قیمت شناس
بازگشت به وبلاگ

نُه روز اجرای مدل رایگان پول‌ساید روی ترافیک واقعی

مهم‌ترین تصمیم محصول ما این است که کدام‌یک از بیست نتیجه جست‌وجو واقعاً همان کالایی است که خواسته‌اید. این تصمیم را به یک مدل رایگان از پول‌ساید سپردیم. در نُه روز ۱۵۱ از ۱۵۱ درخواست را پاسخ داد، ۹۰ از ۹۰ داوری‌اش درست تحویل شد و سرِ سه خط از پنج خط پردازش ما نشست. در عوض، در یک‌چهارم پاسخ‌ها نام فیلدهای داخلی ما را جلوی چشم کاربر چاپ می‌کند.

وقتی در اپ ما دنبال یک گوشی می‌گردید، خزنده‌ای که روی دستگاه خودتان اجرا می‌شود حدود بیست آگهی از فروشگاه‌های ایرانی برمی‌گرداند. بیشترشان اشتباه‌اند: قاب و کاور، محافظ صفحه، باتری یدکی، و گاهی کسی که آگهی داده گوشی می‌خرد، نه می‌فروشد. یک نفر باید به این فهرست نگاه کند و تصمیم بگیرد کدام ردیف‌ها واقعاً همان کالا هستند؛ آن یک نفر، یک مدل زبانی است.

این بی‌زرق‌وبرق‌ترین درخواست کل سامانه است و همان چیزی که تعیین می‌کند اپ به درد می‌خورد یا نه. نُه روز پیش این کار را به یک مدل رایگان از پول‌ساید سپردیم. آنچه در ادامه می‌آید، تمام عددهای لاگ ماست.

۱۵۱ از ۱۵۱
درخواست تولیدی پاسخ داده‌شده
۹۰ از ۹۰
داوری معتبر در اولین تلاش
۲٫۵ ثانیه
میانه — سریع‌ترین چیزی که سنجیدیم
۲۷٪
پاسخ‌هایی که نام فیلدهای ما را چاپ کرد

چطور انتخابش کردیم

ما مجموعه‌ای از ۴۰ فهرست کاندید نگه می‌داریم که زنجیره تولیدی‌مان همه‌شان را دور ریخته بود — سخت‌ترین نمونه‌های موجود، جایی که مدل به بیست آگهی واقعی نگاه کرده و هیچ‌کدام را نگه نداشته. یک ابزار بازپخش، هر فهرست را با همان پرامپتی که واقعاً منتشر می‌کنیم اجرا می‌کند؛ پرامپت را از خروجی بیلد می‌خوانیم نه از روی کپی، چون سنجیدن مدل با پرامپتی که منتشر نمی‌کنید یعنی سنجیدن چیزی که منتشر نمی‌کنید.

فهرست‌های بازیابی‌شده، از ۴۰ فهرستی که زنجیره ما دور ریخته بودبیشتر بهتر است
  1. GPT-5.6-lunaپولی — ۰٫۲۰ / ۱٫۲۰ دلار به ازای هر میلیون۳۹
  2. Qwen3.8-27B (رایگان)میانه ۴۸ ثانیه، کندترین ۱۹۶ ثانیه۳۹
  3. DeepSeek-v4-flash (رایگان)میانه ۱۹ ثانیه۳۸
  4. Laguna-s-2.1 — مستقیمرایگان · میانه ۲٫۵ ثانیه · به هر ۴۰ پاسخ داد۳۶
  5. Laguna-s-2.1 از راه اوپن‌روترهمان مدل، ۴ درخواست از ۴۰ گم شد۳۵
  6. Nemotron-3-super (رایگان)فیلتر عالی، نویسنده ضعیف۳۵
  7. Qwen3.7-plusسریع اما سخت‌گیرتر۲۹
  8. Laguna-xs-2.1۹۹۸ توکن استدلال در هر درخواست۲۹
  9. Gemini 3.1 Flash Liteمدلی که جایگزینش شد۱۰
این‌ها را «تعداد» بخوانید نه «درصد». دو مورد از فهرست بالا ۴ درخواست از ۴۰ را به دلیل خطای انتقال از دست دادند و بعد ۹۷٪ از همان ۳۶ تایی که پاسخ دادند را به نام خود ثبت کردند — نرخی که مخرجش با شکست فراهم‌کننده کوچک می‌شود، پاداشِ پاسخ‌ندادن است.

لاگونا صدرنشین این نمودار نیست. برنده شدنش به ترکیب برمی‌گردد: بازیابی نزدیک به بهترین، کمترین تأخیر میان همه گزینه‌ها، و تنها مدلی که در هر اجرا به تک‌تک درخواست‌ها پاسخ داد. برای فیلتری که وسط جست‌وجوی یک آدم منتظر می‌نشیند، همین معامله را می‌خواهیم.

نُه روز روی ترافیک واقعی

مرحلهدرخواستمیانهصدک ۹۰کندترین
تشخیص این‌که سؤال چه می‌خواهد۱۵۲٫۵ ثانیه۴٫۸ ثانیه۶٫۶ ثانیه
فیلترکردن نتایج جست‌وجو۹۷۴٫۵ ثانیه۹٫۲ ثانیه۱۳٫۵ ثانیه
نوشتن خلاصه‌های پس‌زمینه۱۸۷٫۹ ثانیه۱۲٫۱ ثانیه۱۲٫۳ ثانیه
نوشتن پاسخی که می‌خوانید۲۱۱۱٫۰ ثانیه۱۸٫۷ ثانیه۲۴٫۸ ثانیه
تمام درخواست‌ها به سرویس خودِ پول‌ساید، بین ۲۱ تا ۳۰ اوت ۲۰۲۶. در هیچ مرحله‌ای خطا، وقفه یا پاسخ خالی نداشتیم.

غافلگیرکننده‌ترین نتیجه برای ما حساب توکن‌ها بود. فیلتر ما یک دسته‌بندی با قالب خروجی سخت‌گیرانه است و هر توکنی که مدل صرف فکرکردن کند، از همان بودجه‌ای کم می‌شود که باید پاسخ در آن جا شود. این موضوع قبلاً بدجور ما را سوزانده — یک مدل ۹۵٪ پاسخ‌هایش را به خاطر بودجه کوچک از دست می‌داد و ماه‌ها متن خالی با وضعیت موفق برمی‌گرداند تا کسی متوجه شد. در ۱۸۴ درخواست لاگونا، دقیقاً دو درخواست اصلاً استدلال کردند.

دو چیزی که اشتباه می‌کند

ترجیح می‌دهیم این‌ها را منتشر کنیم تا نکنیم. هر دو، مشکل پیروی از دستور در زبانی غیر از انگلیسی‌اند و هر دو از دید تمام بررسی‌های خودکار ما پنهان ماندند — با خواندن خروجی پیدایشان کردیم.

اول: ماشین‌آلات داخلی ما را جلوی کاربر چاپ می‌کند. هر ردیفی که به نویسنده می‌دهیم یک برچسب ماشینی همراه دارد — مثل match=exact یا priceFreshness=old. این‌ها ورودی‌اند، نه واژه‌هایی که یک خریدار باید ببیند. لاگونا در ۷ پاسخ از ۲۶ پاسخ، این‌ها را عیناً داخل جمله فارسی تکرار می‌کند. مدلی که جایش را گرفت، در ۵۶ پاسخ حتی یک بار این کار را نکرد.

دوم ظریف‌تر و جالب‌تر است. ما می‌خواهیم هر ردیف نگه‌داشته‌شده با یکی از سه برچسب «دقیقاً همان»، «نوع دیگر» یا «مرتبط» مشخص شود. لاگونا تقریباً بدون توجه به شواهد، روی پله وسط می‌نشیند.

مدلداوری«دقیقاً همان»«نوع دیگر»«مرتبط»
Laguna-s-2.1۹۰۱۰٪۶۹٪۲۰٪
GPT-5.6-luna۱۳۰۵۵٪۲۵٪۲۰٪
Gemini 3.1 Flash Lite۶۹۶۰٪۳۰٪۱۰٪
کاربری دنبال «کیس کامپیوتر» گشت. هر ۲۴ نتیجه واقعاً کیس کامپیوتر بودند. سه مدل دیگر همه را «دقیقاً همان» دانستند؛ لاگونا ۲۲ تا از ۲۴ را «مرتبط» خواند.

این ایراد ظاهری نیست، چون آن برچسب برای مرحله بعد حکم دستور را دارد: وقتی ردیفی فقط «مرتبط» است، به نویسنده گفته‌ایم صریحاً بگوید این دقیقاً چیزی نیست که کاربر توصیف کرده. پس یک برچسب کم‌اعتمادبه‌نفس تبدیل می‌شود به پاسخی که بابت کالاهای کاملاً درست عذرخواهی می‌کند.

اتصال مستقیم بهتر از واسطه بود

ما به یک مدل واحد از دو راه موازی رسیدیم: مستقیم از API پول‌ساید، و از نسخه رایگانی که اوپن‌روتر عرضه می‌کند. وزن‌های یکسان، پرامپت یکسان، مجموعه یکسان، در یک نشست. سرویس مستقیم به ۴۰ درخواست از ۴۰ پاسخ داد در برابر ۳۶، با میانه ۲٫۵ ثانیه در برابر ۴٫۴ و صدک ۹۵ برابر ۷٫۳ ثانیه در برابر ۱۳٫۱.

در محیط واقعی این فاصله تیزتر شد. یک درخواست که از راه واسطه رفت، ۱۰۶ ثانیه و کل بودجه خروجی‌اش را صرف استدلال کرد و بعد بریده‌شده اما با وضعیت موفق برگشت — دقیقاً همان شکست خاموشی که برایش نگهبان می‌گذاریم. سرویس مستقیم در نُه روز چیزی شبیه این تولید نکرد. اگر مدلی را می‌سنجید که هر دو مسیر را دارد، هر دو را بسنجید: یک محصول واحد نیستند.

توصیه‌اش می‌کنیم؟

بله، به شرط این‌که یک مسیر پولی هم پشتش گرم نگه دارید. یک نسخه پیش‌نمایش رایگان بدون سقف اعلام‌شده، چیزی نیست که کسب‌وکار رویش بنا کنید؛ برای همین مدل پولی خودِ پول‌ساید را کف زیرش گذاشته‌ایم — با ۰٫۰۹ و ۰٫۱۸ دلار به ازای هر میلیون توکن در برابر ۰٫۲۰ و ۱٫۲۰ دلار مدلی که کنار زد، پشتیبان ما حالا حدود یک‌سوم قبل هزینه دارد. واژگان داخلی را خودتان از متن پاک کنید، به برچسب «مرتبط» به چشم یک سنجه دقیق نگاه نکنید، و به جای تأخیر تک‌درخواست، زمان پاسخ سرتاسری‌تان را اندازه بگیرید. با این شرط‌ها، بی‌سروصدا و بدون حاشیه عالی بوده و حالا اولین مدلی است که وقتی قیمت چیزی را از ما می‌پرسید سراغش می‌رویم.