نُه روز اجرای مدل رایگان پولساید روی ترافیک واقعی
مهمترین تصمیم محصول ما این است که کدامیک از بیست نتیجه جستوجو واقعاً همان کالایی است که خواستهاید. این تصمیم را به یک مدل رایگان از پولساید سپردیم. در نُه روز ۱۵۱ از ۱۵۱ درخواست را پاسخ داد، ۹۰ از ۹۰ داوریاش درست تحویل شد و سرِ سه خط از پنج خط پردازش ما نشست. در عوض، در یکچهارم پاسخها نام فیلدهای داخلی ما را جلوی چشم کاربر چاپ میکند.
وقتی در اپ ما دنبال یک گوشی میگردید، خزندهای که روی دستگاه خودتان اجرا میشود حدود بیست آگهی از فروشگاههای ایرانی برمیگرداند. بیشترشان اشتباهاند: قاب و کاور، محافظ صفحه، باتری یدکی، و گاهی کسی که آگهی داده گوشی میخرد، نه میفروشد. یک نفر باید به این فهرست نگاه کند و تصمیم بگیرد کدام ردیفها واقعاً همان کالا هستند؛ آن یک نفر، یک مدل زبانی است.
این بیزرقوبرقترین درخواست کل سامانه است و همان چیزی که تعیین میکند اپ به درد میخورد یا نه. نُه روز پیش این کار را به یک مدل رایگان از پولساید سپردیم. آنچه در ادامه میآید، تمام عددهای لاگ ماست.
- ۱۵۱ از ۱۵۱
- درخواست تولیدی پاسخ دادهشده
- ۹۰ از ۹۰
- داوری معتبر در اولین تلاش
- ۲٫۵ ثانیه
- میانه — سریعترین چیزی که سنجیدیم
- ۲۷٪
- پاسخهایی که نام فیلدهای ما را چاپ کرد
چطور انتخابش کردیم
ما مجموعهای از ۴۰ فهرست کاندید نگه میداریم که زنجیره تولیدیمان همهشان را دور ریخته بود — سختترین نمونههای موجود، جایی که مدل به بیست آگهی واقعی نگاه کرده و هیچکدام را نگه نداشته. یک ابزار بازپخش، هر فهرست را با همان پرامپتی که واقعاً منتشر میکنیم اجرا میکند؛ پرامپت را از خروجی بیلد میخوانیم نه از روی کپی، چون سنجیدن مدل با پرامپتی که منتشر نمیکنید یعنی سنجیدن چیزی که منتشر نمیکنید.
- GPT-5.6-lunaپولی — ۰٫۲۰ / ۱٫۲۰ دلار به ازای هر میلیون۳۹
- Qwen3.8-27B (رایگان)میانه ۴۸ ثانیه، کندترین ۱۹۶ ثانیه۳۹
- DeepSeek-v4-flash (رایگان)میانه ۱۹ ثانیه۳۸
- Laguna-s-2.1 — مستقیمرایگان · میانه ۲٫۵ ثانیه · به هر ۴۰ پاسخ داد۳۶
- Laguna-s-2.1 از راه اوپنروترهمان مدل، ۴ درخواست از ۴۰ گم شد۳۵
- Nemotron-3-super (رایگان)فیلتر عالی، نویسنده ضعیف۳۵
- Qwen3.7-plusسریع اما سختگیرتر۲۹
- Laguna-xs-2.1۹۹۸ توکن استدلال در هر درخواست۲۹
- Gemini 3.1 Flash Liteمدلی که جایگزینش شد۱۰
لاگونا صدرنشین این نمودار نیست. برنده شدنش به ترکیب برمیگردد: بازیابی نزدیک به بهترین، کمترین تأخیر میان همه گزینهها، و تنها مدلی که در هر اجرا به تکتک درخواستها پاسخ داد. برای فیلتری که وسط جستوجوی یک آدم منتظر مینشیند، همین معامله را میخواهیم.
نُه روز روی ترافیک واقعی
| مرحله | درخواست | میانه | صدک ۹۰ | کندترین |
|---|---|---|---|---|
| تشخیص اینکه سؤال چه میخواهد | ۱۵ | ۲٫۵ ثانیه | ۴٫۸ ثانیه | ۶٫۶ ثانیه |
| فیلترکردن نتایج جستوجو | ۹۷ | ۴٫۵ ثانیه | ۹٫۲ ثانیه | ۱۳٫۵ ثانیه |
| نوشتن خلاصههای پسزمینه | ۱۸ | ۷٫۹ ثانیه | ۱۲٫۱ ثانیه | ۱۲٫۳ ثانیه |
| نوشتن پاسخی که میخوانید | ۲۱ | ۱۱٫۰ ثانیه | ۱۸٫۷ ثانیه | ۲۴٫۸ ثانیه |
غافلگیرکنندهترین نتیجه برای ما حساب توکنها بود. فیلتر ما یک دستهبندی با قالب خروجی سختگیرانه است و هر توکنی که مدل صرف فکرکردن کند، از همان بودجهای کم میشود که باید پاسخ در آن جا شود. این موضوع قبلاً بدجور ما را سوزانده — یک مدل ۹۵٪ پاسخهایش را به خاطر بودجه کوچک از دست میداد و ماهها متن خالی با وضعیت موفق برمیگرداند تا کسی متوجه شد. در ۱۸۴ درخواست لاگونا، دقیقاً دو درخواست اصلاً استدلال کردند.
دو چیزی که اشتباه میکند
ترجیح میدهیم اینها را منتشر کنیم تا نکنیم. هر دو، مشکل پیروی از دستور در زبانی غیر از انگلیسیاند و هر دو از دید تمام بررسیهای خودکار ما پنهان ماندند — با خواندن خروجی پیدایشان کردیم.
اول: ماشینآلات داخلی ما را جلوی کاربر چاپ میکند. هر ردیفی که به نویسنده میدهیم یک برچسب ماشینی همراه دارد — مثل match=exact یا priceFreshness=old. اینها ورودیاند، نه واژههایی که یک خریدار باید ببیند. لاگونا در ۷ پاسخ از ۲۶ پاسخ، اینها را عیناً داخل جمله فارسی تکرار میکند. مدلی که جایش را گرفت، در ۵۶ پاسخ حتی یک بار این کار را نکرد.
دوم ظریفتر و جالبتر است. ما میخواهیم هر ردیف نگهداشتهشده با یکی از سه برچسب «دقیقاً همان»، «نوع دیگر» یا «مرتبط» مشخص شود. لاگونا تقریباً بدون توجه به شواهد، روی پله وسط مینشیند.
| مدل | داوری | «دقیقاً همان» | «نوع دیگر» | «مرتبط» |
|---|---|---|---|---|
| Laguna-s-2.1 | ۹۰ | ۱۰٪ | ۶۹٪ | ۲۰٪ |
| GPT-5.6-luna | ۱۳۰ | ۵۵٪ | ۲۵٪ | ۲۰٪ |
| Gemini 3.1 Flash Lite | ۶۹ | ۶۰٪ | ۳۰٪ | ۱۰٪ |
این ایراد ظاهری نیست، چون آن برچسب برای مرحله بعد حکم دستور را دارد: وقتی ردیفی فقط «مرتبط» است، به نویسنده گفتهایم صریحاً بگوید این دقیقاً چیزی نیست که کاربر توصیف کرده. پس یک برچسب کماعتمادبهنفس تبدیل میشود به پاسخی که بابت کالاهای کاملاً درست عذرخواهی میکند.
اتصال مستقیم بهتر از واسطه بود
ما به یک مدل واحد از دو راه موازی رسیدیم: مستقیم از API پولساید، و از نسخه رایگانی که اوپنروتر عرضه میکند. وزنهای یکسان، پرامپت یکسان، مجموعه یکسان، در یک نشست. سرویس مستقیم به ۴۰ درخواست از ۴۰ پاسخ داد در برابر ۳۶، با میانه ۲٫۵ ثانیه در برابر ۴٫۴ و صدک ۹۵ برابر ۷٫۳ ثانیه در برابر ۱۳٫۱.
در محیط واقعی این فاصله تیزتر شد. یک درخواست که از راه واسطه رفت، ۱۰۶ ثانیه و کل بودجه خروجیاش را صرف استدلال کرد و بعد بریدهشده اما با وضعیت موفق برگشت — دقیقاً همان شکست خاموشی که برایش نگهبان میگذاریم. سرویس مستقیم در نُه روز چیزی شبیه این تولید نکرد. اگر مدلی را میسنجید که هر دو مسیر را دارد، هر دو را بسنجید: یک محصول واحد نیستند.
توصیهاش میکنیم؟
بله، به شرط اینکه یک مسیر پولی هم پشتش گرم نگه دارید. یک نسخه پیشنمایش رایگان بدون سقف اعلامشده، چیزی نیست که کسبوکار رویش بنا کنید؛ برای همین مدل پولی خودِ پولساید را کف زیرش گذاشتهایم — با ۰٫۰۹ و ۰٫۱۸ دلار به ازای هر میلیون توکن در برابر ۰٫۲۰ و ۱٫۲۰ دلار مدلی که کنار زد، پشتیبان ما حالا حدود یکسوم قبل هزینه دارد. واژگان داخلی را خودتان از متن پاک کنید، به برچسب «مرتبط» به چشم یک سنجه دقیق نگاه نکنید، و به جای تأخیر تکدرخواست، زمان پاسخ سرتاسریتان را اندازه بگیرید. با این شرطها، بیسروصدا و بدون حاشیه عالی بوده و حالا اولین مدلی است که وقتی قیمت چیزی را از ما میپرسید سراغش میرویم.