۱۵ مدل زبانی، دو تکلیف واقعی: کدامشان میارزند؟
هر جستوجوی قیمت در محصول ما دو فراخوانی مدل زبانی دارد. برای هر دو، ۱۵ مدل را روی ۱۵۲ جستوجوی واقعی ثبتشده سنجیدیم و نرخ موفقیت، امتیاز کلی و هزینه واقعی هرکدام را اندازه گرفتیم. گرانترین گزینه فهرست، ضعیفترین نتیجه را داد.
هر جستوجوی قیمت در «قیمت شناس» دو بار به یک مدل زبانی نیاز دارد، و این دو تکلیف کاملاً متفاوتاند. اول «حلقه پاسخ»: مدل باید تصمیم بگیرد چه چیزی را در فروشگاهها بگردد و بعد جواب را فارسی بنویسد. دوم «فیلتر ارتباط»: از میان ۲۰ تا ۲۴ آگهی خامی که خزنده برمیگرداند، فقط همان کالای واقعی را نگه دارد. برای هر دو، ۱۵ مدل را روی داده واقعی خودمان سنجیدیم.
- ۱۵
- مدل، روی یک پرامپت یکسان
- ۱۵۲
- جستوجوی واقعی ثبتشده
- ۲
- تکلیف متفاوت در هر جستوجو
- ۳۰ برابر
- اختلاف هزینه بین اول و آخر
تکلیف اول: فیلتر ارتباط
این فراخوانی در هر جستوجو اجرا میشود و بیشترین حجم را دارد. سنجه اصلی ساده است: از میان جستوجوهایی که در عمل به کاربر «نتیجهای پیدا نشد» نشان داده بودند، مدل چند درصد را نجات میدهد؟ سنجه دوم مهم است چون خلافش هم بد است: چند بار کل فهرست را نگه داشت، یعنی عملاً فیلتری در کار نبود؟

| مدل | امتیاز | نرخ موفقیت | کل فهرست را نگه داشت | زمان | هزینه هر ۱ میلیون فراخوانی |
|---|---|---|---|---|---|
| gpt-5.6-luna | ۹۷ | ۹۶٪ | ۵٪ | ۵۶۸ms | ۶۰۷ دلار |
| ling-3.0-flash | ۹۵ | ۱۰۰٪ | ۱۰٪ | ۹۰۸ms | ۳۱۵ دلار |
| gpt-5.4-nano | ۹۳ | ۸۰٪ | ۰٪ | ۵۹۴ms | ۵۴۸ دلار |
| gemma-4-31b-it | ۸۶ | ۷۱٪ | ۱۵٪ | ۶۰۴ms | ۳۳۴ دلار |
| gemma-4-31b-it:free | ۸۱ | ۶۹٪ | ۱۷٪ | ۱۳۷۱ms | ۰ دلار |
| gemini-3.1-flash-lite | ۸۰ | ۶۰٪ | ۰٪ | ۱۸۰۴ms | ۰ دلار |
| deepseek-v4-flash-0731 | ۷۸ | ۹۰٪ | ۰٪ | ۱۲۸۸ms | ۱٬۰۱۵ دلار |
| gemini-3.5-flash-lite | ۷۱ | ۳۰٪ | ۰٪ | ۱۳۴۵ms | ۰ دلار |
| gemini-3.5-flash-lite (اوپنروتر) | ۷۱ | ۲۶٪ | ۸٪ | ۷۳۶ms | ۸۷۹ دلار |
| deepseek-v4-flash | ۷۰ | ۴۸٪ | ۲۱٪ | ۱۳۹۹ms | ۵۱۴ دلار |
| qwen3.7-flash | ۲۳ | — | — | ۹۷۸ms | ۵۹۷ دلار |
| hy3-preview | ۰ | — | — | ۲۷۵۲ms | ۱٬۲۶۰ دلار |
| mimo-v2.5 | ۰ | — | — | ۱۳۴۴ms | ۲٬۰۹۹ دلار |
| nemotron-3.5-lightning | ۰ | — | — | ۵۱۴ms | ۰ دلار |
| gemma-4-31b-it (مستقیم گوگل) | ۰ | — | — | ۳۶٬۳۰۸ms | ۰ دلار |
دو چیز در این جدول ما را غافلگیر کرد. اول اینکه ارزانترین گزینه پولی (ling) بالاترین نرخ موفقیت را دارد — تنها مدلی که هر ۱۰۹ جستوجوی خالی را نجات داد. دوم اینکه گرانترین گزینهای که اصلاً کار میکند (جمنای فلشلایت از مسیر اوپنروتر، ۸۷۹ دلار) پایینترین نرخ موفقیت را دارد: ۲۶٪. یعنی نزدیک به سه برابر پول برای یکچهارم نتیجه.
پنج مدل آخر جدول اصلاً نتوانستند خروجی JSON درست بدهند. سهتایشان بهجای جوابدادن، تا هر سقفی که به آنها بدهید «فکر» میکنند و هرگز به نوشتن جواب نمیرسند — و جالب اینکه دو مورد از گرانترین ردیفهای هزینه هم همینها هستند: بابت شکست خوردن پول میگیرند.
تکلیف دوم: حلقه پاسخ
اینجا مدل باید ابزار جستوجو را درست صدا بزند و بعد جواب فارسی بنویسد. دو چیز را میسنجیم که در هیچ بنچمارک عمومیای دیده نمیشود: آیا عددی که در متن مینویسد واقعاً در فهرست قیمتهایی بوده که دیده است، و آیا برای یک سؤال فقط یک بار جستوجو راه میاندازد.

| مدل | امتیاز | امانتداری در عدد | تصمیم ابزار | فراخوانی در هر سؤال | زمان | هزینه هر ۱ میلیون جستوجو |
|---|---|---|---|---|---|---|
| gemini-3.5-flash-lite | ۱۰۰ | ۲ از ۲ | ۳ از ۳ | ۱ | ۱٫۴ ثانیه | ۰ دلار |
| gemma-4-31b-it | ۹۰ | ۵ از ۵ | ۲ از ۳ | ۱ | ۱٫۸ ثانیه | ۸۸۴ دلار |
| gpt-5.6-luna | ۸۵ | ۵ از ۶ | ۳ از ۳ | ۱ | ۹ ثانیه | ۱٬۰۲۸ دلار |
| deepseek-v4-flash | ۸۰ | ۹ از ۹ | ۳ از ۳ | ۳ | ۲۱ ثانیه | ۱٬۸۶۶ دلار |
| ling-3.0-flash | ۷۰ | ۹ از ۹ | ۲ از ۳ | ۵ | ۹ ثانیه | ۲۹۴ دلار |
| gpt-5.4-nano | ۶۵ | ۴ از ۹ | ۳ از ۳ | ۱ | ۱۴ ثانیه | ۲٬۲۷۳ دلار |
| gemini-3.1-flash-lite | — | سنجیده نشد | ۳ از ۳ | ۱ | ۱٫۷ ثانیه | ۰ دلار |
دو مدل را همینجا کنار گذاشتیم، و دلیلش در هیچ بنچمارک عمومیای پیدا نمیشود. ling برای یک سؤال پنج بار جستوجو راه انداخت و برای «پراید ۱۴۰۰» از خودش «پژو ۲۰۷» درآورد — و هر جستوجو یعنی یک خزش زنده روی کامپیوتر خود کاربر. gpt-5.4-nano هم در قالب خروجی نمره کامل گرفت و بعد نوشت ارزانترین قیمت «۷۴٬۵۰۰٬۰۰۰ تومان» است، در حالی که قیمت واقعی همان فروشگاه در همان فهرست ۷۵٬۴۵۰٬۰۰۰ بود. برای یک سایت مقایسه قیمت، این بدترین نوع خطاست: همهچیز درست به نظر میرسد و فقط عدد غلط است.
قیمت هر توکن، هزینه واقعی را پیشبینی نمیکند

این مهمترین درس عملی این سنجش بود. مدلی که تعرفه هر توکنش یکدهم بقیه است میتواند در عمل چند برابر خرج بردارد، چون پیش از هر جواب صدها یا هزاران توکن «فکر» میکند و همان هم محاسبه میشود. تنها راه فهمیدن هزینه واقعی، فرستادن پرامپت واقعی خودتان و خواندن صورتحساب است.
انتخاب ما
- برای فیلتر ارتباط: ling-3.0-flash — تنها مدل با نرخ موفقیت ۱۰۰٪، و نصف قیمت گزینه بعدی.
- برای حلقه پاسخ: جمنای فلشلایت — یک فراخوانی، سریعترین، و اعدادش دقیق بود. مدلهایی که برای یک سؤال چند بار جستوجو راه میاندازند اینجا جایی ندارند.
- کنار گذاشته شد: gpt-5.4-nano بهخاطر عدد غلط، و پنج مدلی که اصلاً خروجی معتبر ندادند.
محدودیتهای این سنجش
- این بنچمارک دو تکلیف مشخص را میسنجد، نه توانایی عمومی مدلها.
- همه با یک پرامپت یکسان و در دمای صفر سنجیده شدند؛ هر مدلی با پرامپت مخصوص خودش احتمالاً بهتر عمل میکند.
- جدول فیلتر روی ۱۵۲ جستوجو است؛ جدول حلقه پاسخ روی سه آزمون ابزار و یک نمونه متن — یعنی بهمراتب ضعیفتر.
- هر جستوجو یک بار اجرا شد، و در آزمونهای قبلی دیدهایم که یک مدل روی یک ورودی یکسان همیشه یک جواب نمیدهد.
این ادامه بنچمارک قبلی ما روی ۱۱۲ جستوجوی فارسی است، و گزارش اشکال سقف توکن توضیح میدهد چرا نصف این مدلها اول کار خراب به نظر میرسیدند. نتیجهاش را در قیمتهای زنده میبینید.