قیمت شناس
بازگشت به وبلاگ

۱۵ مدل زبانی، دو تکلیف واقعی: کدام‌شان می‌ارزند؟

هر جست‌وجوی قیمت در محصول ما دو فراخوانی مدل زبانی دارد. برای هر دو، ۱۵ مدل را روی ۱۵۲ جست‌وجوی واقعی ثبت‌شده سنجیدیم و نرخ موفقیت، امتیاز کلی و هزینه واقعی هرکدام را اندازه گرفتیم. گران‌ترین گزینه فهرست، ضعیف‌ترین نتیجه را داد.

هر جست‌وجوی قیمت در «قیمت شناس» دو بار به یک مدل زبانی نیاز دارد، و این دو تکلیف کاملاً متفاوت‌اند. اول «حلقه پاسخ»: مدل باید تصمیم بگیرد چه چیزی را در فروشگاه‌ها بگردد و بعد جواب را فارسی بنویسد. دوم «فیلتر ارتباط»: از میان ۲۰ تا ۲۴ آگهی خامی که خزنده برمی‌گرداند، فقط همان کالای واقعی را نگه دارد. برای هر دو، ۱۵ مدل را روی داده واقعی خودمان سنجیدیم.

۱۵
مدل، روی یک پرامپت یکسان
۱۵۲
جست‌وجوی واقعی ثبت‌شده
۲
تکلیف متفاوت در هر جست‌وجو
۳۰ برابر
اختلاف هزینه بین اول و آخر

تکلیف اول: فیلتر ارتباط

این فراخوانی در هر جست‌وجو اجرا می‌شود و بیشترین حجم را دارد. سنجه اصلی ساده است: از میان جست‌وجوهایی که در عمل به کاربر «نتیجه‌ای پیدا نشد» نشان داده بودند، مدل چند درصد را نجات می‌دهد؟ سنجه دوم مهم است چون خلافش هم بد است: چند بار کل فهرست را نگه داشت، یعنی عملاً فیلتری در کار نبود؟

نمودار میله‌ای امتیاز و هزینه هر ۱۵ مدل روی تکلیف فیلتر ارتباط
امتیاز از ۱۰۰ روی ۱۵۲ جست‌وجوی واقعی. ستون سمت چپ، هزینه هر یک میلیون فراخوانی است.
مدلامتیازنرخ موفقیتکل فهرست را نگه داشتزمانهزینه هر ۱ میلیون فراخوانی
gpt-5.6-luna۹۷۹۶٪۵٪۵۶۸ms۶۰۷ دلار
ling-3.0-flash۹۵۱۰۰٪۱۰٪۹۰۸ms۳۱۵ دلار
gpt-5.4-nano۹۳۸۰٪۰٪۵۹۴ms۵۴۸ دلار
gemma-4-31b-it۸۶۷۱٪۱۵٪۶۰۴ms۳۳۴ دلار
gemma-4-31b-it:free۸۱۶۹٪۱۷٪۱۳۷۱ms۰ دلار
gemini-3.1-flash-lite۸۰۶۰٪۰٪۱۸۰۴ms۰ دلار
deepseek-v4-flash-0731۷۸۹۰٪۰٪۱۲۸۸ms۱٬۰۱۵ دلار
gemini-3.5-flash-lite۷۱۳۰٪۰٪۱۳۴۵ms۰ دلار
gemini-3.5-flash-lite (اوپن‌روتر)۷۱۲۶٪۸٪۷۳۶ms۸۷۹ دلار
deepseek-v4-flash۷۰۴۸٪۲۱٪۱۳۹۹ms۵۱۴ دلار
qwen3.7-flash۲۳۹۷۸ms۵۹۷ دلار
hy3-preview۰۲۷۵۲ms۱٬۲۶۰ دلار
mimo-v2.5۰۱۳۴۴ms۲٬۰۹۹ دلار
nemotron-3.5-lightning۰۵۱۴ms۰ دلار
gemma-4-31b-it (مستقیم گوگل)۰۳۶٬۳۰۸ms۰ دلار
امتیاز = ۳۰٪ خروجی سالم + ۳۵٪ نرخ موفقیت + ۲۰٪ سخت‌گیری + ۱۵٪ سرعت. هزینه عمداً در امتیاز نیست تا معامله بین کیفیت و پول دیده شود. «کل فهرست را نگه داشت» پایین‌تر بهتر است. پنج ردیف آخر اصلاً خروجی معتبر JSON ندادند، پس نرخ موفقیت برایشان معنا ندارد.

دو چیز در این جدول ما را غافلگیر کرد. اول اینکه ارزان‌ترین گزینه پولی (ling) بالاترین نرخ موفقیت را دارد — تنها مدلی که هر ۱۰۹ جست‌وجوی خالی را نجات داد. دوم اینکه گران‌ترین گزینه‌ای که اصلاً کار می‌کند (جمنای فلش‌لایت از مسیر اوپن‌روتر، ۸۷۹ دلار) پایین‌ترین نرخ موفقیت را دارد: ۲۶٪. یعنی نزدیک به سه برابر پول برای یک‌چهارم نتیجه.

پنج مدل آخر جدول اصلاً نتوانستند خروجی JSON درست بدهند. سه‌تایشان به‌جای جواب‌دادن، تا هر سقفی که به آن‌ها بدهید «فکر» می‌کنند و هرگز به نوشتن جواب نمی‌رسند — و جالب اینکه دو مورد از گران‌ترین ردیف‌های هزینه هم همین‌ها هستند: بابت شکست خوردن پول می‌گیرند.

تکلیف دوم: حلقه پاسخ

اینجا مدل باید ابزار جست‌وجو را درست صدا بزند و بعد جواب فارسی بنویسد. دو چیز را می‌سنجیم که در هیچ بنچمارک عمومی‌ای دیده نمی‌شود: آیا عددی که در متن می‌نویسد واقعاً در فهرست قیمت‌هایی بوده که دیده است، و آیا برای یک سؤال فقط یک بار جست‌وجو راه می‌اندازد.

نمودار میله‌ای امتیاز و هزینه مدل‌ها روی تکلیف حلقه پاسخ
امتیاز = ۴۵٪ امانت‌داری در عدد + ۳۰٪ تصمیم درست ابزار + ۱۵٪ تک‌فراخوانی + ۱۰٪ سرعت.
مدلامتیازامانت‌داری در عددتصمیم ابزارفراخوانی در هر سؤالزمانهزینه هر ۱ میلیون جست‌وجو
gemini-3.5-flash-lite۱۰۰۲ از ۲۳ از ۳۱۱٫۴ ثانیه۰ دلار
gemma-4-31b-it۹۰۵ از ۵۲ از ۳۱۱٫۸ ثانیه۸۸۴ دلار
gpt-5.6-luna۸۵۵ از ۶۳ از ۳۱۹ ثانیه۱٬۰۲۸ دلار
deepseek-v4-flash۸۰۹ از ۹۳ از ۳۳۲۱ ثانیه۱٬۸۶۶ دلار
ling-3.0-flash۷۰۹ از ۹۲ از ۳۵۹ ثانیه۲۹۴ دلار
gpt-5.4-nano۶۵۴ از ۹۳ از ۳۱۱۴ ثانیه۲٬۲۷۳ دلار
gemini-3.1-flash-liteسنجیده نشد۳ از ۳۱۱٫۷ ثانیه۰ دلار
«امانت‌داری» یعنی از میان عددهایی که مدل در متن فارسی نوشته، چندتایشان واقعاً در فهرست قیمت‌های همان جست‌وجو بودند. «تصمیم ابزار» روی سه پرسش سنجیده شد: یک کالا، یک خودرو و یک پرسش عربی. شواهد این جدول از جدول قبلی ضعیف‌تر است — سه آزمون ابزار و یک نمونه متن به ازای هر مدل.

دو مدل را همین‌جا کنار گذاشتیم، و دلیلش در هیچ بنچمارک عمومی‌ای پیدا نمی‌شود. ling برای یک سؤال پنج بار جست‌وجو راه انداخت و برای «پراید ۱۴۰۰» از خودش «پژو ۲۰۷» درآورد — و هر جست‌وجو یعنی یک خزش زنده روی کامپیوتر خود کاربر. gpt-5.4-nano هم در قالب خروجی نمره کامل گرفت و بعد نوشت ارزان‌ترین قیمت «۷۴٬۵۰۰٬۰۰۰ تومان» است، در حالی که قیمت واقعی همان فروشگاه در همان فهرست ۷۵٬۴۵۰٬۰۰۰ بود. برای یک سایت مقایسه قیمت، این بدترین نوع خطاست: همه‌چیز درست به نظر می‌رسد و فقط عدد غلط است.

قیمت هر توکن، هزینه واقعی را پیش‌بینی نمی‌کند

نمودار ستونی هزینه هر یک میلیون فراخوانی برای پنج مدل
هزینه واقعی یک میلیون فراخوانی فیلتر، اندازه‌گیری‌شده روی توکن‌های واقعی.

این مهم‌ترین درس عملی این سنجش بود. مدلی که تعرفه هر توکنش یک‌دهم بقیه است می‌تواند در عمل چند برابر خرج بردارد، چون پیش از هر جواب صدها یا هزاران توکن «فکر» می‌کند و همان هم محاسبه می‌شود. تنها راه فهمیدن هزینه واقعی، فرستادن پرامپت واقعی خودتان و خواندن صورت‌حساب است.

انتخاب ما

  • برای فیلتر ارتباط: ling-3.0-flash — تنها مدل با نرخ موفقیت ۱۰۰٪، و نصف قیمت گزینه بعدی.
  • برای حلقه پاسخ: جمنای فلش‌لایت — یک فراخوانی، سریع‌ترین، و اعدادش دقیق بود. مدل‌هایی که برای یک سؤال چند بار جست‌وجو راه می‌اندازند اینجا جایی ندارند.
  • کنار گذاشته شد: gpt-5.4-nano به‌خاطر عدد غلط، و پنج مدلی که اصلاً خروجی معتبر ندادند.

محدودیت‌های این سنجش

  • این بنچمارک دو تکلیف مشخص را می‌سنجد، نه توانایی عمومی مدل‌ها.
  • همه با یک پرامپت یکسان و در دمای صفر سنجیده شدند؛ هر مدلی با پرامپت مخصوص خودش احتمالاً بهتر عمل می‌کند.
  • جدول فیلتر روی ۱۵۲ جست‌وجو است؛ جدول حلقه پاسخ روی سه آزمون ابزار و یک نمونه متن — یعنی به‌مراتب ضعیف‌تر.
  • هر جست‌وجو یک بار اجرا شد، و در آزمون‌های قبلی دیده‌ایم که یک مدل روی یک ورودی یکسان همیشه یک جواب نمی‌دهد.

این ادامه بنچمارک قبلی ما روی ۱۱۲ جست‌وجوی فارسی است، و گزارش اشکال سقف توکن توضیح می‌دهد چرا نصف این مدل‌ها اول کار خراب به نظر می‌رسیدند. نتیجه‌اش را در قیمت‌های زنده می‌بینید.