قیمت شناس
بازگشت به وبلاگ

یک هفته اجرای مدل رایگان هتزنر روی ترافیک واقعی

هفته پیش دو مدل رایگان Qwen هتزنر را روی ۱۱۲ جست‌وجوی ضبط‌شده سنجیدیم. این بار عدد‌ها از آزمایشگاه نیامده‌اند: از لاگ‌های واقعی خودمان می‌آیند. هر ۲۷ پاسخ هفته گذشته JSON معتبر بود، هیچ‌کدام روی ورودی سالم خالی برنگشت، میانه پاسخ ۴ تا ۷ ثانیه بود و حتی یک بار هم محدودیت نرخ نخوردیم — که دقیقاً مشکل ما است.

هفته پیش گزارش سنجش دو مدل رایگان Qwen هتزنر را روی ۱۱۲ جست‌وجوی ضبط‌شده منتشر کردیم. یک بنچمارک به شما می‌گوید مدل در شرایط آزمایشگاهی چه می‌تواند بکند؛ نمی‌گوید که سرویس بالا می‌ماند، بعدازظهر سه‌شنبه جواب می‌دهد، یا از برخورد با کاربری که منتظر قیمت است جان سالم به در می‌برد. پس آن را منتشر کردیم، تک‌تک درخواست‌ها را لاگ کردیم، و این گزارش هفته‌ای است که گذشت.

۲۷ از ۲۷
پاسخ، JSON معتبر
۰ از ۸
جست‌وجوی سالم که خالی برگشت
۴٫۱ ثانیه
میانه هر درخواست، بدون استدلال
۰ دلار
هزینه کل

چه چیزی را اندازه می‌گیریم و نمونه چقدر بزرگ است

هر درخواستی که بک‌اند ما به هر مدل زبانی می‌فرستد، در یک ردیف لاگ با نام مدل، تأخیر، شمار توکن و نتیجه ثبت می‌شود. هیچ عددی در این گزارش بعداً بازسازی نشده و هیچ‌کدام بازپخش آزمایشگاهی نیست — این‌ها همان درخواست‌هایی هستند که به آدم‌های واقعی در حال جست‌وجوی کالای واقعی پاسخ داده‌اند.

اندازه نمونه را هم بزرگ‌تر از آنچه هست جلوه نمی‌دهیم. از ۲۰ اوت که پیکربندی فعلی را نهایی کردیم، یازده درخواست تولیدی به هتزنر رفته و بیست‌وهفت داوری داخل پنجره هفت‌روزه شواهد ما قرار می‌گیرد. این عدد کوچک است و دلیل کوچک بودنش، دقیقاً موضوع بخش پایانی همین نوشته است. آمار پایداری را «تا اینجا هیچ چیز خراب نشده» بخوانید، نه «هیچ چیز نمی‌تواند خراب شود».

یک هفته روی ترافیک واقعی

مدلدرخواستپاسخ دادهمیانهکندترینهزینه
Qwen3.6-35B-A3B-FP8 (MoE)۵۴۴٫۱ ثانیه۱۷٫۹ ثانیهرایگان
Qwen3.8-27B (متراکم)۶۶۶٫۹ ثانیه۹٫۲ ثانیهرایگان
از ۲۰ اوت ۲۰۲۶، با استدلال خاموش روی هر دو مدل. تنها درخواست بی‌پاسخ، نتیجه مهلت خودِ کلاینت ما بود، نه خطایی از سمت هتزنر.

سمت کیفیت مهم‌تر از سمت تأخیر است، چون فیلتری که سریع و غلط جواب بدهد از فیلتر کند بدتر است. در همان بازه: هر ۲۷ پاسخ JSON قابل تجزیه بود، هیچ‌کدام از ۸ استخر نامزد سالم خالی برنگشت، هیچ‌کدام کل استخر را نگه نداشت، و مدل‌ها ۴۴ و ۵۰ درصد نامزدهایی را که دیدند نگه داشتند — یعنی دقیقاً شکل فیلتری که واقعاً دارد فیلتر می‌کند. حتی یک پاسخ هم به سقف توکن خروجی نخورد. ده آزمایش از ده آزمایش، اعتبارسنج خروجی ما را بدون هیچ تخلفی رد کردند.

سنجهQwen3.6 MoEQwen3.8 متراکم
پاسخ‌های JSON معتبر۱۴ از ۱۴۱۳ از ۱۳
جست‌وجوی سالمی که خالی برگشت۰ از ۳۰ از ۵
نگه‌داشتن کل استخر (بدون فیلتر)۰٪۰٪
سهم نامزدهای نگه‌داشته‌شده۴۴٪۵۰٪
پاسخ بریده‌شده در سقف توکن۰٪۰٪
ردشدن به دلیل محدودیت نرخ۰۰
پنجره هفت‌روزه شواهد ما. «نگه‌داشتن کل استخر» و «خالی برگشتن» دو راه شکست این کار هستند؛ هر دو صفرند.

استدلال هنوز تعیین‌کننده همه‌چیز است

بزرگ‌ترین اهرم، نه مدل است نه پرامپت نه سخت‌افزار. این است که بگذارید این مدل‌ها پیش از پاسخ دادن فکر کنند یا نه. این را از بنچمارک می‌دانستیم؛ ترافیک واقعی روی آن قیمت گذاشت.

میانه زمان یک فراخوان فیلتر ارتباطثانیه — کمتر بهتر است
  1. Qwen3.8-27B — استدلال روشن۱۹ اوت · ۸ از ۱۶ درخواست تایم‌اوت شد۸۰٫۵
  2. Qwen3.6-35B-A3B — استدلال روشن۱۹ اوت · کندترین درخواست ۱۵۷ ثانیه۵۶٫۲
  3. Qwen3.8-27B — استدلال خاموشاکنون · ۶ از ۶ پاسخ داده۶٫۹
  4. Qwen3.6-35B-A3B — استدلال خاموشاکنون · کندترین درخواست ۱۷٫۹ ثانیه۴٫۱
همان سرویس، همان مدل‌ها، همان کار، به فاصله یک هفته. دو ستون بالا پیکربندی اشتباه خودِ ما است؛ دو ستون پایین همان چیزی است که باید از روز اول منتشر می‌کردیم.

چه چیزی را اشتباه کردیم، علنی

در ۱۹ اوت هتزنر را با استدلال روشن روی هر دو مدل به ابتدای زنجیره‌مان بردیم، با این فرض که داوری بهتر ارزش انتظار را دارد. چهار ساعت ترافیک واقعی روی این فرض قیمت گذاشت و پاسخ منفی بود. میانه زمان پاسخ به یک پرسش قیمت در کل محصول از ۵۶ ثانیه به ۱۱۵ ثانیه رفت و صدک نودم از ۱۳۶ به ۲۹۲ ثانیه. بیست‌ودو جست‌وجو ۲٬۵۴۲ ثانیه در فیلتر ارتباط نشستند؛ سه جست‌وجویی که در همان بازه به مدل پولی ما رسیدند، روی هم یازده ثانیه گرفتند. دو نفر روی جست‌وجویی دکمه توقف را زدند که قیمت‌هایش از قبل جمع‌آوری شده بود و همان‌جا منتظر فیلتری بود که هنوز داشت فکر می‌کرد.

همان بعدازظهر برگرداندیم. لازم است دقیق بگوییم تقصیر با که بود: با ما. سرویس دقیقاً همان کاری را کرد که از آن خواسته بودیم. ما پیکربندی گران را خواسته بودیم.

مدلی که کنار گذاشته بودیم، بی‌سروصدا شروع به کار کرده

در بنچمارک، مدل متراکم Qwen3.8-27B با استدلال خاموش بدترین ورودی جدول بود. میانه خروجی‌اش شش توکن بود: با یک نتیجه خالی جواب می‌داد و می‌ایستاد. سریع، تمیز و بی‌فایده — نمره ۹ از ۱۰۰ گرفت و از آن گذشتیم.

مسیری که برای آزمودن مدل‌ها استفاده می‌کنیم همیشه استدلال را خاموش می‌فرستد. پس هر درخواستی که این مدل متراکم از ۲۰ اوت به بعد سرو کرده، با همان پیکربندی‌ای بوده که کنارش گذاشته بودیم — و حالا داوری‌های کامل ۱۳۰ تا ۲۷۰ توکنی برمی‌گرداند، هر شش باری که از آن پرسیده‌ایم پاسخ داده، با میانه ۶٫۹ ثانیه، و حتی یکی از پنج جست‌وجوی سالمی را که دید خالی برنگرداند.

از بیرون نمی‌توانیم کاملاً جدا کنیم که چقدر از این بهبود از سمت هتزنر است و چقدر از سمت ما، و ادعای خلاف آن روی شش درخواست صادقانه نیست. اما سمت ما بین این دو اندازه‌گیری تغییری نکرده و رفتار تغییر کرده است. چیزی در سمت سرویس‌دهی بهتر از هفته پیش کار می‌کند. اگر این مدل را با استدلال خاموش امتحان کرده‌اید و رها کرده‌اید، ارزش یک نگاه دوباره را دارد.

چیزی که هنوز جلوی ما را گرفته، مدل نیست

کلید ما اجازه ده درخواست در هر شصت ثانیه را می‌دهد، مشترک میان کل بک‌اند. در تمام عمر این یکپارچه‌سازی حتی یک بار هم محدودیت نرخ نخورده‌ایم — حتی یک ردشدن در میان تمام درخواست‌هایی که فرستاده‌ایم.

این تعریف از آن سقف نیست. توصیف این است که چقدر کم جرئت می‌کنیم از آن ترافیک عبور دهیم. یک پرسش کاربر چند فراخوان برای ما هزینه دارد و یک اجرای انبوه روی فهرست خرید ۱۵۰ قلمی حدود ۱۹۰ فراخوان است، که با ده تا در دقیقه یعنی نوزده دقیقه صف پیش از آنکه اصلاً تولیدی شروع شود. برای همین این سرویس دوم زنجیره ما می‌ایستد، پشت یک مدل پولی، و فقط وقتی سرو می‌کند که آن یکی در حال خنک شدن باشد. به همین دلیل این گزارش از یازده درخواست حرف می‌زند و نه یازده هزار.

این سقف است که تعیین می‌کند چه سهمی از بار کاری ما می‌تواند اینجا زندگی کند، نه کیفیت. بک‌اند ما همین حالا روی یک سرور ابری هتزنر در فنلاند اجرا می‌شود، پس بالا بردن آن سقف صرفاً ترافیک را از یک API پولی به شبکه خودِ هتزنر منتقل می‌کند. این معامله را همین امروز قبول می‌کنیم.

توصیه‌اش می‌کنیم؟

بله، به شرط آنکه پیکربندی را یادداشت کنید. استدلال را خاموش کنید، مهلت کوتاه برای هر فراخوان بگذارید، یک مدل پولی پشتش قرار دهید برای هرچه از دستش در می‌رود، و بدون اندازه‌گیری تأخیر سرتاسری — نه تأخیر تک‌فراخوان — آن را به جایگاه اول نبرید؛ همان بعدازظهری که زمان پاسخ خودمان دو برابر شد، تک‌تک عددهای هر فراخوان سالم به نظر می‌رسیدند. با این شرط‌ها یک هفته بی‌سروصدا و بی‌حادثه کار کرده و هیچ هزینه‌ای نداشته است. این ترکیب کمیاب‌تر از آن است که به نظر می‌رسد، و حالا بخشی از روشی است که با آن قیمت‌ها را مقایسه می‌کنیم.