یک هفته اجرای مدل رایگان هتزنر روی ترافیک واقعی
هفته پیش دو مدل رایگان Qwen هتزنر را روی ۱۱۲ جستوجوی ضبطشده سنجیدیم. این بار عددها از آزمایشگاه نیامدهاند: از لاگهای واقعی خودمان میآیند. هر ۲۷ پاسخ هفته گذشته JSON معتبر بود، هیچکدام روی ورودی سالم خالی برنگشت، میانه پاسخ ۴ تا ۷ ثانیه بود و حتی یک بار هم محدودیت نرخ نخوردیم — که دقیقاً مشکل ما است.
هفته پیش گزارش سنجش دو مدل رایگان Qwen هتزنر را روی ۱۱۲ جستوجوی ضبطشده منتشر کردیم. یک بنچمارک به شما میگوید مدل در شرایط آزمایشگاهی چه میتواند بکند؛ نمیگوید که سرویس بالا میماند، بعدازظهر سهشنبه جواب میدهد، یا از برخورد با کاربری که منتظر قیمت است جان سالم به در میبرد. پس آن را منتشر کردیم، تکتک درخواستها را لاگ کردیم، و این گزارش هفتهای است که گذشت.
- ۲۷ از ۲۷
- پاسخ، JSON معتبر
- ۰ از ۸
- جستوجوی سالم که خالی برگشت
- ۴٫۱ ثانیه
- میانه هر درخواست، بدون استدلال
- ۰ دلار
- هزینه کل
چه چیزی را اندازه میگیریم و نمونه چقدر بزرگ است
هر درخواستی که بکاند ما به هر مدل زبانی میفرستد، در یک ردیف لاگ با نام مدل، تأخیر، شمار توکن و نتیجه ثبت میشود. هیچ عددی در این گزارش بعداً بازسازی نشده و هیچکدام بازپخش آزمایشگاهی نیست — اینها همان درخواستهایی هستند که به آدمهای واقعی در حال جستوجوی کالای واقعی پاسخ دادهاند.
اندازه نمونه را هم بزرگتر از آنچه هست جلوه نمیدهیم. از ۲۰ اوت که پیکربندی فعلی را نهایی کردیم، یازده درخواست تولیدی به هتزنر رفته و بیستوهفت داوری داخل پنجره هفتروزه شواهد ما قرار میگیرد. این عدد کوچک است و دلیل کوچک بودنش، دقیقاً موضوع بخش پایانی همین نوشته است. آمار پایداری را «تا اینجا هیچ چیز خراب نشده» بخوانید، نه «هیچ چیز نمیتواند خراب شود».
یک هفته روی ترافیک واقعی
| مدل | درخواست | پاسخ داده | میانه | کندترین | هزینه |
|---|---|---|---|---|---|
| Qwen3.6-35B-A3B-FP8 (MoE) | ۵ | ۴ | ۴٫۱ ثانیه | ۱۷٫۹ ثانیه | رایگان |
| Qwen3.8-27B (متراکم) | ۶ | ۶ | ۶٫۹ ثانیه | ۹٫۲ ثانیه | رایگان |
سمت کیفیت مهمتر از سمت تأخیر است، چون فیلتری که سریع و غلط جواب بدهد از فیلتر کند بدتر است. در همان بازه: هر ۲۷ پاسخ JSON قابل تجزیه بود، هیچکدام از ۸ استخر نامزد سالم خالی برنگشت، هیچکدام کل استخر را نگه نداشت، و مدلها ۴۴ و ۵۰ درصد نامزدهایی را که دیدند نگه داشتند — یعنی دقیقاً شکل فیلتری که واقعاً دارد فیلتر میکند. حتی یک پاسخ هم به سقف توکن خروجی نخورد. ده آزمایش از ده آزمایش، اعتبارسنج خروجی ما را بدون هیچ تخلفی رد کردند.
| سنجه | Qwen3.6 MoE | Qwen3.8 متراکم |
|---|---|---|
| پاسخهای JSON معتبر | ۱۴ از ۱۴ | ۱۳ از ۱۳ |
| جستوجوی سالمی که خالی برگشت | ۰ از ۳ | ۰ از ۵ |
| نگهداشتن کل استخر (بدون فیلتر) | ۰٪ | ۰٪ |
| سهم نامزدهای نگهداشتهشده | ۴۴٪ | ۵۰٪ |
| پاسخ بریدهشده در سقف توکن | ۰٪ | ۰٪ |
| ردشدن به دلیل محدودیت نرخ | ۰ | ۰ |
استدلال هنوز تعیینکننده همهچیز است
بزرگترین اهرم، نه مدل است نه پرامپت نه سختافزار. این است که بگذارید این مدلها پیش از پاسخ دادن فکر کنند یا نه. این را از بنچمارک میدانستیم؛ ترافیک واقعی روی آن قیمت گذاشت.
- Qwen3.8-27B — استدلال روشن۱۹ اوت · ۸ از ۱۶ درخواست تایماوت شد۸۰٫۵
- Qwen3.6-35B-A3B — استدلال روشن۱۹ اوت · کندترین درخواست ۱۵۷ ثانیه۵۶٫۲
- Qwen3.8-27B — استدلال خاموشاکنون · ۶ از ۶ پاسخ داده۶٫۹
- Qwen3.6-35B-A3B — استدلال خاموشاکنون · کندترین درخواست ۱۷٫۹ ثانیه۴٫۱
چه چیزی را اشتباه کردیم، علنی
در ۱۹ اوت هتزنر را با استدلال روشن روی هر دو مدل به ابتدای زنجیرهمان بردیم، با این فرض که داوری بهتر ارزش انتظار را دارد. چهار ساعت ترافیک واقعی روی این فرض قیمت گذاشت و پاسخ منفی بود. میانه زمان پاسخ به یک پرسش قیمت در کل محصول از ۵۶ ثانیه به ۱۱۵ ثانیه رفت و صدک نودم از ۱۳۶ به ۲۹۲ ثانیه. بیستودو جستوجو ۲٬۵۴۲ ثانیه در فیلتر ارتباط نشستند؛ سه جستوجویی که در همان بازه به مدل پولی ما رسیدند، روی هم یازده ثانیه گرفتند. دو نفر روی جستوجویی دکمه توقف را زدند که قیمتهایش از قبل جمعآوری شده بود و همانجا منتظر فیلتری بود که هنوز داشت فکر میکرد.
همان بعدازظهر برگرداندیم. لازم است دقیق بگوییم تقصیر با که بود: با ما. سرویس دقیقاً همان کاری را کرد که از آن خواسته بودیم. ما پیکربندی گران را خواسته بودیم.
مدلی که کنار گذاشته بودیم، بیسروصدا شروع به کار کرده
در بنچمارک، مدل متراکم Qwen3.8-27B با استدلال خاموش بدترین ورودی جدول بود. میانه خروجیاش شش توکن بود: با یک نتیجه خالی جواب میداد و میایستاد. سریع، تمیز و بیفایده — نمره ۹ از ۱۰۰ گرفت و از آن گذشتیم.
مسیری که برای آزمودن مدلها استفاده میکنیم همیشه استدلال را خاموش میفرستد. پس هر درخواستی که این مدل متراکم از ۲۰ اوت به بعد سرو کرده، با همان پیکربندیای بوده که کنارش گذاشته بودیم — و حالا داوریهای کامل ۱۳۰ تا ۲۷۰ توکنی برمیگرداند، هر شش باری که از آن پرسیدهایم پاسخ داده، با میانه ۶٫۹ ثانیه، و حتی یکی از پنج جستوجوی سالمی را که دید خالی برنگرداند.
از بیرون نمیتوانیم کاملاً جدا کنیم که چقدر از این بهبود از سمت هتزنر است و چقدر از سمت ما، و ادعای خلاف آن روی شش درخواست صادقانه نیست. اما سمت ما بین این دو اندازهگیری تغییری نکرده و رفتار تغییر کرده است. چیزی در سمت سرویسدهی بهتر از هفته پیش کار میکند. اگر این مدل را با استدلال خاموش امتحان کردهاید و رها کردهاید، ارزش یک نگاه دوباره را دارد.
چیزی که هنوز جلوی ما را گرفته، مدل نیست
کلید ما اجازه ده درخواست در هر شصت ثانیه را میدهد، مشترک میان کل بکاند. در تمام عمر این یکپارچهسازی حتی یک بار هم محدودیت نرخ نخوردهایم — حتی یک ردشدن در میان تمام درخواستهایی که فرستادهایم.
این تعریف از آن سقف نیست. توصیف این است که چقدر کم جرئت میکنیم از آن ترافیک عبور دهیم. یک پرسش کاربر چند فراخوان برای ما هزینه دارد و یک اجرای انبوه روی فهرست خرید ۱۵۰ قلمی حدود ۱۹۰ فراخوان است، که با ده تا در دقیقه یعنی نوزده دقیقه صف پیش از آنکه اصلاً تولیدی شروع شود. برای همین این سرویس دوم زنجیره ما میایستد، پشت یک مدل پولی، و فقط وقتی سرو میکند که آن یکی در حال خنک شدن باشد. به همین دلیل این گزارش از یازده درخواست حرف میزند و نه یازده هزار.
این سقف است که تعیین میکند چه سهمی از بار کاری ما میتواند اینجا زندگی کند، نه کیفیت. بکاند ما همین حالا روی یک سرور ابری هتزنر در فنلاند اجرا میشود، پس بالا بردن آن سقف صرفاً ترافیک را از یک API پولی به شبکه خودِ هتزنر منتقل میکند. این معامله را همین امروز قبول میکنیم.
توصیهاش میکنیم؟
بله، به شرط آنکه پیکربندی را یادداشت کنید. استدلال را خاموش کنید، مهلت کوتاه برای هر فراخوان بگذارید، یک مدل پولی پشتش قرار دهید برای هرچه از دستش در میرود، و بدون اندازهگیری تأخیر سرتاسری — نه تأخیر تکفراخوان — آن را به جایگاه اول نبرید؛ همان بعدازظهری که زمان پاسخ خودمان دو برابر شد، تکتک عددهای هر فراخوان سالم به نظر میرسیدند. با این شرطها یک هفته بیسروصدا و بیحادثه کار کرده و هیچ هزینهای نداشته است. این ترکیب کمیابتر از آن است که به نظر میرسد، و حالا بخشی از روشی است که با آن قیمتها را مقایسه میکنیم.