Разбираемся, почему официальные и независимые тесты расходятся, и что такое cost per successful task.
Соревнование больших языковых моделей давно превратилось в гонку циферок. Кто-то вырывается вперед по логике, кто-то — по коду, но стоит отправить эти модели в реальные агентские задачи, как красивые ступени начинают разъезжаться. Одна и та же модель в одном тесте — почти чемпион, в другом — середняк. И дело не в том, что кто-то жульничает, а в том, что у бенчмарков разные бюджеты времени и токенов. Разберемся, как эти скрытые параметры влияют на итоговый счет и почему ценник за токен больше не говорит о настоящей цене решения.
Qwen 3.8-Max Benchmark: почему официальные и независимые результаты разошлись
На этой неделе Alibaba выкатила Qwen 3.8-Max и преподнесла его как модель, которая уступает лишь Claude Opus 5. По крайней мере, так выглядела их собственная таблица лидеров: в ней новинка занимала вторую строчку, хотя даже в день запуска было видно, что на одном из 12 сценариев кодинга она вообще не первая.
Но независимый тест VulcanBench пришел чуть ли не к противоположному выводу. Прогон на этом харнессе, судя по всему, использовал предварительную версию, и результат получился обескураживающим: на лучшей настройке усилий Qwen 3.8-Max оказался в середине списка, а на дефолтной — вообще последним.
Qwen 3.8-Max Benchmark в этой ситуации выглядит идеальной иллюстрацией того, как два одинаково честных теста дают несовместимые результаты. И оба результата реальны и защитимы. Просто они измеряют разные вещи. Разгадка — в таймингах.
Alibaba в сносках к своим цифрам честно указывает, что на задачи по кодингу давала модели до пяти часов, а на PaperBench — вообще до двенадцати. VulcanBench же отвел на каждую задачу от 45 до 60 минут реального времени. Вот и получается, что временной бюджет у китайской стороны был в 5–16 раз больше. Такую фору сложно не заметить, когда смотришь на финальные проценты.
Это не значит, что Alibaba жульничает, а VulcanBench — придирается. Просто время стало скрытым гиперпараметром, который решает всё. Модель, которая может размышлять часами, неизбежно обставит ту, что упирается в час. Поэтому при выборе модели пора перестать смотреть только на голые цифры точности. Время и токен-бюджеты должны стать явной частью критериев приемки, а не мелким шрифтом в сносках.
Стоимость успеха: почему цена за токен больше не предсказывает счёт
Бюджет решает всё
Artificial Analysis провела замер, который многое объясняет. DeepSeek-V4-Flash на максимальном уровне усилий сожрала 210 миллионов выходных токенов — при том, что медиана по классу составляет 100 миллионов. Вдумайтесь: вдвое больше болтовни, чем средняя модель. Абсолютная стоимость при этом осталась низкой, потому что сами токены копеечные. Но болтливость стоит не только денег — она стоит времени. И вот это уже может утопить любой продакшн.
Нельзя смешивать неправильный ответ и исчерпание бюджета. Это разные события с разными диагнозами и разными лекарствами. Возьмем Long-Horizon-Terminal-Bench: там 79% нерешенных задач стали жертвами таймаутов, 19% — самостоятельной остановки агента, и лишь 3% — ошибок харнесса. Показатель pass rate сейчас меряет сразу две вещи одновременно, и никто не может сказать, какую из них чинить.
Дорогая лестница, ведущая в никуда
VulcanBench выдал, пожалуй, самый показательный кейс: Claude Opus 5 на низкой настройке усилий решил 20 из 23 задач, а на высокой — всего 18. При этом высокая настройка дала меньше всего неправильных ответов — один против трех у низкой. Звучит как победа качества? Тогда почему итоговый счет хуже? Потому что модель уперлась в лимит времени. Двое из трех регрессов — это обрывы на задачах, которые низкое усилие решает играючи. А если дать модели бесконечное время на обеих настройках, она лишь сравняется с дешевым режимом, но в 3,1 раза дороже.
Отсюда прямой вывод для тех, кто строит маршрутизацию: стандартная схема эскалации «подешевле не сработало — кинем на подороже» летит в тартарары. Вы платите больше за то, чтобы упереться в таймаут, а не за долгожданный успех. Эскалация на более высокое рассуждение при неудаче может быть неэффективной: следующий уровень не просто дороже — он может в принципе не содержать ответа. Вместо качественного скачка вы получаете щедро оплаченное ничто.
Кто уже внедрил cost per successful task и что изменить на этой неделе
Кто уже измеряет стоимость успеха
Хорошая новость: cost per successful task не нужно придумывать с нуля. VulcanBench с первых отчетов публикует доллары за решенную задачу как главный показатель. Long-Horizon-Terminal-Bench выводит стоимость задачи рядом с точностью, и самый показательный пример там — GPT-5.4 примерно за $26 за задачу при куда более низком проценте прохождения, чем Grok 4.5 за $11.
TestEvo-Bench гоняет агентов под бюджетным ограничением и наглядно показывает, как ужимание лимита меняет результат: у Claude Code точность генерации тестов падает с 71% до 44%, как только бюджет становится жестче.
Вендоры тоже уходят от оплаты за токены. HubSpot перевел своего Breeze Customer Agent на 50 центов за решенный разговор вместо $1 за обработанный. Zendesk выставляет счет за автоматическое решение. Fin берет 99 центов за конечный результат и только в том случае, если он действительно доведен до конца.
Что менять уже на этой неделе
Сначала разведите причины отказов. Пусть каждый запуск возвращает отдельное поле с причиной: исчерпан бюджет, не прошел верификатор, ошибка харнесса — вместо одного безликого флага. Пока таймаут и неправильный ответ считаются вместе, pass rate измеряет две разные проблемы и непонятно, что чинить.
Затем начните считать cost per successful task для каждого уровня усилий. Весь потраченный бюджет, включая неудачные попытки, делится на количество задач, прошедших приемку. Ранжирование по этой метрике часто не совпадает с расценками на токены, и самая дешевая настройка нередко выигрывает.
Дальше — ограничивайте токены, а не время выполнения, если только задержка не является частью вашего SLA. При лимите по времени вы неосознанно оцениваете скорость серверов провайдера, а не качество модели.
И наконец, проверьте дефолтную настройку усилий. Qwen 3.8-Max при пустом поле effort работает на максимальном уровне рассуждений, а этот режим в независимых тестах оказался худшим по соотношению цены и успеха. Одно неустановленное поле способно сделать каждый запуск дороже и одновременно реже успешным.
Любому, кто выбирает модель для продакшена, стоит перестать смотреть на рекламные графики и начать считать собственные деньги. Рано или поздно рынок и сам будет платить только за успех, но ждать этого не обязательно — можно начать считать уже сейчас. А мы будем следить, кто из вендоров первым перестанет продавать токены и начнет отвечать за результат.