Загадочная Ox Alpha оказалась китайской моделью GLM-5.3-Flash, которая на дешевых китайских чипах выдает результат уровня топовых американских нейросетей за копейки.
Неделю назад на OpenRouter появилась загадочная модель Ox Alpha. Очередная новинка в каталоге из четырех сотен моделей, где каждую неделю выходят десятки новых. Но что-то было не так. Бесплатный доступ — это понятно, таких много. Но эта штука реально работала. Инди-разработчики и энтузиасты быстро просекли фишку и принялись гонять через нее триллионы токенов в день. Оценки разнились — от нескольких единиц до двадцати с лишним триллионов.
Дальше началось самое веселое. Шесть дней комьюнити играло в Шерлока Холмса. Кто создал эту модель? У кого хватило инфраструктуры бесплатно обслуживать такие объемы? Сначала грешили на американские лаборатории: мол, это долгожданный Gemini, или Anthropic решил прокачать средний ценовой сегмент, или Илон Маск с его мощностями решил похулиганить. Люди даже анализ токенизатора проводили и сетевой трафик разбирали. Настоящая детективная неделя.
26 августа Z.ai официально раскрыла карты. Ox Alpha — это GLM-5.3-Flash. Они специально гоняли ее на публичном трафике, но главный сюрприз даже не в том, насколько модель хороша. Она реально хороша. Весь сервис построен исключительно на китайских чипах и инфраструктуре. Цена — 15 центов за миллион входных токенов и 50 за выходные. На OpenRouter сейчас акция: 50% скидки до 9 сентября — 7,5 и 25 центов соответственно. Веса открыты под лицензией MIT, а инференс хостится не только у Z.ai, но и у GMI Cloud, Cloudflare и других американских провайдеров.
Artificial Analysis в тот же день добавила модель на свой график интеллекта против цены. GLM-5.3-Flash набирает 57 баллов по их индексу при стоимости около девяти центов за задачу. Для сравнения: американский GPT-5.6 Sol (max) держится на отметке 59, но стоит 67 центов. То есть за два пункта интеллекта вы переплачиваете в 7,4 раза. Grok 4.6 — 61 балл и 94 цента за задачу. Десятикратная разница ради четырех пунктов. Верхушка кривой уже давно выровнялась, и токен-экономика начинает диктовать свои правила игры. Вопрос: что будет с нашими тяжелыми инфраструктурными инвестициями, которые никогда не учитывали появление сильного китайского конкурента с открытыми весами?
Американские корпорации уже чувствуют давление на бюджет. Возьмем Uber. Технический директор компании в апреле признался, что годовой бюджет на кодинг на 2026 год испарился за четыре месяца. Он лично сжег 1200 долларов за одну двухчасовую демонстрацию. К июню Uber ввел лимит в 1500 долларов на человека на каждый инструмент. Инструменты полезные, но польза и ценность — не одно и то же. Операционный директор Uber так и не смог провести прямую линию от этих дашбордов к "25% более полезных функций для потребителей".
Опрос McKinsey за 2026 год показывает: 80% людей говорят, что работают быстрее, 37% компаний видят рост прибыли, а 32% отказались от покупки хотя бы одного программного продукта, потому что смогли собрать нужную функцию сами с помощью агентов кодинга. Компании хотят сократить счета. Отказаться от ИИ они не могут. Задача — оптимизировать использование по всей организации.
Китайских разработчиков вроде Zhipu, Qwen или DeepSeek уже не избежать. Они снова и снова доказывают, что могут бросить вызов лидерам индустрии и резать издержки. На OpenRouter китайские модели обогнали американских конкурентов по доле токенов еще в начале июня, и верхушка таблицы до сих пор принадлежит китайским лабораториям. Инди-разработчики уже живут в мире GLM Flash, DeepSeek Flash, MiniMax, Kimi, изредка разбавляя это Grok или Claude, если уже оплатили подписку. А если вы через компанию подписаны на Grok или OpenAI — это теперь утопленные деньги. Финансовый отдел начнет задавать вопросы, зачем платить за места, когда можно платить по факту и в разы меньше.
Что делать? Разделите свою работу с агентами и кодингом на три корзины по доле задач и токенов — не по долларам, ведь у GLM-5.3-Flash цена за токен настолько ниже, что даже при равном долларовом распределении большая часть объема уйдет туда. На самом верху — Fable и Opus. Если нужно проанализировать сложную стратегию или расписать детальный план выполнения — дополнительные очки интеллекта имеют значение, и за них стоит платить. Но только за те редкие задачи, где нельзя экономить. Это примерно 5% объема. Средний ярус — Kimi K3, Gemini 3.7 Flash, GPT-5.6 Sol и Grok 4.6, все в районе 60 баллов по индексу интеллекта. Kimi — тяжелый боец для кодинга и любимец фанатов, Grok 4.6 на втором месте, хотя его подводит маленькое контекстное окно. Сюда отправляйте около 50% объема. И наконец, оставшиеся 45% — смело отдавайте GLM-5.3-Flash как рабочей лошадке. Ваша инфраструктура, ваш микс задач и ваши тесты нарисуют собственную границу эффективности. Китайские модели с открытыми весами сэкономят вам деньги — и они обязаны быть в ваших расчетах.
Сентябрь готовит настоящий потоп новых моделей — Google, xAI, Anthropic, OpenAI и DeepSeek все анонсировали релизы. Граница Парето может снова сдвинуться. Но направление задано: больше интеллекта за меньшие деньги. Лаборатории, которые не смогут снизить стоимость обслуживания, потеряют объем — а вместе с ним и аудиторию, которую этот объем создает.
Домашнее задание перед сентябрем. Посчитайте свои токены. Можете ли вы привязать расходы к метрикам роста выручки или клиентской базы? Если нет — хотя бы к скорости разработки или продуктивности? Без четких целей защитить бюджет будет сложно. Пересоберите ИИ-бюджет с нуля. Пусть каждая команда предложит свой план расходов и сможет его защитить. Определите модель-стратегию по командам. Три яруса: дорогой для необратимых решений и стратегий, средний для повседневной работы и платных подписок, дешевый для массовых задач.
В следующем месяце модели снова подешевеют. Команды станут еще голоднее. Компании, которые выйдут из этой гонки победителями, будут делать ставки осознанно — и не позволят своим агентам думать на Opus или Fable, если задача этого не стоит.
Автор материала — продуктовый исполнительный директор с опытом создания интеграционных платформ в Salesforce, Oracle и AgentPaaS.ai. Работает над продакшн-системами с агентами.
Лично я в полном восторге от происходящего. Еще год назад мы гадали, когда же Китай догонит США в гонке ИИ. А теперь они не догоняют — они переворачивают экономическую модель всей индустрии. И самое смешное, что американские гиганты сами создали этот рынок, а теперь вынуждены конкурировать с десятикратной разницей в цене. Ждем сентября — будет жарко.