Разбираемся, почему лидер бенчмарков не справляется с агентными сценариями и как рост тарифов DeepSeek меняет рынок LLM-моделей.
Рынок корпоративного ИИ живет по новым законам. Пока одни вендоры с помощью AI режут издержки на токенах, другие переписывают ценники и смотрят, как их флагманская модель, отлично показавшая себя в бенчмарках, спотыкается о реальные агентные задачи. В этом материале разбираемся, зачем Writer выпустила Palmyra X6, почему оркестрация экономит больше, чем самая умная LLM-модель, и какой ценой DeepSeek пытается удержать статус народного любимца.
Palmyra X6: новая нейросеть Writer против роста счетов за токены
Компания Writer, чья enterprise-платформа для ИИ-агентов давно обосновалась в Fortune 500 (среди клиентов — Accenture, Uber и Vanguard), сегодня сделала ставку сразу на три фронта: выпустила флагманскую модель Palmyra X6, пересобрала агентный оркестратор и добавила инструменты управления расходами. Звучит как рутинный апдейт, но цифры заставляют присмотреться внимательнее.
По заявлениям Writer, агентный продукт с Palmyra X6 работает в среднем на 52% дешевле, на 48% быстрее и при этом на 10% качественнее. И хотя такие цифры всегда хочется проверить лично, проблема, которую решает компания, абсолютно реальна. ИИ-агент — это не чат-бот. Один запрос превращается в бесконечные циклы планирования, поиска, вызовов инструментов, валидации и повторов. Пользователь видит один ответ, а счёт за токены приходит за весь этот конвейер.
Даже глубинная математика играет против бизнеса. Goldman Sachs прогнозирует 24-кратный рост потребления токенов с 2026 по 2030 год — до 120 квадриллионов токенов в месяц. И это не потому, что люди начнут чаще задавать вопросы: просто корпоративные всегда-включённые агенты заработают без выходных. Хуже того, снижение цены за токен не гарантирует снижение счетов. При 20-кратном росте токенов и падении цен на 75% итоговый счёт всё равно вырастает в пять раз.
«Предприятия хотят взрыва потребления токенов — это значит, что внедрение идёт, — но им нужно, чтобы расходы выровнялись», — говорит CTO Writer Васеем Аль-Ших. Директор по продуктам Matan-Paul Shetrit и вовсе называет стоимость главным барьером. «Самый большой барьер для внедрения ИИ в enterprise — это не возможности модели, а стоимость вокруг неё. Реальность такова, что альтернатива ИИ в большинстве случаев — не другая ИИ-модель, а человеческий труд».
Звучит как парадокс: если Writer режет собственное потребление токенов, не рушит ли это её выручку? Shetrit отвечает без колебаний: «Снижение стоимости не вредит моей прибыли. Оно расширяет её, потому что расширяет TAM возможностей внутри организации». Логика вполне в духе облачной эпохи: цены падают, объёмы потребления растут, а итоговые счета — вместе с ними.
Секрет Palmyra X6: 626 примеров вместо миллиардов
Сама модель — это Mixture-of-Experts с 744 млрд параметров и примерно 40 млрд активных параметров на токен. Архитектура унаследована от GLM-5.2, но вся магия — в пост-обучении. Writer применила метод ASFT — anchored supervised fine-tuning — и обучила модель всего на 626 синтетических агентных траекториях. За одну эпоху. С низкой скоростью обучения.
ASFT работает хитро: сочетает взвешивание токенов с KL-дивергенцией, которая штрафует модель за слишком сильное отклонение от замороженной копии базовой модели. Проще говоря, нейросеть учится новым инструментальным навыкам, но не теряет общих способностей. Вместо стандартного оптимизатора Adam Writer использовала Muon — свежий метод, который работает с матрицами весов как с геометрическими объектами. Звучит как магия, но боссы ИИ-исследований Writer уверены: философия «меньше — значит больше» сработала. Как выразился Дэн Бикель, это позволило оптимизировать модель под клиентов с меньшими затратами на обучение.
Стоит отметить, что для Writer это не эксперимент, а любимая стратегия. Предыдущие модели тоже обучались на синтетике: Palmyra X 004 обошлась примерно в $700 000 (по данным TechCrunch), а Palmyra X5 — около $1 млн на GPU. Весь обучающий датасет X6 — синтетический, но прошёл многоступенчатую фильтрацию: структурные проверки, модельный верификатор и жюри из двух LLM, которые оценивали каждую траекторию.
Бенчмарки, цена и эффект 26 секунд
На внутренних тестах по девяти категориям — от grounding и работы с инструментами до генерации контента, делегирования сабагентам и brand voice — X6 набрала 0.87. Для сравнения: Claude Opus 4.8 получила 0.86, Claude Sonnet 4.6 — 0.85, GPT-5.5 — 0.80, а Gemini 3.1 — 0.77. Но главный козырь — цена. Palmyra X6 стоит $2 за миллион входных и $8 за миллион выходных токенов, тогда как Opus 4.8 запрашивает $15/$75. Задачи выполняются в среднем за 26 секунд, а модель способна автономно работать до восьми часов.
Впрочем, сам Бикель честно признаёт: внутренние бенчмарки вызывают у индустрии здоровый скепсис. «Публичные бенчмарки для нас — не самоцель. Это проверка на здравый смысл, чтобы понять, что мы лезем не на ту гору». И это, пожалуй, самая здоровая позиция во всей этой истории.
Китайский след: почему Palmyra X6 построена на базе GLM-5.2
Когда enterprise-компания из США публично признает, что ее флагманская нейросеть построена на доработке китайской open-weight модели, это звучит как политический скандал. Writer же превратил это в рутину. В техническом отчете черным по белому написано: Palmyra X6 — пост-обученная версия GLM-5.2 от пекинской Z.ai (бывшей Zhipu AI). Никаких попыток скрыть происхождение.
«Эта модель никоим образом не связана с её разработчиками. Она полностью работает на нашей инфраструктуре в США», — отрезал директор по продуктам Writer Матан-Пол Шетрит. Глава исследовательского направления Дэн Бикель выразился еще образнее: «Это в высшей степени модель Palmyra, а мы просто взяли числа с плавающей запятой как стартовую точку и обучаем дальше».
Несложно понять, почему они выбрали именно GLM 5.2. Модель вышла в июне под лицензией MIT и считается самой сильной open-weight на рынке. Artificial Analysis начислил ей 51 балл в своем Intelligence Index — это выше, чем у DeepSeek V4 Pro, Kimi K2.6 и даже некоторых флагманских Gemini от Google. При этом китайская нейросеть стоит копейки по сравнению с API американских вендоров. Для Writer, который продает enterprise-решения, это математика, а не политика.
Но есть нюанс, который не дает спать CISO. Летом SaferAI проверила GLM-5.2 через публичный API Z.ai и обнаружила: модель не отказалась ни от одной задачи по оскорбительным кибератакам или опасной биологии. Более того, у самой Z.ai нет опубликованного safety-фреймворка. Звучит как красный флаг для любой корпорации.
Writer парирует сразу по трем фронтам: веса скачаны с американского Hugging Face, все данные синтезированы и хранились в США, обучение шло на американской инфраструктуре. Этого показалось мало, поэтому компания провела пред-регистрированную оценку рисков — 19 674 ответа, оцененных вслепую, с сравнением против GLM-5.2 и четырех frontier-моделей конкурентов.
Результаты у X6 действительно сильные. На тесте ModelSlant от Washington Post она показала обе стороны спорных вопросов в 80% случаев — максимальный результат среди всех. Она даже отвечала на политически чувствительные запросы, которые DeepSeek V4 отказалась выполнять наотрез. А на бенчмарке FORTRESS X6 с системным сообщением набрала на 8.6 пункта выше по сопротивлению adversarial-атакам, чем сырая GLM-5.2, почти не потеряв в полезности. Сам Шетрит настаивает: X6 значительно лучше не только open-source, но и закрытых альтернатив на момент тестирования.
Впрочем, авторы отчета не стали притворяться, что все идеально. Там честно сказано: поведение модели варьируется в зависимости от языка, и 626 обучающих траекторий не могут стереть все следы базовой модели. Идеальной стерильности не существует.
По сути, выбор Writer — это лакмусовая бумажка для всей индустрии: должны ли американские предприятия строить ИИ на китайских open-source весах? Одни видят в этом катастрофу безопасности, другие — прагматичный способ сэкономить. Если вам нужна максимальная прозрачность, официальный сайт нейросети GLM 5.2 всегда открыт. Но именно Writer взял эту модель, дообучил под свои задачи и обещает, что она безопаснее оригинала. Рынок рассудит.
Оркестрация и контроль расходов: почему AI-агентам нужна обвязка, а не только модель
Пока конкуренты меряются умными цифрами на бенчмарках, Writer предлагает копнуть глубже: возможно, дело вовсе не в модели, а в том, что вокруг нее. Компания опубликовала исследование под названием «The Harness Effect» и заявляет, что переработанный оркестратор Writer Agent в одиночку снижает расходы на 41% и ускоряет выполнение задач на 44%. И главное — это работает с любыми моделями, включая сторонние API от Anthropic и OpenAI.
Возникает логичный вопрос: а зачем тогда Writer вообще тратил деньги на собственную модель X6, если «обвязка» экономит деньги даже на чужих? Ответ топ-менеджмента звучит как манифест параноика, уставшего от прихотей больших лабораторий. Матан-Пол Шетрит, директор по продуктам, объясняет это одним словом — контроль. Нельзя повлиять на то, когда лаборатория решит задепрекейтить свою модель или какие данные она использовала при обучении. Своя модель дает право отвечать на неудобные вопросы enterprise-клиентов, а не разводить руками.
Дэн Бикель, глава AI-исследований Writer, добавляет масла в огонь: модель и оркестратор развивались как сиамские близнецы. X6 создавалась в тесной связке с Writer Agent, они буквально «коэволюционировали». Такой трюк невозможен, если полагаешься на чужой черный ящик. Когда ты строишь свою модель, ты знаешь, под какие конкретно задачи она заточена.
Мультимодельность и «дашборд для CFO»
При этом Writer не впадает в фанатизм и не принуждает клиентов к моногамии. Платформа Writer Agent официально становится мультимодельной: администраторы могут подключать Anthropic, OpenAI, облака Microsoft Azure и AWS Bedrock, платформу Nvidia NIM и даже модели для генерации изображений. Посыл для CIO простой: берите нашу модель, потому что она дешевле и лучше под ваши задачи, но даже если вы выберете другую — платформа все равно сэкономит вам деньги. Хеджирование на грани цинизма, но работает.
Отдельный фронт — финансовая гигиена. Writer добавила инструменты управления расходами, которые дают администраторам централизованный обзор использования агентов, аналитику по переиспользуемым «Playbooks» и «Skills», а также алерты и лимиты трат. Шетрит настаивает, что это не способ ловить сотрудников на растратах, а инструмент уверенности: когда CIO и CISO видят прозрачную картину по безопасности и деньгам, они охотнее расширяют внедрение ИИ на новые зоны, до которых раньше боялись дотронуться.
В этой логике есть железное зерно. Forbes в своих разборах ценовых войн за токены давно советует продвинутым покупателям не смотреть на прейскурант за миллион токенов, а считать стоимость успешно выполненной задачи — с учетом дурацких повторов, лишних вызовов инструментов и эскалаций. Writer фактически продуктивизирует эту дисциплину бухгалтерии. То, что раньше было табличкой в Excel у финансового директора, теперь становится нативной функцией платформы.
Компания последовательно замыкает управленческий контур: в ноябре запустила единый агентный опыт с админ-контролем, в марте добавила Skills и аналитику, а сейчас прикрутила ценники и лимиты к каждому рабочему процессу. Вырисовывается стройная история про то, что главный товар Writer — это предсказуемость счета. Стартап 2020 года, основанный Мэй Хабиб и Васеем Аль-Шихом, привлек $200 млн при оценке $1.9 млрд в конце 2024-го и явно не собирается размениваться на потребительские игрушки.
Шетрит, кстати, очень изящно сформулировал позиционирование: «Привилегия работы с enterprise в том, что мне не нужно, чтобы модель умела писать французский сонет». Это не исследовательская лаборатория, которая пытается объять необъятное, а заточенный под корпоративные задачи вендор. Когда бизнес фокусируется на нуждах клиента, а не на бесконечном улучшении «флоатов», выигрывает кошелек заказчика.
Вся эта история посылает очень четкий сигнал индустрии. Ценность стремительно смещается от дорогостоящего предобучения к пост-обучению открытых весов, к инженерному искусству оркестрации и, что важнее, к дашборду для финансового директора. Frontier-лабораториям с их семикратной ценой за качество остаются только те редкие задачи, где это премиальное качество действительно оправдывает переплату. Для всего остального — включая написание кода и автоматизацию рутины, где как раз и нужны такие решения для AI Agents for Coding, — выигрывает тот, кто знает, что делать с чужими весами и как заставить их работать без удара по бюджету.
DeepSeek V4 Flash: лидер бенчмарков спотыкается на реальных задачах, а цены растут
DeepSeek V4 Flash — триумфатор бенчмарков и любимица разработчиков. С момента запуска ее окрестили «монстром», а по объему токенов она уверенно лидирует в рейтинге OpenRouter. Но как только модель попала на реальные агентные задачи, эйфория начала улетучиваться. Свежий тест Composio показал: V4 Flash справляется лишь с 53,8% сложных сценариев.
Эксперимент выглядел максимально приближенным к боевым условиям. Модель прогнали через восемь агентных сред — включая Claude Code, Codex и OpenCode — на 30 специально усложненных многошаговых задачах. В дело пошли живые инструменты: Gmail, GitHub, Slack и Google Sheets. Из 240 суммарных запусков успешными оказались 129, а заветную планку «каждый оркестратор справился» преодолели лишь 6 сценариев из 30.
Важнее всего тут не сухие проценты, а разброс результатов. Одна и та же модель показывала совершенно разную эффективность в зависимости от оркестратора, конфигурации инструментов, кэширования, повторов и провайдера. Стоило заменить обвязку — и V4 Flash превращалась то в гения, то в крепкого середнячка. Это лишний раз подтверждает: в корпоративной среде оркестрация нередко важнее сырой мощности, а голый рейтинг способен ввести в заблуждение.
DeepSeek переписывает ценники: время теперь тоже деньги
На этом фоне DeepSeek решила пересмотреть тарифы на свои AI-модели V4 Flash и V4 Pro. Flash с 284 миллиардами параметров создавался для массовых сценариев и скорости, Pro с 1,6 триллиона параметров — для сложных рабочих процессов. Обе модели умеют рассуждать в режимах low, high и max, а также «думать», применяя цепочки логических шагов для повышения точности.
Популярность Flash сложно переоценить: она возглавляет чарт OpenRouter с момента появления. ML-исследователь Натан Ламберт писал, что показатели внедрения были просто «безумными», V4 Flash «набрала столько же, сколько GLM 5.2», и по-настоящему является «полным монстром». Но теперь за это придется платить больше.
Новая ценовая сетка выглядит так: Flash off-peak стоит $0.22 за миллион входных токенов и $0.66 за миллион выходных, а в пиковые часы — $0.44 и $1.32. Итого прибавка от 57 до 371 процента. Pro подорожал до $0.66/$1.98 вне пиковых часов и до $1.32/$3.96 в пик — здесь разброс от 51 до 355 процентов. Даже кэш-хиты, когда модель переиспользует прежние запросы, выросли в цене на 52–1100 процентов.
DeepSeek оставила 50-процентную скидку за пределами пиковых нагрузок: 17 часов из 24 дешевле. Так компания пытается спихнуть пакетные задачи на ночь, а вот интерактивные агенты и live-операции вынуждены платить по полной. Примечательно, что домашний рынок оказался самым дорогим.
Санчит вир Гогиа из Greyhound Research сформулировал это точнее всех: «Это не просто повышение цен. Это ценовая архитектура, которая делает время выполнения запроса экономической переменной». Фактически DeepSeek просит клиентов выбирать: дешево и долго или быстро и дорого.
Аналитик Карми Леви добавляет изрядную долю скепсиса. На первый взгляд, повышение выглядит как «самоубийственный ход» для платформы, которая зарабатывает именно на доступности. Но после подорожания DeepSeek все равно остается заметно дешевле конкурентов из США. Преимущество будет сжиматься, но пока бизнес-кейс по-прежнему легко обосновать — просто теперь расчеты должны быть тщательнее.
Где место V4 Flash в реальном бизнесе
Предприятия уже присматриваются к модели, но очень осторожно. Первый очевидный сценарий — пакетная обработка: рутинные, повторяющиеся операции, где не нужны чудеса интеллекта. По словам Леви, V4 Flash отлично подходит для точечных нечувствительных нагрузок с понятными метриками успеха, строгим оверсайтом и запасными моделями на случай сбоя. Широкое внедрение потребует доказанной надежности, безопасности и аудируемости — а с этим пока сложно.
Куда реалистичнее выглядит сценарий «тихого» использования: инженеры будут тестировать модель в изолированных песочницах, привыкать к ней и лишь потом выходить к начальству с предложением оформить бюджет.
Инженер Meta* Наман Ахуя показал, как модель может работать в связке с несколькими системами. Он собрал домашнего агента на V4 Flash, который координировал термостат, охранную систему Ring и дверные замки. Главный вывод: как только ИИ получает право действий, надежность становится важнее интеллекта. Нужны проверки исполнения, повторы и четкие границы разрешений. В корпоративной среде схема та же, только вместо «умного дома» — тикеты, базы данных, CRM и API.
Гогиа напоминает: API Flash все еще в публичной бете, и о сколько-нибудь устойчивых корпоративных контрактах говорить рано. «Модель массова по трафику, но не доказана контрактами». Симптоматично, что в документации DeepSeek для одной популярной агентной среды прямо сказано: встроенных записей V4 недостаточно для стабильной работы без обхода совместимости. Проще говоря, вендор сам признает, что бенчмарки — не гарантия production-ready.
Мультимодельное будущее: не ставьте все на одного победителя
Один и тот же открытый вес, развернутый у разных хостеров, может выдавать совершенно разную пропускную способность и аптайм. Поэтому выбор V4 Flash отвечает лишь на один вопрос закупки — а следом открываются три других: кто будет обслуживать модель, где она работает и какие контроли стоят вокруг.
Адам Далул из EmpirioLabs призывает не гнаться за самыми большими параметрами. Его команда, работающая более чем с сотней моделей, недавно переводила сайт на другие языки — и для этой задачи GPT 5.6 Sol или Opus 5 были бы просто избыточны. Вместо этого Далул спавнит дешевых сабагентов под конкретную операцию: Flash-версии для повседневной работы, Pro — когда требуется запас мощности. Многие команды уже обзаводятся внутренними бенчмарками и «воротами», чтобы маршрутизировать запросы. У Далула один enterprise-клиент осознанно выбрал только V4 Flash: она единственная прошла его критерии по скорости, цене и «разумному порогу интеллекта».
Ахуя резюмирует стратегию разумного использования LLM-моделей: маленькие и эффективные — для частых четких задач, огромные фронтовые — для неоднозначных и рискованных решений. Считать при этом нужно не стоимость токена, а стоимость успешно завершенного рабочего процесса. Иначе можно нарваться на ловушку: дешевый инференс не гарантирует дешевую и безопасную автоматизацию. «Неудачный текстовый ответ — просто неудобство, а вот неудачное действие в рабочем процессе уже имеет реальные последствия».
Выходит, главная битва сейчас идет не за бест-модель, а за предсказуемость. Бизнесу не нужен «монстр» с феноменальным IQ, если он теряется там, где нужно просто довести задачу до конца. Дешевые токены — это всего лишь половина уравнения: вторая половина называется оркестрацией, контролем и готовностью нести ответственность за результат. Те, кто поймут это первыми, выиграют следующий цикл гонки.