Назад в ленту

Гугл и Z.ai: новые ИИ-модели для кодинга и агентов — разбор GLM-5.3 и Gemini 3.7 Flash

Китайский стартап делает ставку на кибербезопасность и пост-обучение, а Google — на скорость и низкие цены, пытаясь удержать лидерство.

ИИ-гонка в этом году напоминает забег, где участники меняют обувь на бегу. Китайский стартап Z.ai выкатывает модель GLM-5.3, которая не только лучше кодит, но и неожиданно быстро учится взламывать. Google, в свою очередь, пытается удержать темп и выпускает уже третью Flash-версию за пару месяцев, параллельно перетряхивая руководство DeepMind. Что стоит за этими релизами и почему кадровые перестановки в Google могут быть важнее любых бенчмарков — разбираемся в материале.

GLM-5.3: Новая эра агентного кодинга от Z.ai

Пост-обучение вместо новой архитектуры

Если в прошлом году главной ставкой Z.ai была новая базовая модель, то теперь путь другой. GLM-5.3 построена на том же фундаменте, что и GLM-5.2, — 743-миллиардная база осталась нетронутой. Вся магия — в масштабировании пост-обучения: инженеры развернули обучение на более широком спектре сред и задач, превратив модель из просто «умной» в агента, способного работать с кодом, документацией, вычислительными кластерами и результатами экспериментов. Как прямо заявили в Z.ai: «Все, что мы сделали для GLM-5.3, — это масштабировали пост-обучение». И, судя по цифрам, этого оказалось достаточно.

Цифры, которые говорят сами за себя

Результаты действительно впечатляют. На Terminal-Bench 3.0 модель прыгнула с 4.6 до 28.3, на DeepSWE v1.1 — с 46.2 до 66.9, а на AutomationBench — с 26.2 до 48.2. Это не просто «прирост», а совершенно другой класс агентного кодинга. Особенно показательно, что задачи в обучающих средах теперь больше напоминают полноценную инженерную работу, а не изолированные упражнения: агенту выдают доступ к кодовым базам, документации и кластерам, а он должен диагностировать проблемы, вносить изменения и демонстрировать измеримый результат. Звучит как описание стажера, только без перекуров.

Отдельного внимания заслуживает эффективность. На собственном Code Bench Z.ai при максимальном уровне рассуждений GLM-5.3 достигла 34.5%, потратив на задачу около 75 тысяч выходных токенов. Для сравнения: GLM-5.2 показывала 23.4%, но сжигала при этом примерно 96 тысяч токенов. Если перевести на язык денег и времени — серьезная экономия. Даже на высоком уровне усилий модель умудряется выдавать 31.4% при 50 тысячах токенов, тогда как Claude Opus 4.8, по данным Z.ai, требует 120 тысяч. Правда, это внутренний бенчмарк компании, так что доверять стоит с оговоркой.

Доступность: сначала план, потом API

GLM-5.3 пока нельзя пощупать через открытый API или скачать веса. Модель доступна только в GLM Coding Plan и фирменной среде ZCode. Обещают, что API и открытые веса появятся примерно через две недели — но только после завершения проверки безопасности. Видимо, в Z.ai решили не повторять прошлые ошибки и сначала убедиться, что модель не натворит дел в чужих руках.

Подводный камень для разработчиков

Есть и сюрприз для тех, кто уже мигрировал на GLM. В API появилось обязательное требование указывать уровень reasoning effort — low, high или max. При этом max стоит по умолчанию, и, по мнению Z.ai, именно его стоит использовать для кодинга. Главная боль: отключить thinking больше нельзя. Если ваше приложение сейчас отправляет thinking.type: "disabled", придется переписывать код — иначе запрос просто упадет. Так что обновление — это не просто смена имени модели, а полноценная миграция.

Итог такой: GLM-5.3 — это не очередной «ребрендинг», а попытка доказать, что границу возможностей можно отодвигать без новой дорогостоящей тренировки. Получилось ли? На бумаге — да. Но, как всегда, решающим станет тест на реальных задачах. Ждем, когда модель выпустят в свободное плавание.

Кибербезопасность GLM-5.3: неожиданное ускорение

Когда в Z.ai добавляли в пост-обучение GLM-5.3 среды для поиска уязвимостей, там явно рассчитывали на скромный прирост профильных навыков. Вместо этого модель рванула вперед так, что разработчики сами опешили. «По мере масштабирования пост-обучения киберспособности развивались быстрее, чем мы ожидали», — признались в компании. И это не просто вежливый реверанс в сторону собственного ИИ: цифры действительно выглядят угрожающе.

На бенчмарке CyberGym, который проверяет обнаружение и валидацию уязвимостей в исходном коде, GLM-5.3 набрала 84.5%. Для сравнения: предшественница GLM-5.2 остановилась на 77.2%, а заявленные показатели GPT-5.6 Sol и Mythos 5 — 83.6% и 83.8% соответственно. То есть по этой дисциплине новинка обошла всех, включая именитых закрытых конкурентов.

Первая кровь: Cursor AI

Показательно, что модель не стала отсиживаться в песочнице. По словам разработчика Z.ai, GLM-5.3 уже нашла потенциально серьезную уязвимость в Cursor AI — ИИ-редакторе кода, который недавно приобрела SpaceX. Насколько серьезной окажется находка, пока неясно: VentureBeat отправила запрос в Cursor и ждет ответа. Но сам факт того, что свежая открытая модель способна на такое, заставляет задуматься.

Впрочем, до полного доминирования в этой области пока далеко. На ExploitBench, где проверяется способность строить цепочки эксплуатации, GLM-5.3 показала 54.4%. Это более чем вдвое выше, чем у GLM-5.2 (24.4%), но вот GPT-5.6 Sol выдает 76.5%, а Mythos 5 — все 78%. То есть находить уязвимости модель научилась лучше, чем превращать их в полноценные атаки — пока что.

Цифры, от которых становится не по себе

Z.ai также отчиталась о практических результатах. За время работы с командами безопасности в Китае модель накопила 2436 подтвержденных находок в 269 проектах — это после экспертной проверки, фильтрации и дедупликации. Из них 1097 отнесены к критическим или высокой степени серьезности. При этом публично раскрыты только 53 уязвимости, а 2383 все еще находятся под эмбарго.

Именно такой прогресс заставил Z.ai вводить ограничения для самых чувствительных функций. По данным Reuters, компания уже внедряет механизм «доверенного доступа» и другие средства контроля для наиболее опасных возможностей модели. Оно и понятно: когда твой ИИ начинает находить баги быстрее, чем ты успеваешь их патчить, хочется хотя бы немного притормозить.

Google Gemini 3.7 Flash: быстрый и доступный апдейт

Три недели — это вообще срок для полноценного апдейта ИИ-модели? В гугле, похоже, считают, что да: очередное обновление в линейке Gemini AI выходит всего через три недели после 3.6 Flash. На этот раз компания сделала ставку на кодинг, агентные сценарии и автоматизацию рабочих процессов. Никакой воды — только то, что реально нужно разработчикам, которые месяцами страдают от бесконечных циклов исправлений и ручного контроля.

Скидка, от которой сложно отказаться

Ещё более приятная часть — цена. До конца 2026 года действует вводная скидка 50%: $0.75 за миллион входных токенов и $3.75 за миллион выходных. С 1 января 2027 года цены удвоятся, но полгода — приличный срок, чтобы проверить, насколько новая модель сокращает количество retry. Если так, то экономия на токенах превратится в экономию на времени и нервах.

Теперь к цифрам. На FrontierCode 1.1 Main, который меряет качество production-кода, модель набрала 43.6%, обойдя Claude Sonnet 5 (42.7%) и GPT-5.6 Terra (41.3%). По сравнению с 3.6 Flash, у которого 34.4%, прогресс составил почти 9 процентных пунктов. В тесте на длинные инженерные задачи DeepSWE v1.1 результат вырос с 49.0% до 65.3% — однако GPT-5.6 Terra по-прежнему лидирует с 69.6%. То есть выстрел вышел мощный, но не в яблочко.

Работа, документы и доступность

Кодинг — не единственная сильная сторона. На AutomationBench, который эмулирует автоматизацию рабочих процессов, модель показала 30.4%, а на тесте сложного понимания PDF — GDP.PDF — 34.0%. Предыдущая версия демонстрировала 17.0% и 22.0% соответственно. Удвоение показателей в этих задачах — серьезная заявка для бизнес-агентов, которым нужно не просто генерировать текст, а выполнять цепочки действий.

Gemini 3.7 Flash уже доступна через Gemini API, AI Studio, Android Studio и среду Antigravity. Подписчики Google AI Pro и Ultra могут опробовать её в личном агенте Spark. Это максимум доступных векторов — от простого чат-бота до полноценного агента, который разбирается с документами и воркфлоу.

Главный вопрос не в том, хороша ли модель на бумаге. Вопрос в том, как она покажет себя в реальных пайплайнах, где каждый лишний токен — это деньги. Пока действуют вводные цены, разработчики получат отличную возможность прогнать новинку по своим сценариям и решить, стоит ли переходить. Google явно рассчитывает, что ответ будет «да» — и для этого у нее есть вся первая половина 2026 года.

Google: кадровые перестановки и борьба за лидерство

Google: кадровые перестановки и борьба за лидерство

Релиз Gemini 3.7 Flash, каким бы быстрым и успешным он ни казался, происходит в тени задержки флагманской модели Gemini 3.5 Pro. Её анонсировали ещё весной, обещая выпуск в июне, но до сих пор модель находится на этапе партнёрского тестирования, а дата выхода так и не названа. Более того, уже в июле появилась информация, что Gemini 3.5 Pro не дотянула до внутренних целей, особенно в кодинге, и теперь Google сосредоточилась на более амбициозном проекте — Gemini 4.

На этом фоне в руководстве Google DeepMind произошла настоящая революция. Нобелевский лауреат и сооснователь DeepMind Демис Хассабис отошёл от оперативного управления лабораторией, став председателем и главным научным директором Alphabet. А бывший технический директор DeepMind Корай Кавукчуоглу теперь единолично рулит всем направлением Gemini — от разработки моделей до приложения и исследовательских команд. Фактически это консолидация полномочий в руках более продукто-ориентированного менеджера.

Кадровые перестановки сопровождаются исходом ключевых исследователей. Джефф Дин, Ориол Виньялс, Куок Ле и Санджай Гемават покинули Google и основали собственный исследовательский стартап Discovery Loop. Ранее команду уже покинули Ноам Шазер (ушёл в OpenAI) и Джон Джампер (теперь в Anthropic). Репутация Google как главной кузницы ИИ-талантов трещит по швам, а внутренние разногласия и бюрократия, по данным Reuters, только усугубляли задержки релизов.

Тем не менее у Google остаётся мощнейший козырь — дистрибуция. Приложение Gemini преодолело отметку в 950 миллионов месячных пользователей. Это означает, что даже без абсолютного лидерства в бенчмарках Google может доставлять свои модели миллиардам людей через Search, Android, Workspace и облако. Именно на это делают ставку те, кто считает панику преждевременной.

Аналитики SemiAnalysis, впрочем, идут дальше и утверждают, что Google вообще отменила Gemini 3.5 Pro, хотя официального подтверждения нет — компания продолжает говорить о временной задержке. Так или иначе, Гугл отчаянно пытается сохранить место в первом эшелоне ИИ-гонки, и скорость выхода Gemini 3.7 Flash показывает: даже без флагмана компания способна быстро итеративно улучшать свои модели. Вопрос лишь в том, хватит ли этого, чтобы не уступить трон более дерзким конкурентам.

Пока Z.ai доказывает, что пост-обучение способно выжать из базовой модели гораздо больше, чем ожидалось, Google лихорадочно латает организационные дыры и делает ставку на скорость. Кибербезопасность GLM-5.3 и доступная цена Gemini 3.7 Flash — это не просто технические детали, а симптомы новой реальности: ИИ-гонка теперь решается не только в лабораториях, но и в вопросах доверия, безопасности и умения быстро доставлять продукт до пользователя. Будет интересно посмотреть, кто первым споткнётся.

Справка по теме (FAQ)
Что такое GLM-5.3 и почему она важна?
GLM-5.3 — это новая модель китайского стартапа Z.ai, использующая ту же базовую модель, что и GLM-5.2, но с масштабированием пост-обучения. Она показала значительный рост в бенчмарках кодинга, а её кибервозможности развились быстрее, чем ожидалось, что вынудило Z.ai ввести ограничения на доступ к чувствительным функциям.
Почему Google задерживает Gemini 3.5 Pro?
Флагманская модель до сих пор находится в партнёрском тестировании, хотя её анонсировали ещё весной. По данным Reuters, модель не дотянула до внутренних целей, особенно в кодинге, и теперь Google сосредоточена на более амбициозном проекте — Gemini 4. Аналитики SemiAnalysis утверждают, что модель фактически отменили, но Google официально это не подтверждает.
Сколько стоит Gemini 3.7 Flash?
До конца 2026 года действует вводная скидка 50%: $0.75 за миллион входных токенов и $3.75 за миллион выходных. С 1 января 2027 года цены удвоятся до $1.50 и $7.50 соответственно.
Что такое Discovery Loop?
Это исследовательский стартап, основанный бывшими ключевыми исследователями Google, включая Джеффа Дина, Ориола Виньялса и Куока Ле, которые покинули компанию на фоне кадровых перестановок в Google DeepMind.