Назад в ленту

Thinking Machines выпустила Inkling Small: открытая ИИ-модель почти флагманского уровня при четверти размера

Новая открытая модель Thinking Machines с 276 млрд параметров почти не уступает флагману, но требует меньше ресурсов и предлагает понятную лицензию Apache 2.0.

За две недели — две open-source модели. Команда Thinking Machines во главе с бывшим техдиректором OpenAI Мирой Мурати явно взяла небывалый темп: вслед за флагманской Inkling выходит уменьшенная версия Inkling Small. «Уменьшенная» здесь — чисто условно: по части бенчмарков новинка почти догоняет старшую сестру, а по кодингу кое-где её обходит.

Внутри — 276 млрд параметров, мультимодальность и контекст на миллион токенов. Но главная интрига не в цифрах, а в стратегии: Thinking Machines показывает, что выпуск больших моделей можно поставить на поток. Плюс не забыли про удобную лицензию и низкие цены на API. Разбираемся, что из этого выйдет и чем Inkling Small реально интересна бизнесу.

Inkling Small: почти флагманская производительность в корпусе вчетверо меньше

Где малыш обгоняет флагмана

Самое забавное начинается, когда смотришь на отдельные бенчмарки. Inkling Small не просто догоняет старшего брата — в ряде дисциплин она его откровенно побеждает. На тесте SWE-bench Verified, который проверяет способность решать реальные задачи программирования, малыш выбивает 80.2% против 77.6% у Inkling. На Terminal Bench 2.1 — 64.7% против 63.8%. Плюс уверенные успехи в SciCode, Humanity’s Last Exam, GPQA Diamond и CritPt. И вот тут возникает закономерный вопрос: а что, собственно, умеет флагман такого, чего не умеет его младший родственник? Ответ находится быстро — это фактологические задачи. На тесте τ³-Banking Inkling Small набирает лишь 15.5% против 23.7% у Inkling. Её показатель AA Omniscience и вовсе уходит в минус, что говорит о явных проблемах с широтой фактических знаний. При этом уровень галлюцинаций у «малыша» даже ниже. Собственно, это и есть главный компромисс. Для кодинга, агентных сценариев, RAG-систем, разбора документов и мультимодальных рабочих процессов Inkling Small подходит почти идеально. Но если бизнесу нужны железобетонные факты из головы модели — без внешних систем проверки и верификации не обойтись. И это нормально, так сейчас работает индустрия.

«Малая» — это относительно

Несмотря на скромное имя, Inkling Small не побежит на ноутбуке. Требования к железу остаются суровыми: стандартный BF16-чекпоинт требует минимум 600 ГБ совокупной памяти GPU. Это, как пишут разработчики, либо 4x NVIDIA B300, либо 8x NVIDIA H200. Квантованная версия NVFP4 снижает планку примерно до 180 ГБ и позволяет запустить модель на одном B300 или двух H200. Да, это не потребительский уровень. Но для предприятий, у которых есть хоть какой-то парк GPU, разница между 600 и 180 ГБ — это пропасть. Модель, которая выдает почти флагманские результаты при радикально меньших затратах на хостинг, упрощает планирование мощностей и делает self-hosting доступным гораздо более широкому кругу компаний. По сути, Thinking Machines предлагает рынку очень элегантную развилку: платить за 975-миллиардного монстра или получить почти то же самое за четверть ресурсов. Бенчмарки показывают, что для большинства практических задач выбор очевиден. Но о высокой фактологической точности в таком случае придется позаботиться самостоятельно.

Внутри Inkling Small: архитектура, мультимодальность и практическое развертывание

Главный трюк Inkling Small спрятан внутри. Это разреженная модель Mixture-of-Experts: 42 слоя, 256 экспертов, но каждый токен активирует лишь шестерых из них. Плюс два общих эксперта, которые дежурят без выходных. Именно так возникает разница между 276 млрд общих параметров и 12 млрд активных: модель хранит огромный багаж знаний, но при обработке каждого токена будит только нужную часть.

Такая схема — не просто способ набить цифры в маркетинговых материалах. Она напрямую влияет на стоимость инференса и требования к железу. Чем меньше активных параметров — тем быстрее и дешевле каждый запрос. При этом модель остаётся «умной», потому что в её распоряжении весь пул экспертов, просто они не работают одновременно.

Мультимодальность здесь тоже решена без костылей. Текст, изображения и аудио проецируются в единое представление и обрабатываются общим декодером. Никаких отдельных внешних систем для распознавания картинок или звука — всё варится в одном котле. Это упрощает пайплайн и снижает задержки при работе со смешанными данными.

Ещё одна приятная мелочь — переменное reasoning effort. Разработчик сам решает, сколько вычислительных мощностей потратить на ответ. Простые задачи можно гонять на минимальном тестовом времени, сложные — на максимальном. Получается прямой рычаг управления балансом между качеством, скоростью и бюджетом.

Цены на запуске: полцены за входной билет

Thinking Machines явно хочет, чтобы новую модель попробовали как можно скорее. При запуске действует скидка 50% на API. Стандартный вариант с контекстом на 64K токенов обойдётся в $0.58 за миллион prefill-токенов, $1.44 за миллион сгенерированных токенов и $1.73 за миллион токенов при обучении. Кэшированный prefill — всего $0.116 за миллион. Для тех, кому нужно больше контекста, есть вариант на 256K токенов, но по более высоким тарифам.

«Маленькая» модель, которой нужен дата-центр

Несмотря на название, на ноутбуке Inkling Small не запустится. Стандартный чекпоинт в формате BF16 требует минимум 600 ГБ видеопамяти. Официально поддерживаются связки из 4× NVIDIA B300 или 8× NVIDIA H200. Квантованная версия NVFP4 снижает аппетиты до 180 ГБ — тогда хватит одного B300 в режиме W4A4 или двух H200 в режиме W4A16. Обычные игровые ПК, MacBook и даже большинство рабочих станций остаются за бортом. Целевые сценарии — серверные GPU, облачные кластеры и специализированные инференс-провайдеры.

Но по сравнению с флагманом, которому нужно в разы больше ресурсов, Inkling Small выглядит уже почти дружелюбно. Вместо восьми топовых ускорителей — четыре, а с квантованием и вовсе пара. Развертывание заметно дешевле, а значит, модель становится доступной организациям, у которых нет целого дата-центра. «Маленькая» — очень относительное понятие.

Открытая лицензия и воспроизводимый конвейер: почему это важно для бизнеса

Лицензия, под которой распространяется модель, для бизнеса зачастую важнее, чем сухие цифры бенчмарков. Здесь у Thinking Machines всё сделано по-умному: Inkling Small вышла под Apache 2.0 — одной из самых разрешительных лицензий в индустрии. Компании могут свободно использовать, модифицировать, распространять и коммерциализировать модель внутри собственных продуктов, не выпрашивая особых условий. Достаточно соблюдать требования по уведомлению и атрибуции.

На фоне конкурентов этот шаг выглядит особенно контрастно. Взять хотя бы Moonshot: свой фронтирный Kimi K3 она недавно выложила под кастомной «открытой» лицензией с кучей дополнительных коммерческих условий. Формально веса доступны, а по факту юридическому отделу придётся разбирать мелкий шрифт неделями. Apache 2.0 избавляет от этой головной боли и упрощает как правовое, так и продуктовое внедрение. Для юридических, закупочных и платформенных команд это ощутимая разница.

Рутина, а не магия

Показательно и то, как спокойно в Thinking Machines отнеслись к собственному релизу. Исследователь Horace He в своём посте в соцсети X пошутил, что если для выпуска оригинальной Inkling потребовалась «целая деревня», то Inkling Small стала рутинной задачей: взяли готовый конвейер, подали на вход модель поменьше — и готово. При этом он добавил, что новая модель неплохо выиграла от улучшений в предобучении, изменений в ML-рецепте и дистилляции по сравнению с флагманом.

Мира Мурати, в свою очередь, подчеркнула: Inkling Small сравнима с Inkling при четверти размера, а веса открыты и сразу доступны для тонкой настройки через Tinker API. За этим стоит конкретная инженерная работа. Модель получила улучшенную предобучающую смесь данных, on-policy дистилляцию, где старшая Inkling выступила учителем, и две недели дополнительного reinforcement learning для агентного кодинга.

Инфраструктура под ключ

С точки зрения внедрения у бизнеса появляется выбор. Полные веса в форматах BF16 и NVFP4 уже лежат на Hugging Face, а среди поддерживаемых инструментов — SGLang, vLLM, TokenSpeed, Unsloth и нативный инструментарий Hugging Face. Развернуть модель можно через API, заняться тонкой настройкой в Tinker, обратиться к стороннему инференс-провайдеру или поднять всё на собственной инфраструктуре.

Но главное — сам факт такого релиза. Он показывает, что Thinking Machines выстроила воспроизводимый конвейер для производства open-weight мультимодальных моделей, а не выпустила разовый исследовательский проект. Две недели между анонсами флагмана и его уменьшенной версии — это темп, который заставляет конкурентов нервничать. И в этой гонке Apache 2.0 даёт компании дополнительное преимущество: бизнесу проще принять открытую модель, когда лицензия предсказуема и понятна.

Заметно, как рынок больших языковых моделей меняет приоритеты. Соревнование идёт уже не столько за «самый большой», сколько за «самый удобный и быстрый в интеграции». Inkling Small — отличный пример того, как можно срезать требования к железу, почти не потеряв в качестве, и при этом обойтись без лицензионных сюрпризов. Посмотрим, что Thinking Machines выкатит через пару недель — а в том, что выкатит, сомнений всё меньше.

Справка по теме (FAQ)
Что такое Inkling Small и почему она называется Small, если у неё 276 млрд параметров?
Inkling Small — это разреженная Mixture-of-Experts модель от Thinking Machines. Всего параметров действительно 276 млрд, но на обработку одного токена активируется лишь 12 млрд. «Маленькой» она называется по сравнению с флагманом Inkling, у которого 975 млрд суммарных параметров и 41 млрд активных.
Под какой лицензией выпущена Inkling Small и можно ли использовать её в коммерческих продуктах?
Модель распространяется под лицензией Apache 2.0. Она позволяет свободно использовать, модифицировать, распространять и коммерциализировать модель, в том числе в составе проприетарного ПО. Главное — соблюдать требования по уведомлению и атрибуции.
На каком оборудовании можно запустить Inkling Small?
В полной точности BF16 модели потребуется минимум 600 ГБ совокупной памяти GPU. Thinking Machines рекомендует конфигурации из четырех NVIDIA B300 или восьми NVIDIA H200. Квантованная версия NVFP4 укладывается примерно в 180 ГБ и может работать на одной B300 (режим W4A4) или двух H200 (режим W4A16). Потребительские ПК и ноутбуки не подходят.
Сколько стоит API Inkling Small?
На старте действует скидка 50%. Для стандартной версии с 64K-контекстом prefill стоит $0.58 за миллион токенов, выходные токены — $1.44, тренировочные — $1.73. Кэшированные prefill-запросы оцениваются в $0.116 за миллион токенов. Также доступен вариант с 256K-контекстом по более высоким тарифам.