Назад в ленту

Роутинг enterprise AI: борьба подходов между Snowflake, Databricks и OpenRouter

Как автоматическая маршрутизация запросов меняет экономику корпоративных ИИ-агентов и кто liderирует на этом рынке

Корпоративный ИИ вырос из демонстрационных прототипов в реальную инфраструктуру, но вместе с этим пришел и суровый урок: запуск тысяч агентов разоряет бюджеты так же быстро, как и приносит выгоду. Проблема «одна модель на всё» давно победила попытки экономии на промптах. Простые вопросы больше не должны обслуживаться мощностями Claude Opus или GPT-4, ради которых приходится платить по ставке премиум-класса.

Ведущие игроки рынка — от Snowflake до Databricks и NVIDIA — переформатируют подход к архитектуре ИИ, внедряя динамический роутинг и новые пласты управления. Но ключевой вопрос сегодня смещается из плоскости «как снизить цену токена» в область «кто и при каких условиях имеет доступ к этим данным». Рассказываем, как open source-хабы экономят до 75% на выполнении задач и зачем крупному бизнесу перестраивать whole governance stack под новые реалии.

TrueForge от TrueFoundry: open source-хаб для AI-агентов с экономией до 75%

Сан-Францисский B2B-стартап TrueFoundry, основанный в 2021 году бывшими инженерами Meta*, выкатил в open source собственный хаб для AI-агентов под названием TrueForge. Лицензия — MIT, то есть бери, форкай, модифицируй, засовывай в коммерческие продукты. Никаких ограничений. И это не очередная игрушка для пет-проектов, а инструмент, который разработчики могут гонять в проде.

Главная заявка компании звучит дерзко: TrueForge выполняет задачи на 30–75% дешевле, чем Claude Managed Agents от Anthropic. Цифры взяты не с потолка. На бенчмарке DevRev Enterprise-Bench, который тестирует многошаговое использование инструментов в CRM, системах тикетов и документообороте, TrueForge в связке с open source моделью GLM-5.2 закрыл 11 из 14 задач за $2.90. Тот же результат с Claude Managed Agents на Claude Opus 4.8 стоил $11.80. Экономия — 75%. Если же сравнивать хабы на одинаковой модели Opus 4.8, разница скромнее, но всё равно ощутимая: $8.50 против $11.80, около 30%.

Context engineering как способ не жечь деньги

Секрет экономии кроется не в магии, а в архитектуре. Ядро TrueForge — контекст-инжиниринг: контроль того, сколько информации уходит обратно в модель на каждом шаге. Схемы MCP-инструментов не грузятся до тех пор, пока они реально не понадобятся. Изолированные задачи делегируются субагентам. Раздутые результаты инструментов складываются в файлы, а не пихаются в активное окно контекста. Структурированные ответы обрабатываются кодом. А длинные диалоги автоматически компактифицируются — порог по умолчанию 50 000 токенов, но его можно менять под конкретного агента.

Отдельная фишка — sandbox-as-a-tool. В отличие от рантаймов, которые держат агента в изолированной среде на протяжении всей работы, TrueForge поднимает sandbox только тогда, когда агенту нужно выполнить код или поработать с файлами. Основной цикл агента остаётся на сервере TrueForge. Это снижает расход вычислительных ресурсов и позволяет серверу гонять больше агентов параллельно.

От локального запуска до продакшена

Развёртывание гибкое. На машине разработчика — одна команда и SQLite. Для продакшена — Docker Compose или Helm с Postgres и Redis. Правда, TrueFoundry прямо предупреждает: локальная конфигурация предназначена только для девелоперской машины, а не как интернет-facing сервис. Логично.

COO TrueFoundry Анураг Гутгутия в разговоре с VentureBeat подчеркнул, что TrueForge — не замена существующим хабам. «Люди будут использовать его наряду с облачными и коммерческими решениями, — пояснил он. — Это vendor-neutral способ запуска управляемых агентов, и он обходится дешевле». Позиция честная: не война с Anthropic, а ещё один вариант для тех, кто хочет контроля и гибкости.

Open source — не значит governed

Тут кроется важный нюанс для enterprise-покупателей. Сам по себе open source TrueForge не наследует политики доступа организации. Если запускать его голым, придётся встраивать собственные контроли внутри или перед ним. Другое дело — связка с коммерческим AI Gateway от TrueFoundry. В этом случае агенты получают готовые SSO, identity providers и гранулярные разрешения, которые уже привязаны к моделям, MCP-серверам, инструментам и другим агентам.

Стратегия TrueFoundry вырисовывается чётко: AI Gateway остаётся единым слоем управления — маршрутизация, аутентификация, доступы, бюджеты, observability, guardrails. TrueForge работает поверх этого шлюза как рантайм для самих агентов. Гутгутия формулирует просто: «Весь трафик всё равно должен течь через наш шлюз».

Бета-пользователи уже опробовали связку. NetApp использовала технологию для инцидент-респонса и быстрого triage тикетов, а также превратила внутренних агентов в self-service инструменты для разработчиков. Automattic — ещё один ранний пользователь.

Финансово у стартапа всё стабильно. Около $21 млн привлечённых инвестиций, из них $19 млн — раунд Series A в феврале 2025 года под руководством Intel Capital при участии Eniac Ventures, Peak XV Surge, Jump Capital и ангелов вроде Гокула Раджарама и Мохита Арона. По данным на январь 2026 года у TrueFoundry более 30 платящих клиентов, ARR перевалил за $1.5 млн, а через AI Gateway проходит свыше 10 млрд запросов в месяц. Среди клиентов — NetApp, Siemens Healthineers, ResMed, Automation Anywhere, Nvidia, Games24x7 и Synopsys.

TrueFoundry не пытается изобрести велосипед заново — они строят слой, который уже работает в проде у крупных компаний, и теперь отдают рантайм агентов в open source. Если модель «бесплатный хаб, платный шлюз» сработает, это будет красивая иллюстрация того, как open source продаёт enterprise-инфраструктуру без агрессивного маркетинга.

Snowflake Cortex AI Gateway: динамический роутинг моделей для экономии до 3x

Enterprise-команды, разгоняющие AI-агентов до промышленных масштабов, быстро упираются в неприятную истину: одна модель на все случаи жизни работает отвратительно. Либо слишком дорогая для тривиальных запросов, либо слишком тупая для сложных. Snowflake решил, что хватит это терпеть — в Cortex AI Gateway появился динамический роутинг моделей, который сам выбирает, кто будет отвечать на каждый конкретный запрос.

Внутренние тесты компании показали сокращение расходов на токены до 3x. Выяснилась до боли знакомая картина: простые вопросы раз за разом улетали к самой мощной и самой дорогой модели. Ответ получался быстрым, но счёт — разорительным. Теперь вместо фиксированного выбора система маршрутизирует каждую задачу туда, где баланс качества и стоимости оптимален.

Как это устроено

Под капотом работают два механизма. Первый — advisor pattern: маленькая модель первой пытается справиться с задачей. Не вышло? Она вызывает более крупную модель как инструмент и продолжает работу с того места, где застряла. Второй — классификатор, натренированный на истории запросов. Он автоматически отправляет прямолинейные вопросы к более дешёвым моделям, не дожидаясь, пока кто-то вручную переключит тумблер.

При этом никто не отбирает у клиентов ручное управление. Можно прибить выбор модели намертво — pin-to-model — или задать диапазон, внутри которого auto routing будет метаться. Система работает строго в этих границах, не выпрыгивая за них ради сиюминутной экономии.

Отдельной платы за сам роутинг нет. Тарификация строится исключительно на токенах, поэтому переход на более дешёвую модель напрямую режет счёт. Никаких скрытых комиссий за «интеллектуальное решение», куда отправить запрос.

Governance привязан к задаче, а не только к данным

Snowflake увязывает роутинг с теми же механизмами контроля доступа, что уже работают на уровне данных. Role-based access стартует с данных, затем маппинг ролей на пулы одобренных моделей, а поверх — ограничение привилегий агентов относительно пользователя. Агент может получить более узкие права, чем человек, который его запустил. Звучит логично, но на практике такое встречается реже, чем хотелось бы.

Весь инференс — и open, и proprietary модели — остаётся внутри security boundary Snowflake. Ничего не уходит наружу к сторонним провайдерам. Открытые модели, включая DeepSeek-V4-Flash и GLM-5.3 китайского происхождения, могут работать из региона клиента, что закрывает вопросы data residency.

Приобретение Natoma добавило ещё один слой: более 100 MCP-коннекторов со scoped и governed доступом. Агенту можно выдать read-only к email, а не широкие права на всё подряд. Мелочь, но именно из таких мелочей складывается доверие к агентным системам.

Контекст решает

Отдельная тема — контекст. Инструменты Horizon Context и Cortex Sense позволяют заранее упаковать контекст и память агента, устраняя exploratory step. Без хорошего контекста модель вынуждена сама исследовать данные, писать и тестировать SQL, натыкаться на ошибки и перезапускать процесс. Это дорого и требует мощной модели. Если контекст подготовлен заранее, с той же задачей справляется более простая и дешёвая модель.

Память агента тоже вшивается в этот процесс. По мере использования она обновляется и подмешивается в будущие запросы. Система не решает одну и ту же проблему с нуля каждый раз — и это ещё один источник экономии, который не виден в прайс-листе.

Динамический роутинг в Cortex AI — это не просто «подешевле переключить». Это попытка встроить экономику в саму логику работы агентов, не жертвуя контролем и безопасностью. Получилось ли у Snowflake переизобрести колесо или просто догнать рынок — покажет время, но направление выбрано верное.

Рынок enterprise AI-роутеров: конкуренция подходов и модель governancы

Роутинг моделей перестает быть экзотикой и превращается в обязательный стандарт для крупного бизнеса. Пока одни решают проблему стоимости execution, другие строят инфраструктуру для маршрутизации трафика. Databricks представила Smart Routing в своем Unity AI Gateway, крупные гиперскейлеры — AWS и Google Cloud — анонсировали собственные решения, а Nvidia 11 августа выкатила технологический слой Switchyard для автоматического выбора оптимальной модели.

На этом фоне выделяется OpenRouter — платформа, которую позиционируют как наиболее известное нейтральное решение. Их козырь — максимальная широта охвата моделей и полное отсутствие привязки к одному вендору. Однако аналитики указывают, что для энтерпрайза одного выбора модели мало. Эксперт Sanjeev Mohan (SanjMo) отмечает: Snowflake продаёт не сам роутинг, а роутинг, который never leaves governed data boundary — то есть запросы остаются внутри системы контроля доступа, тегирования и атрибуции затрат.

Рынок разделился на три четких лагеря. Первый — Databricks. Их подход строится на governance, исходящей из data engineering и ML lineage, где контроль обеспечивает Unity Catalog над данными, моделями и пайплайнами.

Три лагеря на поле роутеров

Второй лагерь — Snowflake. Здесь governance исходит от аналитики и контроля доступа, с фокусом на атрибуцию использования по бизнес-подразделениям. Для клиентской базы, уже центрированной вокруг сноуфлейк, ценность представляет именно интраплатформенный роутинг, который уважает существующую модель доступа и корректно распределяет счета по cost centers.

Третий сегмент — neutral gateways, куда входят OpenRouter, LiteLLM, Portkey и Azure AI Foundry. Эти решения конкурируют за breadth моделей и минимизацию vendor lock-in.

Ручной выбор модели теперь становится liabilities для маржи, когда масштаб достигает сотен агентов. Чтобы не ошибиться с выбором, оценку нужно начинать не с списка фич роутера, а с того, какая модель governance уже соответствует вашему data estate, и насколько ваш бизнес подвержен рискам роста затрат на inference.

Командам, ориентированным на lineage, выгоднее строить шлюз вокруг существующей системы управления метаданными, тогда как multi-platform проектам подойдет именно нейтральный gateway, способный работать с любой базой без привязки к вендору.

Инфраструктура для корпоративных агентов проходит период становления, в котором побеждает не самый быстрый маршрутизатор, а тот, кто лучше всего интегрируется с существующими контурами безопасности компании. Эра ручного контроля над кластером из сотен моделей завершается — наступило время интеллектуального роутинга и жесткого compliance. Будем следить за тем, как эти технологии будут эволюционировать в следующих релизах.

Справка по теме (FAQ)
Что такое динамический роутинг моделей и зачем он нужен?
Это технология, при которой система автоматически выбирает оптимальную AI-модель для каждого конкретного запроса, вместо того чтобы отправлять все задачи через один дорогой endpoint. Это позволяет направлять простые вопросы на дешевые и быстрые модели, а сложные — на мощные, значительно экономя бюджет компании.
Какие платформы предлагают аналоги роутинга?
Помимо Snowflake Cortex AI Gateway, аналоги анонсировали Databricks (Smart Routing), AWS, Google Cloud и Nvidia (технология Switchyard, представленная 11 августа). Также на рынке присутствует OpenRouter — платформа, позиционирующая себя как нейтральный aggregator моделей без вендорской привязки.
Есть ли дополнительная плата за использование систем роутинга?
По словам представителей Snowflake, отдельной платы за сам механизм маршрутизации нет. Тарификация строится исключительно на потребленных токенах. Если запрос перенаправляется на более дешевую модель, пользователь оплачивает только их стоимость, получая прямую экономию без скрытых комиссий за функцию.
В чем ключевое отличие подхода Snowflake от нейтральных шлюзов?
Главное отличие заключается в том, что роутинг Snowflake никогда не покидает границы governed data boundary. Запросы остаются внутри системы с уже настроенным контролем доступа, тегированием и атрибуцией затрат по подразделениям, тогда как нейтральные шлюзы часто делают упор на максимальную свободу выбора модели с меньшей степенью встроенной корпоративной безопасности.
* Деятельность организации «Компания Meta (социальные сети Instagram и Facebook)» признана экстремистской и запрещена в РФ.