Назад в ленту

Корпоративная ИИ-инфраструктура: почему бизнес покупает скорость, оставаясь слепым к стоимости

Рассказываем, как предприятия выбирают платформы для ИИ, почему GPU простаивают и что ждет индустрию на следующем рубеже — памяти моделей.

Корпорации скупают ИИ-ускорители пачками, но почти никто не может посчитать, во что это обходится. Опроса на 170 предприятий хватило, чтобы увидеть: ИИ уже переехал из лабораторий в продакшн, а финансовая дисциплина за ним не поспевает. Компании выбирают поставщиков по скорости и доступности железа, отодвигая цену на второй план — и это приводит к букету парадоксов.

Этот материал — о том, как устроена корпоративная ИИ-инфраструктура в 2026-м: что считают главным, почему GPU простаивают, зачем бизнес заглядывается на «неоклауды» и какой сюрприз готовит память моделей.

Производственный ИИ и текущий стек платформ

Продакшен вместо пилотов

Цифры из свежего опроса, охватившего 170 предприятий со штатом свыше 100 человек, заставляют окончательно похоронить миф об ИИ как игрушке для гиков. Исследование проводилось в июле 2026 года, и его результаты выглядят как приговор эпохе пилотов: 66% компаний уже вывели AI-нагрузки в продакшен, а 29% работают в масштабе. При этом почти треть (30%) все еще топчется на стадии proof-of-concept, и лишь 4% честно признаются: мы даже не начинали. И это, заметьте, не стартапы, а вполне взрослые организации с сотнями сотрудников.

Занятно, что «масштаб» здесь не синоним «везде». Даже в такой продвинутой выборке находится место для пилотов и сомневающихся. Но общая картина однозначна: решения по инфраструктуре принимаются уже не для красивых демо на конференциях, а под живые нагрузки и реальные бизнес-задачи.

Три платформы на нос: как устроен ИИ-стек

Среднее предприятие сегодня несет на себе сразу три инфраструктурные платформы для ИИ. Это не жадность, а суровая необходимость: ни один вендор не способен закрыть все потребности разом. Четверка лидеров — OpenAI (49%), Google Gemini (48%), Microsoft Azure (47%) и Google Cloud (42%) — встречается примерно у половины опрошенных. Модель-провайдеры и облака при этом сосуществуют довольно мирно, деля зоны ответственности.

А вот если попросить респондентов выбрать главную платформу, начинается самое интересное. Microsoft Azure уверенно забирает пальму первенства с 26%, Google Cloud довольствуется вторым местом и 19%. При этом суммируйте доли OpenAI, Gemini и Anthropic — вместе они набирают 35% и формально обходят Azure в одиночку. Но если сложить всех «облачников» (Azure + Google Cloud = 45%), то модель-провайдеры остаются позади. Иными словами, предприятия предпочитают держать инфраструктуру под своим контролем, а модели использовать как инструмент. По крайней мере, пока.

Скорость и надёжность против цены: критерии выбора и метрики успеха

Скорость как религия

Это не случайный сдвиг, а осознанная позиция команд, у которых прод это горит. Когда за плечами живые AI-нагрузки, а не пилотный проект, хочется, чтобы всё просто работало и быстро шевелилось. Отсюда и спрос на мелочи: мелкозернистое автокалибрование привлекает 18% при выборе подрядчика, а стоимость за миллион токенов вообще интересует лишь 16%. Последний пункт, кстати, еще недавно был куда более весомым аргументом в этом сериале опросов — теперь он скромно замыкает список.

Логика успеха ровно такая же. Аптайм и надежность стали главной метрикой успеха для 51% предприятий. Продуктивность разработчиков и скорость деплоя волнует 39%. И только потом, с 31%, идет пресловутая цена за токены. Ритм жизни такой: сначала проверь, что система не упала, потом посчитай, не разорилась ли ты на этом.

Парадокс цены

И вот тут начинается самое смешное и одновременно грустное. Компании оценивают собственную инфраструктуру в целом на крепкие 4,14 из 5, легкость внедрения — на 4,04. Но как только доходит до графы «ценность за деньги», оценка проседает до 3,87. Это самый низкий показатель среди всех критериев.

Казалось бы, классика: все хотят быстро, но не хотят платить. Однако загвоздка в том, что эти же компании понятия не имеют, сколько они на самом деле платят. Менее половины из них способны строго отследить, во что им обходится AI-вычисления. Так что низкая оценка «ценности за деньги» — это не приговор экономике, а крик души людей, которые подозревают, что переплачивают, но не могут это проверить. Слепая вера в скорость — дорогое удовольствие, особенно когда не видишь чека.

Утилизация GPU: почему большинство работает вполсилы

Есть старая поговорка: купить дорогую видеокарту и играть на ней в «Сапёра». Корпоративный мир ИИ довёл эту идею до абсолюта. Только вместо видеокарты здесь — целые стойки с ускорителями за миллионы долларов, а вместо «Сапёра» — нейросети, которые могли бы работать в два раза быстрее, но простаивают.

Цифры из свежего опроса VentureBeat Pulse Research отрезвляют. Среди 155 предприятий, держащих собственные GPU, 69% загружают свои мощности максимум на половину. А 26% операторов — это уже совсем беда: их ускорители работают на 25% или ниже. Если бы конвейер на заводе работал с такой эффективностью, его бы остановили и уволили начальника смены. В ИИ-инфраструктуре это почему-то называют «нормальной эксплуатацией».

Масштаб не спасает

Логично предположить: чем крупнее компания и чем дольше она гоняет ИИ в продакшене, тем лучше выжимает из железа. Так вот — нет. Среди тех, кто запустил AI-нагрузки в масштабе, рубеж в 50% утилизации преодолевают 22%. В среднем по выборке — 23%. Разница — статистическая погрешность, а не закономерность. Просто у одних простаивает чуть меньше, у других чуть больше.

Хуже того, 12% операторов вообще не измеряют загрузку GPU. Вообще никак. Ни телеметрии, ни дашбордов, ни даже примерных прикидок. Ускорители, которые стоят как квартира в Москве, работают в чёрную. И это никого не смущает до тех пор, пока не приходит счёт за электричество или не падает производительность.

Существует распространённый вопрос: GPU Utilization — что это такое и почему этот параметр так важен? Ответ простой: это доля времени, когда графические процессоры реально заняты вычислениями, а не ждут данные или задачи. Именно этот показатель сейчас обнажает главную проблему индустрии — железо покупают охотно, а эффективно использовать его не умеют.

Бухгалтерия разводит руками

Дальше — веселее. Только 47% предприятий строго отслеживают стоимость и возврат своих AI-вычислений. Остальные считают кое-как, не могут посчитать вовсе или честно признаются, что им не до этого. Даже среди компаний, работающих в масштабе, картина лучше лишь незначительно: там точный учёт ведут 56%. То есть почти половина самых продвинутых игроков рынка не знает, окупаются ли их миллионы, влитые в GPU.

Это идеальный шторм. Железо закупают за большие деньги, но в упор не видят, во что оно обходится на самом деле. Утилизация не измеряется, затраты не считаются, и экономика ИИ остаётся «невидимой». Пока эта слепота сохраняется, простой GPU будет восприниматься как норма — просто потому, что никто не знает, сколько денег он сжигает впустую. Но если в дата-центрах простаивают целые стойки, а бухгалтерия при этом разводит руками — значит, индустрия просто выбрасывает деньги в системный блок.

Специализированные облака и намерения переключения провайдеров

Инфраструктурный рынок лихорадит. Согласно свежему опросу VentureBeat, 62% предприятий планируют сменить или добавить провайдера в течение 12 месяцев, а 29% нацелены на ближайший квартал. Казалось бы, сейчас самое время для новых нишевых облаков, чтобы отхватить жирный кусок. Но не тут-то было.

В списке приоритетов AI-специализированные облака действительно лидируют — их собираются оценивать 44% респондентов. Следом идут не-NVIDIA ускорители (39%) и следующее поколение чипов от NVIDIA (25%). Только вот реальное освоение этих самых специализированных облаков пока что измеряется процентами с запятой: CoreWeave и Lambda набрали всего по 3,5% присутствия в стеках, а как основную платформу их выбирает лишь 1% предприятий. Самый широкий разрыв между планами и фактом в этом исследовании.

Импульс налицо, но сдвига нет

А теперь самое интересное. Чистый импульс — то есть разница между теми, кто планирует расширяться, и теми, кто собирается сокращаться — у специализированных облаков максимальный: +36. 42% заявили, что будут наращивать их использование, против 6% желающих отказаться. Неплохо себя чувствуют inference API (+34) и гиперскейлеры (+30). А вот on-prem и colocation стали единственной категорией с ощутимым бегством: 22% активно сокращают собственные мощности.

Но когда доходит до конкретных решений о смене провайдера, в фаворитах оказываются те, кто и так уже на плаву. OpenAI и Google Cloud набрали по 29%, Azure — 28%, Gemini — 25%. Нишевые игроки вроде той же Lambda в этом списке даже близко не стоят. Видимо, предприятие, которое уже живет в экосистеме Microsoft или Google, не горит желанием переезжать ради одной лишь рекламы неоклаудов.

Отдельный нюанс — 13% компаний предпочитают собирать собственный open-source стек, а 9% вообще крутят частные GPU-кластеры. Вместе это больше, чем весь сектор специализированных облаков. Похоже, недоверие к новым провайдерам настолько велико, что проще построить свое.

Итог: рынок хочет перемен, но на деле выбирает старых знакомых. Может, неоклауды действительно совершат рывок в следующем году — но пока что исследование фиксирует лишь красивый анонс, а не реальную миграцию.

Память и KV-кэш: следующий рубеж инфраструктуры ИИ

Пока весь рынок меряется терафлопсами, на горизонте уже вырастает проблема посерьезнее — память. В масштабном инференсе узким местом все чаще становится не GPU, а объем KV-кэша — того самого «блокнота», в котором модель хранит историю разговора. Чем длиннее контекст, тем прожорливее этот блокнот, и со временем именно он начинает диктовать стоимость вычислений.

Кто уже делит этот новый рынок

Пока одни компании все еще присматриваются, другие уже делят поле. Dell — лидер с 24%, Nvidia дышит в спину с 21%. Дальше начинается разброд: 12% респондентов изучают open-source-инструменты, еще 11% делают ставку на эффективность самих моделей — методы вроде MLA и квантизации, которые сокращают аппетит к памяти. Оставшийся длинный хвост — это вендоры систем хранения, каждый из которых пока собирает лишь единицы процентов.

Показательная деталь: примерно каждый пятый (19%) либо вообще не видит проблемы (7%), либо еще не начал ее решать (12%). Это значит, что рынок только формируется — даже у лидеров нет и половины голосов, а решения, которые определят стоимость инференса завтра, фактически остаются вакансией.

В гонке за вычислительной мощностью самое ценное — не скорость покупок, а умение считать. Компании уже освоили роль операторов ИИ, но роль бухгалтеров им только предстоит выучить. И когда эра ограничений по памяти постучит в дверь, станет особенно хорошо видно, кто из «гонщиков» на самом деле следил за спидометром, а кто просто держал педаль в пол.

Справка по теме (FAQ)
Почему компании не могут точно посчитать стоимость ИИ-инфраструктуры?
Только 47% предприятий строго отслеживают, сколько стоят их AI-вычисления и какой возврат они дают. У 39% учет частичный, 15% пока вообще не могут оценить затраты, а 6% не считают это приоритетом. Даже среди компаний, которые уже запустили ИИ в продакшн в масштабе, точный учет есть лишь у 56%.
Что важнее всего при выборе ИИ-провайдера?
Главный критерий — интеграция с существующим стеком: ее назвали 40%. На втором месте производительность (35%), на третьем — доступность GPU (24%). Полная стоимость владения набрала лишь 22%, а стоимость за миллион токенов — 16%.
Почему KV-кэш стал новой проблемой для инференса?
KV-кэш — это память, в которой модель хранит контекст диалога. При росте контекста она становится дороже самих вычислений и превращается в узкое место. Сейчас решения для этой задачи ищут Dell (24%) и Nvidia (21%), а 19% компаний пока не признают или не решают проблему.
Куда компании планируют переезжать с ИИ-нагрузками?
62% предприятий собираются сменить или добавить провайдера в течение года. Чаще всего присматриваются к специализированным AI-облакам (44%), хотя реально используют их лишь единицы — у CoreWeave и Lambda по 3,5% внедрений.