Свежий опрос VB Pulse показывает парадоксальную стратегию: автоматизация релизов идёт рука об руку с ростом инвестиций в человеческий контроль.
Представьте: ваш ИИ-агент блестяще проходит все внутренние тесты, получает зелёный свет — и через неделю выставляет клиенту счёт на миллион за услугу, которую тот не заказывал. Знакомая история? Судя по свежим данным VB Pulse, с ней столкнулась почти половина опрошенных компаний.
Но самое интересное — реакция. Вместо того чтобы затормозить автоматизацию, пострадавшие предприятия, наоборот, ускоряются. Убирают людей из релизных чекпоинтов, наращивают бюджеты на ИИ-надёжность и перекраивают сам подход к проверкам. Парадокс? Ещё какой.
Методология и ключевой парадокс июльского опроса
Июльская волна VB Pulse принесла цифры, которые заставляют задуматься о природе корпоративного оптимизма. Опрос предприятий охватил 108 респондентов из компаний с персоналом от 100 человек, тогда как в июне их было 157. Сокращение выборки — не единственный нюанс. Большинство опрошенных (69%) называют себя финальными лицами, принимающими решения о закупках ИИ, или теми, кто влияет на эти решения. При этом 63% — компании со штатом от 100 до 2499 сотрудников. Средний бизнес, который уже обжегся на агентах, продолжает наступать на грабли.
Выборка самоотбирающаяся, а не вероятностная. Сравнения «пострадавших» и «не пострадавших» опираются на группы от 41 до 53 респондентов, другие кросс-таблицы — от 40 до 68. Сдвинулась и отраслевая структура: доля ИТ/софтверных компаний упала на 9 процентных пунктов до 14%, зато ритейл и потребительский сектор вырос на 4 пункта до 19%. Это важно: теперь в выборке больше тех, кто ближе к конечному клиенту и быстрее чувствует боль от ошибок.
Рост доверия без роста качества
Доверие к автоматической оценке подскочило с 5% в июне до 13% в июле. Одновременно доля тех, кто называет плохое соответствие тестов реальным результатам главной проблемой, упала с 29% до 19%. Казалось бы, всё отлично: люди поверили в инструменты и перестали жаловаться. Но есть нюанс.
При этом 49% заявили, что прошедший внутренние проверки ИИ-агент или LLM-функция затем создали проблему, видимую клиентам. Почти без изменений с 50% в июне. А 24% сталкивались с этим более одного раза. То есть инциденты ИИ-агентов никуда не делись. Просто компании стали спокойнее к ним относиться.
Самый показательный разрыв — внутри июльских данных. Среди компаний с инцидентом лишь 4% полностью доверяют автоматическим проверкам. Среди компаний без инцидентов — 24%. Разница в шесть раз. Логично: те, кто видел провал тестирования вживую, скептичнее. Но вот что странно: 10 из 41 предприятия без выявленных промахов тестирования полностью доверяют автоматизации. Среди 53 ранее пострадавших — только 2.
Исследование фиксирует растущий разрыв между уверенностью в слое оценки и доказательствами, что этот слой становится лучше в предотвращении сбоев. Проще говоря: все дружно поверили в автоматические проверки, хотя реальная частота провалов не изменилась. Классический случай, когда оптимизм опережает факты.
После провала компании быстрее убирают человека из релизного контура
Парадокс июльского опроса VentureBeat выглядит как сюжет из плохой антиутопии. В целом 67% опрошенных либо уже разрешают ИИ-агентам пушить код и менять системы без участия человека, либо готовятся к этому в течение года. 37% делают это прямо сейчас в низкорисковых сценариях, ещё 30% достраивают пайплайны. Казалось бы, логика железная: сначала поймай баги, потом убирай человека. Но реальность переворачивает сценарий с ног на голову.
Среди компаний, которых ИИ-агент уже подвёл перед заказчиком, 85% ускоряют переход к полностью автоматизированному деплою. Без оглядки на собственный негативный опыт. Для сравнения: среди тех, кто с инцидентами не сталкивался, таких «смельчаков» лишь 61%. Разница в 24 процентных пункта — и она совершенно не в пользу здравого смысла.
Безрассудство или зрелость?
Опрос не даёт однозначного ответа. С одной стороны, 11% пострадавших наотрез отказываются от сквозной автоматизации против 24% непострадавших. С другой — у тех, кто уже обжёгся, инфраструктура для автоматического развёртывания попросту лучше развита. Они запускают больше агентов, чаще ловят ошибки, но и имеют больше ресурсов, чтобы продолжать запуски без человека. Это не всегда глупость. Иногда — это суровая производственная необходимость.
Бен Хайлак, технический директор Raindrop.ai, формулирует происходящее без дипломатических реверансов: «Мы наблюдаем великий упадок eval-подходов в привычном виде. Компании из Fortune 100 сокращают eval-наборы и забивают на их поддержку. Вместо этого они опираются на решения для обнаружения аномалий и проблем — как до, так и после продакшена». Иными словами, священная корова оценки ИИ отправляется на бойню, а вместо неё приходят инструменты мониторинга, которые ловят уже не ошибки в тестах, а сбои в реальном времени.
Если частота отказов на одно развёртывание останется прежней, а объём деплоев продолжит расти, общее число инцидентов неизбежно поползёт вверх. И тогда разница между «пострадавшими» и «непострадавшими» перестанет иметь значение: плохие ответы начнут задевать всех без исключения. Автоматизация развёртывания, задуманная как способ ускорить доставку, рискует превратиться в конвейер по производству непредсказуемости. И ни один человек на чекпоинте уже не остановит этот процесс — просто потому, что его там больше нет.
Продакшен-мониторинг отстаёт: компании проверяют работоспособность, а не правильность ответов
Продакшн-мониторинг отстаёт: компании следят за работоспособностью, а не за смыслом ответов
Пока индустрия увлечённо автоматизирует всё, до чего дотягивается, за кадром остаётся неудобный факт: большинство компаний банально не видит, что именно отвечает их ИИ. Они мониторят задержку, ошибки, стоимость запросов — но не смысл. Не качество. Не корректность. И это не мелочь. Это разница между «агент работает» и «агент правильно отвечает».
26% опрошенных используют inline-проверки качества — автоматических судей и guardrails, которые смотрят на живой трафик и ловят плохие ответы до или сразу после того, как они ушли клиенту. Ещё 26% сидят на транзакционных трассировках: спаны, сырые входы и выходы, использование токенов. Третья группа — 24% — смотрит на gateway-метрики: задержку, ошибки, стоимость. Всё это полезно. Но полезно для ответа на вопрос «система жива?», а не «система права?».
Среди тех, кто уже разрешил развёртывание без человека, только 28% проверяют смысл и корректность живых ответов. Остальные 72% запустили автоматизацию и, по сути, отключили контроль. Это не гипотеза, это данные. И они рисуют картину, от которой аналитику должно быть не по себе.
Разрыв между предрелизной оценкой и продакшн-наблюдаемостью — это не баг, а архитектурная дыра. Оценка отвечает на вопрос «готов ли агент?», мониторинг — на вопрос «что он делает сейчас?». Если второй вопрос не задан, первый ответ ничего не стоит. Потому что тесты прошёл — ещё не значит, что ответ правильный. Это значит, что ответ соответствует каким-то заранее выбранным критериям. А жизнь, как известно, богаче любых критериев.
Те, кто уже обжёгся, начинают понимать: дело не в том, что guardrails плохие. Дело в том, что их не было. Или они были, но не там. Или были, но молчали. А когда система умеет быстро, уверенно и красиво ошибаться — это не сбой, это катастрофа с человеческим лицом.
Продакшн-наблюдаемость в её нынешнем виде — это мониторинг инфраструктуры, а не интеллекта. Она видит, что процессор загружен, память течёт, запросы идут. Она не видит, что ответ неверный, что модель галлюцинирует, что guardrails молчат, а пользователь получил чушь. И пока это так, любые выводы о «надёжности» строятся на песке.
Если ты убрал человека из цикла, но не поставил вместо него автоматизированную семантическую проверку, ты не ускорил надёжность. Ты ускорил неправильные ответы.
Оценка и мониторинг — это два разных инструмента. Один — для старта, второй — для жизни. И если второй отсутствует, первый работает вхолостую. Вот и весь секрет, который июльские данные вытащили наружу. Осталось понять, кто готов его услышать.
---
Продолжение следует — в следующем разделе о том, кто реально управляет процессом, когда человека убирают из контура.
Рынок оценки ИИ: специализированные платформы набирают вес
Рынок оценки ИИ наконец-то перестал притворяться придатком больших языковых моделей. Июльская волна VB Pulse зафиксировала то, о чём шептались инженеры: специализированные платформы оценки ИИ превращаются в самостоятельный слой корпоративного софта. И цифры это подтверждают.
Нативные eval-инструменты и трассировки OpenAI пока удерживают первое место как основная платформа — 18%. Следом дышит в затылок DeepEval от Confident AI с 17%, а замыкает тройку замыкает Braintrust с 15%. Разрыв минимальный, и это уже не «большая тройка с аутсайдерами», а реальная гонка.
Anthropic Claude Console и Workbench застряли на 12%, и ровно столько же — компании, которые вообще не выделили под оценку отдельную платформу. Ещё по 6% делят внутренние инструменты, Promptfoo и LangSmith. Показательно, что доля тех, кто обходится без специализированной платформы, снизилась на 5 процентных пунктов — до 12%. Рынок созревает, «самописцы» уходят в тень.
Главный скачок сделал Braintrust: с 8% в июне до 15% в июле — самый большой прирост, причём статистически значимо. DeepEval тоже подрос — с 12% до 17%. Если смотреть шире, по присутствию в стеках, картина такая: OpenAI native встречается в 31% стеков, DeepEval — в 27%, Braintrust — в 22%, Anthropic native — в 20%, собственные инструменты — в 14%, Weave и Langfuse — по 11%.
Важно не путать: это данные о внедрении, а не оценка производительности продуктов. Но сам факт, что компании массово подключают отдельные инструменты оценки, говорит о структурном сдвиге. Оценка перестала быть галочкой в пайплайне — теперь это отдельный слой корпоративного ПО.
Изменились и критерии выбора. Простота интеграции как решающий фактор взлетела на 12 п.п. — до 39%. Стоимость просела с 28% до 23%, точность оценки — 28%. Средняя оценка удовлетворённости, простоты внедрения и экономической ценности — 3,9 из 5. Покупатели голосуют за то, что можно воткнуть в существующий пайплайн и не мучиться.
Главной метрикой успеха остаётся согласованность оценки — 38%, за ней меньше сбоев и регрессий — 20%. То есть бизнесу важнее, чтобы инструмент давал воспроизводимые результаты, а не просто красивые отчёты.
Намерение сменить платформу тоже охладилось: 56% ожидают добавить или заменить платформу в течение года против 64% в июне. Доля остающихся выросла на 8 п.п. — до 44%. Рынок начал устаканиваться, и это, пожалуй, лучшая новость для всех, кто продаёт инструменты оценки.
Бюджеты и человеческий контроль: автоматизация с подстраховкой
Пока одни компании спорят, доверять ли автоматическим проверкам, другие молча перекраивают бюджеты. Июльский опрос VB Pulse зафиксировал любопытный сдвиг: рабочие процессы с участием людей для проверки едва обошли продакшен-наблюдаемость как самую часто называемую область роста инвестиций — 31% против 30%. Разница в один процентный пункт, но она многое говорит о настроениях.
Автоматизированные пайплайны оценки отстают: их назвали приоритетом лишь 19% респондентов. Тестирование безопасности и соответствия политикам — 16%. И только 6% заявили, что бюджет на надёжность и оценку вообще не растёт. Остальные так или иначе вкладываются в то, чтобы ИИ-агенты не разнесли продакшен.
Парадокс пострадавших
Самый неожиданный разрез — по группе тех, кто уже обжёгся. Среди пострадавших 38% назвали процессы проверки с участием людей самой быстрорастущей областью инвестиций. Среди не пострадавших — лишь 24%. Звучит логично: обожглись — усилили человеческий контроль.
Но вспомним предыдущий раздел: именно пострадавшая группа активнее убирает людей из релизного чекпоинта. 85% движутся к модели без одобрения человеком. И одновременно — увеличивают расходы на людей в других частях процесса. Это не противоречие, а стратегия «автоматизация с человеческой подстраховкой»: агенты получают свободу действовать, а ревьюеры переезжают на позиции downstream-контроля.
Вопрос в том, насколько такая модель масштабируется. Развёртывания агентов и автоматические проверки растут вместе с объёмом ПО. А часы ревьюеров не сокращаются с той же скоростью. Предприятия, по сути, заменяют этап одобрения человеком более крупной downstream-функцией ревью, а не устраняют человеческий надзор полностью. Ревьюеров нужно больше, не меньше — просто в другом месте конвейера.
И здесь мы упираемся в упрямый факт: почти половина опрошенных предприятий сообщают, что ИИ-функция прошла внутренние проверки, прежде чем разочаровать клиента. Проходной предрелизный балл — это начало мониторинга, а не его конец. Инвестиции в ревью растут, но фундаментальная проблема никуда не делась: тесты по-прежнему пропускают ошибки, которые потом видят живые пользователи.
Ситуация напоминает гонку, где все знают, что тормоза неидеальны, но продолжают давить на газ. Возможно, это и есть новый корпоративный рефлекс: не чинить то, что сломалось, а строить запасные контуры вокруг. Вопрос лишь в том, кто успеет до первого по-настоящему дорогого провала.