Назад в ленту

Meta* создала новую обвязку для ИИ — EvoHarness-RL учит маленькие модели работать как гиганты

Исследователи Meta* и Университета Иллинойса обучили 8B-модель обходить Claude Opus 4.5 в сложных задачах, используя метод EvoHarness-RL

EvoHarness-RL: новый метод обучения ИИ-агентов для сложных задач

Представьте ИИ-агента, которому поручили миграцию огромного массива клиентских записей из старой CRM в облачную базу данных. Задача тянется на много часов, и рассчитывать только на внутреннее окно контекста здесь попросту невозможно — агенту жизненно необходим исполнительный слой, который в технической литературе называют harness (обвязка).

Эта обвязка снабжает агента обратной связью — например, логами сервера, — помогая держать в голове актуальную картину динамических интеграций. Она же предоставляет трекеры состояния и механизмы управления потоком выполнения, чтобы агент не терял из виду завершенные и ожидающие подзадачи и не дублировал пакеты данных. А когда что-то идет не так — скажем, база отвергает пакет из-за строгих лимитов API, — именно обвязка дает агенту инструменты и инструкции для восстановления.

Главный способ научить агента пользоваться инструментами — написать для него жесткий набор правил. Разработчик, например, может указать: перед отправкой письма всегда сверяйся с корпоративной вики. Но проблема в том, что агент в такой схеме просто исполняет скрипт, не обладая подлинной автономией. Он не обучен самостоятельно взвешивать выгоды и издержки своих действий.

Исследователи из Meta* AI и Университета Иллинойса в Урбане-Шампейне предлагают решение — фреймворк EvoHarness-RL. Он добавляет к обвязке слой абстракции и учит базовую модель тому, когда нужно читать, обновлять или консолидировать информацию, получаемую из окружения.

Для задач с длинным горизонтом планирования ключевым фактором успеха становится то, как ИИ-агент читает и обрабатывает данные из внешней среды. Ему необходимо обновлять картину мира, отслеживать выполненные и оставшиеся подзадачи, восстанавливаться после сбоев и переиспользовать наработанные процедуры. Вся эта работа ложится на обвязку.

Частично проблему решают саморазвивающиеся фреймворки вроде Harness-1: они накапливают прошлые траектории и превращают их в структурированную процедурную память — переиспользуемые навыки, рабочие процессы или библиотеки кода для будущих задач. Но такой подход, как правило, отделяет долгосрочное накопление навыков от отслеживания состояния в реальном времени внутри одного эпизода. Агента целенаправленно не обучают управлять текущим окружением или контролировать шаги активной задачи.

Соавтор статьи об EvoHarness-RL Сюйин Нин в беседе с VentureBeat отметил, что ручная логика и жесткие структуры памяти — главные пожиратели инженерных ресурсов.

«Оптимальная обвязка часто меняется вместе с моделью, — объяснил Нин. — Разным моделям могут требоваться разные промпты, конструкции памяти, разрешения или конфигурации песочницы. Если всю эту логику кодить вручную, то каждое обновление модели приводит к новому долгому циклу настройки и отладки».

Кроме того, существующие системы памяти, которые просто накапливают опыт, могут активно вредить рассуждениям агента. «Память в режиме добавления предполагает, что больше контекста — всегда лучше, но это не так, — говорит Нин. — В ходе длительной задачи в памяти могут остаться устаревшие выводы, неудачные попытки или сведения, потерявшие актуальность». Поэтому агентам с длинным горизонтом нужна динамическая память, способная обновлять, сжимать и заменять информацию, чтобы не повторять прошлых ошибок.

EvoHarness-RL: единое пространство убеждений, прогресса и опыта

Чтобы преодолеть ограничения жестких ручных промптов, исследователи внедряют технику обучения, которая учит агента оптимально использовать свою обвязку. Вместо слепого следования захардкоженным инструкциям агент учится выстраивать структурированное рабочее пространство из хаотичных данных выполнения и решать, когда и как обращаться к этому внешнему состоянию в сложных процессах.

Для упрощения управления разными компонентами обвязки EvoHarness-RL сводит все вспомогательные системы агента к единому интерфейсу. Этот интерфейс назвали BPE (Belief, Progress, Experience), что можно перевести как «Убеждения, Прогресс, Опыт». Он разделяет внешние потребности агента на три функциональные зоны.

Убеждения — поддержание точного представления о текущем окружении. Прогресс — управление завершенными и незавершенными подзадачами. Опыт — переиспользование исторических знаний между задачами.

Вместо сложных доменных API искусственный интеллект общается с этим чистым интерфейсом через четыре компактных метадействия: track (отследить), commit (зафиксировать), recall (вспомнить) и note (записать). Агент отдает команды на отслеживание живого окружения, фиксацию изменений рабочего процесса, вызов прошлых стратегий перед действием и сохранение новых инсайтов для будущих запусков.

Эти состояния напрямую ложатся на востребованные корпоративные вертикали. «В разработке ПО „Убеждения" могут отражать текущее понимание агентом репозитория, — рассказывает Нин, поясняя, как агент отслеживает взаимодействие компонентов и изменения в рабочем пространстве. — „Прогресс" показывает, что уже сделано, что еще предстоит и какие шаги зависят от других». «Опыт» же фиксирует уроки — например, отзыв пользователя об ошибке, — чтобы направлять будущие действия.

Тот же принцип работает и в финансах, добавляет Нин. При аудите соответствия «Убеждения» могут описывать применимые правила и доступные доказательства. «Прогресс» отслеживает выполненные проверки и оставшиеся исключения. «Опыт» помогает агенту замечать повторяющиеся расхождения или понимать, когда проблему пора эскалировать.

«Вместе эти состояния не дают агенту потерять нить задачи или снова и снова наступать на одни и те же грабли», — резюмирует Нин.

Чтобы обучить агента и механике, и стратегии управления внешним пространством, исследователи разработали двухэтапную схему. На первом этапе — контролируемая тонкая настройка обвязки — базовая модель учится извлекать полезные факты из запутанных журналов взаимодействия и укладывать их в структуру BPE.

Однако каждый запрос к памяти или обновление трекеров тратит время и вычислительные токены, поэтому агент не может бездумно проверять свои инструменты на каждом шагу. Второй этап решает эту задачу через «ресурсозатратное» обучение с подкреплением: агент учится расчету — когда обращение к внешнему состоянию оправдывает бюджетные издержки. Этот двухэтапный процесс превращает использование инструментов из жесткого скрипта в усвоенное поведение времени выполнения.

EvoHarness-RL в действии

Для проверки фреймворка исследователи использовали бенчмарк ALFWorld — текстовую среду с многошаговыми задачами, которые тестируют последовательную логику и отслеживание состояния. Базовой моделью выступила Qwen3-8B.

Обученную 8B-модель сравнили с тремя крупными фронтирными моделями (Claude Opus 4.5, GPT-4.1 и GPT-5), замороженными фреймворками со статическими инструментами (ReAct, ExpeL, ReasoningBank) и продвинутыми обучаемыми методами (стандартный GRPO, SkillOS и SkillRL).

Результаты показывают серьезный скачок производительности для небольших экономичных моделей. С EvoHarness-RL модель Qwen3-8B достигла среднего показателя успеха в 96,9% — это прирост на 49,0 процентных пункта относительно базовой версии на ReAct.

Обученная модель обошла и продвинутые обучаемые фреймворки: SkillRL (89,9%) и SkillOS (80,2%). А для разработчиков, думающих об оптимизации вычислительных затрат, самое впечатляющее — 8B-модель фактически сравнялась с дорогими закрытыми моделями вроде Claude Opus 4.5, которая «из коробки» набрала 96,4%.

Помимо прокачки малых моделей, эксперименты показывают, что фреймворк BPE дает универсальные преимущества на всех масштабах моделей, даже без интенсивной фазы обучения с подкреплением. Когда исследователи оснастили замороженные фронтирные модели обвязкой BPE на уровне промптов, их исполнение заметно улучшилось: у GPT-4.1 показатель успеха вырос на 22,1 пункта, а у GPT-5 — на 25,7 пункта.

Помимо цифр, в ходе экспериментов исследователи зафиксировали эффекты, демонстрирующие динамичное поведение, которое большие языковые модели приобретают в процессе тренировки. Во время фазы обучения с подкреплением они наблюдали сдвиг в поведении по мере того, как агент усваивал знания. Этот сдвиг назвали «отжигом обвязки» (harness annealing).

В начале обучения ИИ активно обращался к трекерам «Опыта» и «Прогресса» практически на каждом шагу. Но по мере освоения рутинных действий его зависимость от внешних инструментов снижалась — успешные паттерны встраивались прямо в параметры модели. В реальном корпоративном окружении это напрямую означает меньшую задержку и снижение вычислительных расходов: «отожженный» агент перестает тратить токены и время на запросы к базам данных для стандартных сценариев, которые уже освоил.

Одновременно агент демонстрировал «эволюцию обвязки» — динамическую адаптацию стратегии в зависимости от сложности ситуации. Для простых знакомых задач он обходился без инструментов, но при столкновении с незнакомой средой или неожиданным препятствием активно наращивал использование модулей «Убеждений» и «Опыта». Пример: если агент мигрирует стандартные записи базы данных, он действует быстро. Но встретив странный устаревший API или сложную ошибку валидации, он замедляется, подтягивает логи сервера и запрашивает историю прошлых обращений, чтобы безопасно закрыть пограничный случай — вместо того чтобы выдумывать ответ наобум.

Интеграция EvoHarness-RL в существующие системы

Несмотря на внушительные результаты, внедрение нового фреймворка часто создает трения в корпоративных командах. EvoHarness-RL решает эту проблему через адаптер окружения: внутренние реализации могут оставаться специфичными для существующих инструментов организации, при этом разделяя обучаемый слой.

«Я вижу значительный потенциал в интеграции BPE с существующими оркестрационными системами, — говорит Нин. — Командам не обязательно заменять свои текущие инструменты или фреймворки. BPE может работать как дополнительный слой управления состоянием, который постоянно организует информацию о текущих убеждениях агента, его прогрессе и накопленном опыте».

Для разработчиков, обеспокоенных затратами на инференс, фреймворк также снижает скрытую инженерную стоимость консолидации. Поскольку консолидация требует сильных рассуждений, команды могут принять гибридную асинхронную архитектуру для оптимизации бюджета.

«Один из возможных компромиссов — использовать фронтирную модель для генерации качественных консолидированных данных, а затем дообучить способную модель с открытым весом для рутинного управления состоянием», — объясняет Нин. К тому же, «поскольку консолидация может происходить асинхронно, она не обязана замедлять главный цикл исполнения агента».

Командам стоит трезво оценивать, когда обучаемая обвязка BPE действительно необходима, а когда это избыточно. «Для короткой стабильной задачи возможностей ReAct или стандартного RAG уже достаточно, — отмечает Нин. — BPE становится значительно полезнее, когда агент работает много часов, дней или даже недель». В таких сложных сценариях агенту нужно сжатое понимание своих решений, чтобы не теряться, а «Опыт» позволяет итеративно улучшаться на прошлых неудачах и обратной связи от людей.

По сути, этот подход знаменует сдвиг для инженеров оркестрации ИИ. «Это не полная замена инженерии рабочих процессов, — заключает Нин, — а переход от прямого скриптования поведения агента к созданию систем, в которых лучшее поведение можно выучить».

Справка по теме (FAQ)
Что такое EvoHarness-RL?
EvoHarness-RL — это фреймворк, разработанный исследователями из Meta* AI и Университета Иллинойса в Урбане-Шампейне. Он представляет собой обучаемую «обвязку» (harness) для ИИ-агентов, которая добавляет слой абстракции к внешним инструментам и учит базовую модель эффективно управлять информацией из окружения. Вместо жестких скриптов агент учится самостоятельно решать, когда читать, обновлять или консолидировать данные.
Как работает интерфейс BPE в EvoHarness-RL?
BPE (Belief, Progress, Experience) — это единый интерфейс, который сводит все вспомогательные системы агента к трем функциональным зонам: «Убеждения» (поддержание точного представления о текущем окружении), «Прогресс» (управление завершенными и незавершенными подзадачами) и «Опыт» (переиспользование исторических знаний). Агент взаимодействует с этим интерфейсом через четыре компактных метадействия: track (отследить), commit (зафиксировать), recall (вспомнить) и note (записать).
Каких результатов удалось достичь с помощью EvoHarness-RL?
Модель Qwen3-8B с EvoHarness-RL достигла среднего показателя успеха в 96,9% в бенчмарке ALFWorld, что на 49,0 процентных пункта выше базовой версии на ReAct. Обученная 8B-модель фактически сравнялась с дорогими закрытыми моделями, такими как Claude Opus 4.5 (96,4%), и обошла GPT-4.1 и GPT-5. Кроме того, оснащение замороженных фронтирных моделей обвязкой BPE на уровне промптов улучшило их исполнение на 22-25 процентных пунктов.
* Деятельность организации «Компания Meta (социальные сети Instagram и Facebook)» признана экстремистской и запрещена в РФ.