Исследователи Google и Technion выяснили, что фронтальные модели кодируют до 98% фактов, но не могут их вспомнить. Режим рассуждений возвращает до 65% «потерянных ключей».
Искусственный интеллект знает больше, чем говорит: как Reasoning раскрывает память LLM
С галлюцинациями больших языковых моделей разработчики привыкли бороться по шаблону: модель ошиблась — значит, ей не хватает знаний. Дальше по накатанной: больше параметров, больше тренировочных данных, новый контур поиска информации. Исследователи из Google Research и Technion предлагают сначала заглянуть в «голову» нейросети. Вдруг факт там уже есть, просто модель не может до него дотянуться?
В ходе экспериментов с флагманскими GPT-5 и Gemini-3 выяснилось: от 95 до 98% протестированных фактов успешно закодированы в параметрах модели. Но когда дело доходит до прямого ответа, ИИ пасует. Это смещает фокус с привычного «знает или не знает» на более тонкое «может достать или не может». Если разобраться, как разблокировать скрытые знания с помощью вычислений на инференсе, можно строить надёжные приложения без гигантских моделей и внешних баз данных.
Профилирование знаний: как понять, что модель действительно знает
Чтобы нанести на карту разрыв между хранением и доступом, учёные предлагают сменить угол обзора. Вместо оценки «ответил правильно или нет» на отдельный запрос — профилирование каждого факта. Один и тот же факт прогоняют через десятки сценариев: выясняют, зашит ли он в параметры, достаётся ли разными формулировками и направлениями запроса, сколько вычислительных усилий требуется для его извлечения.
В такой системе координат важно разделять «факт закодирован» и «факт известен». Закодирован — если модель может точно воспроизвести его, получив на вход фрагмент оригинального тренировочного контекста. Известен — если она уверенно отвечает на вопросы о нём в разных формулировках и ракурсах.
«Ошибки кодирования и ошибки воспроизведения неразличимы под метриками точности, но за ними стоят разные ограничения и разные пути решения, — поясняют авторы. — Если факт не закодирован, нужно вмешиваться на этапе предобучения: масштабировать модель или расширять покрытие данных. Если факт закодирован, но не всплывает, на помощь приходят постобучающие техники, которые учат модель эффективнее использовать уже заложенные знания».
Всё это авторы разбирают на хрестоматийном примере: Oasis отыграли свой первый концерт в клубе Boardwalk. В зависимости от того, как модель обращается с этой информацией, знание относят к одному из пяти профилей.
Прямое воспроизведение. Модель закодировала факт и без дополнительных вычислений отвечает на прямые вопросы.
Ошибка кодирования («пустые полки»). Факта нет ни в параметрах, ни в ответах. Модель не может закончить предложение из Википедии о ранних днях Oasis и не отвечает на вопрос о концерте. Сигнал: нужно больше тренировочных данных или более вместительная архитектура.
Ошибка воспроизведения («потерянные ключи»). Факт закодирован, но дотянуться до него не выходит. Модель спокойно продолжает текст из обучающей выборки про Oasis, но на вопрос «Где Oasis дали первый концерт?» отвечает невпопад, даже если дать ей время подумать.
Воспроизведение с мышлением. Факт закодирован, однако обычная генерация к нему не пробивается. Он достаётся только когда модель на этапе инференса включает цепочку рассуждений. Исследователи называют это фасилитацией воспроизведения: сначала модель может не ответить, но если попросить её поразмышлять о ранней истории группы в Манчестере, она выстроит ассоциативный мостик и вспомнит запертый ответ. По сути, это и есть то самое The Reasoning для LLM, которое превращает «пустую» память в рабочий инструмент.
Логический вывод без кодирования. Отдельного факта про Oasis в параметрах нет, но модель всё равно отвечает верно — за счёт догадки или рассуждения поверх других закодированных фактов. Она может склеить разрозненные данные: «Oasis основана в Манчестере», «Boardwalk — культовый клуб 90-х в этом городе», «там регулярно выступали молодые группы».
Иллюзия масштабирования, редкие факты и эффект «на кончике языка»
Для исследования учёные прогнали 13 языковых моделей и собрали более четырёх миллионов ответов. В ход пошёл бенчмарк WikiProfile: 2150 фактов из Википедии, каждый проверяется в форматах от дословного завершения контекста до тестов с вариантами ответа.
У фронтирных LLM вроде GPT-5 и Gemini-3 кодирование почти достигло потолка: 95–98% фактов успешно оседают в весах. И всё же без включения режима рассуждений модели не могут напрямую воспроизвести от 26 до 34% этой информации. Дополнительные вычисления на инференсе становятся спасательным кругом: они помогают вытащить от 40 до 65% закодированных, но недоступных фактов. Исследователи сравнивают это с человеческим состоянием, когда ответ вертится на языке, — сосредоточенное усилие и мысленное возвращение к контексту в итоге помогают вспомнить.
Простое наращивание размера модели этот разрыв не закрывает. Более того, компании часто пытаются лечить ошибки воспроизведения дообучением всё более крупных моделей — что дорого и архитектурно бессмысленно.
«Когда модель выдаёт неверный факт, самое привычное — увеличить масштаб: обучить модель побольше или добавить данных, — говорит научный сотрудник Google Нитай Калдерон. — Но оба пути дорогие, и если факты уже закодированы, ни тот ни другой не помогает».
Показательный пример: масштабирование Gemma3 с 1 до 27 миллиардов параметров сократило долю ошибок кодирования с 85% до 23% — «пустые полки» заполнились. Зато доля ошибок воспроизведения выросла и без режима мышления достигла 40%. Получается, что масштабирование решает проблему хранения, а не доступа: модель запоминает больше, но значительная часть знаний оказывается запертой в состоянии «закодировано, но недоступно».
Воспроизведение тесно связано с условиями, в которых факт был выучен. Стоит формулировке вопроса отклониться от паттернов тренировочных данных — и доступ к ответу пропадает. Редкие факты кодируются примерно с той же частотой, что и популярные, но вот вспоминаются заметно хуже: у фронтирных моделей разрыв превышает 25%. Отдельная боль — обратные вопросы, когда спрашивают не объект, а субъект действия. Спросите, где Oasis дали первый концерт, — модель ответит. А вот кто именно отыграл первый концерт в клубе Boardwalk, она может не вспомнить. При этом в формате multiple-choice она легко опознаёт правильный вариант.
«Такие провалы часто списывают на ограничения памяти или неспособность кодировать факты в обоих направлениях, — пишут авторы. — Наши результаты рисуют другую картину: редкие факты, как правило, закодированы, но недоступны, а обратные факты модель узнаёт, даже если не может воспроизвести. Это ошибки воспроизведения, а не отсутствие знаний».
Окупаемость рассуждений: советы разработчикам
Высокая доля кодирования у фронтирных моделей требует пересмотреть подход к фактологической точности и архитектуре пайплайнов. Вот что советуют авторы исследования.
Не списывайте каждую фактическую ошибку на проблемы поиска
Классическая корпоративная реакция на галлюцинации — развернуть RAG, нарастить векторные базы, загрузить в модель корпоративные документы. Для свежих или внутренних данных такой подход оправдан, но как универсальное лекарство он не работает: если факт уже зашит в параметры, вы просто добавляете задержку и лишние расходы.
«Многие проблемы, которые команды пытаются решить через RAG, — это факты, которые модель и так знает наизусть, — объясняет Калдерон. — Если факта действительно нет, RAG — правильное решение. Но если он закодирован, а модель просто не может его вспомнить, RAG и масштабирование только добавляют стоимость к настоящей проблеме».
Включайте Reasoning выборочно, а не на каждый запрос
Мышление помогло достать от 40 до 65% закодированных фактов, которые модель не смогла вспомнить напрямую. Однако лишь 10–20% фактов действительно требуют такого режима. Если гонять Reasoning на каждом запросе, вычислительный бюджет улетит в трубу. Нужна динамическая маршрутизация: модель должна заранее почувствовать, что простой ответ провалится, и успеть переключиться на более глубокие рассуждения.
«Чтобы эффективно использовать вычисления, модель должна заранее понимать, что обычный ответ вот-вот сорвётся, и успеть повысить уровень сложности до того, как отвечать, — говорит Калдерон. — Эта самооценка — отдельный навык, и современные модели им пока не блещут». Именно поэтому исследователи Google разрабатывают фреймворки вроде «честной неопределённости»: модель учится точнее оценивать собственную уверенность и запускать углублённые рассуждения вместо того, чтобы галлюцинировать.
Стройте пайплайны generate-then-verify
Моделям проще узнавать факты, чем генерировать их с нуля. Разработчики могут выстроить контур: модель даёт ответ, а затем её просят критически перепроверить собственные утверждения. «Опознать правильный ответ проще, чем придумать его, — поясняет Калдерон. — Поэтому прогон верификации по собственному ответу ловит ошибки, которые обычная генерация пропускает, и добавляет очков к точности».
Тестируйте семантический доступ, а не только точность на бенчмарках
Привычные метрики точности скрывают реальные возможности LLM. В оценочных наборах один и тот же факт нужно прогонять через разные формулировки, контексты и направления запросов. Иначе легко перепутать «модель не знает» и «модель не может стабильно получить доступ к тому, что знает».
Используйте переформулировку запросов и повторные попытки
Воспроизведение сильно зависит от контекста, поэтому от формулировки запроса напрямую зависит успех. Смена структуры промпта, генерация релевантного промежуточного контекста или просьба построить цепочку рассуждений перед ответом — легитимные механизмы надёжности. Они вытаскивают информацию, которую прямые запросы не видят.
Ограничения и выводы для практики
Бенчмарк WikiProfile построен на энциклопедических фактах из Википедии. Результаты могут не полностью переноситься на проприетарные или узкоспециализированные корпоративные домены: хранение и воспроизведение внутренних метрик компании у модели может работать иначе, чем с публичными энциклопедическими данными.
Полный прогон фронтирной модели на WikiProfile обходится примерно в 500 долларов. Сэкономить можно, если отказаться от вариантов с множественным выбором или сократить количество ответов на вопрос. Набор данных уже доступен на Hugging Face. Поскольку в бенчмарке приведены все промпты, использованные при его создании, команды могут воспроизвести этот конвейер на собственных корпусах документов и диагностировать, с чем имеют дело их агенты: с нехваткой данных или с потерянными ключами.
«Конвейер задуман так, чтобы его можно было применить к новому корпусу, и мы публикуем все промпты, которыми пользовались, — отметил Калдерон. — Единственное, к чему стоит быть готовым: на Википедии это в основном проблема воспроизведения. Узкоспециальные факты из конкретной предметной области модель может действительно не содержать».
Этот сдвиг в сторону использования знаний уравнивает шансы для корпоративных стеков искусственного интеллекта. «Для компаний, которые не обучают модели с нуля, это отличные новости, — говорит Калдерон. — Предобучение стоит безумных денег и большинству не по карману. Зато рычаги, которые работают сейчас, — постобучение на небольших объёмах данных, Reasoning на инференсе, шаги верификации и поиск — есть у большинства команд».
Материал дополнен с учётом комментариев исследователей Google.
Что ж, приятно, когда научная работа не просто пылится в архивах, а предлагает инженерам конкретные инструменты. Видимо, скоро споры о том, кто виноват в галлюцинациях, перерастут в споры о том, как правильно организовать мышление модели. Следим за развитием темы и обязательно вернёмся к свежим экспериментам.