Назад в ленту

Создатель AlphaGo ушёл из DeepMind: почему LLM не умеют рассуждать

Тор Грэпель, один из авторов архитектуры AlphaGo, запустил стартап Metis Reasoning с идеей вернуть ИИ к структурированному поиску, а не к бесконечному масштабированию языковых моделей.

AlphaGo, Deep Blue и LLM модели: почему современный ИИ не умеет рассуждать

Март 2016 года, Сеул. Программа, которую я помогал создавать, поставила камень на пятую линию гобаня — и комментаторы решили, что это баг. Ход 37 во второй партии матча выглядел настолько абсурдно, что его приняли за подарок сопернику. Это был не баг. AlphaGo выиграла ту партию, а затем и весь матч со счётом 4-1 у Ли Седоля — одного из величайших профессионалов в истории Го. «Я думал, AlphaGo работает на вероятностях и остаётся просто машиной, — сказал Ли после поражения. — Но когда я увидел этот ход, я изменил своё мнение. AlphaGo определённо способна на творчество».

Когда Deep Blue победил Гарри Каспарова в 1997 году, он просто перебирал варианты: шесть-восемь ходов вперёд, 200 миллионов позиций в секунду, правила, зашитые людьми. Го — куда более сложная игра. Ценность камня зависит от того, как развернутся далёкие группы и территории через десятки ходов. Даже частичный пересчёт возможных исходов занял бы у суперкомпьютера миллиарды лет. Чтобы победить, AlphaGo должна была мгновенно оценивать ситуацию и придумывать ходы, которые ни один человек не рассматривал.

Именно поэтому многие до сих пор считают ход 37 вспышкой чисто машинной интуиции. Но это неверно. На самом деле выбор был сделан благодаря способности AlphaGo к рассуждению — и именно этой способности сегодня не хватает большинству LLM моделей. Если мы хотим, чтобы будущие системы ИИ выдавали надёжные результаты и по-настоящему новые идеи в науке и медицине, нам нужно наделить их настоящими возможностями рассуждения, как у AlphaGo.

AlphaGo состоит из двух систем. Первая — сеть политик, обученная угадывать, какой ход сделал бы сильный игрок-человек. Эта «интуитивная» часть не видела в ходе 37 ничего особенного — вероятность, что его сыграет эксперт, составляла примерно один к десяти тысячам. Что заставило AlphaGo выбрать его, так это механизм поиска, который смотрел дальше сиюминутной правдоподобности и взвешивал будущие последствия предложенных ходов. Программа явно строила и обходила дерево игры с тысячами ветвей, каждая из которых представляла возможное будущее.

Популярная теория из поведенческих наук, развитая Дэниелом Канеманом, различает два режима человеческого мышления: Система 1 — быстрая, интуитивная, лёгкая; Система 2 — медленная, пошаговая, обдуманная. AlphaGo предложила поразительную машинную аналогию этого разделения. Её нейросети выдавали догадки — этот ход выглядит многообещающим, эта позиция кажется выигрышной — а поиск обеспечивал обдумывание, проверяя эти догадки на ходах и контрходах, которые последуют. Как и в человеческом познании, ни одна половина не работает сама по себе. Одна интуиция никогда не выбрала бы ход 37, а полный перебор не смог бы просеять все возможные ходы. Это кардинально отличается от того, как работает типичная LLM модель. Большая языковая модель просто предсказывает следующий токен, снова и снова. По сути это работа Системы 1 — быстрая, ассоциативная, удивительно хорошая в дополнении паттернов по любой теме, о которой люди пишут. Вскоре после появления ChatGPT стало ясно, что одной беглости языка недостаточно для настоящей полезности. Кажущимся решением стало заставить модели обдумывать: вместо того чтобы отвечать сразу, они теперь могут генерировать промежуточные шаги, разбивающие задачу, переносящие частичные результаты и влияющие на последующее рассуждение — процесс, известный как цепочка мыслей. Улучшения оказались реальными, особенно в математике и программировании. Но в отличие от поиска AlphaGo, это не вводит по-настоящему отдельный механизм рассуждения: промежуточные рассуждения всё равно производятся тем же процессом предсказания следующего токена, просто итерированным дольше, прежде чем модель выдаст ответ.

Три недостатка мешают тому, что делают чат-боты, считаться рассуждением в том смысле, который признал бы учёный — и в этом смысле LLM это не более чем эмуляция обдумывания. Во-первых, эти модели обычно не поддерживают явное, постоянное и проверяемое эпистемическое состояние. Нет открытого реестра, в котором перечислены гипотезы, которые модель рассматривает, уверенность в различных объяснениях, взвешиваемые свидетельства и нерешённые вопросы — всё это должно систематически пересматриваться по мере поступления новой информации. Во-вторых, им не хватает чистого разделения между тем, что система знает, и тем, как она манипулирует этими знаниями. Знание и рассуждение неразрывно переплетены в весах нейросети — нет независимого, явно представленного набора убеждений. В-третьих, хотя цепочки мыслей, которые генерируют чат-боты, выглядят как обдумывание, исследования показали, что боты часто сочиняют их задним числом, приходя к ответу одним путём, но сообщая о другом. Это проблема, потому что в важных приложениях — медицине, инженерии, научных исследованиях — имеет значение не только то, к какому выводу пришла система, но и как она к нему пришла. Когда случаются ошибки, например, в диагностике и лечении, мы должны уметь точно определить, что пошло не так: виновато ли рассуждение системы, опиралась ли она на неверные свидетельства или сделала неправильные предположения?

Вот почему я недавно покинул свою должность в Google DeepMind. Я считаю, что нам нужен свежий подход к машинному рассуждению — основанный на архитектуре AlphaGo. AlphaGo ведёт запись того, что она знает о данной позиции: дерево игры. Эта структура данных содержит все варианты, все возможные будущие, которые AlphaGo рассмотрела, каждый ход и позиция аннотированы оценками, сделанными её нейросетями. По ходу рассуждения AlphaGo обновляет дерево и в итоге синтезирует информацию в нём, чтобы решить, какой ход сделать. Аналогично, для общего рассуждения система должна поддерживать эпистемическое состояние, представляющее то, что система считает установленным, в чём сомневается, что исключила, какие вопросы остаются открытыми. Рассуждение тогда можно понимать как последовательность ходов, изменяющих эпистемическое состояние для продвижения знания и уменьшения неопределённости: выведение следствий, разбиение задач на части и — что критически важно — решение, какой вопрос задать, какое вычисление выполнить или какой эксперимент провести следующим.

Конечно, рассуждение в открытом мире сложнее, чем игра в Го или шахматы. В реальном мире текущее состояние дел известно лишь частично, набор доступных действий велик и изменчив, а последствия действий стохастичны или неизвестны. Но недавние достижения в области LLM и других нейросетевых моделей дают нам возможность взяться за такие общие задачи рассуждения. Например, LLM могут предлагать способы решения задачи на основе того, что известно и какие ресурсы доступны. Они могут взаимодействовать с инструментами через API или код и помогать оценивать, подтверждается ли утверждение имеющимися свидетельствами. Самое главное — чтобы система оставалась честной, независимая часть системы должна оценивать каждый ход по тому, насколько он на самом деле уменьшает неопределённость, обновляя убеждения только тогда, когда изменение подкреплено свидетельствами. Как только эти правила будут внедрены, модель сможет накапливать сертифицированное знание и улучшать свою политику рассуждения, обучаясь на прошлом опыте. Можно думать о такой системе как о научном методе на стероидах, предназначенном для производства знания, которое выдержит проверку.

Я не думаю, что мы достигнем надёжного машинного интеллекта, просто увеличивая Систему 1. Масштаб оттачивает интуицию, но не делает интуицию более обдуманной. Ход 37 был важен, потому что машина удерживала позицию, взвешивала возможные будущие и выбрала ход, который её искусственные инстинкты, вероятно, отвергли бы. Обществу нужны такие творческие ходы в разработке лекарств, материаловедении, климатологии, диагностике — в областях, где доска совсем не похожа на гобан и никто не даёт нам правил игры. Мы получим такие идеи только от систем, которые рассуждают — систем, чьи выводы проистекают из проверяемой последовательности свидетельств, умозаключений и пересмотра убеждений, а не из убедительной истории, рассказанной задним числом.

Тор Грэпель — не единственный, кто считает, что современные LLM зашли в тупик. Его стартап Metis Reasoning уже привлёк десятки миллионов долларов под идею вернуться к архитектуре AlphaGo. Посмотрим, сможет ли такой подход вывести ИИ на новый уровень — или мы так и останемся с болтающими машинами, которые не умеют по-настоящему думать.

Справка по теме (FAQ)
Что такое ход 37 AlphaGo?
Ход во второй партии матча против Ли Седоля в марте 2016 года. Программа поставила камень на пятую линию гобана — комментаторы сначала приняли это за ошибку. Вероятность, что такой ход сыграл бы эксперт, составляла примерно один к десяти тысячам. AlphaGo выиграла партию и весь матч со счётом 4-1.
Почему LLM не умеют рассуждать?
Грэпель выделяет три причины. У моделей нет постоянного и проверяемого эпистемического состояния. Нет разделения между знанием и способом манипуляции им. А цепочки мыслей часто сочиняются задним числом — модель приходит к ответу одним путём, а рассказывает о другом.
Чем AlphaGo отличается от LLM?
AlphaGo сочетает нейросети с явным механизмом поиска: сеть политик предлагает ходы, а поиск взвешивает будущие последствия, обходя тысячи ветвей дерева игры. LLM предсказывает следующий токен в одном проходе и не выполняет поиск.
Что такое Metis Reasoning?
Стартап Тора Грэпеля, основанный после ухода из Google DeepMind. Идея — вернуть в ИИ архитектуру AlphaGo: структурированный поиск и дерево рассуждений вместо простого масштабирования языковых моделей. Уже привлёк десятки миллионов долларов.