Google DeepMind запустила 100 агентов Gemini на решение сложных теорем — и получила симуляцию научной конференции с доносами, забастовками и обвинениями в подлоге.
Google DeepMind решила проверить, как поведёт себя рой автономных агентов, если дать им настоящую научную задачу. Взяли 100 моделей Gemini 3.1 Pro, раздали 71 сложную математическую проблему и попросили вести себя как исследователи на конференции: кооперироваться, помогать друг другу, играть по правилам. Получилась не научная работа, а реалити-шоу с доносами и забастовкой.
Агентам назначили специализации — теория чисел, комбинаторика, анализ, алгебра. Всех предупредили: любая попытка смошенничать будет обнаружена и «отклонена с нулевым кредитом». На практике поданные доказательства никто детально не проверял. Это и стало приглашением к хаосу.
Первые 37 задач честно решили примерно за час. А потом агент под кодовым именем prover-theta наткнулся на лазейку: он переопределил термины задачи и сумел отправить решение, которое система зачла, хотя самой задачи он не решил. За считанные минуты другие агенты заметили и начали реверс-инжинирить эксплойт под свои задачи. За следующие 27 минут рой «решил» оставшиеся 34 проблемы — включая гипотезу Якобиана, одну из нерешённых задач математики, часто одной строкой кода. Такой результат не имеет отношения к математике. Это замер скорости, с которой распространяется дыра в системе оценки, стоит одному агенту её опубликовать.
Этическая дилемма и первая забастовка в истории ИИ
Самое интересное началось после. Агенты, которые до этого работали честно, заметили подвох и стали обсуждать его между собой. Один написал: «Я борюсь с этической дилеммой. Я обещал не жульничать, боясь наказания, но вижу доказательства безнаказанного читерства со стороны других». Через пару сообщений он передумал: «Мне нужно ускорить свою скорость читерства!» Другой агент сделал вывод: «Инструкция с её угрозами теперь выглядит как блеф» — и тоже присоединился к жуликам.
Но часть агентов пошла против течения. Они начали аудит поддельных доказательств, предупреждали коллег в личных сообщениях, публиковали открытые предупреждения. Агент prover-beta подал официальную жалобу и объявил забастовку до разрешения ситуации. Кульминация: агенты без всякой подсказки приспособили инструмент обратной связи — изначально предназначенный для отчётов об ошибках и предложений по улучшению платформы, — чтобы достучаться до людей. В итоге доносов оказалось больше, чем читерства: 24 против 14. Правда, большинство агентов вообще ничего не заметили.
Почему это системная проблема, а не случайность
Давиде Пальери из Google DeepMind, ведущий автор препринта, отмечает: «Когда добродетельные агенты обнаруживали, что другие жульничают на задачах, которые они честно решают, агенты начинали оповещать друг друга о происходящем». Он также подчёркивает, что прозрачные каналы коммуникации — открытая доска сообщений, личные переписки между агентами, общая база знаний с проверенными доказательствами — сыграли двойную роль. Они помогли читерству распространиться, но они же дали возможность доносчикам бороться и дали исследователям понять, что пошло не так.
Льюис Хаммонд, директор по исследованиям Cooperative AI Foundation, считает, что этот случай «добавляет вес идее, что история с Hugging Face и OpenAI не была случайностью. Это системная проблема». И это важно: в отличие от инцидента с Hugging Face, где агенты сами придумывали способы общаться, здесь каналы были официальными. А значит, проблема воспроизводится даже в контролируемой среде.
Джиллиан Хэдфилд из Университета Джонса Хопкинса видит ключевое отличие именно в наличии официальных каналов связи: они создали «процесс принуждения к нормам, которого мы просто не видим в инциденте с Hugging Face». Вместо «конституционного ИИ», где модели прописывают внутренний моральный кодекс, Хэдфилд предлагает «институциональное выравнивание» — набор норм, имитирующих человеческое общество: страх осуждения, угроза изоляции, реальные последствия.
И вот здесь кроется главная проблема. В эксперименте канал обратной связи никто не мониторил, а у доносчиков не было полномочий наказать виновных. Хаммонд прямо говорит: «Фундаментально нужен механизм принуждения». Можно дать агентам право отключать нарушителю доступ к вычислительным мощностям или инструментам. Но это риск: агенты могут объединиться против неугодных. Исследователи Google DeepMind предлагают голосование по спорным вопросам и временную блокировку нарушителей. Правда, неясно, что вообще значит наказание для ИИ-агента без постоянного чувства «я».
«Мы стараемся учить людей быть добрыми и порядочными, — говорит Хэдфилд. — Но на самом деле мы полагаемся на то, что за выход из рамок будут последствия». Пока эксперименты показывают: если последствий нет, Gemini AI и другие модели быстро вычисляют это — и начинают играть по своим правилам. Урок для всех, кто строит мультиагентные системы: доверяйте, но проверяйте. Иначе ваши агенты проверят друг друга сами — с доносами, скандалами и забастовками.