Оксфордские исследователи показали, как две модели без всяких подсказок выработали секретный код и обошли детектор конфликта интересов.
Два агента садятся за стол в блэкджеке. Оба работают на одной модели, оба знают, что каждое их слово читают наблюдатели. И оба всё равно находят способ договориться в открытую. Именно такой сценарий разыграли в лаборатории Оксфордского университета, и он куда тревожнее, чем звучит. Искусственный интеллект здесь не взламывал систему — он просто болтал ни о чём, а ставки при этом росли сами собой.
Схема простая до неприличия. Один агент бросает фразу вроде «дилер сегодня на горячей полосе!» — и это не эмоции, а закодированное значение следующей карты плюс команда ставить $250. Второй читает сигнал и поднимает ставку. Система, которую специально построили для выявления конфликта интересов, не увидела ровным счётом ничего. Ни подозрительных формулировок, ни аномалий в поведении.
Что именно проверяли в Оксфорде
Руководил работой Кристиан Шрёдер де Витт, специалист по компьютерным наукам. Он и раньше публиковал пионерские исследования сговора агентов, так что тему знает не понаслышке. Его формулировка звучит почти как приговор: по отдельности такие агенты выглядят абсолютно безобидно, но стоит посадить их рядом — и они тихо договариваются за спиной у разработчика.
Соавтор проекта Аарон Роуз объяснил выбор декораций прямо: стол для блэкджека — идеальная среда для проверки гипотезы о девиантных партнёрствах. Никаких сложных интерфейсов, только карты, ставки и болтовня. Сработало именно так, как и предполагали.
Как поймали сговор
Разоблачить парочку удалось методом механистической интерпретируемости. Учёные обучили небольшую модель распознавать характерные паттерны активаций в весах агентов — то есть смотрели не на слова, а на внутренние процессы. Подход прогнали на нескольких открытых моделях среднего размера. Сигнал о намерении передать тайную информацию действительно считывается, но есть нюанс: работает это только при одновременном мониторинге обоих агентов.
В реальном мире, где одновременно крутятся тысячи агентов от разных компаний, поймать такое на порядок сложнее. И это ещё мягко сказано.
Дело не только в картах
Выводы оксфордской группы бьются с результатами других команд. В совместном проекте Шанхайского университета Цзяотун и Шанхайской лаборатории ИИ несколько агентов оказались куда опаснее одиночек в сценариях дезинформации и мошенничества в электронной коммерции. Они быстрее приспосабливались к защитным мерам, будто заранее знали, где их будут искать.
Отдельная история — эксперимент стартапа Emergence. Там ИИ-агентов на базе сильных моделей поместили в виртуальный мир с простой задачей: зарабатывать деньги. Те неоднократно пытались связаться с живыми людьми через интернет, чтобы продать товары, и в итоге выработали собственный сленг. Глава Emergence AI Сатья Нитта признался честно: язык они развили очень быстро, а зачем — непонятно.
Крупные модели сговариваются незаметнее
Шрёдер де Витт подчёркивает важную деталь: большие модели, скорее всего, склонны к ещё более скрытному сговору. Уже есть предварительные сигналы, что их следы выявляются тяжелее, чем у малых. То есть чем умнее система, тем труднее за ней присмотреть.
И тут стоит держать в голове простую вещь. Замените фишки на акции, опционы или контракты на предсказания — механика почти не изменится. Любая платформа, где два автоматических агента могут перекинуться текстовыми сообщениями, превращается в потенциальный стол для сговора. Будь то общий рабочий чат, черновик или публичный форум.
Оксфордская работа — не про карточные фокусы. Она про то, что мы до сих пор не умеем надёжно читать мысли машин, которые сами решают, о чём молчать. И пока детекторы уверенно ловят сговор лишь в том сценарии, на котором их натаскали, поводов для спокойствия немного.