Нейросеть Brain-IT реконструирует увиденные картинки по сканам мозга и тратит на калибровку под нового человека всего час.
ИИ от Weizmann Institute of Science научился читать мысли и восстанавливать изображения по МРТ
Представьте: вы смотрите на картинку, а нейросеть не просто угадывает, что это, а буквально перерисовывает её, считывая активность вашего мозга. Звучит как сценарий киберпанка, но это реальность — разработка команды из Weizmann Institute of Science в Реховоте, Израиль. Инструмент под названием Brain-IT анализирует сканы функциональной МРТ и воссоздает увиденное с пугающей точностью. И да, он умеет работать и в обратную сторону: предсказывать активность мозга по картинке.
Взгляните на примеры: слева — то, что реально видел человек, справа — реконструкция модели по данным МРТ. Разница минимальна, детали совпадают. Профессор Михаэль Ирани, руководитель лаборатории в Israel Weizmann Institute of Science, надеется, что этот «читатель мыслей» в перспективе раскроет механизмы работы мозга, поможет общаться парализованным людям и даже позволит воссоздавать содержимое снов.
«Это великолепная работа, — говорит Джуди Иллес, нейроэтик из Университета Британской Колумбии, не участвовавшая в исследовании. — Идея использовать такой подход для помощи людям с неврологическими проблемами невероятно воодушевляет».
Но не всё так радужно. Другие учёные предупреждают: аналогичные технологии могут вскрывать внутренние мысли и образы без согласия человека. «Результаты выглядят впечатляюще, — отмечает Томми Спрэг, нейробиолог из Калифорнийского университета в Санта-Барбаре. — Но если появится способ тайно извлекать информацию о том, о чём вы думаете, то 150 лет научной фантастики могут стать реальностью в любой момент. И это тревожит».
Как заглянуть в мозг
Нейробиологи бьются над реконструкцией зрительных образов уже много лет. Ранние попытки давали размытые, трудно интерпретируемые картинки. Но прогресс в технологии фМРТ и алгоритмах анализа постепенно меняет игру. Ирани и её коллеги начали с публичных данных: другие исследователи собирали сканы добровольцев, которые рассматривали сотни изображений в томографе.
ФМРТ отслеживает поток оксигенированной крови: активные участки «загораются» на скане. Раньше каждый воксел (трёхмерный пиксель активности) охватывал около 3 кубических миллиметров — примерно 16 000 нейронов. Но команда The Weizmann Institute of Science использовала новые датасеты с разрешением в 1 кубический миллиметр на воксел. Это позволило точнее сопоставить активность с конкретными изображениями.
Другие группы тоже пробовали восстанавливать картинки по МРТ, но качество хромало. «Если человек видел банан, модель могла сгенерировать банан, но он выглядел иначе, — объясняет Ирани. — Не совпадала ни структура, ни положение».
Улучшенный декодер
Чтобы добиться точности, команда обучила ИИ на данных восьми человек, каждый из которых просмотрел около 9000 изображений в высокопольном фМРТ-сканере. Ключевая фишка — декодер состоит из двух ветвей: одна предсказывает структуру (где какие цвета), вторая — содержание (например, «тарелка с бананами»). Эти предсказания подаются в диффузионную модель (ту самую, что генерирует видео и картинки из шума), и на выходе получается максимально точная реконструкция.
Проблема: для обучения нужно гораздо больше данных, чем есть. Решение оказалось элегантным — обучить второй ИИ (энкодер), который предсказывает активность мозга по картинке. Затем энкодер и декодер гоняют данные туда-сюда: берут новое изображение (скажем, леопарда), энкодер генерирует виртуальную фМРТ, декодер пытается восстановить исходник. Сначала получается ерунда, но после многократных итераций качество взлетает. Так команда смогла тренировать модели на любых картинках, даже если их никогда не показывали в томографе. Около 70% обучающих данных — это изображения без реальных парных фМРТ.
Кроме того, объединив данные разных исследований, учёные выявили участки мозга, общие для всех людей. Один регион стабильно реагирует на еду, другой — на спорт. «Теперь мы работаем с нейробиологами, чтобы с помощью этих инструментов узнать новое о мозге», — говорит Ирани.
Главный прорыв: «универсальный энкодер» требует минимальной калибровки для нового человека. Конкурирующие модели нуждаются в ~40 часах фМРТ-данных, чтобы начать предсказывать. Декодер Ирани — всего в одном часе. Результаты представили на конференции Cognitive Computational Neuroscience в Нью-Йорке. «Никто из нас не может позволить себе 40 часов сканирования для каждого испытуемого, — комментирует Спрэг. — Это $600–1000 в час. Такие инструменты ускорят исследования».
Границы возможностей
Декодер не идеален. «Бывают провалы», — признаёт Ирани. На созвоне она показала, как торт превратился в стопку из трёх бутербродов, а собака в ванне — в козла похожего окраса. Но в сравнительных тестах Brain-IT значительно обходит предшественников. «Мы outperformed их с большим отрывом», — говорит Ирани, добавляя, что «чтение мыслей» — это скорее «милое, эффектное название» для их работы.
Следующая цель — видео и аудио. Ирани хочет реконструировать не только то, что человек видит, но и то, о чём думает или что видит во сне. «Этого пока нет, — признаёт она. — Но мы стремимся». В перспективе технология может дать голос парализованным людям с синдромом «запертого человека» и помочь учёным разобраться в природе флешбэков при ПТСР.
Этические дилеммы
Прогресс неизбежно поднимает вопросы ментальной приватности. Что, если злоумышленник сможет воссоздать мысленный образ человека — проиграть его мысли или увиденное? «Если бы вы спросили меня об этом десять лет назад, я бы посмеялся, — говорит Спрэг. — Заставить человека лежать неподвижно в сканере и активно участвовать в исследовании — уже сложно, не то что против его воли». Но Ирани и другие учёные работают над аналогичными методами на основе ЭЭГ — электрической активности мозга, считываемой через шапочку с электродами или даже наушники.
По мере улучшения моделей анализировать такие данные станет проще. «Мы должны серьёзнее отнестись к этическим соображениям», — предупреждает Спрэг. Он считает, что подход Ирани «сработает довольно хорошо» для предсказания образов, которые человек представляет, а не видит.
Переход на ЭЭГ станет «сменой правил игры», уверен Марчелло Йенка, нейроучёный и философ из Мюнхенского технического университета. После калибровки устройства под мозг конкретного пользователя компании смогут относительно легко извлекать дополнительную информацию — потенциально без согласия. Йенка допускает, что суды начнут принимать реконструкции мысленных образов в качестве доказательств.
«Я не сомневаюсь, что это добросовестное исследование, — добавляет он. — Но очевидно, что его можно перехватить для этически и социально проблемного коммерческого использования».
Ирани признаёт потенциальные риски при использовании ЭЭГ, но пока не беспокоится. «Я стараюсь думать только о хорошем», — улыбается она.
Что ж, сценарии «Чёрного зеркала» становятся всё ближе. Остаётся надеяться, что технология в первую очередь поможет тем, кто заперт в собственном теле, а не превратится в инструмент тотальной слежки. За развитием будем следить в оба.