Разбираем четыре альтернативных подхода, которые могут навсегда изменить индустрию искусственного интеллекта.
Серия материалов MIT Technology Review под названием «What’s Next» традиционно заглядывает за горизонт — в отрасли, тренды и технологии, чтобы показать, каким будет будущее. Остальные части цикла можно почитать на сайте издания. Но сейчас нас интересует конкретная тема, которая может перевернуть всю индустрию искусственного интеллекта.
Ещё летом 2017 года исследователи из Google опубликовали статью под названием «Attention Is All You Need», где описали новый тип нейросети — трансформер. Архитектура оказалась чертовски хороша в обработке длинных последовательностей данных, особенно текста.
Прошло девять лет. Трансформеры стали двигателями каждой крупной языковой модели на рынке. «Вся ИИ-индустрия построена на трансформерах, — говорит Джастин Дэнджел, сооснователь и CEO стартапа Subquadratic. — Это одно из важнейших изобретений в истории компьютерных наук. Они изменили мир».
Но трансформеры начинают сдавать позиции. Многие недавние прорывы в LLM — например, так называемые модели рассуждения или способность обрабатывать огромные объёмы входных данных — это не естественное развитие базовой технологии, а костыли, латающие фундаментальные недостатки архитектуры.
Всё больше учёных и инженеров задаются вопросом: что дальше? Языковые модели никуда не денутся, но подход к их созданию может кардинально поменяться. В этом году MIT Technology Review даже окрестил новое поколение моделей термином «LLM+» в своём списке десяти важнейших вещей в ИИ.
На сцену выходит волна стартапов, готовых раздвинуть границы этой бурно развивающейся технологии. Кто-то наверняка прогорит, но ставки высоки, а терять новичкам почти нечего — в отличие от лидеров индустрии.
Сила в числах
Для начала разберёмся с проблемой. Ключевая сила трансформеров — механизм плотного внимания, который кодирует смысл текста в последовательность чисел. Процесс устроен так: каждое слово (или часть слова, известная как токен) сравнивается с каждым другим словом через умножение.
Плотное внимание улавливает смысл текста с поразительной точностью. Но с ростом длины текста количество вычислений растёт в геометрической прогрессии. Документ на 10 000 слов может потребовать от трансформера 50 миллионов операций умножения. Вот главная причина, почему LLM пожирают столько энергии.
Затраты колоссальные. По словам президента OpenAI Грега Брокмана, компания в этом году потратит 50 миллиардов долларов на вычисления. А Международное энергетическое агентство прогнозирует, что к 2030 году общее потребление электроэнергии дата-центрами удвоится.
Более того, трансформеры с трудом справляются с тем, ради чего создаются новейшие модели. Из-за того, что текст обрабатывается слово за словом, держать в памяти большой объём информации одновременно им сложно — контекстное окно не может быть слишком большим. Но если LLM должны решать более сложные задачи, им потребуется обрабатывать куда больше данных: целую библиотеку документов, весь кодовый базис или, в случае агентов, вывод других LLM.
Модели рассуждений работают так: они пишут заметки сами себе (что-то вроде черновика, известного как цепочка мыслей), а потом перечитывают их. Это снова увеличивает объём данных, которые нужно удерживать в памяти.
По мере того как LLM становятся больше и лучше, трансформеры превращаются в бутылочное горлышко. Ключевая сила технологии стала её ограничением.
Вот четыре свежие идеи о том, как решить проблему трансформеров. Эти инновации способны изменить LLM навсегда, сделав их быстрее, гораздо эффективнее и, возможно, умнее.
01: Переосмысление внимания
Очевидный способ ускорить LLM и снизить их стоимость — атаковать проблему в лоб и изменить механизм внимания. Замена плотного внимания на разреженное, которое вычисляет только некоторые пары слов вместо всех, радикально сокращает объём вычислений.
Исследователи за эти годы придумали множество механизмов разреженного внимания. Беда в том, что ни один из них не сравнился с плотным вниманием по точности передачи смысла.
Возможно, всё изменилось. Стартап Subquadratic из Майами утверждает, что создал первый механизм разреженного внимания, который на нескольких задачах — включая поиск и написание кода — не уступает ведущим мейнстримным LLM. Заявление смелое, и в индустрии к нему относятся скептически.
В Subquadratic заявляют, что их модель SubQ на лету определяет, какие слова в каждом фрагменте текста важны, а какие нет. Компания также сообщает, что тысячи людей записались в лист ожидания, и обещает вскоре сделать модель широко доступной.
Тем временем стартап Manifest AI из Сан-Франциско заходит с другой стороны. Вместо изменения механизма внимания компания заменяет его чем-то принципиально иным.
Разработанный механизм под названием power retention (удержание мощности) хранит только самую релевантную информацию для конкретной задачи и не позволяет объёму данных, которые должна отслеживать LLM, разрастаться до бесконечности.
Механизмы внимания заставляют LLM держать в памяти всё содержимое контекстного окна. Модель с разреженным вниманием (вроде SubQ) выбрасывает множество отдельных слов, но всё равно сохраняет приблизительную картину всего, что видела. Power retention работает иначе: модель получает скользящую сводку своего контекстного окна. Когда добавляется новая информация, менее релевантная отбрасывается.
Базовый принцип удержания известен уже десять лет. В Manifest AI утверждают, что им впервые удалось обновить эти техники и построить модели, способные конкурировать с LLM на трансформерах.
Компания заявляет, что трансформер можно конвертировать в модель с power retention с минимальным дообучением. Для демонстрации они превратили открытую модель для кодинга StarCoder в версию PowerCoder. Также вышел релиз модели Brumby, которая, по словам разработчиков, конкурирует с некоторыми версиями популярной открытой модели Qwen от Alibaba.
В Manifest AI рассчитывают, что их технология станет стандартным решением для задач с огромным объёмом данных. Сооснователь и CTO компании Карлес Хелада в анонсирующем видео перечислил массу полезных сценариев: от анализа многочасовых видео до создания агентов, способных работать неделями.
02: Меньше размером, гибче характером
Компания Liquid AI из Кембриджа, Массачусетс, вышедшая из MIT, не стала полностью отказываться от трансформеров. Вместо этого она соединяет их с собственной технологией жидких нейронных сетей. Так родились LFM — жидкие фундаментальные модели, как называет их сооснователь и CEO Рамин Хасани.
Модели Liquid AI гораздо меньше и потребляют меньше энергии, чем большинство LLM. Компания создаёт решения для автопроизводителей, включая Mercedes. Эти модели работают на небольших чипах внутри автомобилей. Последние версии запускаются даже на Raspberry Pi — маломощном компьютере для энтузиастов за 50 долларов.
Для организаций с годовой выручкой менее 10 миллионов долларов модели доступны бесплатно. И они оказались востребованными: Хасани утверждает, что компания насчитала почти 34 миллиона загрузок.
Вдохновением для жидких нейронных сетей послужили черви. Точнее, их мозг. Это развитие другого типа нейросетей — свёрточных, которые появились раньше трансформеров. Ключевая инновация — механизм, позволяющий модели адаптировать поведение к новой информации и обучаться на ходу. Трансформеры так не умеют: после обучения их поведение зафиксировано навсегда.
Первые модели Liquid AI были довольно простыми, но умели управлять дронами и автомобилями. С LFM компания пытается масштабировать технологию, чтобы конкурировать с мейнстримными LLM. Новые модели показывают результаты на уровне конкурентов вчетверо большего размера, включая версии Qwen от Alibaba и открытую LLM Gemma от Google.
Типичная LLM — это стопка соединённых между собой трансформеров. Последние LFM от Liquid AI — гибриды: 20% трансформеров и 80% жидких нейронных сетей.
Это соотношение нашла другая ИИ-система, созданная Liquid AI. Она же помогает проектировать все модели. «Это ядро нашей компании прямо сейчас», — говорит Хасани. Дизайнерский ИИ перебирает множество комбинаций нейронных сетей — жидких, свёрточных, трансформерных — и собирает из них конструкции, попадающие в идеальную точку на шкале производительности и эффективности.
Хасани считает, что трансформеры были лишь началом. «Ваш мозг — это система AGI, и работает она на 20 ваттах. Как такое возможно? Мы можем быть гораздо изобретательнее».
03: Генерация всего текста разом
Почти все LLM выдают ответ по одному слову за раз. Логика понятна: так говорят и пишут люди. Но для компьютеров это крайне неэффективно.
Гораздо быстрее и дешевле генерировать текст целиком — выдать сразу целые предложения или абзацы. Именно такой подход выбрал стартап Inception из Пало-Альто, строящий LLM на технике, которая называется диффузией.
Большинству диффузия известна как технология, управляющая моделями генерации изображений и видео. Диффузионные модели обучаются превращать случайную сетку пикселей — как помехи на старом телевизоре — в картинку. Они работают со всеми пикселями одновременно, вычисляя, какие из них изменить, чтобы статика превратилась в фото высокого разрешения.
Оказалось, тот же процесс работает и с текстом. Inception обучила свои LLM превращать случайный набор слов в осмысленные предложения. Диффузионные LLM по-прежнему используют трансформеры для кодирования смысла, но генерация целых блоков текста разом заставляет трансформеры работать эффективнее. «Вы всё ещё используете большую трансформерную модель, но можете предсказывать множество токенов одновременно, — объясняет сооснователь и CEO Inception Стефано Эрмон. — Поэтому эти модели намного быстрее и выгоднее почти всего, что строят другие сегодня».
Главный вызов — адаптировать технологию из генерации изображений под текст. С картинками всё просто: меняя синий пиксель на красный, можно пройти через промежуточные цвета, говорит Эрмон. С текстом так не выйдет: «Между „кошкой“ и „собакой“ нет ничего промежуточного».
Эрмон также числится исследователем в Стэнфорде. В 2024 году вместе с двумя коллегами он вывел математику, позволяющую диффузионным моделям работать с текстом. Они обучили диффузионную модель, которая сравнялась по качеству с GPT-2 — LLM от OpenAI 2019 года — но была в 10 раз быстрее. Этого хватило, чтобы Эрмон запустил собственную компанию.
Сегодня он целится в высшую лигу. Inception утверждает, что её последняя модель Mercury 2 не уступает некоторым GPT-4 от OpenAI (2023 года), но снова в 10 раз быстрее. «Мы верим в этот подход, потому что он один способен масштабироваться», — заявляет Эрмон.
Важны только скорость и стоимость, добавляет он. «В конечном счёте валюта — это интеллект за доллар».
Inception не единственная, кто ставит на диффузию. Google тоже экспериментирует с этим направлением и собрала прототип LLM под названием Diffusion Gemma. Эрмона конкуренция не пугает. «Думаю, это подтверждение нашей правоты, — говорит он. — Это будущее».
04: Выход за пределы слов
Стартап Pathway, тоже базирующийся в Пало-Альто, пожалуй, самый радикальный из этой четвёрки. Он хочет освободить LLM от оков языка.
Компания построила LLM под названием Dragon Hatchling (в честь драконов из романа Терри Пратчетта «Цвет волшебства», которые материализуются, если долго о них думать). Самый впечатляющий результат — высокий балл в бенчмарке, где LLM сражались с более чем 250 000 сложнейших судоку. Dragon Hatchling решила более 97% головоломок. Несколько ведущих LLM из топ-лабораторий не решили ни одной.
Смысл затеи в том, что, несмотря на выдающиеся успехи в самых разных задачах, существуют классы проблем, где LLM пасуют. Судоку — лишь один пример. Если мы хотим, чтобы LLM предлагали по-настоящему новаторские решения реальных задач, нужно выходить за пределы трансформеров, говорит сооснователь и CEO Pathway Зузанна Стамировска.
Всё потому, что трансформеры заставляют LLM работать только с текстом. Но язык — не лучший инструмент для некоторых типов рассуждений. «Очень сложно представить доску судоку слово за словом», — объясняет Стамировска.
Pathway меняет математику внутри трансформера, заменяя механизм внимания на математическую структуру, называемую пространством состояний. Вместо кодирования информации слово за словом, пространство состояний сжимает её в более абстрактное представление. Dragon Hatchling по-прежнему может обрабатывать и выдавать текст, но также имитирует формы рассуждений, не связанные с последовательностями слов. Это делает модель эффективнее и, в теории, позволяет решать задачи, недоступные другим LLM.
Подумайте о шахматах или математике: такие задачи не хранятся в голове в виде длинного предложения, рассуждает Стамировска. «Момент озарения в вашем мозгу не обязательно рождается в языке. Мы утверждаем, что если приходится рассуждать на языке, это ограничивает».
Стамировска признаёт: обычная LLM может прочитать книгу о методах решения судоку и написать код для этого. Но цель — модели с чем-то большим, чем книжный ум. «Надежда ИИ — не в решении судоку, а в лечении рака. Книги для этого не существует».
«Трансформеры — это инженерное удобство, на которое мы наткнулись, — добавляет она. — Оно породило религию, но глупо думать, что прорыва больше не случится».
Пока одни стартапы пересобирают внимание, другие отказываются от языка как основы мышления. Индустрия явно на пороге тектонического сдвига. Что из этого выстрелит, а что останется историей, покажет время. Но наблюдать за этой гонкой — то ещё удовольствие. Продолжаем следить, и обязательно расскажем, чем всё закончится.