Назад в ленту

Почему нейросети до сих пор учат язык хуже ребенка: разрыв эффективности данных

Дети осваивают родную речь всего за 100 миллионов услышанных слов, а большим языковым моделям нужны триллионы токенов. Ученые бьются над загадкой, которая может перевернуть индустрию ИИ.

Почему искусственный интеллект до сих пор не может учить язык как ребенок: разрыв эффективности ChatGPT и LLM

Люди общаются друг с другом как минимум сто тысяч лет — насколько мы можем судить. И за всё это время в мире существовал лишь один субъект, способный освоить человеческий язык до идеальной беглости: ребенок.

Теперь их стало два.

Спустя всего четыре года после выхода ChatGPT многие уже воспринимают как должное возможность естественно болтать со смартфоном или компьютером. Нейросети вроде Claude, DeepSeek и моделей GPT от OpenAI настолько беглы и гибки, что убедительно маскируются под людей. Но стоит заглянуть за вычислительный занавес — и обнаруживается подвох: обучение компьютера человеческому языку всё ещё требует нечеловеческого объёма данных. LLM легко переваривает в сотню тысяч раз больше слов, чем человек получает за весь период освоения родной речи — и уж точно больше, чем слышит младенец к своему первому дню рождения, когда обычно начинает ухватывать язык.

«Прогресс в последнее время поразительный, — говорит Майкл С. Фрэнк, когнитивист из Стэнфорда, о больших языковых моделях. — Но нам всё равно приходится сжигать лес и соскребать всю сумму человеческих знаний, чтобы воссоздать этап, который происходит в наших гостиных за год».

Эта пропасть между детьми и машинами называется разрывом эффективности данных. И она ставит перед когнитивистами заманчивый вопрос, а перед архитекторами искусственного интеллекта — настоящий вызов: как получается, что дети до сих пор превосходят самые лингвистически изощрённые машины из когда-либо созданных?

Поиск ответов важен и для исследований ИИ, и для когнитивной науки. Последнее десятилетие языковые модели в основном становились лучше за счёт увеличения размеров. Meta* выпустила два года назад Llama 3.1 с открытыми весами — модель пережевала 15 триллионов токенов на этапе предобучения. Фронтальные модели, по словам Итана Готлиба Уилкокса, когнитивиста и лингвиста из Джорджтаунского университета, могут предобучаться на объёме в десять раз больше. Но интернет не бесконечен — и рано или поздно, возможно уже к 2030-м, колодец легко доступных данных иссякнет.

Дети показывают, что учиться большему можно с меньшим. Гораздо меньшим. Ребёнок до полового созревания, выросший в языковой насыщенной среде, мог слышать около 100 миллионов слов. Добавьте грамотность — и к 20 годам счёт дойдёт, возможно, до 300 миллионов.

Разницу в масштабах можно передать только через аналогию. «Claude видел столько языка, сколько целый город переживает за одно поколение», — говорит Уилкокс. Если напечатать на бумаге все слова, использованные для обучения современной LLM, стопка достанет до Международной космической станции. А 100 миллионов слов ребёнка сложились бы в стопку высотой всего 20 метров. И мы умудряемся обходиться куда меньшим.

Пытаясь обратным инжинирингом воспроизвести то, как учатся дети, учёные надеются создать более эффективные по данным модели ИИ. Это пригодится для всего: от тренировки ИИ на видео до создания чат-ботов для сообществ, говорящих на языках меньшинств. Проверка гипотез о человеческом обучении на машинных моделях может также разрешить застарелые вопросы о языке и развивающемся детском разуме. Рождаемся ли мы с языковым инстинктом? Возможно ли в принципе, чтобы ребёнок выучил язык исключительно из опыта? Является ли способ обработки языка причудой нашей биологии, или хотя бы часть её отражает универсальные ограничения того, как языки могут использоваться и усваиваться?

Основные элементы

Большинство из нас осознаёт, что язык — это сложно, только когда пытается выучить новый после детства. Прошедшее совершенное время, раскатистые «р» и носовые гласные, родительный падеж, фразовые глаголы, грамматически мужские столы и женские ложки — вот лишь немногие инструменты лингвистических пыток для взрослого ученика. Однако освоить родной язык обычно не составляет труда. Малыши обычно начинают выдавать грамматически правильные предложения после примерно 10 миллионов услышанных слов — или 30 миллионов по верхней планке.

«Это просто абсолютное чудо, — говорит Фрэнк. — Если натренировать GPT-2 на 30 миллионах слов, получится генератор бессмыслицы, а не ребёнок».

Как именно младенцы это провертывают — загадка. Исследователи много знают о том, что дети учат и как используют язык на разных стадиях развития, но многое остаётся неизвестным. Возможно, самый долгий вопрос: почему младенцы вообще способны выучить язык. Синтаксис человеческого языка — правила соединения слов в предложения — включает рекурсивные вложенные структуры, позволяющие выражать практически бесконечные идеи конечным запасом слов и частей слов. Казалось бы, это должно быть проблемой для младенцев. Они лишь плещутся на мелководье бездонного океана языка. И тем не менее этого достаточно. По капле они познают глубину.

Одно из решений, предложенное в 1950-х лингвистом Массачусетского технологического института Ноамом Хомским, заключается в том, что младенцы рождаются с жёстко прошитым знанием грамматики. Хомский спорил с конкурирующим взглядом психолога Б.Ф. Скиннера о том, что освоение языка полностью определяется средой. Скиннер считал, что язык усваивается через обусловливание и подкрепление — примерно как собака учится сидеть или давать лапу за лакомство. Хомский возражал, ссылаясь на «бедность стимула» — идею, что язык, особенно синтаксис, слишком сложен, а детский опыт с ним слишком «обеднён», чтобы учиться исключительно из опыта. «Его ключевой аргумент был, по сути, что язык нельзя выучить чисто на статистике», — говорит Ричард Футрелл, лингвист и когнитивист из Калифорнийского университета в Ирвайне. Вместо этого Хомский постулировал, что язык основан на наборе логических правил, и утверждал, что детям требуется врождённое знание этих правил, чтобы вывести грамматику своего языка из обрывков речи.

«Это просто абсолютное чудо… Если натренировать GPT-2 на 30 миллионах слов, получится генератор бессмыслицы, а не ребёнок».

Майкл С. Фрэнк, когнитивист, Стэнфордский университет

Взгляд Хомского на язык доминировал в лингвистике США десятилетиями под названием «генеративная грамматика». И он сильно повлиял на компьютерные науки в 1950–60-е, когда ИИ переживал первый бум, а границы между лингвистикой и обработкой естественного языка растворились в потоке военного финансирования — Пентагону требовались компьютеры, понимающие английский и переводящие русский.

Несмотря на ранние успехи простых нейросетей, которые научились распознавать и воспроизводить статистические паттерны, исследователи ИИ в США в основном переняли систему, основанную на правилах, вдохновлённую теориями Хомского. Они пытались учить язык компьютеры, явно прописывая правила в программы — представьте не погружение в языковую среду, а уроки грамматики. Этот подход, часть более широкого направления символьного ИИ, преобладал десятилетиями. И в основном провалился: модели, способные работать с человеческим языком в масштабе, так и не появились. Интерес к обработке естественного языка затих в «ИИ-зиму», начавшуюся в 1970-х.

Впоследствии нейросети начали возвращаться. Но только в 2010-х, когда компьютерное железо стало дешёвым и мощным, а интернет — огромным, их производительность начала привлекать внимание. К 2018–2019 годам модели BERT и GPT-2, построенные на новой архитектуре — трансформере — и обученные на миллиардах токенов, дали инсайдерам понять: обучение на огромном количестве данных может работать для языка. В 2022-м с прорывным успехом чат-бота OpenAI ChatGPT это стало очевидно всем.

LLM — это не мозги. Это мощные статистические обучающиеся машины — наивные распознаватели паттернов, лишённые любых эволюционных биологических особенностей, встроенных в человеческую кору. Другими словами, это именно то, что генеративный лингвист два десятилетия назад счёл бы неспособным выучить язык. И тем не менее они тут, пишут убедительные сонеты и проходят тесты по грамматике.

«Каким бы скептичным вы ни были относительно ИИ, одна вещь действительно впечатлила всех: эти штуки усваивают синтаксис, — говорит Элисон Гопник, психолог развития из Калифорнийского университета в Беркли. — Я не думала, что это окажется правдой. И большинство людей, думаю, тоже не верили, что можно просто взглянуть на статистику большой выборки языка и разобраться в грамматике».

Но что насчёт обучения на маленькой выборке языка — детского масштаба, скажем? Возможно ли построить модель беби-масштаба, которая была бы чем-то большим, чем генератором бессмыслицы?

Справка по теме (FAQ)
Почему детям нужно меньше данных, чем нейросетям?
Это называется разрывом эффективности данных. Ребенок к подростковому возрасту слышит около 100 миллионов слов, а современные LLM обучаются на триллионах токенов. При этом дети достигают беглого владения языком, а GPT-2 на 30 миллионах слов генерирует бессмыслицу. Точная причина пока неизвестна.
Что такое разрыв эффективности данных?
Это пропасть между объемом данных, необходимым человеку и большой языковой модели (LLM) для освоения языка. Ребенку хватает миллионов слов, а нейросетям — сотен миллиардов и триллионов токенов. Ученые пытаются понять, как дети добиваются такого результата.
Какие нейросети упоминаются в контексте проблемы?
В статье речь идет о ChatGPT от OpenAI, а также моделях Claude, DeepSeek, Llama 3.1 от Meta* и GPT-2. Именно на примере этих систем исследователи демонстрируют разницу в объемах данных и эффективности обучения.
Что такое BabyLM Challenge?
Это ежегодное соревнование (workshop при EMNLP), в котором команды соревнуются в обучении языковых моделей на ограниченном объеме данных, сопоставимом с тем, что получает ребенок. Цель — создать более эффективные по данным нейросети и проверить гипотезы о человеческом обучении.
* Деятельность организации «Компания Meta (социальные сети Instagram и Facebook)» признана экстремистской и запрещена в РФ.