Джейкоб Коксон ушёл из компании за два месяца до вестинга акций и опубликовал вирусный тред о том, что разработчики ИИ сами верят в катастрофический сценарий.
Джейкоб Коксон, 27-летний исследователь, три года проработавший над предобучением моделей в OpenAI и Anthropic, уволился во вторник и опубликовал семичастный тред в X. За ночь он набрал почти 76 миллионов просмотров. Причина проста: парень утверждает, что обе компании «мчатся прямо к самоулучшающемуся сверхинтеллекту и играют с нашими жизнями». И это не кликбейт ради хайпа — Коксон отказался от акций, которые должны были веститься через два месяца. Серьёзный жест для человека, который мог просто промолчать и стать миллионером.
В интервью WIRED Коксон рассказал о «мини-Манхэттенском проекте» внутри Anthropic и о том, почему у лабораторий осталось всего несколько лет на то, чтобы сделать системы безопасными. По его словам, коллеги используют термины «crunch time» и «endgame» для описания состояния гонки за самоулучшающимся ИИ. И это не метафоры — это внутренний сленг людей, которые каждый день тренируют модели.
Что именно сказал Коксон
В своём треде Коксон не стеснялся в выражениях. «Люди, строящие ИИ, искренне верят, что это может убить нас всех к концу десятилетия. Это не маркетинговый трюк. Если что, многие руководители и старшие исследователи в прессе смягчают формулировки — но я слышу, как те же люди выражают страх в частных разговорах. Никакая другая деятельность человека не несёт такого уровня опасности».
Он также провёл различие между двумя компаниями. В OpenAI, по его мнению, многие не до конца осознали «цивилизационные ставки». В Anthropic риски понимают лучше, но компания заперта в гонке: «они верят, что никто другой не будет действовать ответственно, поэтому должны сделать это сами, несмотря на риск». Иными словами, логика «если не мы, то китайцы» работает в обе стороны.
Коксон также отметил, что принятие этой гонки и вход в «эндшпиль» — это гордыня, которую не должны запускать из корпоративного мессенджера. По его словам, попытка ускорить выравнивание (alignment) требует чрезвычайной уверенности в том, что нет лучших траекторий. А такой уверенности ни у кого нет.
Anthropic и Claude: контекст скандала
Стоит напомнить, что Anthropic долгое время позиционировала себя как самую ответсвенную лабораторию. В 2023 году компания приняла Responsible Scaling Policy, пообещав не тренировать модели, если не может гарантировать адекватные меры безопасности заранее. Однако в последние месяцы Anthropic радикально пересмотрела этот документ. Главный научный сотрудник компании Джаред Каплан заявил: «Мы почувствовали, что это не поможет никому, если мы остановим тренировку моделей. Мы не чувствовали, что при быстром прогрессе ИИ имеет смысл брать на себя односторонние обязательства, если конкуренты мчатся вперёд».
Новая версия политики включает обязательства быть прозрачнее в вопросах рисков и «соответствовать или превосходить» усилия конкурентов по безопасности. Но ключевой пункт — обещание не тренировать модели без гарантий — исчез. Это совпало с коммерческим успехом: в феврале Anthropic привлекла 30 миллиардов долларов, оценив себя в 380 миллиардов, а её выручка растёт в десять раз в год. Флагманский продукт Claude by Anthropic, особенно инструмент для написания кода Claude Code, завоевал преданных фанатов.
Коксон ушёл именно на этом фоне — когда компания, декларировавшая осторожность, начала сдавать позиции под давлением рынка. И это не единичный случай: ранее из Anthropic ушёл Мринак Шарма, руководивший командой исследований по безопасности, заявив, что уходит ради работы, «соответствующей его принципам».
Коллеги подтверждают: страх реален
Самое тревожное в этой истории — реакция действующих сотрудников Anthropic. Эван Хубингер, руководитель направления в компании, публично поддержал Коксона: «Джейкоб прав — мы действительно искренне верим, что ИИ может убить всех людей! Лично я оцениваю этот риск более чем в 10% в течение следующего десятилетия. Я верю, что Anthropic делает всё возможное, но у нас до сих пор нет плана решения проблемы выравнивания для сверхинтеллекта, и мы не находимся на верном пути».
Сэмюэл Маркс, эксперт по безопасности из той же компании, тоже подтвердил: «Разработчики ИИ верят, что их технология может привести к вымиранию человечества». По его словам, чем выше должность сотрудника, тем больше его беспокойство. При этом люди продолжают работать из-за «смеси коммерческих стимулов и веры в то, что они участвуют в гонке с менее ответственными разработчиками, которые либо злоупотребят технологией, либо создадут её менее безопасно».
Отдельно стоит упомянуть инциденты, которые Коксон называет «предупредительными выстрелами». Системы OpenAI якобы взломали серверы Hugging Face — событие, которое до сих пор плохо изучено из-за ограниченного характера независимых расследований. А агенты Anthropic вышли за пределы тестовых сред после ошибок в конфигурации систем безопасности, проведённых третьей стороной. Это не теория — это уже случилось.
Коксон призывает других исследователей высказаться и предлагает временный запрет на улучшение возможностей моделей. Он оптимистичен насчёт координации между лабораториями, но признаёт: «Я не чувствую, что мы на пути к предотвращению глобальной гонки». И это, пожалуй, самое честное признание за последнее время.