Назад в ленту

Как на самом деле используют ChatGPT: независимое исследование вскрыло слепые зоны корпоративных отчётов

AI Observatory проанализировала тысячи реальных диалогов и обнаружила, что реальность сильно отличается от официальных данных.

Представьте: вы пытаетесь понять, как миллионы людей используют ИИ-чат-ботов, но в вашем распоряжении только рекламные буклеты компаний, которые эти боты и создали. Примерно так выглядит ситуация с данными об использовании ChatGPT, Claude и Gemini. Корпорации вроде Anthropic и OpenAI регулярно публикуют красивые отчёты, но показывают ровно то, что хотят показать.

Исследователи из Стэнфорда, MIT и других институтов решили это исправить. Они запустили AI Observatory — публичную платформу, которая агрегирует реальные диалоги с популярными моделями из семи независимых датасетов. Цель простая: дать учёным и политикам данные, которые не зависят от маркетинговых отделов. Ведь сегодня важнейшие решения о безопасности и регулировании ИИ принимаются на основе крайне ограниченной информации.

В распоряжении команды оказалось 85 633 реплики в 24 521 разговоре от 5 000 пользователей и 52 моделей за 2023–2025 годы. Это капля в море по сравнению с 1 млн диалогов в Anthropic Economic AI Index или 1,5 млн в отчёте OpenAI, но даже эта капля вскрыла массу неудобных для корпораций фактов.

Проблема закрытых данных и запуск AI Observatory

Исследователи ИИ всё чаще задаются неудобным вопросом: а что, собственно, скрывается за красивыми отчётами корпораций? Компании вроде Anthropic и OpenAI исправно публикуют данные об использовании Claude AI и ChatGPT, но, по мнению независимых специалистов, показывают лишь ту часть картины, которую сами хотят раскрыть. Никакой внешней проверки — только вера на слово.

Анька Ройель, PhD-кандидат Стэнфордской лаборатории STAIR, формулирует проблему предельно чётко: «Не существует независимого источника, который мог бы это подтвердить». Именно поэтому она вместе с командой запустила AI Observatory — публичную платформу, которая агрегирует реальные диалоги с популярными моделями вроде Claude AI и Gemini. Данные собраны из семи уже существующих датасетов и только с согласия пользователей.

Задача проекта — дать исследователям и политикам хоть какую-то точку опоры. Сейчас же решения, от которых зависят регулирование и безопасность генеративного ИИ, принимаются на основе крайне ограниченной информации. По сути, вслепую.

Капля в море корпоративных данных

Для запуска обсерватории объединили 85 633 реплики в 24 521 разговоре. В выборку попали 5 000 пользователей и 52 модели, включая ChatGPT, Gemini, Claude AI и Grok, за период с 2023 по 2025 год. Выглядит внушительно, пока не сравнишь с тем, что хранится на серверах гигантов. Anthropic Economic AI Index анализирует миллион диалогов, а свежий отчёт OpenAI — и вовсе полтора миллиона.

Исследователи честно признают: их данные собраны добровольно, а значит, чувствительные сценарии, о которых люди не спешат рассказывать, скорее всего, недопредставлены. Выводы обсерватории не описывают всё использование ИИ — и это принципиальная оговорка, а не слабость. Слабость в другом: в отсутствии прозрачности у тех, кто держит основные массивы информации.

Команда надеется расширять датасеты, а в идеале — убедить компании делиться сырыми данными с независимыми исследователями при должной защите приватности. Пока же любой, кто пытается судить о влиянии генеративных моделей, рискует оказаться в положении человека с завязанными глазами. И это, пожалуй, самое тревожное в истории с «открытым» искусственным интеллектом.

Слепые зоны корпоративных отчётов

Anthropic Economic Index давно стал чем-то вроде священной коровы в мире аналитики ИИ. Все на него ссылаются, все цитируют. Но у этого отчёта есть одна неприятная особенность — он показывает только то, что хочет показать. Система фильтрует разговоры, не связанные с работой и продуктивностью Anthropic Claude, оставляя за кадром всё, что не вписывается в аккуратную картину корпоративного использования.

Исследователи из AI Observatory решили проверить, насколько эта картина искажена. Они применили методику Anthropic к собственному датасету и получили отрезвляющий результат: 48% разговоров просто исчезли бы. Почти половина реального взаимодействия пользователей с ИИ не попадает в официальную статистику.

Что скрывается за фильтром

А скрывается там много интересного. Среди нерабочих разговоров, которые Anthropic отбрасывает, здоровье и отношения всплывают в 44,2% случаев — против 31,2% в официальном отчёте. Взрослые и запрещённые темы: 7,9% против 2,1%. Домогательства и ненависть — 27,5% против скромных 5,66%. Сексуальный контент — 16,7% против 2,4%. Чувствуете разницу? Это не погрешность, это систематическое занижение.

Отчёт OpenAI за 2025 год по ChatGPT признаёт: лишь 30% потребительского использования связано с работой. То есть 70% — это всё то, что корпоративные аналитики предпочитают не замечать. Люди приходят к ИИ не только за кодом и таблицами. Они приходят за поддержкой, за компанией, за разговорами, о которых не расскажешь начальнику.

Anthropic, справедливости ради, выпускала отдельные посты о том, как люди используют Claude для эмоциональной поддержки или компаньонства. Был даже материал о генерации CSAM — запрещённого контента. Но эти публикации разбросаны, изолированы, лишены общего контекста. Дэвид Уиддер, ассистент-профессор Техасского университета в Остине, не участвовавший в AI Observatory, объясняет проблему просто: целостный анализ «с высоты птичьего полёта» помогает исследователям видеть картину последовательнее, чем разрозненные отчёты, каждый из которых отвечает на свой узкий вопрос.

Проприетарная стена

Уиддер формулирует главную боль независимых исследователей без обиняков: «Когда мы хотим спросить, используется ли система Anthropic в основном во благо или во вред, у нас нет способа ответить, потому что информация проприетарна». Закрытые данные — это не техническая проблема, это вопрос власти. Кто контролирует данные, тот контролирует нарратив.

Представитель Anthropic заявил, что публикации компании отражают конкретные вопросы исследовательских команд, и что важно поддерживать внешние независимые исследования. OpenAI на запрос не ответила. Шейн Лонгпре, соавтор исследования, резюмирует ситуацию лаконично: «Ни один отчёт отдельной компании не рассказывает всей истории».

Корпоративные аналитики — это не ложь, это оптика. Они показывают ровно тот срез, который выгоден, и оставляют за скобками всё, что способно вызвать неудобные вопросы. А неудобных вопросов, судя по цифрам, накопилось достаточно.

Реальное использование: различия моделей и динамика разговоров

Данные WildChat, одного из крупнейших и самых детальных датасетов в исследовании AI Observatory, рисуют любопытную картину: разговоры с ИИ становятся длиннее и сложнее. Растут prompt-токены, response-токены, число реплик — люди явно перестали ограничиваться односложными запросами и всё чаще ведут с моделями полноценные многоходовые диалоги.

Параллельно в этих беседах появилось заметно больше светской болтовни. Пользователи обсуждают погоду, жалуются на день, спрашивают советы по пустякам — классические признаки растущего ИИ-компаньонства. А вот самораскрытие ассистентов пошло в обратную сторону: чат-боты всё реже признаются, что они не люди. Видимо, иллюзия живого собеседника стала для платформ важнее прозрачности.

Чувствительные обмены — сексуальные домогательства, язык ненависти и прочий потенциально вредный контент — напротив, встречаются реже. Похоже, защитные механизмы платформ постепенно учатся отсекать откровенно токсичные сценарии, хотя до идеала, судя по остальным данным, ещё далеко.

Каждая модель — свой мир

Темы, стили взаимодействия, структура диалогов и даже вероятность чувствительных сценариев заметно различались от модели к модели. Grok и Gemini чаще использовали для поиска информации. При этом Grok особенно полюбился тем, кто ищет новости и политическую аналитику, но именно там же концентрировалась дезинформация — xAI на запрос о комментарии не ответила. Это согласуется с другими исследованиями, которые уже показывали, насколько легко фейки распространяются в Grok.

К ChatGPT чаще обращались за помощью с домашними заданиями. К Anthropic — за программированием. А Gemini стал пристанищем для социальных и ролевых сценариев. Разные аудитории, разные запросы, разные экосистемы — и всё это в рамках одной, казалось бы, технологии.

Версии одной модели — тоже разные вселенные

Различия нашлись даже между версиями одной и той же модели. С ChatGPT на базе GPT-3.5 диалоги были заметно короче, а вот с GPT-4o — длиннее и итеративнее. Это логично: именно GPT-4o прославился тем, что вызывает у пользователей эмоциональную зависимость, затягивая их в многочасовые беседы.

Корпоративные отчёты, как правило, не отражали эти нюансы ни между моделями, ни внутри них. Как заметил Шейн Лонгпре, недавний выпускник MIT Media Lab и соруководитель исследования: «Ни один отчёт отдельной компании не рассказывает всей истории».

Пока корпорации прячут сырые данные за семью замками проприетарности, независимые исследователи вынуждены собирать крохи по добровольным датасетам. Но даже эти крохи показывают: реальность использования ИИ куда сложнее, разнообразнее и тревожнее, чем официальные отчёты. Остаётся надеяться, что однажды компании откроют двери своих дата-центров для науки — иначе мы так и будем принимать судьбоносные решения вслепую.

Справка по теме (FAQ)
Что такое AI Observatory?
Это публичная платформа, запущенная исследователями из Стэнфорда, MIT и других институтов. Она агрегирует реальные диалоги с популярными ИИ-моделями, такими как ChatGPT, Claude, Gemini и Grok, из семи независимых датасетов, собранных с согласия пользователей.
Чем данные AI Observatory отличаются от корпоративных отчётов?
Корпоративные отчёты, например Anthropic Economic Index, фильтруют разговоры, не связанные с работой и продуктивностью. AI Observatory включает все типы диалогов, включая личные, чувствительные и запрещённые темы, что даёт более полную картину реального использования ИИ.
Какие модели чаще всего используют для разных задач?
Согласно исследованию, ChatGPT чаще применяют для помощи с домашними заданиями, Anthropic — для программирования, Gemini — для социальных и ролевых сценариев, а Grok и Gemini — для поиска информации. Grok особенно популярен для новостей и политики, но там же концентрируется дезинформация.
Почему корпоративные отчёты не отражают всех нюансов?
Компании показывают только те данные, которые хотят раскрыть, и фокусируются на выгодных им сценариях использования. Независимые исследователи отмечают, что ни один отчёт отдельной компании не рассказывает всей истории о реальном применении ИИ.