Как интеграция данных и «тёмные лаборатории» могут сократить сроки разработки препаратов и снизить затраты
Представьте лабораторию, где роботы и ИИ круглосуточно синтезируют, тестируют и оптимизируют потенциальные лекарства, а учёным остаётся лишь анализировать результаты. Это не фантастика — так видят будущее фармацевтики в Cytiva. Но чтобы этот сценарий стал реальностью, индустрии предстоит решить массу проблем: от нехватки качественных данных до интеграции разрозненных приборов в единую экосистему. В новом материале MIT Technology Review разбираются, как AI меняет открытие лекарств и что мешает ему совершить революцию прямо сейчас.
Проблемы с данными в AI-открытии лекарств
Главная проблема с данными в AI-открытии лекарств — это, как ни парадоксально, сами данные. Современные модели упёрлись в самую настоящую «стену данных»: обучение на одних и тех же публичных датасетах приводит к тому, что все алгоритмы приходят к одинаковым выводам, а отдача от каждой новой итерации неуклонно падает. Получается замкнутый круг — все играют по одним и тем же нотам.
Но это ещё цветочки. Куда серьёзнее — хроническая публикационная предвзятость. Научные журналы, как известно, печатают исключительно успешные кейсы. Пол Белчер из Cytiva бьёт тревогу: «Никто не хочет делиться своими неудачами». И это не просто вопрос научной этики — это прямой удар по качеству обучения AI. Модели, лишённые доступа к информации о провалах, учатся видеть только светлую сторону Луны. Где же хранятся эти драгоценные отрицательные данные? «Они похоронены в лабораторных журналах», — констатирует Белчер. Эта информация о неудачных экспериментах практически никогда не используется для обучения нейросетей, а ведь именно failure analysis мог бы дать AI недостающее понимание того, почему молекула не работает.
В довершение кошмара — фабрикация данных с помощью AI. Ирония судьбы: технология, призванная ускорить открытие лекарств, одновременно упростила подделку исходных материалов. Взять хотя бы пресловутые Western blot — стандартный метод идентификации белков. Исследование Элизабет Бик показало, что почти 4% биомедицинских статей содержат дублированные или откровенно манипулированные изображения. И это данные аж за 2016 год — ещё до того, как генеративные нейросети сделали фальсификацию делом пары кликов.
Что характерно, на проблему уже начали реагировать. Cytiva, например, выпустила инструмент Image Integrity Checker, который использует хэш-алгоритмы — да, те самые, что лежат в основе блокчейна — для проверки целостности научных изображений. Издательства уже проявляют к этой штуке живой интерес: дешёвый и сердитый способ убедиться, что картинка в статье подлинная, а не сгенерированная на коленке. Всё это лишний раз доказывает: пока индустрия не решит фундаментальные проблемы с данными, даже самый крутой AI будет лишь дорогой игрушкой, а не прорывом в открытии лекарств.
Будущее: автономные лаборатории и интеграция
Будущее открытия лекарств — это полностью автономные «тёмные лаборатории» (dark labs), работающие круглосуточно с минимальным вмешательством человека. Такие labs-in-the-loop самостоятельно циклически проходят этапы предсказания, тестирования и оптимизации, а затем передают результаты обратно в AI-модели для следующего раунда экспериментов. По словам Пола Белчера, это позволит повысить вероятность успеха кандидатов на входе в клинические испытания: лучшие стартовые точки и больше циклов оптимизации дадут более качественные препараты с меньшим количеством недостатков.
Однако автоматизация лаборатории требует серьёзной интеграции систем. Необходимы совместимые инструменты, строго структурированные и всеобъемлющие наборы данных, а также свободный обмен информацией — то есть соблюдение принципов FAIR (находимость, доступность, интероперабельность и повторное использование). «Сегодня многие приборы в лабораториях работают изолированно, — отмечает Белчер. — Можно иметь лучшую технологию в мире, но если это закрытая экосистема и пользователь не может извлечь данные, от неё нет никакой пользы».
Интегрированная инфраструктура позволит генерировать FAIR-данные в масштабе, которые будут не только использоваться в отдельных отчётах, но и обучать последующие поколения AI-моделей. Тем самым замыкается цикл между вычислительной «сухой» лабораторией (AI) и физической «влажной» лабораторией. «Наша цель — помочь учёным ускорить прорывы и сделать автономные лаборатории реальностью», — говорит Белчер.
Примечательно, что на сегодня ни одно лекарство, открытое в первую очередь с помощью AI, не получило полного одобрения FDA. Впрочем, Белчер ожидает, что это изменится в ближайшие два-три года. «Святым Граалем» AI-открытия остаётся полное in silico предсказание эффективности и токсичности, которое устранило бы необходимость в подавляющем большинстве физических экспериментов. Но путь к этому преграждают не только незрелость моделей, но и регуляторные и финансовые барьеры.
Исследование Стэнфорда показало, что стоимость обучения передовых AI-моделей с 2016 года удваивается ежегодно, добавляя давления на и без того затратную отрасль. Белчер признаёт это противоречие, но настроен оптимистично: «Я думаю, мы придём к балансу между AI и "влажной" работой — как с точки зрения затрат, так и рисков. Пока стоимость вычислений не перевесит стоимость клинической разработки, AI будет преимуществом».
Пока фармацевтика балансирует между 90% неудач и баснословными бюджетами, AI остаётся главной надеждой на ускорение и снижение рисков. Автономные лаборатории выглядят заманчиво, но путь к ним усеян не только техническими, но и регуляторными препятствиями. Одно можно сказать точно: ставки высоки, и каждый шаг вперёд в интеграции данных и моделей приближает нас к лекарствам, которые появятся на рынке быстрее и с меньшим количеством побочных эффектов.