Геномные языковые модели: ИИ, который научился писать ДНК

Если большие языковые модели учатся на текстах, то геномные языковые модели (GLM) учатся на ДНК — той же последовательности из четырёх букв, из которой состоит любой живой организм. В выпуске подкаста Latent Space Эрик Нгуен, CEO и сооснователь Radical Numerics и один из создателей моделей EVO, рассказал, как эта идея из академического эксперимента превратилась в направление, где генеративный ИИ одновременно открывает огромные возможности для медицины и создаёт риски, о которых индустрия только начинает всерьёз говорить.

От чтения ДНК к её генерации

Первые версии таких систем — HyenaDNA, а затем EVO — решали конкретную инженерную проблему: геном длинный, и обычные трансформеры с их ограниченным контекстным окном плохо с ним справлялись. Использование свёрточной архитектуры вместо attention позволило довести контекст до миллиона токенов и уловить дальние взаимосвязи в последовательности — то, что в естественных языковых моделях называют «context rot», только применительно к нуклеотидам ещё острее.

Настоящий сдвиг произошёл, когда EVO научили не просто читать, а генерировать ДНК. Модель самостоятельно спроектировала работающую CRISPR-Cas систему и — что стало поворотным моментом для всей области — впервые в истории сгенерировала с нуля функциональный геном целого организма, бактериофага. До этого биологи могли комбинировать существующие фрагменты ДНК, но не создавать геном «с чистого листа».

Гонка вооружений в биобезопасности

Именно этот эксперимент заставил команду задуматься не только о возможностях, но и об ответственности. Модель, которая хорошо умеет генерировать последовательности, по словам Нгуена, структурно является и хорошим дискриминатором — она способна с высокой точностью предсказать, патогенна последовательность или нет. Отсюда родился «двойной мандат» Radical Numerics: компания, создающая инструменты дизайна биологических молекул, обязана параллельно строить средства защиты.

Существующие защитные механизмы вроде отказа чат-ботов обсуждать вирусы работают на уровне естественного языка и легко обходятся. Настоящая защита, считает Нгуен, должна работать на уровне самой биологической последовательности — в системах мониторинга и раннего обнаружения патогенных сиквенсов, вплоть до задач национальной безопасности. Это тот редкий случай, когда разработчик передовых генеративных возможностей открыто говорит: чем мощнее design-модель, тем сильнее должна быть defense-модель, и делать их должна одна и та же команда, потому что архитектурно это одна и та же технология.

Omni: от демонстрации возможностей к практической пользе

Если EVO и EVO 2 были, по признанию самого CEO, скорее proof-of-concept — конкурентоспособными, но не превосходящими специализированные инструменты на человеческой геномике, — то новая модель Omni сделала ставку на то, что в LLM-индустрии называют alignment и mid/post-training. Базовая претренировка учит модель статистике генома, но не формату «вопрос — ответ»: чтобы модель по запросу оценивала патогенность мутации или искала причинный вариант заболевания, её нужно доучить на структурированных задачах — почти как instruct-тюнинг обычных LLM.

Результат — на бенчмарках вроде ClinVar и TraitGym Omni обходит не только предыдущие геномные языковые модели, но и специализированные supervised-инструменты вроде Borzoi, причём особенно заметен разрыв в некодирующих регуляторных областях генома — той самой части (около 98% ДНК), где скрывается большинство болезнетворных мутаций и где классические биоинформатические методы традиционно слабы.

Chain-of-thought для проектирования молекул

Отдельный и, пожалуй, самый неожиданный результат — перенос идеи chain-of-thought из мира LLM в биологию. Команда показала модели последовательность РНК-аптамеров с постепенно растущим «фитнес-скором» связывания и попросила продолжить тренд. Omni экстраполировала последовательности с более высокой эффективностью связывания, чем те, что видела в обучающих данных, — результат сейчас проверяется в мокрой лаборатории. Тот же принцип компания планирует применить к дизайну бактериофагов против антибиотикорезистентных бактерий и белков для селективного извлечения редкоземельных металлов — задачам, где данные естественным образом организованы как последовательность экспериментов с растущим качеством.

Почему это важно

История Radical Numerics — хороший пример того, куда движется прикладной генеративный ИИ за пределами текста и кода: длинный контекст, унификация задач под один чекпоинт без дообучения под каждую и, главное, осознанное встраивание защитных механизмов в саму разработку модели, а не постфактум. Для разработчиков ИИ-агентов и MLOps-инженеров это конкретный кейс переноса паттернов alignment на нетекстовые домены; для биотеха и фарминдустрии — сигнал, что геномные языковые модели готовы к клиническим задачам вроде поиска причинных мутаций у пациентов с неясным диагнозом; а для регуляторов и политиков — аргумент в пользу того, что вопросы биобезопасности в эпоху генеративного ИИ нельзя откладывать на потом.

Latent Space — подкаст для AI-инженеров. Источник: видео «🔬Bio-security is an AI Arms Race — Eric Nguyen (CEO, Radical Numerics)».

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *