Антибиотики из прошлого: как ChatGPT и Codex помогают искать лекарства будущего

Устойчивые к лекарствам микроорганизмы — бактерии, грибки, паразиты и вирусы — становятся всё более серьёзной глобальной угрозой. По данным исследований, только в 2021 году около пяти миллионов смертей было связано с бактериальной антимикробной резистентностью, и к 2050 году этот показатель может удвоиться.

При этом ни один новый класс антибиотиков не появился за последние 50 лет. Де ла Фуэнте считает, что отрасль зашла в тупик, потому что большинство разработок лишь модифицирует уже существующие препараты или работает с давно известными химическими классами.

⚠ Масштаб угрозы
Антимикробная резистентность (AMR) — это устойчивость микробов к антибиотикам и другим препаратам. По прогнозам ВОЗ и ряда исследований, к 2050 году от AMR будет умирать больше людей, чем сейчас от рака.

Биология как информационная система

«Антимикробная резистентность — одна из величайших экзистенциальных угроз для человечества», — убеждён Сесар де ла Фуэнте, биоинженер из Пенсильванского университета, чья лаборатория занимается поиском антимикробных кандидатов.

Основная идея его работы радикально отличается от традиционных подходов к фармакологии.

Центральная концепция состоит в том, что биология — это информационная система. «Нуклеотиды, составляющие ДНК, и аминокислоты, из которых строятся белки и пептиды (peptides — короткие цепочки аминокислот), — это своего рода алфавит», — объясняет де ла Фуэнте. Именно такой взгляд на биологию позволил его команде разработать методы, способные расшифровать организующие принципы жизни, лежащие в основе функциональных молекул. Модели глубокого обучения лаборатории обучены распознавать паттерны в биологических последовательностях и искать в обширных наборах геномных и протеомных данных потенциальные антимикробные соединения.

Такой подход позволяет сократить первоначальный поиск молекул-кандидатов с нескольких лет до нескольких часов.

«Думать о биологии как об информации — это то, что позволило нам начать расшифровывать принципы жизни, породившие функциональную молекулу» — Сесар де ла Фуэнте

Как работает система: роль ChatGPT и Codex

Наряду с собственными моделями ИИ лаборатория использует ChatGPT и Codex (система OpenAI для генерации программного кода) для мозгового штурма гипотез, написания и отладки кода, обработки наборов данных, анализа результатов и объединения идей из разных научных дисциплин.

Де ла Фуэнте описывает свою трансдисциплинарную команду, объединяющую биологов, химиков, специалистов по информатике и инженеров, и говорит, что инструменты ИИ помогают преодолевать разрыв между участниками с разным техническим бэкграундом: биологи могут создавать программы, а программисты — решать биологические задачи.

ChatGPT также позволяет участникам команды работать на родном языке, что снижает языковые барьеры и ускоряет рабочие процессы.

По словам де ла Фуэнте, общее пространство ChatGPT в лаборатории работает как совместная творческая площадка, питаемая идеями всех членов команды, — хотя он предостерегает, что результаты всегда необходимо проверять на точность.

💡 Совет для исследователей
ChatGPT и Codex не заменяют экспертизу учёного — они выступают в роли «умного ассистента», который помогает быстрее формулировать гипотезы, писать скрипты для анализа данных и находить связи между публикациями из разных областей науки.

Молекулярная де-экстинкция: антибиотики из вымерших организмов

Одно из самых захватывающих направлений работы лаборатории — поиск антимикробных молекул в геномах вымерших существ. Де ла Фуэнте называет это «молекулярной де-экстинкцией» (molecular de-extinction).

В последние годы де ла Фуэнте и его коллеги являются пионерами в области AI-поиска антимикробных соединений. Им удалось идентифицировать доклинических кандидатов в геномах современных людей, вымерших неандертальцев и денисовцев, а также шерстистых мамонтов.

В исследовании, опубликованном в Cell Host & Microbe, они изучили протеомы неандертальцев и денисовцев — наших ближайших вымерших родственников. С помощью модели машинного обучения panCleave было выявлено 69 пептидов-кандидатов из белков древних людей. Шесть из них показали активность in vivo против Acinetobacter baumannii — одного из самых опасных устойчивых к антибиотикам патогенов. Ведущее соединение Neanderthalin-1 продемонстрировало эффективность, сопоставимую с полимиксином B в модели кожной инфекции у мышей.

В отличие от попыток возродить целых вымерших существ, стратегия де ла Фуэнте по «воскрешению» отдельных биомолекул сопряжена с меньшим количеством этических проблем и может принести важные технологические преимущества.

Из давно исчезнувших генетических кодов рождаются новые соединения с такими именами, как mammuthusin-2 (из ДНК шерстистого мамонта) и mylodonin-2 (из ДНК гигантского ленивца).

ℹ Молекулярная де-экстинкция
Этот подход позволяет «воскрешать» не целых существ, а лишь их молекулы — конкретные пептидные последовательности, закодированные в ДНК вымерших видов. Современные технологии секвенирования геномов, в том числе работы нобелевского лауреата Сванте Пяэбо, делают это возможным.

Самые последние открытия: митохондрины

Совсем недавно команда использовала ИИ для изучения более 2000 древних митохондриальных геномов человека и выявила ранее скрытые пептидные последовательности с антибактериальным потенциалом. Эти молекулы были названы «митохондринами» (mitochondrins).

Экспериментальное тестирование показало, что несколько митохондринов активны против клинически значимых бактерий, в том числе лекарственно-устойчивых штаммов. Они проявляют различные механизмы действия, а один из репрезентативных пептидов снизил бактериальную нагрузку A. baumannii в мышиной модели инфекции.

Схема работы лаборатории де ла Фуэнте


graph TD
    A[🧬 Геномы живых и вымерших организмов] --> B[Deep Learning модели лаборатории]
    B --> C[Сканирование пептидных последовательностей]
    C --> D{ChatGPT + Codex}
    D --> E[Формулировка гипотез]
    D --> F[Написание и отладка кода]
    D --> G[Анализ наборов данных]
    E & F & G --> H[Молекулы-кандидаты]
    H --> I[Лабораторное тестирование]
    I --> J[Доклинические испытания на мышах]
    J --> K[Перспективные антибиотики]

Сравнение: традиционный и AI-подход к поиску антибиотиков

ПараметрТрадиционный подходПодход с ИИ (лаборатория де ла Фуэнте)
Время первичного поиска3–6 летНесколько часов
Источники молекулПочва, морские организмыГеномы всех известных существ + вымершие виды
Масштаб охватаТысячи молекулМиллионы последовательностей
ИнструментыЛабораторный скринингDeep learning, ChatGPT, Codex
Командная доступностьТребует узких специалистовБиологи и программисты работают вместе
Языковые барьерыВысокиеСглаживаются через ChatGPT

Следующий шаг: ApexOracle

В рамках текущей работы де ла Фуэнте пытается приблизить кандидатов к клиническим испытаниям. Для этого его команда разрабатывает амбициозную мультимодальную модель ApexOracle, которая должна анализировать новый патоген, выявлять его генетические слабые места, подбирать подходящие антимикробные пептиды и предсказывать, как антибиотик, построенный из этих пептидов, поведёт себя в лабораторных тестах. Эта система, по словам самого учёного, «объединяет понимание химии, геномики и языка».

Лаборатория также представила APEX-GO — генеративный ИИ для разработки улучшенных пептидных аналогов, который достигает 85% успешности при лабораторном тестировании и в 72% случаев повышает антибиотическую активность молекул.

Важные оговорки: от открытия до лекарства далеко

Даже перспективная молекула, найденная таким способом, проходит ещё годы дополнительных испытаний — на токсичность, дозировку и технологичность производства — прежде чем попадает на регуляторную проверку или клинические испытания.

Реальная суть работы более конкретна: исследовательская группа использует языковые и кодовые инструменты для поиска в биологических данных молекул, которые могут оказаться достойными тестирования. Это важно, потому что поиск антимикробных средств — это прежде всего задача поиска, и лишь потом — медицинская задача.

📝 Пример применения Codex
Биолог в команде де ла Фуэнте может описать задачу на естественном языке — например, «написать скрипт для извлечения пептидных последовательностей длиной 8–15 аминокислот из файла FASTA» — и Codex сгенерирует рабочий Python-код. Это позволяет исследователям без глубоких знаний программирования автоматизировать рутинные задачи анализа данных.
# Пример: извлечение коротких пептидных последовательностей из FASTA-файла
# (такой код может генерировать Codex по описанию задачи на естественном языке)

from Bio import SeqIO

def extract_peptides(fasta_file, min_len=8, max_len=15):
    peptides = []
    for record in SeqIO.parse(fasta_file, "fasta"):
        seq = str(record.seq)
        for i in range(len(seq)):
            for length in range(min_len, max_len + 1):
                if i + length <= len(seq):
                    peptides.append(seq[i:i+length])
    return peptides

candidates = extract_peptides("neanderthal_proteome.fasta")
print(f"Найдено {len(candidates)} пептидных кандидатов")

Почему это важно для нас

Антимикробная резистентность — это не абстрактная угроза из научных статей. В российских больницах, как и во всём мире, всё чаще фиксируются случаи инфекций, против которых стандартные антибиотики бессильны. Поиск новых молекул с иным механизмом действия — задача, актуальная для глобального здравоохранения.

Работа лаборатории де ла Фуэнте показывает: ИИ в науке — это не замена учёного, а мощный инструмент, который позволяет делать то, что раньше было физически невозможным: сканировать миллионы генетических последовательностей за часы, строить гипотезы на стыке биологии, химии и информатики, и — буквально — воскрешать молекулы из прошлого, чтобы бороться с болезнями настоящего.

Шерстистый мамонт не вернётся. Но его молекулы, возможно, спасут чью-то жизнь.