Google DeepMind представляет SynthID Bio: цифровые водяные знаки для синтетической биологии
Компания Google DeepMind представила SynthID Bio — концепт-метод маркировки генеративно-синтетических белков, позволяющий внедрять невидимые цифровые следы прямо в биологический код. Новая технология обеспечивает возможность верификации происхождения как виртуальных моделей, так и синтезированных физических молекул, не нарушая их биологическую функциональность.
# Google DeepMind introduces SynthID Bio for synthetic biology
Компания Google DeepMind анонсировала появление SynthID Bio, нового метода водяных знаков, специально разработанного для сферы синтетической биологии. Эта технология направлена на решение вопросов биобезопасности и научной честности, позволяя идентифицировать объекты, созданные с помощью искусственного интеллекта, даже после их физического синтеза.
Как работает технология
В основе SynthID Bio лежит способность адаптировать алгоритм под конкретный тип данных. Для работы с последовательностями аминокислот система subtly guiding (тонко направляет) выбор конкретных аминокислот, тогда как для прогнозирования трехмерных структур она корректирует атомные координаты. Эти изменения настолько минимальны, что становятся неразличимы визуально или в стандартных биологических тестах, но при этом создают надежный цифровой сигнал для последующей проверки.
В ходе экспериментов исследователи продемонстрировали, что вносимые изменения не влияют на биологическую функцию белка. Это критически важно, так как большинство белковых дизайнов создаются с целью лечения заболеваний или научных исследований. В качестве доказательства эффективности были протестированы белковые связывающие агенты (protein binders), разработанные с помощью методов AlphaProteo и ProteinMPNN с активацией SynthID Bio.
Результаты лабораторных тестов на трех различных белках-мишенях показали, что водняемые дизайны соответствуют таким параметрам, как: * Показатель «hit rate» (частота попадания в цель); * Аффинность связывания (сила взаимодействия); * Естественное разнообразие последовательностей.
Таким образом, были созданы первые в истории белковые связывающие агенты, которые одновременно несут в себе цифровой след и обладают полной биологической активностью.
Для работы с прогнозированием сворачивания белка (protein folding) инженеры настроили небольшую часть диффузионной сети AlphaFold 3. Это позволило внедрить функцию маркировки непосредственно в веса модели. Теперь любые прогнозируемые трехмерные координаты содержат в себе обнаружимый цифровой код независимо от того, кто и как запускает модель. Система сохраняет точность предсказаний AlphaFold 3 и демонстрирует почти идеальную обнаружимость даже при наличии цифрового шума или небольших изменений координат.
Биобезопасность и целостность данных
Подход DeepMind к биобезопасности строится на принципе многоуровневой защиты, напоминающем модель «швейцарского сыра», где различные меры безопасности перекрывают недостатки друг друга. SynthID Bio служит важным дополнительным слоем верификации, встроенным непосредственно в дизайн биологических объектов.
Эксперт по биобезопасности Сarah Кarter отметила, что связывание дизайнов с разработчиками моделей позволяет производителям синтеза ДНК упрощать процесс скрининга заказов от клиентов, использующих эти инструменты. Это особенно актуально для этапа синтеза ДНК, который находится на передовой биобезопасности. Исторически незнакомые последовательности часто ошибочно принимались за естественные, однако генеративный ИИ способен создавать принципиально новые структуры, не имеющие сходства с известными угрозами. Проверка таких случаев вручную часто затягивает исследование.
Система SynthID Bio способна предоставить автоматический сигнал, подтверждающий происхождение заказа от доверенной модели, что ускоряет процесс одобрения и позволяет сосредоточить ресурсы на действительно подозрительных последовательностях.
Кроме того, технология поможет поддерживать целостность открытых баз данных, таких как Protein Data Bank, UniProt и GenBank. Ошибочные метки в этих базах могут негативно повлиять на принятие решений в сфере биобезопасности, и с ростом количества данных от ИИ эта проблема может усугубляться. SynthID Bio может способствовать правильному помечению синтетических записей в процессе их подачи.
Будущие шаги и открытость
Компания подчеркивает, что ни одно решение по биобезопасности не является «серебряной пулей». SynthID Bio представляет собой важный первый шаг к надежной идентификации и отслеживанию биологических последовательностей и структур, созданных ИИ. В будущем исследователи планируют улучшить устойчивость водяных знаков к намеренным попыткам их изменения.
Технология также может быть объединена с подходами к метаданным происхождения, аналогичными C2PA для цифрового контента, или с центральными репозиториями данных для лучшего отслеживания.
В настоящее время команда работает над применением метода к более сложным биологическим объектам. Совместно с лабораторией Hie в Стэнфорде и Arc Institute они интегрировали SynthID Bio в Evo 2, продвинутую модель генома, для маркировки генома сконструированного бактериофага. Лабораторные тесты на культурах бактерий подтвердили работоспособность этих помеченных организмов.
В рамках приверженности ответственной инновации Google DeepMind обнародовал методы работы, открыл исходный код и данные in vitro, а также выделил веса модели для научного сообщества. Цель — обеспечить, чтобы меры безопасности и ответственности развивались в ногу с технологическими возможностями искусственного интеллекта.
Для сотрудничества по этому вопросу организация приглашает связаться по адресу synthidbio@google.com.