Google DeepMind пилотирует первые в мире двойные слепые оценки моделей ИИ
Коллектив исследователей Google DeepMind совместно с партнерами из Сингапура, США и Канады запускает пилотный проект по проведению двойных слепых тестов для передовых моделей искусственного интеллекта. Этот метод использует криптографически защищенное облако, чтобы гарантировать, что модель не может «подсмотреть» тестовые вопросы до начала экзамена, а оценщики остаются в неведении относительно архитектуры оцениваемой системы.

# Google DeepMind запускает первый в мире двойной слепой тест для моделей ИИ
В мире искусственного интеллекта доверие к результатам тестов часто сталкивается с серьезной проблемой: «загрязнением бенчмарков». Это случается, когда модель анализирует вопросы еще до того, как ей предстоит ответить на них, используя информацию, полученную из открытых источников или предыдущих испытаний. Для оценки надежности ИИ такой подход неприемлем.
Google DeepMind объявила о запуске мирного «пилота» — первого в истории двойного слепого теста для собственной передовой модели класса frontier (Gemini Flash Lite). Инициатива объединила усилия корпорации с экспертами из Singapore AI Safety Institute, OpenMined, AVERI и консорциума MLCommons. Цель проекта — создать стандарт индустрии, в котором проверка безопасности и интеллекта ИИ происходит в условиях, исключающих любые возможности для подготовки ответа на основе утечки данных.
Что такое двойной слепой тест?
Для понимания масштабности нововведения полезно провести аналогию с экзаменом на профессиональную переподготовку. Представьте студента, который готовится к сложному зачету. Если он случайно увидит структуру экзаменационных билетов или примеры вопросов раньше времени, его результат перестает быть объективным доказательством знаний. Он просто вспомнит ответы, а не продемонстрирует понимание предмета.
В контексте ИИ это явление известно как benchmark contamination (загрязнение бенчмарков). Раньше при внешнем аудите существовал компромисс: либо оценщики передавали вопросы модели (рискуя, что ИИ их «запомнит» и оптимизирует ответ заранее), либо модель-разработчик передавал свои исходные коды (ставя под угрозу интеллектуальную собственность компании).
Технология двойного слепого теста устраняет эту дилемму. Ни оценщик не знает, на какой именно модели тестируется инструмент, и ни разработчик модели не знает содержания вопросов. Это достигается благодаря использованию Confidential Computing — технологии обработки данных в зашифрованном виде. Вычисления происходят внутри «криптографического ящика», где данные расшифровываются только во время активного вычисления и исчезают сразу после. Таким образом, Google не видит вопросов тестирования, а внешние партнеры не видят весов (архитектуры) модели Gemini.
Криптографическая защита данных
Ранее безопасность тестов гарантировалась в основном юридическими договорами и протоколами отсутствия логирования (zero-logging). Хотя эти меры важны, они не дают техдоказательств того, что данные действительно не просматривались «вживую».
Новый метод вводит технический барьер. Криптографические доказательства подтверждают целостность процесса: они гарантируют, что ни один участник не мог получить доступ к сырым данным другого до завершения вычислений. Это особенно критично для высокочувствительных областей, таких как кибербезопасность или государственное регулирование, где утечка промптов (запросов) или весов модели может иметь серьезные последствия.
*Интересно наблюдать за тем, как быстро меняется ландшафт безопасности ИИ. Ранее мы говорили о защите данных от внешних взломов; теперь фокус смещается на защиту самих методов проверки от манипуляций внутри процесса оценки. Это шаг от «доверим, но проверяем» к «математически доказываем надежность».*
Новый стандарт доверия
Партиципация независимых организаций, таких как Singapore AI Safety Institute, в таких тестах является ключевым фактором. Представители этих организаций подтвердят, что процесс проходил без нарушения протоколов, а результаты отражают реальные способности модели, а не её способность «спасаться» от проверки.
Успешное завершение этого пилота должно стать фундаментом для будущих отраслевых стандартов. Регуляторы, исследователи и конечные пользователи смогут с большей уверенностью принимать решения о внедрении технологий ИИ, зная, что оценки проходили в условиях максимальной прозрачности и изоляции данных.
В будущем подобные методы могут стать обязательным требованием для сертификации передовых моделей, используемых в критической инфраструктуре. Пока же DeepMind и партнеры продолжают работу над расширением методологии, стремясь сделать её доступной для всех участников экосистемы искусственного интеллекта.