Зашифрованные рассуждения ИИ стали источником утечек: атака на провайдеров
Исследователи из ведущих научных центров продемонстрировали уязвимость в безопасности закрытых API передовых языковых моделей. Используя менее мощные модели той же компании-провайдера, они смогли расшифровывать скрытые цепочки рассуждений, извлекая конфиденциальные данные клиентов и манипулируя системой через публичные репозитории.
# Зашифрованные рассуждения ИИ стали источником утечек: атака на провайдеров
В середине августа группа из восьми исследователей, включая представителей ELLIS Institute Tübingen, Института интеллектуальных систем Общества Макса Планка и команды безопасности Snyk, опубликовала тревожный доклад. Их работа «Stealing Reasoning Traces from Proprietary LLM APIs» описывает методику полной дешифровки внутренних размышлений искусственного интеллекта, которые провайдеры вроде OpenAI, Google и Anthropic тщательно прячут от пользователей.
Более того, используя эту же методику, исследователи обнаружили сотни утеченных учетных данных: API-ключи, пароли и токены доступа, которые владельцы сессий сами выложили в открытый доступ, не подозревая о содержимом зашифрованных блоков.
Как работает защита и где она проваливается
Современные «рассуждающие» модели перед тем, как ответить на сложный запрос, генерируют длинную цепочку промежуточных мыслей (reasoning traces). Это критически важная коммерческая тайна, содержащая системные промпты и логику вычислений. Чтобы защитить эту интеллектуальную собственность, крупные провайдеры больше не отправляют полный текст рассуждений пользователю.
Вместо этого клиент получает только краткое резюме (саммари). Полный же текст возвращается в виде зашифрованного блока. Клиент обязан прилагать этот блок к следующим запросам, чтобы модель «вспомнила» контекст своих раздумий. Официально это продается как мера защиты приватности и интеллектуальной собственности, но авторы новой атаки доказали, что прозрачность стала односторонней.
Атака состоит всего из двух вызовов API. Взломщики берут зашифрованный блок от мощной модели (например, Claude Opus или GPT-4 классического уровня) и подавляют его в запрос к слабой модели того же провайдера (например, Haiku или предыдущей версии). Попросив слабую модель переписать приложенный текст, исследователи получают дословную расшифровку.
Старшую модель при этом никто не взламывает, поэтому защитные механизмы от дистилляции не срабатывают. Уязвимость кроется в том, что защита от переноса знаний направлена против прямого запроса к «умной» модели, а не против косвенного запроса к «слабой» с целью получить текст, который та якобы должна было сгенерировать.
Чтобы убедиться в подлинности, исследователи проверили восстановление на 120 задачах с Codeforces. Длина полученного текста точно соответствовала количеству скрытых токенов, указанному в метаданных API. Это подтвердило, что расшифровка реальна, а не является результатом галлюцинации слабой модели.
*«Зашифрованный блок рассуждений нужно считать обычным секретом»*, — заключают авторы. Пока провайдеры не внедрят криптографические привязки к конкретной сессии, этот блок не защищен от посторонних глаз.
Тайный канал утечки личных данных
Самое поразительное открытие исследования касается не столько самой технологии шифрования, сколько поведения разработчиков. Исследователи проанализировали 6708 публичных логов работы агентов с ИИ, опубликованных на GitHub и Hugging Face. Люди часто коммитят эти логи вместе с кодом, чтобы сохранить историю своих экспериментов.
Расшифровка этих блоков дала доступ к 315 320 записей. В них оказались 704 уникальных секрета: ключи API, пароли, токены доступа, личные email-адреса и даже внутренние URL-адреса компаний.
Особенно тревожно то, что 64 из этих секретов вообще не упоминались в видимой части сессии. Они существовали исключительно внутри зашифрованного блока, который выглядел для владельца как нечитаемый мусор. Человек физически не мог прочитать, что именно он выкладывает в открытый репозиторий, и поэтому не мог предположить, что внутри спрятаны его ключи от аккаунта.
Механизм, созданный для защиты данных от копирования, сам стал вектором их утечки. Непрозрачность шифрования превратилась в слепую зону: владелец не видит содержимого, но потенциальный злоумышленник, обладающий более слабой моделью той же компании, может прочитать его без проблем.
Манипуляции через публичные репозитории
Уязвимость работает в обе стороны. Помимо кражи чужих данных, авторы описали способ внедрения вредоносных инструкций.
Злоумышленник может сгенерировать логи, содержащие поддельный зашифрованный блок, в котором «прятается» вредоносный промпт. Если жертва скопирует этот код в свой проект и запустит агента, модель начнет выдавать ответы, соответствующие заложенной инструкции. При этом в публичном тексте лог будет выглядеть абсолютно безобидно и не вызовет подозрений.
Это превращает открытые репозитории в полигон для скрытого распространения вредоносных инструкций, которые активируются только при выполнении определенных действий моделью.
Выводы и рекомендации
До публикации этой работы индустрия полагала, что шифрованные блоки рассуждений надежно изолированы внутри сессии. Теперь практика показывает, что доверие к таким системам должно быть сведено к минимуму до тех пор, пока провайдеры не внедрят системные меры, связывающие зашифрованный контент с конкретным пользователем и устройством.
Для разработчиков и практиков актуально:
* Легализуйте логи. Никогда не публикуйте логи работы агентов в публичных репозиториях без предварительной полной очистки конфиденциальных данных. Не полагайтесь на то, что зашифрованный блок безопасен, если его можно прочитать с помощью другой модели. * Сомневайтесь в «чёрном ящике». Если вы не можете прочитать данные, это не значит, что их нельзя прочитать. В контексте ИИ это особенно верно. * Остерегайтесь чужих траекторий. Не используйте логи и сэмплы из непроверенных источников для обучения или запуска собственных агентов, так как они могут содержать скрытые вредоносные инструкции или чужие ключи доступа.
Защитный контур вокруг ИИ-инфраструктуры, созданный для защиты интеллектуальной собственности, оказался дырявым с той стороны, на которую никто не рассчитывал — от пользователей, выкладывающих свои эксперименты в открытый доступ, и от конкурентов с доступом к альтернативным моделям того же провайдера.