Антропик · Claude · Искусственный интеллект · Водяные знаки · EU AI Act · Технологии · Прозрачность ИИ · Безопасность данных15 августа в 22:01 · 4 мин

Антропик раскрывает механизм водяных знаков в текстах Claude: как это работает и можно ли скрыть след

Антропик опубликовала подробное техническое разъяснение внедрения систем водяных знаков в генерируемые моделью Claude тексты. Данная мера необходима для соблюдения требований Прозрачности кода ЕС (EU AI Act) и направлена на достоверное определение искусственного происхождения контента, не влияя на его стилистику и качество.

# Антропик разъясняет работу водяных знаков вClaude

Компания Anthropic выложила в своём блоге пост, посвящённый деталям реализации новых водяных знаков в текстовом интерфейсе своего ИИ-ассистента Claude. Публикация была создана в ответ на растущее число вопросов от сообщества разработчиков и пользователей касательно алгоритмов маркировки, устойчивости знаков к редактированию и специфики их применения в кодовом окружении.

Решение о внедрении этой технологии стало реакцией на недавние изменения в законодательстве Европейского Союза. Новый регламент, известный как Транспарентный кодекс ЕС (EU AI Act), обязывает создателей искусственного интеллекта внедрять технические системы, позволяющие надёжно идентифицировать контент, сгенерированный алгоритмами.

Принцип работы и влияние на качество текста

Суть новой системы строится на использовании метода SynthID-Text, технология, базовые принципы которой были разработаны командой Google DeepMind ещё в 2024 году. По словам представителей Антропик, система встраивает в текст незаметный для человеческого восприятия паттерн. Этот код становится видимым только для тех, кто обладает специальным ключом дешифровки.

Компания подчеркнула, что применение водяных знаков не влияет на стилистические качества генераций модели. Для обычного читателя, не имеющего технических ключей доступа, ответ модели остаётся неразличимым как от обычного текста, так и от воды помеченного.

Важно отметить разницу между этой новой технологией и существующими на рынке детекторами ИИ. Такие сервисы, как Pangram, часто ищут характерные языковые маркеры — специфическую «речь машины», например, конструкцию «это не [X], это [Y]». Антропик уточняет, что поиск этих поверхностных паттернов кардинально отличается от проверки наличия криптографического водяного знака, который встраивается на уровне выбора низкоуровневых элементов текста.

Во время создания текста модель принимает множество мелких решений: выбор между словами «хмурое» или «пасмурное», синонимами и другими вариациями. Именно в этих моментах «бесплодных» выборов, не влияющих на смысл предложения, алгоритм оставляет след, который невозможно обнаружить без ключа.

Устойчивость к редактированию и код

Одним из ключевых вопросов, поднятых сообществом, является судьба водяного знака при доработке текста человеком. Согласно разъяснениям Антропик, легкое редактирование, например, замена нескольких слов или исправление грамматики, с высокой вероятностью не позволит полностью удалить водяной знак. Однако если текст подвергнется полной переработке, при которой каждое исходное слово будет заменено, след может быть стёрт.

В последнем случае компания сама указывает на парадокс: если текст полностью переписан вручную, то говорить об «искусственно генерированном контенте» становится дискуссионным вопросом, даже если исходная идея принадлежала алгоритму.

Интересные нюансы возникают при работе с текстами, которые были лишь отредактированы ИИ. В таких случаях наличие знака зависит от объёма текста и глубины изменений. Если редактор внес лишь минимальные правки в черновик, написанный человеком, то подавляющее большинство слов останется за автором, и водяному знаку не будет за что «зацепиться».

Особое внимание уделено генерации кода. Антропик отмечает, что в программном обеспечении у модели гораздо меньше свободы выбора: она должна предложить рабочий, функциональный вариант, а не вариации синонимов. Поэтому интенсивность водяного знака в коде будет значительно ниже, чем в художественной прозе или статьях.

«В тех частях кода, где есть произвольный выбор терминов, например в комментариях, водяной знак может быть применён, — заявил представитель компании. — Однако по определению это будет иметь пренебрежимо малое влияние на саму функциональность кода».

Инициатива индустрии

Антропик подтверждает, что не является единственным игроком, внедряющим подобные меры. Другие крупные разработчики языковых моделей подписались под тем же Кодексом практики и планируют реализовать собственные уникальные системы водяных знаков. Это указывает на формирование отраслевого стандарта прозрачности в сфере искусственного интеллекта.

Некоторым пользователям эта мера кажется лишней нагрузкой или даже угрозой, однако компания настаивает на необходимости соблюдения законодательства ЕС. Разъяснения были призваны снизить градус недоверия и прояснить технические аспекты работы нового функционала, продемонстрировав, что безопасность и прозрачность не должны идти в ущерб качеству сервисов.

Первоисточники

TechCrunch AI
← Вернуться в эфир