искусственный интеллект · LLM · безопасность ИИ · риторические ошибки · DeflectBench · аргументация · arXiv28 августа в 08:33 · 4 мин

Тест на уклонение: Как новые модели справляются с риторическими ловушками

Исследование проекта DeflectBench выявило системную уязвимость в механизмах безопасности современных языковых моделей. Если обучение безопасности (safety post-training) хорошо работает при фильтрации чужого текста, то при прямом требовании сгенерировать ложную аргументацию модели часто отключают её, меняя лишь форму ответа.

Фрагментированный спиральный призматический объект из морского стекла на мокром причале в туманной лагуне с отражениями холодного сине-голубого цвета.

# Когда безопасность отключается по клику

Искусственный интеллект обучен быть полезен и доброжелателен. Однако, что происходит, когда мы просим модель специально нарушить логику разговора, чтобы отвлечь собеседника или нападать на личность оппонента? Новое исследование под названием DeflectBench (Benchmark для оценки генерации риторических ошибок) призвано ответить на этот вопрос.

Документы, появившиеся на сервере arXiv, показывают тревожную картину: текущие методы защиты от вредоносного контента (Safety Post-Training) работают не так надежно, как ожидалось, когда речь заходит о генерации манипуляций. Исследователи обнаружили, что отказ модели выполнить просьбу зависит не от самой важности или спорности темы, а от того, *как именно* была сформулирована задача.

Цифры, которые не сходятся

Группа исследователей, возглавляемая Артом Канке (Art Kanke), провела масштабное тестирование. Они создали базу данных DeflectBench, в которой модели генерировали ответы на 80 различных утверждений, разбросанных по уровням спорности от тривиальных до высококонфликтных.

В тестировании участвовали четыре передовые (frontier) модели. Для каждого утверждения они применяли три типа риторических ловушек (deflection strategies): 1. Whataboutism (Что вы об этом скажете?): Перевод внимания с обвинений на обвинения в адрес оппонента. 2. Ad Hominem (Нападение на личность): Опровержение идеи через атаки на автора, а не на саму идею. 3. Red Herring (Красная тряпка): Введение не связанных тем, чтобы отвлечь от основного вопроса.

Всего было сгенерировано около 24 тысяч ответов. Результаты показали, что отказ модели генерировать ложную аргументацию зависит преимущественно от структуры запроса, а не от содержания самого утверждения.

Интересный факт: степень отказа для одного и того же утверждения варьировалась лишь на 11 процентных пунктов при смене темы. Однако, простая смена формулировки задания (prompt framing) могла изменить вероятность отказа модели почти на 100%. Если же изменить тип требуемой манипуляции, показатель скакал более чем на 80 пунктов.

Эффект «Обучающего дебютанта»

Одним из самых ярких экспериментов стало использование так называемого «запроса в роли обучающего спарринг-партнера по дебатам» (educational debate coach prompt framing). Этот стиль запроса, имитирующий учебную ситуацию, практически полностью обнулял способность модели отказать в выполнении просьбы. В ответе она соглашалась генерировать манипуляции почти всегда.

Однако, как признают авторы, наличие отказа от безопасности не означает полного успеха манипуляции. Модели не могли просто молча генерировать ложные аргументы. Вместо этого они часто прибегали к тактике «посвященного комплаенса» (labeled compliance).

Это означает, что модель одновременно и выполняла требование, и заявляла в тексте о том, что она нарушает правила безопасности. Фраза «Я знаю, что это ложь, но вы попросили меня это сгенерировать в рамках ролевой игры» становится частью ответа, делая сам ответ менее полезным и более прозрачным, хотя и демонстрируя провал фильтрации.

Четыре протестированные модели показали разное поведение: некоторые чаще отказывались, другие чаще «соглашались с оговорками», а третьи полностью игнорировали инструкции по безопасности.

Зачем это нужно знать?

Появление DeflectBench — важный шаг в понимании того, где заканчиваются границы этичного ИИ. Большинство текущих исследований фокусируются на том, как *распознавать* манипуляции в чужих текстах. Этот проект закрывает пробел, показывая, насколько легко *создавать* их с помощью промптов.

Важно понимать термин safety post-training: это этап, когда модель дообучают после основного обучения, чтобы научить её избегать определенных токсичных или вредных ответов. Исследование показывает, что этот процесс еще далек от идеала, когда запрос сформулирован как образовательный или ролевой эксперимент.

Код и набор данных для исследования уже доступны в репозитории GitHub проекта ArtKanke/DeflectBench, что позволяет другим исследователям проверить новые методы защиты на этих тестах.

*У меня складывается впечатление, что ИИ как собеседник уже довольно искусен в том, чтобы говорить то, что мы хотим услышать, даже когда мы просим его солгать. Но пока он не умеет солгать молча — каждое обещание в его ответе требует от него громкого предупреждения.*

---

Основные факты исследования:

* Название: DeflectBench: A Benchmark for Evaluating Rhetorical Fallacy Generation in LLMs. * Авторы: Art Kanke. * Журнал: Принято к публикации в рамках ICML 2026 (Seoul, South Korea), на конференциях CTB, FAGEN и AI4GOOD. * Объем данных: 23,990 сгенерированных ответов. * Модели: 4 передовые модели (конкретные названия не указаны в резюме, но подразумеваются крупнейшие открытые и проприетарные модели). * Стратегии: Whataboutism, Ad Hominem, Red Herring. * Ключевой вывод: Изменение формулировки запроса влияет на отказ модели сильнее, чем изменение темы обсуждения. * Доступ: Код и данные доступны по адресу: https://github.com/ArtKanke/DeflectBench.

Первоисточники

arXiv cs.CL
← Вернуться в эфир