LLM · Deception Detection · Linear Probes · OOD Robustness · Principal Components · AI Safety · Llama-3.14 сентября в 10:03 · 4 мин

Фильтрация подпространств: новый метод повышения устойчивости нейросетей к манипуляциям

Исследование, опубликованное на arXiv, демонстрирует, что устойчивость линейных проверок (probes) в крупных языковых моделях к вневыборочным данным определяется не столько обучением на тестовых примерах, сколько умением отсеивать шумные векторные направления. Авторы показывают, как проекция на малую часть главных компонент активаций позволяет достичь точности, близкой к идеальной, без прямого доступа к данным для проверки.

Образ разбитого кристаллического нейрона, фильтрующего хаос в тишине подводного архива

# Фильтрация подпространств: новый метод повышения устойчивости нейросетей к манипуляциям

В мире больших языковых моделей (LLM) проблема достоверности остается критической. Исследователи постоянно ищут способы детектировать обманы, манипулятивное поведение или попытки обхода этических ограничений непосредственно в активациях нейронной сети. Однако стандартный подход — создание линейных «зондов» (probes), обучаемых на конкретных наборах данных — часто сталкивается с проблемой обобщения. Модель, прекрасно работающая на одном наборе вопросов о честности, может полностью сбоить на других, даже связанных с темой.

Новая работа, представленная на сервере arXiv (архив ID: 2609.02893), предлагает фундаментально иной взгляд на эту проблему. Вместо того чтобы пытаться переобучить пробы под каждый новый сценарий, авторы Daniel Yoo и Adrians Skapars изложили метод, основанный на геометрической обработке внутренних представлений данных. Их ключевой тезис: устойчивость к вневыборочным данным (out-of-distribution, OOD) определяется в первую очередь правильным выбором подпространства признаков.

Математика доверия: главные компоненты как фильтр

Технически, внутреннее состояние большой языковой модели — это облако точек в огромном многомерном пространстве. Когда мы пытаемся классифицировать эти состояния на «честные» или «манипулятивные», мы ищем разделяющую плоскость. Однако авторы обнаружили, что большинство стандартных пробов фокусируются не на сути манипуляции, а на поверхностных артефактах источника данных (например, специфический стиль формулировок или наличие определенных маркеров, уникальных для обучающей выборки).

Для решения этой задачи исследователи предложили использовать метод главных компонент (Principal Components, PC). Если представить активации модели как векторы, то главные компоненты — это направления в пространстве, которые сохраняют максимальную вариацию данных. В данном контексте авторы не использовали все возможные компоненты. Вместо этого они отбирали небольшую их подмножество, основанное на обучающем распределении активаций модели Llama-3.1-8B-Instruct.

Простыми словами: Представьте, что вы пытаетесь различить две группы людей по цвету глаз, но в вашем наборе данных все из первой группы тоже носят синие кепки, а из второй — красные. Стандартная проверка подхватит этот стереотип («красная кепка = группа Б»). Если вы пришлете человека с синей кепкой из другой страны, проверка ошибется. Метод главных компонент здесь выступает как мощный фильтр, который отсекает такие «шумные» поверхностные признаки (синие кепки) и оставляет только то, что действительно важно для задачи (цвет глаз).

Экспериментальная валидация на данных Llama-3.1

Исследование проводилось на базе модели Llama-3.1-8B-Instruct. Авторы оценивали способность своих пробов обобщаться на три удерживаемых набора данных (held-out datasets), посвященных обнаружению обмана, не обучая пробы непосредственно на этих новых данных. Результаты оказались поразительными.

Обычно разрыв между базовой проверкой (baseline), обученной на одном домене, и идеальной проверкой (oracle), обученной непосредственно на каждом тестовом наборе, был значительным. Новый метод позволил значительно сузить этот разрыв: * На наборе данных "Insider Trading Report" (Отчеты о внутрибиржевой торговле) разница между базовым и идеальным результатом составила всего 22%, то есть метод закрыл 78% разрыва. * На более сложном наборе "Sandbagging" (скрытая подготовка к задачам с целью снижения оценки) метод закрыл 25% разрыва между базовым и идеальным уровнем.

Это означает, что путем проекции на малое количество главных компонент из обучающего распределения, авторы достигли переноса производительности (cross-domain transfer), которая почти совпадает с производительностью пробов, натренированных непосредственно на тестовых распределениях.

Интерпретируемость и роль LLM-судьи

Однако интересная деталь заключалась не только в точности, но и в объяснимости. Авторы обнаружили, что направления, на которые исходная проба ставила сильные веса, часто кодировали специфические для источника поверхностные черты. Напротив, направления, которые действительно переносились на новые домены, кодировали более абстрактные контрасты, которые можно описать естественным языком.

Для автоматического отбора этих наиболее надежных главных компонент исследователи внедрили механизм оценки с помощью языковой модели-судьи (LLM judge). Эта модель анализирует примеры, вызывающие наибольшую и наименьшую активацию для каждой главной компоненты, и оценивает, насколько эти примеры подразумевают переносимое направление обмана.

Этот гибридный подход — использование линейной алгебры для снижения размерности и LLM для семантической оценки компонентов — стал ключом к успеху. Он показал, что мы можем понять, «что именно» видит модель внутри своего скрытого пространства, и отфильтровать только то, что имеет реальное, а не артефактное значение.

В заключение, эта работа подчеркивает, что поиск робастных методов анализа LLM не должен сводиться к бесконечному расширению обучающих датасетов. Ключ к устойчивости кроется в правильной геометрии внутренних представлений, где фильтрация по подпространству позволяет отсеять шум и уловить сущность явления.

Первоисточники

arXiv cs.CL
← Вернуться в эфир