искусственный интеллект · языковые модели · arXiv · нейросети · исследование · машинное обучение · алгоритмы6 августа в 07:31 · 4 мин

Когда больше становится меньше: парадокс повторов в языковых моделях

Научное исследование, опубликованное в архиве arXiv, ставит под сомнение фундаментальное предположение разработчиков ИИ: что увеличение частоты повторения целевого слова в тексте однозначно усиливает его предсказуемость. Оказывается, эффект зависит от контекста: если повторы стоят рядом, они работают как «приминг» (подсказка), но если их разделяет новый синтаксический контекст, вероятность ошибки модели начинает расти после достижения определенного пика. Этот эффект наблюдается универсально на множестве языков и типов моделей.

# Когда больше становится меньше: парадокс повторов в языковых моделях

В основе разработки больших языковых моделей (LLM) лежит идея, что контекст помогает машине делать правильные прогнозы. Интуитивно кажется логичным: если текст содержит множество повторений одного и того же слова, алгоритм должен стать еще увереннее в предсказании следующего шага или заполнить пропуск. Однако новое исследование, проведенное Хан-ю Уангом и представленное на платформе arXiv (cs.CL), демонстрирует, что эта интуитивная связь далеко не всегда верна. В статье «When More Becomes Less: Position-Dependent Repetition Effects in Language Models» показывается, что для некоторых конфигураций данных большее количество повторов приводит к снижению точности работы модели.

Зависимость от позиции: приминг против инвертированной кривой

Исследователи провели эксперимент, используя так называемые тесты типа «Cloze» (заполнение пропуска), где в тексте встречается серия повторений одного целевого токена. Ключевая инновация работы заключается в различении двух сценариев расположения этих повторов относительно места, где модель должна сделать предсказание.

1. Соседние повторы (Adjacent probe): Здесь целевое слово повторяется непосредственно перед пропуском. В этом случае поведение модели совпадает с классической психологической концепцией «приминга» (priming). Чем больше раз слово повторяется подряд, тем выше вероятность $P(\text{target})$, что модель правильно идентифицирует его. Кривая роста вероятности плавно поднимается и в конечном итоге выходит на плато, не снижаясь.

2. Отсроченные повторы (Displaced probe): В этой конфигурации блок повторяющихся слов отделен от места предсказания новой фразой или контекстом. Именно здесь обнаруживается парадокс. Вероятность правильного предсказания сначала растет, достигая раннего пика, а затем, по мере добавления новых копий слова, начинает снижаться. График зависимости принимает форму инвертированной буквы U.

Это явление не является артефактом конкретной модели. Исследование охватило 13 открытых моделей различных архитектур (кодировщиков и декодеров). Эффект снижения вероятности при избытке повторов был статистически значим во всех тестах (95% доверительный интервал исключал ноль) и наблюдался на четырех языках: английском, испанском, китайском, немецком и французском. Успешная репликация результата в 42 из 42 мультинациональных ячейк данных подтверждает универсальность данного феномена.

Технические детали: внимание и семантика

Для понимания причин этого поведения исследователи провели глубокую аналитическую работу, используя методы кausal-абляции (причинного исключения переменных) и анализ внутренних механизмов внимания моделей.

Было установлено, что эффект вызван именно точным лексическим повторением, а не просто увеличением длины текста или наличием общих семантических признаков. Контрольные тесты исключили влияние «фреймовой прагматики» — то есть вероятность того, что снижение точности возникает из-за того, как именно построен вопрос теста, а не из-за содержания слов.

Внутри моделей происходит следующее: когда количество повторов $N$ возрастает в отсроченном сценарии, сумма всего «бюджета внимания» (attention budget), который модель уделяет всему блоку повторов, действительно растет. Однако внимание, распределенное на единичный токен целевого слова, падает. В моделях на основе маскирования (Masked Language Models) этот механизм работает так, что избыточная информация о повторении начинает «размывать» точечный сигнал, необходимый для корректного предсказания в новой грамматической среде.

Это открытие имеет важные последствия для создания метрик оценки качества ИИ. Традиционные методы, которые варьировали количество повторов, предполагали, что позиция чтения (readout position) не влияет на результат. Теперь доказано, что эти два параметра нельзя считать независимыми (ортогональными). То, как модель обрабатывает повторение, радикально меняется в зависимости от того, стоит ли оно рядом с пропуском или в другом абзаце.

Выводы и значение для развития ИИ

Работа Хан-ю Уанга напоминает, что языковые модели, несмотря на их сложность, все еще работают в рамках ограниченных механизмов внимания и статистики частот. Они не обладают глубоким пониманием прагматики языка в том смысле, в каком это делают люди; они лишь находят паттерны, которые часто становятся менее эффективными при чрезмерном усложнении данных.

Этот результат заставляет специалистов пересмотреть методы бенчмаркинга и оценки надежности языковых моделей. Простого увеличения объема обучающих данных или добавления повторений в тестовые наборы больше недостаточно — иногда это приводит к обратному эффекту, снижая качество выводов системы. Исследование подчеркивает важность учета контекстуальной позиции данных при анализе поведения нейросетей и открывает новые направления для изучения того, как именно механизмы внимания интерпретируют избыточную информацию в текстовых потоках.

Для разработчиков алгоритмов это сигнал: оптимизация не должна быть слепой по отношению к структуре повторов. Понимание того, когда «больше» действительно становится «меньше», является ключевым шагом к созданию более устойчивых и предсказуемых систем искусственного интеллекта, способных справляться с нестандартными сценариями обработки текста.

Первоисточники

arXiv cs.CL
← Вернуться в эфир