Скрытая переменная в тестах на ИИ: как лимит токенов искажает оценку языкового интеллекта
Многие оценки возможностей многоязычных моделей искусственного интеллекта базируются на фиксированном лимите на количество сгенерированных токенов. Однако новые исследования показывают, что этот параметр действует как скрытая переменная эксперимента: разная языковая плотность требует разного числа токенов для выражения одного и того же смысла, что может кардинально менять измеренный «разрыв» между производительностью на родном языке и переводом.
# Скрытая переменная в тестах на ИИ: как лимит токенов искажает оценку языкового интеллекта
В мире оценки больших языковых моделей (LLM) стандартом часто становится публикация точности на фиксированном лимите вывода. Это упрощение имеет под собой серьёзное методологическое основание. Если модель должна выразить ответ на трёх языках — немецком, тайском и суахили — а тест ограничивает её одним числом токенов, возникает скрытая асимметрия. Языки требуют разного количества символов для передачи идентичной информации: тайский текст может быть короче или длиннее своего немецкого аналога, но в контексте токенов разница может быть ещё более резкой из-за особенностей кодировки и морфологии.
Исследование под кодовым названием «Mind the Cap», опубликованное на arXiv, ставит под сомнение валидность сравнения моделей, основанного на единственном пороговом значении. Авторы показывают, что выбор лимита токенов может не просто слегка сместить метрики, а полностью изменить картину того, как хорошо модель справляется с задачами на разных языках.
Исчезающий разрыв: эффект бюджета токенов
Основа проблемы кроется в том, что различие между производительностью на родном языке (native) и переводом (translate) часто рассматривается как индикатор качества reasoning (логического вывода) модели. Однако авторы работы доказывают, что этот разрыв во многом является артефактом «бюджета токенов».
Исследователи протестировали две популярные архитектуры — Qwen3-8B и Llama-3.1-8B-Instruct — используя четыре различных стратегии промптинга. Результаты были ошеломляющими: измеряемый разрыв между стратегиями колебался на 57 пунктов в зависимости от выбранного лимита. Более того, при нормализации длины ответов этот разрыв сокращался до 38.9 пунктов только в тех случаях, когда лимит реально ограничивал генерацию. В ситуациях с жёсткими лимитами нормализация могла даже поменять местами лидеров: та стратегия, которая проигрывала при малом лимите, могла выиграть при большем.
*«Лимит вывода следует рассматривать как независимую переменную и отчитываться о точности во всём диапазоне бюджетных режимов, а не в одной точке»*, — заключают авторы.
Для подтверждения гипотезы был проведён масштабный анализ на 540 000 независимо ограниченных декодирований. Исследователи заморозили (freezed) три пика производительности модели Qwen и её значение на уровне 1024 токенов. Статистический анализ с использованием метода Коррекции Холма (Holm-corrected tests) отверг ноль-гипотезу, подтверждая, что наблюдаемые различия статистически значимы и не являются случайным шумом.
Точка насыщения и стратегии адаптации
Интересным открытием стало исследование точки насыщения (saturation). Тест с лимитом $B^*=1024$ не смог отвергнуть нулевую гипотезу, потому что к этому моменту точность на родном языке уже достигла максимума (насыщения). Разница, наблюдаемая выше этого порога, оказалась не следствием нехватки ресурсов для мышления модели, а «разрывом производительности стратегий» (strategy-performance gap). Проще говоря, модель уже знала ответ, но не смогла выдать его полностью из-за искусственного ограничения.
Работа также рассматривает влияние адаптации словаря на языке Тай. Внедрение расширенного словаря на тайском языке закрыло 0.0 пунктов разрыва в замороженном бюджете, но повысило точность на 4.9 пункта там, где 19% трассировок всё ещё обрезались. Это подтверждает, что каналы урезания (truncation) напрямую влияют на цену ошибки и требуют тщательной калибровки.
Кроме того, авторы продемонстрировали, что объявленный бюджет не всегда совпадает с фактическим. Если заявлять модели бюджет в 128 токенов, а фактический жёсткий лимит останется 2048, точность на тайском языке изменится на 5.1 пункта. Это означает, что точность зависит не только от фактического ограничения, но и от контекста, в котором модель работает.
Идентификация пиков и будущее benchmarking
В работе используется уникальная методика вычисления «временной идентичности корректного эмиссии» (correct-emission timing identity). Эта метрика, рассчитанная на одном запуске с большим лимитом, позволила предсказать три заранее определённых пика производительности в тесте MGSM с точностью до 0.65 пункта. В exploratory анализе, ограниченном только моделью Qwen, этот метод отслеживал резервные элементы (held-out items) в трёх дополнительных бенчмарках с точностью 0.92 пункта, локализуя пик ровно в пяти из семи ячеек.
Эти результаты указывают на то, что текущий подход к оценке многоязычных моделей может быть系统性льно предвзятым. Если тесты проводятся при разных или неоптимальных лимитах, мы можем ошибочно приписывать недостатки модели языковым барьерам, когда на самом деле дело в техническом ограничении вывода.
Для исследователей и разработчиков это означает необходимость перехода к отчётам, которые показывают кривую точности в зависимости от бюджета, а не единый процент. Только так можно получить честную картину того, как модели справляются с задачами на разных языках, не подвергаясь влиянию скрытых переменных эксперимента.
В заключение, работа «Mind the Cap» напоминает, что в эпоху сложных нейросетей простота метрик часто становится источником иллюзий. Понимание того, как лимиты токенов взаимодействуют с языковой структурой, является первым шагом к более точной и справедливой оценке возможностей искусственного интеллекта.