Случайный выбор в ИИ: почему повторный запуск одной модели не заменяет разнообразие
Статистическая вариативность при многократном запуске одной нейросети часто ошибочно принимают за глубокий анализ неопределенности. Новое исследование из arXiv показывает, что这种方法 лишь создает иллюзию понимания, тогда как настоящее познание требует ансамбля различных моделей.
# Статистический шум vs. Реальная неопределенность
В мире больших языковых моделей (LLM) существует распространенная практика: чтобы оценить уверенность системы в своем ответе, запускают один и тот же запрос многократно. Если модель дает разные ответы, это трактуется как знак неуверенности. Этот метод получил название «самосогласованность» (self-consistency). Однако недавнее исследование, опубликованное в arXiv под номером 2607.20464, ставит под сомнение эффективность этого подхода, указывая на фундаментальный разрыв между шумом случайности и реальным знанием.
Задача: найти сигнал в шуме
Исследование, проведенное Ицхаром Али (Izhar Ali), сопоставило два режима генерации ответов на одни и те же вопросы:
1. Глубокое выборочное исследование: Один и тот же языковая модель запускается 100 раз на одном вопросе с температурой (parameter controlling randomness) $ au=1$. Это создает высокую вариативность ответов. 2. Ансамблевый подход: Ансамбль из 24 разных языковых моделей запускается один раз каждое на тех же вопросах с температурой $ au=0$ (детерминированный режим).
Цель было понять, какой из этих подходов лучше выявляет структуру взаимосвязей между вопросами. Если несколько вопросов связаны темой, они должны «переворачиваться» вместе в своих ответах, демонстрируя когерентную неопределенность.
Для разделения полезного сигнала от случайного шума исследователи использовали статистический тест Марченко–Пастура (Marchenko–Pastur test). Этот метод позволяет определить, вылазают ли собственные значения ковариационной матрицы выборок за границы, характерные для случайного распределения.
Результаты: глубина эпистемического пробела
Результаты тестов оказались контрастными и показали эпистемическую (познавательную) ограниченность простых методов повторения.
Внутри одной модели, независимо от того, сколько раз она запускалась (до 100 раз), статистический анализ выявил, что выше уровня случайного шума поднимается не более одной размерности (одного типа когерентной неопределенности). Это утверждение верно для пяти различных семейств моделей и трех стандартных бенчмарков: MMLU (общие знания), HellaSwag (понимание контекста) и GSM8K (математика).
В противоположность этому, ансамбль из 24 разнообразных моделей, каждый из которых отвечал один раз, продемонстрировал способность выявить четыре собственных значения, вышедших за границы случайного шума. Это означает, что разнообразие моделей действительно позволяет уловить более сложную структуру знаний и областей неопределенности, которые скрыты от глаза одиночной модели, даже если последнюю заставить работать сто раз.
Интересно, что при использовании «нулевой гипотезы» Бернулли (сложность, сопоставимая с задачами бенчмарков), даже в 500 симуляциях Монте-Карло удалось найти не более одной размерности, отличной от шума.
Таким образом, самосогласованность предоставляет точную оценку неопределенности для каждого отдельного вопроса, но она не способна обнаружить структурные связи между вопросами. Только разнообразный ансамбль моделей может «высветить» те области неопределенности, которые остаются скрытыми в рамках одиночной архитектуры.
Почему это важно на практике
Для разработчиков и исследователей ИИ это открытие имеет критическое значение. Ограничиваться многократными запусками одной модели становится экономически и вычислительно неэффективным, если цель — понять систему. Это приводит к ложному чувству безопасности.
Термин «температура» ($ au$) регулирует случайность выборки. Высокая температура делает ответы более разбросанными, но не добавляет знаний. Низкая температура делает вывод детерминированным. Исследование показывает, что изменение температуры не расширяет эпистемическое поле модели так же эффективно, как увеличение разнообразия архитектур в ансамбле.
Авторы подчеркивают: случайная выборка (sampling) является «эпистемически мелкой» (epistemically shallow). Она дает нам поверхностное представление о том, что модель знает и что она не знает, но не раскрывает глубинную структуру этих знаний. Только разнообразие моделей позволяет увидеть картину целиком, позволяя системе «переворачиваться» вместе по всем ключевым темам, а не по одной случайной оси.
В будущем оценка надежности ИИ-систем должна опираться не на количество итераций одного запуска, а на стратегическое объединение разных моделей. Это потребует новых архитектур и методов обучения, но это единственный путь к подлинному пониманию ограничений наших искусственных интеллектов.
--- *Примечание редактора: Это анализ научной работы Izhar Ali. Факты изложены строго на основе предоставленного источника arXiv. Любые заявления компаний об их собственной производительности, если они не были сделаны в оригинальном тексте, не являются частью этой репортажной статьи.*