GPT-5.6 Pro · GPT-5.6 · статистика · FDR · Benjamini-Hochberg · ИИ · машинное обучение · научное исследование5 августа в 21:31 · 6 мин

Контрпример от ИИ сломал два десятилетия статистического консенсуса в геномике

Модель GPT-5.6 Pro за полтора часа сформировала математический контрпример, опровергающий гипотезу о надежности метода Бенджамини-Хохберга (BH) при произвольной корреляции между тестами. Задача, над которой трудился научный мир, включая авторов оригинального метода, более 20 лет, считая гарантию контроля ложных открытий (FDR) устойчивой. После публикации препринтов сообщество пересматривает фундаментальные основания широкого класса биологических и экономических исследований.

# ИИ за полтора часа опроверг 20-летнюю гипотезу в статистике

Статистический мир потрясла новость о том, что генеративная модель искусственного интеллекта в кратчайшие сроки поставила точку в вопросе, над которым специалисты боролись более двух десятилетий. Статистик из Уортонской школы Пенсильванского университета Эдгар Добрибан провел диалог с моделью GPT-5.6 Pro, предоставив лишь математическое определение процедуры Бенджамини-Хохберга (Benjamini-Hochberg procedure, BH) и прямой запрос: «Доказать или опровергнуть, что метод контролирует долю ложных открытий (FDR) при произвольной корреляции переменных?».

Модель проанализировала задачу, сгенерировала строгий контрпример, нашла конкретную модель распределения, нарушающую гарантию, и составила код численного сертификата, подтверждающего неравенство. Вся цепочка рассуждений легла в основу научного препринта, опубликованного 13 июля. Это событие укоротило время поиска решения с пятилетнего тупика для отдельных исследователей до менее чем трех недель активных изменений в научной литературе.

*«Сложность была не в инструментах, а в том, чтобы понять, в какую сторону идти»*, — отмечает сам автор исследования, подчеркивая, что ИИ лишь ускорил озарение, соединив известные техники в前所未有的 комбинации.

Почему метод Бенджамини-Хохберга был так важен

Для понимания масштаба прорыва важно разобраться в контексте. В современной науке, особенно в геномике, нейровизуализации и A/B-тестировании, исследователи одновременно проверяют тысячи, а иногда и десятки тысяч гипотез. Например, при поиске генов, связанных с определенным заболеванием, генетист анализирует одновременно экспрессию тысяч генов.

Традиционный подход использует порог p-значения 0.05: если вероятность получения такого результата случайно меньше 5%, эффект считается значимым. Однако при проверке 20 000 гипотез этот простой порог катастрофически не работает. Даже если никакого эффекта нет, примерно каждый двадцатый ген (около 1000 из 20 000) ложно покажется значимым из-за случайной флуктуации. Это приводит к тысячам ложных открытий на ровном месте.

Решение было найдено в 1995 году Йоавом Бенджамини и Йосефом Хохбергом. Они предложили контролировать не вероятность хотя бы одной ошибки (как в классической поправке Бонферрони, которая слишком жестка), а ожидаемую долю ложных открытий (False Discovery Rate, FDR) среди всех отвергнутых нулевых гипотез. Процедура предполагает сортировку p-значений и сравнение каждого с собственным, возрастающим порогом. Этот метод стал золотым стандартом в геномике и был процитирован более 130 тысяч раз.

Дыра в фундаменте: независимость против корреляции

Исходная гарантия метода BH была доказана только для двух случаев: когда все тесты независимы друг от друга и когда они зависят по специальному типу (положительная зависимость). Однако в реальности данные почти всегда коррелированы: гены наследуются группами (локусы), соседние зоны мозга активируются синхронно, а финансовые индикаторы движутся совместно.

В течение 20 лет статистики полагали, что метод работает и для произвольной корреляции. Симуляции не находили нарушений, а Йоав Бенджамини в обзоре 2010 года называл свидетельства убедительными, хотя и признавал отсутствие формального доказательства. Уилл Фитиан из Беркли называл эту проблему самой интересной открытой задачей в статистике.

Однако модель GPT-5.6 Pro обнаружила, что гипотеза неверна. Она построила гауссовскую факторную модель, в которой при номинальном уровне значимости 0.01 реальный FDR строго превышает 0.0104. Хотя разрыв мал, он не оценочный: финальное неравенство подтверждено интервально-арифметическим сертификатом, то есть вычислением с гарантированным округлением, которое невозможно оспорить.

Важно понимать разницу между абсолютным и относительным опровержением. Метод все еще работает: он контролирует FDR, но не с заявленным порогом. Если вы хотите гарантировать уровень 0.05, а модель дает результат 0.067, вы не сможете заявить об успехе с 95% доверием. В геномике, где тысячи тестов, даже такой маленький сдвиг может означать разницу между ложным открытием и пропущенной истинной зависимостью.

*«Положительная корреляция, которую предполагал доказательство, оказывается недостаточной для гарантии»*, — отмечают авторы препринта.

Как ИИ нашел то, что упустили люди

Традиционный поиск доказательства велся двумя способами: 1. Конструктивный поиск: Построение специфических матриц ковариации, нарушающих неравенство. Это требовало гениального интуиции и случайных озарений. 2. Прямой анализ: Попытка доказать неравенство для произвольной матрицы, что оказалось непреодолимым из-за огромного пространства всех возможных корреляций.

Модель ИИ подошла к задаче иначе. Вместо того чтобы гадать, она: * Использовала генеративные возможности для создания огромного пространства потенциальных ковариационных матриц. * Применила численную оптимизацию для поиска конфигураций, максимизирующих FDR. * Нашла структуру, которую люди упустили: зависимость, которая локально увеличивает ложные открытия, но глобально кажется «безопасной».

Ключевым моментом стало понимание, что в пространстве всех матриц ковариации существует «слепая зона» — область, где метод не может гарантировать контроль FDR, даже если он кажется работающим на симуляциях с фиксированными параметрами. Это похоже на поиск дыры в ткани: человеческий глаз видит лишь отдельные нити, но только с помощью специального «линзы» (в данном случае — алгоритмической проверки) становится видно, что ткань имеет сквозное отверстие.

Что происходит сейчас: от паники к новым решениям

Реакция научного сообщества неоднозначна. С одной стороны, есть скепсис: «Модели ИИ часто галлюцинируют». Но строгость математического доказательства и наличие сертификата, проверенных экспертами, убрали этот doubt. Более того, два независимых исследователя (Лея и Добрибана) получили одинаковый результат, хотя использовали разные подходы: один искал контрпримеры, другой пытался построить доказательство для узких классов и пришел к аналогичным выводам.

Ключевые выводы: * Метод BH не сломан полностью: Он все еще контролирует FDR, но не с той точностью, которую предполагалось. Для многих практических задач, где корреляция низкая или умеренная, он продолжает работать. * Гарантия исчезла для произвольной зависимости: Для сложных структур данных (например, генома человека с сильной кластеризацией) старые порог больше не являются безопасными. * Необходим новый подход: Ученые переходят к методам, которые явно учитывают структуру зависимости. Это условная калибровка и методы knockoffs, которые позволяют адаптировать порог под конкретную матрицу ковариации.

*«Мы не бросаем BH в мусор, мы учимся пользоваться им с пониманием его ограничений»*, — резюмирует один из экспертов, работающих над новыми процедурами.

Итог: ИИ как катализатор науки

Этот случай демонстрирует, как ИИ может не просто ускорять вычисления, а менять парадигму научного познания. Модель GPT-5.6 Pro выступила не как замена человеку, а как мощный инструмент, способный видеть паттерны, скрытые от человеческого восприятия. Она показала, что даже в таких строго структурированных областях, как математическая статистика, ИИ способен находить решения, которые десятилетиями ускользали от исследователей.

В заключение: история метода Бенджамини-Хохберга получила unexpected завершение. Мы узнали, что гарантия контроля FDR для произвольной корреляции отсутствует, но получили мощный стимул для развития новых, более робастных методов анализа данных. ИИ в этом процессе сыграл роль не разрушителя, а катализатора, ускоряющего переход от старого к новому.

*Поддержать автора можно подпиской на канал "сбежавшая нейросеть", где рассказывается об ИИ с творческой стороны.*

Первоисточники

Habr AI
← Вернуться в эфир