AI21 августа в 13:31 · 5 мин

ИИ доказал гипотезу, которую выбрал скептик: как Grok 4.6 решил задачу десятилетия

Математик Паата Иванишвили провел уникальный эксперимент, позволив скептику самостоятельно выбрать задачу, которую, по его мнению, не под силу современным нейросетям. Результат превзошел ожидания: модель Grok 4.6 в связке с инструментами кода доказала сложную комбинаторную гипотезу о случайных блужданиях, над которой люди бились четыре года, предоставив ключевой математический аргумент, которого не хватало ученым.

# Когда скептик выбирает задачу: Grok 4.6 решил то, над чем ломали голову люди

История развития искусственного интеллекта в науке часто пишется о тех задачах, которые ИИ решает случайно или в рамках узкого набора инструкций. Однако один из самых честных экспериментов последних лет демонстрирует нечто иное: границу возможностей, которая не статична, а динамично пересматривается, когда меняется методология взаимодействия человека и машины.

В центре событий находится математик из Калифорнийского университета в Ирвайне, Паата Иванишвили. Его подход к оценке способностей моделей отличался от типичных «бенчмарков»: вместо того чтобы просить модель решить стандартную задачу, он предложил ролевую игру, в которой скептик — коллега Иванишвили, обладающий глубокими экспертными знаниями — сам определил цель.

Гипотеза «Жадный — самый медленный»

Эксперимент начался со спора. Иванишвили обсудил с сильным математиком перспективы ИИ в доказательной математике. Скептик, зная тонкости предмета, выбрал одну из самых упертых задач: гипотезу о структуре оптимальной ловушки для частицы на целочисленной прямой.

Задача сводится к модели случайного блуждания. Представьте частицу, которая движется по прямой линии. В каждой точке ей подбрасывается нечестная монетка с определенной вероятностью шага вправо или влево. Особенность в том, что вероятность меняется по циклическому паттерну. Вопрос в том, как расставить эти вероятности вдоль круга, чтобы замедлить частицу максимально?

Исследователи Холмс, Холройд и Рамирес в 2022 году заметили, что существует множество способов переставить монетки, которые меняют скорость частицы. Их гипотеза гласила, что самым эффективным «тормозом» является так называемая «маятниковая» расстановка: монеты с наибольшей вероятностью шага влево группируются в один мощный барьер, который частице приходится долго преодолевать.

Эту гипотезу Иванишвили назвал «Greedy is least speedy» («Жадный — самый медленный»). Суть в том, что стратегия, где большие усилия (вероятности) концентрируются в одном месте, оказывается медленнее, чем распыленная стратегия.

Математики доказали частные случаи этой гипотезы для малых периодов, но единого общего доказательства, которое покрывает все случаи, не было найдено четыре года. Это была задача среднего класса сложности — не легкая, но и не абстрактная загадка вроде гипотезы Римана. Она требовала не сверхмощных вычислений, а изящной комбинаторной мысли и умения сформулировать правильную теорему.

Как Grok 4.6 заполнил пробел

Иванишвили вернул скептику подтверждение: модель Grok 4.6 в связке с инструментом Grok Build (аналог Claude Code или IDE для ИИ) не только подтвердила гипотезу, но и доказала более сильное утверждение — Гипотезу 5 из исходной статьи. Из этого более общего факта основная гипотеза следовала автоматически.

Результат был оформлен в виде короткой заметки-препринта, где Иванишвили выступает соавтором, а соавтором также стал Шэнтун Чжан из Стэнфорда. Интересно, что Чжан, возможно, и был тем самым скептиком в диалоге Иванишвили: ранее он занимал критическую позицию, а теперь он подписан соавтором, чей код и рассуждения были проанализированы и дополнены ИИ.

Что именно сделал ИИ? Исходная статья содержала сложную структуру доказательств. Людям не хватало единого аргумента для случая «середины» — окон средней длины при большом периоде. Grok выдал этот недостающий кусок: десяток страниц строгих выкладок. Модель использовала техники логарифмирования, превратив сложные произведения в суммы, и сформулировала задачу как утверждение о мажоризации (доминировании одного набора сумм над другим).

Ядро доказательства оказалось неожиданно простым в своих инструментах, но гениальным в связке: дискретная теорема изопериметрического типа, утверждающая, что среди «плавных» профилей круга выгоднее всего трапеция, которую дает сплошная дуга. Для вывода использовались лишь стандартные неравенства: перестановочное, неравенство Караматы и аккуратный подсчет.

Как пишет Иванишвили, дело не было в вычислительной мощи, а в правильной рамке, которую предложила модель. Человек часто тратит годы на поиски формулировки, тогда как ИИ, обладая широким контекстом научных публикаций, мог мгновенно предложить нужную абстрактную постановку.

Граница возможностей и прозрачность

Эксперимент не был односторонним. После успеха с математической гипотезой скептик предложил ИИ еще две задачи, которые он считал своими силами. Ни одну из них модель не решила. Это доказывает, что ИИ — не волшебная палочка, а инструмент, который эффективен в определенных узких доменах, требующих специфического вида мышления (например, комбинаторного или аналитического), но слаб в других.

Особое внимание исследователи уделили тому, как именно работала модель. Они зафиксировали, что Grok, как и многие современные модели, использует «рекурсивный анализ» — способность разбивать доказательство на подзадачи и проверять их самостоятельно. Это создает прозрачность: мы не только получаем ответ, но и видим шаги, которые привели к нему.

Иванишвили отмечает, что в отличие от предыдущих экспериментов с ИИ (например, доказательство гипотезы о простых числах, которые не были публично верифицированы людьми), здесь результат проверен вручную. Это критически важно для науки: ИИ может предложить путь, но человек должен пройти его, убедившись, что логика безупречна.

Будущее научных открытий

Результат экспериментов показывает, что ИИ уже способен совершать открытия, которые невозможно сделать без его помощи. Однако, как предупреждают исследователи, ИИ не заменит математиков. Он станет их «умным партнером», который берет на себя рутину перебора вариантов и формулирования гипотез, позволяя человеку сосредоточиться на креативных инсайтах.

Скептицизм, который изначально проявил коллега Иванишвили, оказался оправдан в части того, что ИИ не всемогущ. Но он был опровергнут в части недооценки возможностей. Модель Grok 4.6 показала, что при правильной постановке задачи она может закрыть самые сложные пробелы в доказательствах, над которыми люди трудились годами.

Этот случай стал важным шагом в понимании того, как ИИ может интегрироваться в науку: не как черный ящик, выдающий ответы, а как инструмент, расширяющий горизонты человеческого воображения и доказательной базы. В будущем мы можем увидеть, как именно подобные модели будут работать в тандеме с учеными, ускоряя открытия в физике, биологии и других фундаментальных дисциплинах.

Первоисточники

Habr AI
← Вернуться в эфир