Новый тест на долговременное отслеживание состояния: LLM вычислили MD5 через 196 шагов
Исследование на arXiv подтвердило, что большие языковые модели способны сохранять точные математические состояния через сотни зависимых вызовов инструментов. В эксперименте модель gpt-oss-120b успешно вычислила криптографический хэш MD5, проходя 196 шагов, что демонстрирует возможность реализации сложных агентских задач без каскадных ошибок.

# Следование длинной траектории: как большие языковые модели учатся не терять нить
Рейтинг 196 шагов без сбоя — новое доказательство стабильности когнитивного процесса в LLM.
В мире искусственного интеллекта оценка способности моделей к решению сложных, многошаговых задач долгое время оставалась областью туманных догадок. Часто успехи агентов в бенчмарках объяснялись умением интерпретировать инструкции, а не способностью последовательно удерживать точное состояние данных через серию зависимых действий. Новое исследование, опубликованное в базе знаний arXiv (cs.AI), предлагает строгий эксперимент, который отделяет истинное долгосрочное отслеживание состояния от других когнитивных навыков. Авторы продемонстрировали, что современная модель может вычислить криптографический хэш шаг за шагом, сохраняя промежуточные данные в контексте на протяжении всей цепочки вычислений.
Почему сложность скрыта в зависимости
Основная проблема долгосрочных задач в искусственном интеллекте заключается в эффекте каскадных ошибок. Если каждая следующая операция зависит от результата предыдущей, то даже минимальная погрешность на начальном этапе приводит к полной ошибке на выходе. В традиционных тестах агентов этот фактор часто игнорируется или смешивается с другими сложностями, такими как понимание естественного языка. Исследователи задались вопросом: способны ли языковые модели на самом деле запоминать точное математическое состояние через множество вызовов инструментов, или же они лишь имитируют успех на короткий срок.
Для проверки этого гипотезы авторы выбрали задачу вычисления функции MD5 — одного из самых строгих стандартов криптографического хэширования. MD5 работает не по магии, а по чётким математическим алгоритмам, описанным в документе RFC 1321. Вычисление хэша для строки определённой длины требует выполнения фиксированной последовательности операций над набором данных, представленным в виде четырёх 32-битных слов (a, b, c, d). В отличие от обычных задач, где можно «подгадать» правильный ответ, здесь путь к результату строго детерминирован.
Эксперимент как эталон точности
В основе эксперимента лежит выполнение последовательности из 196 вызовов инструментов, распределённых по 64 раундам. Ключевым условием является то, что модель должна самостоятельно удерживать четыре 32-битных слова в своём контексте от одного шага к другому. Интерпретация данных здесь тривиальна, а верификация возможна до бита: результат каждого шага сравнивается с эталонным следом, рассчитанным вручную. Это исключает возможность использования shortcuts или галлюцинаторных ответов; если итоговый хэш не совпадает, ошибка точно в механике подсчёта.
Для выполнения такой задачи была использована модель gpt-oss-120b. Это представляет собой архитектуру mixture-of-experts, где активны только около 5,5 миллиарда параметров на токен при температуре 0. Модель работала с коротким фиксированным промптом. Результаты были поразительны: модель успешно удерживала полное состояние данных через все 196 вызовов и возвращала правильный хэш-суммарный результат в большинстве завершённых запусков. Это подтверждает, что современные языковые модели способны сохранять точную внутреннюю память для сложных вычислений, не теряя данные на протяжении длительного когнитивного процесса.
Усиление через проверку и голосование
Интересным и наиболее сложным сценарием стал тест, в котором сами примитивные инструменты для вычислений были заменены на второй экземпляр большой языковой модели. В этом режиме «водитель» и «работник» вычисляли хэш полностью от scratch (с нуля) без доступа к орacles точной арифметики. Даже в таких условиях успех был достигнут за счёт двух ключевых факторов, которые не меняли веса модели:
1. Сохранение рассуждений в контексте: Модель должна была удерживать не только числа, но и логику своих шагов в видимом контексте на каждом туре. 2. Голосование над работником: Использование механизма, позволяющего исключить ошибки модульной арифметики путём коллективного анализа.
Это доказывает, что стабильность не является врождённым свойством архитектуры, а достигается через правильную инженерную организацию процесса и проверку результатов. Оставшиеся ошибки были локализованы и разделены на категории: проблемы удержания состояния, арифметические сбои и ошибки серверной части.
Что это значит для будущего агентов
Данный эксперимент служит важным вехой в понимании того, как работают большие языковые модели. Он показывает, что сложность долгосрочных задач может быть измерена и преодолена, если создать чистую среду для проверки способности удержания состояния. Способность модели сохранять точные промежуточные результаты через сотни зависимых шагов открывает пути к созданию более надёжных автономных систем, способных выполнять длительные цепочки логических действий без необходимости постоянной перепроверки на каждом шаге. Это переход от имитации разума к демонстрации устойчивой когнитивной структуры.
Технологии, позволяющие моделям выполнять такие сложные вычисления, постепенно становятся стандартом. Однако важно помнить, что успех зависит не только от параметров модели, но и от того, как мы строим процесс взаимодействия с ней. Правильная организация контекста и введение механизмов самовыявления ошибок остаются критически важными для достижения стабильности в реальных сценариях применения.