Backtrader-Bench: Новый стандарт оценки навыков торговых агентов на базе ИИ
Оценка способности языковых моделей (LLM) решать задачи алгоритмической торговли сталкивается с уникальными сложностями: риск утечки данных при использовании статических тестов и необходимость верификации численных результатов через реальное выполнение кода. Исследователи представили фреймворк Backtrader-Bench, который использует автоматическую генерацию вопросов с множественным выбором для создания устойчивой среды тестирования. Результаты показывают, что модели с инструментами исполнения кода значительно превосходят те, что полагаются исключительно на внутреннее знание, демонстрируя разрыв в 17 процентных пунктов в точности ответов.
# Backtrader-Bench: Новый стандарт оценки навыков торговых агентов на базе ИИ
В мире количественных финансов скорость принятия решений часто перевешивает интуицию. Алгоритмическая торговля требует от программистов не просто написания кода, а глубокого понимания финансовых стратегий, управления рисками и математической точности. Искусственный интеллект, особенно большие языковые модели (LLM), предлагает обещание автоматизации этих процессов. Однако, как мы можем быть уверены, что «программист»-бот не просто декламирует идеальные решения из тренировочной выборки, а действительно способен проанализировать новую рыночную конфигурацию?
Команда исследователей, представивших работу на arXiv под названием «Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs», предложила ответ на этот вызов. Они разработали фреймворк, который устраняет необходимость в ручном создании тестовых наборов данных и минимизирует риск утечки информации (data contamination), используя масштабируемую систему генерации вопросов.
Динамическая генерация вместо статических тестов
Традиционные бенчмарки в области ИИ часто страдают от устаревания или того, что модели просто заучивают вопросы и ответы. В области алгоритмической торговли эта проблема усугубляется тем, что результаты тестов зависят от конкретного кода, который должен быть выполнен, чтобы получить истинное значение (ground truth). Статические наборы данных быстро становятся неактуальными или уязвимыми для подделки.
Исследователи предлагают решение в виде двух дополнительных конвейеров (pipelines) в рамках фреймворка Backtrader-Bench:
1. Детерминированный конвейер вопросов с множественным выбором (MCQ): Эта система автоматически генерирует вопросы на основе конфигураций бэктестов (обратного тестирования) для пяти различных торговых стратегий. Система использует 33 шаблона и три уровня сложности. Ключевая особенность — наличие независимого проверяющего, который каждый раз заново выводит ответ на основе текущего кода, обеспечивая надежность тестирования. 2. Конвейер фильтрации «генератор-решатель»: Этот модуль автоматически ищет более сложные задачи. Генератор создает вопросы и проверяет их выполнение через код. Затем вопросы преобразуются в формат MCQ. Любые вопросы, которые можно решить без использования инструментов (то есть, только на основе текста), отбрасываются. Это гарантирует, что оставшиеся задачи действительно требуют навыков работы с кодом.
Таким образом, система не просто задает вопросы, она динамически адаптирует сложность и проверяет, что решение невозможно найти без фактического взаимодействия с торговой средой.
Результаты: Значимость инструментов
На основе сгенерированного набора из 30 проверенных вопросов исследователи оценили 11 моделей, не использующих инструменты, и четыре конфигурации с инструментами. Результаты теста показали резкое разделение между двумя подходами.
Модели, усиленные инструментами (то есть имеющие доступ к исполнению кода), достигли точности 90,0% в одном проходе. Лучшие модели из этой группы — GPT-5.5 и Opus 4.7 — продемонстрировали выдающуюся способность к выполнению сложных логических цепочек в контексте торговли.
В сравнении с ними, лучшие базовые модели, лишенные доступа к инструментам, показали точность 73,0% (в среднем по 10 запусков). Разрыв составил внушительные 17 процентных пунктов. Это свидетельствует о том, что способность модели «мыслить» без вычислительной поддержки в задачах алгоритмической торговли имеет фундаментальные ограничения.
Более того, на наборе из 38 отдельно сгенерированных сложных вопросов точность моделей без инструментов упала еще сильнее. Половина из них продемонстрировала результат, близкий к случайному угадыванию (25%). Это подтверждает, что в задачах, требующих точных расчетов и понимания динамики рынка, интуиция модели без подкрепления кодом практически бесполезна.
Взгляд в будущее: Обучение через автоматизацию
Значимость исследования Backtrader-Bench выходит за рамки простой оценки текущих возможностей. Архитектура созданной системы вопросов и ответов спроектирована так, чтобы быть масштабируемой. Авторы указывают, что созданная инфраструктура может быть использована для формирования обучающих корпорусов (наборов данных) для обучения с подкреплением (reinforcement learning).
Цель авторов ясна: создать специализированных агентов, способных работать в реальных рабочих процессах количественной торговли. Вместо того чтобы полагаться на редкое и дорогое человеческое обучение или фиксированные примеры, будущее автоматизации торговых стратегий может лежать в плоскости массового генеративного тестирования, которое непрерывно улучшает модели за счет самогенерируемых сценариев.
Как отмечали исследователи, эта работа принята к публикации на семинаре FinLLM в рамках конференции IJCAI 2026. Код и данные доступны для ознакомления, что открывает возможности для дальнейшего развития сообщества в области AI for Finance.
В заключение, Backtrader-Bench подчеркивает важный сдвиг парадигмы: в сложных прикладных областях, где ошибки имеют денежное выражение, ИИ должен обладать не только языковой компетенцией, но и способностью безопасно и точно взаимодействовать с реальными вычислительными системами.