ИИ · FinTech · arXiv · Оценка моделей · Финансы · Профессиональная этика · FinProBench6 августа в 10:31 · 4 мин

FinProBench: новая шкала оценки финансовых ИИ-агентов на основе профессиональных артефактов

Исследователи представили FinProBench и методологию RGRC, которая создает критерии оценки для финансовых ИИ-агентов, извлекая их напрямую из реальных профессиональных работ, а не только из инструкций или выходов моделей. Это позволяет отличать качество в задачах, где человеческий опыт еще недоступен языковым моделям.

# FinProBench: Ограничения инженерии промтов и сила профессионального опыта

Разработка искусственного интеллекта для финансового сектора сталкивается с фундаментальной проблемой оценки качества. Существующие методы часто полагаются на сравнение вывода модели с текстом промпта или используют другие модели-судьи без учета тонких, негласных стандартов профессии. Новая работа, доступная в репозитории arXiv под заголовком *FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables*, предлагает решение через создание бенчмарка и конвейера для генерации критериев.

Концепция: от инструкций к артефактам

Центральная идея исследования заключается в смене парадигмы оценки. Вместо того чтобы полагаться на то, что модель знает о задаче благодаря промпту (инструкции), авторы предлагают извлекать критерии успеха непосредственно из готовых профессиональных документов (deliverables), созданных живыми специалистами.

Методология, названная Role-Grounded Rubric Construction (RGRC), состоит из четырех этапов: 1. Сбор артефактов: Сбор реальных работ специалистов. 2. Извлечение компетенций: Выделение ключевых навыков и требований из этих работ. 3. Синтез критериев: Формирование рубрик оценки. 4. Валидация: Проверка корректности созданных критериев.

Такой подход позволяет зафиксировать «молчаливые стандарты» (tacit standards) — то, что опытный профессионал делает автоматически, но редко прописывает в явных инструкциях для ИИ. Критерии, созданные таким образом, способны передаваться на другие задачи внутри той же профессиональной роли.

Разделение ролей: привычные и специализированные

В ходе подготовки бенчмарка исследователи классифицировали 57 профессий. В результате они выделили две основные группы: * Конвенциональные роли (prior-rich): 30 профессий, где стандарты и шаблоны хорошо известны и, вероятно, уже присутствуют в обучающих данных языковых моделей. * Специализированные роли (prior-sparse): 27 профессий, требующих глубокого отраслевого опыта, стандартов которого модели могут не знать.

Этот разграничитель стал ключевым для понимания возможностей и ограничений современных ИИ-агентов.

Результаты: где промпы работают, а где нужен человек

Экспериментальное сравнение показало интересный контраст между двумя подходами оценки: использованием только промптов (Prompt-only) и новым методом на основе артефактов (RGRC).

* В конвенциональных ролях: Разница минимальна. Метод Prompt-only достиг точности 89,2%, в то время как RGRC показал 90,7%. Это подтверждает, что для рутинных и хорошо документированных задач инструкции достаточно точны. Языковые модели здесь успешно имитируют ожидаемый результат. * В специализированных ролях: Разница колоссальна. RGRC показал результат 99,1%, тогда как Prompt-only упал до 78,0%. Это доказывает, что инженерии промптов недостаточно для сложных задач, требующих специфической профессиональной экспертизы, не зашитой в общие данные модели.

В рамках FinProBench использовано 1 723 отобранных артефакта, охватывающих 8 финансовых подотраслей и 161 тип документа. Начальный набор для тестирования включает 20 задач. Оценка проводилась с помощью гетерогенных моделей-судей (heterogeneous LLM judges).

Итоговый рейтинг показал, что человеческие артефакты в среднем занимают первое место (73,7 балла из 100), что выше результатов всех протестированных систем (70,3; 70,2 и 69,6). Тем не менее, доверительные интервалы 95% для всех систем накладываются друг на друга, указывая на то, что разные системы имеют свои сильные и слабые стороны, но ни одна пока не достигла идеального человеческого уровня.

Экономическая эффективность метода

Помимо качества, метод RGRC демонстрирует значительную эффективность с точки зрения ресурсов. Переиспользование критериев на уровне профессиональной роли снижает предполагаемые затраты на разработку оценки для каждой новой задачи в 6,7 раза по сравнению с авторским составлением критериев с нуля.

Факты исследования подтверждают, что прогресс в области финансовых ИИ зависит не от количества инструкций, а от глубокого понимания реальной профессиональной практики.

*Авторский штрих: Как маяк в тумане данных, этот подход напоминает, что за цифрами и кодом стоят реальные человеческие компетенции, которые нельзя полностью алгоритмизировать одним текстом. Мы движемся от имитации формы к пониманию сути профессионального труда.*

Первоисточники

arXiv cs.AI
← Вернуться в эфир