Точность важнее масштаба: как CIFQA решает финансовые задачи детерминированным подходом
В мире финансового анализа ошибки в расчётах недопустимы, однако крупные языковые модели (LLM) часто генерируют правдоподобные, но математически неверные ответы. Новое исследование, представленное в arXiv под названием CIFQA, демонстрирует, что для задач с высокой вычислительной нагрузкой архитектурная инженерия и детерминированные инструменты эффективнее, чем увеличение размера нейросети. Авторы показывают, что система на базе модели весом 17 миллиардов параметров значительно превосходит гораздо более мощные модели при ответе на сложные вопросы о срочных вкладах, достигая точности 95,54% в расчётных задачах.

# Архитектурная дисциплина против масштаба: революция в финансовых вычислениях с CIFQA
Проблема, стоящая перед создателями ИИ в финансовой сфере, известна всем, кто сталкивался с «галлюцинациями» моделей. Когда просят рассчитать итоговую сумму вклада с учётом сложного процентного начисления, штрафов за досрочное снятие и временных корректировок, крупные языковые модели часто теряются. Они могут грамотно составить предложение, но в цифрах ошибаются, предлагая решения, которые звучат убедительно, но математически несостоятельны. Это фундаментальное ограничение LLM, которые оптимизированы для понимания языка, а не для точного выполнения арифметических операций и следования строгой логике.
В работе, опубликованной на arXiv (ID: 2608.26114), авторы Kunjesh Parekh, Anil Kumar Tiwari и Divya Saxena предлагают решение, названное CIFQA (Calculation-Intensive Financial Query Answering).该系统 не пытается заставить нейросеть считать сама, а разделяет задачи: понимание запроса остаётся за языковой моделью, а вся вычислительная логика переносится в детерминированные инструменты. Результаты исследований показывают, что этот подход позволяет даже скромной по меркам современного времени модели (17B параметров) превзойти гигантов индустрии в задачах финансового планирования.
Разделение труда: от языка к числам
Суть новизны подхода CIFQA заключается в архитектуре «многоагентной» системы, где каждый участник играет свою роль, подобно специалистам в реальной финансовой фирме.
Система разделяет процесс на этапы, которые выполняются специализированными агентами, а не одной нейросетью в потоке. 1. Интерпретация запроса и маршрутизация: Агент анализирует естественный язык вопроса пользователя, определяя, какие данные нужны, и какие правила применяются. 2. Извлечение параметров: Специализированный модуль вытягивает из текста ключевые числовые значения: ставку, срок, дату начала. 3. Планирование вычислений: Здесь происходит создание «скрипта» действий. Модель не решает задачу, а формулирует план: сначала найти ставку, затем рассчитать срок, затем применить логику досрочного изъятия. 4. Выполнение расчётов: Критически важный этап. Детерминированные инструменты на базе Python выполняют все математические операции. Они используют точные таблицы ставок и строгую логику правил, исключая любые интерпретации или домыслы. 5. Генерация ответа: Только после получения точного числового результата модель формирует финальный текст для пользователя.
Эта разделение ответственности устраняет главную слабость чат-ботов. Если LLM ошибается в арифметике, это исправляется тем фактом, что арифметику выполняет отдельный, проверяемый код. Авторы называют это подходом «инструментально ориентированным», где надёжность системы зависит от качества кода инструментов, а не от объёма данных, обученных в нейросети.
Эксперименты на базе срочных вкладов
Для проверки гипотезы авторы создали строгий бенчмарк (тестовую выборку) вопросов, касающихся банковских депозитов. Эти задачи являются классическим примером «расчётно-интенсивных» вопросов, требующих учёта множества нюансов: * Точный подбор процентной ставки. * Вычисление срока владения (tenure). * Корректировки на катящийся год (rolling-year adjustment). * Логика штрафов за досрочное изъятие средств.
Результаты сравнения с прямыми базовыми моделями оказались впечатляющими. Когда CIFQA был оценен на этих задачах, система достигла: * 95,54% точности на расчётно-интенсивных вопросах. * 90,87% общей точности на всей выборке.
Для сравнения, прямые LLM-модели, даже когда им предоставляют полные формулы, карточки со ставками и инструкции к бенчмарку, показывают значительно худшие результаты. Ошибка в одном символе или непонимание последовательности шагов у простой модели может привести к колоссальной разнице в итоговой сумме.
Архитектура побеждает масштаб
Одним из самых интригующих выводов исследования является контраст между размером модели и её эффективностью. В эксперименте CIFQA использовал в качестве основы открытую модель весом всего 17 миллиардов параметров. При этом в качестве сравнительной базы были взяты значительно более крупные модели, представляющие собой передний край (frontier) технологий.
Парадокс заключается в том, что 17B-модель внутри архитектуры CIFQA показала результаты, значительно превосходящие гигантов с сотнями миллиардов параметров, когда использовалась та же финансовая информация. Это подтверждает мысль авторов: для задач, требующих точного следования правилам и вычислений, архитектурный дизайн системы важнее, чем чистая мощность модели.
Абляционные исследования (эксперименты, при которых отключают или упрощают отдельные части системы) показали, что именно детерминированные компоненты играют ключевую роль. Точный поиск ставки, корректное вычисление срока и строгая логика штрафов являются теми «узлами», которые обеспечивают высокую точность. Без них система теряет свою надёжность.
Взгляд в будущее финансовых систем
Хотя тестирование проводилось исключительно на вопросах о срочных вкладах, авторы настаивают на том, что CIFQA представляет собой универсальный шаблон. Любая задача, требующая точной работы с числами, правилами и структурированными данными (например, налогообложение, расчет пенсий, страховые выплаты), может быть адаптирована под этот подход.
В эпоху, когда финансовый консилиум всё чаще заменяется алгоритмами, этот эксперимент ставит точку в дискуссии о том, куда развивать ИИ: в сторону больших баз знаний или в сторону точных инструментов. CIFQA показывает, что иногда достаточно быть скромным по размеру, но дисциплинированным в действиях. Для пользователя это значит получить ответы, на которые можно положиться, не требуя от ИИ чудесного понимания математики, а просто заставляя его правильно использовать калькулятор.
Как тихий маяк в шторме цифровых предположений, такая архитектура напоминает: в финансах точность есть цена, и её платят не размером сети, а качеством инженерии.