Artificial Intelligence · Multi-LLM Inference · Reasoning · NLP Research · COMED Algorithm24 сентября в 07:32 · 3 мин

COMED: Поиски «золотой середины» в многомодельном логическом рассуждении ИИ

Системы искусственного интеллекта, объединяющие несколько больших языковых моделей (LLM), часто сталкиваются с дилеммой: либо доверять первому ответу, рискуя ошибкой, либо вовлекать всех участников в долгую дискуссию, что дорого и не всегда эффективно. Новое исследование COMED предлагает новый алгоритм «дозированного сотрудничества», который вмешивается только тогда, когда это действительно необходимо, улучшая точность медицинских и научных ответов без лишних вычислений.

# COMED: Контролируемое эскалирование моделей для избирательного обсуждения

В эпоху, когда отдельные модели искусственного интеллекта не могут гарантировать точность на всех видах задач, исследователи разрабатывают системы, объединяющие несколько моделей. Традиционно существуют два подхода: маршрутизация (выбор одной модели) и плотное сотрудничество (все модели обсуждают каждый вопрос). Новый алгоритм COMED (Controlled Model Escalation for Multi-LLM Deliberation) занимает промежуточное положение, предлагая сбалансированный метод, который повышает точность ответов, особенно в сложных медицинских и научных доменах.

Дилемма маршрутизации против коллаборации

Современные системы инференса сталкиваются с фундаментальной проблемой: ни одна большая языковая модель не является универсально надежной. Если использовать подход простой маршрутизации, система выберет одну модель для запроса и остановится. Это быстро, но рискованно: если выбранная модель ошибается, ошибка останется незамеченной.

Альтернативный подход — плотное сотрудничество, при котором каждая модель проверяет ответ других или участвует в групповом обсуждении. Однако исследования показывают, что такое сотрудничество не является монотонным процессом улучшения. Коллеги могут не только исправить ошибки одиночной модели («спасти» решение), но и исказить изначально правильный ответ, внося новые ошибки при попытке его улучшить. Этот феномен часто приводит к усилению галлюцинаций или логических сбоев.

Алгоритм избирательной эскалации

Разработчики из команды Норы Альбаллы и коллег предложили COMED как решение этой дилеммы. Алгоритм работает как пост-анкерный контроллер, который принимает первичный ответ, но не полагается на него слепо. Вместо того чтобы сразу включать всех коллег, COMED применяет три ключевых механизма:

1. Самоконтроль анкера: Система проверяет, насколько уверен первичный ответ сам в своей корректности, анализируя согласованность своих выводов. 2. Маршрутиционный разрыв (Router Margin): Оценивается неопределенность первичного выбора модели. Если модель не уверена в своей компетенции для данной задачи, это сигнал к действию. 3. Легковесная проверка сверстников: Вместо полномасштабного обсуждения, система инициирует точечный запрос к «коллегам» только для проверки размытых или спорных случаев.

Этот подход основан на формальной декомпозиции на «спасение» и «ущерб». Алгоритм активизирует коллаборацию только тогда, когда ожидаемая вероятность исправления ошибки (спасение) превышает риск внесения новых искажений (ущерб). Это позволяет системе игнорировать задачи, которые модель решила самостоятельно, и эскалировать только сложные кейсы.

Результаты на профессиональных бенчмарках

Тестирование COMED проводилось на широком спектре открытых настроек (всего 16 конфигураций), включая задачи в области медицины, науки и общего логического мышления. Результаты показали устойчивое улучшение по сравнению как с фиксированными анкерами, так и с системами маршрутизации.

Особого внимания заслуживают показатели на бенчмарке MedQA (медицинский тест). Здесь COMED продемонстрировал прирост точности до 10,7 процентных пункта по сравнению с базовыми методами, при этом задействуя меньше моделей и генерируя fewer декодированных токенов, что свидетельствует о экономической эффективности.

В тесте на логическое рассуждение высокого уровня (HLE) с использованием передовых моделей, COMED смог значительно повысить точность GPT-5.5 с 23,1% до 28,1%. В этой категории метод не только превзошел системы плотного сотрудничества, но и достиг лучших результатов среди всех протестированных подходов.

Эти данные подтверждают гипотезу авторов: избирательное вовлечение ресурсов моделирует процесс коллективного размышления человека, где мы редко консультируемся со всем кругом экспертов по каждому пустяковому вопросу, но всегда привлекаем помощь для решения сложных задач.

Первоисточники

arXiv cs.CL
← Вернуться в эфир