COMED: Поиски «золотой середины» в многомодельном логическом рассуждении ИИ
Системы искусственного интеллекта, объединяющие несколько больших языковых моделей (LLM), часто сталкиваются с дилеммой: либо доверять первому ответу, рискуя ошибкой, либо вовлекать всех участников в долгую дискуссию, что дорого и не всегда эффективно. Новое исследование COMED предлагает новый алгоритм «дозированного сотрудничества», который вмешивается только тогда, когда это действительно необходимо, улучшая точность медицинских и научных ответов без лишних вычислений.
# COMED: Контролируемое эскалирование моделей для избирательного обсуждения
В эпоху, когда отдельные модели искусственного интеллекта не могут гарантировать точность на всех видах задач, исследователи разрабатывают системы, объединяющие несколько моделей. Традиционно существуют два подхода: маршрутизация (выбор одной модели) и плотное сотрудничество (все модели обсуждают каждый вопрос). Новый алгоритм COMED (Controlled Model Escalation for Multi-LLM Deliberation) занимает промежуточное положение, предлагая сбалансированный метод, который повышает точность ответов, особенно в сложных медицинских и научных доменах.
Дилемма маршрутизации против коллаборации
Современные системы инференса сталкиваются с фундаментальной проблемой: ни одна большая языковая модель не является универсально надежной. Если использовать подход простой маршрутизации, система выберет одну модель для запроса и остановится. Это быстро, но рискованно: если выбранная модель ошибается, ошибка останется незамеченной.
Альтернативный подход — плотное сотрудничество, при котором каждая модель проверяет ответ других или участвует в групповом обсуждении. Однако исследования показывают, что такое сотрудничество не является монотонным процессом улучшения. Коллеги могут не только исправить ошибки одиночной модели («спасти» решение), но и исказить изначально правильный ответ, внося новые ошибки при попытке его улучшить. Этот феномен часто приводит к усилению галлюцинаций или логических сбоев.
Алгоритм избирательной эскалации
Разработчики из команды Норы Альбаллы и коллег предложили COMED как решение этой дилеммы. Алгоритм работает как пост-анкерный контроллер, который принимает первичный ответ, но не полагается на него слепо. Вместо того чтобы сразу включать всех коллег, COMED применяет три ключевых механизма:
1. Самоконтроль анкера: Система проверяет, насколько уверен первичный ответ сам в своей корректности, анализируя согласованность своих выводов. 2. Маршрутиционный разрыв (Router Margin): Оценивается неопределенность первичного выбора модели. Если модель не уверена в своей компетенции для данной задачи, это сигнал к действию. 3. Легковесная проверка сверстников: Вместо полномасштабного обсуждения, система инициирует точечный запрос к «коллегам» только для проверки размытых или спорных случаев.
Этот подход основан на формальной декомпозиции на «спасение» и «ущерб». Алгоритм активизирует коллаборацию только тогда, когда ожидаемая вероятность исправления ошибки (спасение) превышает риск внесения новых искажений (ущерб). Это позволяет системе игнорировать задачи, которые модель решила самостоятельно, и эскалировать только сложные кейсы.
Результаты на профессиональных бенчмарках
Тестирование COMED проводилось на широком спектре открытых настроек (всего 16 конфигураций), включая задачи в области медицины, науки и общего логического мышления. Результаты показали устойчивое улучшение по сравнению как с фиксированными анкерами, так и с системами маршрутизации.
Особого внимания заслуживают показатели на бенчмарке MedQA (медицинский тест). Здесь COMED продемонстрировал прирост точности до 10,7 процентных пункта по сравнению с базовыми методами, при этом задействуя меньше моделей и генерируя fewer декодированных токенов, что свидетельствует о экономической эффективности.
В тесте на логическое рассуждение высокого уровня (HLE) с использованием передовых моделей, COMED смог значительно повысить точность GPT-5.5 с 23,1% до 28,1%. В этой категории метод не только превзошел системы плотного сотрудничества, но и достиг лучших результатов среди всех протестированных подходов.
Эти данные подтверждают гипотезу авторов: избирательное вовлечение ресурсов моделирует процесс коллективного размышления человека, где мы редко консультируемся со всем кругом экспертов по каждому пустяковому вопросу, но всегда привлекаем помощь для решения сложных задач.