Процессные ограничения: малая модель DeepLens обгоняет лидеров ИИ в медицине
В исследовании, опубликованном на платформе arXiv, продемонстрирована методика, которая позволяет малой модели искусственного интеллекта превзойть мощные фронтиерные языковые модели при решении сложных медицинских задач. Ключевым фактором успеха выступает не количество параметров сети, а строгая регламентация процесса работы агента.
# Глубокая диагностика: почему структура важнее размера модели
Медицинская диагностика традиционно рассматривается как многоэтапный процесс, требующий вытаскивания фактов из истории болезни, консультации внешних знаний, генерации дифференциального анализа и финального выбора наиболее вероятного диагноза. Современные фронтиерные языковые модели (LLM), несмотря на их широкие знания, часто демонстрируют хрупкость в таких задачах при однократном промптировании. Новые данные показывают, что дисциплинированный подход к архитектуре работы агента способно нивелировать этот недостаток.
Архитектура DeepLens Diagnosis Agent
В центре внимания исследования находится DeepLens Diagnosis Agent. Это система, построенная на базе малой модели медицинской реASONиинга — JSL Medical Small 7B v2. Вместо простого вопроса-ответа система использует пятиэтапный пайплайн, сочетающий возможности модели с жесткими процессными ограничениями. В основу заложен метод извлечения сгенерированных знаний (RAG).
Процесс работы агента строго регламентирован на каждом этапе: происходит структурированное извлечение клинических данных, дисциплинированный поиск информации по базе знаний, генерация ограниченного круга кандидатов, явное триангулирование доказательств и формирование финального, проверяемого решения. Такой подход позволяет системе работать как на аналитической машине, где каждый шаг поддается аудиту.
Результаты на бенчмарке DiagnosisArena
Эффективность подхода была оценена на бенчмарке DiagnosisArena, который насчитывает 915 клинических случаев. Без применения агентского рабочего процесса та же самая модель показывала точность всего 23,99%. Внедрение методологии DeepLens повысило этот показатель до 60,14%, что стало лучшим результатом среди моделей малого и среднего размера.
Важно отметить, что на стандартных медицинских тестах, где требуется знание фактологии, модель без сложного рабочего процесса достигала 88,2% точности. Падение результатов в специфической диагностической среде подчеркивает главную мысль авторов: работа с неопределенностью требует больше, чем простое воспроизведение знаний из базы. Процессные ограничения компенсируют отсутствие больших параметров.
Экономическая эффективность и надежность
Стоимость работы агента составляет около 0,0072 доллара США на случай (24 тысячи токенов на графическом процессоре A100) при задержке в 24 секунды. Это на 35–45% дешевле, чем работа с моделями уровня Claude Sonnet 4.5 (0,0110 доллара) и Gemini 3.1 Pro (0,0128 доллара). При этом DeepLens показывает перевес над ними в точности на 9,7 и 9,17 процентных пункта соответственно.
Наличие структурированных промежуточных артефактов позволяет локализировать ошибки и отслеживать ход рассуждений. В сферах с высокими рисками, где критически важна прослеживаемость и воспроизводимость решений, такие свойства являются не просто бонусом, а обязательным требованием. Это подтверждает гипотезу о том, что грамотный дизайн рабочего процесса может быть более значимым фактором, чем стоимость API или количество параметров модели.