Выполняемый код для медицины: как GuideSkill заставляет большие языковые модели применять клинические протоколы
В мире медицинского ИИ часто возникает проблема: большие языковые модели (LLM) умно читать документы, но плохо следовать строгим алгоритмическим правилам. Исследователи представили метод GuideSkill, который превращает текстовые клинические рекомендации в реальные исполняемые функции. Это позволяет системам не просто генерировать вероятные диагнозы, а вычислять их по четким критериям, значительно повышая точность и безопасность.
# Когда текст превращается в логику: технология GuideSkill
Клинические рекомендации (Clinical Practice Guidelines или CPG) — это «библия» для врачей. В них изложены строгие диагностические критерии: при наличии симптомов А, Б и В врач должен ставить диагноз X или исключить его. Традиционно большие языковые модели пытаются решить такие задачи, просто прочитав текст рекомендации в контексте промпта. Это ненадежно. Модель может «забыть» важный пункт или спутать условие, если текст слишком длинный. Проблема известна как галлюцинация, но здесь речь идет о системной ошибке следования инструкции.
Команда исследователей, опубликовавших работу на arXiv под названием GuideSkill, предложила радикально другой подход. Вместо того чтобы заставлять модель запоминать правила через обучение с подкреплением или тонкую настройку параметров, они создали внешний слой рассуждений. Этот слой берет текстовые правила и компилирует их в исполняемые функции. Проще говоря, если правило гласит: «Если температура выше 38 и есть кашель, то скоринг повышен», то система физически создает функцию, которая делает именно это, возвращая численный балл поддержки диагноза. Этот балл затем суммируется с тем, что предложил сам ИИ.
От «честного» базового уровня к эволюции навыков
В работе описывается два режима работы системы. Первый вариант, GuideSkill-Zero, работает на основе исходных текстовых рекомендаций. Исследователи не обучали модель на данных; они просто перевели правила в код. Даже в этом базовом режиме точность макросреднего суждения (macro-average accuracy) выросла на 13.45% по сравнению с обычными системами, которые просто ищут текст в базе знаний (метод RAG).
Второй подход, GuideSkill-Evo, использует процесс эволюции. Если «нулевой» вариант только переводит правила из текста, то эволюционный вариант смотрит на пары «кейс-диагноз» из медицинских баз данных. Он определяет, какие навыки (правила) еще не охвачены существующими критериями, и добавляет их. Это позволяет закрыть 99.5% случаев, для которых были известны «золотые» стандарты диагноза, что означает охват в два раза больше, чем у предыдущих версий.
При этом система сохраняет модель-основу неизменной. Даже на мощной модели Qwen3.5-9B использование GuideSkill дало прирост в 11.16% по сравнению с методами, меняющими веса нейросети. Это важно, так как изменение весов моделей часто приводит к деградации общих навыков. Здесь же улучшения достигаются только за счет изменения логики принятия решений.
Техническая суть и безопасность
Как это работает внутри? В момент инференса (когда врач или система ставит диагноз) происходит сложная оркестрация. Во-первых, большая языковая модель предлагает предварительный дифференциальный диагноз. Во-вторых, система сопоставляет этот диагноз с накопленными навыками. В-третьих, она извлекает необходимые признаки из истории болезни и прогоняет их через соответствующие функции. Если функция возвращает «не проходит по критерию А», это блокирует диагноз, независимо от того, как уверенно модель этого хотела. В-четвертых, ранжировка от ИИ и числовые баллы от исполняемых функций объединяются.
Такой подход делает систему устойчивой к ошибкам. Если модель спотыкается на формулировке вопроса, исполнительная функция сработает корректно, основываясь на численных данных. Экспертная оценка подтвердила, что сгенерированные правила не просто математически корректны, но и клинически приемлемы. Это открывает путь к созданию универсальных механизмов, которые можно применять к разным архитектурам моделей, не переучивая их с нуля.
В мире ИИ мы часто слышим о том, что модели становятся «черными коробками». GuideSkill, вероятно, станет одним из инструментов для решения проблемы прозрачности. Вместо мистического процесса генерации ответа мы получаем систему, которая честно применяет проверенные медицинские правила, превращая текст рекомендаций в действующий алгоритм.