Глубокие исследования и фактологическая точность: новый метод прогнозирования медицинских кодов
В области клинической информатики представлен новый гибридный алгоритм «ICD-Deepresearch», сочетающий возможности структурированных моделей электронных медицинских карт (EHR) с агентами для глубоких исследований. Данная система, описанная в работе на arXiv, демонстрирует способность более точно и релевантно предсказывать диагнозы пациентов при будущих визитах, используя для обоснования выводов внешние клинические данные.

# Foundation Agents Meet Agentic Deep Research: Evidence-Grounded Clinical Code Forecasting
Развитие больших языковых моделей (LLM) привело к появлению инструментов, способных не только генерировать текст, но и проводить исследования. Однако в высокоструктурированных областях, таких как медицина, где требуется строгая привязка к фактам, подход «глубокого исследования» (Deep Research) сталкивается с вызовом отсутствия «золотого стандарта» для будущих событий.
Новая работа, опубликованная 17 августа 2026 года, introduces метод под названием ICD-Deepresearch. Авторы Junda Wang, Meysam Ghaffari, Akshat Choube, Mohsen Sharifi Renani, Hong Yu и Carlos Morato описывают систему, которая интегрирует прогнозирующие модели с агентами для поиска информации, создавая гибридный подход к прогнозированию кодов МКБ-10 (ICD).
Прогнозирование будущих диагнозов: постановка задачи
Задача, решаемая системой, является следующей встречающей (next-encounter) прогнозирование кодов ICD. Цель заключается в предсказании стандартизированных диагностических кодов, которые будут зафиксированы в медицинской документации при будущем визите пациента, используя только доступные на данный момент исторические данные.
Эта задача имеет две ключевые особенности, отличающие её от простой классификации: 1. Продольный характер: Целевая медицинская запись еще не существует. 2. Мультилейбелность: Для одного пациента может быть верным несколько диагнозов одновременно.
Традиционные структурированные модели электронных карт (EHR foundation models) хорошо справляются с анализом временных прогрессий и рецидивов болезней в структурированных данных. Однако языковые модели (LLM) обладают гибкостью в формулировании диагностических гипотез и работе с неструктурированными текстами (записями врачей, клиническими заметками).
ICD-Deepresearch объединяет эти подходы, используя агентов для глубоких исследований для связывания данных пациента с внешними клиническими знаниями и словарями медицинских кодов.
Архитектура гибридной системы
Система работает по принципу ограниченного бюджета на выбор кандидатов (fixed top-K budget), что отражает реальную вычислительную и временную ограниченность процесса принятия решений.
Процесс генерации кандидатов происходит в несколько этапов:
1. Предварительная оценка (EHR Prior): Модуль SparseEHR генерирует предварительный рейтинг вероятностей диагнозов на основе истории болезни пациента. Это служит базой для дальнейших исследований. 2. Расширение исследований: На основе предварительной оценки запускаются два ограниченных раунда расширения поиска. Агент ищет внешние клинические связи и дополнительные доказательства, подтверждающие или опровергающие гипотезы. 3. Независимый прогноз: Параллельно работает модель GPT-5 Direct Forecast (прямое прогнозирование), которая генерирует альтернативные кандидаты, не опираясь на результаты поиска агента. Это обеспечивает разнообразие в наборе прогнозов.
Этапы генерации заканчиваются модулем финального отбора, который: * Валидирует полученные кандидаты. * Убирает дубликаты. * jointly ranks (совместно ранжирует) результаты обоих путей (от агента поиска и прямой модели).
Важно отметить, что финальный модуль, отвечающий за написание обоснований (rationales), отделен от процесса принятия решения о диагнозе. Это позволяет системе объяснять свои выводы после того, как прогноз уже сформирован, избегая предвзятости в генерации аргументов под конкретный диагноз.
Результаты и оценка полезности
Эффективность системы была протестирована на наборах данных MIMIC-III и MIMIC-IV, которые являются стандартом для исследований клинической информатики.
Показатели точности (precision) и полноты (recall), усредненные по пациентам, показали следующие результаты: * На MIMIC-III: точность 24.60%, полнота 35.09%. * На MIMIC-IV: точность 25.14%, полнота 48.32%.
Хотя показатели точности и полноты являются объективными метриками, в медицине критически важно качество предоставляемой информации. Для оценки этой стороны были проведены опросы врачей.
Врачи оценивали полезность извлеченных системой документов: * ICD-Deepresearch: 51% (MIMIC-III) и 68% (MIMIC-IV) отвлеченных документов были признаны полезными врачами. * GPT-5 (поиск в вебе): 22% и 39% соответственно. * Medical Deep Research: 32% и 41% соответственно.
Результаты указывают на то, что гибридный подход не только улучшает прогнозные метрики по сравнению с локальными контрольными группами, но и предоставляет врачу гораздо более релевантную информацию для принятия решений.
Технический контекст
Для понимания работы системы важно разделить понятия: * Фундаментальная модель EHR (Structured EHR Foundation Models): Это алгоритмы, специально обученные на табличных и структурированных данных электронных карт (лабораторные анализы, даты приема, диагнозы). Они улавливают временные паттерны и повторяющиеся состояния здоровья. * Языковая фундаментальная модель (Language Foundation Models): Модели, такие как GPT-5, обученные на текстовых данных. Они генерируют текстовые гипотезы, но без внешних проверок могут галлюцинировать или не учитывать редкие клинические ассоциации. * Агенты для глубоких исследований (Deep Research Agents): Программные сущности, способные самостоятельно искать информацию в интернете или базах данных, анализировать её и синтезировать ответы, следуя поставленной цели.
Введение ICD-Deepresearch демонстрирует путь к созданию систем, где сила обработки естественного языка дополняется строгой фактологической проверкой через агентов поиска, что особенно важно в регулируемых сферах, где цена ошибки высока.