искусственный интеллект · медицинская информатика · большие языковые модели · предиктивная аналитика · архив arXiv31 августа в 22:32 · 4 мин

Глубокие исследования и фактологическая точность: новый метод прогнозирования медицинских кодов

В области клинической информатики представлен новый гибридный алгоритм «ICD-Deepresearch», сочетающий возможности структурированных моделей электронных медицинских карт (EHR) с агентами для глубоких исследований. Данная система, описанная в работе на arXiv, демонстрирует способность более точно и релевантно предсказывать диагнозы пациентов при будущих визитах, используя для обоснования выводов внешние клинические данные.

Прозрачный стеклянный призма в каменном маяке, преломляющий холодный серебристый свет над ночью в Тихой бухте

# Foundation Agents Meet Agentic Deep Research: Evidence-Grounded Clinical Code Forecasting

Развитие больших языковых моделей (LLM) привело к появлению инструментов, способных не только генерировать текст, но и проводить исследования. Однако в высокоструктурированных областях, таких как медицина, где требуется строгая привязка к фактам, подход «глубокого исследования» (Deep Research) сталкивается с вызовом отсутствия «золотого стандарта» для будущих событий.

Новая работа, опубликованная 17 августа 2026 года, introduces метод под названием ICD-Deepresearch. Авторы Junda Wang, Meysam Ghaffari, Akshat Choube, Mohsen Sharifi Renani, Hong Yu и Carlos Morato описывают систему, которая интегрирует прогнозирующие модели с агентами для поиска информации, создавая гибридный подход к прогнозированию кодов МКБ-10 (ICD).

Прогнозирование будущих диагнозов: постановка задачи

Задача, решаемая системой, является следующей встречающей (next-encounter) прогнозирование кодов ICD. Цель заключается в предсказании стандартизированных диагностических кодов, которые будут зафиксированы в медицинской документации при будущем визите пациента, используя только доступные на данный момент исторические данные.

Эта задача имеет две ключевые особенности, отличающие её от простой классификации: 1. Продольный характер: Целевая медицинская запись еще не существует. 2. Мультилейбелность: Для одного пациента может быть верным несколько диагнозов одновременно.

Традиционные структурированные модели электронных карт (EHR foundation models) хорошо справляются с анализом временных прогрессий и рецидивов болезней в структурированных данных. Однако языковые модели (LLM) обладают гибкостью в формулировании диагностических гипотез и работе с неструктурированными текстами (записями врачей, клиническими заметками).

ICD-Deepresearch объединяет эти подходы, используя агентов для глубоких исследований для связывания данных пациента с внешними клиническими знаниями и словарями медицинских кодов.

Архитектура гибридной системы

Система работает по принципу ограниченного бюджета на выбор кандидатов (fixed top-K budget), что отражает реальную вычислительную и временную ограниченность процесса принятия решений.

Процесс генерации кандидатов происходит в несколько этапов:

1. Предварительная оценка (EHR Prior): Модуль SparseEHR генерирует предварительный рейтинг вероятностей диагнозов на основе истории болезни пациента. Это служит базой для дальнейших исследований. 2. Расширение исследований: На основе предварительной оценки запускаются два ограниченных раунда расширения поиска. Агент ищет внешние клинические связи и дополнительные доказательства, подтверждающие или опровергающие гипотезы. 3. Независимый прогноз: Параллельно работает модель GPT-5 Direct Forecast (прямое прогнозирование), которая генерирует альтернативные кандидаты, не опираясь на результаты поиска агента. Это обеспечивает разнообразие в наборе прогнозов.

Этапы генерации заканчиваются модулем финального отбора, который: * Валидирует полученные кандидаты. * Убирает дубликаты. * jointly ranks (совместно ранжирует) результаты обоих путей (от агента поиска и прямой модели).

Важно отметить, что финальный модуль, отвечающий за написание обоснований (rationales), отделен от процесса принятия решения о диагнозе. Это позволяет системе объяснять свои выводы после того, как прогноз уже сформирован, избегая предвзятости в генерации аргументов под конкретный диагноз.

Результаты и оценка полезности

Эффективность системы была протестирована на наборах данных MIMIC-III и MIMIC-IV, которые являются стандартом для исследований клинической информатики.

Показатели точности (precision) и полноты (recall), усредненные по пациентам, показали следующие результаты: * На MIMIC-III: точность 24.60%, полнота 35.09%. * На MIMIC-IV: точность 25.14%, полнота 48.32%.

Хотя показатели точности и полноты являются объективными метриками, в медицине критически важно качество предоставляемой информации. Для оценки этой стороны были проведены опросы врачей.

Врачи оценивали полезность извлеченных системой документов: * ICD-Deepresearch: 51% (MIMIC-III) и 68% (MIMIC-IV) отвлеченных документов были признаны полезными врачами. * GPT-5 (поиск в вебе): 22% и 39% соответственно. * Medical Deep Research: 32% и 41% соответственно.

Результаты указывают на то, что гибридный подход не только улучшает прогнозные метрики по сравнению с локальными контрольными группами, но и предоставляет врачу гораздо более релевантную информацию для принятия решений.

Технический контекст

Для понимания работы системы важно разделить понятия: * Фундаментальная модель EHR (Structured EHR Foundation Models): Это алгоритмы, специально обученные на табличных и структурированных данных электронных карт (лабораторные анализы, даты приема, диагнозы). Они улавливают временные паттерны и повторяющиеся состояния здоровья. * Языковая фундаментальная модель (Language Foundation Models): Модели, такие как GPT-5, обученные на текстовых данных. Они генерируют текстовые гипотезы, но без внешних проверок могут галлюцинировать или не учитывать редкие клинические ассоциации. * Агенты для глубоких исследований (Deep Research Agents): Программные сущности, способные самостоятельно искать информацию в интернете или базах данных, анализировать её и синтезировать ответы, следуя поставленной цели.

Введение ICD-Deepresearch демонстрирует путь к созданию систем, где сила обработки естественного языка дополняется строгой фактологической проверкой через агентов поиска, что особенно важно в регулируемых сферах, где цена ошибки высока.

Первоисточники

arXiv cs.CL
← Вернуться в эфир