искусственный интеллект · медицинский AI · выживаемость · большие языковые модели · Survprompt · машинное обучение · онкология2 октября в 04:32 · 4 мин

Языковые модели как приближенные оценщики выживаемости: новые данные из медицинской статистики

Исследование, опубликованное на arXiv, демонстрирует способность передовых больших языковых моделей (LLM) генерировать прогнозы продолжительности жизни пациентов, сопоставимые со специализированными алгоритмами. Авторы представили фреймворк Survprompt, который позволяет преобразовывать структурированные медицинские данные в текстовые описания для задач выживаемости 'из коробки', без дополнительной дообучения модели на конкретных данных.

# Большие языковые модели как приближенные оценщики выживаемости

Традиционный анализ выживаемости является краеугольным камнем современной медицины, позволяя оценивать вероятность наступления критических событий — например, смерти пациента или рецидива заболевания — на основе различных параметров. Эти методы широко используются для оценки рисков, но часто требуют сложной настройки под конкретные датасеты. В новом исследовании, доступном по адресу arXiv:2609.38181, авторы ставят под сомнение необходимость сложной подготовки моделей, показывая, что современные LLM способны выполнять подобные задачи с удивительной точностью.

Фреймворк Survprompt: от таблиц к истории болезни

Основным инструментом в данном исследовании стал предложенный авторами фреймворк, названный Survprompt. В своей сути, этот подход решает задачу перевода структурированных клинических признаков (например, возраст, стадия опухоли, показатели крови) в свободный текстовый формат — медицинскую вивенту (краткое клиническое описание). Полученный текст затем подается в предобученную языковую модель.

Ключевой особенностью подхода является метод «из коробки» (zero-shot). Это означает, что модель не обучалась специально на исторических данных пациентов из используемых выборок. Вместо этого она использовала свои общие знания, полученные при обучении на огромных массивах текстов, для логического вывода прогноза. Авторы отмечают, что пациенты, ищущие прогностическую информацию, часто обращаются именно к таким общедоступным инструментам, однако степень их надежности до настоящего времени не была строго оценена.

Сравнительный анализ с классическими моделями

Для проверки эффективности подхода команда провела масштабное бенчмаркинг, сравнив результаты работы LLM с традиционными методами, в частности, с использованием случайных лесов выживаемости (Random Survival Forests — RSF). RSF являются стандартом индустрии для специализированных задач выживаемости и долго разрабатывались отдельными учеными для медицинского применения.

Испытания проводились на двух крупных когортах данных: общедоступном наборе MSK-CHORD и недавно созданной выборке из сети Providence St. Joseph Health Network. Для оценки точности использовались специализированные метрики, такие как среднее абсолютное ошибочное значение с учетом цензурирования (cMAE) и индекс конкордантности (c-index).

Результаты оказались неожиданно конкурентоспособными. Модель GPT-5.6-Sol продемонстрировала cMAE, находящуюся в пределах 10% от показателей лучших специализированных моделей RSF по нескольким типам рака. Более того, для рака простаты в наборе MSK-CHORD языковая модель показала меньшую ошибку, чем классические алгоритмы.

Важно понимать разницу между метриками. Низкий cMAE говорит о том, что модель хорошо угадывает конкретное число лет, которое проживет пациент. Высокий c-index же отражает способность модели корректно разделять пациентов на группы риска (кто проживет дольше, а кто меньше). В этом аспекте LLM показали свою слабость: индекс конкордантности у них был ниже, чем у специализированных моделей, что указывает на плохую дискриминационную способность между высокорисковыми и низкорисковыми пациентами.

Анализ влияния признаков (feature ablations) выявил интересную деталь: хотя LLM используют общую логику, они выстраивают приоритет клинических переменных схожим образом, как и специализированные выживаемостные модели. Это подтверждает, что модели действительно «понимают» медицинскую логику, а не просто имитируют случайные корреляции.

Ограничения и будущее клинического применения

Несмотря на высокие показатели точности для отдельных прогнозов, исследование подчеркивает существенные ограничения. Точность работы LLM варьировалась в зависимости от типа рака и учреждения, где собирались данные. Это делает их применение менее надежным по сравнению со статистическими моделями, которые могут быть более устойчивыми к вариациям в структуре данных.

Таким образом, можно заключить, что языковые модели выступают в роли «приближенных оценщиков» выживаемости. Они могут генерировать удивительно точные числовые прогнозы без специальной дообучки, что открывает возможности для быстрого первичного скрининга. Однако их нестабильность при различении групп риска требует осторожности. В клинической практике такие модели могут служить полезным дополнением, предоставляя «второе мнение», но не должны полностью заменять проверенные статистические методы или врачебный опыт в принятии окончательных решений о лечении.

Первоисточники

arXiv cs.CL ↗
← Вернуться в эфир