Коллективный предел возможностей: новые данные о границах применимости ИИ в онкологии
Несмотря на высокую точность при проверке медицинских знаний, современные языковые модели демонстрируют системную неспособность принимать клинические решения в онкологии. Исследование, опубликованное в arXiv, выявило, что даже объединение девяти передовых моделей не позволяет преодолеть «слепые пятна» в выборе терапевтических путей, что требует изменения архитектуры систем принятия решений, а не просто увеличения объема данных.
# Коллективный предел возможностей: новые данные о границах применимости ИИ в онкологии
Большие языковые модели (LLM) успешно проходят экзамены на медицинские знания, демонстрируя уверенное владение фактами. Однако реальная клиническая онкология — это не тест на запоминание, а сложный процесс последовательных выборов: следование рекомендациям, оценка необходимости эскалации терапии и принятие решений в условиях неопределенности. Новое исследование, представленное в базе arXiv под заголовком "A collective capability boundary in frontier large language models on guideline-conformant and case-specific oncology decision-making", бросает вызов оптимистичным ожиданиям относительно автономного использования ИИ в этой сфере.
Методология и масштаб проверки
Для оценки способностей современных моделей исследователи создали новый инструмент — Бенчмарк границ онкологических решений (Oncology Decision Boundary Benchmark, ODDB). В его основе лежат 2005 клинических точек принятия решений, собранных из руководств NCCN (Национальные институты онкологии США) и реальных случаев рака толстой кишки. Оценка проходила на выборке из девяти передовых моделей (LLM), выпущенных в период с июня 2025 по апрель 2026 года, включая как проприетарные, так и модели с открытыми весами.
Валидация была выполнена с использованием полностью детерминированного скрипта, исключившего случайности генерации текста. Классификация ответов в 14 типов ошибок была независимо проверена двумя врачами-онкологами, что обеспечило высокую надежность результатов (согласованность Кохена для взвешенного kappa составила 0.939 и 0.790 соответственно).
Системные сбои в мета-оценке
Ключевой вывод исследования заключается в том, что объединение девяти разных моделей в «супер-модель» не решило проблему систематических ошибок. Более того, ни одна из этих моделей не дала правильного ответа на 42.1% всех пунктов (с доверительным интервалом Уилсона 40.0–44.3%). Ситуация была еще более критичной для специфических кейсов: на 66.4% случаев рака толстой кишки ни одна модель не предложила верного решения.
Анализ показал, что ошибки сосредоточены не на деталях, а на более высоком уровне: модели не могут корректно выбрать путь в рамках клинических рекомендаций, прежде чем углубляться в анализ самого этого пути. Исследователи называют это «системной слепой точкой в клинической мета-оценке». Проблема, по их мнению, требует архитектурного вмешательства, а не простого накопления данных для переобучения.
Для тех, кто не знаком с терминологией: мета-оценка в медицине — это способность специалиста не просто знать лечение конкретного органа, а оценить контекст болезни, риски пациента и выбрать общую стратегию. Если модель знает, как лечить печень, но не понимает, когда это лечение противопоказано при сопутствующем раке легких, она имеет дефект мета-оценки.
Опасность «резолютивности» и новые требования к архитектуре
Интересным фактом стало поведение моделей, настроенных на принятие решительных действий (например, GPT-5.5 и Gemini 3.1 Pro Preview). Они делали небезопасные завершающие утверждения в 3–5 раз чаще, чем семь более сдержанных моделей, при этом их итоговая точность не была выше.
В диапазоне от 3 до 9% случаев модели фактически называли правильный следующий шаг, но не делали явного обещания его выполнить. Исследователи квалифицируют это как «провал в принятии решения», а не в знании. Пациент получает верную информацию, но алгоритм избегает ответственности за клиническое действие.
Резюмируя, авторы отмечают, что качество самой модели перестало быть главным ограничением для внедрения. Ключевым ограничением является ложное предположение, что любую клиническую задачу можно возложить на одну модель. Для прогресса требуется архитектура, способная распознавать момент, когда модель достигла границ своей компетентности, и передавать окончательное решение врачу.
*«Модель не должна принимать решение, если она не уверена, куда её это приведет, даже если она знает все факты».*
Такой подход сдвигает фокус с бесконечного улучшения алгоритмов на создание гибридных систем, где ИИ выступает инструментом поддержки, а окончательное слово остается за человеком.