искусственный интеллект · материаловедение · большие языковые модели · научные исследования · анализ кристаллов · валидация ИИ1 октября в 09:03 · 5 мин

CARAT: Различают ли модели материалов истинное рассуждение от механического зачитывания?

В современной науке о материалах критически важно отделить способность искусственного интеллекта логически анализировать данные от простого копирования информации, заложенной в его промпт. Новая методология CARAT, описанная в исследовании arXiv:2609.38340, доказывает, что существующие модели часто «зачитывают» ответы, скрытые в текстовом описании кристаллической решётки, вместо того чтобы выводить их на основе графической структуры. Авторы работы разработали строгий протокол оценки, который выявил, что даже передовые архитектуры могут игнорировать визуальные доказательства, полагаясь на устные инструкции, и показал пути преодоления этой ошибки через специализированное обучение и изменение формата подаче данных.

# CARAT: Различают ли модели материалов истинное рассуждение от механического зачитывания?

В области материаловедения и химической физики искусственный интеллект всё чаще используется для анализа сложных структур кристаллов. Однако возникает фундаментальный вопрос: когда модель большой языковой модели (LLM) отвечает на вопрос о свойствах материала, она действительно «понимает» предоставленную структуру или просто распознаёт паттерн, который уже содержится в самом описании задачи? Традиционные метрики точности часто бессильны в этом вопросе, поскольку текстовое описание структуры часто явно упоминает тот самый параметр, по которому проверяется ответ модели.

Новое исследование под названием CARAT (CRyAllographic Assessment Test) предлагает радикально новый подход к валидации знаний ИИ. Работа, опубликованная на arXiv в сентябре 2026 года, ставит под сомнение надёжность текущих бенчмарков и демонстрирует, что большинство моделей склонны к «рецитации» (механическому воспроизведению) информации, а не к логическому выводу на основе визуальных данных.

*«Когда модель отвечает на вопрос о кристаллической структуре, она извлекает знание из самой структуры или копирует ответ, уже напечатанный во входных данных?»* — так авторы формулируют главную проблему, которую решает их методология.

Почему точность обманчива

Основная сложность оценки состоит в том, что стандартные форматы ввода данных не позволяют отличить рассуждение от копирования. Если в текстовом описании кристалла сказано, что атомы расположены в определённой конфигурации, и модель затем воспроизводит эту конфигурацию в ответ, это может быть интерпретировано как правильное решение. Но на самом деле модель могла просто скопировать ключевую фразу из запроса.

Для преодоления этого ограничения исследователи создали GraphSpace — новую визуальную среду, где каждая структурная связь в кристаллической решётке именуются и изолируются отдельно. Это позволяет отделить факты, которые должны быть проанализированы, от тех, что могут быть случайно угаданы. В ходе экспериментов было установлено, что на самых сложных наборах данных для бенчмарка, использование этой «заземлённой» (grounded) визуальной перспективы повышает точность ответа на 17,3 балла по сравнению с использованием лишь формулярных вводов данных. Это указывает на то, что визуальное представление структуры содержит значительно больше информации, чем сухие текстовые формулировки, если модель умеет с этим работать.

Самокритика и раскритика бенчмарков

Особую ценность исследователи придают тому, что они подвергли сомнению не только поведение моделей, но и сами инструменты для их оценки. Была обнаружена удивительная зависимость от способа отображения данных: методика GraphSpace превзошла обычное периодическое представление графов на 19,3 балла. Однако детальный анализ показал, что этот результат складывается из двух эффектов.

Во-первых, там, где обычное отображение уже содержит всю необходимую для ответа информацию, перевес составляет лишь 1,96 балла. Это говорит о том, что в таких случаях модели могут просто «запоминать» контекст задачи, не прибегая к глубокому анализу.

Во-вторых, там, где обычное отображение полностью опускает ключевые поля, отставание достигает 46,7 баллов. Это наглядно демонстрирует, что высокие показатели точности в старых тестах часто являются артефактом некачественного дизайна бенчмарка, а не свидетельством реальных аналитических способностей ИИ.

Ловушка в собственных данных

Самым серьёзным выводом работы стала атака на собственные созданные исследователями тесты. Авторы заметили, что существующие протоколы содержат скрытые упрощения, которые легко эксплуатируются моделями. Правило, которое игнорирует визуальную ссылку и просто считывает список данных напрямую, позволяло моделям правильно ответить на четыре из семи «усложнённых» (hardened) семейств задач.

В ответ на это исследовательская группа перестроила бенчмарк, чтобы включить ещё одиннадцать подобных кратковходов, разместив их вблизи уровня случайного угадывания. Это позволило отсеять модели, полагающиеся на такие хитрости.

Проведённые тесты с «замороженной» (без дообучения) моделью показали тревожную картину: на 95,6% случаев в парных сравнениях модель цитировала визуальную ссылку, но давала идентичный ответ, даже когда она была перенаправлена на другую, лишённую смысла ссылку. Это означало, что модель повторяла отношение между атомами, не используя для этого предоставленную визуальную базу. После введения соответствующего обучающего надзора (matched supervision) модель достигла точности 99,8%. Однако при полном удалении визуальной ссылки её производительность упала до 23,4%, что даже ниже порога лучшего из возможных кратковходов (27,0%).

Оба этих шага — обучение с надзором и удаление лишних подсказок — оказались обучаемыми навыками, которые можно внедрить в архитектуру модели.

Заключение

Исследование CARAT подчёркивает, что текущая эра машинного обучения в материаловедении достигла точки, где необходимо пересмотреть критерии оценки интеллекта ИИ. Высокая точность на старых тестах может быть лишь иллюзией, создтой благодаря тому, что задачи слишком просто решаются через чтение текста, а не через анализ данных.

Показано, что визуальные представления структур, такие как GraphSpace, обладают значительно большим диагностическим потенциалом, если они используются правильно. Более того, продемонстрировано, что модели могут быть переобучены для того, чтобы действительно «видеть» структуру, а не просто «читать» её описание. Это открывает новые горизонты для создания надёжных инструментов, способных реально решать сложные научно-технические проблемы, а не имитировать экспертное мнение.

Технический термин matched supervision в данном контексте означает процесс обучения, где модель получает прямую обратную связь только за те случаи, когда она действительно использовала предоставленные доказательства для формирования ответа, что позволяет отсеивать случайные совпадения. А pairing inference — это метод сравнения результатов модели на идентичных данных, представленных в разных форматах (например, текст против графа), для выявления зависимости от конкретного вида подачи информации.

Первоисточники

arXiv cs.AI ↗
← Вернуться в эфир