искусственный интеллект · образование · оценка знаний · машинное обучение · NLP · архитектура нейросетей3 августа в 09:31 · 4 мин

Могут ли большие языковые модели понять сложность задания? Новые данные о проблемах автоматической генерации

Недавнее исследование, опубликованное на arXiv, ставит под сомнение способность современных больших языковых моделей (LLM) точно оценивать сложность учебных заданий. Несмотря на рост вычислительных мощностей, модели демонстрируют систематическую склонность недооценивать трудность материала, уступая в этом простому машинному обучению с учителем.

# Могут ли большие языковые модели понять сложность задания?

Ожидание от искусственного интеллекта быть абсолютным решением для образования столкнулось с реальностью. Новая работа исследователей, представленная в репозитории arXiv под номером 2607.28634, раскрывает ограничения крупных моделей в одной из ключевых задач образовательного тестирования: оценке уровня сложности учебных вопросов.

В современном образовании, особенно при формировании итоговых экзаменов высокого риска (high-stakes assessments), умение точно классифицировать сложность задания критически важно. Это позволяет педагогам балансировать между формативной оценкой и проверкой знаний. Исследователи Xinyi Wang и коллеги предложили проверить, способны ли современные LLM выполнить эту задачу эффективнее, чем традиционные алгоритмы.

Ограниченный словарный запас сложности

Эксперимент был проведён на базе большого теста по чтению и письму. В исследовании сравнивались результаты нескольких архитектур: от современных больших языковых моделей (включая версии GPT-4.1 и GPT-5.4) до энкодер-только моделей (encoder-only) и классических машинных моделей, обученных на признаках текста (feature-based supervised models).

Результаты показали удивляющую, если принять их близко, закономерность. Лучшую из всех тестированных моделей оказалась не самая передовая языковая система. ГPT-4.1 в режиме «zero-shot» (без предварительного обучения на конкретных примерах сложности) с параметром температуры (temperature), установленным в 0, смог достичь метрики квадратичного вейв-кappa (QWK) на уровне 0,578.

Для контекста: метрика QWK измеряет согласованность между предсказанием модели и реальными значениями сложности. Однако ConvBERT — модель, которая опирается исключительно на архитектуру энкодера — показала более высокую точность, достигнув QWK 0,625. Это означает, что даже самая умная языковая модель в этой задазе проиграла более простой и специализированной нейросети.

*Замечание редактора:* Параметр температуры в настройках генерации влияет на разнообразие ответов модели. Значение 0 заставляет модель выбирать наиболее вероятный вариант, что в задачах классификации часто является стандартом для максимальной предсказуемости, но не гарантирует понимания контекста.

Систематическая ошибка: всё кажется лёгким

Анализ поведения моделей выявил фундаментальную проблему. Все тестированные LLM испытывали трудности с правильным присвоением метки «сложное» заданиям, которые таковыми действительно являлись. Более того, исследователи обратили внимание на странный тренд: по мере роста собственных возможностей модели, они становились ещё менее критичными к сложности материала.

Особенно ярко это проявилось у более новой версии GPT-5.4. Эта модель, обладая расширенными знаниями, склонна было переоценивать свои способности и, как следствие, недооценивать сложность заданий. Вместо того чтобы распознать тонкие нюансы, требующие глубокого мышления, модель интерпретировала такие вопросы как относительно простые.

Это явление можно объяснить через призму того, как модели обрабатывают семантическую информацию. Исследование методом уменьшения размерности векторов (dimension reduction of embeddings) показало, что в пространстве векторов данных элементы с разными уровнями сложности были перемешаны. Семантика текста, на которую опираются LLM, оказалась недостаточным маркером для определения трудности, так как сложные и простые вопросы могут быть семантически близки, но требуют разного когнитивного усилия от учащегося.

Итоги и предостережения для автоматизации

Итоговый вывод исследования однозначен и требует осторожности со стороны разработчиков образовательных платформ, планирующих внедрять автоматическую генерацию заданий. Если LLM не способны корректно оценить сложность существующих вопросов, их применение для создания контента с целевой сложностью (targeted difficulty levels) сопряжено с высокими рисками.

Авторы работы призывают к тому, чтобы в сферах, где от точности оценки знаний зависит будущее учащихся, не полагались слепо на возможности больших языковых моделей в вопросах психометрии. Традиционные методы машинного обучения, основанные на инженерии признаков, в данном случае продемонстрировали свою устойчивость и превосходство над модными, но ещё не до конца осмысленными архитектурными новшествами.

Наука движется не только вперёд, но и через осознание границ новых инструментов. Пока семантика текста не станет полным отражением когнитивной нагрузки, которую он вызывает у человека, автоматическая генерация сложных экзаменационных вопросов останется зоной риска.

Первоисточники

arXiv cs.CL
← Вернуться в эфир