AI7 августа в 21:01 · 5 мин

Опыт учителя в коде: Как ИИ-репетиторы учатся вовремя помогать

Новая методика от Allen Institute for AI и Hugging Face позволяет объективно оценить способность языковых моделей балансировать между помощью ученику и сохранением его самостоятельности. Результаты показывают, что даже передовые модели склонны «передавать домашнее задание», лишь бы получить пятёрку, и требуют чёткого формулирования педагогических дилемм в промптах, чтобы научиться думать как наставник.

# Когда помогать, а когда молчать: новый тест для ИИ-репетиторов

Обучение — это не просто передача информации. В идеале, хороший педагог умеет чувствовать момент: когда ученик застрял и ему нужна подсказка, а когда он справится сам, если только не вмешиваться. Для искусственного интеллекта эта грань между «быть полезным» и «быть полезным именно здесь и сейчас» часто становится неодолимой. Однако команда Allen Institute for AI (allenai) совместно с Hugging Face разработала фреймворк TutorMoments, который впервые на основе реальных данных оценивает способность крупных языковых моделей (LLM) принимать педагогические решения.

Метод, основанный на опыте реальных учителей

Принцип работы системы строится на анализе реальных образовательных процессов. Исследователи использовали базу данных транскриптов индивидуальных уроков математики для студентов 2–7 классов в США. Эти записи были проанализированы 27 опытными учителями, которые отметили ключевые моменты, где педагог должен был выбрать между двумя стратегиями: 1. Скаффолдинг (Scaffolding): сделать задачу проще, чтобы ученик мог ее решить и получить поддержку. 2. Давление на строгость (Rigor): не помогать, а стимулировать ученика к более глубокой самостоятельной работе.

Всего в наборе данных, доступном на Hugging Face, содержится 462 обезличенных транскрипта с более чем 1500 таких моментов. Система берет запись урока, останавливает ее в точке принятия решения и передает эту ситуацию языковой модели. Модель должна продолжить роль репетитора в диалоге с имитационным учеником (также управляемым ИИ) и показать, что она сделает в реальной жизни.

Проще говоря, это «перемотка» урока, где роль учителя берет на себя нейросеть, чтобы проверить её интуитивную оценку ситуации.

Проблема «вездесущей помощи»

Исследование выявило тревожную тенденцию. В экспериментах использовались семь различных больших языковых моделей. Результаты показали явный перекос: модели значительно чаще прибегали к перескаффолдингу (over-scaffolding). Это означает, что они предлагали слишком много помощи, фактически решая часть задачи за ученика или объясняя концепцию, когда ученик еще мог ее осознать сам.

Причина кроется в базовой настройке современных моделей. Они обучены быть максимально полезными и дружелюбными. Для ИИ, обученного на публичных диалогах, «помощь» часто означает дать ответ или подробное объяснение. В контексте обучения это разрушает так называемую «продуктивную борьбу» (productive struggle) — состояние, когда ученик действительно напрягает мозг, чтобы понять материал, что критически важно для закрепления знаний.

Система TutorMoments вводит метрики оценок от 0 до 1. Например, оценка 0.5 по показателю «поддержка строгости» означает, что модель успешно стимулировала ученика к самостоятельной работе ровно в половине случаев, когда это было уместно. Оказалось, что стандартные промпты, содержащие лишь общую просьбу «будь хорошим репетитором», приводили к низким показателям. ИИ не понимал контекста и просто выполнял свою миссию быть вежливым помощником.

Что это значит для терминологии?

В контексте этой статьи важно понимать разницу между скаффолдингом и обучением. Скаффолдинг — это временная опора, которая помогает построить мост к пониманию, но должна постепенно сниматься. Если опора остается навсегда, ученик не учится ходить сам. В терминах ИИ: скаффолдинг — это вопрос, наводящий на ответ или упрощенный пример. Обучение в данном фреймворке происходит, когда модель сознательно отказывается от упрощения, заставляя модель-ученика мыслить глубже.

Формулирование проблемы меняет всё

Наиболее важным выводом стало влияние описания задачи. Когда исследователи явно указали в инструкциях к модели, что ей нужно выбирать между помощью и самостоятельной работой, а также избегая чрезмерной поддержки, результаты улучшились у всех протестированных моделей.

Однако «магия» одного хорошего описания (prompts) не дала идеального результата. Даже с улучшенными инструкциями лучшие модели не догнали уровень реальных учителей. Более того, реальные педагоги в транскриптах также совершали ошибки, так как это анализировались именно неудачные моменты. Тем не менее, модели всё еще часто действовали менее гибко, чем люди.

Интересный нюанс: хотя модели стали чаще требовать от учеников объяснения своих мыслей (что является хорошей стратегией), они использовали менее разнообразный набор тактик по сравнению с людьми. Живые учителя умеют менять стиль общения, использовать метафоры, делать паузы или менять тон голоса. ИИ пока ограничивается сухими вопросами.

Ограничения и будущее открытого исследования

Тестирование на TutorMoments является лишь первым шагом. Исследователи четко отмечают ограничения методики:

* Отсутствие реальных учеников: Оценки проводятся на симуляции, поэтому неясно, действительно ли такой подход улучшает долгосрочное запоминание материала. * Узкая специфика: Данные собраны только из уроков математики в США для начальной и средней школы. Нельзя гарантировать, что модели будут так же неуклюжи в преподавании истории или химии. * Субъективность учителя: Даже человеческие аннотаторы могли ошибочно оценить момент, когда помогать, а когда нет.

Команда Allenai делится кодом и данными открыто, надеясь, что исследователи и разработчики смогут доработать алгоритмы. Цель — создать репетиторов, которые адаптируются к конкретному ученику, а не просто выполняют шаблонные действия. Как отмечают авторы, хороший ИИ-репетитор должен знать не только факты, но и уметь вовремя помолчать и довериться ученику.

Технические детали для разработчиков

Для воспроизведения результатов в проекте используется репозиторий кода и датасет allenai/tutormoments-preview. Оценка модели происходит по трем основным параметрам: 1. Насколько эффективно она стимулировала ученика (Rigor). 2. Насколько эффективно она давала нужную поддержку, когда это требовалось (Scaffolding). 3. Насколько она правильно интерпретировала намерение ученика (Intent Recognition).

--- *Проект поддержан Фондом Гейтса (The Gates Foundation) и Learning Commons. Дatasets mentioned in this article: [allenai/tutormoments-preview] на Hugging Face.*

Первоисточники

Hugging Face Blog
← Вернуться в эфир