Что делает текст «хорошим»? LLM оценивают намерение, а не только грамматику
Искусственный интеллект способен оценивать литературное качество текстов, опираясь не на простую проверку фактов, а на сложную оценку намерения автора, структуры и уникального голоса. Новое исследование показывает, что нейросети ценят намеренность выше безупречной корректности и уязвимы к тому, насколько мы распознаем исходный автор.
# Что делает текст «хорошим»? LLM оценивают намерение, а не только грамматику
Вопрос о том, что именно делает написание «хорошим», веками занимал центральное место в литературоведении и лингвистике. С развитием моделей искусственного интеллекта, способных к сложному рассуждению, этот вопрос переместился в цифровую сферу: могут ли машины объективно оценивать искусство, и на чем базируется их суждение? Новое исследование, опубликованное в базе arXiv, дает ответы, которые могут удивить как писателей, так и разработчиков.
Ученые из группы исследования Birger Moëll провели глубокое тестирование того, как современные большие языковые модели (LLM) с возможностью рассуждения анализируют литературные произведения. Их выводы бросают вызов упрощенному представлению о том, что ИИ просто ищет грамматические ошибки или проверяет достоверность фактов.
Намерение важнее правды
В ходе первого этапа исследования была создана проверка, состоящая из 30 текстов реального происхождения, распределенных по шести уровням качества. Эти тексты ranged от классической канонической литературы до анонимых сообщений на форумах. Исследователи анализировали «следы рассуждения» модели — внутренний процесс, который ИИ применяет для вынесения вердикта.
Результаты показали, что модель достигает средней точности классификации уровня текстов в 79,3% при повторных тестах на различных версиях модели DeepSeek. Но что еще важнее, анализ мыслей модели выявил устойчивую теорию оценки: она ставит во главу угла не техническую безупречность, а намеренность.
*ИИ ценит «craft» (ремесло), глубину и уникальный голос выше, чем простое соответствие грамматическим нормам.*
Это означает, что для модели хороший текст — это не просто набор правильных слов, а отпечаток чьей-то конкретной души и намерения. Если текст звучит как искреннее выражение уникального голоса автора, модель склонна оценивать его выше, даже если в нем есть странности или нетипичные обороты. Это подтверждает гипотезу о том, что ИИ пытается уловить человеческий авторский стиль.
Эксперимент с известными именами
Однако исследователи обнаружили интересный эффект при знакомстве с текстами. В ходе эксперимента с «знакомыми» стилями, где использовались известные имена авторов, но сам текст был изменен или написан исследователями в похожем стиле, оценки модели могли завышаться. Это говорит о том, что модель частично опирается на репутацию автора или узнаваемость источника. Но важно отметить: это завышение не полностью искусственное; оно переплетается с реальными качественными различиями между подлинными каноническими текстами и пастичами, написанными исследователями для теста. Модель, похоже, признает авторитет имен, но не игнорирует и реальное содержание.
Как разрушить красивый текст?
Второй этап исследования был посвящен тому, какие именно элементы текста влияют на оценку ИИ больше всего. Ученые систематически «портили» пять классических прозаических текстов, применяя шесть различных манипуляций: упрощение лексики, сглаживание ритма, удаление образов, обобщение голоса, упрощение структуры и их комбинации.
Результаты оказались поразительными: - Упрощение словарного состава вызвало наименьший проигрыш в оценке (всего 0,41 балла). - Влияние структуры на оценку было гораздо сильнее (потеря 2,78 балла). - Утрата уникального голоса (voice genericization) вызвала падение на 2,34 балла.
Самым разрушительным оказался одновременный порч всех элементов, что привело к катастрофическому падению оценки (-5,64 балла). Интересно, что этот эффект был субаддитивным — то есть сумма потерь от отдельных повреждений была чуть меньше общей потери от комбинации, что указывает на сложную взаимосвязь между элементами текста в глазах ИИ.
Подобные закономерности были подтверждены при сравнении с другой моделью Qwen QwQ.
Итоги для будущего письма
В заключение исследование предполагает, что суждения ИИ о качестве письма являются целостными и специфичными для каждого автора. Искусственный интеллект более чувствителен к структурным и стилистическим особенностям, чем к простому подбору слов. Это открывает новые горизонты для автоматической обратной связи по письмам и компьютерной эстетики. ИИ, возможно, ближе к пониманию искусства, чем нам думается: он ищет не просто правильные ответы, а уникальные голоса, которые способны тронуть воображение.
Эти выводы важны для тех, кто использует ИИ как редактора, так и для авторов, стремящихся понять, как机器 воспринимает их творчество. В конечном счете, «хороший» текст для машины — это текст, который говорит на языке структуры и намерения, а не просто на языке правильных слов.