VakyArth: Новая бенчмарка выявила системные ошибки ИИ в прагматике индийских языков
Исследование, опубликованное на платформе arXiv, демонстрирует, что современные большие языковые модели (LLM) испытывают значительные трудности с пониманием неявных смыслов, культурных нюансов и контекстуальных отсылок в индийских языках. Созданный исследователями бенчмарк VakyArth показывает, что даже модели с высокой общей производительностью часто проваливаются в задачах, требующих социального интеллекта и лингвистической деликатности.

# Вакья Арtha: когда искусственный интеллект учится понимать контекст
Проблема понимания человеком речи часто сводится не к буквальным определениям слов, а к тонкому социальному интеллект, культурным кодам и контексту. В мире искусственного интеллекта это свойство называется «прагматикой». Долгое время исследования в этой области фокусировались преимущественно на английском и других высоконасыщенных ресурсами языках. Индийские языки, напротив, оставались «белым пятном» в тестах на разум машин.
Новое исследование, представленные в начале сентября 2026 года на платформе arXiv под названием VakyArth, меняет эту картину. Это первая в своем роде диагностическая бенчмарка, специально созданная для оценки прагматических способностей нейросетей в четырех индийских языках: хинди, пенджаби, тамиле и малаялам.
За пределами буквального смысла
Прагматика в лингвистике — это раздел, изучающий, как контекст и намерение говорящего влияют на смысл высказывания. В повседневной жизни мы постоянно оперируем смыслами, которые прямо не озвучиваются. Например, фраза «Это ужасно жарко здесь» может означать не просто констатацию факта о температуре, а вежливую просьбу приоткрыть окно. Модель, обученная только на фактах, может правильно определить температуру в комнате, но не понять просьбу.
Исследователи создали VakyArth, чтобы проверить, способны ли современные мультILINGUALLLM расшифровывать такие «неписаные правила» в языках Индии. Бенчмарк охватывает пять ключевых явлений прагматики:
1. Деиксы (Deixis): Использование слов, смысл которых зависит от точки зрения говорящего (слова «здесь», «сейчас», «я», «ты»). 2. Речевые акты (Speech Acts): Функции речи, такие как просьбы, извинения или обещания, которые могут выражаться по-разному. 3. Импликатуры (Implicature): Скрытый смысл, подразумеваемый говорящим, но не явный в тексте. 4. Социальная прагматика: Нормы вежливости и социального взаимодействия. 5. Когерентность (Coherence): Способность выстраивать логичную и связную мысль в контексте.
Все задания в бенчмарке были разработаны носителями соответствующих языков, что гарантирует культурную аутентичность тестов. Использовались форматы множественного выбора, задачи естественного вывода и переводы.
Системные сбои: результаты теста
Результаты оказались неутешительными. При тестировании на множестве мультilingual больших языковых моделей (разных семейств и размеров) наблюдалась устойчивая неспособность моделей корректно интерпретировать прагматические значения, корни которых лежат в индийской лингвистике и культуре.
Анализ выявил интересные закономерности: * Преимущество тестов с выбором ответа: Точность ответов в заданиях с множественным выбором (MCQ) превышала точность в задачах естественного вывода (NLI) во всех сочетаниях модель-язык. Это говорит о том, что модели лучше справляются с явными выборками, но хуже справляются с логическим выведением скрытых смыслов. * Ограничения перевода: Производительность перевода не является надежным индикатором понимания прагматики. Модель может перевести фразу грамматически верно, но упустить тон вежливости или социальный контекст. * Языковое неравенство: Исследователи заметили системную разницу между индоарийскими и дравидскими языками. Модели демонстрировали преимущество в задачах перевода для индоарийских языков (например, хинди, пенджаби) по сравнению с дравидскими (тамил, малаялам), что может указывать на перекосы в данных, использовавшихся для обучения текущих поколений ИИ.
Также было доказано, что автоматические метрики оценки качества перевода часто не замечают тексты, которые звучат гладко и вписываются в структуру, но полностью проваливаются по смысловой и прагматической верности. Особенно это касается импликатур и деиксов.
Почему это важно
Вакья Арtha ставит важный вопрос перед разработчиками: мы не просто учим машины фактам, но и учим их «быть людьми» в разных культурных контекстах. Если ИИ не понимает, как вежливо попросить помощи на малаялам или как интерпретировать подтекст в разговоре на хинди, его внедрение в реальное социальное взаимодействие, особенно в Индии, остается рискованным.
Авторы работы подчеркивают, что существующие методы оценки ограничены, и без специализированных бенчмарков для низкоресурсных и лингвистически сложных языков прогресс в создании истинно мультILINGUAL и культурно чувствительных систем будет медленным. VakyArth становится первым шагом к диагностике этих проблем, позволяя четко видеть, где наши алгоритмы теряют контакт с реальностью человеческого общения.
Как и в случае с любым научным экспериментом, данные, представленные в arXiv, требуют дальнейшей проверки и воспроизведения, но уже сегодня они дают понять масштаб задач, стоящих перед нейросетями в глобальном масштабе.