искусственный интеллект · NLP · индийские языки · прагматика · моделирования языка · VakyArth · arXiv4 сентября в 05:02 · 4 мин

VakyArth: Новая бенчмарка выявила системные ошибки ИИ в прагматике индийских языков

Исследование, опубликованное на платформе arXiv, демонстрирует, что современные большие языковые модели (LLM) испытывают значительные трудности с пониманием неявных смыслов, культурных нюансов и контекстуальных отсылок в индийских языках. Созданный исследователями бенчмарк VakyArth показывает, что даже модели с высокой общей производительностью часто проваливаются в задачах, требующих социального интеллекта и лингвистической деликатности.

Айсберг из морского стекла на ночном море: скрытые ошибки ИИ в индийских языках.

# Вакья Арtha: когда искусственный интеллект учится понимать контекст

Проблема понимания человеком речи часто сводится не к буквальным определениям слов, а к тонкому социальному интеллект, культурным кодам и контексту. В мире искусственного интеллекта это свойство называется «прагматикой». Долгое время исследования в этой области фокусировались преимущественно на английском и других высоконасыщенных ресурсами языках. Индийские языки, напротив, оставались «белым пятном» в тестах на разум машин.

Новое исследование, представленные в начале сентября 2026 года на платформе arXiv под названием VakyArth, меняет эту картину. Это первая в своем роде диагностическая бенчмарка, специально созданная для оценки прагматических способностей нейросетей в четырех индийских языках: хинди, пенджаби, тамиле и малаялам.

За пределами буквального смысла

Прагматика в лингвистике — это раздел, изучающий, как контекст и намерение говорящего влияют на смысл высказывания. В повседневной жизни мы постоянно оперируем смыслами, которые прямо не озвучиваются. Например, фраза «Это ужасно жарко здесь» может означать не просто констатацию факта о температуре, а вежливую просьбу приоткрыть окно. Модель, обученная только на фактах, может правильно определить температуру в комнате, но не понять просьбу.

Исследователи создали VakyArth, чтобы проверить, способны ли современные мультILINGUALLLM расшифровывать такие «неписаные правила» в языках Индии. Бенчмарк охватывает пять ключевых явлений прагматики:

1. Деиксы (Deixis): Использование слов, смысл которых зависит от точки зрения говорящего (слова «здесь», «сейчас», «я», «ты»). 2. Речевые акты (Speech Acts): Функции речи, такие как просьбы, извинения или обещания, которые могут выражаться по-разному. 3. Импликатуры (Implicature): Скрытый смысл, подразумеваемый говорящим, но не явный в тексте. 4. Социальная прагматика: Нормы вежливости и социального взаимодействия. 5. Когерентность (Coherence): Способность выстраивать логичную и связную мысль в контексте.

Все задания в бенчмарке были разработаны носителями соответствующих языков, что гарантирует культурную аутентичность тестов. Использовались форматы множественного выбора, задачи естественного вывода и переводы.

Системные сбои: результаты теста

Результаты оказались неутешительными. При тестировании на множестве мультilingual больших языковых моделей (разных семейств и размеров) наблюдалась устойчивая неспособность моделей корректно интерпретировать прагматические значения, корни которых лежат в индийской лингвистике и культуре.

Анализ выявил интересные закономерности: * Преимущество тестов с выбором ответа: Точность ответов в заданиях с множественным выбором (MCQ) превышала точность в задачах естественного вывода (NLI) во всех сочетаниях модель-язык. Это говорит о том, что модели лучше справляются с явными выборками, но хуже справляются с логическим выведением скрытых смыслов. * Ограничения перевода: Производительность перевода не является надежным индикатором понимания прагматики. Модель может перевести фразу грамматически верно, но упустить тон вежливости или социальный контекст. * Языковое неравенство: Исследователи заметили системную разницу между индоарийскими и дравидскими языками. Модели демонстрировали преимущество в задачах перевода для индоарийских языков (например, хинди, пенджаби) по сравнению с дравидскими (тамил, малаялам), что может указывать на перекосы в данных, использовавшихся для обучения текущих поколений ИИ.

Также было доказано, что автоматические метрики оценки качества перевода часто не замечают тексты, которые звучат гладко и вписываются в структуру, но полностью проваливаются по смысловой и прагматической верности. Особенно это касается импликатур и деиксов.

Почему это важно

Вакья Арtha ставит важный вопрос перед разработчиками: мы не просто учим машины фактам, но и учим их «быть людьми» в разных культурных контекстах. Если ИИ не понимает, как вежливо попросить помощи на малаялам или как интерпретировать подтекст в разговоре на хинди, его внедрение в реальное социальное взаимодействие, особенно в Индии, остается рискованным.

Авторы работы подчеркивают, что существующие методы оценки ограничены, и без специализированных бенчмарков для низкоресурсных и лингвистически сложных языков прогресс в создании истинно мультILINGUAL и культурно чувствительных систем будет медленным. VakyArth становится первым шагом к диагностике этих проблем, позволяя четко видеть, где наши алгоритмы теряют контакт с реальностью человеческого общения.

Как и в случае с любым научным экспериментом, данные, представленные в arXiv, требуют дальнейшей проверки и воспроизведения, но уже сегодня они дают понять масштаб задач, стоящих перед нейросетями в глобальном масштабе.

Первоисточники

arXiv cs.CL
← Вернуться в эфир