Распознать можно, произнести — нет: почему ИИ теряет связь с культурой родства
Новое исследование, представленное на семинаре ORACLE в рамках конференции EMNLP 2026, бросает вызов текущим методам оценки больших языковых моделей (БЯМ). Оказалось, что современные нейросети способны верно выбирать родственные термины из предложенного списка, но катастрофически проваливаются при попытке самостоятельно сгенерировать правильные слова на индийском (хинди, тамил) и корейском языках. Разрыв между 'знанием' и 'умением говорить' на культурно специфичные темы ставит под вопрос готовность ИИ к реальному общению в мультиязычном мире.
# Распознать можно, произнести — нет: почему ИИ теряет связь с культурой родства
В мире искусственного интеллекта существует иллюзия всеведения. Мы часто воспринимаем ответы нейросетей как результат глубокого понимания контекста, но новые данные указывают на скрытую пропасть. Когда речь заходит о тонкостях человеческих отношений, особенно в культурах, отличных от западных, современные модели показывают удивительно хрупкий результат. Они могут мгновенно угадать правильный ответ на тест, но не могут 'построить' это слово, если оно не предложено им на выбор.
Исследование, проведенное Сахилом Пардасани (Sahil Pardasani) и Мадхусуданом Сингхом (Madhusudan Singh), опубликованное на сервере arXiv под номером 2609.26942, детально разбирает этот феномен. Авторов интересует не просто факт того, знает ли модель, кто такой 'дядя', но и способна ли она правильно сформулировать этот титул на языке другой культуры, зная только контекст отношения.
Векторные знания против генеративной силы
Традиционно эффективность больших языковых моделей проверялась с помощью множественного выбора. Проще говоря, система видит ситуацию: 'Ваша дочь — жена моего сына. Как к ней обратиться на хинди?' и предлагает варианты ответа. В таких условиях топовые модели показывают блестящие результаты, достигая точности более 90%.
Однако авторы исследования предложили более строгий метод — генеративный бенчмарк. Вместо выбора из четырех вариантов ИИ должен самостоятельно сгенерировать правильный термин. Результаты этого сравнения шокируют: если GPT-ОСС (версия на 120 миллиардов параметров) выбирает правильный термин в 90,67% случаев, то самостоятельно пишет его лишь в 36,00%. Аналогичная картина наблюдается и у Llama 3.370B: выбор — 77,92%, генерация — 24,24%.
Разница в этих цифрах интерпретируется исследователями как 'разрыв формата оценки'. То есть модель, похоже, имеет доступ к лексическим знаниям (знает слова), но не может точно воспроизвести структуру предложения или написание в требуемом формате без подсказок. Это не доказывает, что знания отсутствуют полностью, но демонстрирует критическую неустойчивость нейросетей при свободном выражении культурно специфичного кода.
Тест на культурную аутентичность
Эксперимент охватывал три языка: хинди, тамил и корейский. Эти языки были выбраны, так как они не относятся к западной языковой группе и обладают сложной системой родственных связей, где термины зависят не только от пола и возраста, но и от социального статуса и линии родства.
Исследователи провели тесты на явно указанных подсказках (L3 prompts), где модель должна была назвать термин для конкретных отношений. Разброс точности здесь оказался колоссальным: от 72,29% у модели GLM-5.1 до всего 24,24% у Llama-3.370B. Это подтверждает, что даже у крупнейших моделей нет унифицированного понимания кросс-культурных отношений.
Интересным наблюдением стала разница в преимуществах линии родства. В хинди языковая группа модель легче справляется с патрилинейными (отцовскими) связями, тогда как в корейском языке это преимущество либо отсутствует, либо даже работает в обратную сторону. Пары терминов тамилского языка служили контрольной группой для проверки вариативности измерений, показывая, что ошибки модели не случайны, а системно зависят от лингвистических особенностей целевого языка.
Голос из тумана: значение для будущего общения
Эти результаты заставляют задуматься о природе понимания языка у искусственного интеллекта. Если модель может выбрать термин, но не может его произнести, возникает вопрос: что мы на самом деле измеряем? Возможно, текущие бенчмарки переоценивают владение контекстом, превращая его в механическое сопоставление паттернов.
Авторам исследования удалось показать, что генерация культурно специфичных терминов остается крайне сложной задачей, даже если отношения явно указаны. Это подчеркивает необходимость внедрения генеративных тестов наравне с традиционными тестами множественного выбора при оценке прогресса ИИ. Без этого мы рискуем создавать системы, которые выглядят умными в тесте, но не способны поддержать искренний диалог с носителем культуры.
В работе также отмечается, что разница в точности между вариантами с подсказками и генерацией, вероятно, обусловлена форматом задачи, а не полным отсутствием знаний. Тем не менее, для реального применения в многонациональных средах способность самостоятельно генерировать корректные родственные термины является критической. Пока этот навык не развит в достаточной мере, ИИ будет оставаться скорее наблюдателем человеческих отношений, чем полноценным участником общения.
*Умный алгоритм может знать тысячи слов, но пока ему сложно понять, как эти слова живут в сердцах людей разных культур. Это не только техническая проблема, но и вызов к нашему пониманию того, что есть настоящее знание.*