Как выбор корпуса меняет оценки зависимых дистанций: почему языковые универсалии зависят от данных
В лингвистике считается нормой рассматривать оценки зависимости-дистанции (dependency-distance), полученные из одного корпуса, как стабильные свойства языка. Однако новое исследование, опубликованное на arXiv, бросает вызов этому представлению. Аналитика показывает, что замена одного корпуса другим на одном языке может изменить 40% попарных ранжирований языков, делая выводы о иерархии языковой сложности уязвимыми к методологическим деталям.
# Неопределенность в основе лингвистических универсалий
В современной вычислительной лингвистике существует устоявшаяся практика: оценки зависимости-дистанции (MDD — Mean Dependency Distance), полученные при анализе одного конкретного корпуса (treebank), часто трактуются исследователями как инвариантные характеристики самого языка. Этот подход позволяет сравнивать сложные языки с простыми, утверждая, например, что японский или английский минимизируют расстояния между словами сильнее, чем другие языки группы.
Однако новое исследование, проведенное Сируи Чэном (Sirui Chen) и опубликованное в предпечатной версии arXiv под идентификатором cs.CL 2609.04223, ставит под сомнение надежность этого подхода. Исследование задается простым, но фундаментальным вопросом: насколько выбор конкретного корпуса влияет на конечные оценки зависимости-дистанции?
Методология: сравнение пар корпусов
Для проверки этой гипотезы исследователю необходимо было сравнить данные, полученные из разных источников. Была проанализирована выборка из 38 пар корпусов, написанных на одном языке, взятых из версии 2.18 Universal Dependencies (UD). В рамках исследования использовались строгие статистические методы, включая анализ согласованности корреляции (concordance correlation) и анализ Бланда-Альтьмана (Bland-Altman analysis), а также метод вселенной с двенадцатью спецификациями (twelve-specification multiverse design). Последний метод позволяет учесть вариативность в предобработке данных, такую как разная обработка токенов или пунктуации.
Результаты оказались шокирующе нестабильными с точки зрения кросс-языковых сравнений. Замена одного корпуса на другой в рамках одного языка привела к тому, что почти 40% попарных ранжирований языков изменили свое положение. Если ранее язык А считался более сложным, чем язык Б, после смены корпуса этот порядок мог быть полностью перевернут. Более того, выбор конкретного корпуса accounted for (учитывал) примерно 29% дисперсии между группами данных. Это несогласие значительно превышает ошибки выборки внутри самого корпуса и сохраняется при всех 12 различных методах предобработки.
Сохраняется ли принцип минимизации длины?
Несмотря на хаос в кросс-языковых ранжированиях, исследование выявило важный устойчивый паттерн. В каждом из проанализированных корпусов подтвердилась гипотеза о минимизации длины зависимости (dependency-length minimization или DLM). Нормализованный коэффициент в каждом случае оставался ниже единицы, что свидетельствует о том, что человеческие речи действительно стремятся сокращать путь между главными словами.
Это указывает на то, что качественное лингвистическое универсалии — стремление к экономической организации грамматики — выживает даже при замене источников данных. Однако количественная иерархия, в которой одни языки стабильно опережают другие по этому показателю, оказывается не более чем артефактом выбора конкретной коллекции текстов.
Корпус как фильтр реальности
Данные, полученные в ходе исследования, больше соответствуют модели, где средняя дистанция зависимости (MDD) является не стабильным параметром на уровне языка, а композитным показателем, зависящим от корпуса. Он отражает комплекс факторов: грамматику, стиль регистра и особенности аннотации, специфичные для конкретной выборки текстов.
Как редактор, наблюдающий за эволюцией данных, важно отметить: наука движется не только вперед, но и уточняет границы применимости своих инструментов. Утверждение о том, что "язык А имеет более короткую зависимость, чем язык Б", теперь требует оговорки: "в определенных корпусах, при определенных предобработках". Это не отменяет ценности исследования, но заставляет лингвистов быть более скромными в своих выводах, отделяя устойчивые грамматические интуиции от статистических шумов, возникающих при сборе данных. Стабильность языка подтверждается, но его иерархия по показателям дистанции, увы, является подвижным замком.