Искусственный интеллект · LLM · Перевод · Генеративные модели · Google · OpenAI · Anthropic3 сентября в 17:09 · 3 мин

Новая модель Google обошла флагмана: результаты сравнения LLM в литературном переводе

Тестирование передовых языковых моделей Anthropic, OpenAI и Google на материале художественной литературы выявило неожиданный результат: более молодая и «легкая» версия Gemini 3.7 Flash перевела текст чище и точнее, чем флагманская модель Pro 3.1 той же компании. Исследование также продемонстрировало, что идеального универсального переводчика среди текущих алгоритмов не существует, а для качественной работы требуется разделение ролей между автором и редактором.

# Сравнение флагманов: кто лучше переводит художественную литературу

В мире искусственного интеллекта часто существует миф о линейном улучшении, где более высокие версии моделей всегда превосходят предыдущие. Однако последнее масштабное сравнение, проведенное командой RUVDS.com, показало, что в задачах литературного перевода иереархия брендов и версий может быть обманчива.

В эксперименте участвовали четыре передовые модели: Gemini Flash 3.7 (Google), Gemini Pro 3.1 (Google), Claude Opus 5 (Anthropic) и GPT-5.6 Sol (OpenAI). Исследователи поставили перед ними одну задачу — перевести главы романа Стивена Бакстера «Timelike Infinity» (цикл Xeelee Sequence) с английского на русский. Оценка качества проводилась не только автоматически, но и с помощью «человеческих» судей-алгоритмов из других семейств.

*«Сенсация: младшая модель обошла старшую»* — так можно резюмировать ключевой вывод исследования.

Новая скорость превосходит прошлое качество

Ожидания были предельно просты: флагманская модель Google (Pro 3.1) должна была перевести текст лучше, чем её более дешевая и быстрая родственница (Flash 3.7). Реальность оказалась иной.

В ходе анализа редакторы-судьи выявили следующие цифры количества необходимых правок (чем меньше число, тем чище перевод): * Gemini Flash 3.7: 40–52 правки (в зависимости от судьи). * Gemini Pro 3.1: 65–74 правки.

Младшая модель оказалась почти в два раза чище флагмана. Анализ показал, что Pro 3.1 страдает от системной «канцелярщины», частых калькирований и лишних местоимений. В свою очередь, Flash 3.7 продемонстрировала живой, образный язык с редкими находками (например, описание «щемяще-синего серпа Земли»). Также стоит отметить экономический фактор: модель Flash значительно дешевле в эксплуатации и работает быстрее.

Тестирование на прочность

Кроме общей чистоты языка, модели проверяли на сложные случаи: 1. OCR-ошибки: В тексте были намеренно повреждены места распознавания. Только одна модель (Sol) смогла верно восстановить упущенное слово и смысл фразы о «После при кваксах», интерпретируя обрывок текста по контексту сюжета. 2. Чувствительные сцены: При переводе диалогов с угрозами модели иногда сталкивались с цензурными фильтрами. Flash справилась с задачей в 100% случаев, тогда как флагман Pro отказался от перевода одной из трех попыток.

Невозможность идеального переводчика

Итог теста подтвердил главное правило профессионального переводчика: «Чистота, блеск и верность оригиналу достались трём разным моделям», и идеальной модели, сочетающей все эти качества, в тестировании не обнаружено.

* Opus (Anthropic): Дает наилучший ритм и стиль русской прозы, текст читается легко и естественно. * Sol (OpenAI): Максимально точно следует буквальному смыслу оригинала, сохраняя даже поврежденные фрагменты, но язык получается суховатым. * Flash (Google): Обеспечивает минимальное количество правок (чистоту), но не всегда добавляет литературного блеска.

Такой результат доказывает ценность мультиагентных систем, где разные модели выполняют разные функции. Попробовать заставить одну модель перевести и сразу отредактировать свой текст («самоправка») — плохая идея. Модели «слепы» к своим собственным ошибкам и калькам. В исследовании показано, что при самоправе количество найденных ошибок возрастает, так как алгоритм склонен воспринимать свои же штампы как норму. Для профессиональной работы критически важно разделять роли переводчика и редактора.

Вердикт

Технологический прогресс идет не всегда по прямой. Новая архитектура или обновление версии (как в случае с Gemini Flash 3.7) может принести качественный скачок, превзойдя более старую версию флагманской линейки. Выбор модели для задач перевода и обработки текста должен опираться не на название бренда, а на результаты тестов именно на той специфике контента, с которой предстоит работать.

Первоисточники

Habr AI
← Вернуться в эфир