AI3 сентября в 18:05 · 7 мин

Своя «младшая» модель обошла флагмана: разбор перевода романа четырьмя моделями ИИ

В эру, когда маркетинговые названия моделей часто обманчивы, свежий эксперимент на художественном тексте выявил парадокс: новейшая версия «быстрой» линейки Google Gemini Flash 3.7 перевела роман Стивена Бакстера чище, чем её предшественница флагманская линия Gemini Pro 3.1. Тщательное сравнение четырёх ведущих моделей (Claude Opus 5, OpenAI Sol 5.6, Gemini Flash 3.7 и Gemini Pro 3.1) в рамках литературного конвейера показало, что «идеальный переводчик» не существует, а самокоррекция является фатальной ошибкой любой системы.

Холодная метафора ИИ: ледяной кубик в форме книги на мрачном причале ночью.

# Своя «младшая» модель обошла флагмана: разбор перевода романа четырьмя моделями ИИ

В мире искусственного интеллекта названия моделей часто становятся удобной припиской, скрывающей реальную архитектуру. Традиционная иерархия, где «флагманские» модели считаются безальтернативными лидерами, а «быстрые» версии используются лишь для черновиков, оказалась под угрозой. Новый эксперимент, проведенный на основе художественного произведения, демонстрирует, что скорость разработки и обновление весов могут быть важнее громкого названия линейки.

В этом обзоре мы рассматриваем результаты сравнительного тестирования четырех передовых моделей для задач перевода, редактирования и факточекинга. Участники: Claude Opus 5 от Anthropic, gpt-5.6-sol от OpenAI, Gemini 3.7 Flash и Gemini 3.1 Pro от Google.

Почему важна «слепая» редакция

Для глубокого анализа качества перевода авторы эксперимента использовали специализированный конвейер BookTrans. Классическая схема работы редактора имеет скрытый недостаток: при правке текста редактор видит только готовый перевод, не имея доступа к оригиналу одновременно. Это создает риск того, что редактор бессознательно подтянет кальки или синтаксические конструкции с языка оригинала, перекрасив их в русский. Именно поэтому в сложных проектах вводится роль «сверщика» — той самой фигуры, которая видит оригинал и перевод рядом и выносит вердикт: допустить ошибку автора в текст или исправить её в сноску.

Именно для этой роли — сверщика — и проводились тесты. Модель должна была оценить черновик перевода другой модели и предложить минимальное количество правок, необходимых для достижения литературного стандарта. Цель эксперимента состояла в том, чтобы определить, чей черновик требует наименьшего количества правок и каков характер этих правок.

Методика: тестирование на материале Xeelee Sequence

Объектом исследования послужили главы из романа Стивена Бакстера «Timelike Infinity» (цикл «Хищный отряд», Xeelee Sequence). Выбор неслучаен: текст насыщен научной фантастикой, требует точного знания терминологии, содержит сложные описания космоса и диалоги высокого уровня.

Все модели переводили один и тот же набор глав, используя единый справочник имен и терминов. Оценка качества проводилась двумя методами: 1. Количественный анализ: Подсчет количества правок, предложенных «судьями» (другими моделями). Чем меньше правок — тем чище исходный перевод. 2. Качественный анализ: Сравнительное чтение текстов в оригинале и переводе для выявления нюансов стиля, кальк и смысловых ошибок.

Итоги сравнительного тестирования

Результаты теста оказались неожиданностью для индустрии. Флагманская модель Gemini Pro 3.1, которую традиционно ожидали видеть лучшей, показала худшие результаты по всем параметрам по сравнению с более быстрой и менее дорогой Gemini 3.7 Flash.

| Модель-переводчик | Правки (судья Opus) | Правки (судья Sol) | Правки (судья Pro) | Характер перевода | | :--- | :--- | :--- | :--- | :--- | | Gemini 3.7 Flash | 40 | 48 | 52 | Живой, образный, минимум ошибок | | Claude Opus 5 | — | 55 | 61 | Лучший ритм, естественная проза | | OpenAI Sol 5.6 | 61 | 51 | 69 | Максимальная верность оригиналу | | Gemini Pro 3.1 | 74 | 74 | 65 | Канцелярщина, кальки, частые ошибки |

*(Значения в скобках указывают на уровень оценки самим переводчиком при самокоррекции)*

Ключевые выводы: * Flash 3.7 переведила текст чище всех. Судьи из всех семей моделей (и Opus, и Sol, и Pro) предложили меньшее количество правок для её черновика, чем для любого другого варианта. Разница между Opus (40 правок) и Pro (74 правки) составляет почти 85%. * Обновление важнее ранга. Модель Flash 3.7 вышла в середине 2026 года, тогда как Pro 3.1 — в начале того же года. Новейшая архитектура младшей модели в данном случае превосходила старую флагманскую. * Самостоятельная оценка не работает. Модели были слепы к собственным ошибкам. Например, модель Sol предложила 51 правку своему тексту, в то время как внешние судьи нашли 61–69. Это подтверждает невозможность использования одной модели для перевода и редактуры одновременно.

Анализ стиля: кто лучше, а кто хуже

За сухими цифрами скрываются существенные различия в подходах моделей:

* Gemini 3.7 Flash показала сочетание точности и живости. Перевод не содержал фактических ошибок. Удачными переводами стали образы вроде «росчерк пикселей» для выражения *bolt of pixels* и «щемяще-синий серп Земли». Единичные ошибки носили характер мелких тавтологий или кальк, но они были легко исправимы. * Claude Opus 5 продемонстрировал лучшее владение ритмом русского языка. Фразы звучали как литературная проза, а не перевод («Людей раздавили», «Они себя переделали»). Однако в сложных сценах иногда допускались стилистические пересушки. * OpenAI Sol 5.6 стал эталоном точности. Она восстановила поврежденное OCR-место в исходнике (ошибочно прочитанный титул) и сохранила авторские конструкции, даже если они были стилистически сложны. Однако язык получился сухим и книжным. * Gemini Pro 3.1 оказался самым проблемным. В тексте наблюдались системные кальки («триггеры ностальгии», «глаза почувствовали слезливость»), канцелярский стиль и лишние местоимения. Например, фраза «триггерами ностальгии» вместо более литературного «спусковыми крючками». В диалогах использовалось канцеляритное «тогда как» там, где контекст требовал простоты.

Проблема самокоррекции и роль «сверщика»

Одним из важнейших выводов исследования стала невозможность эффективной самокоррекции. Попытки заставить одну и ту же модель сначала перевести, а затем отредактировать свой же результат приводят к тому, что она игнорирует собственные ошибки. Модель воспринимает свою же кальку как норму и не может её обнаружить.

Это фундаментально меняет подход к автоматизации переводов. В профессиональном конвейере теперь критически важно разделять роли: перевод должен выполнять одна модель, а редакция и верификация — другая. Использование двух моделей из одного семейства (например, двух разных версий Gemini) для этих этапов неэффективно по сравнению с использованием представителей разных семей (например, Google для перевода и Anthropic для редактуры).

Примеры из теста показывают, что чужой взгляд позволяет заметить системные ошибки, которые модель-оригинал пропустит. Так, модель Sol, правя свой текст, пропустила около 7% ошибок, тогда как модель Pro, правя текст Sol, предложила 69 правок.

Влияние глубины рассуждений и цена точности

Исследование также охватило промежуточные модели — Claude Sonnet 5 и OpenAI Terra 5.6, проверяя влияние параметра «глубина рассуждений» на качество текста.

Оказалось, что увеличение глубины рассуждений (от low до max) практически не влияет на количество ошибок в художественном переводе. Разброс в количестве правок был сопоставим с погрешностью теста.

* Claude Sonnet: При повышении глубины улучшался стиль (исчезали сломанный синтаксис), но цена росла втрое, а время генерации увеличивалось в четыре раза. При максимальной глубине модель также начинала терять абзацы текста. * OpenAI Terra: Глубина рассуждений не помогла избежать смысловых промахов, свойственных этой модели (например, ошибка с мили вместо километра и упоминание «кваксов» вместо «послов»).

Экономика процессов также важна. Максимальный уровень глубины рассуждений у Sonnet стоит столько же ($1.22), сколько и перевод той же главы модели Opus ($1.26), но Opus делает это чище и быстрее.

Выводы для индустрии

1. Не верьте названиям линейок. Быстрая модель нового поколения может превзойти флагмана прошлого года. Выбор модели должен базироваться на замерах на конкретной задаче, а не на маркетинговых позициях. 2. Два мозга лучше одного. Качественный перевод требует мультиагентного подхода: одна модель для генерации, другая для редактуры. Совмещение этих функций одной моделью ведет к системным ошибкам. 3. Идеала нет. Каждая модель имеет свои сильные и слабые стороны: кто-то лучше пишет ритм, кто-то точнее следует тексту, кто-то быстрее. Идеального универсального переводчика не существует, но грамотное комбинирование инструментов позволяет минимизировать ошибки.

Первоисточники

Habr AI
← Вернуться в эфир