Китайские «рабочие лошадки» в битве с западными флагманами: тестирование MiniMax, LongCat и DeepSeek
В новом исследовании модели средней ценовой категории — MiniMax M3, LongCat 2.0, MiMo-v2.5-Pro и DeepSeek V4 Pro — столкнулись в двенадцати реальных задачах. Результаты показали, что при ограниченных бюджетах эти модели могут упрощенных, но функциональных решений, превосходя более дорогие аналоги в коде и анализе текстов.

# Китайские модели среднего сегмента: почему «рабочие лошадки» не стыдятся соревноваться с «флагманами»?
Если «флагманы» нейросетей соревнуются в скорости обработки терабайт данных, то «рабочие лошадки» призваны решать задачи, которые требуют денег: кодить, анализировать документы и делать это по цене токена, доступной для бизнеса. В новой части цикла тестов мы спустились на ступень ниже — в диапазон моделей, которые компании ставят в продакшн, когда счёт идет на десятки тысяч запросов в месяц.
Мы сравнили четыре модели: MiniMax M3 (от производителя видео-генераторов), LongCat 2.0 (от компании Meituan, доставляющей еду), MiMo-v2.5-Pro (линейка от Xiaomi) и DeepSeek V4 Pro (старшая модель, но с ценой «среднячка»). Все тесты проходили через агрегатор BotHub, без использования веб-интерфейсов, чтобы исключить скрытые преимущества.
Код: когда одна и та же программа появляется дважды
Первым тестом стала разработка браузерных шахмат. Задача была стандартной: создать игру на HTML/CSS/JS, работающую без сервера.
Результат превзошел ожидания: все четыре модели выдали рабочий код с первого запуска. Но вот где возникло странное совпадение.
Модели MiMo-v2.5-Pro и DeepSeek V4 Pro выдали практически идентичные решения. Исследователи выяснили, что код совпадает построчно: одинаковые переменные, одинаковый порядок векторов движения коня, даже те же самые цвета в CSS (например, #5a5a8a для наведения). Вероятность случайного совпадения порядка 40 000 вариантов для векторов движения и цветовых палитр стремится к нулю.
Скорее всего, обе модели обучались на одном и том же исходном примере из набора данных и просто воспроизвели его, но с разными «названиями функций». Это важный урок: надеяться, что две разные модели дадут два разных решения, на простых канонических задачах не стоит. Вы получите одну и ту же программу в двух редакциях.
Однако лидером раунда стала LongCat 2.0. Она не просто написала игру, но и включила не проситые функции: возможность отмены хода и подписи съеденных фигур. При этом её проект оказался самым дешевым из всех — всего 2 рубля 55 копеек против 11 рублей у DeepSeek.
Анализ текстов: ловля нестыковок в «Убийстве в Восточном экспрессе»
Второй тест проверял способность моделей работать с длинным контекстом (333 тысячи знаков). Задача: найти фактические ошибки в романе Агаты Кристи, не путая их с сюжетными подсказками автора.
Здесь победила MiMo-v2.5-Pro. Модель нашла ошибку в хронологии прибытия поезда, несоответствие транслитерации названия станции и историческую неточность в топонимике (разделение города на «Стамбул» и прилегающие районы). Она также заметила грамматическую несогласованность в описании улик (где-то упоминается она, где-то он).
MiniMax M3 показала дисциплинированный результат, но часть своих находок оказалась неверной: она указала на расхождение в расписании поезда как на ошибку, хотя художественный текст не обязан соответствовать историческим расписаниям поездов той эпохи. Кроме того, модель уловила несколько сюжетных нюансов, которые не являются фактическими ляпами.
LongCat 2.0 и DeepSeek V4 Pro продемонстрировали слабость в этом раунде. Они перечислили в качестве ошибок те самые сюжетные подсказки (красное кимоно, нож в губке), которые автор оставил намеренно скрытыми. Более того, LongCat допустила галлюцинации: она написала о расхождении написаний одного имени, которое на самом деле было одинаковым во всем тексте, просто заполнив шаблон ответа.
Мультимодальность и стоимость
Один из ключевых вопросов: насколько эти модели готовы работать с картинками? Оказалось, что в данном списке мультимодальность — это скорее исключение. Из четырёх моделей лишь DeepSeek V4 Pro умеет обрабатывать изображения, остальные работают только с текстом. Это правило, которое нужно учитывать при проектировании пайплайнов на базе дешевых китайских моделей.
Глубокая статистика расходов (в CAPS — внутренней валюте тестового сервиса) показала явное преимущество LongCat 2.0 по экономии бюджета. MiniMax M3 и MiMo оказались в середине, а DeepSeek, несмотря на статус «флагмана», в этом конкретном наборе задач показал себя как самая дорогая из участников.
Выводы для бизнеса
Этот цикл тестов доказывает, что переход на модели среднего сегмента не означает падения качества. На задачах кодинга и работы с текстом китайские «рабочие лошадки» могут дать решения, сопоставимые с западными флагманами, при затратах в разы меньших.
Однако есть риски: 1. Зависимость от обучающих данных: На простых задачах можно столкнуться с дублированием решений от разных моделей. 2. Ошибки в анализе текста: Модели могут путать сюжетные хитрости автора с ошибками фактологии. 3. Отсутствие мультимодальности: Не все дешевые модели умеют работать с картинками.
Выбор модели должен опираться не только на стоимость токена, но и на проверку конкретных сценариев использования, чтобы избежать сюрпризов в продакшене.