Гибридный бенчмарк на RTX PRO 6000: квантованный DeepSeek и MoE-модель Ornith обновили стандарты локального AI
В рамках продолжающейся серии тестирования локальных моделей искусственного интеллекта на графических процессорах NVIDIA RTX PRO 6000, исследователь сравнил производительность и точность 2-битной версии модели DeepSeek V4 Flash с полной точностью API-версии и новой архитектурой MoE от Ornith. Результаты показали, что радикальное квантование модели DeepSeek приводит к падению качества на 3.4%, в то время как менее известная модель Ornith-35B демонстрирует баланс скорости и интеллекта, превосходя по декодированию другие локальные конфигурации.

# Локальная эра LLM: 2-битный DeepSeek против мощи Ornith-35B
Процесс миграции сложных языковых моделей (LLM) в корпоративные и домашние серверы продолжается стремительными темпами. На этот раз фокус внимания сместился на аппаратную конфигурацию на базе профессиональной видеокарты NVIDIA RTX PRO 6000. Исследование, проведенное экспертом даниил_иванов, представляет собой глубокий технический анализ влияния квантования на точность ответов модели DeepSeek V4 и дебютной тестирование архитектуры Mix-of-Experts (MoE) на примере моделей Ornith.
Точность против скорости: цена квантования DeepSeek
Центральным вопросом исследования стало сопоставление 2-битной версии модели DeepSeek V4 Flash (квантование IQ2_XXS от Unsloth) с полной точностью оригинальной модели, используемой через API. Традиционно считается, что снижение битности весов модели позволяет сэкономить память и увеличить скорость вывода, но часто ценой значительной потери качества генерации.
В ходе бенчмарка, состоящего из 50 задач платформы lii-code-bench-ru, было установлено следующее:
* DeepSeek V4 Flash (API, полная точность): Получил оценку 0.731 балла. Модель выполнила 42 из 50 задач. Время первого токена (TTFT) составило 15.95 секунды, скорость декодирования — 53.3 токена в секунду. * DeepSeek V4 Flash (Локально, 2-бит): Оценка снизилась до 0.697 балла. Успешно решено 35 из 50 задач. TTFT сократился до 8.48 секунды, а скорость декодирования выросла до 66.8 токенов в секунду.
Разница в оценке составляет 0.034 балла. Исследователь отметил, что эти данные получены после пересчета на ансамбль из трех судей (Gemini, GPT-5.1 и Opus), чтобы избежать искажений, характерных для оценки одним модельным агентом. Хотя квантование позволило ускорить обработку запросов на 25%, потеря качества оказалась существенной для задач, требующих высокой точности логики и кода.
Как работает квантование в этом контексте?
Технически, алгоритм UD-IQ2_XXS применяет разную степень сжатия к различным частям модели. Эксперты-маршрутизаторы и общие слои сохраняют повышенную точность (форматы Q8/F16), тогда как специализированные эксперты подвергаются агрессивному сжатию до 2 бит. Это позволяет модели выживать в условиях ограниченной памяти без полного обрушения функциональности, но генерирует «шум», который судьи-аналитики фиксируют как выдуманные цифры или противоречащие условию задачи рекомендации.
MoE-архитектура: Выход Ornith на первый план
Помимо модификации DeepSeek, исследователи протестировали две модели из семейства Ornith: 9- и 35-миллиардную версии. Особое внимание attracted модель Ornith-35B-A3B, использующая архитектуру «смеси экспертов» (MoE). В таких моделях не все нейроны активны для каждого запроса, что снижает вычислительные затраты.
Результаты для Ornith-35B оказались неожиданно конкурентными:
* Оценка: 0.729 балла. * Точность: 42 из 50 задач (равно API-версии DeepSeek). * Скорость: 236.5 токенов в секунду.
Это означает, что Ornith-35B выполняет декодирование почти в 4.5 раза быстрее, чем полная версия DeepSeek, при практически идентичном качестве ответов. Однако при сравнении с собственной лучшей локальной моделью на исследуемом оборудовании — Qwen3.8-27B (оценка 0.789, 56 из 50 задач) — Ornith проигрывает как по точности (разница 0.06 баллов), так и по надежности выполнения задач.
Проблема контекста и параллелизма
В ходе тестирования столкнулись с интересными нюансами работы с контекстом. Модель DeepSeek, развернутая с одним параллельным слотом (--parallel 1) для поддержки огромного контекста (до 1 мега-токена), демонстрировала удивительно низкую задержку первого ответа (TTFT 239 мс) при последовательной обработке. В то же время, стандартные бенчмарки, предполагающие параллельную загрузку, выдавали задержки в десятки секунд, что было ошибочно интерпретировано как медленное мышление модели. На практике, для сессий пользователя, это является ключевым преимуществом.
Также были замечены ошибки при запуске бенчмарков для Ornith-9B из-за исчерпания кредитов у провайдеров API-судей, что потребовало дозагрузки средств для завершения полных прогонов. Тем не менее, после устранения технических помех картина стала четкой: малые модели часто проваливаются на специфических логических тестах.
Итоги и рекомендации для продакшна
На основе полученных данных можно сформулировать следующие выводы для пользователей мощных видеокарт высокого класса:
1. Модель DeepSeek V4 в 2-битном виде не рекомендуется для продакшн-сред, где важна абсолютная точность. Разница в 0.034 балла на тестовой выборке из 50 задач может привести к критическим ошибкам в коде или юридически значимых ответах. Тем не менее, её исключительная скорость декодирования и компактность делают её отличным кандидатом для ролей ревьюера кода или планировщика задач, где важна скорость реакции. 2. Орнит 35B (Ornith-35B) представляет собой перспективный вариант для систем, где приоритетом является скорость отклика при сохранении приемлемого уровня интеллекта. Она закрывает потребность в быстром генеративном инструменте, не уступая топовым API-решениям в базовых тестах. 3. Qwen3.8-27B продолжает оставаться безусловным лидером в данной конфигурации, демонстрируя наилучший баланс между точностью (56/50 задач) и скоростью, хотя и требующий значительно больше оперативной памяти для работы с контекстом.
Для большинства приложений, где требуется работа с большими окнами контекста и высокая скорость ответа, комбинация мощной карты RTX PRO 6000 с правильно настроенной моделью может заменить дорогие API-вызовы, сохраняя при этом контроль над данными. Однако выбор модели зависит от конкретной задачи: для глубокого анализа необходим Qwen, для молниеносной генерации — Ornith, а для специфических быстрых проверок — квантованный DeepSeek.
Таким образом, локальное развертывание продолжает эволюционировать, предлагая новые возможности для оптимизации ресурсов, но цена квантования остается значимым фактором, требующим взвешенного подхода к выбору архитектуры.