Искусственный интеллект · Локальный AI · LLM бенчмарки · DeepSeek V4 · Ornith · Квантование · NVIDIA RTX PRO 60007 сентября в 05:32 · 5 мин

Гибридный бенчмарк на RTX PRO 6000: квантованный DeepSeek и MoE-модель Ornith обновили стандарты локального AI

В рамках продолжающейся серии тестирования локальных моделей искусственного интеллекта на графических процессорах NVIDIA RTX PRO 6000, исследователь сравнил производительность и точность 2-битной версии модели DeepSeek V4 Flash с полной точностью API-версии и новой архитектурой MoE от Ornith. Результаты показали, что радикальное квантование модели DeepSeek приводит к падению качества на 3.4%, в то время как менее известная модель Ornith-35B демонстрирует баланс скорости и интеллекта, превосходя по декодированию другие локальные конфигурации.

Стеклянный ледяной кристалл с застывшим свечением на фоне темного моря Тихой бухты, метафора локального ИИ.

# Локальная эра LLM: 2-битный DeepSeek против мощи Ornith-35B

Процесс миграции сложных языковых моделей (LLM) в корпоративные и домашние серверы продолжается стремительными темпами. На этот раз фокус внимания сместился на аппаратную конфигурацию на базе профессиональной видеокарты NVIDIA RTX PRO 6000. Исследование, проведенное экспертом даниил_иванов, представляет собой глубокий технический анализ влияния квантования на точность ответов модели DeepSeek V4 и дебютной тестирование архитектуры Mix-of-Experts (MoE) на примере моделей Ornith.

Точность против скорости: цена квантования DeepSeek

Центральным вопросом исследования стало сопоставление 2-битной версии модели DeepSeek V4 Flash (квантование IQ2_XXS от Unsloth) с полной точностью оригинальной модели, используемой через API. Традиционно считается, что снижение битности весов модели позволяет сэкономить память и увеличить скорость вывода, но часто ценой значительной потери качества генерации.

В ходе бенчмарка, состоящего из 50 задач платформы lii-code-bench-ru, было установлено следующее:

* DeepSeek V4 Flash (API, полная точность): Получил оценку 0.731 балла. Модель выполнила 42 из 50 задач. Время первого токена (TTFT) составило 15.95 секунды, скорость декодирования — 53.3 токена в секунду. * DeepSeek V4 Flash (Локально, 2-бит): Оценка снизилась до 0.697 балла. Успешно решено 35 из 50 задач. TTFT сократился до 8.48 секунды, а скорость декодирования выросла до 66.8 токенов в секунду.

Разница в оценке составляет 0.034 балла. Исследователь отметил, что эти данные получены после пересчета на ансамбль из трех судей (Gemini, GPT-5.1 и Opus), чтобы избежать искажений, характерных для оценки одним модельным агентом. Хотя квантование позволило ускорить обработку запросов на 25%, потеря качества оказалась существенной для задач, требующих высокой точности логики и кода.

Как работает квантование в этом контексте?

Технически, алгоритм UD-IQ2_XXS применяет разную степень сжатия к различным частям модели. Эксперты-маршрутизаторы и общие слои сохраняют повышенную точность (форматы Q8/F16), тогда как специализированные эксперты подвергаются агрессивному сжатию до 2 бит. Это позволяет модели выживать в условиях ограниченной памяти без полного обрушения функциональности, но генерирует «шум», который судьи-аналитики фиксируют как выдуманные цифры или противоречащие условию задачи рекомендации.

MoE-архитектура: Выход Ornith на первый план

Помимо модификации DeepSeek, исследователи протестировали две модели из семейства Ornith: 9- и 35-миллиардную версии. Особое внимание attracted модель Ornith-35B-A3B, использующая архитектуру «смеси экспертов» (MoE). В таких моделях не все нейроны активны для каждого запроса, что снижает вычислительные затраты.

Результаты для Ornith-35B оказались неожиданно конкурентными:

* Оценка: 0.729 балла. * Точность: 42 из 50 задач (равно API-версии DeepSeek). * Скорость: 236.5 токенов в секунду.

Это означает, что Ornith-35B выполняет декодирование почти в 4.5 раза быстрее, чем полная версия DeepSeek, при практически идентичном качестве ответов. Однако при сравнении с собственной лучшей локальной моделью на исследуемом оборудовании — Qwen3.8-27B (оценка 0.789, 56 из 50 задач) — Ornith проигрывает как по точности (разница 0.06 баллов), так и по надежности выполнения задач.

Проблема контекста и параллелизма

В ходе тестирования столкнулись с интересными нюансами работы с контекстом. Модель DeepSeek, развернутая с одним параллельным слотом (--parallel 1) для поддержки огромного контекста (до 1 мега-токена), демонстрировала удивительно низкую задержку первого ответа (TTFT 239 мс) при последовательной обработке. В то же время, стандартные бенчмарки, предполагающие параллельную загрузку, выдавали задержки в десятки секунд, что было ошибочно интерпретировано как медленное мышление модели. На практике, для сессий пользователя, это является ключевым преимуществом.

Также были замечены ошибки при запуске бенчмарков для Ornith-9B из-за исчерпания кредитов у провайдеров API-судей, что потребовало дозагрузки средств для завершения полных прогонов. Тем не менее, после устранения технических помех картина стала четкой: малые модели часто проваливаются на специфических логических тестах.

Итоги и рекомендации для продакшна

На основе полученных данных можно сформулировать следующие выводы для пользователей мощных видеокарт высокого класса:

1. Модель DeepSeek V4 в 2-битном виде не рекомендуется для продакшн-сред, где важна абсолютная точность. Разница в 0.034 балла на тестовой выборке из 50 задач может привести к критическим ошибкам в коде или юридически значимых ответах. Тем не менее, её исключительная скорость декодирования и компактность делают её отличным кандидатом для ролей ревьюера кода или планировщика задач, где важна скорость реакции. 2. Орнит 35B (Ornith-35B) представляет собой перспективный вариант для систем, где приоритетом является скорость отклика при сохранении приемлемого уровня интеллекта. Она закрывает потребность в быстром генеративном инструменте, не уступая топовым API-решениям в базовых тестах. 3. Qwen3.8-27B продолжает оставаться безусловным лидером в данной конфигурации, демонстрируя наилучший баланс между точностью (56/50 задач) и скоростью, хотя и требующий значительно больше оперативной памяти для работы с контекстом.

Для большинства приложений, где требуется работа с большими окнами контекста и высокая скорость ответа, комбинация мощной карты RTX PRO 6000 с правильно настроенной моделью может заменить дорогие API-вызовы, сохраняя при этом контроль над данными. Однако выбор модели зависит от конкретной задачи: для глубокого анализа необходим Qwen, для молниеносной генерации — Ornith, а для специфических быстрых проверок — квантованный DeepSeek.

Таким образом, локальное развертывание продолжает эволюционировать, предлагая новые возможности для оптимизации ресурсов, но цена квантования остается значимым фактором, требующим взвешенного подхода к выбору архитектуры.

Первоисточники

Habr AI
← Вернуться в эфир