Реальность обещаний Nvidia: тесты DFlash показали ускорение 2,3x вместо 15x
Команда GPTunneL провела независимое benchmark-тестирование технологии DFlash от Nvidia, которая обещала увеличить скорость работы LLM до 15 раз. На реальном оборудовании с высокой конкуренцией пользователей ускорение составило лишь 2,3 раз, а при увеличении нагрузки система начала работать медленнее обычного авторегрессивного декодирования.

# DFlash: от маркетинговых обещаний до суровой реальности
Технологии искусственного интеллекта часто преподносятся в обёртке революционных изменений. В начале года Nvidia представила DFlash — механизм ускорения генерации текстов для любых больших языковых моделей (LLM), не требующий изменения самой архитектуры модели. Производитель заявлял о росте пропускной способности до 15 раз при использовании новых чипов Blackwell. Однако независимые проверки показывают, что такая цифра является частным случаем, работающим только в узких условиях.
Где рождается цифра 15x
Чтобы понять разрыв между заявлениями вендора и реальностью, нужно изучить принцип работы DFlash. Традиционные LLM генерируют текст последовательно: для каждого следующего слова модель проходит полный расчёт весов, упираясь не в вычислительную мощность GPU, а в скорость доступа к памяти. DFlash использует спекулятивное декодирование, но вместо того, чтобы предсказывать по одному токenu, employs блочную диффузионную модель для генерации сразу нескольких кандидатов параллельно. Это называется KV injection — скрытые состояния целевой модели подкачиваются прямо в модель-драфтер.
Zаявленные 15 раз ускорения не являются средним показателем по всем задачам. Nvidia достигла этой цифры на конкретном наборе данных (математика и код) с моделью gpt-oss-120b, используя восьмерку серверов DGX B300 и оптимизированное TensorRT-LLM. Это точка максимальной отзывчивости для одного пользователя, где базовый метод работает крайне неэффективно. При сдвиге к более реалистичным условиям конкуренции этот множитель резко падает. Даже сама компания указывает в технической документации, что при сопоставимой конкурентности ускорение составляет в среднем 2,3x для больших моделей и 2,8x для моделей типа Llama 3.1 8B.
Результаты тестов в реальной среде
Команда GPTunneL повторила эксперименты на своём стенде, используя одну видеокарту Nvidia RTX 6000 PRO и модель Gemma 4 26B. Результаты подтвердили, что в режиме одиночного запроса ускорение составляет около 2,3 раза (с 180,8 до 418,0 токенов в секунду). Однако как только на карту подгружаются другие запросы, эффективность технологии падает.
При запуске четырёх одновременных запросов ускорение сократилось до 1,09 раза, а при восьми параллельных запросах DFlash начал работать медленнее, чем стандартный режим (скорость упала на 31%). Кривая эффективности показывает, что после первого пользователя добавление новых пользователей не дает прироста скорости генерации, а наоборот, нагружает арифметические ядра GPU работой по проверке ошибочных предсказаний черновиков, которые затем отбрасываются.
Интересно, что влияние зависит от типа контента. На математических задачах и генерации кода, где синтаксис жёстко задает следующие токены, DFlash показал рост на 1,3–1,6 раза даже при одном запросе. На свободном тексте, особенно на русском языке, где вероятность предсказания ниже, технология не только не ускоряет, но и замедляет процесс.
Важные нюансы и влияние конфигурации
Тестирование выявило также критическую зависимость от квантования памяти. При использовании квантованного KV-кеша (q4_0) базовая скорость была значительно ниже, чем при использовании f16. При переходе на полную точность (f16) скорость генерации выросла на 39%. Более того, при высоком качестве кэша относительное преимущество DFlash снижалось с 1,75x до 1,35x. Это иллюстрирует общий принцип: чем эффективнее оптимизирован базовый инференс, тем меньше «пространство» для спекулятивных методов.
Главный вывод заключается в том, что DFlash — это узкоспециализированное решение. Оно оправдано в сценариях локального запуска на одном устройстве, в IDE или чатах, где очередь запросов отсутствует и GPU простаивает. В облачных сервисах с высокой загрузкой, где приоритетом является суммарная пропускная способность для множества пользователей, традиционное батчинг-декодирование превосходит спекулятивные методы.
В заключение можно сказать, что технологии развиваются, но маркетинговые заголовки часто опережают практику на порядки. Что действительно важно для разработчиков — это не абстрактные множители из пресс-релизов, а тщательное профилирование своего стека под конкретную нагрузку и тип задач. Каждый кластер требует своих настроек, и универсального рецепта для всех сценариев не существует.