RBS-Attention: Новый алгоритм разреженного префикса ускоряет обработку длинных контекстов в больших языковых моделях
Исследователи представили RBS-Attention — метод разреженной обработки входных данных (prefill), не требующий обучения. Технология решает проблему «усреднения» важности токенов в блоках, предлагая двойную ветвь отбора: базовую для оценки средней релевантности и спасательную для выявления скрытых значимых фрагментов. На аппаратном обеспечении NVIDIA H100 метод демонстрирует ускорение до 20,65 раз по сравнению с традиционным плотным вниманием.
# RBS-Attention: Преодоление узких мест длинного контекста
В эпоху развертывания языковых моделей с контекстным окном в сотни тысяч токенов, критическим узким местом становится этап предварительной обработки (prefill). Именно здесь происходит расчет матрицы внимания для всего входного запроса перед генерацией первого слова. Традиционные архитектуры вынуждены обрабатывать данные плотным способом, что создает колоссальную нагрузку на память и вычисления. Группа исследователей из arXiv представила решение, названное RBS-Attention (Radius-Bounded Sparse Prefill), которое предлагает радикально иной подход к отбору блоков данных.
Проблема усреднения и двойное решение
Ключевая проблема текущих методов разреженной выборки заключается в феномене, который авторы назвали mean dilution (усреднение среднего). В стандартных разреженных алгоритмах анализируется центр (центроид) блока токенов. Если внутри блока находится один highly relevant (крайне важный) токен, окруженный множеством нерелевантных слов, расчет усредненного значения может скрыть важность этого ключевого элемента. Система принимает решение игнорировать весь блок, теряя критическую информацию.
RBS-Attention устраняет этот недостаток с помощью двух комплементарных (взаимодополняющих) ветвей отбора:
1. Базовая ветвь (Centroid Base Branch): Традиционно оценивает среднюю релевантность блока, фильтруя явно нерелевантные сегменты. Это обеспечивает стабильность и высокую производительность для стандартных случаев. 2. Спасательная ветвь (Rescue Branch): Специально настроена на поиск аномалий. Она использует радиус ключевого блока (maximum key-block radius) и анализирует его распределение с учетом конкретного запроса, слоя нейросети и головы внимания (attention head). Если базовая ветвь рискует пропустить важный блок из-за наличия шума, спасательная ветвь выявляет его через радиально-адаптивный анализ.
Результаты двух ветвей независимо пороговыми значениями, после чего объединяются маски отбора. Это позволяет контролировать вклад «спасенных» блоков, не нарушая при этом оптимизированную архитектуру разреженного FlashAttention.
Производительность на реальном железе
Технические показатели были измерены на актуальных графических процессорах NVIDIA H100 с использованием модели Qwen3-30B-A3B-Instruct-2507-FP8 при длине контекста 128K токенов. Результаты показывают существенный отрыв от базовых конфигураций:
* 20,65-кратное ускорение по сравнению со стандартным вычислительным блоком prefill-attention. * 11,92-кратное ускорение относительно реализации в фреймворке vLLM. * 5,97-кратное ускорение времени появления первого токена (time-to-first-token) в общем времени выполнения запроса.
Важно отметить, что ускорение достигается без потери качества. При тестировании на плотной модели Qwen3-32B метод показал общий балл точности RULER на уровне 88,65 против 89,52 у стандартного плотного внимания. Для проверки качества также были задействованы бенчмарки LongBench-v2, InfiniteBench и Video-MME.
Поддержка и адаптивность
В отличие от многих оптимизаций, требующих дообучения модели на специфических данных, RBS-Attention является training-free (не требующим обучения). Метод оперирует архитектурными изменениями в логике отбора блоков во время инференса (вывода).
Исследования подтверждают, что адаптивный подход, учитывающий радиус блоков, эффективен для различных сценариев. Дополнительные эксперименты пролили свет на поведение метода в отношении размера блоков, пороговых значений и потребления памяти, доказывая его применимость для современных систем обработки длинных текстов, видео и других мультимодальных данных.
Технология демонстрирует, что балансировка между скоростью вычислений и сохранением смысловой целостности длинного контекста возможна без переписывания базовых весов нейросети, лишь изменив алгоритмическую логику предварительной фазы обработки.