Инфраструктура Olmo-core 3: Открытая экосистема для обучения сверхмасштабных языковых моделей
Институт искусственного интеллекта Allen AI представил Olmo-core 3 — обновленную открытую платформу для обучения моделей с архитектурой смеси экспертов (MoE). Данная система разработана с учетом специфик распределенных вычислений, позволяя масштабировать количество параметров модели до триллиона и выше, сохраняя при этом вычислительную эффективность. Новая инфраструктура доступна для научного сообщества и станет основой для следующего поколения моделей Olmo.
# Инфраструктура Olmo-core 3: Открытая экосистема для обучения сверхмасштабных языковых моделей
*Опубликовано: 1 октября 2026 года. Источники: Блог Hugging Face, Allen AI.*
Институт Allen AI объявил о релизе Olmo-core 3, представляющего собой значительное обновление инструментов для разработки больших языковых моделей. Это не просто обновление библиотеки, а полная перестройка программного стека, ориентированного на работу с архитектурами смеси экспертов (Mixture of Experts, MoE). Ключевой целью разработки стало обеспечение возможности масштабирования обучения моделей с параметрами в триллионный диапазон без резкого роста вычислительных затрат.
*Примечание редактора:* Открытость инфраструктуры часто становится решающим фактором в научной среде. Предоставление доступа не только к весам модели, но и к коду обучения позволяет исследователям воспроизводить результаты и адаптировать технологии под свои задачи, что ускоряет прогресс в области ИИ.
Принципы работы новой архитектуры
Проблема, которую решает Olmo-core 3, заключается в эффективности распределения задач при работе с огромными моделями. В архитектурах MoE модель состоит из множества специализированных компонентов, называемых «экспертами». При обработке каждого входного токена активными являются лишь небольшая часть этих экспертов. Однако традиционные методы обучения требовали постоянной пересборки весов модели для каждого шага, что создавало огромные нагрузки на память и коммуникацию между видеокартами в кластере.
Новая версия инфраструктуры отказалась от ранее используемого подхода с полным шардированием данных (Fully Sharded Data Parallelism, FSDP). Вместо этого Olmo-core 3 перешла на распределенный параллелизм данных (Distributed Data Parallelism, DDP). Новая система удерживает экспертов непосредственно на видеокартах, направляя к ним только те данные, которые им необходимы. Это позволяет избежать частой передачи весов памяти между устройствами, устраняя один из главных «узких мест» в обучении сверхбольших моделей.
Для сравнения, в предыдущих версиях стека с использованием 8 видеокарт NVIDIA B300 производительность при обработке модели объемом 47 миллиардов параметров составляла около 19 400 токенов в секунду на одной карте. С внедрением новой системы этот показатель вырос почти в 2,7 раза — до 52 000 токенов в секунду. При этом количество активных параметров на токен осталось прежним (около 3,2 миллиарда), а общее количество параметров модели увеличилось с 4,6 до 47 миллиардов.
Технические оптимизации и масштабирование
Достижение таких показателей стало возможным благодаря совокупности нескольких технических приемов, направленных на оптимизацию маршрутизации данных и вычислений. Система использует ряд продвинутых методов распределения нагрузки:
* Экспертный параллелизм: Разделение пула экспертов между видеокартами так, что каждый процессор хранит лишь часть всей базы знаний. * Параллелизм по конвейеру: Разбиение слоев модели на группы, распределенные по кластеру, что снижает объем памяти, необходимый для каждого устройства. * Распределенный оптимизатор: Дробление состояния оптимизатора (данных, используемых для обновления весов) по всем GPU вместо хранения полной копии на каждом.
Дополнительные улучшения включают использование строкового экспертного параллелизма, которое размещает маршрутизированные данные прямо в буферах ввода экспертов, минимизируя лишнюю перестановку. Также реализован механизм, при котором метаданные маршрутизации остаются на GPU, что позволяет CPU формировать задачи без ожидания копирования информации. Наконец, объединение мелких вычислений (Grouped GEMM) позволяет видеокартам выполнять рутинные операции более эффективно.
Особое внимание уделено формату чисел MXFP8. Это формат с пониженной точностью, который использует меньше бит для представления значений. В бенчмарках на четырех видеокартах B300 включение MXFP8 позволило увеличить общую пропускную способность обучения на 21% по сравнению с форматом BF16, а также снизить пиковое потребление памяти с 103 ГБ до 95 ГБ. Экономия была достигнута преимущественно за счет ускорения вычислений в слоях, преобразующих данные, а не в механизмах внимания.
Взгляд на будущее: триллион параметров
Техническая зрелость Olmo-core 3 была продемонстрирована на тестировании конфигураций с колоссальными объемами данных. Бенчмарки проводились на видеокартах NVIDIA B300, где система успешно обрабатывала модель общим объемом 1,2 триллиона параметров. При этом активными оставались 58,36 миллиарда параметров на токен при использовании 512 видеокарт. Максимальная наблюдаемая производительность составила 858 TFLOP/s на одну видеокарту.
Важно отметить, что эти тесты включали также эксперименты с DeepEP v2 — альтернативным протоколом передачи данных между экспертами. Результаты показывают возможность работы с моделями общим объемом до 2,38 триллионов параметров в рамках коротких тестов на пропускную способность, хотя полноценный процесс обучения таких моделей требует дальнейших исследований.
В отчете Allen AI также приводятся выводы, которые могут неочевидно влиять на практику разработки. Например, обнаружено явление, которое авторы назвали «гирмандерингом токенов» (failure token gerrymandering): использование метрик, поощряющих равномерное распределение нагрузки, может приводить к искажению реального распределения работы при росте масштаба модели. Также было выявлено, что простое наложение коммуникационных процессов на вычисления иногда замедляет общий процесс, а изменение скорости обучения экспертов не всегда дает ожидаемый эффект.
Olmo-core 3 открыта для всех исследователей и разработчиков. Она предоставляет гибкость для экспериментов с маршрутизацией и параллелизацией, а также адаптацию под различные типы аппаратного обеспечения. Этот стек станет фундаментом для следующего поколения моделей Olmo, которые планируется обучать на самых больших датасетах с расширенным контекстным окном.