ИИ · MLX · MTPLX · M4 Max · LLM · Оптимизация · Машинное обучение · Apple Silicon3 октября в 12:33 · 5 мин

MTPLX против oMLX: сравнение локальных ИИ-агентов на Mac M4 Max

Исследование производительности двух серверов для запуска локальных моделей — MTPLX и oMLX — на ноутбуке MacBook Pro с процессором M4 Max. Эксперимент подтвердил преимущество специализированной связки MTPLX с технологиями многотокенного предсказания (MTP), разрыв в скорости составил от 2,8 до 6,4 раз по сравнению со стандартной обвязкой oMLX.

# MTPLX против oMLX: одна модель, два сервера, разница в 3–6 раз

В первой части исследования мы протестировали локального кодового агента pi, использующего модель Qwen3.8-27B через сервер MTPLX. Теперь стоит вопрос: насколько существенный разрыв во времени объясняется именно технологией многотокенного предсказания (Multi-Token Prediction, MTP), или же он является следствием архитектуры сервера в целом? Под угрозой стоит популярный совет из обществ: использовать oMLX как более быстрый и качественный выбор для Apple Silicon.

Цель эксперимента — проверить, как ведет себя та же модель Qwen3.8-27B и тот же агент на альтернативном сервере oMLX. Для тестов использовался MacBook Pro с чипом M4 Max и 128 ГБ памяти.

Сравнение скорости и качества выполнения задач

Для проверки производительности была выполнена одна и та же задача: написание интерпретатора выражений minicalc с нуля на основе спецификации. Агент должен был написать код и успешно пройти 24 видимых теста, а также 30 скрытых тестов, о которых он не знал заранее.

Сборки моделей differed в реализации, но базовая архитектура и размер весов (4 бита) были схожи: - MTPLX: вес модели 20,7 ГБ. Включает специальные головы для MTP (глубина черновика D3). - oMLX: вес модели 16,1 ГБ. Не использует MTP-головы для этой сборки.

Результаты показывают значительное преимущество MTPLX во времени выполнения: - Режим medium (умолчание MTPLX): MTPLX справился за 10–16 минут в среднем, тогда как oMLX потратил 37,5 минут. Разница составила почти 2,8 раза. - Режим xhigh (высокие размышления): MTPLX завершил задачу за 14,5 минуты, oMLX — за 92,8 минуты. Разница достигла 6,4 раз. - Режим low (низкие размышления): MTPLX потратил 18,3 минуты, oMLX — 72 минуты. Разница — около 3,9 раз.

Важно отметить, что в режимах с включенными размышлениями (medium, xhigh, low) обе связки успешно прошли все 30 скрытых тестов. Это указывает на то, что разницу во времени определяет скорость генерации, а не качество логики агента.

Попытка отключить размышления (off) показала катастрофические результаты. На MTPLX работа оборвалась на 8,5 минуты из-за того, что код не мог быть импортирован. На oMLX агент ушел в бесконечный цикл и завис тестовый процесс на 68 минут. Вывод: для сложных логических задач режим без размышлений неприменим.

Почему возник такой разрыв?

Автоматически приписывать весь разрыв технологии MTP нельзя. При анализе траектории работы агента на сервере oMLX стало заметно, что в режиме xhigh агент совершал значительно больше действий: - Количество вызовов инструментов у oMLX выросло почти в 3 раза по сравнению с MTPLX. - Общее число сгенерированных токенов оказалось почти в два раза больше.

Часть времени оMLX уходит на обработку входного контекста и подготовку к генерации. Однако даже учитывая эти факторы, разрыв в 6,4 раза остается существенным свидетельством эффективности специализированной связки MTPLX на данном оборудовании.

Влияние режима охлаждения и потребления памяти

Шум и температура Один из популярных вопросов пользователей касается громкости работы ноутбука. При тестировании MTPLX на максимуме (режим turbo) вентиляторы достигали 7800 об/мин, температура поднималась до 107 °C. В режиме default под управлением macOS обороты снижались на треть, но скорость генерации тоже падала примерно на 30%.

Сервер oMLX в рамках данного эксперимента не подвергался отдельному замеру температур и шума, однако по общей логике архитектуры MLX можно предположить схожий профиль работы. Ограничение скорости на Mac часто связано именно с тепловым пакетом, а не с вычислительной мощностью ядра.

Расход памяти Для задачи с генерацией до 40 тысяч токенов используется окно контекста в 262 144 токена. Расходы памяти зависят от формата кеша внимания (KV-cache): - Один токен занимает около 64 КБ. - Полный контекст (262 тыс. токенов) требует примерно 16 ГБ памяти.

При работе с oMLX процесс занимал в среднем 18 ГБ, на пике достигая 21 ГБ. Для MTPLX расчетный расход также составляет около 26 ГБ с учетом служебных буферов. На ноутбуке Mac с 24 ГБ оперативной памяти такая нагрузка критична: GPU получает от 16 до 18 ГБ, чего достаточно, но без запаса. Модели большего размера или с более широким контекстом могут не поместиться.

Выводы

Сравнение двух серверов показало, что выбор oMLX как более быстрого решения для Mac M4 Max не подтвердился в данной конфигурации. Напротив, связка MTPLX с технологиями MTP показала превосходство в скорости обработки задач от 2,8 до 6,4 раз.

Качество работы агента и способность проходить сложные тесты были сопоставимы: обе связки справились с заданием на 100%. Разница заключалась исключительно в эффективности использования вычислительного ресурса при генерации.

Рекомендации по настройке: 1. Используйте режимы размышления (medium, xhigh) для кодинговых задач, так как отключение размышлений (off) приводит к зависанию агента. 2. Обращайте внимание на окно контекста в настройках oMLX, так как по умолчанию оно ограничено 32 768 токенами. 3. Для MacBook Pro с 24 ГБ памяти будьте осторожны с окном контекста и объемом весов модели.

В следующих исследованиях планируется протестировать модель Qwen3.8-Flash-Next на урезанной сборке и проверить работу с реальными репозиториями кода вместо синтетических задач.

*Примечание: Данный тест проводился на конкретной конфигурации железа и одной модели. Результаты могут отличаться на других устройствах или при использовании иных сборок LLM.*

Первоисточники

Habr AI ↗
← Вернуться в эфир