MTPLX против oMLX: сравнение локальных ИИ-агентов на Mac M4 Max
Исследование производительности двух серверов для запуска локальных моделей — MTPLX и oMLX — на ноутбуке MacBook Pro с процессором M4 Max. Эксперимент подтвердил преимущество специализированной связки MTPLX с технологиями многотокенного предсказания (MTP), разрыв в скорости составил от 2,8 до 6,4 раз по сравнению со стандартной обвязкой oMLX.
# MTPLX против oMLX: одна модель, два сервера, разница в 3–6 раз
В первой части исследования мы протестировали локального кодового агента pi, использующего модель Qwen3.8-27B через сервер MTPLX. Теперь стоит вопрос: насколько существенный разрыв во времени объясняется именно технологией многотокенного предсказания (Multi-Token Prediction, MTP), или же он является следствием архитектуры сервера в целом? Под угрозой стоит популярный совет из обществ: использовать oMLX как более быстрый и качественный выбор для Apple Silicon.
Цель эксперимента — проверить, как ведет себя та же модель Qwen3.8-27B и тот же агент на альтернативном сервере oMLX. Для тестов использовался MacBook Pro с чипом M4 Max и 128 ГБ памяти.
Сравнение скорости и качества выполнения задач
Для проверки производительности была выполнена одна и та же задача: написание интерпретатора выражений minicalc с нуля на основе спецификации. Агент должен был написать код и успешно пройти 24 видимых теста, а также 30 скрытых тестов, о которых он не знал заранее.
Сборки моделей differed в реализации, но базовая архитектура и размер весов (4 бита) были схожи: - MTPLX: вес модели 20,7 ГБ. Включает специальные головы для MTP (глубина черновика D3). - oMLX: вес модели 16,1 ГБ. Не использует MTP-головы для этой сборки.
Результаты показывают значительное преимущество MTPLX во времени выполнения: - Режим medium (умолчание MTPLX): MTPLX справился за 10–16 минут в среднем, тогда как oMLX потратил 37,5 минут. Разница составила почти 2,8 раза. - Режим xhigh (высокие размышления): MTPLX завершил задачу за 14,5 минуты, oMLX — за 92,8 минуты. Разница достигла 6,4 раз. - Режим low (низкие размышления): MTPLX потратил 18,3 минуты, oMLX — 72 минуты. Разница — около 3,9 раз.
Важно отметить, что в режимах с включенными размышлениями (medium, xhigh, low) обе связки успешно прошли все 30 скрытых тестов. Это указывает на то, что разницу во времени определяет скорость генерации, а не качество логики агента.
Попытка отключить размышления (off) показала катастрофические результаты. На MTPLX работа оборвалась на 8,5 минуты из-за того, что код не мог быть импортирован. На oMLX агент ушел в бесконечный цикл и завис тестовый процесс на 68 минут. Вывод: для сложных логических задач режим без размышлений неприменим.
Почему возник такой разрыв?
Автоматически приписывать весь разрыв технологии MTP нельзя. При анализе траектории работы агента на сервере oMLX стало заметно, что в режиме xhigh агент совершал значительно больше действий: - Количество вызовов инструментов у oMLX выросло почти в 3 раза по сравнению с MTPLX. - Общее число сгенерированных токенов оказалось почти в два раза больше.
Часть времени оMLX уходит на обработку входного контекста и подготовку к генерации. Однако даже учитывая эти факторы, разрыв в 6,4 раза остается существенным свидетельством эффективности специализированной связки MTPLX на данном оборудовании.
Влияние режима охлаждения и потребления памяти
Шум и температура
Один из популярных вопросов пользователей касается громкости работы ноутбука. При тестировании MTPLX на максимуме (режим turbo) вентиляторы достигали 7800 об/мин, температура поднималась до 107 °C. В режиме default под управлением macOS обороты снижались на треть, но скорость генерации тоже падала примерно на 30%.
Сервер oMLX в рамках данного эксперимента не подвергался отдельному замеру температур и шума, однако по общей логике архитектуры MLX можно предположить схожий профиль работы. Ограничение скорости на Mac часто связано именно с тепловым пакетом, а не с вычислительной мощностью ядра.
Расход памяти Для задачи с генерацией до 40 тысяч токенов используется окно контекста в 262 144 токена. Расходы памяти зависят от формата кеша внимания (KV-cache): - Один токен занимает около 64 КБ. - Полный контекст (262 тыс. токенов) требует примерно 16 ГБ памяти.
При работе с oMLX процесс занимал в среднем 18 ГБ, на пике достигая 21 ГБ. Для MTPLX расчетный расход также составляет около 26 ГБ с учетом служебных буферов. На ноутбуке Mac с 24 ГБ оперативной памяти такая нагрузка критична: GPU получает от 16 до 18 ГБ, чего достаточно, но без запаса. Модели большего размера или с более широким контекстом могут не поместиться.
Выводы
Сравнение двух серверов показало, что выбор oMLX как более быстрого решения для Mac M4 Max не подтвердился в данной конфигурации. Напротив, связка MTPLX с технологиями MTP показала превосходство в скорости обработки задач от 2,8 до 6,4 раз.
Качество работы агента и способность проходить сложные тесты были сопоставимы: обе связки справились с заданием на 100%. Разница заключалась исключительно в эффективности использования вычислительного ресурса при генерации.
Рекомендации по настройке: 1. Используйте режимы размышления (medium, xhigh) для кодинговых задач, так как отключение размышлений (off) приводит к зависанию агента. 2. Обращайте внимание на окно контекста в настройках oMLX, так как по умолчанию оно ограничено 32 768 токенами. 3. Для MacBook Pro с 24 ГБ памяти будьте осторожны с окном контекста и объемом весов модели.
В следующих исследованиях планируется протестировать модель Qwen3.8-Flash-Next на урезанной сборке и проверить работу с реальными репозиториями кода вместо синтетических задач.
*Примечание: Данный тест проводился на конкретной конфигурации железа и одной модели. Результаты могут отличаться на других устройствах или при использовании иных сборок LLM.*