LiquidAI · LLM · Quantization · Edge AI · HuggingFace · QAD · GGUF · Local AI20 августа в 04:32 · 3 мин

Компания LiquidAI выпустила модели LFM2.5 с квантованием, сохраняющие высокую точность

Команда LiquidAI представила обновленные 4-битные контрольные точки (checkpoints) серии LFM2.5, разработанные с использованием метода дистилляции с осознанным квантованием (QAD). Данная технология позволяет запускать модели меньших размеров на периферийном оборудовании, обеспечивая производительность, сопоставимую с более высокими форматами квантования, при этом сохраняя скорость декодирования, характерную для нативного 4-битного сжатия.

# LFM2.5 Q4_0: Новый стандарт для локального ИИ на периферийных устройствах

Компания LiquidAI объявила о публикации четырех новых контрольных точек моделей серии LFM2.5. Эти модели оптимизированы для работы на устройствах с ограниченными ресурсами, таких как ноутбуки и мобильные телефоны, не жертвуя при этом уровнем интеллекта.

Что такое QAD и почему это важно

В основе обновления лежит технология Quantization-Aware Distillation (QAD) — дистилляция с осознанным квантованием. Чтобы понять суть, нужно разделить два понятия.

Квантование (Quantization) — это процесс снижения битовой глубины весов модели. Если представить модель как сложную карту, где каждый узел имеет точное значение, то квантование округляет эти значения до меньшего числа бит (в данном случае до 4 бит). Это резко сокращает размер файла и потребление памяти, но традиционно ведет к потере точности. Обычное пост-обучение квантования (PTQ) часто не может полностью компенсировать эти потери.

Дистилляция — это процесс обучения маленькой модели («ученика») на основе большой модели («учителя»), чтобы передать ей знания.

Метод QAD объединяет эти подходы: модель обучается с уже включенным процессом округления весов. Это позволяет «ученику» (модели с квантованными весами) заранее адаптироваться к потерям точности, сохраняя при этом высокую эффективность.

Результаты тестирования: баланс скорости и точности

Команда LiquidAI провела сравнительный анализ новых Q4_0 контрольных точек против традиционных методов квантования. Тесты охватывают четыре модели разной емкости: LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct и LFM2.5-2.6B.

Испытания проходили на реальных устройствах: * GPU-архитектуры: MacBook Pro и NucBox EVO-X2. * CPU-архитектуры (ARM): Samsung Galaxy S26 Ultra и Raspberry Pi 5.

В результате применения QAD достигнуты следующие показатели: * LFM2.5-230M и LFM2.5-350M: Новая точность Q4_0 сопоставима с качеством Q5_K_M при увеличении скорости декодирования на 33% и 4% соответственно. * LFM2.5-1.2B-Instruct и LFM2.5-2.6B: Показатели Q4_0 приближаются к качеству Q4_K_M, а скорость декодирования повышается на 14% и 3%.

Кроме того, модели демонстрируют восстановление 97% точности, которая обычно теряется при переходе от формата BF16 (высокоточный стандарт) к квантованному формату. Бенчмарки включают сложные задачи: логическое мышление (GPQA Diamond, MMLU-Pro), использование инструментов (IFEval, IFBench) и агентское поведение.

Как использовать новые модели

Новые файлы доступны на платформе Hugging Face в форматах GGUF, совместимых с популярным движком llama.cpp. Пользователи могут запускать модели локально без необходимости подключаться к удаленным серверам.

Для запуска используется стандартная командная строка. Пример команды для модели среднего размера:

bash llama-cli -hf LiquidAI/LFM2.5-350M --hf-file LFM2.5-350M-QAD-Q4_0.gguf -p "Что такое C. elegans?"

Это позволяет разработчикам интегрировать мощные языковые модели прямо в приложения для мобильных устройств или локальные сети, обеспечивая конфиденциальность данных и автономную работу.

Где найти модели

Полные списки весов и документации доступны на репозитории LiquidAI в Hugging Face: * [LFM2.5-230M](https://huggingface.co/LiquidAI/LFM2.5-230M-GGUF) * [LFM2.5-350M](https://huggingface.co/LiquidAI/LFM2.5-350M-GGUF) * [LFM2.5-1.2B-Instruct](https://huggingface.co/LiquidAI/LFM2.5-1.2B-Instruct-GGUF) * [LFM2.5-2.6B](https://huggingface.co/LiquidAI/LFM2.5-2.6B-GGUF)

Компания отмечает, что эти достижения делают возможным развертывание интеллектуальных агентов непосредственно на клиентском оборудовании, что является ключевым трендом развития периферийного ИИ.

Первоисточники

Hugging Face Blog
← Вернуться в эфир