Kimi K3: анализ открытой модели весом 2,8 трлн параметров и её инфраструктуры
27 июля компания Moonshot AI обнародовала веса модели Kimi K3, обладающей 2,8 трлн параметров. Релиз сопровождали технический отчет и открытые инструменты обучения. Данная публикация раскрывает детали архитектуры, подтвержденные результаты независимых тестов, а также анализирует лицензионные условия и практические ограничения по ресурсам.
# Kimi K3: анализ открытой модели весом 2,8 трлн параметров и её инфраструктуры
27 июля Moonshot AI обнародовала веса модели Kimi K3, обладающей внушительными 2,8 трлн параметров. До этого момента модель была доступна исключительно через платный API. Вместе с весами в открытый доступ попали технический отчет и три внутренних инструмента, на которых строилось обучение системы. Ниже представлен разбор релиза: что подтверждено независимыми замерами, что остается заявлением разработчиков и на какие технические детали стоит обратить внимание перед внедрением.
Архитектура и архитектурные нововведения
Модель Kimi K3 построена на основе разреженной архитектуры Mix-of-Experts (MoE). При полном объеме в 2,8 трлн параметров, для обработки каждого токена активируется лишь 16 экспертов из общего числа 896. Это обеспечивает работу примерно 50 млрд параметров в момент генерации. Такая схема позволяет сохранять высокую емкость знаний при относительно низкой стоимости вычислений на шаг генерации.
В основу архитектуры заложены два ключевых решения: Kimi Delta Attention и Attention Residuals. Первое из них изменяет механизм обработки длинных последовательностей, исключая полностью мягкое внимание (softmax-attention) в некоторых слоях. Второе касается передачи информации через глубину сети.
Кроме архитектурных особенностей, Moonshot представила инфраструктурный стек:
* FlashKDA: CUDA-ядра, реализованные на основе CUTLASS, оптимизированные под Kimi Delta Attention. Заявленное ускорение обработки входного контекста составляет от 1,72 до 2,22 раза по сравнению с flash-linear-attention на GPU H20 (бенчмарк производителя). * MoonEP: библиотека для обмена данными между экспертами MoE при распределенном обучении. * AgentENV: платформа изолированных песочниц на базе Firecracker microVM, разработанная совместно с kvcache-ai. Она поддерживает дешевые снапшоты, паузу и ветвление окружений, что критически важно для обучения агентов с подкреплением в промышленных масштабах.
Независимые замеры и позиции в рейтингах
В индексе Artificial Analysis модель набрала 57 баллов, заняв четвертое место в общем зачете и первое среди всех моделей с открытыми весами. Контекст расстановки сил следующий:
* Модель уступает Claude Fable 5 и GPT-5.6 Sol. * На уровне Claude Opus 4.8 и GPT-5.5. * Значительно превосходит открытых конкурентов: GLM-5.2 (51 балл) и DeepSeek V4 Pro (44 балла).
На специализированных задачах прогресс очевиден: рейтинг Elo в GDPval v2 вырос с 1190 у версии K2.6 до 1668. На площадке LMArena Frontend Code Arena Kimi K3 заняла первое место, выиграв в слепых парных сравнениях по фронтенд-коду у Claude Fable 5 в 76% случаев. Важно отметить, что эта арена узко специализирована на фронтенд-задачах и не свидетельствует об общем интеллектуальном превосходстве.
Модель показывает высокий уровень интеллекта, сопоставимый с Opus 4.8 и GPT-5.5, что подтверждает заявленный рост эффективности. Однако, цифра о приросте в 2,5 раза по сравнению с K2 является внутренней оценкой Moonshot и пока не проверена независимыми лабораториями.
Ограничения развертывания и лицензия
Главным практическим ограничением является объем весов. Даже в формате MXFP4 (четырёхбитное представление) модель занимает около 1,4 ТБ. Развернуть такой весовый файл на стандартной рабочей станции невозможно. Речь идет о многокарточных серверных конфигурациях. Команды с ограниченными ресурсами, вероятно, будут использовать арендованные мощности. Поддержка модели на стороне провайдеров (Together AI, Fireworks, DigitalOcean, Nebius и др.) доступна с момента релиза.
Цена по API составляет 3 доллара за миллион входных токенов и 15 за миллион выходных. Для сравнения, полный прогон индекса Artificial Analysis на сторонних моделях обходится в среднем в 0,94 доллара за задачу, что сопоставимо с GPT-5.6 Sol.
Лицензионные условия также требуют внимания. В отличие от предыдущих моделей семейства Kimi под лицензией Modified MIT, K3 работает под собственной лицензией Moonshot с обязательным указанием авторства в отчетах. Это означает, что прямое использование модели в коммерческих продуктах без соглашения с Moonshot может потребовать получения отдельного лицензионного соглашения, особенно если речь идет о крупных провайдерах MaaS. Для команд с ограничениями по передаче данных (например, из-за геополитики или требований регуляторов) открытые веса снимают вопрос, который API не решал ни за какие деньги: модель работает в собственном контуре, и данные не покидают инфраструктуру пользователя.
На что смотреть в ближайшие месяцы
Короткий список метрик, по которым можно будет судить о реальном эффекте релиза:
1. Квантизация от сообщества. Если сообщество сможет успешно ужать модель до одной восьмикарточной ноды (например, с помощью квантизации в FP8 или INT8 без потери качества), круг тех, кто может её развернуть, вырастет на порядок. Если качественной квантизации не произойдет, открытость останется преимущественно для организаций, имеющих мощные стойки. 2. Независимое воспроизведение 2,5×. Пока это цифра из отчёта. Внешние замеры на сопоставимых бюджетах покажут, насколько Kimi K3 действительно меняет экономику обучения по сравнению с предшественником. 3. Ответ GLM и DeepSeek. Разрыв в 6 и 13 баллов индекса — это не пропасть, и оба конкурента работают в том же цикле выпусков. Необходимо будет посмотреть на следующие версии этих моделей. 4. Практика по лицензии. Как поведут себя MaaS-провайдеры и станет ли отдельное соглашение с Moonshot стандартной процедурой для крупных интеграторов.
Отдельный сценарий для команд с ограничениями по передаче данных
Открытые веса снимают вопрос, который API не решал ни за какие деньги. Модель в собственном контуре не отправляет запросы на внешние серверы, и обсуждение трансграничной передачи данных на этом заканчивается. Это делает модель привлекательной для организаций, работающих в юрисдикциях с жесткими требованиями к локализации данных.
Стоимость развертывания и вопросы к читателям
Ценой в 1,4 ТБ и стойку под неё. Отсюда главный вопрос к читателям:
Открытые веса, которые физически может развернуть пара сотен организаций в мире, — это про доступность или про репутацию и давление на цены закрытых API? И если вы уже гоняли K3 через API или у провайдеров: как она держится на длинном контексте ближе к верхней границе миллиона токенов и совпадают ли впечатления по фронтенд‑коду с результатами арены?
---
Ссылки по теме
* Kimi K3 на Hugging Face — веса и карточка модели * Репозиторий MoonshotAI/Kimi‑K3 — технический отчёт, код, ссылки на FlashKDA, MoonEP и AgentENV * Kimi K3 в Artificial Analysis — независимые замеры интеллекта, скорости и стоимости * Источник: Технический отчет Kimi K3 — Moonshot AI
Теги: kimi k3, kimi moonshot ai, открытые данные, moe, open source llm Хабы: Искусственный интеллект, Машинное обучение, Open source
Нравится 0 | Не нравится | Добавить в закладки 0 | Поделиться | Комментарии 0
Охват за 30 дней: 16K+ | Карма: STAS @stas-clear
---
*Авторы статьи приглашают читателей поделиться своим опытом работы с Kimi K3, особенно в части квантизации и развертывания на собственных серверах.*
*© 2006–2026, Habr. Все права защищены.