Moonshot AI представила Kimi K3: анализ архитектуры и производительности
27 июля компания Moonshot AI сделала доступными веса своей мультимодальной MoE-модели Kimi K3, ранее функционировавшей исключительно через платный API. Этот релиз сопровождался публикацией технического отчета и трех внутренних инструментов, использованных для обучения модели. Kimi K3 представляет собой масштабную архитектуру с 2,8 триллионами параметров, из которых 104 миллиарда активируются при обработке каждого токена.
Архитектурные особенности и инновации Kimi K3
Согласно техническому блогу Moonshot AI, архитектура Kimi K3 является результатом комплексного проектирования, где все компоненты разрабатывались взаимосвязанно. Ключевые инновации включают:
- Гибридная система внимания: Сочетание Kimi Delta Attention и глобального MLA (Multi-Layer Attention).
- Attention Residuals: Механизм для повышения стабильности и производительности.
- MoE на 896 экспертов: Архитектура Mixture-of-Experts с впечатляющим числом экспертов для эффективной обработки данных.
- Обучение длинных агентных траекторий: Специализированные методы обучения для работы с продолжительными последовательностями задач.
- Отдельная система кеширования: Оптимизированное кеширование для улучшения скорости и эффективности.
Эти решения направлены на повышение возможностей модели в различных сценариях, хотя, как признает Moonshot AI в своем отчете, средняя производительность Kimi K3 уступает моделям Claude Fable 5 и GPT-5.6 Sol.
Результаты тестирования и бенчмаркинг
Moonshot AI опубликовала результаты Kimi K3 на бенчмарках для программирования и агентных задач. В некоторых специфических тестах, касающихся программирования и работы с инструментами, K3 продемонстрировала превосходство над такими моделями, как Claude Opus 4.8, GPT-5.5, GPT-5.6 Sol и Claude Fable 5. Однако важно отметить, что эти отдельные успехи не отражают общую картину.
Независимые проверки производительности Kimi K3 проводились на 204 задачах бенчмарков PAC1 и ECOM1, имитирующих реальные рабочие операции с файлами, счетами, корзинами, платежами, возвратами и отчетами. Модель набрала 61/104 на PAC1 и 44,75/100 на ECOM1. Анализ отказов выявил повторяющиеся проблемы, такие как:
- Нарушение точной схемы.
- Частично выполненные транзакции.
- Ошибки при работе с длинными таблицами.
- Неоптимальные маршруты выполнения задач.
- Пропущенные проверки доверия.
Все запуски и трассы успешных и неудачных задач доступны для публичной проверки, что позволяет получить более полное представление о реальных возможностях и ограничениях Kimi K3. PROSTO24 продолжит следить за развитием и внедрением этой значимой модели.
Попробовал Kimi K3, впечатления смешанные. С одной стороны, для программирования и специфических агентных задач она действительно выдает неплохие результаты, иногда даже лучше, чем ожидал. Особенно хорошо справляется с генерацией кода по заданным условиям. Но вот с длинными таблицами и многошаговыми транзакциями, как и пишут, есть проблемы – часто путается или пропускает шаги. Мой совет: для критичных задач лучше разбивать их на мелкие подзадачи, тогда K3 справляется гораздо стабильнее.