16 июля Moonshot AI выпустила Kimi K3. Модель хорошо справляется со сложными задачами разработки, но из-за её масштаба каждый лишний шаг при исследовании репозитория обходится дорого.
В предварительном сравнении на RepoContextBench подключение CodeAlive к Kimi Code с Kimi K3 дало два результата:
- среднее время задачи сократилось на 31%;
- агент израсходовал на 28% меньше токенов.
Мы ещё проверяем эти прогоны, поэтому в открытом отчёте их пока нет.
На что уходит время
Kimi K3 — Mixture-of-Experts-модель с 2,8 трлн параметров и контекстным окном до миллиона токенов. На каждом токене она активирует 16 из 896 экспертов. Даже при такой разреженности Moonshot рекомендует как минимум 64 ускорителя для эффективного инференса. В справочнике моделей Kimi Code скорость K3 указана как обычная. Отдельного HighSpeed-варианта, который есть у Kimi K2.7 Code, для неё пока нет.
Скорость генерации — только часть ожидания. Перед ответом агент ищет термин, читает несколько файлов, определяет следующий шаг, уточняет запрос, а затем проверяет вызовы, реализации, конфигурацию и тесты.
Каждый цикл добавляет время работы инструментов, входные и reasoning-токены, а затем ещё один ответ модели. Контекстное окно в миллион токенов позволяет прочитать больше кода, но заполнять его широкой поисковой выдачей всё равно долго и дорого.
Как CodeAlive сокращает исследование
CodeAlive не заставляет K3 генерировать токены быстрее. Context Engine заранее обрабатывает репозиторий, после чего Kimi Code может:
- сориентироваться по Repository Ontology;
- сочетать семантический и точный поиск;
- пройти по вызовам, ссылкам, реализациям и наследованию;
- прочитать исходники, необходимые для ответа.
Рассуждает по-прежнему K3, но вместо восстановления структуры репозитория по именам файлов она получает небольшой набор полезных путей и связей.
RepoContextBench измеряет время и токены агента отдельно от модели-судьи. В нашем предварительном парном сравнении CodeAlive сократил среднее время задачи Kimi Code на 31%, а расход токенов агента — на 28% относительно соответствующего прогона K3 без CodeAlive.
Это не означает, что сама K3 генерирует на 31% быстрее. Быстрее заканчивается вся задача, потому что агент расходует меньше времени и контекста на поиск кода. Перед публикацией мы ещё проверяем качество ответов, ошибки и точную конфигурацию эксперимента.
Kimi Code поддерживает удалённые MCP-серверы по HTTP, поэтому CodeAlive работает рядом с его локальными инструментами. Подключение описано в гайде CodeAlive MCP, а текущая методика RepoContextBench опубликована на GitHub.