논문Hugging Face
Kimi K3: Open Frontier Intelligence
논문 ID: 2607.24653247 추천
#MoE#Agent#Coding#Long-Context#Vision#Reasoning#Evaluation
핵심 요약
2.8T 파라미터 규모의 MoE 모델로, 100만 토큰 컨텍스트와 강력한 에이전트/코딩 능력을 갖춘 오픈 소스 프론티어 모델
상세 내용
기존 모델의 스케일링 효율성과 긴 컨텍스트 처리 능력을 개선하기 위해 Kimi K3를 개발했습니다. Kimi Delta Attention과 Attention Residuals를 통해 정보 내용을 최적화하고, Stable LatentMoE를 도입하여 효율적인 전문가 활성화를 구현했습니다. 또한 에이전트 및 코딩 도메인에 특화된 강화학습(RL)과 데이터 레시피를 적용했습니다. 그 결과 Kimi K2 대비 2.5배의 스케일링 효율 향상을 달성하며 코딩, 에이전트, 비전 등 다양한 작업에서 프론티어급 성능을 확보했습니다. 최종적으로 모델 가중치를 공개하여 연구 및 배포 가속화를 목표로 합니다.
주요 내용
- 2.8T 파라미터 MoE 구조 및 104B 활성 파라미터 설계
- KDA(Kimi Delta Attention)와 Stable LatentMoE를 통한 스케일링 효율 2.5배 향상
- 100만 토큰 컨텍스트와 에이전트/코딩 특화 강화학습(RL) 적용
실무에서 볼 만한 점
대규모 컨텍스트와 에이전트 능력을 갖춘 오픈 모델로서, 복잡한 코딩 작업 및 장기 실행(Long-horizon) 작업 자동화에 즉시 활용 가능합니다.
참고할 행동
- 100만 토큰 컨텍스트를 활용한 대규모 코드베이스 분석 실험
- 에이전트 워크플로우 내에서의 추론 및 실행 능력 검증
- 기존 모델 대비 코딩 및 비전 작업의 성능 벤치마크 비교