Kimi-K3 공개: 2.8조 파라미터·100만 토큰 오픈 MoE 에이전트 모델
문샷 AI가 개발한 2.8T 오픈 MoE 모델 'Kimi-K3'가 알리바바 클라우드에 론칭되었습니다. KDA·Gated MLA 기반 104B 활성 파라미터 구조와 100만 토큰 컨텍스트로 자율 리포지토리 엔지니어링을 지원합니다.
문샷 AI(Moonshot AI)가 개발한 총 2.8T(2조 8,000억) 파라미터 규모와 네이티브 100만 토큰 컨텍스트 윈도우를 갖춘 차세대 오픈 가중치 에이전트 모델 ‘Kimi-K3’가 2026년 9월 알리바바 클라우드(Alibaba Cloud) 및 Kimi 플랫폼에 라이브로 제공되기 시작했습니다.
이미지 출처: @alibaba_cloud on X / Moonshot AI
문샷 AI 기술 문서에 따르면 Kimi-K3는 오픈 모델 최초로 3T급 규모에 도달한 멀티모달 파운데이션 모델로, 대규모 리포지토리 전체를 단일 세션에 적재해 분석하고 터미널 도구 연동을 통해 복잡한 코드베이스 엔지니어링을 자율적으로 수행하도록 설계되었습니다. 모델 가중치를 오픈 소스로 배포함과 동시에 알리바바 클라우드 Model Studio 및 Kimi API 등 호스팅 서비스가 함께 가동되면서 프론티어급 에이전트 추론 환경을 다양한 경로로 활용할 수 있게 되었습니다.
2.8T 총 파라미터와 104B 활성 연산: KDA·Gated MLA 기반 MoE 아키텍처
Kimi-K3의 핵심 설계는 대규모 파라미터 풀과 실용적인 추론 효율성을 결합한 전문가 혼합(Mixture-of-Experts, MoE) 아키텍처에 있습니다.
모델은 총 93개의 레이어로 구성되어 있으며, 초입부의 1개 Dense 레이어와 이후 이어지는 92개의 MoE 레이어로 체계화되었습니다. 전체 파라미터 풀은 2.8T에 달하지만, 각 토큰 입력 시 전체 896개의 전문가 중 16개의 선택 전문가(Selected Experts)와 2개의 상시 공유 전문가(Shared Experts)만을 동적으로 호출합니다. 이를 통해 실제 토큰당 활성화되는 파라미터 연산량을 104B(1,040억) 수준으로 제어하여 처리 속도와 서빙 자원을 최적화했습니다.
어텐션 구조 역시 긴 시퀀스 연산 병목을 줄이기 위해 특화 구성되었습니다.
- 어텐션 레이어 복합 구성: 69개 레이어에 걸쳐 KDA(Kimi Delta Attention)를 배치하고, 24개 레이어에는 게이트 기반 다중 헤드 잠재 어텐션(Gated MLA)을 결합하여 키-값(KV) 캐시 메모리 부담을 완화했습니다.
- 차원 및 활성화 사양: 어텐션 히든 차원 7168, 96개의 어텐션 헤드, Latent MoE 차원 3584, 전문가당 히든 차원 3072를 채택했습니다. 여기에 SiTU-GLU 활성화 함수와 어텐션 레지듀얼(AttnRes) 기법을 적용했으며 160K 크기의 대규모 어휘 사전을 지원합니다.
100만 토큰 컨텍스트와 자율 리포지토리 엔지니어링 역량
Kimi-K3는 네이티브 100만 토큰(1,048,576 토큰) 컨텍스트 윈도우를 기본 지원하여, 외부 RAG 검색이나 인위적인 파일 분할 없이 대형 프로젝트 전체를 단일 세션에서 조망합니다.
수백 개 소스 파일로 구성된 모노레포를 적재한 뒤, 리포지토리 단위 이해, 다중 파일 간 교차 수정(cross-file edits), 빌드 검증 및 테스트 디버깅을 거쳐 결과물을 전달할 수 있습니다. 특히 장기 에이전트 세션(Long-Horizon Coding)에서 인간의 개입을 최소화하면서 셸 터미널 명령어를 직접 오케스트레이션하는 작업 흐름을 지원합니다.
문샷 AI와 기술 보고서가 명시한 실무 적용 영역은 다음과 같습니다.
- 시스템 및 하드웨어 프로그래밍: GPU 커널 최적화, 맞춤형 컴파일러 개발, 칩 설계(Chip Design) 보조 등 저수준 시스템 엔지니어링 작업에 투입 가능합니다.
- 비전 루프 기반 개발 및 지식 작업: 텍스트, 이미지, 비디오를 단일 모델에서 네이티브로 처리하여 게임 개발의 시각적 렌더링 루프 검증, CAD 자동화 스크립팅, 대화형 시각화 위젯 및 대시보드 제작을 엔드투엔드로 수행합니다.
배포 채널·인프라 제약 사항 및 100만 토큰 무료 체험
문샷 AI와 알리바바 클라우드는 연구자와 엔지니어가 작업 환경에 맞춰 Kimi-K3를 활용할 수 있도록 다각화된 온보딩 경로를 제공합니다.
오픈 가중치 연구를 위해 Hugging Face(moonshotai/Kimi-K3)와 GitHub 공식 리포지토리를 통해 모델 가중치와 기술 보고서가 공개되었습니다. 자체 인프라 구축이 부담스러운 환경을 위해 Kimi Web, Kimi Code, Kimi 공식 API는 물론 알리바바 클라우드 Model Studio를 통한 매니지드 호출 경로가 가동 중입니다. 론칭과 함께 100만 토큰 무료 체험 혜택이 제공됩니다.
도입 시 검토해야 할 실무적 제약 사항과 운영 기준은 다음과 같습니다.
- 자체 호스팅 하드웨어 요구량: 총 2.8T 파라미터(활성 파라미터 104B) 규모의 초대형 가중치를 로컬이나 온프레미스 클러스터에서 직접 호스팅하려면 고대역폭 VRAM을 탑재한 멀티 노드 고성능 GPU 인프라가 필수적입니다.
- 프론티어 모델 성능 비교: 공식 기술 보고서 평가에 따르면 오픈 모델 중에서는 최고 수준의 벤치마크를 기록했으나, 폐쇄형 상용 프론티어 모델(Claude Fable 5, GPT-5.6 Sol 등)과의 종합 성능 비교에서는 여전히 격차가 존재합니다.
- 프로모션 이후 API 비용 관리: 100만 토큰 무료 체험 종료 후 대규모 리포지토리를 연속 탐색하거나 장시간 에이전트 세션을 운영할 경우 토큰 소비량에 비례해 API 비용이 발생하므로 세션별 컨텍스트 캐싱 및 호출 제어가 필요합니다.