Kimi K3 Open Weights 정식 공개: 2026년 7월 27일 Hugging Face 전체 가중치 및 셀프호스트 가이드
7월 16일 Kimi K3 API 리뷰 이후 의사결정 초점은 2026년 7월 27일 Hugging Face 전체 가중치(Modified MIT) 공개로 이동했습니다. AI 인프라 담당자를 위해 타임라인, 2.8T 아키텍처, 벤치 승패, AA Index 3위, API $3/$15, 1.4TB 셀프호스트, API vs 자체 3시나리오, 릴리스 체크리스트, 5단 Runbook, FAQ를 다룹니다.
목차
페인 포인트: 7월 27일 이후 모델 선型을 재검토해야 하는 이유
- 오픈/클로즈드 지능 격차 실질적 해소: K3는 Artificial Analysis Intelligence Index v4.1에서 57.1점, 189개 모델 중 3위. Claude Fable 5(59.9)와 격차 2.8점. 전체 가중치 공개 후 클로즈드 API vs 약한 OSS 이분법에서 벗어납니다.
- 셀프호스트 비용 과소평가: 2.8T 4-bit 양자화에도 1.4TB와 64+ 가속기 필요. WAIC 이후 노트북·일반 VPS로는 불가능함을 깨닫는 팀이 늘고 있습니다.
- 단일 벤더 정책·환각 리스크: 7월 1일 Anthropic 미국籍 제한이 90분 내 API 가용성에 영향. Moonshot도 K3는 K2.6 대비 환각률 상승, 문체 안정성은 Fable/Sol에 미달한다고 인정.
1. 릴리스 타임라인
| 날짜 | 이벤트 | 의미 |
|---|---|---|
| 7월 16일 | API 문서에 Kimi K3上线, kimi-k3 즉시 호출 | 대규모 발표 없이 개발자 우선 |
| 7월 17–20일 | WAIC 2026 | 중국 AI 동시기: GLM-5.2, DeepSeek V4, MiniMax |
| 7월 27일 | HF 전체 가중치, Modified MIT, 기술 보고서, vLLM KDA/prefix caching | 최초 2T+ 다운로드 가능 open weights |
| 7월 27일+ | Ollama / GGUF 커뮤니티 양자화 | 소비자 PoC, 프로덕션 전량 아님 |
2. 7월 27일 공개 항목
- Hugging Face 전체 가중치: 2.8T, MXFP4/MXFP8, 양자화 친화적;
- Modified MIT: 연구·상업 허용, Moonshot 브랜드·안전 조항;
- 기술 보고서: KDA, AttnRes, Stable LatentMoE, Quantile Balancing, Per-Head Muon, SiTU;
- vLLM Day-0: KDA + prefix caching, 1M 토큰 디코딩 최대 6.3×;
- Ollama/GGUF: 수일 내 커뮤니티 버전, 전체 2.8T는 Mac/노트북 부적합.
Moonshot은 기술 보고서에서 종합 3위를 솔직히 인정: 「K3가 세계 최강은 아니지만, open weights로는 클로즈드 최전선에 가장 가깝다.」
3. 아키텍처 사양
| 항목 | 상세 |
|---|---|
| 총 파라미터 | 2.8조(2.8T) |
| MoE | Stable LatentMoE: 896 experts / 16 active |
| 어텐션 | KDA + AttnRes + Gated MLA |
| 컨텍스트 | 1,048,576 tokens (1M) |
| 모달리티 | 텍스트, 이미지, 비디오 |
| 학습 정밀도 | MXFP4 weights, MXFP8 activations |
| K2 대비 | 스케일링 효율 약 2.5× |
| KDA 디코딩 | 1M에서 최대 6.3×, KV 캐시 75% 절감 |
4. 벤치마크: 승리와 패배
| 벤치 | K3 | Fable 5 | Sol | 해석 |
|---|---|---|---|---|
| Frontend Code Arena | #1 | — | — | 프론트엔드 1위 |
| Automation Bench | 30.8 | 29.1 | 29.7 | 자동화 1위 |
| SpreadsheetBench 2 | 선두 | — | — | 스프레드시트 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 브라우징 1위 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 장코드 대폭 선두 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 터미널 Sol 근접 |
| Program Bench | 77.8 | 76.8 | 77.6 | 프로그램 1위 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 복잡 Repo Fable |
| DeepSWE | 67.5 | 70.0 | 73.0 | 깊은 버그 Sol |
| GDPval v2 Elo | 열세 | 선두 | 선두 | 종합 Elo 약점 |
약점(자인): K2.6 대비 환각률 상승, 문체·안정성 Fable/Sol 미달. 벤더 자체 보고.
5. AA Intelligence Index 및 API 가격
| 모델 | AA Index | 순위 | 입력 $/M | 출력 $/M | 캐시 |
|---|---|---|---|---|---|
| Claude Fable 5 | 59.9 | 1 | — | — | — |
| GPT-5.6 Sol | 58.9 | 2 | — | — | — |
| Kimi K3 | 57.1 | 3 / 189 | $3.00 | $15.00 | $0.30 |
Artificial Analysis 단일 태스크: K3 약 $0.94, Fable 5 대비 65.8% 저렴.
6. 셀프호스트 요건
- 4-bit: 약 1.4TB (K2.7 Code INT4 ~577GB 참고);
- 프로덕션: 64+ 가속기 슈퍼노드;
- vLLM KDA + prefix caching Day-0.
인용 가능 기술 정보 (EEAT)
- 2.8T 최대 다운로드 open weights, DeepSeek V4 Pro 대비 75%↑.
- 896 중 16 활성, Quantile Balancing.
- 1M 고정 $3/$15, KDA 6.3× 디코딩.
- AA 단일 태스크 $0.94, Fable 대비 65.8%↓.
- Moonshot AA 3위 공개 인정.
7. API vs 자체: 3시나리오
| 시나리오 | 권장 | 이유 |
|---|---|---|
| 스타트업 / PoC | API / OpenRouter | CapEx 제로 |
| 중형 / 혼합 | API + Fable/Sol | 역할별 라우팅 |
| 대기업 / 데이터 미반출 | 64+ GPU 자체 + API 백업 | Modified MIT 상업 허용 |
8. 산업·지정학
WAIC 2026에서 중국 AI(Moonshot, GLM-5.2, DeepSeek V4, MiniMax) 집중 공개. open/closed 격차 2026년 중 실질적 해소. K2→K2.5→K3는 Moonshot 컴백 아크.
9. 릴리스 체크리스트
10. 5단 Runbook
11. FAQ
Q: 가중치 공개일?
A: 2026년 7월 27일.
Q: 필요 HW?
A: 4-bit 1.4TB + 64+ GPU.
Q: API vs 자체?
A: 저중流量 API; 대기업만 자체.
Q: 종합 순위?
A: AA 57.1, 189개 중 3위.
Q: Ollama?
A: 7/27 후 수일 내 GGUF.
Q: 7/16 리뷰 차이?
A: 리뷰=API; 본문=7/27 가중치.
결론
7월 27일 Kimi K3 open weights는 2T+·AA 3위·Modified MIT의 첫 조합입니다. 대부분 팀에게 API + 하이브리드가 Q3 2026 현실解입니다.
그러나 K3 Agent를 노트북·Linux VPS·macOS 없는 CI에서 돌리면 장루프 중단, API Key 혼재, Xcode/Fastlane 동기 불가 문제가 남습니다. 7×24 Kimi Code + K3와 iOS 서명·OpenClaw가 필요하면 VPSMAC M4 Mac 클라우드가 더 안정적입니다.
관련: Kimi K3 심층 리뷰 (7/16) · Kimi API
데이터 기준: 2026-07-22. 7/27 세부는 Hugging Face 공식 repo 우선.