Kimi K3는 오픈소스인가? Moonshot AI 2.8조 파라미터 모델 해설
짧은 답: 엄격한 정의로는 아니요 — Moonshot AI도 그렇게 주장하지 않습니다. 2026년 7월 27일 저녁, 중국 AI 연구소는 Kimi K3의 전체 가중치와 기술 보고서를 공개했습니다. 2.8조 파라미터 Mixture-of-Experts 모델로 100만 token 컨텍스트와 네이티브 시각 이해를 갖춥니다. 본 글은 아키텍처 혁신, 벤치마크 비교, 라이선스 조건, 자체 호스팅 한계, API 가격과 5단 통합 Runbook을 다룹니다.
목차
페인 포인트: K3 전체 공개 후 반드시 재검토해야 할 3가지
- 오픈소스 vs open weight 혼동: 중국 언론은 K3를 "완전 오픈소스"라고 광범위하게 보도하지만, Moonshot 공식 자료는 "open source"라는 표현을 한 번도 쓰지 않았습니다 — 일관되게 "open weight"라고 합니다. 법무팀이 OSI 기준으로 감사하면 모델을 잘못 분류할 수 있습니다: 학습 데이터와 전체 학습 코드는 공개되지 않았습니다.
- 라이선스의 2가지 새로운 상업적 게이트: K3는 K2 시대 Modified MIT 라이선스를 사용하지 않습니다. 완전 커스텀 문서로 이전에 없던 임계값이 신설되었습니다 — Model-as-a-Service 사업이 직전 12개월 2,000만 달러 초과, 또는 제품이 1억 MAU 초과 시 출시 전 법무 검토가 필요합니다.
- 자체 호스팅과 API 현실 간격: 2.8조 파라미터, 약 1.56TB 가중치, Moonshot 권장 64개 이상 가속기로 "가중치가 공개됨" ≠ "로컬에서 실행 가능"입니다. 대부분의 팀에게 현실적인 경로는 API 또는 OpenRouter입니다.
Kimi K3는 오픈소스인가, open weight인가?
Open Source Initiative(OSI) 정의에 따르면 진정한 오픈소스 모델에는 공개된 학습 데이터, 공개된 학습 코드, 재현 가능한 파이프라인이 필요합니다 — 학습된 가중치만으로는 부족합니다. Kimi K3는 가중치, 기술 보고서, 학습에 인접한 여러 인프라 도구를 제공하지만 학습 데이터와 전체 학습 코드는 제공하지 않습니다. 따라서 open-weight 모델입니다: 누구나 다운로드, 실행, 파인튜닝, 상업 배포는 가능하지만 Moonshot 외부에서는 처음부터 재현할 수 없습니다.
라이선스 자체도 K2 시리즈보다 강화되었습니다. "Modified MIT"가 아닌, 이전에 없던 2가지 상업적 임계값을 포함한 완전 커스텀 문서입니다:
- Model-as-a-Service 수익 게이트. 귀하 또는 관계사가 K3 기반 Model-as-a-Service 사업을 운영하고 직전 12개월 누적 2,000만 달러 초과 수익을 내면, 계속하기 전 Moonshot AI와 별도 상업 계약이 필요합니다.
- 표시 의무 게이트. 제품 또는 서비스가 월간 활성 사용자 1억 초과 또는 월간 수익 2,000만 달러 초과 시 제품 UI에 "Kimi K3"를 눈에 띄게 표시해야 합니다.
거의 모든 스타트업, 개인 개발자, 중소기업에게 두 임계값 모두 실무적 우려가 아닙니다 — 오늘 K3 위에서 상업 제품을 구축·출시할 수 있습니다. 실제로 중요한 조항은 첫 번째이며, Moonshot 자체 API와 직접 경쟁하는 형태로 K3 추론을 대규모 재판매하는 비즈니스 모델인 경우에만 해당됩니다.
Kimi K3 한눈에 보기
| 항목 | 값 |
|---|---|
| 총 파라미터 | 2.8조 |
| 활성 파라미터 | 약 1,040억 |
| 아키텍처 | Mixture-of-Experts (MoE) |
| 전문가 | 896 라우팅 전문가, 토큰당 16 활성화, 공유 전문가 포함 |
| 어텐션 메커니즘 | Kimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (MLA) |
| 컨텍스트 윈도우 | 1,000,000 token |
| 멀티모달 | 네이티브 시각 이해 (ViT-V2, 27층) |
| 가중치 형식 | MXFP4 가중치, MXFP8 활성화 (SFT 단계부터 양자화 인식 학습) |
| 다운로드 크기 | 약 1.56TB (Hugging Face) |
| 라이선스 | 커스텀 라이선스 — Moonshot은 "open weight"라고 부르며 "open source"라고 하지 않음 |
| 최초 제공 | 2026년 7월 16일 (API 전용) |
| 전체 가중치 공개 | 2026년 7월 27일 |
가중치와 함께 Moonshot은 K3 학습을 지탱한 3가지 인프라 기술 MoonEP, FlashKDA, AgentEnv를 공개했습니다. 이 출시로 K3는 역대 최대 규모의 완전 공개 open-weight 모델이 되었으며, 1.56TB 다운로드는 30분 이내 Hugging Face 트렌드 1위를 기록했습니다. Moonshot은 일관되게 "open-weight" 출시라고 부르며 "open source"라고 하지 않습니다.
아키텍처: KDA, Attention Residuals, Per-Head Muon이 실제로 하는 일
Kimi K3는 기존 레시피의 단순 확장이 아닙니다 — Moonshot은 딥러닝의 오랜 기본 3요소(어텐션, 잔차 연결, 옵티마이저)를 재구축했습니다.
Kimi Delta Attention (KDA): 채널별로 "망각"을 세분화
표준 Gated DeltaNet은 메모리 상태 전체에 단일 스칼라 망각 게이트를 적용합니다 — 전체가 동일 비율로 감쇠합니다. KDA는 채널 단위 게이팅으로 대체하여 각 특징 차원이 독립적인 감쇠율을 갖고, 일부 특징은 무기한 보존하면서 다른 특징은 적극적으로 망각합니다. chunkwise Diagonal-Plus-Low-Rank(DPLR) 공식으로 구현되어 시간에 대해 선형 재귀를 유지하면서 하드웨어 효율을 지킵니다. K3는 KDA 층과 소수의 전역 어텐션(Gated MLA) 층을 교차 배치 — 이 하이브리드 설계가 100만 token 컨텍스트를 지원하면서 KV 캐시 크기를 낮게 유지하는 핵심입니다.
Attention Residuals (AttnRes): 무엇을 남길지 선택하는 잔차 연결
표준 심층 네트워크에서 잔차 연결은 깊이가 증가할수록 각 층 출력을 균일하게 누적하고, 네트워크가 깊을수록 초기 층 정보가 희석됩니다. AttnRes는 균일 누적을 선행 모든 층의 선택적·입력 의존형 집계로 대체합니다. 오버헤드는 미미합니다: 층당 RMSNorm 1개와 pseudo-query 벡터 1개로 총 파라미터의 극히 일부입니다. 테스트에서 추가 비용 2% 미만으로 약 25% 학습 효율 향상. pseudo-query 벡터는 0으로 초기화되어 초기에는 균일 평균과 동등하며 초기 학습 불안정을 피합니다.
Per-Head Muon: 어텐션 헤드를 독립 최적화
Muon은 대규모 학습에서 널리 채택된 옵티마이저입니다. K3는 모델 전체를 균일 처리하지 않고 어텐션 헤드별로 동작하도록 확장하여 각 헤드에 더 적응적인 수렴 경로를 제공합니다. 순수 학습 시 기술로 API 호출자에게는 보이지 않지만, K3가 활성 파라미터 수 대비 폐쇄형 프론티어 모델에 맞서는 이유의 일부입니다.
Stable LatentMoE: 설계상 희소
K3 MoE 층은 896 전문가를 라우팅하고 토큰당 16개만 활성화 — 약 1.8% 희소성 — 공유 전문가로 기본 안정성 확보. 대규모에서 부하 불균형이 처리량을 저하시키는 것을 방지하기 위해 Moonshot은 Quantile Balancing을 적용하고 계산 랭크당 중복 전문가 수의 수학적 상한을 증명하여 항상 실행 가능한 균형 라우팅 계획을 보장합니다.
가중치만큼 중요한 3가지 인프라 공개
Moonshot은 모델 카드만 공개하지 않았습니다 — K3 학습을 가능하게 한 인프라 스택을 공개했으며, 개발자 커뮤니티의 높은 평가의 큰 이유입니다.
| 기술 | 역할 | 주요 수치 |
|---|---|---|
| MoonEP | 초대규모·세밀 MoE용 고성능 통신 라이브러리 | 과부하 전문가를 일시 복제하여 각 랭크에 균등 token 수 배분; 랭크당 중복 전문가 수 수학적 상한 증명, 부하 불균형에서도 효율 유지 |
| FlashKDA | Kimi Delta Attention의 CUTLASS 기반 커널 구현 (이전 공개) | NVIDIA H20에서 flash-linear-attention 기준 대비 1.72×–2.22× 빠른 prefill; chunk_kda 경유 드롭인 대체 백엔드 자동 디스패치, 코드 변경 불필요 |
| AgentEnv | KVCache.ai 공동 개발 Firecracker microVM 샌드박스 | 대규모 병렬 Agentic RL 학습용; 빠른 스냅샷, fork, 복원 지원. Moonshot 보고: checkpoint 지연 최저 133ms, 재개 지연 최저 49ms, 최대 6.5× 메모리 오버커밋 (제3자 독립 재현 미확인) |
벤치마크: Kimi K3 vs GPT-5.6, Claude, GLM-5.2
벤더 보고 수치는 평가 하네스마다 크게 다르므로, 아래는 가능한 한 독립 제3자 평가를 우선합니다.
SWE-bench Verified (독립 평가, Vals AI, 2026년 7월 기준)
| 모델 | 점수 | 출시일 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Artificial Analysis Intelligence Index (중립 제3자 종합 점수, max 추론)
- Claude Fable 5 (max + fallback): 60
- GPT-5.6 Sol (max): 59
- Kimi K3 (max): 약 57 — 종합 3위, open-weight 1위
- GLM-5.2 (max): 51 (이전 open-weight 1위)
- DeepSeek V4 Pro (max): 44
Kimi K3는 현재 raw 능력 기준 최강 open-weight 모델이지만 최저가는 아닙니다. Intelligence Index에서 작업당 약 $0.95 — Claude Fable 5(약 $2.40/작업)보다 약 60% 저렴하지만 동급 open-weight GLM-5.2(약 $0.47/작업)보다 비쌉니다. 요약하면: open-weight 계층의 능력 상한이지, 가성비 최우선 선택은 아닙니다. K3는 현재 Arena.ai Frontend Code Arena 리더보드에서도 1위입니다.
인용 가능한 기술 사실 (EEAT)
- 규모: 총 파라미터 2.8T, 활성 약 104B, 희소성 1.8% (896 전문가 중 16/token).
- 컨텍스트와 캐싱: 100만 token 컨텍스트; Mooncake 분리형 서빙은 일반 코딩 워크로드에서 캐시 히트율 90% 초과 보고.
- 독립 벤치마크: Vals AI SWE-bench Verified 93.4%; Artificial Analysis Intelligence Index 약 57, open-weight 1위, 종합 3위.
가격 및 자체 호스팅: 정말 직접 실행할 수 있나?
API 경유
Moonshot은 OpenAI SDK 호환 Chat Completions API를 https://api.moonshot.ai/v1에서 모델 ID kimi-k3로 제공 — 기존 통합의 대부분은 base URL과 API 키 변경만 필요합니다.
| Token 유형 | 100만 token당 가격 |
|---|---|
| 입력 (캐시 히트) | $0.30 |
| 입력 (캐시 미스) | $3.00 |
| 출력 (추론 trace 포함) | $15.00 |
Moonshot의 분리형 Mooncake 서빙 아키텍처는 일반 코딩 워크로드에서 캐시 히트율 90% 초과를 보고하며, 실제 사용의 대부분은 $3.00 표기보다 $0.30에 가까운 비용이 됩니다.
자체 호스팅
896 전문가에 걸친 2.8조 파라미터 K3는 일반 소비자용 또는 대부분의 프로슈머 하드웨어에서는 비현실적입니다. Moonshot은 64개 이상 가속기를 갖춘 슈퍼노드 구성 배포를 권장합니다. 개인 개발자와 대부분의 기업에게 현실적인 경로는 공식 API 또는 OpenRouter 같은 라우터를 통해 K3를 호출하는 것 — 7개 제공업체가 이미 호스팅 중이며 대부분 Moonshot 자체와 유사한 가격입니다.
큰 그림: 미중 AI 분쟁 속 Kimi K3
Kimi K3 open-weight 공개는 진공에서 일어나지 않았습니다. 세계 인공지능 대회(WAIC 2026) 기간 중 미중 "모델 증류" 분쟁이 급격히 격화된 직후입니다: 백악관 과학기술 고문 Michael Kratsios가 Moonshot의 Anthropic Fable 모델에 대한 "대규모·은밀한 산업 증류" 캠페인을 K3 학습에 사용했다고 비난했고, 미 재무장관 Scott Bessent가 제재와 Entity List 지정을 시사했습니다. 중국 상무부는 7월 28일 "AI 패권주의"를 비난하며 보복 조치를 경고했습니다. 이런 배경에서 전체 가중치·기술 보고서·3가지 인프라 기술 공개는 의도적 신호로 읽힙니다 — Moonshot은 엔지니어링을 상세히 보여주는 것이 방법론에 대한 의문에 답하는 가장 명확한 방법이라고 판단합니다. K3 출시 3일 후 Moonshot 투자자 중 하나인 Alibaba가 2.4조 파라미터 Qwen3.8-Max-Preview를 발표하여 K3에 대한 직접 대응으로 널리 해석되며, open-weight 경쟁은 "3T 클럽"이라 불리는 단계에 진입했습니다.
5단 통합 Runbook
FAQ
Kimi K3는 오픈소스인가요?
아니요, OSI의 엄격한 정의에는 해당하지 않습니다. open-weight 모델입니다: 학습된 가중치, 기술 보고서, 일부 인프라 도구는 공개되었지만 학습 데이터와 전체 학습 코드는 공개되지 않았습니다. Moonshot도 자료에서 "open weight"라고 표기하며 "open source"라고는 하지 않습니다.
Kimi K3를 무료로 상업적으로 사용할 수 있나요?
예, 대부분의 사용 사례에서 가능합니다. 제한이 적용되는 경우는 K3 기반 Model-as-a-Service 사업이 직전 12개월 2,000만 달러 초과 수익(Moonshot과 별도 계약 필요), 또는 제품이 월간 활성 사용자 1억 초과·월간 수익 2,000만 달러 초과(UI에 "Kimi K3" 표시 필요)인 경우뿐입니다.
Kimi K3 자체 호스팅에 얼마나 많은 VRAM/하드웨어가 필요한가요?
Moonshot은 64개 이상 가속기를 갖춘 슈퍼노드 구성을 권장합니다. 일반 소비자용 또는 대부분의 프로슈머 하드웨어에서는 현실적이지 않습니다. 대부분의 개발자는 공식 API나 OpenRouter 같은 호스팅 제공업체를 사용해야 합니다.
Kimi K3는 GPT-5.6, Claude와 비교해 어떤가요?
독립 SWE-bench Verified 점수(93.4% vs 95–97%)에서는 Claude Opus 5, GPT-5.6 Sol, Claude Fable 5에 약간 뒤처지지만 Artificial Analysis Intelligence Index에서 종합 3위이며, GLM-5.2, DeepSeek V4 Pro를 앞서는 최강 open-weight 모델입니다.
Kimi K3와 Kimi K2의 차이는 무엇인가요?
K3는 K2.5의 약 3배 파라미터, 아키텍처에 Attention Residuals와 Per-Head Muon 추가, 컨텍스트 윈도우와 멀티모달 능력 대폭 확장. 라이선스에도 K2 시리즈에 없던 Model-as-a-Service 수익 임계값이 신설되어 상업 조건이 더 세분화되었습니다.
요약
Kimi K3 전체 open-weight 공개는 중국 프론티어 모델의 새 단계 — "API 이용 가능"에서 "엔지니어링 세부사항 감사 가능"으로 — 를 표시합니다. KDA, AttnRes, Per-Head Muon, Stable LatentMoE의 진정한 아키텍처 혁신, 폐쇄형 프론티어 모델 대비 경쟁력 있는 벤치마크, MoonEP/FlashKDA/AgentEnv 3가지 공개 인프라를 제공합니다. 그러나 open weight는 OSI 오픈소스가 아니며, 커스텀 라이선스의 2가지 상업적 게이트는 신중한 법무 검토가 필요합니다.
Kimi K3 Agent를 개인 노트북이나 일반 Linux VPS에서만 운영하면 슬립으로 인한 긴 루프 중단, API 키와 프로덕션 코드베이스 혼재, Apple 툴체인(Xcode, Fastlane, notarytool)을 동일 머신에서 다룰 수 없는 등의 한계가 있습니다. 7×24 무인 Agent — Kimi Code에서 K3를 실행하면서 iOS CI나 OpenClaw 게이트웨이도 처리해야 하는 — 팀에게 VPSMAC M4 Mac 클라우드 노드 임대(네이티브 macOS, SSH + launchd 데몬, 개발 도구와 동일 네트워크 세그먼트)는 개인 기기나 Linux VPS보다 안정적인 프로덕션 선택입니다.
출처: Moonshot 공식 블로그 · Kimi API 문서 · Vals AI SWE-bench Verified · Artificial Analysis Intelligence Index
데이터 기준일: 2026년 7월 28일. 벤치마크는 Vals AI와 Artificial Analysis 독립 평가를 우선합니다. 모델 능력과 가격은 변경될 수 있습니다 — 출시 전 공식 문서에서 확인하세요.