阿里Qwen3.8-Max發布:2.4萬億參數衝進Arena全球前五,下週開源
誰:阿里巴巴;什麼時候:2026年8月3日;做了什麼:正式發布千問Qwen3.8-Max並同步上線Agent產品「千問辦公」。本文面向AI開發者與企業技術決策者,完整解讀時間線、核心跑分、Kimi K3/DeepSeek V4對比、開源標籤爭議,並附五步API接入Runbook與五條FAQ。
痛點拆解:Qwen3.8-Max發布後,開發者必須正視的三件事
- 「開源」標籤早於權重落地:阿里官網GA當天即標註「Open-Source」,但截至發稿Hugging Face與ModelScope均無倉庫、許可證或確切日期,僅有「下週」(預計8月10日前後)的模糊承諾——企業若按已開源做合規備案,存在審計風險。
- 跑分全部來自阿里自建框架:PaperBench、QwenSWEBench、RecreationBench等均爲內部基準;Arena上1496分標註爲「Preliminary/初步」,Artificial Analysis等中立平臺尚未復現GA版成績。遷移生產系統前必須自建A/B驗證。
- 預覽版透明度缺口延續到GA:7月19日預覽版禁止自動化生產環境調用、未公開激活參數;GA雖補充950億激活量,但獨立盲測(269文件架構任務)Kimi K3得83分、Qwen3.8-Max預覽版80分——同檔位互有勝負,而非「全面碾壓」。
時間線:從預覽版到正式發布,兩週內節奏很快
- 7月16日:月之暗面發布Kimi K3,2.8萬億參數(896專家中激活16個),主打獨立評測與透明技術報告。
- 7月19日:Qwen3.8-Max預覽版開放,接入Token Plan/Qoder/QoderWork,價格爲正式價10%,未公佈激活參數與跑分表,服務條款禁止自動化生產環境調用。
- 7月27日:Kimi K3按承諾開源權重,上線Hugging Face,同步開源注意力內核、MoE通信庫等基礎設施。
- 7月31日:DeepSeek發布V4-Flash正式版,參數規模不變,智能體與代碼基準大幅超過V4-Pro預覽版。
- 8月3日:Qwen3.8-Max正式GA,發布完整跑分表,「千問辦公」Agent同步上線;阿里港股漲約7%、美股漲約4.5%。
- 預計8月10日前後:Qwen3.8-Max及精簡版Qwen3.8-27B權重計劃登陸Hugging Face與ModelScope,具體日期與開源協議尚未公佈。
核心數據一覽
| 項目 | Qwen3.8-Max |
|---|---|
| 發布日期 | 2026年8月3日(GA) |
| 總參數/激活參數 | 2.4萬億/950億 |
| 架構 | 基於Qwen3.5的稀疏MoE+混合注意力 |
| 上下文窗口 | 100萬token(思考模式約98.3萬,輸出上限13.1萬) |
| 輸入模態 | 文本/圖像/視頻 |
| API定價 | 輸入$2/百萬token,輸出$6/百萬token |
| 國內定價 | 輸入12元/百萬token,輸出36元/百萬token |
| Arena文本競技場(8月1日快照) | 第5名,1496分(Preliminary)—前8名中唯一非Anthropic模型 |
| Arena視覺競技場 | 第2名,僅次於Claude Fable 5 |
| PaperBench(阿里自測) | 93.0(較上代+28.2) |
| SWE-bench Pro(阿里自測) | 67.7(落後Fable 5的80.0) |
| 權重開源狀態 | 承諾「下週」,截至發稿未上線 |
表中帶「阿里自測」標註的數據均來自官方發布材料,尚無Artificial Analysis、Arena.ai等第三方正式復現結果。
橫向對比:Qwen3.8-Max、Kimi K3、DeepSeek V4、Claude
| 模型 | 廠商 | 總參數/激活 | 上下文 | 定價(入/出每百萬token) | 權重開源 | 獨立評測 |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | 阿里巴巴 | 2.4T/950億 | 100萬 | $2/$6 | 未開源(承諾中) | 暫無 |
| Kimi K3 | 月之暗面 | 2.8T/約500億 | 約104.8萬 | $3/$15 | 已開源(7月27日) | AA指數約57.11 |
| DeepSeek V4-Pro | DeepSeek | 1.6T/490億 | 100萬 | 未公開 | 已開源 | SWE-bench Verified 80.6% |
| DeepSeek V4-Flash | DeepSeek | 同V4-Pro | 100萬 | 未公開 | 已開源 | 9項智能體/代碼基準超V4-Pro |
| Claude Opus 5 | Anthropic | 未公開 | 100萬 | $5/$25 | 閉源 | Arena前列 |
| Claude Fable 5 | Anthropic | 未公開 | 100萬 | $10/$50 | 閉源 | Arena文本第1名 |
深度拆解:2.4萬億參數背後,阿里想解決什麼問題
Qwen3.8-Max延續Qwen3.5的稀疏MoE路線:總參數2.4萬億、每token僅激活950億,推理成本接近千億級模型而非2.4T全量調用——這也是API定價$2/$6明顯低於Claude Opus 5($5/$25)和Fable 5($10/$50)的架構原因。
模型提供reasoning_effort三檔(low/medium/xhigh,默認xhigh),通過enable_thinking或Anthropic兼容接口的reasoning.effort調節速度與深度。長程自主任務是核心賣點:16天無人工介入編碼項目、500+步芯片設計優化、自建RecreationBench黑盒還原真實應用——但均爲阿里自建評測,部分過程見GitHub qwen-code-dev-bot/oh-my-cli。
生態方面,Qwen3.8-Max同步接入「千問辦公」Agent平臺,API兼容OpenAI與Anthropic雙協議,可直接接入Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw等主流Agent工具鏈。
爭議點:「開源」標籤掛得比權重早
- 官網已標註「Open-Source」,Hugging Face/ModelScope尚無倉庫與許可證。
- 所有跑分均來自阿里自建測試框架,Arena 1496分爲「初步」排名。
- 對比表腳註稱「Fable 5結果可能涉及fallback」,但未公開自家測試方法論。
- 預覽階段禁止生產自動化調用、未公開激活參數與安全評估,多家評測機構建議先業務場景實測。
可引用技術信息(EEAT硬核數據)
- 參數與成本:總參數2.4T,激活950億;API輸入$2/百萬token、輸出$6/百萬token,國內口徑輸入12元/百萬、輸出36元/百萬。
- Arena與獨立盲測:Arena文本第5名1496分(8月1日快照,Preliminary);獨立盲測269文件架構任務Kimi K383分、Qwen3.8-Max預覽版80分。
- 長上下文與多模態:支持100萬token上下文(思考模式約98.3萬);Arena視覺競技場第2名,僅次於Claude Fable 5。
五步接入Runbook
常見問題(FAQ)
Q: Qwen3.8-Max現在能直接用嗎?開源了沒有?
A: API已可通過QwenCloud調用,兼容OpenAI與Anthropic雙協議。權重尚未開源,預計8月10日前後公佈Hugging Face/ModelScope倉庫與許可證,以官方公告爲準。
Q: Qwen3.8-Max和Kimi K3誰更強?
A: 無統一權威評測。獨立盲測顯示同檔位互有勝負(Kimi K3 83分vs Qwen預覽版80分)。Kimi K3優勢是已開源且有AA指數;Qwen3.8-Max優勢是API價格更低、多模態更全面。
Q: 2.4萬億參數意味着普通開發者用不起?
A: 激活僅950億,API調用成本接近千億級模型。完整版本地部署需多節點數據中心;更現實的選擇是等待同期開源的Qwen3.8-27B。
Q: 阿里公佈的跑分能信嗎?
A: 可作參考,不能作定論。建議關注獨立評測複測,或在實際業務場景做A/B測試。
Q: 對普通用戶有什麼實際影響?
A: 蘋果中國市場Apple Intelligence的生成式AI基於經壓縮的Qwen模型本地運行(iPhone 15及以上),國內用戶將在系統層面直接受益。
總結
Qwen3.8-Max標誌着阿里首次承諾開源Max級權重,2.4T/950億激活的「大容量、低激活」設計與$2/$6定價在Agent生態卡位上意圖明確——但「開源」標籤目前仍是承諾而非事實,跑分亦待第三方復現。若你把Qwen Code或OpenClaw Agent完全跑在個人筆記本或普通Linux VPS上,會面臨休眠中斷長循環、本地密鑰與生產代碼庫混存、以及無法在Apple工具鏈(Xcode、Fastlane、notarytool)同機編排等侷限。對於需要7×24無人值守Agent、在Qwen Code中跑Qwen3.8-Max同時又要做iOS CI或OpenClaw網關的團隊,租賃VPSMAC的M4 Mac雲節點——原生macOS、SSH+launchd守護、與遠程開發工具同網段——通常是比個人設備或Linux VPS更穩定、更適合混合模型策略的生產選擇。
參考資料: 阿里雲官方博客 · Arena.ai公開排行榜 · TechCrunch/CNBC市場報道
數據截止日期:2026-08-04。 跑分數據優先標註來源(阿里自測/Arena初步/獨立第三方),模型能力與開源時間可能隨時更新,請以官方公告爲準。