阿里Qwen3.8-Max發布:2.4萬億參數衝進Arena全球前五,下週開源

:阿里巴巴;什麼時候:2026年8月3日;做了什麼:正式發布千問Qwen3.8-Max並同步上線Agent產品「千問辦公」。本文面向AI開發者與企業技術決策者,完整解讀時間線、核心跑分、Kimi K3/DeepSeek V4對比、開源標籤爭議,並附五步API接入Runbook與五條FAQ。

抽象神經網絡可視化圖形,象徵Qwen3.8-Max大規模混合專家語言模型與Arena競技場排名

內容目錄

痛點拆解:Qwen3.8-Max發布後,開發者必須正視的三件事

  1. 「開源」標籤早於權重落地:阿里官網GA當天即標註「Open-Source」,但截至發稿Hugging Face與ModelScope均無倉庫、許可證或確切日期,僅有「下週」(預計8月10日前後)的模糊承諾——企業若按已開源做合規備案,存在審計風險。
  2. 跑分全部來自阿里自建框架:PaperBench、QwenSWEBench、RecreationBench等均爲內部基準;Arena上1496分標註爲「Preliminary/初步」,Artificial Analysis等中立平臺尚未復現GA版成績。遷移生產系統前必須自建A/B驗證。
  3. 預覽版透明度缺口延續到GA:7月19日預覽版禁止自動化生產環境調用、未公開激活參數;GA雖補充950億激活量,但獨立盲測(269文件架構任務)Kimi K3得83分、Qwen3.8-Max預覽版80分——同檔位互有勝負,而非「全面碾壓」。

時間線:從預覽版到正式發布,兩週內節奏很快

核心數據一覽

項目Qwen3.8-Max
發布日期2026年8月3日(GA)
總參數/激活參數2.4萬億/950億
架構基於Qwen3.5的稀疏MoE+混合注意力
上下文窗口100萬token(思考模式約98.3萬,輸出上限13.1萬)
輸入模態文本/圖像/視頻
API定價輸入$2/百萬token,輸出$6/百萬token
國內定價輸入12元/百萬token,輸出36元/百萬token
Arena文本競技場(8月1日快照)第5名,1496分(Preliminary)—前8名中唯一非Anthropic模型
Arena視覺競技場第2名,僅次於Claude Fable 5
PaperBench(阿里自測)93.0(較上代+28.2)
SWE-bench Pro(阿里自測)67.7(落後Fable 5的80.0)
權重開源狀態承諾「下週」,截至發稿未上線
表中帶「阿里自測」標註的數據均來自官方發布材料,尚無Artificial Analysis、Arena.ai等第三方正式復現結果。

橫向對比:Qwen3.8-Max、Kimi K3、DeepSeek V4、Claude

模型廠商總參數/激活上下文定價(入/出每百萬token)權重開源獨立評測
Qwen3.8-Max阿里巴巴2.4T/950億100萬$2/$6未開源(承諾中)暫無
Kimi K3月之暗面2.8T/約500億約104.8萬$3/$15已開源(7月27日)AA指數約57.11
DeepSeek V4-ProDeepSeek1.6T/490億100萬未公開已開源SWE-bench Verified 80.6%
DeepSeek V4-FlashDeepSeek同V4-Pro100萬未公開已開源9項智能體/代碼基準超V4-Pro
Claude Opus 5Anthropic未公開100萬$5/$25閉源Arena前列
Claude Fable 5Anthropic未公開100萬$10/$50閉源Arena文本第1名

深度拆解:2.4萬億參數背後,阿里想解決什麼問題

Qwen3.8-Max延續Qwen3.5的稀疏MoE路線:總參數2.4萬億、每token僅激活950億,推理成本接近千億級模型而非2.4T全量調用——這也是API定價$2/$6明顯低於Claude Opus 5($5/$25)和Fable 5($10/$50)的架構原因。

模型提供reasoning_effort三檔(low/medium/xhigh,默認xhigh),通過enable_thinking或Anthropic兼容接口的reasoning.effort調節速度與深度。長程自主任務是核心賣點:16天無人工介入編碼項目、500+步芯片設計優化、自建RecreationBench黑盒還原真實應用——但均爲阿里自建評測,部分過程見GitHub qwen-code-dev-bot/oh-my-cli

生態方面,Qwen3.8-Max同步接入「千問辦公」Agent平臺,API兼容OpenAI與Anthropic雙協議,可直接接入Claude Code、Codex、Qoder CLI、Qwen CodeOpenClaw等主流Agent工具鏈。

爭議點:「開源」標籤掛得比權重早

  1. 官網已標註「Open-Source」,Hugging Face/ModelScope尚無倉庫與許可證。
  2. 所有跑分均來自阿里自建測試框架,Arena 1496分爲「初步」排名。
  3. 對比表腳註稱「Fable 5結果可能涉及fallback」,但未公開自家測試方法論。
  4. 預覽階段禁止生產自動化調用、未公開激活參數與安全評估,多家評測機構建議先業務場景實測。

可引用技術信息(EEAT硬核數據)

五步接入Runbook

步驟 1 在阿里雲Model Studio/QwenCloud註冊,創建API Key 步驟 2 選擇接入面:官方OpenAI兼容API或Anthropic兼容接口(Claude Code/Qwen Code/OpenClaw) 步驟 3 配置base_url與model=qwen3.8-max,按需設置reasoning_effort(low/medium/xhigh) 步驟 4 用真實長代碼或Agent任務Pilot 10–20次,記錄質量、Token消耗與緩存命中率 步驟 5 混合路由上線:長程自主任務路由Qwen3.8-Max,關鍵Repo修Bug保留Claude Fable 5,等待下週權重開源後評估Qwen3.8-27B本地部署

常見問題(FAQ)

Q: Qwen3.8-Max現在能直接用嗎?開源了沒有?

A: API已可通過QwenCloud調用,兼容OpenAI與Anthropic雙協議。權重尚未開源,預計8月10日前後公佈Hugging Face/ModelScope倉庫與許可證,以官方公告爲準。

Q: Qwen3.8-Max和Kimi K3誰更強?

A: 無統一權威評測。獨立盲測顯示同檔位互有勝負(Kimi K3 83分vs Qwen預覽版80分)。Kimi K3優勢是已開源且有AA指數;Qwen3.8-Max優勢是API價格更低、多模態更全面。

Q: 2.4萬億參數意味着普通開發者用不起?

A: 激活僅950億,API調用成本接近千億級模型。完整版本地部署需多節點數據中心;更現實的選擇是等待同期開源的Qwen3.8-27B。

Q: 阿里公佈的跑分能信嗎?

A: 可作參考,不能作定論。建議關注獨立評測複測,或在實際業務場景做A/B測試。

Q: 對普通用戶有什麼實際影響?

A: 蘋果中國市場Apple Intelligence的生成式AI基於經壓縮的Qwen模型本地運行(iPhone 15及以上),國內用戶將在系統層面直接受益。

總結

Qwen3.8-Max標誌着阿里首次承諾開源Max級權重,2.4T/950億激活的「大容量、低激活」設計與$2/$6定價在Agent生態卡位上意圖明確——但「開源」標籤目前仍是承諾而非事實,跑分亦待第三方復現。若你把Qwen Code或OpenClaw Agent完全跑在個人筆記本或普通Linux VPS上,會面臨休眠中斷長循環、本地密鑰與生產代碼庫混存、以及無法在Apple工具鏈(Xcode、Fastlane、notarytool)同機編排等侷限。對於需要7×24無人值守Agent、在Qwen Code中跑Qwen3.8-Max同時又要做iOS CI或OpenClaw網關的團隊,租賃VPSMAC的M4 Mac雲節點——原生macOS、SSH+launchd守護、與遠程開發工具同網段——通常是比個人設備或Linux VPS更穩定、更適合混合模型策略的生產選擇。

參考資料: 阿里雲官方博客 · Arena.ai公開排行榜 · TechCrunch/CNBC市場報道

數據截止日期:2026-08-04。 跑分數據優先標註來源(阿里自測/Arena初步/獨立第三方),模型能力與開源時間可能隨時更新,請以官方公告爲準。