阿里Qwen3.8-Max发布:2.4万亿参数冲进Arena全球前五,下周开源

:阿里巴巴;什么时候:2026年8月3日;做了什么:正式发布千问Qwen3.8-Max并同步上线Agent产品「千问办公」。本文面向AI开发者与企业技术决策者,完整解读时间线、核心跑分、Kimi K3/DeepSeek V4对比、开源标签争议,并附五步API接入Runbook与五条FAQ。

抽象神经网络可视化图形,象征Qwen3.8-Max大规模混合专家语言模型与Arena竞技场排名

内容目录

痛点拆解:Qwen3.8-Max发布后,开发者必须正视的三件事

  1. 「开源」标签早于权重落地:阿里官网GA当天即标注「Open-Source」,但截至发稿Hugging Face与ModelScope均无仓库、许可证或确切日期,仅有「下周」(预计8月10日前后)的模糊承诺——企业若按已开源做合规备案,存在审计风险。
  2. 跑分全部来自阿里自建框架:PaperBench、QwenSWEBench、RecreationBench等均为内部基准;Arena上1496分标注为「Preliminary/初步」,Artificial Analysis等中立平台尚未复现GA版成绩。迁移生产系统前必须自建A/B验证。
  3. 预览版透明度缺口延续到GA:7月19日预览版禁止自动化生产环境调用、未公开激活参数;GA虽补充950亿激活量,但独立盲测(269文件架构任务)Kimi K3得83分、Qwen3.8-Max预览版80分——同档位互有胜负,而非「全面碾压」。

时间线:从预览版到正式发布,两周内节奏很快

核心数据一览

项目Qwen3.8-Max
发布日期2026年8月3日(GA)
总参数/激活参数2.4万亿/950亿
架构基于Qwen3.5的稀疏MoE+混合注意力
上下文窗口100万token(思考模式约98.3万,输出上限13.1万)
输入模态文本/图像/视频
API定价输入$2/百万token,输出$6/百万token
国内定价输入12元/百万token,输出36元/百万token
Arena文本竞技场(8月1日快照)第5名,1496分(Preliminary)—前8名中唯一非Anthropic模型
Arena视觉竞技场第2名,仅次于Claude Fable 5
PaperBench(阿里自测)93.0(较上代+28.2)
SWE-bench Pro(阿里自测)67.7(落后Fable 5的80.0)
权重开源状态承诺「下周」,截至发稿未上线
表中带「阿里自测」标注的数据均来自官方发布材料,尚无Artificial Analysis、Arena.ai等第三方正式复现结果。

横向对比:Qwen3.8-Max、Kimi K3、DeepSeek V4、Claude

模型厂商总参数/激活上下文定价(入/出每百万token)权重开源独立评测
Qwen3.8-Max阿里巴巴2.4T/950亿100万$2/$6未开源(承诺中)暂无
Kimi K3月之暗面2.8T/约500亿约104.8万$3/$15已开源(7月27日)AA指数约57.11
DeepSeek V4-ProDeepSeek1.6T/490亿100万未公开已开源SWE-bench Verified 80.6%
DeepSeek V4-FlashDeepSeek同V4-Pro100万未公开已开源9项智能体/代码基准超V4-Pro
Claude Opus 5Anthropic未公开100万$5/$25闭源Arena前列
Claude Fable 5Anthropic未公开100万$10/$50闭源Arena文本第1名

深度拆解:2.4万亿参数背后,阿里想解决什么问题

Qwen3.8-Max延续Qwen3.5的稀疏MoE路线:总参数2.4万亿、每token仅激活950亿,推理成本接近千亿级模型而非2.4T全量调用——这也是API定价$2/$6明显低于Claude Opus 5($5/$25)和Fable 5($10/$50)的架构原因。

模型提供reasoning_effort三档(low/medium/xhigh,默认xhigh),通过enable_thinking或Anthropic兼容接口的reasoning.effort调节速度与深度。长程自主任务是核心卖点:16天无人工介入编码项目、500+步芯片设计优化、自建RecreationBench黑盒还原真实应用——但均为阿里自建评测,部分过程见GitHub qwen-code-dev-bot/oh-my-cli

生态方面,Qwen3.8-Max同步接入「千问办公」Agent平台,API兼容OpenAI与Anthropic双协议,可直接接入Claude Code、Codex、Qoder CLI、Qwen CodeOpenClaw等主流Agent工具链。

争议点:「开源」标签挂得比权重早

  1. 官网已标注「Open-Source」,Hugging Face/ModelScope尚无仓库与许可证。
  2. 所有跑分均来自阿里自建测试框架,Arena 1496分为「初步」排名。
  3. 对比表脚注称「Fable 5结果可能涉及fallback」,但未公开自家测试方法论。
  4. 预览阶段禁止生产自动化调用、未公开激活参数与安全评估,多家评测机构建议先业务场景实测。

可引用技术信息(EEAT硬核数据)

五步接入Runbook

步骤 1 在阿里云Model Studio/QwenCloud注册,创建API Key 步骤 2 选择接入面:官方OpenAI兼容API或Anthropic兼容接口(Claude Code/Qwen Code/OpenClaw) 步骤 3 配置base_url与model=qwen3.8-max,按需设置reasoning_effort(low/medium/xhigh) 步骤 4 用真实长代码或Agent任务Pilot 10–20次,记录质量、Token消耗与缓存命中率 步骤 5 混合路由上线:长程自主任务路由Qwen3.8-Max,关键Repo修Bug保留Claude Fable 5,等待下周权重开源后评估Qwen3.8-27B本地部署

常见问题(FAQ)

Q: Qwen3.8-Max现在能直接用吗?开源了没有?

A: API已可通过QwenCloud调用,兼容OpenAI与Anthropic双协议。权重尚未开源,预计8月10日前后公布Hugging Face/ModelScope仓库与许可证,以官方公告为准。

Q: Qwen3.8-Max和Kimi K3谁更强?

A: 无统一权威评测。独立盲测显示同档位互有胜负(Kimi K3 83分vs Qwen预览版80分)。Kimi K3优势是已开源且有AA指数;Qwen3.8-Max优势是API价格更低、多模态更全面。

Q: 2.4万亿参数意味着普通开发者用不起?

A: 激活仅950亿,API调用成本接近千亿级模型。完整版本地部署需多节点数据中心;更现实的选择是等待同期开源的Qwen3.8-27B。

Q: 阿里公布的跑分能信吗?

A: 可作参考,不能作定论。建议关注独立评测复测,或在实际业务场景做A/B测试。

Q: 对普通用户有什么实际影响?

A: 苹果中国市场Apple Intelligence的生成式AI基于经压缩的Qwen模型本地运行(iPhone 15及以上),国内用户将在系统层面直接受益。

总结

Qwen3.8-Max标志着阿里首次承诺开源Max级权重,2.4T/950亿激活的「大容量、低激活」设计与$2/$6定价在Agent生态卡位上意图明确——但「开源」标签目前仍是承诺而非事实,跑分亦待第三方复现。若你把Qwen Code或OpenClaw Agent完全跑在个人笔记本或普通Linux VPS上,会面临休眠中断长循环、本地密钥与生产代码库混存、以及无法在Apple工具链(Xcode、Fastlane、notarytool)同机编排等局限。对于需要7×24无人值守Agent、在Qwen Code中跑Qwen3.8-Max同时又要做iOS CI或OpenClaw网关的团队,租赁VPSMAC的M4 Mac云节点——原生macOS、SSH+launchd守护、与远程开发工具同网段——通常是比个人设备或Linux VPS更稳定、更适合混合模型策略的生产选择。

参考资料: 阿里云官方博客 · Arena.ai公开排行榜 · TechCrunch/CNBC市场报道

数据截止日期:2026-08-04。 跑分数据优先标注来源(阿里自测/Arena初步/独立第三方),模型能力与开源时间可能随时更新,请以官方公告为准。