阿里Qwen3.8-Max发布:2.4万亿参数冲进Arena全球前五,下周开源
谁:阿里巴巴;什么时候:2026年8月3日;做了什么:正式发布千问Qwen3.8-Max并同步上线Agent产品「千问办公」。本文面向AI开发者与企业技术决策者,完整解读时间线、核心跑分、Kimi K3/DeepSeek V4对比、开源标签争议,并附五步API接入Runbook与五条FAQ。
痛点拆解:Qwen3.8-Max发布后,开发者必须正视的三件事
- 「开源」标签早于权重落地:阿里官网GA当天即标注「Open-Source」,但截至发稿Hugging Face与ModelScope均无仓库、许可证或确切日期,仅有「下周」(预计8月10日前后)的模糊承诺——企业若按已开源做合规备案,存在审计风险。
- 跑分全部来自阿里自建框架:PaperBench、QwenSWEBench、RecreationBench等均为内部基准;Arena上1496分标注为「Preliminary/初步」,Artificial Analysis等中立平台尚未复现GA版成绩。迁移生产系统前必须自建A/B验证。
- 预览版透明度缺口延续到GA:7月19日预览版禁止自动化生产环境调用、未公开激活参数;GA虽补充950亿激活量,但独立盲测(269文件架构任务)Kimi K3得83分、Qwen3.8-Max预览版80分——同档位互有胜负,而非「全面碾压」。
时间线:从预览版到正式发布,两周内节奏很快
- 7月16日:月之暗面发布Kimi K3,2.8万亿参数(896专家中激活16个),主打独立评测与透明技术报告。
- 7月19日:Qwen3.8-Max预览版开放,接入Token Plan/Qoder/QoderWork,价格为正式价10%,未公布激活参数与跑分表,服务条款禁止自动化生产环境调用。
- 7月27日:Kimi K3按承诺开源权重,上线Hugging Face,同步开源注意力内核、MoE通信库等基础设施。
- 7月31日:DeepSeek发布V4-Flash正式版,参数规模不变,智能体与代码基准大幅超过V4-Pro预览版。
- 8月3日:Qwen3.8-Max正式GA,发布完整跑分表,「千问办公」Agent同步上线;阿里港股涨约7%、美股涨约4.5%。
- 预计8月10日前后:Qwen3.8-Max及精简版Qwen3.8-27B权重计划登陆Hugging Face与ModelScope,具体日期与开源协议尚未公布。
核心数据一览
| 项目 | Qwen3.8-Max |
|---|---|
| 发布日期 | 2026年8月3日(GA) |
| 总参数/激活参数 | 2.4万亿/950亿 |
| 架构 | 基于Qwen3.5的稀疏MoE+混合注意力 |
| 上下文窗口 | 100万token(思考模式约98.3万,输出上限13.1万) |
| 输入模态 | 文本/图像/视频 |
| API定价 | 输入$2/百万token,输出$6/百万token |
| 国内定价 | 输入12元/百万token,输出36元/百万token |
| Arena文本竞技场(8月1日快照) | 第5名,1496分(Preliminary)—前8名中唯一非Anthropic模型 |
| Arena视觉竞技场 | 第2名,仅次于Claude Fable 5 |
| PaperBench(阿里自测) | 93.0(较上代+28.2) |
| SWE-bench Pro(阿里自测) | 67.7(落后Fable 5的80.0) |
| 权重开源状态 | 承诺「下周」,截至发稿未上线 |
表中带「阿里自测」标注的数据均来自官方发布材料,尚无Artificial Analysis、Arena.ai等第三方正式复现结果。
横向对比:Qwen3.8-Max、Kimi K3、DeepSeek V4、Claude
| 模型 | 厂商 | 总参数/激活 | 上下文 | 定价(入/出每百万token) | 权重开源 | 独立评测 |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | 阿里巴巴 | 2.4T/950亿 | 100万 | $2/$6 | 未开源(承诺中) | 暂无 |
| Kimi K3 | 月之暗面 | 2.8T/约500亿 | 约104.8万 | $3/$15 | 已开源(7月27日) | AA指数约57.11 |
| DeepSeek V4-Pro | DeepSeek | 1.6T/490亿 | 100万 | 未公开 | 已开源 | SWE-bench Verified 80.6% |
| DeepSeek V4-Flash | DeepSeek | 同V4-Pro | 100万 | 未公开 | 已开源 | 9项智能体/代码基准超V4-Pro |
| Claude Opus 5 | Anthropic | 未公开 | 100万 | $5/$25 | 闭源 | Arena前列 |
| Claude Fable 5 | Anthropic | 未公开 | 100万 | $10/$50 | 闭源 | Arena文本第1名 |
深度拆解:2.4万亿参数背后,阿里想解决什么问题
Qwen3.8-Max延续Qwen3.5的稀疏MoE路线:总参数2.4万亿、每token仅激活950亿,推理成本接近千亿级模型而非2.4T全量调用——这也是API定价$2/$6明显低于Claude Opus 5($5/$25)和Fable 5($10/$50)的架构原因。
模型提供reasoning_effort三档(low/medium/xhigh,默认xhigh),通过enable_thinking或Anthropic兼容接口的reasoning.effort调节速度与深度。长程自主任务是核心卖点:16天无人工介入编码项目、500+步芯片设计优化、自建RecreationBench黑盒还原真实应用——但均为阿里自建评测,部分过程见GitHub qwen-code-dev-bot/oh-my-cli。
生态方面,Qwen3.8-Max同步接入「千问办公」Agent平台,API兼容OpenAI与Anthropic双协议,可直接接入Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw等主流Agent工具链。
争议点:「开源」标签挂得比权重早
- 官网已标注「Open-Source」,Hugging Face/ModelScope尚无仓库与许可证。
- 所有跑分均来自阿里自建测试框架,Arena 1496分为「初步」排名。
- 对比表脚注称「Fable 5结果可能涉及fallback」,但未公开自家测试方法论。
- 预览阶段禁止生产自动化调用、未公开激活参数与安全评估,多家评测机构建议先业务场景实测。
可引用技术信息(EEAT硬核数据)
- 参数与成本:总参数2.4T,激活950亿;API输入$2/百万token、输出$6/百万token,国内口径输入12元/百万、输出36元/百万。
- Arena与独立盲测:Arena文本第5名1496分(8月1日快照,Preliminary);独立盲测269文件架构任务Kimi K383分、Qwen3.8-Max预览版80分。
- 长上下文与多模态:支持100万token上下文(思考模式约98.3万);Arena视觉竞技场第2名,仅次于Claude Fable 5。
五步接入Runbook
常见问题(FAQ)
Q: Qwen3.8-Max现在能直接用吗?开源了没有?
A: API已可通过QwenCloud调用,兼容OpenAI与Anthropic双协议。权重尚未开源,预计8月10日前后公布Hugging Face/ModelScope仓库与许可证,以官方公告为准。
Q: Qwen3.8-Max和Kimi K3谁更强?
A: 无统一权威评测。独立盲测显示同档位互有胜负(Kimi K3 83分vs Qwen预览版80分)。Kimi K3优势是已开源且有AA指数;Qwen3.8-Max优势是API价格更低、多模态更全面。
Q: 2.4万亿参数意味着普通开发者用不起?
A: 激活仅950亿,API调用成本接近千亿级模型。完整版本地部署需多节点数据中心;更现实的选择是等待同期开源的Qwen3.8-27B。
Q: 阿里公布的跑分能信吗?
A: 可作参考,不能作定论。建议关注独立评测复测,或在实际业务场景做A/B测试。
Q: 对普通用户有什么实际影响?
A: 苹果中国市场Apple Intelligence的生成式AI基于经压缩的Qwen模型本地运行(iPhone 15及以上),国内用户将在系统层面直接受益。
总结
Qwen3.8-Max标志着阿里首次承诺开源Max级权重,2.4T/950亿激活的「大容量、低激活」设计与$2/$6定价在Agent生态卡位上意图明确——但「开源」标签目前仍是承诺而非事实,跑分亦待第三方复现。若你把Qwen Code或OpenClaw Agent完全跑在个人笔记本或普通Linux VPS上,会面临休眠中断长循环、本地密钥与生产代码库混存、以及无法在Apple工具链(Xcode、Fastlane、notarytool)同机编排等局限。对于需要7×24无人值守Agent、在Qwen Code中跑Qwen3.8-Max同时又要做iOS CI或OpenClaw网关的团队,租赁VPSMAC的M4 Mac云节点——原生macOS、SSH+launchd守护、与远程开发工具同网段——通常是比个人设备或Linux VPS更稳定、更适合混合模型策略的生产选择。
参考资料: 阿里云官方博客 · Arena.ai公开排行榜 · TechCrunch/CNBC市场报道
数据截止日期:2026-08-04。 跑分数据优先标注来源(阿里自测/Arena初步/独立第三方),模型能力与开源时间可能随时更新,请以官方公告为准。