Qwen3.8-Max est-il open source ? Ce qu'Alibaba a réellement publié cette semaine
Réponse courte : pas encore. Le 3 août 2026, Alibaba a mis Qwen3.8-Max en GA (2,4T total, 95B actifs, Arena Text n°5) et l'a tagué Open-Source sur qwen.ai — sans poids sur Hugging Face. Cet article couvre la chronologie, le tableau de benchmarks, la comparaison Kimi K3/DeepSeek V4, la controverse open source, plus un runbook API en 5 étapes et 5 FAQ.
Sommaire
Points de friction : trois réalités après le lancement de Qwen3.8-Max
- Le label Open-Source est arrivé avant les poids. qwen.ai a marqué Qwen3.8-Max Open-Source le jour du GA — dépôt, licence et date sur Hugging Face/ModelScope absents. Seule une promesse « la semaine prochaine » (vers le 10 août). Risque compliance si traité comme déjà open.
- Tous les benchmarks sont exécutés par le vendeur. PaperBench, QwenSWEBench, RecreationBench sont internes ; Arena 1 496 points est « Preliminary ». Artificial Analysis n'a pas reproduit la GA. A/B propre avant migration prod.
- Les lacunes de transparence de la preview persistent. Preview du 19 juillet : pas de paramètres actifs, automatisation prod interdite. GA a ajouté 95B ; seul test aveugle indépendant (269 fichiers architecture) : Kimi K3 83/100, Qwen Preview 80/100 — pairs à égalité.
Chronologie : ce qui a été livré — et ce qui ne l'a pas été
- 16 juillet 2026 — Moonshot AI publie Kimi K3 (2,8T MoE, 16/896 experts actifs) avec benchmarks indépendants et rapport technique.
- 19 juillet 2026 — Preview Qwen3.8-Max via Token Plan/Qoder/QoderWork à 10 % du tarif ; pas de paramètres actifs, pas de tableau de benchmarks, ToS interdisant l'automatisation prod.
- 27 juillet 2026 — Kimi K3 livre les poids ouverts sur Hugging Face plus noyaux d'attention et bibliothèque MoE.
- 31 juillet 2026 — DeepSeek V4-Flash GA : bat V4-Pro sur neuf benchmarks agent/code sans plus de paramètres.
- 3 août 2026 — Qwen3.8-Max GA avec tableau complet et agent Qwen Office ; actions Alibaba HK ~+7 %, US ~+4,5 %.
- « Semaine prochaine » (vers 10 août) — Poids ouverts Qwen3.8-Max et Qwen3.8-27B promis sur HF/ModelScope ; pas de dépôt, licence ni date.
Les chiffres publiés par Alibaba
| Spec | Qwen3.8-Max |
|---|---|
| Date GA | 3 août 2026 |
| Total / actifs | 2,4T / 95B |
| Architecture | MoE sparse + attention hybride sur base Qwen3.5 |
| Contexte | 1M tokens (~983K avec thinking ; 131K sortie max) |
| Modalités | Texte, image, vidéo |
| Prix API | 2 $ / 6 $ par million tokens in/out |
| Arena Text (1er août) | n°5, 1 496 pts (Preliminary) — seul non-Anthropic du top 8 |
| Arena Vision | n°2, derrière Claude Fable 5 |
| PaperBench (Alibaba) | 93,0 (+28,2 vs génération préc.) |
| SWE-bench Pro (Alibaba) | 67,7 — derrière Fable 5 (80,0) |
| Poids ouverts | Promis « semaine prochaine » ; pas en ligne |
Les lignes « Alibaba-run » viennent des matériaux vendeur. Aucune reproduction indépendante GA à la publication.
Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude
| Modèle | Labo | Total/actifs | Contexte | Prix (in/out par 1M) | Poids ouverts ? | Benchmark indép. |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | Alibaba | 2,4T / 95B | 1M | 2 $ / 6 $ | Promis, non livrés | Aucun encore |
| Kimi K3 | Moonshot AI | 2,8T / ~50B | ~1,05M | 3 $ / 15 $ | Livrés 27 juil. | AA Index ≈ 57,11 |
| DeepSeek V4-Pro | DeepSeek | 1,6T / 49B | 1M | Non publié | Livrés | SWE-bench Verified 80,6 % |
| DeepSeek V4-Flash | DeepSeek | Comme V4-Pro | 1M | Non publié | Livrés | Bat V4-Pro sur 9 benchmarks agent/code |
| Claude Opus 5 | Anthropic | Non divulgué | 1M | 5 $ / 25 $ | Fermé | Arena top tier |
| Claude Fable 5 | Anthropic | Non divulgué | 1M | 10 $ / 50 $ | Fermé | n°1 Arena Text |
Sous le capot : ce que signifient 2,4 billions de paramètres
MoE sparse : 2,4T total, 95B activés par token — le coût d'inférence suit le nombre actif, d'où 2 $/6 $, bien sous Opus 5 (5 $/25 $) et Fable 5 (10 $/50 $).
Trois niveaux reasoning_effort (low/medium/xhigh, défaut xhigh) via enable_thinking ou reasoning.effort compatible Anthropic. Autonomie long horizon : projet code 16 jours sans supervision, optimisation puce 500+ étapes, RecreationBench en boîte noire — benchmarks Alibaba ; traces partielles sur GitHub qwen-code-dev-bot/oh-my-cli.
Distribution : Qwen Office, protocoles OpenAI et Anthropic — Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw par changement de base URL.
Le problème du label Open-Source
- Tag Open-Source avant les poids — marketing avant artefact.
- Tous benchmarks vendor-run ; Arena 1 496 reste Preliminary.
- Note de bas de page : résultats Fable 5 « may involve fallbacks » sans méthodologie Alibaba équivalente.
- Preview : automatisation prod interdite, pas de paramètres actifs, pas de model card ni éval sécurité — évaluateurs indép. déconseillaient migration sur seule annonce.
Données techniques citables (EEAT)
- Paramètres & coût : 2,4T total, 95B actifs ; API 2 $/M entrée, 6 $/M sortie.
- Arena & test aveugle : Arena Text n°5 à 1 496 (1er août, Preliminary) ; architecture aveugle Kimi K3 83/100, Qwen Preview 80/100.
- Contexte & multimodal : 1M tokens (~983K avec thinking) ; Arena Vision n°2 derrière Fable 5.
Runbook d'intégration en 5 étapes
FAQ
Qwen3.8-Max est-il open source maintenant ?
Non. API live, poids absents sur HF/ModelScope. Tag Open-Source = intention — promis « semaine prochaine » sans date.
Comparaison avec Kimi K3 ?
Pas de face-à-face autoritaire. Test aveugle : K3 83/100 vs Qwen 80/100. K3 a poids publics et score AA ; Qwen3.8-Max API moins chère et multimodal plus large.
Faut-il un datacenter pour 2,4T ?
Pour le modèle complet oui. L'API contourne cela. Qwen3.8-27B est la cible locale réaliste.
Benchmarks Alibaba fiables ?
Les traiter comme affirmations vendeur. Attendre reproduction tierce ou tester sur votre charge.
Pourquoi m'en soucier sans utiliser Qwen ?
Qwen alimente l'IA générative d'Apple Intelligence en Chine on-device (iPhone 15+).
Synthèse
Qwen3.8-Max est la première promesse open-weight Max d'Alibaba — design 2,4T/95B « gros total, petite activation » à 2 $/6 $ vise l'écosystème agent. Le label Open-Source reste une promesse ; scores en attente de reproduction indép. Faire tourner Qwen Code ou OpenClaw sur portable perso ou VPS Linux implique veille interrompue, clés API mélangées aux dépôts prod, pas de toolchain Apple (Xcode, Fastlane, notarytool) sur la même machine. Pour des agents 7×24 sans surveillance avec API Qwen3.8-Max plus CI iOS ou passerelle OpenClaw, louer un nœud Mac M4 VPSMAC (macOS natif, SSH+launchd) est plus stable qu'un laptop ou VPS Linux.
Sources : Alibaba Cloud · Arena.ai · CNBC / TechCrunch
Données au 2026-08-04. Benchmarks étiquetés par source (Alibaba/Arena préliminaire/tiers). Vérifier les annonces officielles.