OpenRouter Juli 2026 Modell-Rankings im Detail: Wer gewinnt wirklich den AI-Traffic-Krieg?
Wenn Sie in OpenRouter, Cursor oder einem selbstgebauten Agent noch mit dem Bild von vor Monaten entscheiden, welches LLM sich lohnt, sind Sie wahrscheinlich veraltet. Dieser Artikel verankert sich an OpenRouter-Echt-Traffic bis zum 25. Juli 2026: Xiaomi Mimo V2.5 an der Spitze, chinesische Anbieter ca. 46%, Hantel-Struktur aus Nutzung und Qualitaet, Coding-Agents und der unsichtbare Roleplay-Markt — plus August-Prognose und fuenf Schritte Schicht-Routing-Runbook.
Inhaltsverzeichnis
- 1. Drei Auswahl-Schmerzpunkte
- 2. Juli-Ranking: Modelle und Anbieter
- 3. Hohe Nutzung ≠ hohe Qualitaet
- 4. App-Ebene: Coding-Agents und versteckter Markt
- 5. Preis- und Positionierungstabelle
- 6. August-Prognose
- 7. Empfehlungen nach Rolle
- 8. Fuenf Schritte Schicht-Routing-Runbook
- 9. Zitierfaehige technische Fakten
- 10. Fazit
1. Drei Auswahl-Schmerzpunkte: Ranking, Qualitaet und echte Workloads entkoppelt
- Token-Nutzungs-Ranking als Qualitaets-Ranking missverstehen. OpenRouter sortiert nach echtem, bezahltem Routing-Traffic — nicht nach Benchmarks. Guenstige, schnelle Modelle hinter High-Traffic-Apps dominieren leicht, fehlen aber bei schwerer Reasoning fast voellig.
- App-Ebene als Treiber ignorieren. Hermes Agent allein ca. 45% App-Token; Cline → Roo Code → Kilo Code zeigt, wie schnell Open-Source-Coding-Agents forken. Nur das Modell-Ranking zeigt nicht, wofuer diese «Gehirne» genutzt werden.
- Single-Model-Hardcoding bei monatlichem Champion-Wechsel. Februar MiniMax M2.5, April MiMo-V2-Pro, Juli Mimo V2.5 — der Monats-Champion wechselt haeufig, DeepSeek bleibt mit ca. 16-18% der stabilste Anbieter.
2. Juli-Ranking: Xiaomi auf Platz 1, chinesische Modelle ca. 46%
Datenquelle: OpenRouter offizielles Ranking (openrouter.ai/rankings), Stand 25. Juli 2026. Das Ranking aktualisiert taeglich — vor Veroeffentlichung Live-Daten auf der Website pruefen.
Top 12 Modelle nach Token-Nutzung (Taeglich)
| Rang | Modell | Anbieter | Token/Tag | 30-Tage kumuliert |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4T | 31,2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9B | 23,6T |
| 3 | Hy3 | Tencent | 590B | 23,4T |
| 4 | Nemotron 3 Ultra 550B (kostenlos) | NVIDIA | 428,6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7B | 11,6T |
| 6 | GLM 5.2 | Z.ai | 316,7B | 13,3T |
| 7 | MiniMax M3 | MiniMax | 262,5B | 15,1T |
| 8 | Step 3.7 Flash | StepFun | 204,8B | 5,9T |
| 9 | Kimi K3 | Moonshot | 157,6B | 1,6T (neu im Ranking) |
| 10 | Ling 3.0 Flash | Ant InclusionAI | 128,3B | 417,3B |
| 11 | Gemini 3 Flash Preview | 106,3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5B | 3,6T |
Sieben der Top-10 sind chinesische Modelle; Nemotron 3 Ultra, Claude und Gemini halten Positionen fuer die USA. Am 24. Juli war Claude Opus 4.8 noch Platz 10, am 25. Juli von Ling 3.0 Flash aus den Top 12 gedrueckt — das Ranking schwankt extrem schnell.
Anbieter-Anteile (7-Tage-Mehrquellen, gerundet)
| Anbieter | Region | Token-Anteil (ca.) |
|---|---|---|
| DeepSeek | 🇨🇳 China | 16-18% |
| Xiaomi | 🇨🇳 China | 8-18% (Mimo V2.5-Sprung, hoechste Volatilitaet) |
| Anthropic | 🇺🇸 USA | 10-15% |
| Tencent | 🇨🇳 China | 8-13% |
| 🇺🇸 USA | 8-13% | |
| Z.ai | 🇨🇳 China | 4-7% |
| OpenAI | 🇺🇸 USA | 6-8% |
| NVIDIA | 🇺🇸 USA | 5% |
Chinesische Anbieter zusammen ca. 46% (vor einem Jahr unter 2%); US-Anbieter zusammen ca. 30-36% (vor einem Jahr ca. 70%). Hauptgrund: Preis — DeepSeek V4 Flash Input ca. $0,05-0,14/M, GPT-5.5 ca. $5/M — bis zu 35-facher Preisabstand.
3. Die andere Seite: Hohe Nutzung ≠ hohe Qualitaet
Nach Ausgabenanteil (nicht Token-Volumen) nach Task-Typ: Allgemeiner Dialog 35,7%, Agent-Workflows 30,4%, Code 26,5%, Datenverarbeitung 7,5%. Bei schwerer Klassifikation/Reasoning kehrt sich das Bild um — Claude Sonnet 4.6 und Claude Opus 4.7 je ca. 13,5% Ausgabenanteil geteilt Platz 1, GPT-5.5 ca. 11,6% Platz 3; guenstige Open-Source-Modelle aus dem Volumen-Ranking fehlen hier fast komplett.
Der Markt bildet eine Hantel-Struktur: Guenstige chinesische Open-Source-Modelle fressen Massen-Workloads mit hoher Fehlertoleranz (Smalltalk, Kreativ, Roleplay, einfaches Coding); Closed-Source-Flaggschiffe halten Preismacht bei schweren, fehlerintoleranten Tasks. Am 24. Juli veroeffentlichte Anthropic Claude Opus 5 mit FrontierBench v0.1 43,3% (GPT-5.6 Sol 37,5%), Preis weiter Opus-Range $5/$25 pro M — «Ich bin teuer, aber es lohnt sich.»
4. App-Geheimnis: Coding-Agents regieren, Roleplay ist die unsichtbare Haelfte
Das Modell-Ranking zeigt «welches Gehirn beliebt ist»; das App-Ranking (openrouter.ai/apps) zeigt «wofuer es genutzt wird»:
| Rang | App | Typ | Anteil (ca.) |
|---|---|---|---|
| 1 | Hermes Agent | Persoenlicher Agent / CLI Agent | ~45% |
| 2 | Kilo Code | Coding Agent | ~13% |
| 3 | OpenClaw | Allgemeiner Agent | ~9% |
| 4 | Claude Code | Coding Agent | ~6% |
| 5 | Descript | Content-Produktion | ~4,5% |
| 6 | pi | Agent | ~3,3% |
| 7-9 | Lemonade / ISEKAI ZERO / Janitor AI | Begleitung / Roleplay | je ~2% |
| 10 | Cline | Coding Agent (IDE-Plugin) | ~1,7% |
Cline → Roo Code → Kilo Code ist dieselbe Code-Linie in drei Generationen — Enkel Kilo Code hat die Vorfahren ueberholt. Roleplay/Begleitung (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) macht einen erheblichen Anteil am Open-Source-Traffic aus; OpenRouter × a16z «State of AI» zeigt: Kreativ-Roleplay traegt ueber die Haelfte des Open-Source-Gesamt-Traffics — in Enterprise-AI-Berichten praktisch unsichtbar.
5. Preis- und Positionierungstabelle
| Modell | Input/M | Output/M | Kontext | Positionierung |
|---|---|---|---|---|
| DeepSeek V4 Flash | ~$0,05-0,14 | ~$0,24-0,28 | 1M | Preis-Leistungs-Koenig, Agentic Coding |
| Nemotron 3 Ultra | $0,42 (plus kostenlose Variante) | $2,61 | — | US Open Source, NVIDIA-Oekosystem |
| MiniMax M3 | $0,10 | $1,21 | Langkontext | Multimodal/Bild-Input im Budget |
| GLM 5.2 | $0,45 | $3,31 | — | Open Source «Opus-aehnliche» Planungsqualitaet |
| Kimi K3 | ~$3 | ~$15 | 1M | Groesstes Open-Source-Gewicht (1,4TB), Closed-Source-Niveau |
| Claude Opus 5 | $5 (Fast $10) | $25 (Fast $50) | 1M | Closed-Source-Flaggschiff, staerkste Juli-Benchmarks |
6. August-Prognose
- Chinesische Open-Source-Modelle klettern weiter, 50% im Jahr wahrscheinlich — sofern US-Anbieter nicht massiv senken; derzeit keine Anzeichen.
- Monats-Champion wechselt weiter: Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax, Moonshot — Preiskampf und Iteration stoppen nicht.
- Anthropic koennte guenstigeres Modell bringen (Haiku-Niveau) fuer Volumen; Opus 5 ist bereits das vierte Flaggschiff in zwei Monaten (nach Mythos 5, Fable 5, Sonnet 5) — Strategie: volle Preisbandbreite.
- Kimi K3 mit 1,4TB Gewicht: Community-Quantisierung in 2-4 Wochen moeglich — dann erst fuer kleine Teams nutzbar; aktuell profitieren vor allem Grossanbieter und Inference-Clouds (z. B. Fireworks AI).
- Sicherheit und Compliance als neue Auswahl-Variable: OpenAI-Modell-Sandbox-Escape auf Hugging Face, US-Kongress «AI Kill Switch Act» und White-House-Framework fuer Frontier-Modelle vor Veroeffentlichung — «Anbieter-Sicherheitsreputation» gewinnt in Enterprise-Beschaffung.
7. Empfehlungen nach Rolle
Indie-Entwickler / kleine Teams
- OpenRouter eignet sich gut als Tech-Sandbox — ein Key, Hunderte Modelle. Beachten: Latenz aus China ca. 180-250ms, keine lokalen Rechnungen; fuer Produktion ggf. lokale Compliance-Relays pruefen.
- Coding: zuerst DeepSeek V4 Flash und GLM 5.2; bei hartnackigen Schritten Route zu Claude Opus 5 / GPT-5.6 — gemischtes Routing senkt Kosten stark.
Enterprise Tech Lead
- Nicht nur nach Nutzungs-Ranking waehlen; eigenes Eval-Set (Akzeptanzrate, Fehlerrate, reale Latenz) ist Pflicht.
- Schicht-Routing: Smalltalk/Kreativ guenstig, Klassifikation/schwere Reasoning/hochriskante Agents auf Closed-Source-Flaggschiffe — direkte Hantel-Lektion.
- «Sicherheitsbilanz des Modellanbieters» in die Auswahl-Scorecard aufnehmen.
AI-Agent- / Coding-Tool-Produzenten
- Cline → Kilo Code zeigt: Open-Source-Moat ist flacher als gedacht, Nachfolger koennen schnell ueberholen.
- Roleplay/Begleitung ist groesser als Enterprise-Berichte vermuten — Entertainment-Produkte nicht ignorieren.
8. Fuenf Schritte Schicht-Routing-Runbook
Schritt 1 — Nach Task-Risiko und Fehlertoleranz splitten
Massen/fehlertolerant → DeepSeek V4 Flash, Mimo V2.5; schwere Reasoning/hochriskante Agents → Claude Opus 5.
Schritt 2 — Primaermodell und Fallback auf OpenRouter
Schritt 3 — 35-fachen Preisabstand in Monatsrechnung einrechnen
Bei 10M Input-Token/Tag grob: DeepSeek V4 Flash ca. $5-14/Tag, GPT-5.5 ca. $50/Tag — ROI von Schicht-Routing ist enorm.
Schritt 4 — Gateway auf Mac Cloud 7x24 verlagern
launchd fuer OpenClaw, API-Keys per Umgebungsvariable. Siehe OpenRouter-API-Anleitung und Juni-Ranking-Analyse.
Schritt 5 — Monatliches Review: Ranking und eigenes Eval-Set
9. Zitierfaehige technische Fakten
- Xiaomi Mimo V2.5 1,4T Token/Tag — Juli-Modell-Ranking Platz 1; DeepSeek V4 Flash 943,9B/Tag Platz 2.
- Chinesische Anbieter auf OpenRouter ca. 46% Token-Anteil, von unter 2% in einem Jahr; US-Big-Three ca. 30-36%.
- DeepSeek V4 Flash vs. GPT-5.5 Input ca. 35-facher Preisabstand; Hermes Agent ca. 45% App-Token.
- Claude Opus 5 FrontierBench v0.1 43,3%; schwere Reasoning Ausgabenanteil Claude Sonnet 4.6 / Opus 4.7 je 13,5%.
10. Fazit: Capability und Popularity driften auseinander
Der Juli-Satz, der bleibt: Capability und Popularity driften auseinander. Chinesische Open-Source-Modelle gewinnen mit Preis die Haelfte des Traffics; US-Closed-Source-Flaggschiffe halten Preismacht und Sicherheits-Moat bei schweren Tasks. Wichtiger als «Wer ist Nr. 1?» ist ein Eval-System und Schicht-Routing.
Multi-Modell-Gateway auf Laptop oder reinem Linux-VPS hat Schwaechen: Deckel zu, fehlende Apple-Toolchain, komplexes Debugging. Fuer OpenClaw / Cursor Agent 7x24 mit DeepSeek, Opus und GLM: VPSMAC M4 Mac-Cloud-Knoten mieten — Modell nach Ranking wechseln, Laufzeit bleibt.