API-Preise ändern sich wöchentlich—DeepSeek V3.2 führt im Ultra-Budget, Gemini Flash-Lite profitiert vom Ökosystem, doch Multi-Turn-Agents machen aus „günstig“ „teuer“. Wiederverwendbares Ranking-Framework mit August-2026-Offiziellpreisen.
Wie wir „günstigste“ ranken
Viele Listen vergleichen nur Input-Preise oder mischen OpenRouter-Volumen ein. Unsere Haupttabelle nutzt drei Regeln:
| Regel | Bedeutung |
|---|---|
| Blend-Kosten | 60 % Input + 40 % Output pro 1M Tokens (USD) |
| Offiziell | Herstellerpreise Stand August 2026 |
| Nachhaltig | Keine Gratis-Trials; nur bezahlte Tiers |
Kurz: DeepSeek führt Ultra-Budget; Gemini Flash-Lite top 3 im Blend; Multi-Turn-Agents vervielfachen die Lücke.
Haupttabelle August 2026
Blend = Input×0.6 + Output×0.4
| Rang | Modell | In | Out | Blend | Einsatz |
|---|---|---|---|---|---|
| 1 | DeepSeek V3.2 | 0,14 | 0,28 | ~0,20 | Hohes Volumen |
| 2 | Gemini 2.0 Flash-Lite | 0,075 | 0,30 | ~0,17 | Kurzantworten |
| 3 | GPT-4.1 Nano | 0,10 | 0,40 | ~0,22 | Tagging |
| 4 | Mistral Small 3.1 | 0,10 | 0,30 | ~0,18 | EU-Region |
| 5 | Qwen3 32B | ~0,15 | ~0,60 | ~0,33 | Chinesisch |
| 6 | Claude Haiku 4.5 | 1,00 | 5,00 | ~2,60 | Niedrige Latenz |
| 7 | GPT-4.1 Mini | 0,40 | 1,60 | ~0,88 | Allgemein |
| 8 | Gemini 2.5 Flash | 0,30 | 2,50 | ~1,18 | Multimodal |
| 9 | Claude Sonnet 4 | 3,00 | 15,00 | ~7,80 | Schweres Reasoning |
| 10 | GPT-5.4 / Opus | 5,00+ | 25,00+ | ~13+ | Top-Qualität |
Ränge 1–4 liegen nah—wählen Sie nach Latenz und Tool-Stabilität. Drei Ebenen: L1 günstig → L2 mittel → L3 Flagship.
Embedding & Batch
| Typ | Führend | $/1M |
|---|---|---|
| Embedding | Gemini / OpenAI small | 0,02–0,025 |
| Batch | Async | ~50 % Rabatt |
Versteckte Kosten
Output oft 60–75 %, Agents 8–20×, Prompt-Cache, OpenRouter-Aufschlag, GPU-Fixkosten beim Self-Hosting.
Szenarien
| Produkt | Stack | Monat @ DAU 100 |
|---|---|---|
| Chat | DeepSeek / Flash-Lite | $15–80 |
| RAG | Flash-Lite + Embedding | $80–350 |
| Coding-Agent | Sonnet + Nano | $150–600+ |
Update-Richtlinie
Erster Werktag im Monat Preise prüfen. >15 % Änderung in 72 h footnoten. 2026-08-04: DeepSeek #1, Flash-Lite top 3 Blend.
Sparen heute
Kleines Modell default, Cache an, max_tokens, Embedding getrennt, Tagesalarm, Dual-Vendor.
Preise öffentlich zum Redaktionsschluss; Abrechnung maßgeblich.
Gestuftes Routing—Laufzeitumgebung in TCO einrechnen
Günstige Tokens auf instabilem VPS: Ersparnis durch Retries verloren.
Nuvcloud dediziertes M4 Mac mini für Xcode, OpenClaw, lange Agents.