Fazit zuerst
- Keinen Einzelpreis suchen: Abrechnungsweg wählen (Free / Standard / Batch / Vertex).
- Tokenkosten treibt Output + Thinking, nicht der Input-Aufkleber.
- Flash oft gratis in der Tabelle. 3.1 Pro Preview ohne Free Tier.
- 3.7/3.6-Flash-Intro bis 2026-12-31, danach verdoppelt.
- Deckel-Retries kaufen dasselbe Thinking. Wasserscheide: Track × Output-Mix × Host.
Modellgüte ist nicht die Wasserscheide. Abrechnungsweg und Thinking-Anteil sind es.
0. Fazit zuerst
Stand 2026-08-19 ist die Gemini-Developer-API-Preisseite kein Monatsabo, sondern eine Matrix: Modell × Standard/Batch/Flex/Priority × USD je 1 Mio. Token. Studio-Chat ist in vielen Ländern gratis. Produktions-Gemini-API-Preise hängen von Billing, Free Tier, In/Out-Mix, Thinking, Batch und Cache ab.
Arbeitszahlen (USD/1M, Paid Standard): 2.5 Flash-Lite ~$0,10 / $0,40. 2.5 Flash und 3.5 Flash-Lite ~$0,30 / $2,50. 3 Flash Preview ~$0,50 / $3,00. 3.5 Flash ~$1,50 / $9,00. 3.7/3.6 Flash Intro ~$0,75 / $3,75 (ab 2027-01-01 etwa das Doppelte). 3.1 Pro Preview ohne Free Tier, ≤200k ~$2 / $12. Output inklusive Thinking. Stack: KI-Agent-Stack 2026.
1. Warum „Was kostet die Gemini API?“ keine Zahl ist
Teams verwechseln Studio-Chat mit unendlichem Free-API, setzen Pro-Preise für Flash an und kalkulieren nur Input. PoC-Woche $0, erste Produktionswoche füllt Output-Token, Deckel-zu-Timeouts kaufen Thinking erneut. 2026 ergänzt Queues, Intro-Ablauf und 200k-Stufen.
- Gratis heißt RPM/RPD; Daten können Produkte verbessern.
- Batch/Flex ≈ halber Preis gegen Latenz; Priority teurer.
- Search Grounding Gemini 3.x: ~5.000/Monat geteilt gratis, danach ~$14 / 1k.
- Audio/Bild/Veo/TTS sind andere Zeilen. Vergleich Sitz-Abo: Claude-Code-Preise 2026.
Im Finanzmodell «Probewoche» und «Tool-Loop-Woche» trennen. Im Studio wirken es Hunderte Token, der Agent schreibt bei jedem functionCall erneut Thinking. Jahresbudgets auf 3.7-Flash-Intro brauchen eine Spalte 2027-01-01 verdoppelt — sonst sieht Q1 wie Nutzungs-Explosion aus, ist aber nur das Ende der Intro.
Free Tier prüft Schema und functionCall-Form, trägt keine DAU. Sobald Paid an ist: Keys ins Backend, tägliches USD-Cap.
- Context Cache hat Schreiben, Speicher und Hit-Read. Nur Input-Preis unterschätzt lange Systemprompts.
- Priority ist keine klügere Modellklasse, sondern eine teurere Queue.
- Vertex und Developer API können dieselbe model id teilen, Rechnung und IAM nicht. Ein JSON Schema bleibt die Quelle.
2. Fünf Abrechnungswege
2.1 Studio-UI
Prompts testen. Kein Produktions-RPM, keine Trainingsgarantie.
2.2 API-Free-Tier
Key aus AI Studio. Flash oft Free of charge; 3.1 Pro Preview Not available. Rate Limits. Nicht für 24/7-Agenten.
2.3 Bezahlte Developer API
Höhere Limits, Cache, Batch. Paid meist ohne Training. Billing.
2.4 Vertex / Enterprise
IAM, VPC-SC, Vertrag, Region. Andere Stückpreise. Vertex-Preise. Wegen Compliance wählen.
2.5 Ausführungshost (versteckt)
Die API-Rechnung enthält kein Mac und kein MCP. Timeouts kaufen Thinking zweimal. MCP auf Cloud-Mac vs. VPS vs. lokal.
3. Vergleich mit gleichen Spalten
| Ebene / Option | Einstieg | Ausführung | Kontext | Kosten | Rechtegrenze |
|---|---|---|---|---|---|
| API Free | Key / Studio | Inferenz + functionCall im Kontingent | Kann Produkte verbessern | Aufkleber $0, Cap = RPM | Keine Keys im Browser |
| Paid Standard | Abgerechnete Developer API | Prod-RPM, bezahltes Grounding | Paid meist ohne Training | Je 1M Token, Thinking im Output | Keys im Backend |
| Batch / Flex | Asynchron | Rabatt gegen Wartezeit | Nachtjobs | ~50 %, oft kein Free-Batch | GCP-Rechnung |
| Priority | Peak | Teurer | Online-Spitzen | 3.7 Intro z. B. $1,35 / $6,75 | SLO vor Stückpreis |
| Vertex | GCP / Einkauf | Region, Vertrag | Unternehmensgrenze | Vertrag ≠ Blogtabelle | IAM / VPC-SC |
| Host | Laptop / VPS / Cloud-Mac | MCP, Builds, Signatur | Repos, Zertifikate | Tagesmiete + Retry-Token | Prozessrechte |
Ein günstigeres Flash heilt nicht „jedes Timeout kauft Thinking erneut“.
3.1 Standard-Spickzettel (offiziell 2026-08)
| Modell | Free | Input | Output (inkl. Thinking) | Notiz |
|---|---|---|---|---|
| 2.5 Flash-Lite | ja | $0,10 | $0,40 | günstigster Text |
| 2.5 Flash / 3.5 Flash-Lite | ja | $0,30 | $2,50 | Balance |
| 3.5 Flash | ja | $1,50 | $9,00 | Cache-Read $0,15 |
| 3.6 / 3.7 Flash | ja | $0,75→$1,50 | $3,75→$7,50 | Intro bis 2026-12-31 |
| 3.1 Pro Preview | nein | $2 / $4 | $12 / $18 | keine Free-Keys |
| 2.5 Pro | ja | $1,25 / $2,50 | $10 / $15 | 200k-Stufen |
4. Szenarien
| Ebene / Option | Einstieg | Ausführung | Kontext | Kosten | Rechtegrenze |
|---|---|---|---|---|---|
| Lernen / Demo | Studio + Free-Key | Flash-Lite, Thinking aus | Ein Notebook | Ziel $0 | nur Testkeys |
| Wöchentliches Produkt | Paid + Flash-Lite | Toolschritte kappen | Kurzkontext + Cache | Output 3–8× Input budgetieren | Backend-Proxy |
| Code-Agent | Paid, optional 3.7-Intro | kleines Thinking, Fail-Fuse | Repo-Zusammenfassung | Output dominiert | MCP immer an |
| Nacht-Evals | Batch / Flex | Stunden-OK | Massendateien | Rabatt gegen SLA | Queue dokumentieren |
| Compliance | Vertex | andere Rechnung | Daten in VPC | Einkaufspreis | Least-Privilege-IAM |
| iOS kolokal | Cloud-Mac + MCP | Gemini nur Inferenz | Zertifikate auf dem Mac | Tagesmiete + API | Keychain bleibt |
5. Empfohlene Stacks
A Privat: Studio → Free 2.5 Flash-Lite B Produkt: Paid API + Flash, System cachen, Batch nachts, Pro nur Router C 2026 Q4: 3.7-Intro mit 2027-01-01-Verdopplung stresstesten D Apple: Inferenz Gemini, MCP/Signatur auf Cloud-Mac
6. Fallstricke
- Fallstrick 1: Studio-gratis ≠ unendliche API. 429 ist das Produkt.
- Fallstrick 2: Nur Input kalkulieren. Thinking sitzt im Output.
- Fallstrick 3: 3.1 Pro Preview mit Free-Key schlagen.
- Fallstrick 4: Intropreise ohne Ablauf ins Jahresbudget.
- Fallstrick 5: Keys im Browser.
- Fallstrick 6: Unbegrenzte Retries.
- Fallstrick 7: Grounding/Bild/TTS in die Textzelle mischen.
7. Sieben Schritte
- Offizielle Tabelle: Model-ID, Free ja/nein, Intro-Ablauf.
- Echten Produktionsprompt messen — nicht „Hallo“.
- Toolschritte und Tages-USD-Cap; bei 429 Flash-Lite.
- Systemprompt und Tool-Schema cachen.
- Offline Batch, live Standard/Priority.
- MCP und Builds weg vom zuklappenden Laptop. MCP und Cloud-Mac.
- Interne Preisliste mit 2027-01-01-Stresspreis; monatlich Invoice-Diff.
8. FAQ
Gibt es noch ein Free Tier?
Pro Modell. Flash und 2.5 Pro oft Free of charge. 3.1 Pro Preview nicht. Gratis = niedriges RPM und mögliche Produktverbesserung.
Wohin gehört Thinking?
In den Output. Cache ist die dritte Spalte.
Ist Batch immer günstiger?
Paid Batch oft ~50 %, häufig ohne Free-Batch, ungeeignet für Dialog.
Developer API vs. Vertex?
Tabellen nicht quer vergleichen. Vertex verkauft Region und Vertrag. Startups sind auf der Developer API schneller.
Warum Cloud-Mac?
Gemini verkauft Inferenz. Stirbt MCP/Xcode auf dem Laptop, wird Thinking erneut berechnet. Immer-an Cloud-Mac senkt verschwendete Tokenkosten.
9. Zusammenfassung
Die Gemini-API-Preise 2026 sind eine Matrix mit Verfallsdatum. Den Monat bestimmt Output+Thinking-Anteil plus, ob Sie Fehler zweimal bezahlen. Reihenfolge: Tabelle → echten Prompt messen → Flash default → Pro nur routen → Cache und Batch → Host immer an.