Angebot

Gemini-API-Preise 2026: Tokenkosten und kostenloses Kontingent erklärt

KI-Engineering Gemini API · Preise · Token
2026-08-19 ~14 Min.

Fazit: Suchen Sie keinen einzelnen Gemini-API-Preis — wählen Sie den Abrechnungsweg.

Wasserscheide ist Output + Thinking. 3.1 Pro Preview ohne Free Tier; 3.7-Flash-Intro bis 2026-12-31.

Fazit zuerst

  1. Keinen Einzelpreis suchen: Abrechnungsweg wählen (Free / Standard / Batch / Vertex).
  2. Tokenkosten treibt Output + Thinking, nicht der Input-Aufkleber.
  3. Flash oft gratis in der Tabelle. 3.1 Pro Preview ohne Free Tier.
  4. 3.7/3.6-Flash-Intro bis 2026-12-31, danach verdoppelt.
  5. Deckel-Retries kaufen dasselbe Thinking. Wasserscheide: Track × Output-Mix × Host.
Modellgüte ist nicht die Wasserscheide. Abrechnungsweg und Thinking-Anteil sind es.
Gemini-API-Preistabelle und Tokenkosten-Dashboard
Zuerst den Abrechnungsweg festlegen, dann die Million-Token-Zeilen lesen.

0. Fazit zuerst

Stand 2026-08-19 ist die Gemini-Developer-API-Preisseite kein Monatsabo, sondern eine Matrix: Modell × Standard/Batch/Flex/Priority × USD je 1 Mio. Token. Studio-Chat ist in vielen Ländern gratis. Produktions-Gemini-API-Preise hängen von Billing, Free Tier, In/Out-Mix, Thinking, Batch und Cache ab.

Arbeitszahlen (USD/1M, Paid Standard): 2.5 Flash-Lite ~$0,10 / $0,40. 2.5 Flash und 3.5 Flash-Lite ~$0,30 / $2,50. 3 Flash Preview ~$0,50 / $3,00. 3.5 Flash ~$1,50 / $9,00. 3.7/3.6 Flash Intro ~$0,75 / $3,75 (ab 2027-01-01 etwa das Doppelte). 3.1 Pro Preview ohne Free Tier, ≤200k ~$2 / $12. Output inklusive Thinking. Stack: KI-Agent-Stack 2026.

1. Warum „Was kostet die Gemini API?“ keine Zahl ist

Teams verwechseln Studio-Chat mit unendlichem Free-API, setzen Pro-Preise für Flash an und kalkulieren nur Input. PoC-Woche $0, erste Produktionswoche füllt Output-Token, Deckel-zu-Timeouts kaufen Thinking erneut. 2026 ergänzt Queues, Intro-Ablauf und 200k-Stufen.

  • Gratis heißt RPM/RPD; Daten können Produkte verbessern.
  • Batch/Flex ≈ halber Preis gegen Latenz; Priority teurer.
  • Search Grounding Gemini 3.x: ~5.000/Monat geteilt gratis, danach ~$14 / 1k.
  • Audio/Bild/Veo/TTS sind andere Zeilen. Vergleich Sitz-Abo: Claude-Code-Preise 2026.

Im Finanzmodell «Probewoche» und «Tool-Loop-Woche» trennen. Im Studio wirken es Hunderte Token, der Agent schreibt bei jedem functionCall erneut Thinking. Jahresbudgets auf 3.7-Flash-Intro brauchen eine Spalte 2027-01-01 verdoppelt — sonst sieht Q1 wie Nutzungs-Explosion aus, ist aber nur das Ende der Intro.

Free Tier prüft Schema und functionCall-Form, trägt keine DAU. Sobald Paid an ist: Keys ins Backend, tägliches USD-Cap.

  • Context Cache hat Schreiben, Speicher und Hit-Read. Nur Input-Preis unterschätzt lange Systemprompts.
  • Priority ist keine klügere Modellklasse, sondern eine teurere Queue.
  • Vertex und Developer API können dieselbe model id teilen, Rechnung und IAM nicht. Ein JSON Schema bleibt die Quelle.

2. Fünf Abrechnungswege

2.1 Studio-UI

Prompts testen. Kein Produktions-RPM, keine Trainingsgarantie.

2.2 API-Free-Tier

Key aus AI Studio. Flash oft Free of charge; 3.1 Pro Preview Not available. Rate Limits. Nicht für 24/7-Agenten.

2.3 Bezahlte Developer API

Höhere Limits, Cache, Batch. Paid meist ohne Training. Billing.

2.4 Vertex / Enterprise

IAM, VPC-SC, Vertrag, Region. Andere Stückpreise. Vertex-Preise. Wegen Compliance wählen.

2.5 Ausführungshost (versteckt)

Die API-Rechnung enthält kein Mac und kein MCP. Timeouts kaufen Thinking zweimal. MCP auf Cloud-Mac vs. VPS vs. lokal.

3. Vergleich mit gleichen Spalten

Ebene / OptionEinstiegAusführungKontextKostenRechtegrenze
API FreeKey / StudioInferenz + functionCall im KontingentKann Produkte verbessernAufkleber $0, Cap = RPMKeine Keys im Browser
Paid StandardAbgerechnete Developer APIProd-RPM, bezahltes GroundingPaid meist ohne TrainingJe 1M Token, Thinking im OutputKeys im Backend
Batch / FlexAsynchronRabatt gegen WartezeitNachtjobs~50 %, oft kein Free-BatchGCP-Rechnung
PriorityPeakTeurerOnline-Spitzen3.7 Intro z. B. $1,35 / $6,75SLO vor Stückpreis
VertexGCP / EinkaufRegion, VertragUnternehmensgrenzeVertrag ≠ BlogtabelleIAM / VPC-SC
HostLaptop / VPS / Cloud-MacMCP, Builds, SignaturRepos, ZertifikateTagesmiete + Retry-TokenProzessrechte

Ein günstigeres Flash heilt nicht „jedes Timeout kauft Thinking erneut“.

3.1 Standard-Spickzettel (offiziell 2026-08)

ModellFreeInputOutput (inkl. Thinking)Notiz
2.5 Flash-Liteja$0,10$0,40günstigster Text
2.5 Flash / 3.5 Flash-Liteja$0,30$2,50Balance
3.5 Flashja$1,50$9,00Cache-Read $0,15
3.6 / 3.7 Flashja$0,75→$1,50$3,75→$7,50Intro bis 2026-12-31
3.1 Pro Previewnein$2 / $4$12 / $18keine Free-Keys
2.5 Proja$1,25 / $2,50$10 / $15200k-Stufen

4. Szenarien

Ebene / OptionEinstiegAusführungKontextKostenRechtegrenze
Lernen / DemoStudio + Free-KeyFlash-Lite, Thinking ausEin NotebookZiel $0nur Testkeys
Wöchentliches ProduktPaid + Flash-LiteToolschritte kappenKurzkontext + CacheOutput 3–8× Input budgetierenBackend-Proxy
Code-AgentPaid, optional 3.7-Introkleines Thinking, Fail-FuseRepo-ZusammenfassungOutput dominiertMCP immer an
Nacht-EvalsBatch / FlexStunden-OKMassendateienRabatt gegen SLAQueue dokumentieren
ComplianceVertexandere RechnungDaten in VPCEinkaufspreisLeast-Privilege-IAM
iOS kolokalCloud-Mac + MCPGemini nur InferenzZertifikate auf dem MacTagesmiete + APIKeychain bleibt

5. Empfohlene Stacks

A Privat: Studio → Free 2.5 Flash-Lite
B Produkt: Paid API + Flash, System cachen, Batch nachts, Pro nur Router
C 2026 Q4: 3.7-Intro mit 2027-01-01-Verdopplung stresstesten
D Apple: Inferenz Gemini, MCP/Signatur auf Cloud-Mac

6. Fallstricke

  • Fallstrick 1: Studio-gratis ≠ unendliche API. 429 ist das Produkt.
  • Fallstrick 2: Nur Input kalkulieren. Thinking sitzt im Output.
  • Fallstrick 3: 3.1 Pro Preview mit Free-Key schlagen.
  • Fallstrick 4: Intropreise ohne Ablauf ins Jahresbudget.
  • Fallstrick 5: Keys im Browser.
  • Fallstrick 6: Unbegrenzte Retries.
  • Fallstrick 7: Grounding/Bild/TTS in die Textzelle mischen.

7. Sieben Schritte

  1. Offizielle Tabelle: Model-ID, Free ja/nein, Intro-Ablauf.
  2. Echten Produktionsprompt messen — nicht „Hallo“.
  3. Toolschritte und Tages-USD-Cap; bei 429 Flash-Lite.
  4. Systemprompt und Tool-Schema cachen.
  5. Offline Batch, live Standard/Priority.
  6. MCP und Builds weg vom zuklappenden Laptop. MCP und Cloud-Mac.
  7. Interne Preisliste mit 2027-01-01-Stresspreis; monatlich Invoice-Diff.

8. FAQ

Gibt es noch ein Free Tier?

Pro Modell. Flash und 2.5 Pro oft Free of charge. 3.1 Pro Preview nicht. Gratis = niedriges RPM und mögliche Produktverbesserung.

Wohin gehört Thinking?

In den Output. Cache ist die dritte Spalte.

Ist Batch immer günstiger?

Paid Batch oft ~50 %, häufig ohne Free-Batch, ungeeignet für Dialog.

Developer API vs. Vertex?

Tabellen nicht quer vergleichen. Vertex verkauft Region und Vertrag. Startups sind auf der Developer API schneller.

Warum Cloud-Mac?

Gemini verkauft Inferenz. Stirbt MCP/Xcode auf dem Laptop, wird Thinking erneut berechnet. Immer-an Cloud-Mac senkt verschwendete Tokenkosten.

9. Zusammenfassung

Die Gemini-API-Preise 2026 sind eine Matrix mit Verfallsdatum. Den Monat bestimmt Output+Thinking-Anteil plus, ob Sie Fehler zweimal bezahlen. Reihenfolge: Tabelle → echten Prompt messen → Flash default → Pro nur routen → Cache und Batch → Host immer an.

Token für Inferenz, nicht für Deckel-Retries

Stückpreise sind öffentlich. Das Budget sprengt Timeout plus MCP-Abbruch und erneutes Thinking. Dediziertes M4-Cloud-Mac hält Host, Repo und MCP auf einem immer-an Pfad. Tagesmiete zur Abnahme, dann Monat.

Vergleich · Tarife · Start