Kernpunkte
- Offiziell bestätigt: Am 19. Mai 2026 auf der I/O die Gemini-3.5-Familie vorgestellt; Gemini 3.5 Flash am selben Tag GA; Pro intern im Einsatz, öffentlicher Rollout für „nächsten Monat“ geplant — dieser Zeitplan wurde verschoben.
- Stand 13. Juli: Pro weiterhin in der Vertex-AI-Unternehmensvorschau; in der öffentlichen API kein GA-Eintrag für
gemini-3.5-pro; mehrere Medien nennen den 17. Juli als Zieldatum — Google hat es nicht offiziell bestätigt. - Nicht offiziell, aber weit verbreitet: 2M-Token-Kontext, Deep-Think-Reasoning-Schicht, API ca. $15/$60 pro Million Token, Ultra-Abo ab $250/Monat.
- Jetzt verfügbar: Gemini 3.5 Flash (1M Kontext, $1,50/$9 pro Million Token) deckt die meisten Agent- und Coding-Szenarien ab.
- Die Entscheidungsgrenze ist nicht „wer ist schlauer“, sondern Kontextlänge × Reasoning-Kosten × Ausführungsumgebung — lange Agenten gehören auf einen Cloud Mac mit 24/7-Toolchain.
Fazit vorab: Flash arbeitet heute, Pro lohnt das Warten — aber nicht für Produktion
Bis Google eine offizielle Model Card veröffentlicht, sind alle Pro-Zahlen Wetten — keine Vertragsklauseln.
Drei Sätze zum Merken: ① Gemini 3.5 Flash ist Googles Standard für Entwickler 2026; ② Gemini 3.5 Pro ist das „Schwere Geschütz“ der Familie, aber Mitte Juli noch nicht öffentlich GA; ③ Produktionssysteme an ein „angeblich 17. Juli“-Datum zu binden, ist riskanter als sinnvoll.
Im offiziellen Blog bleibt Google zurückhaltend: Die 3.5-Familie steht für „frontier intelligence with action“ — Agenten und Coding; Flash sofort verfügbar; Pro „intern im Einsatz, Start nächsten Monat erwartet“. Sundar Pichai auf der I/O-Bühne mit gleicher Linie. Im offiziellen Text stehen weder 2M Kontext noch Deep Think noch API-Preise — das kommt aus Medienberichten und Enterprise-Leaks und braucht eine Vertrauensstufe.
Pragmatisch für Engineers: Flash für Antigravity / Gemini API / Vertex-Agent-Pipelines, Aufgaben mit „2M Token ganzes Repo auf einmal“ oder „harte Mehrschritt-Reasoning“ ins Backlog, Default-Modell erst wechseln, wenn der Gemini-API-Changelog einen GA-Eintrag zeigt. Wie in unserem GPT-5.6- und Gemini-Auswahlleitfaden: Modell-Launches häufen sich — Workflow-Einstieg und Ausführungsknoten zuerst fixieren.
1. Warum „verzögert“ sich Gemini 3.5 Pro gegenüber Flash?
Dass Flash am I/O-Tag GA wurde, ist kein Zufall. Google positioniert 3.5 Flash als hochdurchsatz, agentenpriorisiertes Standardmodell: 1M Kontext, dynamisches Thinking standardmäßig an, Terminal-Bench 2.1 76,2 % u. a. in der I/O-Ankündigungsliste. Es soll zeigen: „Flash kann Flaggschiff-Niveau“ — entscheidend für Suche, Gemini App und Antigravity-Default.
Pro hat eine andere Rolle. Medien (u. a. Business Insider, Geeky Gadgets) berichten: In der Enterprise-Vorschau erreichte Pro bei langen Agent-Läufen Token-Effizienz und Qualität nicht die interne Bar — daher Architektur-Neuaufbau, GA von Juni auf Juli verschoben, Berichte nennen 17. Juli als Ziel. Google kommentiert konkrete Daten nicht — „17. Juli“ ist ein Branchen-Konsens-Fenster, kein SLA-Versprechen.
Was scheiterte am alten Plan? Viele Teams schrieben nach der I/O „Juni: voll auf Pro“:
- Budget nach „Gerücht $15/$60“ fixiert — im Juni nur Flash abrechenbar, Finanzmodell verzerrt.
- Prompts und Toolchains in Vertex-Preview ohne abstrahierte Model-ID — Umschalten bei GA bedeutet Nacharbeit.
- „2M ganzes Repo in einem Rutsch“ als Architektur-Prämisse — Flash 1M + Retrieval/Chunking schafft oft 80 %.
- Lange Agenten auf dem Laptop: Deckel zu, Verbindung weg — nicht Pro-Schuld, wird aber dem Release zugeschrieben.
Kernlektion: Google wartet lieber einen Monat, als mit einem unterparigen „Ultra-Nachfolger“ die Marke zu riskieren. Signal für Nutzer: Flash ist schon stark — Pro muss deutlich stärker sein für eigene Preisstufe.
2. Was ist Gemini 3.5 Pro? Abgrenzung zu Flash
2.1 Familienpositionierung (offiziell)
Laut Google ist Gemini 3.5 die neue Modellfamilie 2026 mit Fokus Agenten, Coding, Langläufer. Flash: „Default, schnell, breite Abdeckung“; Pro: „schwerste Reasoning, längster Kontext, höchste Qualität“ — narrative Nachfolge von Gemini Ultra / 3.1 Pro, ohne dass Google im I/O-Text „Ultra umbenannt“ schreibt — nur „3.5 Pro“.
2.2 Gemini 3.5 Flash (GA, Referenz)
Pro ohne Flash-Vergleich lässt sich „warten oder nicht?“ nicht beantworten:
- API-ID:
gemini-3.5-flash(GA, ohne preview-Suffix) - Kontext: 1.048.576 Input-Token / 65.536 Output-Token (offizielle Doku)
- Preis: $1,50 / $9,00 pro Million Input/Output-Token; Cache-Input $0,15
- Vertrieb: Gemini App, AI Mode in Search, Gemini API, AI Studio, Android Studio, Google Antigravity, Vertex AI, Gemini Enterprise
- Fähigkeiten: Multimodal-Input, Function Calling, Code-Ausführung, Such-Tools, dynamisches Thinking
2.3 Gemini 3.5 Pro (Vorschau / GA ausstehend)
Stand 2026-07-13 öffentlich bestätigt:
- Google bestätigt Pro existiert und intern genutzt wird; öffentlicher Rollout von „nächsten Monat (Juni)“ verschoben.
- Vertex-AI-Enterprise-Kunden in begrenzter Vorschau (nicht Self-Service für alle).
- Öffentliche Gemini-API-Liste:
gemini-3.5-flash,gemini-3.1-pro-previewu. a. — keine Pro-GA-Model-Card.
Medienberichtete Pro-Differenzierung (bei GA zu prüfen):
- 2M-Token-Kontext — etwa doppelt Flash, für ganzes Repo, lange Compliance-Docs, lange Agent-Spuren.
- Deep-Think-Reasoning-Schicht — Mehrschritt-Logik, komplexe Mathematik, Planung; angeblich an Abo-Tier gebunden (siehe Preise).
- Stärkeres Multimodal & UI-Generierung — interaktive Web-UI der Gemini-3-Serie, hardest reasoning.
- Niedrigere Latenz kein Verkaufsargument — Pro qualitätsorientiert, ergänzt Flash statt zu ersetzen.
3. Release-Zeitplan: von der I/O bis Mitte Juli
| Zeit | Ereignis | Vertrauensstufe |
|---|---|---|
| 2026-05-19 | Google I/O: Gemini 3.5; Flash GA; Pro intern, öffentlich „nächsten Monat“ | Offiziell |
| 2026-05 ~ 06 | Flash Default in Gemini App / Search AI Mode; Antigravity, Enterprise synchron | Offiziell |
| Ende Juni 2026 | Medien: Pro-GA von Juni auf Juli; Vertex-Preview läuft; API-Changelog ohne Pro-GA | Medien + API-Stand |
| 2026-07-08 ~ 17 | Mehrere Outlets: Google-Ziel 17. Juli GA; Architektur-Rebuild und Preview-Feedback | Medien (nicht angekündigt) |
| 2026-07-13 (Artikeldatum) | Pro noch nicht öffentlich GA; Entwickler: Flash in Produktion, Changelog beobachten | Faktischer Stand |
Offizielle News verfolgen? Zwei Quellen: Google DeepMind / Gemini-Modell-Blog und Gemini API Changelog. Am GA-Tag typischerweise: Model Card, Preisseite, AI-Studio-Default. Nur Schlagzeile ohne diese drei — weiter als Vorschau behandeln.
4. Funktionsliste: offiziell bestätigt vs. erwartet
| Fähigkeit | Flash (GA) | Pro (erwartet / Berichte) | Status |
|---|---|---|---|
| Agent-Langläufer | Offiziell im Fokus | Stärkeres Reasoning & Planning | Flash bestätigt; Pro nach GA testen |
| Kontextfenster | 1M Token | 2M Token (Berichte) | Flash offiziell; Pro nicht angekündigt |
| Deep Think / Tiefen-Reasoning | Dynamisches Thinking standard an | Eigene Deep-Think-Schicht (Berichte) | Pro nicht angekündigt |
| Coding / Terminal-Bench | 76,2 % (I/O) | Erwartet über Flash | Flash mit Zahl; Pro ausstehend |
| Multimodal | Bild, Text, Audio, Video | Stärkere interaktive UI (Berichte) | Flash bestätigt |
| Antigravity / Vertex | Angebunden | In Vorschau | Flash GA; Pro Enterprise-Preview |
Für Entwickler hängt der „Wert“ einer Funktion vom Aufgabentyp ab:
- Code-Review + Patch unter 800K Token: Flash meist ausreichend, Kosten kontrollierbar.
- Gesamtes Dependency-Graph + Cross-Service-Trace in einem Output: 2M theoretisch Vorteil — Pro-Latenz und Halluzinationsrate abwarten.
- Mehrschritt-Mathe, komplexe Compliance-Reasoning: Deep Think als eigenes Tier könnte OpenAI
reasoning.effort=maxoder Claude extended thinking entsprechen.
5. Gemini 3.5 Pro Preis: offizielle Lücke und Schätzung
Google hat keine offiziellen Pro-API-Preise veröffentlicht. Nachfolgend gestaffelt — Gerüchte nicht als Rechnung behandeln.
5.1 Bestätigter Referenzpreis: Gemini 3.5 Flash
| Posten | Preis (USD) |
|---|---|
| Input-Token | $1,50 / Mio. (Nicht-Global-Region ca. $1,65) |
| Output-Token | $9,00 / Mio. (Nicht-Global-Region ca. $9,90) |
| Cache-Input | $0,15 / Mio. |
5.2 Medienberichtete Pro-Preise (unbestätigt)
Mehrere Medien in gleicher Größenordnung — nur für Budget-Sandkasten:
- API: ca. $15 / Mio. Input, $60 / Mio. Output — etwa 10× Flash.
- Consumer-Abo: Deep Think oder volle Pro-Fähigkeiten evtl. Gemini Advanced / Ultra (ca. $250/Monat) (Medien, nicht Google-Preisseite).
- Andere Outlets milder (z. B. $1,25 / $10) — widerspricht 10×-These — GA-Model-Card ist maßgeblich.
5.3 Grober Wettbewerbsvergleich (Entscheidungshilfe, keine Live-Quotes)
Pro-Gerücht vs. Flash und GPT-5.6 / Codex-Kontingentlogik im gleichen Rahmen:
- Hochfrequente Agenten, Millionen Token/Tag: Flash oder GPT-5.6 Luna/Terra realistischer.
- Selten, sehr langer Kontext, ein Schuss: Pro 2M evtl. TCO-Vorteil (weniger Calls für Qualität) — offizielle Preise abwarten.
- Terminal-Coding-Agent 24/7: Neben Modellkosten oft Ausführungsumgebung (dauerhaft laufender Cloud Mac) wichtiger als 5× Token-Preis.
6. Fünf Dimensionen: Pro (erwartet) vs. Flash vs. GPT-5.6 vs. Claude
| Dimension | Gemini 3.5 Flash | Gemini 3.5 Pro (erwartet) | GPT-5.6 Sol | Claude Mythos 5 |
|---|---|---|---|---|
| Verfügbarkeit | GA, alle Kanäle | Vorschau / GA ausstehend | GA (2026-07) | GA |
| Kontext | 1M (offiziell) | 2M (Berichte) | je nach Plan / API | ca. 200K+ |
| Coding-Agent | Terminal-Bench 76,2 % | Ausstehend | Terminal-Bench 88,8 % | SWE-bench Pro führend |
| API-Preis (Größenordnung) | $1,5 / $9 | Gerücht ~$15 / $60 | Sol/Terra/Luna getrennt | oberes Mittelfeld |
| Bester Einstieg | Antigravity / Gemini API | Vertex + AI Studio (bald) | Codex / Cursor | Claude Code CLI |
Die Tabelle zeigt nicht „wer gewinnt“, sondern: kein einzelner Default-Gewinner. Flash ist in Googles Ökosystem schon „schnell und günstig genug“ als Agent-Basis; Pro mit 2M + Deep Think würde sehr lange Dokumente und harte Reasoning abdecken; OpenAI und Anthropic sind bei Terminal-Coding und IDE-Einstieg reifer. Siehe GPT-5.6 Coding-Modellwahl.
7. Szenario-Matrix
| Szenario | Jetzt empfohlen | Nach Pro-GA prüfen | Nicht empfohlen |
|---|---|---|---|
| Antigravity-Default-Agent | 3.5 Flash | Pro je Aufgabe | Auf Pro warten und stoppen |
| Code-Review <1M Token | 3.5 Flash | — | Pro-Preview erzwingen |
| Monorepo-Analyse in einem Lauf | Flash + Chunking / Retrieval | 3.5 Pro 2M | Lokal auf Laptop erzwingen |
| Komplexe Finanz / Compliance-Reasoning | Flash + menschliche Prüfung | Deep Think (falls angekündigt) | Free-Tier langer Agent |
| iOS / Xcode CI-Agent | Flash API + Cloud Mac | Pro langer Kontext | Nur Web-UI ohne Toolchain |
| Produktion mit SLA | Flash GA + Version pinnen | Pro GA + Canary | An Gerücht-Release-Datum binden |
8. Empfohlene Stacks
【Stack A — Einzelentwickler / Test】
Modell: Gemini 3.5 Flash (AI Studio oder API)
Einstieg: Antigravity oder eigenes Skript + Function Calling
Ausführung: Kurz lokal; Lang auf Cloud Mac
Budget: Flash $1,5/$9 für Token; nicht 10× Pro reservieren
【Stack B — Enterprise Vertex】
Modell: Flash Produktion + Pro-Preview separates Projekt
Governance: Preview/Produktion unterschiedliche Service Accounts; Model-ID als Env-Var
Monitoring: Changelog-RSS + Kostenalarm (BigQuery Billing-Export)
Switch: Nach Pro-GA 10 % Traffic Canary → Benchmark-Regression → Voll
【Stack C — Multi-Modell-Coding-Team】
Retrieval / großes Repo: Gemini 3.5 Flash
Harte Reasoning / Architektur-Review: Pro abwarten oder Claude extended thinking
Terminal-Edits: Claude Code oder Codex auf Cloud-Mac-Worktree
IDE-Alltag: Cursor + GPT-5.6 Terra
Prinzip: Pro Aufgabe ein „Hauptmodell“, keine doppelten Token
9. Typische Fehler
- Fehler 1: Medienbericht als Model Card. 2M, Deep Think, $15/$60 stehen nicht im offiziellen I/O-Text — in Architekturdocs „unbestätigt“ markieren.
- Fehler 2: Flash nur Übergang. I/O-Daten: Flash schlägt 3.1 Pro in mehreren Agent-Benchmarks — Hauptmodell, kein „/lite“.
- Fehler 3: Bei Pro-Launch alle umstellen. Längerer Kontext ≠ niedrigere Gesamtkosten; ein fehlgeschlagener 2M-Call kann teurer sein.
- Fehler 4: Antigravity vs. API ignorieren. Gleiches Modell, andere Harness — Tools, Rechte, Latenz im echten Einstieg testen.
- Fehler 5: Während Pro-Wartezeit nichts deployen. Wettbewerb wartet nicht — Flash-Pipeline zuerst lohnt sich mehr als zwei Wochen Leerlauf.
10. Umsetzung in 7 Schritten
- Aufgaben inventarisieren: Anteil >1M Kontext oder harte Reasoning; unter 20 % reicht Flash als Hauptmodell.
- Flash-Produktionspfad: AI Studio oder Vertex-Projekt; API-Key / Workload Identity pro Umgebung.
- Model-ID abstrahieren:
GEMINI_MODEL=gemini-3.5-flash— keine verstreuten Hardcodes für Pro-GA-Switch. - Lange Agenten auf Ausführungsknoten: Stundenlange Toolchains auf Cloud Mac — Schlafmodus vermeiden (orthogonal zu Flash/Pro, aber kritisch).
- Changelog abonnieren: Gemini API + Google-AI-Blog; Kalender Mitte/Ende Juli auf GA prüfen.
- Pro-GA-Tag: Model Card lesen → internes Golden Set → Flash Kosten/Qualität → 10 % Canary.
- Zwei-Wochen-Review: Token, Erfolgsrate, manuelle Eingriffe — Daten entscheiden über 10× Preis.
11. FAQ
Ist Gemini 3.5 Pro veröffentlicht?
Stand 13. Juli 2026 noch nicht öffentlich GA. Google kündigte am 19. Mai auf der I/O Pro intern an, Start „nächsten Monat“ — verschoben; Enterprise-Kunden limitierte Vertex-AI-Vorschau. Medien nennen 17. Juli als Ziel — Google hat das Datum nicht bestätigt.
Was ist der Unterschied zwischen Gemini 3.5 Pro und Flash?
Flash voll verfügbar: schnelle Agenten und Coding, 1M Kontext, $1,50/$9 pro Million Token. Pro erwartet als Familien-Flaggschiff: Medien 2M Kontext, Deep Think, höhere API-Preise, stärkere Mehrschritt-Aufgaben — Specs laut GA-Model-Card.
Was kostet Gemini 3.5 Pro?
Google hat keine offiziellen Pro-Preise. Medien: API ca. $15/$60 pro Million Input/Output, etwa 10× Flash; Deep Think evtl. Ultra-Abo ~$250/Monat. Bis zur offiziellen Preisseite nur Flash in Vertrag und Budget.
Welches Gemini-Modell jetzt nutzen?
Produktion: Gemini 3.5 Flash (gemini-3.5-flash). Für Google-Ökosystem Agenten, Antigravity, Enterprise-Orchestrierung ist Flash 2026 der Default. Pro nur in Preview-Qualifikation, vom Produktions-Traffic getrennt.
Lohnt 2M Kontext das Warten auf Pro?
Hängt von der Aufgabe ab: 1M + RAG/Chunking deckt oft 80 % — nicht warten nötig. Routinemäßig ganzes Repo in einem Call mit hohen Retry-Kosten — A/B nach Pro-GA. Architektur vor GA nicht auf Gerücht-2M setzen.
12. Zusammenfassung
Was ist Gemini 3.5 Pro? — Googles 3.5-Flaggschiff der I/O 2026 für schwerste Reasoning und längsten Kontext, Mitte Juli noch nicht öffentlich GA. Funktionen und Preise: Flash hat vollständige Model Card; Pro-Zahlen 2M, Deep Think, $15/$60 sind „glaubwürdige Berichte, nicht angekündigt“. Release von „Juni“ auf „Mitte/Ende Juli“ — API-Changelog zählt, nicht Medien-Countdown.
Pragmatischer Weg: heute Flash für Agenten, morgen Pro als Upgrade. Modell-News wöchentlich — Engineering fixiert Ausführungsumgebung, Model-ID-Abstraktion und Kosten-Dashboard — den Rest ändern, wenn Sundar das nächste Mal im Blog unterschreibt.
Während Pro aussteht: Flash + Cloud Mac stabilisieren
Gemini 3.5 Flash per API für Coding-Agenten — Ausführung auf Cloud Mac mini M4: xcodebuild, Git-Worktree, SSH-Sessions ohne Abbruch. Nach Pro-GA nur Model-ID in Env-Vars ändern, Pipeline bleibt; Apple-Silicon-Unified-Memory für 1M-Kontext, macOS-Isolation reduziert Risiko falscher Agent-Zugriffe auf lokale Dateien.
Zuerst Tagesmiete für Antigravity / Gemini-API-Smoke-Tests, dann Monatsmiete dauerhaft. kvmboot Cloud Mac mini M4: „Flash heute, Pro morgen“ — Pakete ansehen und die GA-Wartezeit in lieferbare Agent-Pipelines verwandeln.