Offre limitée

Qu'est-ce que Gemini 3.5 Pro ? Fonctions, prix et date de sortie (2026)

Ingénierie IAGemini 3.5 · Guide modèle
2026-07-1312 min de lecture

Officiel vs rumeurs : contexte 2M, Deep Think, tarifs API, GA mi-juillet ; comparaison cinq axes avec Flash et GPT-5.6 et plan en 7 étapes.

Au 13 juillet 2026, Google a annoncé la famille Gemini 3.5 à l'I/O et livré Flash en GA, mais Gemini 3.5 Pro n'est toujours pas en GA public. Ce guide sépare l'officiel des rumeurs pour décider si Flash suffit aujourd'hui ou s'il faut budgéter Pro.

Points clés

  1. Confirmé officiellement : le 19 mai 2026 à l’I/O, Google a présenté la famille Gemini 3.5 ; Gemini 3.5 Flash en GA le jour même ; Pro en usage interne, déploiement public prévu « le mois prochain » — calendrier repoussé.
  2. Au 13 juillet : Pro toujours en aperçu entreprise Vertex AI ; pas d’entrée GA gemini-3.5-pro dans l’API publique ; plusieurs médias visent le 17 juillet — Google n’a pas confirmé.
  3. Non confirmé officiellement, mais largement relayé : contexte 2M tokens, couche Deep Think, API ~15 $/60 $ par million de tokens, abonnement Ultra ~250 $/mois.
  4. Disponible maintenant : Gemini 3.5 Flash (1M de contexte, 1,50 $/9 $ par million) couvre la plupart des scénarios agent et code.
  5. Le critère de choix n’est pas « qui est le plus intelligent », mais longueur de contexte × coût du raisonnement × environnement d’exécution — les agents longs gagnent à tourner sur un Mac cloud 24 h/24.
Visualisation de réseaux neuronaux et flux de données, symbole du long contexte et du raisonnement Gemini 3.5 Pro
La question sur Gemini 3.5 Pro n’est pas « s’il existe », mais si les specs GA correspondront à l’aperçu.

Conclusion anticipée : Flash travaille aujourd’hui, Pro mérite l’attente — pas la prod

Tant que Google n’a pas publié de model card officielle, tous les chiffres sur Pro sont des paris, pas des clauses contractuelles.

Trois phrases à retenir : ① Gemini 3.5 Flash est déjà le modèle par défaut Google pour les développeurs en 2026 ; ② Gemini 3.5 Pro est le « gros calibre » de la famille, mais mi-juillet toujours pas en GA public ; ③ lier la prod à une date « supposée le 17 juillet » est plus risqué que rentable.

Sur le blog officiel, Google reste mesuré : la famille 3.5 vise « frontier intelligence with action » — agents et code ; Flash disponible immédiatement ; Pro « en usage interne, lancement public le mois prochain attendu ». Sundar Pichai sur scène à l’I/O, même ligne. Le texte officiel ne mentionne ni 2M de contexte, ni Deep Think, ni les tarifs API — cela vient de la presse et des fuites entreprise, à traiter par niveau de confiance.

Approche pragmatique : faire tourner Antigravity / Gemini API / Vertex avec Flash, mettre en backlog les tâches « 2M tokens dépôt entier » ou « raisonnement dur multi-étapes », basculer le modèle par défaut quand le changelog Gemini API affiche une entrée GA. Comme dans notre guide GPT-5.6 et Gemini : les lancements s’accélèrent — fixez d’abord l’entrée workflow et le nœud d’exécution.

1. Pourquoi Gemini 3.5 Pro « tarde » plus que Flash ?

Que Flash soit en GA le jour de l’I/O n’est pas un hasard. Google positionne 3.5 Flash comme modèle par défaut à haut débit, priorité agents : 1M de contexte, thinking dynamique activé par défaut, Terminal-Bench 2.1 à 76,2 % dans la liste des annonces I/O. Objectif : prouver que « Flash peut viser le flagship » — crucial pour la recherche, Gemini App et l’expérience Antigravity par défaut.

Pro joue un autre rôle. La presse tech (Business Insider, Geeky Gadgets, etc.) rapporte qu’en aperçu entreprise, l’efficacité token et la qualité sur les agents longue durée n’ont pas atteint la barre interne — d’où une refonte d’architecture, GA glissée de juin à juillet, date cible 17 juillet dans les articles. Google refuse de commenter les dates — « 17 juillet » est une fenêtre de consensus industrie, pas un engagement SLA.

Où l’ancien plan a échoué ? Beaucoup d’équipes ont écrit « bascule totale Pro en juin » après l’I/O :

  • Budget figé sur « rumeur 15 $/60 $ », alors qu’en juin seul Flash est facturable — modèle financier faussé.
  • Prompts et toolchains en preview Vertex sans ID de modèle abstrait — retouches au switch GA.
  • « 2M pour tout le dépôt d’un coup » comme prémisse — Flash 1M + retrieval/chunking couvre souvent 80 %.
  • Agent long sur laptop : couvercle fermé, session coupée — pas la faute de Pro, mais attribué au retard de release.

Leçon : Google préfère un mois de retard à un successeur « Ultra » sous le seuil qui abîme la marque. Signal pour les utilisateurs : Flash est déjà fort — Pro doit être nettement supérieur pour justifier sa grille tarifaire.

2. Qu’est-ce que Gemini 3.5 Pro ? Distinction avec Flash

2.1 Positionnement famille (officiel)

Selon Google, Gemini 3.5 est la nouvelle famille 2026, mots-clés agents, code, tâches longue durée. Flash : « défaut, rapide, large couverture » ; Pro : « raisonnement le plus dur, contexte le plus long, qualité maximale » — narrative successeur de Gemini Ultra / 3.1 Pro, sans que Google écrive « Ultra renommé » dans le texte I/O — seulement « 3.5 Pro ».

2.2 Gemini 3.5 Flash (GA, référence)

Parler de Pro sans Flash empêche de juger « faut-il attendre » :

  • ID API : gemini-3.5-flash (GA, sans suffixe preview)
  • Contexte : 1 048 576 tokens entrée / 65 536 sortie (doc officielle)
  • Tarifs : 1,50 $ / 9,00 $ par million input/output ; cache entrée 0,15 $
  • Distribution : Gemini App, AI Mode in Search, Gemini API, AI Studio, Android Studio, Google Antigravity, Vertex AI, Gemini Enterprise
  • Capacités : entrée multimodale, function calling, exécution de code, outils de recherche, thinking dynamique

2.3 Gemini 3.5 Pro (aperçu / GA en attente)

Au 2026-07-13, état confirmé publiquement :

  • Google confirme que Pro existe et est utilisé en interne ; rollout public repoussé depuis « mois prochain (juin) ».
  • Clients entreprise Vertex AI en aperçu limité (pas d’auto-inscription pour tous).
  • Liste API publique : gemini-3.5-flash, gemini-3.1-pro-preview, etc. — pas de model card Pro GA.

Différenciation Pro relayée par la presse (à valider à la GA) :

  • Contexte 2M tokens — environ le double de Flash, pour dépôt entier, docs conformité longues, traces agent longues.
  • Couche Deep Think — logique multi-étapes, maths complexes, planification ; liée aux paliers d’abonnement (voir prix).
  • Multimodal et génération UI renforcés — UI web interactive de la série Gemini 3, hardest reasoning.
  • Latence basse n’est pas l’argument — Pro privilégie la qualité, complète Flash sans le remplacer.

3. Calendrier : de l’I/O à mi-juillet

Date Événement Fiabilité
2026-05-19 Google I/O : Gemini 3.5 ; Flash GA ; Pro interne, public « mois prochain » Officiel
2026-05 ~ 06 Flash par défaut Gemini App / Search AI Mode ; Antigravity, Enterprise synchronisés Officiel
Fin juin 2026 Presse : GA Pro de juin à juillet ; preview Vertex continue ; changelog API sans Pro GA Presse + état API
2026-07-08 ~ 17 Plusieurs médias : cible Google 17 juillet GA ; refonte architecture et retours preview Presse (non annoncé)
2026-07-13 (date article) Pro toujours pas en GA public ; développeurs : Flash en prod, surveiller changelog État factuel

Suivre les annonces ? Deux sources : blog modèles Gemini / DeepMind et changelog Gemini API. Le jour GA : model card, page tarifs, option par défaut AI Studio. Titre seul sans ces trois éléments — traiter comme aperçu.

4. Fonctionnalités : confirmé vs attendu

Capacité Flash (GA) Pro (attendu / presse) Statut
Agents longue durée Focus officiel Raisonnement et planification renforcés Flash confirmé ; Pro à évaluer post-GA
Fenêtre de contexte 1M tokens 2M tokens (presse) Flash officiel ; Pro non annoncé
Deep Think / raisonnement profond Thinking dynamique par défaut Couche Deep Think dédiée (presse) Pro non annoncé
Code / Terminal-Bench 76,2 % (I/O) Attendu au-dessus de Flash Flash chiffré ; Pro en attente
Multimodal Image, texte, audio, vidéo UI interactive renforcée (presse) Flash confirmé
Antigravity / Vertex Intégré En aperçu Flash GA ; Pro aperçu entreprise

Pour les développeurs, la « valeur » d’une fonction dépend du type de tâche :

  • Revue de code + patch sous 800K tokens : Flash suffit souvent, coût maîtrisé.
  • Graphe de dépendances entier + trace cross-service en une sortie : 2M avantage théorique — attendre latence Pro et taux d’hallucination.
  • Preuves math multi-étapes, conformité complexe : Deep Think en palier dédié pourrait viser OpenAI reasoning.effort=max ou Claude extended thinking.

5. Prix Gemini 3.5 Pro : vide officiel et estimation

Google n’a pas publié les tarifs API officiels de Pro. Ci-dessous par niveau — ne pas traiter les rumeurs comme facture.

5.1 Référence confirmée : Gemini 3.5 Flash

Poste Prix (USD)
Tokens entrée 1,50 $ / million (régions non globales ~1,65 $)
Tokens sortie 9,00 $ / million (régions non globales ~9,90 $)
Cache entrée 0,15 $ / million

5.2 Fourchettes Pro relayées par la presse (non confirmées)

Plusieurs médias dans la même ordre de grandeur — sandbox budgétaire uniquement :

  • API : environ 15 $ / million entrée, 60 $ / million sortie — ~10× Flash.
  • Abonnement grand public : Deep Think ou Pro complet peut exiger Gemini Advanced / Ultra (~250 $/mois) (presse, pas page tarifs Google).
  • D’autres outlets plus modérés (ex. 1,25 $ / 10 $) — contredit l’hypothèse 10× — model card du jour GA fait foi.

5.3 Comparaison concurrents (aide à la décision, pas devis temps réel)

Rumeur Pro vs Flash et logique quotas GPT-5.6 / Codex dans le même cadre :

  • Agents haute fréquence, millions de tokens/jour : Flash ou GPT-5.6 Luna/Terra plus réaliste.
  • Faible fréquence, contexte très long, succès en un coup : Pro 2M peut avoir un avantage TCO (moins d’appels pour la qualité) — tarifs officiels à confirmer.
  • Agent code terminal 24 h/24 : hors coût modèle, l’environnement d’exécution (Mac cloud toujours allumé) pèse souvent plus qu’un token 5× plus cher.

6. Cinq dimensions : Pro (attendu) vs Flash vs GPT-5.6 vs Claude

Dimension Gemini 3.5 Flash Gemini 3.5 Pro (attendu) GPT-5.6 Sol Claude Mythos 5
Disponibilité GA, tous canaux Aperçu / GA en attente GA (2026-07) GA
Contexte 1M (officiel) 2M (presse) selon offre / API ~200K+
Agent code Terminal-Bench 76,2 % En attente Terminal-Bench 88,8 % SWE-bench Pro en tête
Prix API (ordre de grandeur) 1,5 $ / 9 $ Rumeur ~15 $ / 60 $ Sol/Terra/Luna séparés Milieu-haut de gamme
Meilleure entrée Antigravity / Gemini API Vertex + AI Studio (bientôt) Codex / Cursor Claude Code CLI

Le tableau ne dit pas « qui gagne », mais : pas de gagnant unique par défaut. Flash est déjà « assez rapide et pas cher » comme socle agent dans l’écosystème Google ; Pro avec 2M + Deep Think comblerait docs très longs et raisonnement dur ; OpenAI et Anthropic restent plus matures sur le code terminal et l’entrée IDE. Voir guide choix modèle codage GPT-5.6.

7. Matrice de scénarios

Scénario Recommandé maintenant À réévaluer après GA Pro Déconseillé
Agent par défaut Antigravity 3.5 Flash Pro selon tâche Attendre Pro et s’arrêter
Revue code <1M tokens 3.5 Flash Forcer preview Pro
Analyse monorepo en une passe Flash + chunking / retrieval 3.5 Pro 2M Forcer en local sur laptop
Raisonnement finance / conformité complexe Flash + relecture humaine Deep Think (si annoncé) Agent long en offre gratuite
Agent CI iOS / Xcode API Flash + Mac cloud Pro long contexte UI web seule sans toolchain
Système prod avec SLA Flash GA + version figée Pro GA + canary Lier à une date de rumeur

8. Stacks recommandés

【Stack A — Développeur solo / test】
Modèle : Gemini 3.5 Flash (AI Studio ou API)
Entrée : Antigravity ou script maison + function calling
Exécution : court en local ; long sur Mac cloud
Budget : Flash 1,50 $/9 $ pour tokens ; ne pas réserver 10× Pro

【Stack B — Entreprise Vertex】
Modèle : Flash prod + projet séparé preview Pro
Gouvernance : preview/prod comptes de service distincts ; ID modèle en variable d’env
Monitoring : RSS changelog + alerte coûts (export billing BigQuery)
Bascule : après GA Pro 10 % trafic canary → régression benchmark → plein

【Stack C — Équipe multi-modèles code】
Retrieval / grand dépôt : Gemini 3.5 Flash
Raisonnement dur / revue architecture : attendre Pro ou Claude extended thinking
Édition terminal : Claude Code ou Codex sur worktree Mac cloud
IDE quotidien : Cursor + GPT-5.6 Terra
Principe : une tâche, un « modèle principal », pas de double facturation tokens

9. Erreurs fréquentes

  • Erreur 1 : article de presse = model card. 2M, Deep Think, 15 $/60 $ absents du texte I/O officiel — marquer « non confirmé » dans les docs d’architecture.
  • Erreur 2 : Flash n’est qu’un passage. Données I/O : Flash dépasse 3.1 Pro sur plusieurs benchmarks agent — modèle principal, pas un « /lite ».
  • Erreur 3 : basculer toute l’équipe dès Pro. Contexte plus long ≠ coût total plus bas ; un appel 2M raté peut coûter plus cher.
  • Erreur 4 : ignorer Antigravity vs API. Même modèle, harness différent — outils, droits, latence à tester sur la vraie entrée.
  • Erreur 5 : ne rien déployer en attendant Pro. La concurrence n’attend pas — pipeline Flash d’abord vaut mieux que deux semaines vides.

10. Mise en œuvre en 7 étapes

  1. Inventorier les tâches : part >1M contexte ou raisonnement dur ; si <20 %, Flash comme modèle principal.
  2. Chemin prod Flash : projet AI Studio ou Vertex ; clé API / workload identity par environnement.
  3. Abstraire l’ID modèle : GEMINI_MODEL=gemini-3.5-flash — pas de chaînes en dur éparpillées pour le switch Pro GA.
  4. Agents longs sur nœud d’exécution : toolchains de plusieurs heures sur Mac cloud — éviter veille locale (orthogonal à Flash/Pro, mais critique).
  5. S’abonner au changelog : Gemini API + blog Google AI ; rappel calendrier mi/fin juillet pour GA.
  6. Jour GA Pro : lire model card → golden set interne → coût/qualité vs Flash → canary 10 %.
  7. Bilan deux semaines : tokens, taux de succès, interventions humaines — données pour juger le prix 10×.

11. FAQ

Gemini 3.5 Pro est-il sorti ?

Au 13 juillet 2026, pas encore en GA public. Google a annoncé Pro en usage interne le 19 mai à l’I/O, sortie « mois prochain » — repoussée ; clients entreprise en aperçu limité Vertex AI. La presse vise le 17 juillet — Google n’a pas confirmé cette date.

Quelle différence entre Gemini 3.5 Pro et Flash ?

Flash pleinement disponible : agents rapides et code, 1M contexte, 1,50 $/9 $ par million. Pro attendu comme flagship : presse 2M, Deep Think, tarifs API plus élevés, tâches multi-étapes renforcées — specs selon model card GA.

Quel est le prix de Gemini 3.5 Pro ?

Google n’a pas publié les tarifs Pro. Presse courante : API ~15 $/60 $ par million input/output, ~10× Flash ; Deep Think peut lier l’abonnement Ultra ~250 $/mois. Jusqu’à la page tarifs officielle, ne mettre que Flash en contrat et budget.

Quel modèle Gemini utiliser maintenant ?

En production : Gemini 3.5 Flash (gemini-3.5-flash). Pour agents, Antigravity, orchestration Enterprise dans l’écosystème Google, Flash est le défaut 2026. Pro seulement en qualification preview, isolé du trafic prod.

Le contexte 2M vaut-il d’attendre Pro ?

Selon la tâche : si 1M + RAG/chunking couvre 80 %, inutile d’attendre. Si vous injectez routinièrement tout le dépôt en un appel avec coût de retry élevé — A/B après GA Pro. Ne pas architecturer sur une rumeur 2M avant GA.

12. Synthèse

Qu’est-ce que Gemini 3.5 Pro ? — Le flagship 3.5 annoncé à l’I/O 2026 pour le raisonnement le plus dur et le contexte le plus long, mi-juillet toujours pas en GA public. Fonctions et prix : Flash a une model card complète ; chiffres clés Pro 2M, Deep Think, 15 $/60 $ restent « presse crédible, non annoncé ». Calendrier glissé de « juin » à « mi/fin juillet » — le changelog API prime sur le compte à rebours médias.

Chemin pragmatique : Flash aujourd’hui pour les agents, Pro demain en upgrade incrémental. Guerre des modèles chaque semaine — l’équipe fixe environnement d’exécution, abstraction ID modèle et tableau de bord coûts — le reste attend la prochaine signature de Sundar sur le blog.

En attendant Pro : stabiliser l’agent avec Flash + Mac cloud

Gemini 3.5 Flash en API pour agents code — exécution sur Mac cloud mini M4 : xcodebuild, worktree Git, sessions SSH sans coupure. Après GA Pro, changer l’ID modèle dans les variables d’env, la pipeline reste ; mémoire unifiée Apple Silicon pour contexte 1M, isolation macOS réduit le risque d’actions agent sur fichiers locaux.

D’abord location journalière pour tests Antigravity / Gemini API, puis mensuelle en permanence. kvmboot Mac cloud mini M4 : « Flash aujourd’hui, Pro demain »Voir les offres et transformer l’attente GA en pipeline agent livrable.