Lors du Google I/O 2026 en mai, Sundar Pichai a présenté simultanément Gemini 3.5 Flash (déjà en GA) et Gemini 3.5 Pro (aperçu flagship). Pro n'est pas une simple version agrandie de Flash — Google a choisi une refonte complète plutôt qu'une itération incrémentale, en visant directement les trois défis les plus durs des modèles de pointe actuels : contexte ultra-long, raisonnement approfondi et orchestration multi-agents. Cet article détaille, du point de vue développeur, 10 capacités mises à niveau, avec un comparatif face à Flash, Claude et GPT pour vous aider à choisir.
D'abord : où se situe Pro dans la gamme Gemini 3.5
À l'I/O 2026, Google a adopté une stratégie de double lancement :
- Gemini 3.5 Flash : GA dès mai, modèle par défaut de Google AI Mode, axé sur la vitesse, le coût et la couverture écosystème.
- Gemini 3.5 Pro : présenté le même jour mais ouverture large différée, positionné comme « capacité maximale de la gamme », destiné au raisonnement complexe, à l'analyse de dépôts entiers et aux tâches Agent de longue durée.
Il est à noter que, selon plusieurs sources, Google a tout repris à zéro avant le lancement de Pro — la version interne n'atteignait pas la qualité de raisonnement attendue, et l'équipe a préféré reconstruire plutôt que livrer dans la précipitation. Cela explique pourquoi Flash est disponible depuis près de deux mois, tandis que le GA de Pro est encore reporté (objectif initial fin juin ; mi-juillet, toujours en aperçu entreprise sur Vertex AI).
Pour les développeurs : Flash est l'option par défaut aujourd'hui ; Pro est l'arme spécialisée quand contexte et raisonnement doivent être au maximum — pas un remplacement universel.
Mise à niveau 1 : fenêtre de contexte de 2 millions de tokens
C'est le chiffre le plus visible de Gemini 3.5 Pro : 2 millions de tokens, soit le double de Flash (1 million) et le plus grand contexte de production parmi les modèles de pointe actuels.
| Comparaison | Contexte max | Par rapport à Pro |
|---|---|---|
| Gemini 3.5 Pro | 2 millions de tokens | — |
| Gemini 3.5 Flash | 1 million de tokens | Moitié |
| GPT-5.x (niveau étendu) | ~512 000 tokens | ~1/4 |
| Claude Opus 4.x | 200 000 tokens | ~1/10 |
Que peut-on loger dans 2 millions de tokens ?
- Un monorepo TypeScript de taille moyenne (~2 000 fichiers, ~200 lignes chacun)
- Trois ans d'exports Slack d'une équipe de 30 personnes
- Quatre prospectus SEC S-1 complets simultanément
- Un dossier complet de contentieux civil (requêtes, témoignages, preuves, procès-verbaux d'audience)
Point clé : pouvoir tout charger ≠ valoir le coup de tout charger. 2 millions de tokens augmentent nettement la latence de prefill et le coût d'entrée ; si la réponse se cache dans un petit fragment, RAG + Flash est souvent plus rentable. L'avantage contextuel de Pro se manifeste quand les relations inter-fichiers doivent être visibles en même temps — audit de sécurité sur tout le dépôt, comparaison croisée de clauses contractuelles, Agent de longue durée qui refuse les handoffs de contexte.
Mise à niveau 2 : mode Deep Think pour le raisonnement approfondi
Deep Think est le nom produit de Google pour le « calcul de raisonnement étendu à l'inférence » (extended inference-time compute). Avant de produire la réponse finale, le modèle consacre plus de cycles à des dérivations intermédiaires et à l'auto-correction, plutôt qu'à un simple pattern matching rapide.
Contrôlé via le paramètre API thinkingConfig, quatre niveaux :
| thinkingLevel | Cas d'usage | Impact latence |
|---|---|---|
minimal | Requêtes simples, réponse rapide | Minimal |
low | Complétion standard | Faible |
medium | Raisonnement multi-étapes | Moyen |
high | Preuves mathématiques, décisions d'architecture, optimisation multi-contraintes | Élevé |
import { GoogleGenerativeAI } from "@google/generative-ai";
const genAI = new GoogleGenerativeAI(process.env.GEMINI_API_KEY);
const model = genAI.getGenerativeModel({
model: "gemini-3.5-pro",
generationConfig: {
thinkingConfig: { thinkingLevel: "high" }
}
});
Alerte coût importante : les tokens de raisonnement comptent dans le budget de contexte et sont facturés au tarif des tokens de sortie. Un problème difficile peut consommer beaucoup de tokens avant même la réponse finale. Deep Think est un « interrupteur pour les cas difficiles », pas le mode par défaut.
Flash ne supporte pas Deep Think — c'est l'une des capacités exclusives à Pro.
Mise à niveau 3 : boucles de recherche agentiques multi-étapes
Par rapport à Gemini 3.1 Pro, la génération 3.5 marque un saut net en capacités agentiques. Pro supporte nativement des boucles de recherche multi-étapes : le modèle peut planifier seul un parcours de recherche, parcourir plusieurs sources, synthétiser en interne puis répondre — plutôt que le mode « une recherche, une réponse » en une seule passe.
Impact direct sur :
- Analyse concurrentielle / marché : croiser plusieurs rapports financiers, communiqués et docs produit
- Étude de choix technologique : parcourir simultanément docs officielles, issues GitHub et discussions communautaires
- Revue de conformité : repérer des clauses contradictoires dans de vastes corpus réglementaires
Si vous utilisez déjà la fonction « recherche approfondie » de Google AI Mode, la version pilotée par Pro devrait théoriquement gérer des chaînes de recherche plus complexes et plus longues — l'expérience réelle reste à valider après le GA large.
Mise à niveau 4 : workflows autonomes et orchestration d'outils
Selon les annonces I/O et des retours de développeurs tiers, Gemini 3.5 Pro hérite de l'architecture agentique de Flash et renforce la chaîne d'appels d'outils : le modèle peut enchaîner en workflow autonome des tâches du type « lire le code → lancer les tests → corriger le bug → relancer les tests », sans attendre une confirmation à chaque étape.
Combiné au protocole d'outils MCP, Pro peut en théorie :
- Découvrir les outils disponibles via MCP (filesystem, GitHub, base de données, etc.)
- Décider seul l'ordre d'appel selon la complexité de la tâche
- Conserver l'état de tâches longues dans la fenêtre de 2 millions de tokens
Pour les indépendants et petites équipes, cela signifie déléguer plus de « glue logic » au modèle et ne valider que le résultat final. En production, gardez des limites de permissions et des points de contrôle humains — autonome ≠ sans surveillance.
Mise à niveau 5 : collaboration multi-agents Google Antigravity
La gamme Gemini 3.5 est étroitement liée à Antigravity, la plateforme de développement lancée en parallèle par Google. Antigravity permet à Pro de déployer des sous-agents parallèles : différentes sous-tâches avancent simultanément via des agents indépendants, l'agent principal coordonne et fusionne les résultats.
Workflow typique :
- Sous-agent A : scan des vulnérabilités de sécurité
- Sous-agent B : vérification des dépendances obsolètes
- Sous-agent C : génération de brouillons de PR de correction
- Agent principal : rapport consolidé et priorisation
Cela correspond étroitement au modèle « Orchestrator + Workers » décrit dans les quatre architectures multi-agents. La valeur d'Antigravity est de productiser la couche d'orchestration et de réduire le seuil pour construire son propre framework Agent.
Si vous faites déjà tourner OpenClaw ou un Agent auto-hébergé sur un Mac cloud, surveillez si Antigravity ouvrira l'accès self-hosted — pour l'instant, c'est surtout l'écosystème Google.
Mise à niveau 6 : compréhension documentaire multimodale
La force historique de Gemini, c'est le multimodal. 3.5 Pro renforce le raisonnement sur images et la compréhension au niveau document — pas seulement de l'OCR, mais une analyse sémantique structurée de graphiques, scans et PDF mixtes.
Cas d'usage concrets :
- Injecter schémas d'architecture et diagrammes de flux dans le contexte pour générer du code
- Analyser tableaux et annotations manuscrites dans des contrats scannés
- Raisonnement conjoint images clés + sous-titres vidéo (périmètre exact selon la model card officielle)
Pour les développeurs iOS / macOS : vous pouvez mettre dans le contexte Pro des captures Xcode, rapports Instruments et maquettes, pour que le modèle comprenne à la fois « à quoi ressemble l'interface » et « ce que disent les métriques de performance » — Flash le fait aussi, mais le long contexte de Pro permet d'avoir simultanément « toute la spec design + toutes les captures + le dépôt de code ».
Mise à niveau 7 : précision de récupération en long contexte
« Tenir 2 millions de tokens » et « les récupérer correctement une fois chargés » sont deux choses différentes. Le défaut classique des premiers modèles long contexte : le lost in the middle — quand l'info clé est au milieu du contexte, la qualité des réponses chute.
Google affirme avoir amélioré la précision de récupération sur toute la fenêtre sur 3.5 Pro, pour garder une qualité utilisable même proche de 2 millions de tokens. Si c'est confirmé, cela détermine directement si Pro vaut le « tout charger » plutôt qu'un RAG par blocs.
Recommandation : après le GA, testez avec votre propre corpus — needle-in-a-haystack : enterrez un fait clé à 500 000, 1 million et 1,5 million de tokens, et vérifiez l'extraction. Ne vous fiez pas qu'aux chiffres de keynote.
Mise à niveau 8 : bond en benchmarks de raisonnement de pointe
À l'I/O, Google a laissé entendre que 3.5 Pro retrouverait et dépasserait le niveau de pointe sur des benchmarks difficiles comme ARC-AGI-2 et Humanity's Last Exam (HLE) — compensant le compromis de Flash optimisé pour la vitesse sur le raisonnement abstrait.
Mi-juillet 2026, les benchmarks officiels ne sont pas encore publiés en entier, et les tiers manquent de comparaisons équitables sur le même harness. Donc :
- Pour savoir si la qualité de raisonnement dépasse Claude Opus 4.8 / GPT-5.5 — on voit la direction, pas de verdict
- La stratégie Google ressemble plus à dominer la longueur de contexte qu'à affronter frontalement Anthropic sur tous les classements agentic coding
À la sélection, demandez-vous : votre goulot, c'est « pas assez de raisonnement » ou « contexte trop petit » ? Pour le premier, attendez les benchmarks ; pour le second, Pro a déjà un différenciateur clair.
Mise à niveau 9 : nouvelle architecture reconstruite from scratch
Facile à passer sous silence, mais important pour les utilisateurs long terme : Gemini 3.5 Pro n'est pas un 3.1 Pro avec plus de paramètres — c'est une version réentraînée par Google DeepMind après des tests internes insuffisants.
Conséquences pratiques :
- Comportement potentiellement très différent de 3.1 Pro — prompts et system prompts existants à retuner
- GA retardé en échange d'une qualité garantie — bon pour la prod, mais docs d'intégration et tarifs instables au début
- Infrastructure agentique partiellement partagée avec Flash — migration Flash → Pro relativement légère côté toolchain
Mise à niveau 10 : API ouverte et endpoint compatible OpenAI
Pro sera accessible via plusieurs canaux :
| Canal | Statut (15.07.2026) | Notes |
|---|---|---|
| Vertex AI | Aperçu entreprise | Model ID : gemini-3.5-pro-preview-06, allowlist requis |
| Google AI Studio | Ouverture post-GA | Idéal pour tests rapides en solo |
| Gemini API (REST/SDK) | Ouverture post-GA | SDK officiels Python / TypeScript |
| Endpoint compatible OpenAI | Déjà sur AI Studio | Changer le base URL suffit pour migrer un SDK OpenAI existant |
| Abonnement Gemini Advanced | Prévu au GA | Entrée grand public |
En long contexte, le Context Caching est le levier coût clé : l'entrée en cache peut coûter ~90 % moins cher que l'entrée standard — idéal pour « le même gros contexte, beaucoup de questions » (audit de dépôt, Q&R juridique multi-tours).
const cachedContent = await genAI.cacheContent({
model: "gemini-3.5-pro",
contents: [{ role: "user", parts: [{ text: largeContext }] }],
ttl: "3600s"
});
const model = genAI.getGenerativeModelFromCachedContent(cachedContent);
const result = await model.generateContent("Based on the context above, find all SQL injection risks");
Pro vs Flash vs concurrents : tout en un tableau
| Dimension | Gemini 3.5 Pro | Gemini 3.5 Flash | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| Contexte | 2 millions de tokens | 1 million de tokens | 200 000 tokens | ~512 000 tokens |
| Raisonnement profond | Deep Think | Non | Extended thinking | o-series |
| Prix entrée (est.) | 12–15 $ / M | 1,50 $ / M | ~20 $ / M | ~15 $ / M |
| Prix sortie (est.) | 36–45 $ / M | 9 $ / M | ~60 $ / M | ~60 $ / M |
| Statut GA | En aperçu | GA | GA | GA |
| Meilleur cas | Contexte ultra-long, analyse de dépôt | Flux quotidien haut débit | Codage agentique | Tâches structurées multi-étapes |
Tarifs estimés en phase d'aperçu — après GA, voir la page tarifs officielle Google. Pour une stratégie de routage plus complète : classement OpenRouter Top10.
Comment s'y connecter ? Disponibilité et calendrier
Au 15 juillet 2026 :
- La liste publique Gemini API reste dominée par
gemini-3.5-flashetgemini-3.1-pro-preview— pas encore de GA large pour gemini-3.5-pro - Plusieurs sources visent le 17 juillet environ comme date GA, mais Google n'a pas publié de model card ni de tarifs officiels — à prendre comme repère de planification, pas comme engagement de prod
- Les entreprises peuvent demander l'aperçu
gemini-3.5-pro-preview-06sur Vertex AI
Pour les développeurs individuels, maintenant :
- Faire tourner la logique métier et l'intégration d'outils avec Flash
- Préparer prompts Pro et modèle de budget (surtout Deep Think + long contexte)
- Au GA, faire un A/B : même tâche sur Flash et Pro, décider le routage avec consommation réelle de tokens et qualité mesurée
Verdict : qui doit attendre Pro, qui peut rester sur Flash
Gemini 3.5 Pro est un outil spécialisé, pas un remplacement global.
Équipes qui valent la peine d'attendre / tester Pro en priorité :
- Juridique, finance, conformité — analyse croisée de longs documents
- Audit sécurité — dépôt de code entier visible d'un coup
- Agents longue durée — état de session sur des heures, sans compression fréquente du contexte
- Raisonnement difficile — maths, architecture, optimisation multi-contraintes, prêt à payer latence et tokens pour la précision
Équipes qui peuvent rester sur Flash :
- Assistance au codage quotidienne, édition fichier par fichier
- Pipelines API haut débit (support, génération de contenu, classification)
- Q&R sur base de connaissances couverte par RAG
- Chemins de production sensibles à la latence
Parmi les 10 mises à niveau, seuls deux chiffres changent vraiment la donne : 2 millions de tokens et Deep Think. Le reste (boucles agentiques, Antigravity, multimodal) est en grande partie déjà couvert par Flash ; Pro élève le plafond. Identifiez d'abord si votre goulot est « ça ne tient pas » ou « ça ne réfléchit pas assez », puis décidez si Pro vaut l'investissement.
Besoin d'un environnement de build 24/7 pour vos Agents ?
Mac mini M4 cloud en bare metal dédié — idéal pour Xcode CI, runners auto-hébergés et Agents OpenClaw en permanence — nœuds Tokyo, Singapour, Hong Kong, facturation à la journée
Pour aller plus loin
Questions fréquentes
Gemini 3.5 Pro ou Gemini 3.5 Flash — comment choisir ?
Pour le dialogue quotidien, le haut débit et la sensibilité au coût : Flash. Pour 2 millions de tokens en contexte complet, Deep Think et des boucles de recherche Agent complexes : Pro. Le prix unitaire de Pro est environ 8 à 10 fois celui de Flash.
Gemini 3.5 Pro est-il utilisable maintenant ?
Mi-juillet 2026, Pro reste en aperçu entreprise sur Vertex AI. L'API Gemini publique propose surtout gemini-3.5-flash et gemini-3.1-pro. GA large attendu mi-juillet — vérifiez la documentation officielle Google.
Combien coûte en plus le mode Deep Think ?
Les tokens de raisonnement comptent dans le budget de contexte et sont facturés au tarif sortie. Un problème complexe peut consommer beaucoup de tokens avant la réponse finale — réservez Deep Think aux tâches difficiles (preuves mathématiques, décisions d'architecture).
À quoi sert un contexte de 2 millions de tokens ?
Audit de dépôt entier, comparaison croisée de documents juridiques ou réglementaires, maintien d'état pour Agents longue durée. Pour l'édition d'un seul fichier ou une tâche couverte par RAG, Flash + recherche par blocs est en général plus rapide et moins cher.
Puis-je appeler Gemini 3.5 Pro avec mon SDK OpenAI existant ?
Oui. Google AI Studio expose un endpoint compatible OpenAI ; la plupart des codes SDK OpenAI existants migrent en changeant le base URL et le nom du modèle.