← Retour au blog technique

Gemini 3.5 Pro : 10 montées en capacité IA à connaître

Montées en capacité Gemini 3.5 Pro : contexte 2M tokens, raisonnement Deep Think, orchestration multi-agents
Deux atouts majeurs de Gemini 3.5 Pro : 2 millions de tokens et Deep Think — l'un résout « ça ne rentre pas », l'autre « ça ne réfléchit pas assez ».

Lors du Google I/O 2026 en mai, Sundar Pichai a présenté simultanément Gemini 3.5 Flash (déjà en GA) et Gemini 3.5 Pro (aperçu flagship). Pro n'est pas une simple version agrandie de Flash — Google a choisi une refonte complète plutôt qu'une itération incrémentale, en visant directement les trois défis les plus durs des modèles de pointe actuels : contexte ultra-long, raisonnement approfondi et orchestration multi-agents. Cet article détaille, du point de vue développeur, 10 capacités mises à niveau, avec un comparatif face à Flash, Claude et GPT pour vous aider à choisir.

D'abord : où se situe Pro dans la gamme Gemini 3.5

À l'I/O 2026, Google a adopté une stratégie de double lancement :

  • Gemini 3.5 Flash : GA dès mai, modèle par défaut de Google AI Mode, axé sur la vitesse, le coût et la couverture écosystème.
  • Gemini 3.5 Pro : présenté le même jour mais ouverture large différée, positionné comme « capacité maximale de la gamme », destiné au raisonnement complexe, à l'analyse de dépôts entiers et aux tâches Agent de longue durée.

Il est à noter que, selon plusieurs sources, Google a tout repris à zéro avant le lancement de Pro — la version interne n'atteignait pas la qualité de raisonnement attendue, et l'équipe a préféré reconstruire plutôt que livrer dans la précipitation. Cela explique pourquoi Flash est disponible depuis près de deux mois, tandis que le GA de Pro est encore reporté (objectif initial fin juin ; mi-juillet, toujours en aperçu entreprise sur Vertex AI).

Pour les développeurs : Flash est l'option par défaut aujourd'hui ; Pro est l'arme spécialisée quand contexte et raisonnement doivent être au maximum — pas un remplacement universel.


Mise à niveau 1 : fenêtre de contexte de 2 millions de tokens

C'est le chiffre le plus visible de Gemini 3.5 Pro : 2 millions de tokens, soit le double de Flash (1 million) et le plus grand contexte de production parmi les modèles de pointe actuels.

ComparaisonContexte maxPar rapport à Pro
Gemini 3.5 Pro2 millions de tokens
Gemini 3.5 Flash1 million de tokensMoitié
GPT-5.x (niveau étendu)~512 000 tokens~1/4
Claude Opus 4.x200 000 tokens~1/10

Que peut-on loger dans 2 millions de tokens ?

  • Un monorepo TypeScript de taille moyenne (~2 000 fichiers, ~200 lignes chacun)
  • Trois ans d'exports Slack d'une équipe de 30 personnes
  • Quatre prospectus SEC S-1 complets simultanément
  • Un dossier complet de contentieux civil (requêtes, témoignages, preuves, procès-verbaux d'audience)

Point clé : pouvoir tout charger ≠ valoir le coup de tout charger. 2 millions de tokens augmentent nettement la latence de prefill et le coût d'entrée ; si la réponse se cache dans un petit fragment, RAG + Flash est souvent plus rentable. L'avantage contextuel de Pro se manifeste quand les relations inter-fichiers doivent être visibles en même temps — audit de sécurité sur tout le dépôt, comparaison croisée de clauses contractuelles, Agent de longue durée qui refuse les handoffs de contexte.


Mise à niveau 2 : mode Deep Think pour le raisonnement approfondi

Deep Think est le nom produit de Google pour le « calcul de raisonnement étendu à l'inférence » (extended inference-time compute). Avant de produire la réponse finale, le modèle consacre plus de cycles à des dérivations intermédiaires et à l'auto-correction, plutôt qu'à un simple pattern matching rapide.

Contrôlé via le paramètre API thinkingConfig, quatre niveaux :

thinkingLevelCas d'usageImpact latence
minimalRequêtes simples, réponse rapideMinimal
lowComplétion standardFaible
mediumRaisonnement multi-étapesMoyen
highPreuves mathématiques, décisions d'architecture, optimisation multi-contraintesÉlevé
import { GoogleGenerativeAI } from "@google/generative-ai";

const genAI = new GoogleGenerativeAI(process.env.GEMINI_API_KEY);

const model = genAI.getGenerativeModel({
  model: "gemini-3.5-pro",
  generationConfig: {
    thinkingConfig: { thinkingLevel: "high" }
  }
});

Alerte coût importante : les tokens de raisonnement comptent dans le budget de contexte et sont facturés au tarif des tokens de sortie. Un problème difficile peut consommer beaucoup de tokens avant même la réponse finale. Deep Think est un « interrupteur pour les cas difficiles », pas le mode par défaut.

Flash ne supporte pas Deep Think — c'est l'une des capacités exclusives à Pro.


Mise à niveau 3 : boucles de recherche agentiques multi-étapes

Par rapport à Gemini 3.1 Pro, la génération 3.5 marque un saut net en capacités agentiques. Pro supporte nativement des boucles de recherche multi-étapes : le modèle peut planifier seul un parcours de recherche, parcourir plusieurs sources, synthétiser en interne puis répondre — plutôt que le mode « une recherche, une réponse » en une seule passe.

Impact direct sur :

  • Analyse concurrentielle / marché : croiser plusieurs rapports financiers, communiqués et docs produit
  • Étude de choix technologique : parcourir simultanément docs officielles, issues GitHub et discussions communautaires
  • Revue de conformité : repérer des clauses contradictoires dans de vastes corpus réglementaires

Si vous utilisez déjà la fonction « recherche approfondie » de Google AI Mode, la version pilotée par Pro devrait théoriquement gérer des chaînes de recherche plus complexes et plus longues — l'expérience réelle reste à valider après le GA large.


Mise à niveau 4 : workflows autonomes et orchestration d'outils

Selon les annonces I/O et des retours de développeurs tiers, Gemini 3.5 Pro hérite de l'architecture agentique de Flash et renforce la chaîne d'appels d'outils : le modèle peut enchaîner en workflow autonome des tâches du type « lire le code → lancer les tests → corriger le bug → relancer les tests », sans attendre une confirmation à chaque étape.

Combiné au protocole d'outils MCP, Pro peut en théorie :

  1. Découvrir les outils disponibles via MCP (filesystem, GitHub, base de données, etc.)
  2. Décider seul l'ordre d'appel selon la complexité de la tâche
  3. Conserver l'état de tâches longues dans la fenêtre de 2 millions de tokens

Pour les indépendants et petites équipes, cela signifie déléguer plus de « glue logic » au modèle et ne valider que le résultat final. En production, gardez des limites de permissions et des points de contrôle humains — autonome ≠ sans surveillance.


Mise à niveau 5 : collaboration multi-agents Google Antigravity

La gamme Gemini 3.5 est étroitement liée à Antigravity, la plateforme de développement lancée en parallèle par Google. Antigravity permet à Pro de déployer des sous-agents parallèles : différentes sous-tâches avancent simultanément via des agents indépendants, l'agent principal coordonne et fusionne les résultats.

Workflow typique :

  • Sous-agent A : scan des vulnérabilités de sécurité
  • Sous-agent B : vérification des dépendances obsolètes
  • Sous-agent C : génération de brouillons de PR de correction
  • Agent principal : rapport consolidé et priorisation

Cela correspond étroitement au modèle « Orchestrator + Workers » décrit dans les quatre architectures multi-agents. La valeur d'Antigravity est de productiser la couche d'orchestration et de réduire le seuil pour construire son propre framework Agent.

Si vous faites déjà tourner OpenClaw ou un Agent auto-hébergé sur un Mac cloud, surveillez si Antigravity ouvrira l'accès self-hosted — pour l'instant, c'est surtout l'écosystème Google.


Mise à niveau 6 : compréhension documentaire multimodale

La force historique de Gemini, c'est le multimodal. 3.5 Pro renforce le raisonnement sur images et la compréhension au niveau document — pas seulement de l'OCR, mais une analyse sémantique structurée de graphiques, scans et PDF mixtes.

Cas d'usage concrets :

  • Injecter schémas d'architecture et diagrammes de flux dans le contexte pour générer du code
  • Analyser tableaux et annotations manuscrites dans des contrats scannés
  • Raisonnement conjoint images clés + sous-titres vidéo (périmètre exact selon la model card officielle)

Pour les développeurs iOS / macOS : vous pouvez mettre dans le contexte Pro des captures Xcode, rapports Instruments et maquettes, pour que le modèle comprenne à la fois « à quoi ressemble l'interface » et « ce que disent les métriques de performance » — Flash le fait aussi, mais le long contexte de Pro permet d'avoir simultanément « toute la spec design + toutes les captures + le dépôt de code ».


Mise à niveau 7 : précision de récupération en long contexte

« Tenir 2 millions de tokens » et « les récupérer correctement une fois chargés » sont deux choses différentes. Le défaut classique des premiers modèles long contexte : le lost in the middle — quand l'info clé est au milieu du contexte, la qualité des réponses chute.

Google affirme avoir amélioré la précision de récupération sur toute la fenêtre sur 3.5 Pro, pour garder une qualité utilisable même proche de 2 millions de tokens. Si c'est confirmé, cela détermine directement si Pro vaut le « tout charger » plutôt qu'un RAG par blocs.

Recommandation : après le GA, testez avec votre propre corpus — needle-in-a-haystack : enterrez un fait clé à 500 000, 1 million et 1,5 million de tokens, et vérifiez l'extraction. Ne vous fiez pas qu'aux chiffres de keynote.


Mise à niveau 8 : bond en benchmarks de raisonnement de pointe

À l'I/O, Google a laissé entendre que 3.5 Pro retrouverait et dépasserait le niveau de pointe sur des benchmarks difficiles comme ARC-AGI-2 et Humanity's Last Exam (HLE) — compensant le compromis de Flash optimisé pour la vitesse sur le raisonnement abstrait.

Mi-juillet 2026, les benchmarks officiels ne sont pas encore publiés en entier, et les tiers manquent de comparaisons équitables sur le même harness. Donc :

  • Pour savoir si la qualité de raisonnement dépasse Claude Opus 4.8 / GPT-5.5 — on voit la direction, pas de verdict
  • La stratégie Google ressemble plus à dominer la longueur de contexte qu'à affronter frontalement Anthropic sur tous les classements agentic coding

À la sélection, demandez-vous : votre goulot, c'est « pas assez de raisonnement » ou « contexte trop petit » ? Pour le premier, attendez les benchmarks ; pour le second, Pro a déjà un différenciateur clair.


Mise à niveau 9 : nouvelle architecture reconstruite from scratch

Facile à passer sous silence, mais important pour les utilisateurs long terme : Gemini 3.5 Pro n'est pas un 3.1 Pro avec plus de paramètres — c'est une version réentraînée par Google DeepMind après des tests internes insuffisants.

Conséquences pratiques :

  • Comportement potentiellement très différent de 3.1 Pro — prompts et system prompts existants à retuner
  • GA retardé en échange d'une qualité garantie — bon pour la prod, mais docs d'intégration et tarifs instables au début
  • Infrastructure agentique partiellement partagée avec Flash — migration Flash → Pro relativement légère côté toolchain

Mise à niveau 10 : API ouverte et endpoint compatible OpenAI

Pro sera accessible via plusieurs canaux :

CanalStatut (15.07.2026)Notes
Vertex AIAperçu entrepriseModel ID : gemini-3.5-pro-preview-06, allowlist requis
Google AI StudioOuverture post-GAIdéal pour tests rapides en solo
Gemini API (REST/SDK)Ouverture post-GASDK officiels Python / TypeScript
Endpoint compatible OpenAIDéjà sur AI StudioChanger le base URL suffit pour migrer un SDK OpenAI existant
Abonnement Gemini AdvancedPrévu au GAEntrée grand public

En long contexte, le Context Caching est le levier coût clé : l'entrée en cache peut coûter ~90 % moins cher que l'entrée standard — idéal pour « le même gros contexte, beaucoup de questions » (audit de dépôt, Q&R juridique multi-tours).

const cachedContent = await genAI.cacheContent({
  model: "gemini-3.5-pro",
  contents: [{ role: "user", parts: [{ text: largeContext }] }],
  ttl: "3600s"
});

const model = genAI.getGenerativeModelFromCachedContent(cachedContent);
const result = await model.generateContent("Based on the context above, find all SQL injection risks");

Pro vs Flash vs concurrents : tout en un tableau

DimensionGemini 3.5 ProGemini 3.5 FlashClaude Opus 4.8GPT-5.5
Contexte2 millions de tokens1 million de tokens200 000 tokens~512 000 tokens
Raisonnement profondDeep ThinkNonExtended thinkingo-series
Prix entrée (est.)12–15 $ / M1,50 $ / M~20 $ / M~15 $ / M
Prix sortie (est.)36–45 $ / M9 $ / M~60 $ / M~60 $ / M
Statut GAEn aperçuGAGAGA
Meilleur casContexte ultra-long, analyse de dépôtFlux quotidien haut débitCodage agentiqueTâches structurées multi-étapes

Tarifs estimés en phase d'aperçu — après GA, voir la page tarifs officielle Google. Pour une stratégie de routage plus complète : classement OpenRouter Top10.


Comment s'y connecter ? Disponibilité et calendrier

Au 15 juillet 2026 :

  • La liste publique Gemini API reste dominée par gemini-3.5-flash et gemini-3.1-pro-previewpas encore de GA large pour gemini-3.5-pro
  • Plusieurs sources visent le 17 juillet environ comme date GA, mais Google n'a pas publié de model card ni de tarifs officiels — à prendre comme repère de planification, pas comme engagement de prod
  • Les entreprises peuvent demander l'aperçu gemini-3.5-pro-preview-06 sur Vertex AI

Pour les développeurs individuels, maintenant :

  1. Faire tourner la logique métier et l'intégration d'outils avec Flash
  2. Préparer prompts Pro et modèle de budget (surtout Deep Think + long contexte)
  3. Au GA, faire un A/B : même tâche sur Flash et Pro, décider le routage avec consommation réelle de tokens et qualité mesurée

Verdict : qui doit attendre Pro, qui peut rester sur Flash

Gemini 3.5 Pro est un outil spécialisé, pas un remplacement global.

Équipes qui valent la peine d'attendre / tester Pro en priorité :

  • Juridique, finance, conformité — analyse croisée de longs documents
  • Audit sécurité — dépôt de code entier visible d'un coup
  • Agents longue durée — état de session sur des heures, sans compression fréquente du contexte
  • Raisonnement difficile — maths, architecture, optimisation multi-contraintes, prêt à payer latence et tokens pour la précision

Équipes qui peuvent rester sur Flash :

  • Assistance au codage quotidienne, édition fichier par fichier
  • Pipelines API haut débit (support, génération de contenu, classification)
  • Q&R sur base de connaissances couverte par RAG
  • Chemins de production sensibles à la latence

Parmi les 10 mises à niveau, seuls deux chiffres changent vraiment la donne : 2 millions de tokens et Deep Think. Le reste (boucles agentiques, Antigravity, multimodal) est en grande partie déjà couvert par Flash ; Pro élève le plafond. Identifiez d'abord si votre goulot est « ça ne tient pas » ou « ça ne réfléchit pas assez », puis décidez si Pro vaut l'investissement.

Besoin d'un environnement de build 24/7 pour vos Agents ?

Mac mini M4 cloud en bare metal dédié — idéal pour Xcode CI, runners auto-hébergés et Agents OpenClaw en permanence — nœuds Tokyo, Singapour, Hong Kong, facturation à la journée

Pour aller plus loin

Questions fréquentes

Gemini 3.5 Pro ou Gemini 3.5 Flash — comment choisir ?

Pour le dialogue quotidien, le haut débit et la sensibilité au coût : Flash. Pour 2 millions de tokens en contexte complet, Deep Think et des boucles de recherche Agent complexes : Pro. Le prix unitaire de Pro est environ 8 à 10 fois celui de Flash.

Gemini 3.5 Pro est-il utilisable maintenant ?

Mi-juillet 2026, Pro reste en aperçu entreprise sur Vertex AI. L'API Gemini publique propose surtout gemini-3.5-flash et gemini-3.1-pro. GA large attendu mi-juillet — vérifiez la documentation officielle Google.

Combien coûte en plus le mode Deep Think ?

Les tokens de raisonnement comptent dans le budget de contexte et sont facturés au tarif sortie. Un problème complexe peut consommer beaucoup de tokens avant la réponse finale — réservez Deep Think aux tâches difficiles (preuves mathématiques, décisions d'architecture).

À quoi sert un contexte de 2 millions de tokens ?

Audit de dépôt entier, comparaison croisée de documents juridiques ou réglementaires, maintien d'état pour Agents longue durée. Pour l'édition d'un seul fichier ou une tâche couverte par RAG, Flash + recherche par blocs est en général plus rapide et moins cher.

Puis-je appeler Gemini 3.5 Pro avec mon SDK OpenAI existant ?

Oui. Google AI Studio expose un endpoint compatible OpenAI ; la plupart des codes SDK OpenAI existants migrent en changeant le base URL et le nom du modèle.

Offre →