2026年5月の Google I/O で、Sundar Pichai は Gemini 3.5 Flash(GA 済み)と Gemini 3.5 Pro(フラッグシップ・プレビュー)を同時に発表した。Pro は Flash の単なる拡大版ではない——Google は増分改善ではなくゼロからの再構築を選び、現行フロンティアモデルが最も苦戦する3領域——超長コンテキスト、深い推論、多段 Agent オーケストレーション——を正面から狙った。本記事では開発者視点で10のアップグレードを分解し、Flash・Claude・GPT との選定対照を示す。
まず押さえる:Pro は Gemini 3.5 シリーズのどこに立つか
Google は I/O 2026 で二本立てのリリースを採った:
- Gemini 3.5 Flash:5月に GA。Google AI Mode のデフォルトモデルとして、速度・コスト・エコシステム展開を主眼に置く。
- Gemini 3.5 Pro:同じステージで披露されたが広域公開は後ろ倒し。「シリーズ最高能力」として、複雑な推論・リポジトリ全体の分析・長時間 Agent タスクを想定。
注目すべきは、複数の報道によると Google が Pro 公開前に作り直しを決断したこと——社内テスト版が期待する推論品質に届かず、チームは急ぎのリリースではなく再構築を選んだ。これが Flash が約2か月使えるのに対し、Pro の GA が何度も延期されている理由(当初目標は6月末、7月中旬時点では Vertex AI 企業プレビュー段階)を説明する。
開発者向けの整理:Flash は今日のデフォルト。Pro は「コンテキストも推論も上限まで必要」なときの特化兵器であり、全面置き換えではない。
アップグレード 1:200万 token コンテキストウィンドウ
これが Gemini 3.5 Pro の最も目立つ数字:200万 token。Flash(100万)の2倍で、現行の主要フロンティアモデルにおける最大級の本番向けコンテキスト。
| 比較対象 | 最大コンテキスト | Pro 比 |
|---|---|---|
| Gemini 3.5 Pro | 200万 token | — |
| Gemini 3.5 Flash | 100万 token | 半分 |
| GPT-5.x 拡張枠 | 約51.2万 token | 約1/4 |
| Claude Opus 4.x | 20万 token | 約1/10 |
200万 token で何が入る?
- 中規模の TypeScript monorepo(約2000ファイル、各200行)
- 30人チームの3年分 Slack エクスポート
- SEC S-1 目論見書4通を同時にコンテキストへ
- 民事訴訟の全卷宗(訴状、証言、証拠、法廷記録)
判断のポイント:入る ≠ 全部入れる価値がある。200万 token のロードは prefill 遅延と入力コストを大きく増やす。答えが語料の一部にしかないなら、RAG + Flash の方が安く速いことが多い。Pro のコンテキスト優位はファイル間の関係を同時に見せる必要がある場面——リポジトリ全体のセキュリティ監査、複数契約条項の突合、長時間 Agent がコンテキスト引き継ぎを避けたいとき——に効く。
アップグレード 2:Deep Think 深い推論モード
Deep Think は Google が「推論時計算の拡張」(extended inference-time compute)に付けた製品名。最終回答を出す前に、より多くの推論サイクルを使って中間推論と自己修正を行い、素早いパターンマッチに頼らない。
API の thinkingConfig パラメータで制御。4段階:
| thinkingLevel | 適用シーン | レイテンシ影響 |
|---|---|---|
minimal | 単純クエリ、即応 | 最小 |
low | 標準補完 | 低 |
medium | 多段推論 | 中 |
high | 数学証明、アーキテクチャ判断、多制約最適化 | 最大 |
import { GoogleGenerativeAI } from "@google/generative-ai";
const genAI = new GoogleGenerativeAI(process.env.GEMINI_API_KEY);
const model = genAI.getGenerativeModel({
model: "gemini-3.5-pro",
generationConfig: {
thinkingConfig: { thinkingLevel: "high" }
}
});
コスト注意:推論 token はコンテキスト予算に含まれ、出力 token 単価で課金される。中間推論が長い難問は、最終回答の前にかなりの token を消費しうる。Deep Think は「難問スイッチ」であり、デフォルトではない。
Flash は Deep Think をサポートしない——Pro 独占の能力のひとつ。
アップグレード 3:多段 Agentic リサーチループ
Gemini 3.1 Pro と比べ、3.5 世代は Agentic 能力で明確な世代差がある。Pro はネイティブに多段リサーチループをサポート:モデルが検索経路を自律的に計画し、複数ソースを横断して内部で統合したうえで回答する。「一度検索して一度答える」単発モードではない。
影響が直接的なシーン:
- 競合・市場分析:複数の決算、プレスリリース、製品ドキュメントの突合
- 技術選定調査:公式ドキュメント、GitHub Issue、コミュニティ議論を同時参照
- コンプライアンス審査:長大なポリシー群から矛盾条項を特定
Google AI Mode の「ディープリサーチ」を既に使っているなら、Pro 駆動版はより複雑で長い調査チェーンを扱えるはず——ただし実感は広域 GA 後の検証待ち。
アップグレード 4:自律ワークフローとツールチェーン編成
I/O 発表とサードパーティ開発者報告によると、Gemini 3.5 Pro は Flash の Agentic アーキテクチャを継承し、ツール呼び出しチェーンをさらに強化した:「コードを読む → テスト実行 → バグ修正 → 再テスト」のような多段タスクを自律ワークフローに串刺しにでき、各ステップでユーザ確認を待たない。
MCP ツールプロトコルと組み合わせると、Pro は理論上:
- MCP 経由で利用可能ツール(filesystem、GitHub、データベース等)を発見
- タスクの複雑さに応じて呼び出し順序を自律決定
- 200万 token ウィンドウ内で長時間タスクの状態を保持
個人開発者や小チームにとっては、より多くの「接着ロジック」をモデルに任せ、人は最終結果をレビューすればよい。本番では権限境界と人手チェックポイントを——自律 ≠ 無人運用。
アップグレード 5:Google Antigravity マルチ Agent 連携
Gemini 3.5 シリーズは、Google が同時期に発表した Antigravity 開発プラットフォームと深く結びついている。Antigravity では Pro が並列サブ Agentを展開できる:異なるサブタスクを独立 Agent が同時進行し、メイン Agent が調整と結果統合を担う。
典型的なワークフロー:
- サブ Agent A:セキュリティ脆弱性スキャン
- サブ Agent B:依存バージョンの期限切れチェック
- サブ Agent C:修正 PR ドラフト生成
- メイン Agent:レポート統合と優先度付け
これは マルチ Agent 4アーキテクチャの「Orchestrator + Workers」パターンと高い一致を示す。Antigravity の価値はオーケストレーション層の製品化にあり、自前 Agent フレームワーク構築のハードルを下げる。
クラウド Mac 上で OpenClaw やセルフホスト Agent を回しているなら、Antigravity のセルフホスト接続が開くか注視——現状は Google エコシステム内が中心。
アップグレード 6:全モーダル・ドキュメント級理解
Gemini シリーズの強みは一貫してマルチモーダル。3.5 Pro は画像推論とドキュメント級理解を強化——OCR で文字を抜くだけでなく、図表・スキャン文書・混在 PDF を構造化して意味解析する。
実用例:
- アーキテクチャ図・フロー図をそのままコンテキストに入れてコード生成
- スキャン契約書の表や手書き注釈の分析
- 動画のキーフレーム + 字幕の共同推論(対応範囲は公式 model card 参照)
iOS/macOS 開発者向け:Xcode スクリーンショット、Instruments レポート、デザインカンプを Pro コンテキストにまとめて入れ、「UI がどう見えるか」と「パフォーマンスデータが何を言うか」を横断理解させられる——Flash でも可能だが、Pro の長コンテキストなら「設計仕様全体 + 全スクリーンショット + コードベース」を同時に見せる余地がある。
アップグレード 7:長コンテキスト検索精度の向上
「200万 token 入る」と「入れたあと正確に引き出せる」は別問題。初期の長コンテキストモデルは中間迷失(lost in the middle)が慢性化——重要情報がコンテキスト中央に埋まると回答品質が急落する。
Google は 3.5 Pro で全ウィンドウ検索精度を改善したと主張し、200万 token 近傍でも実用の召回品質を維持しようとしている。事実なら、Pro が「全量投入」に値するか、チャンク RAG に留めるかの判断に直結する。
推奨:GA 後に自社コーパスでneedle-in-a-haystack テスト——50万、100万、150万 token 地点に重要事実を1件ずつ埋め、正確に取り出せるか確認。キーノートの数字だけを信じない。
アップグレード 8:フロンティア推論ベンチマークの飛躍
Google は I/O で、3.5 Pro が ARC-AGI-2、Humanity's Last Exam(HLE) など高難度推論ベンチでフロンティア水準を回復・超える示唆を出した——速度最適化で抽象推論が弱かった Flash の穴埋め。
2026年7月中旬時点で、公式ベンチマークは未公開。サードパーティも同一 harness での公平比較が乏しい。したがって:
- 「推論品質が Claude Opus 4.8/GPT-5.5 を上回るか」——方向性は見えるが結論は出せない
- Google の戦略はコンテキスト長さで先行し、すべての agentic coding ランキングで Anthropic と正面衝突する形ではなさそう
選定時に自問:ボトルネックは「推論が浅い」か「コンテキストに入らない」か。前者はベンチ待ち、後者は Pro に明確な差別化がある。
アップグレード 9:ゼロから再構築した新アーキテクチャ
見落とされがちだが、長期利用者にとって重要:Gemini 3.5 Pro は 3.1 Pro のパラメータ拡張ではなく、Google DeepMind が社内テスト未達後に再学習した版。
実務への影響:
- 挙動は 3.1 Pro と大きく異なる可能性——既存のプロンプトテンプレート、システムプロンプトの再チューニングが必要
- GA 遅延は品質担保のトレードオフ——本番には良いが、初期の統合ドキュメントと価格は不安定
- Flash と Agentic 基盤を一部共有——Flash から Pro へのツールチェーン移行は比較的軽い
アップグレード 10:オープン API と OpenAI 互換エンドポイント
Pro は複数チャネルで公開予定:
| チャネル | 状態(2026.07.15) | 備考 |
|---|---|---|
| Vertex AI | 企業プレビュー | Model ID:gemini-3.5-pro-preview-06、allowlist 要 |
| Google AI Studio | GA 後開放 | 個人開発者の素早い試行向け |
| Gemini API(REST/SDK) | GA 後開放 | Python/TypeScript 公式 SDK |
| OpenAI 互換エンドポイント | AI Studio で対応済み | 既存 OpenAI SDK は base URL 変更で移行可 |
| Gemini Advanced サブスク | GA と同期見込み | コンシューマー向け入口 |
長コンテキストでは Context Caching がコストの要:キャッシュ入力は標準入力より約90%安く、「同じ大コンテキストへ繰り返し質問」するワークフロー(リポジトリ監査、多段の法律 Q&A 等)に効く。
const cachedContent = await genAI.cacheContent({
model: "gemini-3.5-pro",
contents: [{ role: "user", parts: [{ text: largeContext }] }],
ttl: "3600s"
});
const model = genAI.getGenerativeModelFromCachedContent(cachedContent);
const result = await model.generateContent("Based on the context above, find all SQL injection risks");
Pro vs Flash vs 競合:一覧表で比較
| 次元 | Gemini 3.5 Pro | Gemini 3.5 Flash | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| コンテキスト | 200万 token | 100万 token | 20万 token | 約51.2万 token |
| 深い推論 | Deep Think | なし | Extended thinking | o-series |
| 入力単価(目安) | $12–15 / M | $1.50 / M | 約 $20 / M | 約 $15 / M |
| 出力単価(目安) | $36–45 / M | $9 / M | 約 $60 / M | 約 $60 / M |
| GA 状態 | プレビュー中 | GA 済み | GA 済み | GA 済み |
| 最適シーン | 超長コンテキスト、リポジトリ全体分析 | 日常の高スループット | Agentic コーディング | 構造化された多段タスク |
価格はプレビュー段階の目安。GA 後は Google 公式価格ページを参照。より完全なモデルルーティング戦略は OpenRouter Top10 ランキングも参考に。
どう接続する?現状の利用可否とタイムライン
2026年7月15日時点:
- 公開 Gemini API のモデル一覧は依然
gemini-3.5-flashとgemini-3.1-pro-previewが中心で、gemini-3.5-pro の広域 GA は未掲載 - 複数報道は 7月17日頃を GA 目標とするが、Google は正式な model card と価格発表を出していない——計画参考に留め、未確認バージョンへ本番依存を先走らせない
- 企業ユーザーは Vertex AI で
gemini-3.5-pro-preview-06プレビュー権限を申請可能
個人開発者の今やること:
- Flash でビジネスロジックとツールチェーン統合を通す
- Pro 向けプロンプトとコスト予算モデルを準備(特に Deep Think + 長コンテキスト)
- GA 後に A/B:同一タスクを Flash と Pro で走らせ、実 token 消費と品質でルーティング方針を決める
結論:Pro を待つべき人、今 Flash で十分な人
Gemini 3.5 Pro は特化ツールであり、全面代替ではない。
Pro を待つ/優先試すチーム:
- 法務・金融・コンプライアンス——複数の長文書の横断分析
- セキュリティ監査——リポジトリ全体を同時に見せる必要
- 長時間 Agent——数時間にわたるセッション状態、頻繁なコンテキスト圧縮を避けたい
- 高難度推論——数学、アーキテクチャ、多制約最適化。レイテンシと token で精度を買う覚悟
今 Flash で十分なチーム:
- 日常のコーディング補助、単一ファイル編集
- 高スループット API パイプライン(サポート、コンテンツ生成、分類)
- RAG でカバーできるナレッジベース Q&A
- レイテンシ敏感な本番パス
10のアップグレードのうち、ゲームを変えるのは実質2つの数字:200万 token と Deep Think。残り(Agentic ループ、Antigravity、マルチモーダル)は Flash が大半をカバーし、Pro はその上で天井を上げる。まずボトルネックが「入らない」か「深く考えられない」かをはっきりさせ、Pro に課金するか決めよう。
Agent を回すなら 24/7 オンラインのビルド環境が要る
クラウド Mac mini M4 専有ベアメタル。Xcode CI、セルフホスト Runner、OpenClaw Agent 常駐に最適——東京・シンガポール・香港ノード、日額課金
関連記事
よくある質問
Gemini 3.5 Pro と Gemini 3.5 Flash はどう選ぶ?
日常対話・高スループット・コスト重視なら Flash。200万 token の全量コンテキスト、Deep Think 深い推論、複雑な Agent リサーチループが必要なら Pro。Pro の単価は Flash の約8–10倍。
Gemini 3.5 Pro は今使える?
2026年7月中旬時点で Pro は Vertex AI 企業プレビュー段階。公開 Gemini API は gemini-3.5-flash と gemini-3.1-pro が中心。広域 GA は7月中下旬見込み——Google 公式ドキュメントを参照。
Deep Think モードはコストをどれだけ増やす?
推論 token はコンテキスト予算に含まれ、出力 token 単価で課金。複雑な問題は最終回答前に大量の token を消費しうる。数学証明、アーキテクチャ判断など高難度タスクでのみ有効化を推奨。
200万 token コンテキストはどんなシーン向き?
リポジトリ全体のコード監査、複数の法律/政策文書の突合、長時間 Agent のセッション状態保持に向く。単一ファイル編集や RAG で足りるタスクは Flash + チャンク検索の方が安く速いことが多い。
既存の OpenAI SDK で Gemini 3.5 Pro を呼べる?
可能。Google AI Studio が OpenAI 互換エンドポイントを提供。多くの既存 OpenAI SDK コードは base URL と model 名を変えるだけで移行できる。