2026 年 5 月 Google I/O 上,Sundar Pichai 同時發布了 Gemini 3.5 Flash(已 GA)與 Gemini 3.5 Pro(旗艦預覽版)。Pro 不是 Flash 的簡單放大版——Google 選擇從零重構而非增量迭代,目標直指當前前沿模型最難啃的三塊:超長上下文、深度推理、多步 Agent 編排。本文以開發者視角拆解 10 項能力升級,並提供與 Flash、Claude、GPT 的選型對照。
先搞清楚:Pro 在 Gemini 3.5 系列裡的定位
Google 在 I/O 2026 採用了雙軌發布策略:
- Gemini 3.5 Flash:5 月即 GA,作為 Google AI Mode 預設模型,主打速度、成本與生態覆蓋。
- Gemini 3.5 Pro:同場亮相但延後廣泛開放,定位「系列內最高能力」,面向複雜推理、整倉分析、長時 Agent 任務。
值得注意的是,據多方報導 Google 在 Pro 發布前推倒重來——內部測試版本未能達到預期推理品質,團隊選擇重構而非趕工上線。這也解釋了為何 Flash 已可用近兩個月,Pro 的 GA 仍一再延後(原目標 6 月底,截至 7 月中旬仍在 Vertex AI 企業預覽階段)。
對開發者而言:Flash 是今天的預設選項;Pro 是「上下文和推理都到頂」時的專項武器,而非全面替代。
升級 1:200 萬 token 上下文視窗
這是 Gemini 3.5 Pro 最醒目的數字:200 萬 token,是 Flash(100 萬)的兩倍,也是當前主流前沿模型裡最大的生產級上下文。
| 對比對象 | 最大上下文 | 相對 Pro |
|---|---|---|
| Gemini 3.5 Pro | 200 萬 token | — |
| Gemini 3.5 Flash | 100 萬 token | 一半 |
| GPT-5.x 擴展檔 | 約 51.2 萬 token | 約 1/4 |
| Claude Opus 4.x | 20 萬 token | 約 1/10 |
200 萬 token 大致能裝下什麼?
- 一個中型 TypeScript monorepo(約 2000 個檔案,每檔 200 行)
- 30 人團隊 3 年的 Slack 匯出記錄
- 4 份完整的 SEC S-1 招股書同時放入上下文
- 民事訴訟全套卷宗(訴狀、證詞、證據、庭審記錄)
關鍵判斷:上下文能裝下 ≠ 值得全量裝入。載入 200 萬 token 會顯著增加 prefill 延遲和輸入成本;若答案只藏在語料的一小塊裡,RAG + Flash 往往更划算。Pro 的上下文優勢體現在跨檔案關係必須同時可見的場景——整倉安全稽核、多合約條款交叉比對、長時 Agent 不願做上下文交接時。
升級 2:Deep Think 深度推理模式
Deep Think 是 Google 對「擴展推理時計算」(extended inference-time compute)的產品命名。模型在生成最終答案前,會花更多推理週期做中間推導和自我糾錯,而不是快速模式匹配。
透過 API 的 thinkingConfig 參數控制,四個檔位:
| thinkingLevel | 適用場景 | 延遲影響 |
|---|---|---|
minimal | 簡單查詢、快速回應 | 最低 |
low | 標準補全 | 低 |
medium | 多步推理 | 中等 |
high | 數學證明、架構決策、多約束最佳化 | 最高 |
import { GoogleGenerativeAI } from "@google/generative-ai";
const genAI = new GoogleGenerativeAI(process.env.GEMINI_API_KEY);
const model = genAI.getGenerativeModel({
model: "gemini-3.5-pro",
generationConfig: {
thinkingConfig: { thinkingLevel: "high" }
}
});
重要成本提示:推理 token 計入上下文預算,並按輸出 token 費率計費。一道需要大量中間推導的難題,可能在寫出最終答案前就消耗可觀 token。Deep Think 是「難題開關」,不是預設模式。
Flash 不支援 Deep Think——這是 Pro 獨佔能力之一。
升級 3:多步 Agentic 研究循環
相比 Gemini 3.1 Pro,3.5 代在 Agentic 能力上有明顯代際躍升。Pro 原生支援多步研究循環:模型可以自主規劃檢索路徑,遍歷多個資訊來源,在內部綜合後再輸出答案,而不是「搜一次、答一次」的單輪模式。
這對以下場景影響直接:
- 競品/市場分析:需要交叉比對多份財報、新聞稿、產品文件
- 技術選型調研:同時翻閱官方文件、GitHub Issue、社群討論
- 合規審查:在冗長政策庫中定位衝突條款
如果你已經在用 Google AI Mode 的「深度研究」功能,Pro 驅動的版本理論上能處理更複雜、更長的調研鏈路——但具體體驗需等廣泛 GA 後實測。
升級 4:自主工作流與工具鏈編排
據 I/O 發布資訊與第三方開發者報告,Gemini 3.5 Pro 繼承了 Flash 的 Agentic 架構,並進一步強化了工具呼叫鏈能力:模型可以把「讀程式碼 → 跑測試 → 修 bug → 再跑測試」這類多步任務串成自主工作流,而不是每步都等使用者確認。
與 MCP 工具協定結合時,Pro 理論上能:
- 透過 MCP 發現可用工具(filesystem、GitHub、資料庫等)
- 根據任務複雜度自主決定呼叫順序
- 在 200 萬 token 視窗內保持長時任務狀態
對獨立開發者和小團隊,這意味著可以把更多「膠水邏輯」交給模型,人只審最終結果。生產環境仍建議加權限邊界和人工檢查點——自主 ≠ 無人值守。
升級 5:Google Antigravity 多 Agent 協同
Gemini 3.5 系列與 Google 同期發布的 Antigravity 開發平台深度綁定。Antigravity 允許 Pro 部署並行子 Agent:不同子任務由獨立 Agent 同時推進,主 Agent 負責協調與合併結果。
典型工作流:
- 子 Agent A:掃描安全漏洞
- 子 Agent B:檢查依賴版本過期
- 子 Agent C:產生修復 PR 草稿
- 主 Agent:彙總報告並排序優先級
這與 多 Agent 四種架構裡的「Orchestrator + Workers」模式高度吻合。Antigravity 的價值在於把編排層產品化,降低自建 Agent 框架的門檻。
若你已在雲端 Mac 上跑 OpenClaw 或自託管 Agent,可關注 Antigravity 是否開放自託管接入——目前仍以 Google 生態內為主。
升級 6:全模態文件級理解
Gemini 系列一貫強項是多模態。3.5 Pro 在此基礎上強化了圖像推理和文件級理解——不僅 OCR 擷取文字,而是對圖表、掃描件、混排 PDF 做結構化語意分析。
實際用途包括:
- 把架構圖、流程圖直接丟進上下文做程式碼生成
- 分析掃描合約中的表格與手寫批註
- 影片關鍵影格 + 字幕聯合推理(具體支援範圍以官方 model card 為準)
對 iOS/macOS 開發者:可以把 Xcode 截圖、Instruments 報告、設計稿一併放入 Pro 上下文,讓模型跨模態理解「介面長什麼樣」和「效能資料說什麼」——這在 Flash 上也能做,但 Pro 的長上下文讓「整份設計規範 + 全部截圖 + 程式碼庫」同時可見成為可能。
升級 7:長上下文檢索精度提升
「能裝 200 萬 token」和「裝進去還能準確召回」是兩件不同的事。早期長上下文模型的通病是中間迷失(lost in the middle)——關鍵資訊埋在上下文中部時,回答品質驟降。
Google 在 3.5 Pro 上宣稱改進了全視窗檢索精度,力求在接近 200 萬 token 時仍保持可用的召回品質。若屬實,這將直接決定 Pro 是否值得「全量灌入」而非分塊 RAG。
建議做法:GA 後用自己的業務語料做needle-in-a-haystack 測試——在 50 萬、100 萬、150 萬 token 處各埋一條關鍵事實,看模型能否準確擷取。別只看發布會數字。
升級 8:前沿推理基準躍升
Google 在 I/O 上暗示 3.5 Pro 將在 ARC-AGI-2、Humanity's Last Exam(HLE) 等高難度推理基準上恢復並超越前沿水準——彌補 Flash 為速度最佳化而在抽象推理上的短板。
截至 2026 年 7 月中旬,官方 benchmark 尚未完整公開,第三方也缺少同 harness 下的公平對比。因此:
- 對「推理品質是否超過 Claude Opus 4.8/GPT-5.5」——目前只能看方向,不能下結論
- Google 的策略更像是上下文長度領跑,而非在所有 agentic coding 榜單上正面硬剛 Anthropic
選型時問自己:你的瓶頸是「推理不夠深」還是「上下文裝不下」?前者等 benchmark,後者 Pro 已有明確差異化。
升級 9:從零重構的新架構
這一點容易被忽略,但對長期使用者很重要:Gemini 3.5 Pro 不是 3.1 Pro 的參數擴容,而是 Google DeepMind 在內部測試未達預期後重新訓練的版本。
實際影響:
- 行為模式可能和 3.1 Pro 差異較大——已有的 prompt 模板、系統提示詞需要重新調優
- 延遲 GA 換來品質保底——對生產系統是好事,但也意味著早期整合文件和定價都不穩定
- 與 Flash 共享部分 Agentic 基礎設施——從 Flash 遷移到 Pro 的工具鏈改動相對小
升級 10:開放 API 與 OpenAI 相容端點
Pro 將透過多條管道開放:
| 管道 | 狀態(2026.07.15) | 備註 |
|---|---|---|
| Vertex AI | 企業預覽 | Model ID:gemini-3.5-pro-preview-06,需 allowlist |
| Google AI Studio | GA 後開放 | 適合個人開發者快速試驗 |
| Gemini API(REST/SDK) | GA 後開放 | Python/TypeScript 官方 SDK |
| OpenAI 相容端點 | AI Studio 已支援 | 現有 OpenAI SDK 改 base URL 即可遷移 |
| Gemini Advanced 訂閱 | 預計 GA 同步 | 消費者端入口 |
長上下文場景下,Context Caching 是關鍵成本槓桿:快取輸入可比標準輸入便宜約 90%,適合「同一份大上下文反覆提問」的工作流(如整倉稽核、多輪法律問答)。
const cachedContent = await genAI.cacheContent({
model: "gemini-3.5-pro",
contents: [{ role: "user", parts: [{ text: largeContext }] }],
ttl: "3600s"
});
const model = genAI.getGenerativeModelFromCachedContent(cachedContent);
const result = await model.generateContent("Based on the context above, find all SQL injection risks");
Pro vs Flash vs 競品:一張表看懂
| 維度 | Gemini 3.5 Pro | Gemini 3.5 Flash | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| 上下文 | 200 萬 token | 100 萬 token | 20 萬 token | 約 51.2 萬 token |
| 深度推理 | Deep Think | 無 | Extended thinking | o-series |
| 輸入價(估) | $12–15 / M | $1.50 / M | 約 $20 / M | 約 $15 / M |
| 輸出價(估) | $36–45 / M | $9 / M | 約 $60 / M | 約 $60 / M |
| GA 狀態 | 預覽中 | 已 GA | 已 GA | 已 GA |
| 最佳場景 | 超長上下文、整倉分析 | 日常高吞吐 | Agentic 編碼 | 結構化多步任務 |
定價為預覽階段估算,GA 後請以 Google 官方定價頁為準。更完整的模型路由策略可參考 OpenRouter Top10 排行。
怎麼接入?目前可用性與時間線
截至 2026 年 7 月 15 日:
- 公開 Gemini API 模型列表仍以
gemini-3.5-flash和gemini-3.1-pro-preview為主,尚未列出 gemini-3.5-pro 的廣泛 GA - 多方報導指向 7 月 17 日左右為 GA 目標日,但 Google 未發布正式 model card 和定價公告——建議當作規劃參考,不要提前把生產依賴押在未確認的版本上
- 企業用戶可透過 Vertex AI 申請
gemini-3.5-pro-preview-06預覽權限
個人開發者現階段行動建議:
- 用 Flash 跑通業務邏輯和工具鏈整合
- 準備 Pro 的 prompt 和成本預算模型(尤其 Deep Think + 長上下文)
- GA 後做 A/B:同一任務分別跑 Flash 和 Pro,用真實 token 消耗和資料品質決定路由策略
結論:誰該等 Pro,誰現在用 Flash 就夠
Gemini 3.5 Pro 是專項工具,不是全面替代。
值得等 Pro/優先試用的團隊:
- 法律、金融、合規——需要多份長文件交叉分析
- 安全稽核——需要整倉程式碼同時可見
- 長時 Agent——會話狀態跨越數小時,不願頻繁做上下文壓縮
- 高難度推理——數學、架構、多約束最佳化,願意用延遲和 token 換準確率
現在繼續用 Flash 就夠的團隊:
- 日常編碼輔助、單檔編輯
- 高吞吐 API 管道(客服、內容生成、分類)
- 可用 RAG 覆蓋的知識庫問答
- 對延遲敏感的生產路徑
10 項升級裡,真正改變遊戲規則的只有兩個數字:200 萬 token 和 Deep Think。其餘能力(Agentic 循環、Antigravity、多模態)Flash 已覆蓋大部分,Pro 是在此基礎上把天花板抬高。先想清楚你的瓶頸是「裝不下」還是「想不深」,再決定要不要為 Pro 買單。
跑 Agent 需要 24/7 線上的建構環境?
雲端 Mac mini M4 獨享裸金屬,適合 Xcode CI、自託管 Runner 與 OpenClaw Agent 常駐——東京、新加坡、香港節點,按天計費
延伸閱讀
常見問題
Gemini 3.5 Pro 和 Gemini 3.5 Flash 怎麼選?
日常對話、高吞吐、成本敏感選 Flash;需要 200 萬 token 全量上下文、Deep Think 深度推理、複雜 Agent 研究循環時選 Pro。Pro 單價約為 Flash 的 8–10 倍。
Gemini 3.5 Pro 現在能用嗎?
截至 2026 年 7 月中旬,Pro 仍在 Vertex AI 企業預覽階段,公開 Gemini API 以 gemini-3.5-flash 和 gemini-3.1-pro 為主。廣泛 GA 預計在 7 月中下旬,請以 Google 官方文件為準。
Deep Think 模式會增加多少成本?
推理 token 計入上下文預算,並按輸出 token 費率計費。複雜問題可能在生成最終答案前就消耗大量 token,建議僅在數學證明、架構決策等高難度任務上開啟。
200 萬 token 上下文適合什麼場景?
適合整倉程式碼稽核、多份法律/政策文件交叉比對、長時 Agent 會話狀態保持。單檔編輯或可用 RAG 檢索的任務,Flash + 分塊檢索通常更便宜更快。
能用現有 OpenAI SDK 呼叫 Gemini 3.5 Pro 嗎?
可以。Google AI Studio 提供 OpenAI 相容端點,多數現有 OpenAI SDK 程式碼只需改 base URL 和 model 名稱即可遷移。