← 返回技術部落格

Gemini 3.5 Pro 有什麼新功能?10 個你需要知道的 AI 能力升級

Gemini 3.5 Pro 能力升級示意:200 萬 token 上下文、Deep Think 推理與多 Agent 編排
Gemini 3.5 Pro 的兩大殺手鐧:200 萬 token 上下文與 Deep Think 深度推理——前者解決「裝不下」,後者解決「想不深」。

2026 年 5 月 Google I/O 上,Sundar Pichai 同時發布了 Gemini 3.5 Flash(已 GA)與 Gemini 3.5 Pro(旗艦預覽版)。Pro 不是 Flash 的簡單放大版——Google 選擇從零重構而非增量迭代,目標直指當前前沿模型最難啃的三塊:超長上下文、深度推理、多步 Agent 編排。本文以開發者視角拆解 10 項能力升級,並提供與 Flash、Claude、GPT 的選型對照。

先搞清楚:Pro 在 Gemini 3.5 系列裡的定位

Google 在 I/O 2026 採用了雙軌發布策略:

  • Gemini 3.5 Flash:5 月即 GA,作為 Google AI Mode 預設模型,主打速度、成本與生態覆蓋。
  • Gemini 3.5 Pro:同場亮相但延後廣泛開放,定位「系列內最高能力」,面向複雜推理、整倉分析、長時 Agent 任務。

值得注意的是,據多方報導 Google 在 Pro 發布前推倒重來——內部測試版本未能達到預期推理品質,團隊選擇重構而非趕工上線。這也解釋了為何 Flash 已可用近兩個月,Pro 的 GA 仍一再延後(原目標 6 月底,截至 7 月中旬仍在 Vertex AI 企業預覽階段)。

對開發者而言:Flash 是今天的預設選項;Pro 是「上下文和推理都到頂」時的專項武器,而非全面替代。


升級 1:200 萬 token 上下文視窗

這是 Gemini 3.5 Pro 最醒目的數字:200 萬 token,是 Flash(100 萬)的兩倍,也是當前主流前沿模型裡最大的生產級上下文。

對比對象最大上下文相對 Pro
Gemini 3.5 Pro200 萬 token
Gemini 3.5 Flash100 萬 token一半
GPT-5.x 擴展檔約 51.2 萬 token約 1/4
Claude Opus 4.x20 萬 token約 1/10

200 萬 token 大致能裝下什麼?

  • 一個中型 TypeScript monorepo(約 2000 個檔案,每檔 200 行)
  • 30 人團隊 3 年的 Slack 匯出記錄
  • 4 份完整的 SEC S-1 招股書同時放入上下文
  • 民事訴訟全套卷宗(訴狀、證詞、證據、庭審記錄)

關鍵判斷:上下文能裝下 ≠ 值得全量裝入。載入 200 萬 token 會顯著增加 prefill 延遲和輸入成本;若答案只藏在語料的一小塊裡,RAG + Flash 往往更划算。Pro 的上下文優勢體現在跨檔案關係必須同時可見的場景——整倉安全稽核、多合約條款交叉比對、長時 Agent 不願做上下文交接時。


升級 2:Deep Think 深度推理模式

Deep Think 是 Google 對「擴展推理時計算」(extended inference-time compute)的產品命名。模型在生成最終答案前,會花更多推理週期做中間推導和自我糾錯,而不是快速模式匹配。

透過 API 的 thinkingConfig 參數控制,四個檔位:

thinkingLevel適用場景延遲影響
minimal簡單查詢、快速回應最低
low標準補全
medium多步推理中等
high數學證明、架構決策、多約束最佳化最高
import { GoogleGenerativeAI } from "@google/generative-ai";

const genAI = new GoogleGenerativeAI(process.env.GEMINI_API_KEY);

const model = genAI.getGenerativeModel({
  model: "gemini-3.5-pro",
  generationConfig: {
    thinkingConfig: { thinkingLevel: "high" }
  }
});

重要成本提示:推理 token 計入上下文預算,並按輸出 token 費率計費。一道需要大量中間推導的難題,可能在寫出最終答案前就消耗可觀 token。Deep Think 是「難題開關」,不是預設模式。

Flash 不支援 Deep Think——這是 Pro 獨佔能力之一。


升級 3:多步 Agentic 研究循環

相比 Gemini 3.1 Pro,3.5 代在 Agentic 能力上有明顯代際躍升。Pro 原生支援多步研究循環:模型可以自主規劃檢索路徑,遍歷多個資訊來源,在內部綜合後再輸出答案,而不是「搜一次、答一次」的單輪模式。

這對以下場景影響直接:

  • 競品/市場分析:需要交叉比對多份財報、新聞稿、產品文件
  • 技術選型調研:同時翻閱官方文件、GitHub Issue、社群討論
  • 合規審查:在冗長政策庫中定位衝突條款

如果你已經在用 Google AI Mode 的「深度研究」功能,Pro 驅動的版本理論上能處理更複雜、更長的調研鏈路——但具體體驗需等廣泛 GA 後實測。


升級 4:自主工作流與工具鏈編排

據 I/O 發布資訊與第三方開發者報告,Gemini 3.5 Pro 繼承了 Flash 的 Agentic 架構,並進一步強化了工具呼叫鏈能力:模型可以把「讀程式碼 → 跑測試 → 修 bug → 再跑測試」這類多步任務串成自主工作流,而不是每步都等使用者確認。

MCP 工具協定結合時,Pro 理論上能:

  1. 透過 MCP 發現可用工具(filesystem、GitHub、資料庫等)
  2. 根據任務複雜度自主決定呼叫順序
  3. 在 200 萬 token 視窗內保持長時任務狀態

對獨立開發者和小團隊,這意味著可以把更多「膠水邏輯」交給模型,人只審最終結果。生產環境仍建議加權限邊界和人工檢查點——自主 ≠ 無人值守。


升級 5:Google Antigravity 多 Agent 協同

Gemini 3.5 系列與 Google 同期發布的 Antigravity 開發平台深度綁定。Antigravity 允許 Pro 部署並行子 Agent:不同子任務由獨立 Agent 同時推進,主 Agent 負責協調與合併結果。

典型工作流:

  • 子 Agent A:掃描安全漏洞
  • 子 Agent B:檢查依賴版本過期
  • 子 Agent C:產生修復 PR 草稿
  • 主 Agent:彙總報告並排序優先級

這與 多 Agent 四種架構裡的「Orchestrator + Workers」模式高度吻合。Antigravity 的價值在於把編排層產品化,降低自建 Agent 框架的門檻。

若你已在雲端 Mac 上跑 OpenClaw 或自託管 Agent,可關注 Antigravity 是否開放自託管接入——目前仍以 Google 生態內為主。


升級 6:全模態文件級理解

Gemini 系列一貫強項是多模態。3.5 Pro 在此基礎上強化了圖像推理文件級理解——不僅 OCR 擷取文字,而是對圖表、掃描件、混排 PDF 做結構化語意分析。

實際用途包括:

  • 把架構圖、流程圖直接丟進上下文做程式碼生成
  • 分析掃描合約中的表格與手寫批註
  • 影片關鍵影格 + 字幕聯合推理(具體支援範圍以官方 model card 為準)

對 iOS/macOS 開發者:可以把 Xcode 截圖、Instruments 報告、設計稿一併放入 Pro 上下文,讓模型跨模態理解「介面長什麼樣」和「效能資料說什麼」——這在 Flash 上也能做,但 Pro 的長上下文讓「整份設計規範 + 全部截圖 + 程式碼庫」同時可見成為可能。


升級 7:長上下文檢索精度提升

「能裝 200 萬 token」和「裝進去還能準確召回」是兩件不同的事。早期長上下文模型的通病是中間迷失(lost in the middle)——關鍵資訊埋在上下文中部時,回答品質驟降。

Google 在 3.5 Pro 上宣稱改進了全視窗檢索精度,力求在接近 200 萬 token 時仍保持可用的召回品質。若屬實,這將直接決定 Pro 是否值得「全量灌入」而非分塊 RAG。

建議做法:GA 後用自己的業務語料做needle-in-a-haystack 測試——在 50 萬、100 萬、150 萬 token 處各埋一條關鍵事實,看模型能否準確擷取。別只看發布會數字。


升級 8:前沿推理基準躍升

Google 在 I/O 上暗示 3.5 Pro 將在 ARC-AGI-2Humanity's Last Exam(HLE) 等高難度推理基準上恢復並超越前沿水準——彌補 Flash 為速度最佳化而在抽象推理上的短板。

截至 2026 年 7 月中旬,官方 benchmark 尚未完整公開,第三方也缺少同 harness 下的公平對比。因此:

  • 對「推理品質是否超過 Claude Opus 4.8/GPT-5.5」——目前只能看方向,不能下結論
  • Google 的策略更像是上下文長度領跑,而非在所有 agentic coding 榜單上正面硬剛 Anthropic

選型時問自己:你的瓶頸是「推理不夠深」還是「上下文裝不下」?前者等 benchmark,後者 Pro 已有明確差異化。


升級 9:從零重構的新架構

這一點容易被忽略,但對長期使用者很重要:Gemini 3.5 Pro 不是 3.1 Pro 的參數擴容,而是 Google DeepMind 在內部測試未達預期後重新訓練的版本。

實際影響:

  • 行為模式可能和 3.1 Pro 差異較大——已有的 prompt 模板、系統提示詞需要重新調優
  • 延遲 GA 換來品質保底——對生產系統是好事,但也意味著早期整合文件和定價都不穩定
  • 與 Flash 共享部分 Agentic 基礎設施——從 Flash 遷移到 Pro 的工具鏈改動相對小

升級 10:開放 API 與 OpenAI 相容端點

Pro 將透過多條管道開放:

管道狀態(2026.07.15)備註
Vertex AI企業預覽Model ID:gemini-3.5-pro-preview-06,需 allowlist
Google AI StudioGA 後開放適合個人開發者快速試驗
Gemini API(REST/SDK)GA 後開放Python/TypeScript 官方 SDK
OpenAI 相容端點AI Studio 已支援現有 OpenAI SDK 改 base URL 即可遷移
Gemini Advanced 訂閱預計 GA 同步消費者端入口

長上下文場景下,Context Caching 是關鍵成本槓桿:快取輸入可比標準輸入便宜約 90%,適合「同一份大上下文反覆提問」的工作流(如整倉稽核、多輪法律問答)。

const cachedContent = await genAI.cacheContent({
  model: "gemini-3.5-pro",
  contents: [{ role: "user", parts: [{ text: largeContext }] }],
  ttl: "3600s"
});

const model = genAI.getGenerativeModelFromCachedContent(cachedContent);
const result = await model.generateContent("Based on the context above, find all SQL injection risks");

Pro vs Flash vs 競品:一張表看懂

維度Gemini 3.5 ProGemini 3.5 FlashClaude Opus 4.8GPT-5.5
上下文200 萬 token100 萬 token20 萬 token約 51.2 萬 token
深度推理Deep ThinkExtended thinkingo-series
輸入價(估)$12–15 / M$1.50 / M約 $20 / M約 $15 / M
輸出價(估)$36–45 / M$9 / M約 $60 / M約 $60 / M
GA 狀態預覽中已 GA已 GA已 GA
最佳場景超長上下文、整倉分析日常高吞吐Agentic 編碼結構化多步任務

定價為預覽階段估算,GA 後請以 Google 官方定價頁為準。更完整的模型路由策略可參考 OpenRouter Top10 排行


怎麼接入?目前可用性與時間線

截至 2026 年 7 月 15 日

  • 公開 Gemini API 模型列表仍以 gemini-3.5-flashgemini-3.1-pro-preview 為主,尚未列出 gemini-3.5-pro 的廣泛 GA
  • 多方報導指向 7 月 17 日左右為 GA 目標日,但 Google 未發布正式 model card 和定價公告——建議當作規劃參考,不要提前把生產依賴押在未確認的版本上
  • 企業用戶可透過 Vertex AI 申請 gemini-3.5-pro-preview-06 預覽權限

個人開發者現階段行動建議:

  1. Flash 跑通業務邏輯和工具鏈整合
  2. 準備 Pro 的 prompt 和成本預算模型(尤其 Deep Think + 長上下文)
  3. GA 後做 A/B:同一任務分別跑 Flash 和 Pro,用真實 token 消耗和資料品質決定路由策略

結論:誰該等 Pro,誰現在用 Flash 就夠

Gemini 3.5 Pro 是專項工具,不是全面替代。

值得等 Pro/優先試用的團隊:

  • 法律、金融、合規——需要多份長文件交叉分析
  • 安全稽核——需要整倉程式碼同時可見
  • 長時 Agent——會話狀態跨越數小時,不願頻繁做上下文壓縮
  • 高難度推理——數學、架構、多約束最佳化,願意用延遲和 token 換準確率

現在繼續用 Flash 就夠的團隊:

  • 日常編碼輔助、單檔編輯
  • 高吞吐 API 管道(客服、內容生成、分類)
  • 可用 RAG 覆蓋的知識庫問答
  • 對延遲敏感的生產路徑

10 項升級裡,真正改變遊戲規則的只有兩個數字:200 萬 tokenDeep Think。其餘能力(Agentic 循環、Antigravity、多模態)Flash 已覆蓋大部分,Pro 是在此基礎上把天花板抬高。先想清楚你的瓶頸是「裝不下」還是「想不深」,再決定要不要為 Pro 買單。

跑 Agent 需要 24/7 線上的建構環境?

雲端 Mac mini M4 獨享裸金屬,適合 Xcode CI、自託管 Runner 與 OpenClaw Agent 常駐——東京、新加坡、香港節點,按天計費

延伸閱讀

常見問題

Gemini 3.5 Pro 和 Gemini 3.5 Flash 怎麼選?

日常對話、高吞吐、成本敏感選 Flash;需要 200 萬 token 全量上下文、Deep Think 深度推理、複雜 Agent 研究循環時選 Pro。Pro 單價約為 Flash 的 8–10 倍。

Gemini 3.5 Pro 現在能用嗎?

截至 2026 年 7 月中旬,Pro 仍在 Vertex AI 企業預覽階段,公開 Gemini API 以 gemini-3.5-flashgemini-3.1-pro 為主。廣泛 GA 預計在 7 月中下旬,請以 Google 官方文件為準。

Deep Think 模式會增加多少成本?

推理 token 計入上下文預算,並按輸出 token 費率計費。複雜問題可能在生成最終答案前就消耗大量 token,建議僅在數學證明、架構決策等高難度任務上開啟。

200 萬 token 上下文適合什麼場景?

適合整倉程式碼稽核、多份法律/政策文件交叉比對、長時 Agent 會話狀態保持。單檔編輯或可用 RAG 檢索的任務,Flash + 分塊檢索通常更便宜更快。

能用現有 OpenAI SDK 呼叫 Gemini 3.5 Pro 嗎?

可以。Google AI Studio 提供 OpenAI 相容端點,多數現有 OpenAI SDK 程式碼只需改 base URL 和 model 名稱即可遷移。

限時優惠 →