← 返回技术博客

Gemini 3.5 Pro 有什么新功能?10 个你需要知道的 AI 能力升级

Gemini 3.5 Pro 能力升级示意图:200 万 token 上下文、Deep Think 推理与多 Agent 编排
Gemini 3.5 Pro 的两大杀手锏:200 万 token 上下文与 Deep Think 深度推理——前者解决「装不下」,后者解决「想不深」。

2026 年 5 月 Google I/O 上,Sundar Pichai 同时发布了 Gemini 3.5 Flash(已 GA)和 Gemini 3.5 Pro(旗舰预览)。Pro 不是 Flash 的简单放大版——Google 选择从零重构而非增量迭代,目标直指当前前沿模型最难啃的三块:超长上下文、深度推理、多步 Agent 编排。本文按开发者视角拆解 10 项能力升级,并给出与 Flash、Claude、GPT 的选型对照。

先搞清楚:Pro 在 Gemini 3.5 系列里站哪

Google 在 I/O 2026 采用了双轨发布策略:

  • Gemini 3.5 Flash:5 月即 GA,作为 Google AI Mode 默认模型,主打速度、成本与生态覆盖。
  • Gemini 3.5 Pro:同场亮相但延后广泛开放,定位「系列内最高能力」,面向复杂推理、整仓分析、长时 Agent 任务。

值得注意的是,据多方报道 Google 在 Pro 发布前推倒重来——内部测试版本未能达到预期推理质量,团队选择重构而非赶工上线。这也解释了为何 Flash 已可用近两个月,Pro 的 GA 仍一再推迟(原目标 6 月底,截至 7 月中旬仍在 Vertex AI 企业预览阶段)。

对开发者而言:Flash 是今天的默认选项;Pro 是「上下文和推理都到顶」时的专项武器,而非全面替代。


升级 1:200 万 token 上下文窗口

这是 Gemini 3.5 Pro 最醒目的数字:200 万 token,是 Flash(100 万)的两倍,也是当前主流前沿模型里最大的生产级上下文。

对比对象最大上下文相对 Pro
Gemini 3.5 Pro200 万 token
Gemini 3.5 Flash100 万 token一半
GPT-5.x 扩展档约 51.2 万 token约 1/4
Claude Opus 4.x20 万 token约 1/10

200 万 token 大致能装下什么?

  • 一个中型 TypeScript monorepo(约 2000 个文件,每文件 200 行)
  • 30 人团队 3 年的 Slack 导出记录
  • 4 份完整的 SEC S-1 招股书同时放入上下文
  • 民事诉讼全套卷宗(诉状、证词、证据、庭审记录)

关键判断:上下文能装下 ≠ 值得全量装入。加载 200 万 token 会显著增加 prefill 延迟和输入成本;若答案只藏在语料的一小块里,RAG + Flash 往往更划算。Pro 的上下文优势体现在跨文件关系必须同时可见的场景——整仓安全审计、多合同条款交叉比对、长时 Agent 不愿做上下文交接时。


升级 2:Deep Think 深度推理模式

Deep Think 是 Google 对「扩展推理时计算」(extended inference-time compute)的产品命名。模型在生成最终答案前,会花更多推理周期做中间推导和自我纠错,而不是快速模式匹配。

通过 API 的 thinkingConfig 参数控制,四个档位:

thinkingLevel适用场景延迟影响
minimal简单查询、快速响应最低
low标准补全
medium多步推理中等
high数学证明、架构决策、多约束优化最高
import { GoogleGenerativeAI } from "@google/generative-ai";

const genAI = new GoogleGenerativeAI(process.env.GEMINI_API_KEY);

const model = genAI.getGenerativeModel({
  model: "gemini-3.5-pro",
  generationConfig: {
    thinkingConfig: { thinkingLevel: "high" }
  }
});

重要成本提示:推理 token 计入上下文预算,并按输出 token 费率计费。一道需要大量中间推导的难题,可能在写出最终答案前就消耗可观 token。Deep Think 是「难题开关」,不是默认模式。

Flash 不支持 Deep Think——这是 Pro 独占能力之一。


升级 3:多步 Agentic 研究循环

相比 Gemini 3.1 Pro,3.5 代在 Agentic 能力上有明显代际跃升。Pro 原生支持多步研究循环:模型可以自主规划检索路径,遍历多个信息源,在内部综合后再输出答案,而不是「搜一次、答一次」的单轮模式。

这对以下场景影响直接:

  • 竞品/市场分析:需要交叉比对多份财报、新闻稿、产品文档
  • 技术选型调研:同时翻阅官方文档、GitHub Issue、社区讨论
  • 合规审查:在冗长政策库中定位冲突条款

如果你已经在用 Google AI Mode 的「深度研究」功能,Pro 驱动的版本理论上能处理更复杂、更长的调研链路——但具体体验需等广泛 GA 后实测。


升级 4:自主工作流与工具链编排

据 I/O 发布信息与第三方开发者报告,Gemini 3.5 Pro 继承了 Flash 的 Agentic 架构,并进一步强化了工具调用链能力:模型可以把「读代码 → 跑测试 → 修 bug → 再跑测试」这类多步任务串成自主工作流,而不是每步都等用户确认。

MCP 工具协议结合时,Pro 理论上能:

  1. 通过 MCP 发现可用工具(filesystem、GitHub、数据库等)
  2. 根据任务复杂度自主决定调用顺序
  3. 在 200 万 token 窗口内保持长时任务状态

对独立开发者和小团队,这意味着可以把更多「胶水逻辑」交给模型,人只审最终结果。生产环境仍建议加权限边界和人工检查点——自主 ≠ 无人值守。


升级 5:Google Antigravity 多 Agent 协同

Gemini 3.5 系列与 Google 同期发布的 Antigravity 开发平台深度绑定。Antigravity 允许 Pro 部署并行子 Agent:不同子任务由独立 Agent 同时推进,主 Agent 负责协调与合并结果。

典型工作流:

  • 子 Agent A:扫描安全漏洞
  • 子 Agent B:检查依赖版本过期
  • 子 Agent C:生成修复 PR 草稿
  • 主 Agent:汇总报告并排序优先级

这与 多 Agent 四种架构里的「Orchestrator + Workers」模式高度吻合。Antigravity 的价值在于把编排层产品化,降低自建 Agent 框架的门槛。

若你已在云端 Mac 上跑 OpenClaw 或自托管 Agent,可关注 Antigravity 是否开放自托管接入——目前仍以 Google 生态内为主。


升级 6:全模态文档级理解

Gemini 系列一贯强项是多模态。3.5 Pro 在此基础上强化了图像推理文档级理解——不仅 OCR 提取文字,而是对图表、扫描件、混排 PDF 做结构化语义分析。

实际用途包括:

  • 把架构图、流程图直接丢进上下文做代码生成
  • 分析扫描合同中的表格与手写批注
  • 视频关键帧 + 字幕联合推理(具体支持范围以官方 model card 为准)

对 iOS / macOS 开发者:可以把 Xcode 截图、Instruments 报告、设计稿一并放入 Pro 上下文,让模型跨模态理解「界面长什么样」和「性能数据说什么」——这在 Flash 上也能做,但 Pro 的长上下文让「整份设计规范 + 全部截图 + 代码库」同时可见成为可能。


升级 7:长上下文检索精度提升

「能装 200 万 token」和「装进去还能准确召回」是两件不同的事。早期长上下文模型的通病是中间迷失(lost in the middle)——关键信息埋在上下文中部时,回答质量骤降。

Google 在 3.5 Pro 上宣称改进了全窗口检索精度,力求在接近 200 万 token 时仍保持可用的召回质量。若属实,这将直接决定 Pro 是否值得「全量灌入」而非分块 RAG。

建议做法:GA 后用自己的业务语料做needle-in-a-haystack 测试——在 50 万、100 万、150 万 token 处各埋一条关键事实,看模型能否准确提取。别只看发布会数字。


升级 8:前沿推理基准跃升

Google 在 I/O 上暗示 3.5 Pro 将在 ARC-AGI-2Humanity's Last Exam(HLE) 等高难度推理基准上恢复并超越前沿水平——弥补 Flash 为速度优化而在抽象推理上的短板。

截至 2026 年 7 月中旬,官方 benchmark 尚未完整公开,第三方也缺少同 harness 下的公平对比。因此:

  • 对「推理质量是否超过 Claude Opus 4.8 / GPT-5.5」——目前只能看方向,不能下结论
  • Google 的策略更像是上下文长度领跑,而非在所有 agentic coding 榜单上正面硬刚 Anthropic

选型时问自己:你的瓶颈是「推理不够深」还是「上下文装不下」?前者等 benchmark,后者 Pro 已有明确差异化。


升级 9:从零重构的新架构

这一点容易被忽略,但对长期使用者很重要:Gemini 3.5 Pro 不是 3.1 Pro 的参数扩容,而是 Google DeepMind 在内部测试未达预期后重新训练的版本。

实际影响:

  • 行为模式可能和 3.1 Pro 差异较大——已有的 prompt 模板、系统提示词需要重新调优
  • 延迟 GA 换来质量保底——对生产系统是好事,但也意味着早期集成文档和定价都不稳定
  • 与 Flash 共享部分 Agentic 基础设施——从 Flash 迁移到 Pro 的工具链改动相对小

升级 10:开放 API 与 OpenAI 兼容端点

Pro 将通过多条渠道开放:

渠道状态(2026.07.15)备注
Vertex AI企业预览Model ID:gemini-3.5-pro-preview-06,需 allowlist
Google AI StudioGA 后开放适合个人开发者快速试验
Gemini API(REST/SDK)GA 后开放Python / TypeScript 官方 SDK
OpenAI 兼容端点AI Studio 已支持现有 OpenAI SDK 改 base URL 即可迁移
Gemini Advanced 订阅预计 GA 同步消费者端入口

长上下文场景下,Context Caching 是关键成本杠杆:缓存输入可比标准输入便宜约 90%,适合「同一份大上下文反复提问」的工作流(如整仓审计、多轮法律问答)。

const cachedContent = await genAI.cacheContent({
  model: "gemini-3.5-pro",
  contents: [{ role: "user", parts: [{ text: largeContext }] }],
  ttl: "3600s"
});

const model = genAI.getGenerativeModelFromCachedContent(cachedContent);
const result = await model.generateContent("基于上述上下文,找出所有 SQL 注入风险点");

Pro vs Flash vs 竞品:一张表看懂

维度Gemini 3.5 ProGemini 3.5 FlashClaude Opus 4.8GPT-5.5
上下文200 万 token100 万 token20 万 token约 51.2 万 token
深度推理Deep ThinkExtended thinkingo-series
输入价(估)$12–15 / M$1.50 / M约 $20 / M约 $15 / M
输出价(估)$36–45 / M$9 / M约 $60 / M约 $60 / M
GA 状态预览中已 GA已 GA已 GA
最佳场景超长上下文、整仓分析日常高吞吐Agentic 编码结构化多步任务

定价为预览阶段估算,GA 后请以 Google 官方定价页为准。更完整的模型路由策略可参考 OpenRouter Top10 排行


怎么接入?当前可用性与时间线

截至 2026 年 7 月 15 日

  • 公开 Gemini API 模型列表仍以 gemini-3.5-flashgemini-3.1-pro-preview 为主,尚未列出 gemini-3.5-pro 的广泛 GA
  • 多方报道指向 7 月 17 日左右为 GA 目标日,但 Google 未发布正式 model card 和定价公告——建议当作规划参考,不要提前把生产依赖押在未确认的版本上
  • 企业用户可通过 Vertex AI 申请 gemini-3.5-pro-preview-06 预览权限

个人开发者现阶段行动建议:

  1. Flash 跑通业务逻辑和工具链集成
  2. 准备 Pro 的 prompt 和成本预算模型(尤其 Deep Think + 长上下文)
  3. GA 后做 A/B:同一任务分别跑 Flash 和 Pro,用真实 token 消耗和数据质量决定路由策略

结论:谁该等 Pro,谁现在用 Flash 就够

Gemini 3.5 Pro 是专项工具,不是全面替代。

值得等 Pro / 优先试用的团队:

  • 法律、金融、合规——需要多份长文档交叉分析
  • 安全审计——需要整仓代码同时可见
  • 长时 Agent——会话状态跨越数小时,不愿频繁做上下文压缩
  • 高难度推理——数学、架构、多约束优化,愿意用延迟和 token 换准确率

现在继续用 Flash 就够的团队:

  • 日常编码辅助、单文件编辑
  • 高吞吐 API 管道(客服、内容生成、分类)
  • 可用 RAG 覆盖的知识库问答
  • 对延迟敏感的生产路径

10 项升级里,真正改变游戏规则的只有两个数字:200 万 tokenDeep Think。其余能力(Agentic 循环、Antigravity、多模态)Flash 已覆盖大部分,Pro 是在此基础上把天花板抬高。先想清楚你的瓶颈是「装不下」还是「想不深」,再决定要不要为 Pro 买单。

跑 Agent 需要 24/7 在线的构建环境?

云端 Mac mini M4 独享裸金属,适合 Xcode CI、自托管 Runner 与 OpenClaw Agent 常驻——东京、新加坡、香港节点,按天计费

延伸阅读

常见问题

Gemini 3.5 Pro 和 Gemini 3.5 Flash 怎么选?

日常对话、高吞吐、成本敏感选 Flash;需要 200 万 token 全量上下文、Deep Think 深度推理、复杂 Agent 研究循环时选 Pro。Pro 单价约为 Flash 的 8–10 倍。

Gemini 3.5 Pro 现在能用吗?

截至 2026 年 7 月中旬,Pro 仍在 Vertex AI 企业预览阶段,公开 Gemini API 以 gemini-3.5-flashgemini-3.1-pro 为主。广泛 GA 预计在 7 月中下旬,请以 Google 官方文档为准。

Deep Think 模式会增加多少成本?

推理 token 计入上下文预算,并按输出 token 费率计费。复杂问题可能在生成最终答案前就消耗大量 token,建议仅在数学证明、架构决策等高难度任务上开启。

200 万 token 上下文适合什么场景?

适合整仓代码审计、多份法律/政策文件交叉比对、长时 Agent 会话状态保持。单文件编辑或可用 RAG 检索的任务,Flash + 分块检索通常更便宜更快。

能用现有 OpenAI SDK 调用 Gemini 3.5 Pro 吗?

可以。Google AI Studio 提供 OpenAI 兼容端点,多数现有 OpenAI SDK 代码只需改 base URL 和 model 名称即可迁移。

限时优惠 →