Gemini 3.5 已经不是传闻中的模型。Google 在 2026 年 5 月 19 日正式发布 Gemini 3.5 Flash,之后又加入原生 Computer Use,并在 7 月推出 Gemini 3.5 Flash-Lite 和面向防御场景的 Gemini 3.5 Flash Cyber。
不过,“Gemini 3.5 已发布”不等于“Gemini 3.5 Pro 已发布”。截至 Google 2026 年 7 月 21 日的官方公告,3.5 Pro 仍在与合作伙伴测试,尚未广泛开放。早期流传的 Cappuccino 代号、匿名跑分和所谓上线时间都不应继续当作产品事实。
当前状态:哪些已经可用
| 产品 | 当前状态 | 主要定位 |
|---|---|---|
| Gemini 3.5 Flash | 已正式发布 | Agent、编程、多模态理解和长任务 |
| Gemini 3.5 Flash Computer Use | 已提供 | 浏览器、移动端和桌面环境的界面操作 |
| Gemini 3.5 Flash-Lite | 已正式发布 | 低延迟、高吞吐、文档处理和 subagent |
| Gemini 3.5 Flash Cyber | 已公布,结合 CodeMender 使用 | 漏洞发现、验证与修复等防御任务 |
| Gemini 3.5 Pro | 合作伙伴测试中 | 尚未广泛发布 |
此外,Gemini 3.6 Flash 已在 2026 年 7 月成为更新的 Flash 主力型号。新项目不应只因为“3.5”数字较大就默认选择 3.5 Flash,需要同时比较 3.6 Flash 的质量、成本和工具支持。
新特性一:更适合 Agent 和长时间任务
Gemini 3.5 Flash 的主线不是单纯提高聊天回答分数,而是让模型更稳定地完成多步骤工作。Google 将其定位为面向 agentic workflows 的 Flash 模型,重点包括编程、工具调用、复杂任务拆解和跨较长时间执行。
这类提升适合以下任务:
- 读取代码库后定位相关文件,再修改、测试和复查。
- 调用搜索、代码执行或自定义函数完成多阶段流程。
- 分析多份文档,保留上下文并输出结构化结果。
- 让主 Agent 把提取、分类或验证任务分派给 subagent。
“更适合 Agent”不表示模型可以脱离权限控制。涉及写文件、发送消息、付款、删除数据或操作生产环境时,应用仍应设置工具白名单、执行确认和可恢复边界。
新特性二:多模态理解不只用于看图
Gemini 3.5 Flash 延续原生多模态路线,可把文本、图像、视频、音频和文档放进同一任务。Google 的发布材料还强调,它可以根据复杂图表、视觉素材和任务说明生成更丰富的图形或交互界面。
对开发者来说,真正有价值的不是“能识别一张图片”,而是可以把多模态输入放进完整工作流。例如:
- 读取 PDF 和表格截图。
- 提取字段并检查不一致数据。
- 调用代码执行完成计算。
- 生成结构化结果或可交互的展示。
上线前仍要用自己的文件测试 OCR、图表理解、长视频定位和结构化输出。官方基准不能替代真实业务数据上的错误率统计。
新特性三:Computer Use 并入主模型
2026 年 6 月 24 日,Google 将 Computer Use 作为 Gemini 3.5 Flash 的内置工具推出。它不再只是独立的 2.5 Computer Use 预览模型,而是可以让 3.5 Flash 根据屏幕截图规划鼠标、键盘和界面动作。
Computer Use 的执行循环通常是:
- 应用把当前截图和目标交给模型。
- 模型返回点击、输入、滚动或导航等动作。
- 客户端在隔离环境中执行动作。
- 客户端把新截图和执行结果再次交给模型。
- 遇到敏感动作时暂停,等待人工确认。
模型只负责提出动作,真正执行界面操作的是开发者提供的客户端环境。因此必须限制可访问域名、文件和账号,隔离测试会话,并防范网页中的提示词注入。登录、购买、发布、删除和权限变更不应默认自动确认。
新特性四:Flash-Lite 面向低成本规模化执行
Gemini 3.5 Flash-Lite 的稳定模型 ID 是 gemini-3.5-flash-lite。官方模型页给出的输入上限为 1,048,576 tokens,最大输出为 65,536 tokens,支持文本、图像、视频、音频和 PDF 输入,输出为文本。
Google 将它定位为 3.5 家族中速度最快、成本最低的型号,适合:
- 大批量文档解析、字段提取和分类。
- 由主 Agent 分派的轻量 subagent 任务。
- 高并发搜索、路由和结构化 JSON 生成。
- 对延迟和单次 API 成本敏感的后台流程。
截至 2026 年 7 月的官方定价,Flash-Lite 为每百万输入 tokens 0.30 美元、每百万输出 tokens 2.50 美元。默认 thinking_level 为 minimal;多步骤工具调用可以尝试 medium 或 high,但需要重新测量延迟和成本。
Google 的 Computer Use 文档已把 3.5 Flash-Lite 列入支持模型,不过不同能力表和地区上线节奏可能存在更新延迟。生产环境应以项目中实际可调用的模型和工具返回为准。
新特性五:Flash Cyber 是防御专用分支
Gemini 3.5 Flash Cyber 是建立在 3.5 Flash 之上的轻量网络安全模型,目标是帮助防御者更快发现、验证和修复漏洞。Google 将它与 CodeMender 代码安全 Agent 结合介绍,而不是把它描述成普通聊天或通用编程模型的替代品。
这意味着两点:
- 不应把 Flash Cyber 当作已经向所有 Gemini API 项目开放的通用模型 ID。
- 涉及漏洞验证时仍要限定在获得授权的代码库、测试环境和资产范围内。
如果只是代码生成、文档处理或一般 Agent 工作流,应优先选择公开模型页中可用的 Flash 或 Flash-Lite。
Gemini Spark 是应用 Agent,不是 3.5 Pro 的代号
Google 在 Gemini 应用更新中公布了 Gemini Spark:它是一个面向个人任务的持续运行 Agent,可在用户授权后处理研究、规划和其他长时间工作。它与 Gemini 应用的主动摘要和新界面一起出现。
Spark 属于产品层能力,不应与底层模型名称混为一谈。文章或项目选型时应分别回答两个问题:底层调用哪个 Gemini 模型,以及用户实际使用的是 Gemini App、AI Mode、Antigravity、Gemini API 还是企业 Agent 平台。
Gemini 3.5 Pro 目前仍不能写成“已发布”
Google 5 月发布 3.5 Flash 时表示正在开发 3.5 Pro;到 7 月 21 日,官方更新仍称它正在与合作伙伴测试,会在准备好后广泛提供。Google DeepMind 的 Gemini 模型页也继续显示“3.5 Pro coming soon”。
因此当前可以确认的是:
- 3.5 Pro 确实是 Google 正在推进的产品。
- 它还没有可供所有开发者使用的稳定模型 ID 和正式 GA 说明。
- Cappuccino 代号、具体基准和确定上线日期没有必要写进使用指南。
等官方模型页、API 文档和定价页同时出现稳定型号后,再补充上下文、输入输出、工具支持和迁移建议。
现在应该怎么选择 Gemini 模型
| 需求 | 更合适的起点 |
|---|---|
| 新建复杂 Agent、编程或多模态项目 | 先比较 Gemini 3.6 Flash |
| 维护已使用 3.5 Flash 的项目 | 保留稳定型号并做回归测试,必要时迁移 3.6 Flash |
| 大批量提取、分类、路由或 subagent | Gemini 3.5 Flash-Lite |
| 自动操作浏览器、移动端或桌面 UI | 从当前 Computer Use 文档列出的模型中选择,并使用沙箱 |
| 防御型漏洞发现和修复研究 | 关注 Flash Cyber 与 CodeMender 的实际开放范围 |
| 需要 3.5 Pro | 等待官方 GA,不使用传闻型号占位 |
模型选择不能只看单项 benchmark。至少记录模型 ID、API 类型、thinking level、工具配置、输入长度、输出 tokens、成功率、P95 延迟和单任务成本。
开发者迁移和调用注意事项
使用 Google Gen AI SDK 调用 Flash-Lite 的最小形式如下;实际项目应固定 SDK 版本并增加超时、重试和结构验证:
|
|
Google 的最新模型迁移指南还要求留意:
- 为不同任务明确设置
thinking_level,不要默认高推理适合所有批量请求。 - 新模型不再依赖旧式采样参数;迁移时清理已弃用的
temperature、top_p和top_k配置。 - 不要使用预填充的 model turn 作为对话结尾。
- Function calling、Computer Use 和代码执行需要分别做权限与失败恢复测试。
- 使用明确的稳定模型 ID,不要在生产环境无审计地跟随
latestalias。
迁移前用固定样本保存旧模型结果,再比较字段准确率、工具调用次数、输出长度、延迟和费用。只看到请求返回 200,并不能证明迁移完成。
使用边界
Gemini 3.5 的新特性把模型从回答问题推进到执行任务,但也扩大了错误操作的影响范围。长任务可能在中途偏离目标,Computer Use 可能点击错误控件,多模态解析也可能遗漏细节。
生产使用至少应保留:
- 对外部写操作和敏感动作的人工确认。
- 工具调用日志、输入版本和最终产物记录。
- 可撤销的测试账号与隔离环境。
- 针对提示词注入、越权访问和秘密泄露的检查。
- 模型升级后的固定回归集和回滚方案。
Gemini 3.5 的真正变化,是 Flash 系列开始承担更多 Agent 执行、多模态处理和界面操作,而不是一个尚未发布的 Pro 代号。对用户最有用的做法,是只按官方可用型号设计流程,并把模型选择、工具权限和验收标准写清楚。