AI最新资讯 130

深度观察:Google 用 Flash 三件套重构生产级 AI Agent 的成本与边界

2026 年 7 月 21 日,Google 以 Gemini 团队名义发布一组相互关联的 Flash 更新。表面上是一次常规的模型代际刷新:更强一点、更快一点、更便宜一点。若把三条产品线并排放在一起,画面会清晰许多——Gemini 3.6 FlashGemini 3.5 Flash-Lite,以及嵌入 CodeMenderGemini 3.5 Flash Cyber,对应的是同一议题的不同切面:如何把 AI Agent 从演示推进到可规模化运行,同时在高风险能力上划定边界。

代表 Gemini 团队发声的产品管理高级总监 Tulsee Doshi 在说明中指出,正在搭建生产级智能体的开发者与客户,需要更高的 token 效率、更低延迟与更可靠的表现。Flash 系列被定义为效率与质量的交汇带,用来支撑可扩展的 agentic 工作流。这一定位决定了本次发布的重心:不是单独炫耀某一条榜单分数,而是压低「跑通一次任务」的综合成本,并让多智能体编排在工程上站得住。

背景:Agent 规模化首先撞上账单与时延

智能体系统与单轮聊天不同。一次完整任务往往包含规划、检索、工具调用、代码执行、校验与重试;链路越长,输出 token、推理步数与调用次数越容易成倍放大。Google 在材料中反复强调三类压力:更高的 token 效率、更低的延迟、更可靠的性能。Flash 系列此前就试图卡在「够用质量」与「可承受成本」之间;本次更新则是在 3.5 Flash 的用户与客户反馈之上,继续把这个平衡往「可规模化」一侧推。

由此可以理解,为什么官方会同时放出「更省 token 的主力模型」和「更快更便宜的高吞吐模型」。前者服务复杂决策与主流程编排,后者吸收批量子任务与流水线负载。专用安全模型则单独成轨:能力足够强、部署却刻意收窄,避免与通用 API 同一开放策略。

产品矩阵:一条工作流上的三层分工

官方将三项更新并列给出,逻辑并不对称。

Gemini 3.6 Flash 被称作 workhorse——编程、知识工作与多模态上的主力。Artificial Analysis Index 显示,它相对 3.5 Flash 约减少 17% 输出 token;在 Datacurve 的 DeepSWE 等部分基准上,输出 token 节省可达约 65%,且输出 token 单价更低。价格为每百万输入 token 1.50 美元、每百万输出 token 7.50 美元,低于 3.5 Flash。官方称,它完成多步工作流时所需推理步数与工具调用更少,并在 OSWorld 验证任务中表现出更好的 token 效率与更低的冗长度。

Gemini 3.5 Flash-Lite 则明确面向低延迟与高吞吐:agentic 检索、文档处理等开发工作流。Artificial Analysis 测得其输出约 350 tokens/s,为 3.5 系列最快;定价每百万输入 0.3 美元、输出 2.5 美元。质量相对 3.1 Flash-Lite 有明显提升,适合高吞吐生产流量。thinking level 可按负载切换:minimal 与 low 偏向大体量、低成本、低延迟执行;更高 thinking level 用于多步子智能体负载。

Gemini 3.5 Flash Cyber 不进入同一条「即日起全面可用」清单。它基于 3.5 Flash 微调,面向漏洞发现与修复,并与 CodeMender 的多智能体编排绑定。Google 强调,成功的网络安全应用需要「模型 + 智能体基础设施」的协同,而非单点模型调用。

官方给出的一则编排示意,把前两档模型的关系写得很直白:在 3.6 Flash 担任 master agent 时,3.5 Flash-Lite 可瞬时生成 25 个可供继续探索的网页设计方案。主模型负责方向与整合,轻量模型负责批量展开——这是当前多智能体系统里常见的「贵决策、便宜扩写」结构,而 Google 把它写进了自家产品叙事。

3.6 Flash:省 token 之后,质量是否同步抬升

只谈「更短」并不足以支撑生产替换。官方同时给出相对 3.5 Flash 的多维对比:

评测 含义侧重 3.6 Flash 3.5 Flash
DeepSWE 代码任务精度、减少无用修改与执行循环 49% 37%
MLE Bench 机器学习研究类任务 63.9% 49.7%
OSWorld-Verified 计算机使用 / 操作系统级任务 83.0% 78.4%
GDPval-AA v2 知识工作相关 1421 1349

DeepSWE 上的变化被官方解释为更高精度、更少非必要代码编辑与更少执行循环——对 agentic 编码而言,这意味着少走弯路、少烧重试 token。MLE Bench 的差距则把「研究向」任务纳入 Flash 档的讨论范围。OSWorld-Verified 的提升,与 Computer use 成为 Gemini API 与 Gemini Enterprise 的内置客户端工具同一条线上:模型不仅要会写代码,还要能在工具界面与环境交互中稳住多步操作。

知识工作与多模态是另一条客户线索。官方点名 Hebbia、Harvey,称其在文档解析、图表与数据分析、报告起草等场景中表现突出。演示向案例还包括:在 AIS 的 Managed Agents 上解析财务数据与会议记录;在 AGY 上通过多智能体编排执行代码迁移,并声称相较 3.5 Flash 延迟更低、质量更高;在 Gemini App 的 canvas 中开发面向 3D 工作流的摄影级贴图提取工具;结合 AGY 与 tldraw 离线编辑器构建交互式主题工作室。这些案例本身偏展示,但覆盖了金融知识工作、工程迁移、视觉与交互生成——与「workhorse」的定位相互印证。

安全侧,3.6 Flash 随发布强化 Frontier Safety,覆盖 CBRN(化学、生物、放射、核)与网络攻击相关滥用方向,官方称对 jailbreak 的抵抗显著增强,同时训练上尽量减少对有益用途的过度拒绝。细节指向 3.6 Flash model card。对机构采购而言,这是能力清单之外必须并读的约束条件。

3.5 Flash-Lite:当「便宜档」开始逼近更重的模型

Flash-Lite 以往容易被理解为「牺牲能力换速度」。本次材料试图改写这一印象。相对 3.1 Flash-Lite,公开数字包括:

  • Terminal-Bench 2.1:54% 对 31%(编程与 agentic 任务)
  • GDM-MRCR v2:72.2% 对 60.1%(长上下文)
  • GDPval-AA v2:1140 对 642(真实世界任务执行相关)

更引人注意的是横向对比:在多项 agentic 与编程评测上,3.5 Flash-Lite 超过 Gemini 3 Flash,例如 SWE-Bench Pro 54.2% 对 49.6%,OSWorld-Verified 74.0% 对 65.1%。官方据此称,对仍运行在 2.5 与 3 Flash 工作负载上的场景,它可能是更快、也更强的选项。结合约 350 tokens/s 的输出速度,以及相对 3.5 Flash 更低的大体量任务延迟,其角色更接近「可扩规模的执行层」,而非单纯兜底。

应用示意同样围绕吞吐展开:从大规模电商数据中提取并合成产品特征;收据翻译与摘要的规模化处理;游戏原型的快速生成与多方案迭代。规格细节见 3.5 Flash-Lite model card。对工程团队,thinking level 与 computer use 内置工具意味着:同一模型 ID 下,既可压成批处理节点,也可在需要时抬高推理深度承担子智能体步骤。

把价格并排,梯度会更清楚。3.6 Flash 为 1.50 / 7.50 美元每百万输入/输出 token;3.5 Flash-Lite 为 0.3 / 2.5 美元。输入价差约五倍,输出价差约三倍。再叠加 3.6 Flash 侧「更少输出、更少工具轮次」的叙事,系统总成本并不只取决于哪一档更便宜,而取决于多少调用落在主模型、多少落在 Lite。

安全支线:能力前移,开放后移

第三项更新跳出通用开发者市场。官方坦言,AI 模型发现安全漏洞的速度,已经超过现有体系完成修复的能力;要应对这一落差,需要「足够强」且「足够高效」的软件防护路径。Flash 的性能与效率被描述为检测、验证与修补代码安全问题的合适基础。Gemini 3.5 Flash Cyber 在 3.5 Flash 上微调,面向发现与修复漏洞,token 单价低于更大规模通用模型。

在 CodeMender 中,多个 3.5 Flash Cyber 智能体协同产出一份合并报告;官方称其在流行基准 CyberGym 上达到前沿竞争水平。关键限制紧随其后:因技术具有双用途属性,部署采取刻意策略——模型将通过 CodeMender,以有限访问试点形式,仅向政府与受信任合作伙伴 提供,时间表述为「soon」。官方解释是:让一线防御方在漏洞被利用前获得发现与修复的先机,同时降低更广泛滥用风险。

这一安排把「模型能力」与「分发策略」拆开。公开市场上的 3.6 Flash 也在强化对 cyber offense 相关滥用的防护;真正把「找洞 + 修洞」做成专用产品的,则不走全量 API 开放。深度阅读时,不宜把 Cyber 与 Flash-Lite 写成同一层级的「即买即用」SKU。

渠道铺开:从 API 到搜索的多层触达

3.6 Flash 与 3.5 Flash-Lite 自发布日起可用,渠道分层清晰:

  • 开发者:Gemini API,入口包括 Google AI Studio 与 Android Studio;3.6 Flash 另在 Google Antigravity 中提供,并指向 Developer Guide。
  • 企业:Gemini Enterprise Agent Platform;3.6 Flash 亦出现在 Gemini Enterprise 应用。
  • 大众产品:Gemini 应用;3.5 Flash-Lite 同时在 Google Search 逐步上线。

渠道结构说明 Google 并不把本次更新仅视为「实验室模型表」上的一行。Agent 平台、企业应用、消费端与搜索侧同步触达,意味着效率优化会同时进入开发者账单、企业内部智能体编排,以及面向更广用户的产品路径。对评估者而言,可在 API 侧复现 token 与延迟,在 Enterprise 侧观察托管智能体与 computer use 的集成形态,在应用与搜索侧感受轻量模型带来的响应变化——验证路径并不单一。

路线图:Flash 提速落地,Pro 与 4 仍在纵深

材料末尾留下两条时间轴。Gemini 3.5 Pro 仍在与合作伙伴测试,官方称将在准备就绪后更广泛推出。与此并行,团队已启动其描述为「迄今最具雄心」的预训练,目标是 Gemini 4,并对进展表示乐观。欢迎开发者在使用 3.6 Flash 与 3.5 Flash-Lite 时反馈,以改进后续模型。

读法可以是双层的:Flash 线负责把 agentic 工作流的单位经济与延迟压到可规模化区间;Pro 与 4 代表更高上限仍在伙伴验证与预训练阶段。机构选型时,宜把「当前可替换上线的执行层」与「中长期更强基座」分开评估,避免用尚未开放的 Pro 时间表延缓对 3.6 Flash / Flash-Lite 的实测。

如何读这次发布

综合公开信息,可把本次更新概括为三句话。

第一,Google 把生产级 Agent 的核心矛盾定义为 token 效率、延迟与可靠性,并用 Flash 的「效率—质量」区间作答;3.6 Flash 用更少输出与更低单价换取更低任务总成本,同时在编程、知识工作与计算机使用评测上相对 3.5 Flash 抬升。

第二,3.5 Flash-Lite 不再只是「更快的弱模型」叙事:在吞吐约 350 tokens/s、更低单价的同时,多项 agentic / 编程分数超过前代 Lite,甚至在部分评测上超过 3 Flash,并被明确放进主从多智能体结构中的执行层。

第三,安全能力单独成轨:CodeMender 与 3.5 Flash Cyber 在 CyberGym 上追求前沿竞争力,但分发仅限政府与受信任伙伴试点——能力前移与开放后移并行。

对已运行 agentic 系统的团队,公开材料中最可操作的对照指标,仍是单位任务输出 token、端到端延迟与失败重试,以及与业务相近的 DeepSWE、OSWorld-Verified、SWE-Bench Pro、Terminal-Bench 等结果。型号选择上,复杂编排与知识/多模态主路径更贴近 3.6 Flash;批量检索、文档流水线与子智能体扩写更贴近 3.5 Flash-Lite;漏洞发现与修复则落在 CodeMender 的受控通道内。Flash 系列此轮更新给出的,不只是三行产品名,而是一套关于「如何把智能体跑得起、跑得稳、跑得受控」的分层答案。

感谢阅读,如果这篇文章对你有帮助,欢迎继续浏览同栏目内容。

返回 AI最新资讯