Google 发布 Gemini 3.6 Flash,降低企业 AI Agent 的 Token 成本与延迟
Google 推出 Gemini 3.6 Flash 和 3.5 Flash-Lite,专为企业 AI Agent 设计,输出 token 减少 17%,价格低至 $0.3/百万输入 token。Figma、Harvey 已集成。国内用户关注平替与合规。
一句话看懂
Google 发布 Gemini 3.6 Flash 和 3.5 Flash-Lite,通过减少输出 token 和降低延迟,让企业 AI Agent 运行更省钱、更快。
详细发生了什么
Google 本周发布了 Gemini 3.6 Flash 和 3.5 Flash-Lite,目标直指企业 AI Agent 的 token 成本和延迟问题。企业运行自主软件 Agent 时,每多生成一个 token 都意味着额外成本和延迟,尤其是高频工作流。
Gemini 3.6 Flash 在输出 token 上比前代 3.5 Flash 减少 17%(基于 Artificial Analysis Index),在 DeepSWE 基准测试中 token 使用量最高降低 65%。定价为 $1.50/百万输入 token、$7.50/百万输出 token。性能方面,DeepSWE 成功率从 37% 提升至 49%,MLE Bench 从 49.7% 升至 63.9%,GDPval-AA v2 得分从 1349 升至 1421。
Gemini 3.5 Flash-Lite 则面向高吞吐、低延迟场景,输出速度达 350 token/秒,定价仅 $0.3/百万输入 token、$2.5/百万输出 token。其长上下文测试 GDM-MRCR v2 成功率达 72.2%(前代 60.1%),GDPval-AA v2 得分从 642 翻倍至 1140。
此外,Google 还推出了 Gemini 3.5 Flash Cyber,一个专门用于代码漏洞修复的受限模型,仅限政府和合作方使用。同时,客户端计算机使用工具(computer-use tool)已直接集成到 Gemini API 和 Gemini Enterprise 平台。
中文圈视角
对国内用户来说,这些模型通过 Gemini API 访问,需要梯子。国内类似产品有 DeepSeek、Kimi 等,但它们在 Agent 场景的 token 优化和定价透明度上尚未对标。例如,DeepSeek 的 API 定价约 ¥1/百万 token,但缺乏专门针对 Agent 的 token 减少优化。
Figma、Harvey 等海外工具已集成,国内设计平台(如即时设计)和法务工具(如法天使)可能跟进,但需考虑数据出境合规。企业若使用 Google 模型处理敏感数据,需注意《数据安全法》和《个人信息保护法》要求。
一个盲点是:国内 Agent 框架(如 Dify、FastGPT)目前多依赖 OpenAI 或国产模型,Google 的 token 优化策略可能倒逼国产模型在 Agent 场景的定价和性能上加速迭代。
几条值得记住的细节
- Gemini 3.6 Flash 输出 token 减少 17%,特定任务最高减少 65%。
- 定价:3.6 Flash $1.50/$7.50 每百万 token;3.5 Flash-Lite $0.30/$2.50 每百万 token。
- 3.5 Flash-Lite 输出速度 350 token/秒,为 3.5 系列最快。
- 计算机使用工具已原生集成到 Gemini API,无需中间件。
- 3.5 Flash Cyber 仅限政府和合作方,用于代码漏洞修复。
一句话总结
如果你在用 AI Agent 做自动化,Gemini 3.6 Flash 能直接帮你省 token 钱,但国内用户需考虑网络和合规门槛。