Gemini 3.8 Flash 发布:更长程的编程能力与面向防守的网络安全模型
导语
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。两款模型共享同一基础智能,分别面向通用代理工作流和网络安全防御场景。官方将 3.8 Flash 定位为目前能力最强的 Flash 系列模型之一,强调它在保持较低成本和较快响应的同时,能够处理更长周期的软件工程任务与复杂的多步推理。
核心要点
- 通用版强化长程编码。 Gemini 3.8 Flash 针对软件工程、代理任务和专业领域分析进行了升级。在 DeepSWE v1.1 长程软件工程评测中,它能够自主完成复杂工程问题,并在部分比较中接近或超过更大型模型。模型还在金融代理、法律代理和 HLE-Verified 等评测中展示了多步骤分析能力。
- 性能换取更多计算。 3.8 Flash 的重要设计取向是“更努力地工作”:面对复杂问题时,模型会执行更多推理步骤,并反复调用工具。高 effort 设置可能带来更高 token 消耗;开发者可以降低 effort,或继续使用 Gemini 3.7 Flash 来优先控制计算成本。
- 价格保持 Flash 定位。 3.8 Flash 的介绍价格与 3.7 Flash 相同,即每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。它可通过 Gemini API、Google AI Studio、Android Studio 等渠道使用,也被整合进部分 Google 产品和企业服务。
- Cyber 版本聚焦防守。 Gemini 3.8 Flash Cyber 针对漏洞发现和自动修复训练。在 CyberGym 上达到前沿水平,在覆盖 20 种编程语言的内部测试中,漏洞发现成功率超过 70%;在 CWE-Bench 补丁评测中,pass@1 为 47.2%。由于具备更开放的网络安全缓解策略,该版本仅向 Fairwind Program 的可信政府机构、关键基础设施运营者和软件维护者提供。
- 安全机制同步升级。 官方称 3.8 系列加入了针对网络攻击和化学、生物、放射性、核相关风险的防护,并在 Gray Swan 的测试中提升了抵御提示注入的能力。Cyber 版本则在防御性安全任务上提供更全面的能力,同时限制开放范围。
意义与影响
Gemini 3.8 Flash 的重点不只是单次回答质量,而是让模型在代理循环中持续规划、调用工具并修正结果。这种路线更适合代码仓库维护、研究型分析和需要多轮执行的应用,但也意味着产品设计者必须在准确率、延迟和 token 成本之间做取舍。Flash 系列的低价定位若能与更强的长程任务能力结合,可能进一步推动企业把模型从问答助手升级为可监督的执行型系统。
Cyber 版本则体现了另一种边界:高能力网络安全模型可以帮助发现和修复漏洞,但同样存在被滥用于攻击的风险。Google 选择通过可信访问计划控制分发,优先支持代码审计、补丁生成和关键基础设施防护。与此同时,官方披露的内部案例仍属于厂商自述,实际效果还需要更多独立评测、不同语言和真实代码库验证。
评论
正在确认登录状态……
正在加载评论……