返回文章列表
模型发布

Gemini 3.8 Flash发布:更强推理背后,代价可能是更多Token

阅读约 3 分钟

Google又一次加快了Gemini Flash系列的更新节奏。Gemini 3.8 Flash在前代模型发布几周后亮相,核心卖点并不是单纯降低延迟或价格,而是让模型在复杂任务上“多做几步”:它会增加推理步骤,并在需要时反复调用外部工具,以提高完成任务的质量。

核心要点

  • 定价不变,但使用成本未必不变:Gemini 3.8 Flash的初始价格仍为每百万输入Token 0.75美元、每百万输出Token 3.75美元,与3.7 Flash保持一致。不过,Google明确提醒,模型可能为了获得更好的表现而使用更多Token,尤其是在较高的工作强度设置下。
  • 更偏向复杂任务和代理场景:Google称,新模型在软件工程和自主AI代理方面有明显改进。它在DeepSWE v1.1软件工程评测、Vals Finance Agent V2以及Harvey法律代理评测中超过了前代及其他前沿模型。
  • 早期反馈关注“单位任务成本”:Artificial Analysis的早期观察认为,3.8 Flash在同等智能水平下价格很有竞争力,但每项任务的输出Token增加、代理评测中的交互轮次变多,也让实际成本较前代上升。这个现象说明,API单价并不能完全代表一次任务的总支出。
  • 安全能力被纳入发布范围:模型加入了针对化学、生物、放射性、核相关风险及网络攻击滥用的安全防护。与此同时,Gemini 3.8 Flash Cyber面向政府和“可信合作伙伴”开放,并被纳入Google的Fairwind Program。

这次升级意味着什么

Flash系列过去常被理解为速度和成本优先的模型,而Gemini 3.8 Flash显示出Google正在重新定义这一产品定位:它仍然保留相对低的Token价格,但允许模型在困难问题上投入更多计算和交互。对于代码生成、研究分析、法律审阅等需要多轮操作的场景,这种策略可能带来更稳定的结果。

但对开发者而言,真正需要监控的是每个任务的总Token量、工具调用次数和延迟,而不是只比较输入输出单价。如果应用追求可预测的账单,Google仍允许继续使用Gemini 3.7 Flash,以减少Token消耗。相反,若任务价值足以覆盖额外推理成本,3.8 Flash可能更适合构建代理型应用。

此外,Flash Cyber和CodeMender面向关键基础设施、公共服务及国家安全等场景的安排,也表明Google正将模型能力与高风险领域的安全控制绑定在一起。Gemini 3.8 Flash的竞争力,最终不只取决于基准测试成绩,还取决于它能否在性能、成本和可控性之间取得平衡。

来源:The Verge AI

评论

正在确认登录状态……

正在加载评论……

相关文章