Wattage:把 AI Agent 的 Token 浪费变成可审计成本
导语
AI Agent 的成本问题往往不是“模型单价太贵”这么简单,而是隐藏在提示词重复发送、工具调用重复、检索无效循环、推理 token 过量等细节里。Wattage 试图扮演一个面向 Agent 的“Kill-A-Watt 电表”:读取一次真实执行轨迹,告诉开发者 token 花在哪里、哪些属于浪费、折算成多少钱,以及应该如何修复。
这个开源工具的定位并不是新的 Agent 框架,而是成本观测与回归控制层。它可直接读取 OpenTelemetry GenAI 语义约定下导出的 OTLP JSON trace,离线完成定价与检测,不需要配置文件,也不需要 API key。
核心要点
- 离线分析 trace:通过
wattage report trace.json读取 Agent 调用轨迹,按输入、输出、缓存读取、缓存创建、reasoning 等类别拆分 token。 - 把浪费换算成真实成本:工具内置带日期的价格快照,对每次模型调用进行计价;如果遇到无法定价的模型,它不会猜测,而是把该调用成本记为 0,并在 CI 中明确失败。
- 八类检测器:包括稳定提示前缀重复发送、缓存使用不足、输出过度冗长、重复工具调用、非收敛循环、检索反复无效、模型规格过高,以及简单任务上的 reasoning 花费过量。
- CI 成本回归门禁:
wattage ci可与 GitHub Actions 集成,根据分数、成本增幅或严重问题让构建失败,并输出 PR 评论、SARIF 和 JUnit XML。 - README 徽章与评分:
wattage score和wattage badge提供 0–100 的 Token Efficiency 等级,便于在项目中持续展示成本效率状态。
Wattage 比较强调“可证据化”的检测。其 nonconvergence detector 关注 Agent 是否在循环中看似持续工作、实则没有取得进展。项目用 10 个手工标注的合成循环做基准,报告中 Wattage 的 Precision、Recall、F1 均为 1.00;作为对照的 SHA-256 精确匹配基线虽然 Precision 为 1.00,但 Recall 只有 0.14,F1 为 0.25。该对比意在说明,简单重复检测很难发现带时间戳重试、策略来回摇摆或内容不同但进展停滞的循环。
项目还给出一个真实捕获的 Agent trace 示例:在稳定提示前缀未启用缓存的场景中,prefix_churn 修复模拟显示成本可从 0.000199 美元降到 0.000110 美元,降幅为 44.7%。作者也说明,示例金额很小是因为它只是 3 轮 demo trace,但机制可迁移到生产规模。
意义与影响
随着 Agent 被接入 CI、客服、研发工具和内部自动化流程,成本问题正在从“账单月底才发现”转向“每次代码变更都可能引入回归”。Wattage 的价值在于把 token 成本纳入工程质量门禁:不仅看功能是否通过,也看 Agent 是否因为提示词、缓存、模型选择或循环控制变得更贵。
它对团队的另一个提醒是,成本优化不能脱离质量。Wattage 为修复建议标注 quality_risk;例如降级模型或减少 reasoning 可能影响输出质量,只有在提供质量映射证据后才会计入评分。这种设计避免了把“省钱”简单等同于“更好”。
总体看,Wattage 适合已有 trace 或准备接入 OpenTelemetry 的 Agent 项目,用作开发期诊断、PR 门禁和持续成本观察。它并不能替代业务侧评测,但能把许多过去靠经验排查的 token 浪费模式,转化为可复现、可审计、可自动化拦截的工程信号。
来源:Hacker News
评论
正在确认登录状态……
正在加载评论……