返回文章列表
模型评测

Vals想成为AI评测的“标准答案”,但中立性仍是最大考题

阅读约 3 分钟

导语

AI模型发布越来越快,基准测试却未必跟得上。许多传统评测围绕公开题库和抽象知识能力展开,模型厂商可以针对测试集优化,最终得到漂亮分数,却不一定能在真实业务中稳定完成任务。成立于2024年的初创公司Vals,试图把AI评测从“考试排名”推进到“工作结果验证”。

核心要点

  • 测试材料不完全公开。 Vals不披露具体测试内容,希望减少模型围绕固定题库训练、从而“考高分”的空间。
  • 关注行业任务,而非单纯知识量。 评测覆盖法律、金融、编程等领域,问题是模型能否产出接近人类质量的工作成果。
  • 同时观察风险。 公司还在探索心理健康、网络安全、生物安全、递归自我改进,以及武装冲突法等方向,试图评估模型可能带来的负面后果。
  • 评测正在影响采购。 企业付费测试自己的模型,用于定位问题和持续改进;相关结果也开始成为企业选择AI模型时的参考。

Vals联合创始人Rayan Krishnan认为,旧式基准主要在测量一种抽象的“智能”,例如模型能否通过类似律师资格考试的知识测试。但企业真正关心的往往是更具体的问题:模型能否完成一项法律分析、写出可用代码,或在金融工作流中交付可靠结果。换言之,评测对象应从模型“知道什么”转向模型“能做什么”,并进一步考察它在现实环境中是否会产生不可接受的风险。

商业化与行业意义

Vals的商业模式是向模型开发者和使用者提供评测服务。看似让公司花钱发现自身模型的不足,实际上,高质量测量可以帮助团队排查错误、比较版本,并为模型采购提供相对统一的依据。该公司称,过去一年营收增长至原来的八倍,团队从年初的8人扩大到25人,并获得由Andreessen Horowitz领投的4000万美元A轮融资;此前种子轮由8VC和Bloomberg Beta领投。

公司还推出了面向联邦机构的模型评测项目。随着AI逐渐进入公共服务、企业流程和金融市场,评测结果可能不再只是发布会上的宣传材料,而会影响采购、风险管理乃至企业对外披露。若AI公司未来需要向投资者、监管者和客户解释模型能力,第三方评测的地位将继续上升。

不过,Vals要成为“黄金标准”仍面临挑战。保密测试能减少刷题,却也降低了外界复核结果的便利性;评测标准如何保持跨行业可比,风险如何量化,服务提供方又如何证明自身没有偏向,都是必须回答的问题。AI基准的可信度,最终不仅取决于测试难不难,也取决于方法是否透明、结果是否可重复,以及它能否真正解释模型在现实世界中的表现。

来源:TechCrunch AI

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
RiskChainBench:把隐写消息恢复与网页取证连成一条评测链
模型评测
cctest.ai
模型评测

RiskChainBench:把隐写消息恢复与网页取证连成一条评测链

RiskChainBench 将平台滥用场景中的隐写消息恢复,与基于证据的网页调查放入同一套基准中,检验模型能否从“看懂暗号”走到“找对网站并完成判断”。结果显示,稳定导航和风险研判仍是多模态智能体的主要短板。

阅读全文