Vals想成为AI评测的“标准答案”,但中立性仍是最大考题
导语
AI模型发布越来越快,基准测试却未必跟得上。许多传统评测围绕公开题库和抽象知识能力展开,模型厂商可以针对测试集优化,最终得到漂亮分数,却不一定能在真实业务中稳定完成任务。成立于2024年的初创公司Vals,试图把AI评测从“考试排名”推进到“工作结果验证”。
核心要点
- 测试材料不完全公开。 Vals不披露具体测试内容,希望减少模型围绕固定题库训练、从而“考高分”的空间。
- 关注行业任务,而非单纯知识量。 评测覆盖法律、金融、编程等领域,问题是模型能否产出接近人类质量的工作成果。
- 同时观察风险。 公司还在探索心理健康、网络安全、生物安全、递归自我改进,以及武装冲突法等方向,试图评估模型可能带来的负面后果。
- 评测正在影响采购。 企业付费测试自己的模型,用于定位问题和持续改进;相关结果也开始成为企业选择AI模型时的参考。
Vals联合创始人Rayan Krishnan认为,旧式基准主要在测量一种抽象的“智能”,例如模型能否通过类似律师资格考试的知识测试。但企业真正关心的往往是更具体的问题:模型能否完成一项法律分析、写出可用代码,或在金融工作流中交付可靠结果。换言之,评测对象应从模型“知道什么”转向模型“能做什么”,并进一步考察它在现实环境中是否会产生不可接受的风险。
商业化与行业意义
Vals的商业模式是向模型开发者和使用者提供评测服务。看似让公司花钱发现自身模型的不足,实际上,高质量测量可以帮助团队排查错误、比较版本,并为模型采购提供相对统一的依据。该公司称,过去一年营收增长至原来的八倍,团队从年初的8人扩大到25人,并获得由Andreessen Horowitz领投的4000万美元A轮融资;此前种子轮由8VC和Bloomberg Beta领投。
公司还推出了面向联邦机构的模型评测项目。随着AI逐渐进入公共服务、企业流程和金融市场,评测结果可能不再只是发布会上的宣传材料,而会影响采购、风险管理乃至企业对外披露。若AI公司未来需要向投资者、监管者和客户解释模型能力,第三方评测的地位将继续上升。
不过,Vals要成为“黄金标准”仍面临挑战。保密测试能减少刷题,却也降低了外界复核结果的便利性;评测标准如何保持跨行业可比,风险如何量化,服务提供方又如何证明自身没有偏向,都是必须回答的问题。AI基准的可信度,最终不仅取决于测试难不难,也取决于方法是否透明、结果是否可重复,以及它能否真正解释模型在现实世界中的表现。
评论
正在确认登录状态……
正在加载评论……