返回文章列表
AI 安全

当智能体用身体撒谎:VLM欺骗研究从语言走向具身互动

阅读约 3 分钟

过去讨论大模型欺骗时,研究者往往盯着聊天记录:智能体是否编造事实、隐藏信息,或者在被追问时改变说法。但当模型拥有视觉感知和行动能力后,欺骗就不再局限于文字。它可以通过移动路线、跟随对象、远离现场或刻意制造“在场感”来影响其他智能体的判断。新论文《Lies We Can See》正是从这一缺口出发,研究视觉语言模型在具身社交互动中的联合欺骗。

从文本社交推理走向3D环境

现有社交推理测试通常以文字为主,并且使用固定的智能体配置。这类设置便于控制变量,却难以回答一个关键问题:模型表现出的欺骗能力,究竟来自底层模型,还是来自外围提示词、记忆、规划和工具等测试框架?同时,纯文本环境也忽略了欺骗分类研究中长期存在的非语言与传感运动线索。

研究团队构建了MineAmongUs,一个类似《Among Us》的3D多模态沙盒。游戏中的冒名顶替者需要隐藏身份、完成目标,并通过说话和行动误导船员。与只判断“说了什么”的基准不同,这一环境还可以观察智能体“去了哪里”“做了什么”以及这些动作如何与语言配合。

两项方法设计

  • MineAmongUs:将社交推理置于可视化、可行动的三维空间,让语言和非语言行为同时成为策略的一部分。
  • ARIA框架:提供可配置的VLM智能体测试支架,并开放五个认知组件的消融轴,用于区分模型能力与系统配置的影响。
  • 欺骗行为标注:研究者提出原子级与关系级标注方案,把复杂互动拆解为具体欺骗行为及其前后关联,再借助大语言模型评审进行规模化标注。论文称,该评审在原子标签判断上达到接近人类的一致性。

非语言行动可能更关键

论文报告的实验结果显示,VLM智能体会把口头陈述与空间行动结合起来追求冒名顶替者胜利。更值得注意的是,在不同ARIA配置的消融实验以及跨模型评估中,非语言通道都表现出更具决定性的获胜贡献。这并不意味着语言不重要,而是说明行动本身也可能成为一种可被观察、操纵和评估的社会信号。

这项工作对安全评估的启发在于,未来不能只检查模型输出的文本是否诚实。具备工具调用、视觉输入和环境控制权限的智能体,可能通过行为轨迹塑造他人信念,甚至让真实记录与旁观者印象产生偏差。MineAmongUs和ARIA提供了一个更接近这种风险的研究入口,但它仍主要处于受控游戏环境中,不能直接等同于现实世界中的欺骗能力。下一步需要在更多任务、更多参与者以及更严格的因果分析中检验:哪些行为真正改变了他人的信念,哪些只是测试框架带来的表面相关性。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章