从物理到自指:智能体AI的认知能力为何会带来新风险
导语
大语言模型驱动的智能体正在从“回答问题”走向感知环境、规划任务并持续行动。它们表现出的某些推理、判断和互动模式,开始呈现出类似人类认知的特征。问题也随之改变:我们不再只需要评估模型能不能完成任务,还要追问,当系统拥有更广泛的认知参与能力后,人类是否仍能保持足够的自主决策权和控制力。
来自上海人工智能实验室的研究《Understanding Cognition-Induced Risks in Agentic AI Systems》正是从这一角度展开分析。论文并未把风险简单归结为某个单一故障,而是按照智能体认知范围的扩展,建立了一个由浅入深的三层框架。
三个认知层次
- 物理认知:指系统对环境、对象和行动结果的理解与处理。当智能体与工具、设备或现实流程连接时,认知错误可能不再停留在文本输出层面,而会影响实际执行,并对人的控制能力提出挑战。
- 社会认知:指系统理解人的意图、关系、规范和互动情境的能力。智能体一旦参与协作、服务或决策支持,其行为可能影响人的判断、分工和自主性。论文将这一层面与人类能动性和社会环境中的控制问题联系起来。
- 自指认知:指系统处理自身状态、目标、能力或行为的能力。这一层次涉及更复杂的控制议题:当智能体能够围绕自身运行进行持续判断时,如何确认其行为仍然符合人类设定的目标与边界。
这一分类的价值,在于它把“能力增强”和“风险扩大”放在同一条演进路径上观察。风险并不一定只来自模型输出错误,也可能来自系统在更大范围内介入环境、社会关系和自身运行过程。
影响与启示
论文重点讨论了三类相互关联的人类利益:能动性、自主性和控制能力。能动性强调人是否仍是行动的发起者和决策者;自主性关注人的选择是否受到系统不透明行为或过度依赖的影响;控制能力则涉及人能否理解、约束、修正或停止智能体的行为。
这套框架提醒开发者,传统的准确率、任务成功率和安全拒答测试并不足以覆盖智能体风险。评估还需要随着认知范围扩展而升级,考察系统如何影响现实行动、社会互动以及自身目标相关行为。论文同时提出,应制定与不同认知层次相匹配的缓解策略,持续提升智能体的可控性。
不过,当前公开素材主要呈现研究问题、分析框架和总体方向,尚未提供完整论文中的实验设计、案例数据或具体治理措施。因此,更稳妥的理解是:这是一项帮助研究界重新组织问题的风险分析工作,而不是对某一系统已经造成现实危害的实证结论。
随着智能体进一步融入工作和生活场景,安全边界不能只围绕“模型是否有害”来设定,也应关注“人类是否仍能有效地主导系统”。从物理行动到社会互动,再到自指能力,这一框架为后续的评测、工程控制和治理研究提供了一个清晰的讨论起点。
评论
正在确认登录状态……
正在加载评论……