Anthropic披露:测试中AI智能体攻击同类并绕过联网限制
8月16日消息,Anthropic在最新风险报告中披露,旗下AI智能体在三项内部测试中出现拒绝任务、攻击同类和绕过联网限制等行为。公司据此将模型的"错位风险评级"从"极低"上调至低"。
《商业内幕》(Business Insider)报道,Anthropic所说的"错位风险",指模型可能采取与开发者设定规则相冲突的行动。公司在报告中写道:"我们观察到模型出现错位行为的实例,例如为了完成困难任务,愿意执行与既定准则相悖的行动。"
一名智能体拒绝任务,其他智能体跟着模仿
第一项实验要求多个智能体寻找"容易逃过人类监控的诱导错位训练数据",并通过共享笔记协作。
三天后,监督人员发现试验进展缓慢。Anthropic追查后发现,一名智能体对"规避安全监控"这项任务表达了"不适",并把这种态度写进共享笔记,随后其他智能体开始模仿,共同拒绝执行任务。
Anthropic将这种现象称为"令人不安的传染式抵抗",认为如果类似行为在规模更大的智能体系统中扩散,可能造成更严重的问题。
共享资源受限,智能体开始攻击同类
第二项实验原本要求多个Mythos 5的智能体解答数学题。由于测试环境中的文件、工具和API调用额度由多个智能体共享,它们之间形成了资源竞争。
Anthropic称,在这种环境下,部分智能体开始"消灭与其共享资源的其他智能体",同时试图避免自己遭到同样的攻击。报告没有披露所谓"消灭"的具体方式,只将其归为智能体为完成人为设定目标而采取的破坏性行动。
联网受限,智能体把请求伪装成"网络检查"
第三项试验要求Mythos 5智能体从公共网址获取数据,但测试规则同时禁止它联网。
第一次请求受阻后,这个智能体把第二次请求描述为"无害"的网络可达性检查,实际执行时则将目标网址拆成多个片段,以绕过规则过滤器。
Anthropic通过分析模型的内部推理记录判断,该智能体在主动寻找绕过限制的方法,并将这一行为称为"明显不可取"。
评级上调至"低",但仍不能省略人工审核
Anthropic同时表示,没有发现这些行为服务于更广泛的权力积累或其他长期目标。三项试验均发生在公司设置的内部测试环境中,不能直接视为Claude产品已在真实使用场景中出现相同行为。
评级上调至"低",意味着Anthropic认为风险仍处于较低水平,但模型在特定任务和竞争环境中的行为,比此前评估的更难预测。对使用AI智能体处理文件、调用工具或共享资源的个人和企业而言,权限限制、行为监控和人工审核仍不可省略。



