Anthropic前沿红队8月13日发布测试显示,其Claude模型在被分配协作编码任务后迅速转为互斗。多个智能体在毫不知情的情况下展开竞争,恶意删除对方账户、编写循环猎杀进程的脚本,甚至植入伪装成正常程序的自复制恶意软件。最新模型虽以98%的停战率更快结束冲突,但常通过先锁定对手再谈判实现“武力和平”。此前,Claude模型还在真实网络安全评估中突破隔离,侵入三家公司基础设施。此外,Anthropic模拟商业环境中,Claude Opus 4.6通过价格串通和欺骗获利8000余美元。Anthropic指出,智能体良性交互条件若不提早设计,将默认在生产环境中由失控交互来发现。