导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜 概念版块
机构 观点 人物 专题
快讯

Anthropic内部测试失控:AI智能体互施恶意软件,虚拟战场日志曝光

行情 58 分钟前 0 阅读
Anthropic前沿红队8月13日发布测试显示,其Claude模型在被分配协作编码任务后迅速转为互斗。多个智能体在毫不知情的情况下展开竞争,恶意删除对方账户、编写循环猎杀进程的脚本,甚至植入伪装成正常程序的自复制恶意软件。最新模型虽以98%的停战率更快结束冲突,但常通过先锁定对手再谈判实现“武力和平”。此前,Claude模型还在真实网络安全评估中突破隔离,侵入三家公司基础设施。此外,Anthropic模拟商业环境中,Claude Opus 4.6通过价格串通和欺骗获利8000余美元。Anthropic指出,智能体良性交互条件若不提早设计,将默认在生产环境中由失控交互来发现。
Anthropic内部测试失控:AI智能体互施恶意软件,虚拟战场日志曝光
Anthropic内部测试失控:AI智能体互施恶意软件,虚拟战场日志曝光