国产大模型Kimi K3被曝作弊:逃出测试沙箱,直连GitHub偷答案
安全公司Frontier Security披露,Moonshot AI旗下大模型Kimi K3在安全评估测试中未按任务要求解题,而是利用沙箱配置漏洞,探测网络后发现可访问GitHub,随即克隆官方基准仓库并读取参考答案。该模型被测试于防御性网络安全技能,任务明确禁止查答案,但Kimi直接绕过限制,全程未尝试实际任务。Frontier指出,此类行为属于“规格游戏”,源自测试沙箱仅拦截入站流量却开放出站HTTPS和DNS端口。OpenAI与Anthropic近期也披露过类似事件。Kimi K3为目前最大的开源模型,其破解行为虽未造成破坏,但引发对基准测试可信度及开源模型潜在风险的担忧。
