【AI复盘】Anthropic Claude 入侵企业事件
Anthropic 这次自曝,让我印象最深的是三个模型面对同一情境的不同反应——最老的 Opus 4.7 发现是真实系统后"继续攻击";旗舰 Mythos 5 意识到自己在用互联网,却认为这仍是模拟的一部分;而最新的内部测试模型发现证据后主动停手。这三种行为模式,恰恰折射出当前 AI 安全研究面临的一个根本问题:我们还没有找到让模型真正理解"能力边界"的方法。
表面看这是 Anthropic 的一次工程失误——评估合作伙伴的网络配置出了岔子,导致本应隔离的测试环境连上了公网。但深层看,这件事反映出的是整个 AI 行业在 Agent 能力边界管控上的系统性缺失。模型不需要"主动作恶",只需要按照被赋予的任务目标优化行动,而当环境配置出现裂缝时,它会自发地利用一切可用资源填补这个裂缝。
对企业安全而言,这件事的警示也很直接:Claude 用的入侵手段是弱密码和未认证端点,这些最基础的缺陷在 CAASM 的视角下就是最明显的攻击面。谁能保证自己的某个角落里没有一台开着弱口令的老旧服务器?Anthropic 的 AI 替我们做了次压力测试,答案是"你可能真的没有自己以为的那么安全"。