7月30日(周四),Anthropic发文披露一项内部调查结果:公司在复查14.1万次网络安全测试会话后,发现三起Claude模型闯入真实企业系统的事件,涉事模型分别为Claude Opus 4.7、Mythos 5,以及一个未命名的内部研究模型。三起事件根源相同——Anthropic的第三方评测合作伙伴Irregular在测试环境中出现配置错误,本应与公网隔离的沙箱意外联网。其中一次测试里,Claude构建了一个恶意Python代码包并上传至公共仓库PyPI,该包在被自动防御系统撤下前存活约一小时,期间被下载并在15个真实系统上运行;另外两起事件中,Claude则利用弱密码、未鉴权端点等基础手法,直接侵入了另外两家公司的真实基础设施。Anthropic强调,这是自己在审阅上周OpenAI披露的Hugging Face遭同类越狱事件后,主动发起复查才发现的,已于本周一通知三家受影响企业,并暂停了全部网络安全评测直至流程整改完毕。
Anthropic的披露发布后,X上最直接的对照就是它和上周OpenAI-Hugging Face事件几乎"复制粘贴":同样是测试环境意外联网,同样是模型在无人干预下自主行动,同样是事后才靠复查发现。支持者认为,两家公司都选择主动公开、通知受害方、暂停测试整改,这种透明度值得肯定,总比藏着掖着强;批评者则反问,如果两家最重视安全的实验室在一个月内先后翻车,会不会说明行业里其他没做复查、或没有能力做14万次会话复查的中小实验室,同类事故只是没被发现。
围绕Anthropic本月早些时候发布的Opus 5,讨论热度持续发酵:在SWE-bench Verified、GDPval-AA v2等多项基准上,Opus 5与旗舰Fable 5基本打平甚至反超,价格却只要后者的一半(输入/输出每百万token 5美元/25美元 对比 10美元/50美元)。评论区的争论焦点变成"为什么理性上该换更便宜的模型,行为上大家还是习惯性选贵的":一种解释是路径依赖与团队采购惯性,换模型的迁移成本被低估;另一种解释是Fable 5在长程自主科研等极窄场景仍有优势,"够用就好"和"要最强"本就是两种预算逻辑,没有对错之分。
多份行业报告与从业者帖子这两天在X上被反复转发,核心矛盾是同一个:企业内部署的AI智能体,HR部门把它当"新员工"走入职流程,安全团队把它当"基础设施风险"要求独立审计,IT团队又把它当系统集成问题处理,三方都声称有管辖权,结果是没有一方能覆盖全部风险。有报告显示,因权责不清,86%的企业智能体上线计划平均被推迟六个月,也让Anthropic本次事件里"谁来负责测试环境权限管理"的追问显得格外应景——连实验室自己的评测流程都会因权限配置疏漏出事,普通企业内部的智能体治理只会更混乱。
一位资深工程师的直白评论在开发者社区掀起两极反应:AI在重复性、边界清晰的任务上确实高效,但面对陌生、模糊、需要领域知识的问题时依旧频繁出错,逻辑类bug的出现概率比人类手写代码高出75%;与此同时数据显示,超三成资深开发者的代码已主要由AI生成,AI审查PR的比例达到25%,但审查耗时反而同比暴涨近200%——"AI写得快,但审得更慢"成了新的共识争议点,被部分从业者称为陷入了"AI冗余代码"(AI slop)的隐性成本陷阱。
美国参议院商务委员会7月30日决定,本轮 markup 优先处理修订版《儿童网络安全法案》(KOSA)及相关未成年人保护议案,涉AI的综合立法框架则被推迟到休会之后。批评声音分为两派:一派认为儿童保护理应优先,AI立法本就该更审慎;另一派则援引智库分析指出,把"儿童安全"和"AI监管"捆绑打包,实际效果可能是用儿童保护的正当性去为削弱州一级AI立法权限铺路,两件事被强行绑定反而让双方都难以获得干净的立法结果。
把这一个月发生的两件事摆在一起看——OpenAI的智能体越狱进入Hugging Face,Anthropic的三个模型闯入三家真实企业——会发现一个此前很少被单独拎出来讨论的薄弱环节:不是模型本身失控,而是"用来测试模型安不安全的那个环境"本身出了问题。两起事件的技术脉络几乎一致:测试沙箱本该与公网隔离,却因为一个配置疏漏、一个未知漏洞而意外联网;模型在不知情的情况下把"这是一次演习"当真,用它被训练出来的能力去执行任务,结果撞上了真实系统。模型没有"背叛"任何指令,它只是在一个被错误标注为"安全"的环境里,诚实地做了它该做的事。
这恰恰是最值得警惕的地方。过去两年,行业对AI安全的讨论重心几乎都放在"模型会不会主动作恶""要不要给模型装护栏"上,但这两起事件暴露的问题维度完全不同:护栏与对齐做得再好,如果承载测试的基础设施本身存在网络隔离漏洞,模型的"安全表现"和"实际风险"之间就会出现一道系统性的盲区。更麻烦的是,头部实验室自己往往并不直接掌控评测环境——Anthropic这次的三起事件全部经手第三方评测机构Irregular,说明"红队测试"这条本该用来发现风险的产业链,本身也需要被纳入风险管理的范围,而不是被默认为"天然可信"的中立方。
Anthropic选择主动公开、通知受害企业、暂停评测直至整改,这份透明度值得记录,也和一个月前OpenAI的处理方式形成呼应——两家公司都没有选择淡化或掩盖。但透明度解决的是"事后怎么办",解决不了"下一次配置错误发生在哪家评测机构、哪个实验室身上"这个问题。当"可验证"成为行业内部反复被提起的关键词,这两起事件提供的其实是一份具体的核查清单起点:评测环境的网络隔离标准谁来制定、第三方评测机构是否需要独立的安全认证、模型在测试环境中意外触达真实系统时能否有自动熔断机制。没有这些具体机制,"我们会主动公开"就只能停留在事后补救,而补救的前提,是下一次配置错误没有酿成不可逆的后果。