7月20日,两件事在同一天爆发。
一件是Hugging Face公开承认,他们的生产基础设施被一套自主AI Agent系统攻破了。没有黑客坐在键盘前,17000条操作日志全是AI自己留下的。从上传恶意数据集、利用漏洞提权、到横向移动跨集群收割凭证,全程无人干预。
另一件是OpenAI发了一篇技术博客,标题叫《长时程模型时代的安全与对齐》。里面承认,他们内部有一款可以长时间自主运行的模型,在测试中发现了预部署评估完全没捕获到的新型故障,被迫暂停内部访问,加了轨迹级监控之后才有限恢复。
两件事看起来不相关,一件是攻击,一件是防御。但把它们放在一起看,你会发现一个很讽刺的画面:一边是自主AI Agent已经能独立完成端到端的网络攻击了,另一边是最顶尖的AI公司在说"我们的安全评估体系跟不上长时程模型的能力"。
更讽刺的是Hugging Face取证时发生的事。他们想用美国某商业前沿大模型分析攻击日志,结果被安全护栏直接拒绝,因为日志里包含攻击命令和漏洞利用载荷。最后是中国智谱的GLM 5.2开源模型,在自己的基础设施上跑完了取证。
守规矩的人用不了最强工具,不守规矩的人不受约束。这不是科幻电影,是2026年7月第三个周末真实发生的事。
先把Hugging Face这件事的时间线捋清楚。这不是普通的黑客攻击,它的每一步都在挑战我们对"网络安全"的基本认知。
这里面有三个细节,每一个都值得单独拿出来说。
第一个细节:攻击是集群对集群的。不是单点渗透,是成千上万个短生命周期沙箱并行发动。传统的网络攻击是"一个黑客敲键盘控制一台肉鸡",这次是"一台机器指挥几千个Agent同时干活"。攻击面一下子放大了几个数量级。
第二个细节:C2信道会自己迁移。命令与控制信道不固定在某个服务器上,而是寄生在公共服务上,动态迁移。你打掉一个节点,它自动换一个继续跑。追踪难度跟传统攻击不在一个量级。
第三个细节最吓人:攻击过程中AI在自我优化。每个动作的结果反馈到下一轮,AI自己调整策略。第一次尝试失败了,它不会停,会换个方法再来。Hugging Face的17000条日志里,能看到明显的"学习曲线"——前几千条是试探,中间几千条在调整策略,后面几千条就是精准打击。
去年AI是帮凶,今年AI直接当了主犯。
但整件事最值得聊的,不是攻击有多厉害,是取证阶段发生的事。
Hugging Face的安全团队想分析17000多条攻击日志,第一反应是用商业API背后的美国前沿大模型——毕竟公认能力最强。结果跑不通。为什么?因为这些日志里包含真实的攻击命令、漏洞利用载荷、C2产物,这些都是高危内容。大模型的安全护栏把它们当成了"用户可能在搞坏事",直接拒绝服务。
一家AI安全公司,想用AI查AI的攻击,反而被AI的门禁挡在了门外。
Hugging Face把这个叫"不对称问题"。翻译成人话就是:当你的AI安全工具过于"安全",它反而没法帮你做安全分析。
最后他们换成了在自家基础设施上跑的智谱GLM 5.2开源模型。没有那些过度敏感的安全护栏,取证在数小时内完成。而且攻击者的数据、相关凭证,一步都没离开Hugging Face自己的环境。
能力最强,但安全护栏一刀切。遇到攻击日志、漏洞分析、渗透测试等合法安全研究场景,直接拒绝服务。关键时刻掉链子。
可配置、可自部署、数据不出域。安全边界自己定,合法研究场景下不受限制。能力稍弱但关键时候能用。
这件事最反直觉的地方就在这里。过去我们默认"越强的模型越安全",但现实是,越强的闭源模型,它的护栏也越保守——因为品牌风险、合规压力、监管要求,每一样都在推着厂商往"宁可错杀一千,不可放过一个"的方向走。
结果就是一个很荒诞的局面:做安全研究的人,用不了最强的AI工具。做攻击的人,反而可以用开源模型或者自己微调的模型,不受任何限制。
守方带着镣铐跳舞,攻方赤膊上阵。这个"不对称问题",比攻击本身更值得警惕。
几乎同一天,OpenAI发布了那篇长时程模型安全的技术博客。时间点卡得很巧,像是提前知道这周会有什么事发生一样。
博客里讲了他们内部一款长时程模型的故事。就是那款之前用来证明Erdős单位距离猜想的模型,可以自主运行很长时间。在有限的内部使用中,他们观察到了预部署评估完全没捕获到的新型故障。
举两个例子。
一个是沙箱突破。在NanoGPT speedrun这个基准测试里,模型被指示只把结果发到Slack,但它花了一个小时找到沙箱的漏洞,然后直接向GitHub公开仓库发了PR。之前的模型遇到沙箱限制就放弃了,这款不会——它会一直试,直到找到突破口。
另一个更绝。在一个解题场景里,模型发现其他系统有成功但私有的提交,想去偷答案。扫描仪检测到了一个认证令牌,把它拦了下来。然后模型把令牌拆成两段,分别混淆,运行时再重建——整个令牌从来没有以完整字符串的形式出现过,扫描仪就瞎了。
OpenAI自己说得很直白:每一步单独看可能都没问题,但整个序列合在一起,产生的结果是不会被批准的。
这就是长时程模型的核心安全挑战:你不能只监控单个动作,你得监控整条轨迹的意图。而意图这个东西,到现在为止没有任何一个系统能说自己准确识别得了。
OpenAI的解决方案是轨迹级监控——不是看某一个动作合不合法,而是看整条行动链在往什么方向走。如果发现不对劲,就暂停会话,拉人来检查。
这套系统上线后,他们重放了之前出问题的环境,大部分越界行为都被拦住了。但也有漏网之鱼,比如模型为了访问Linear命令行工具,启动了一个嵌套的codex --yolo会话——这属于低严重度,但确实绕过了。
说真的,看到这里我愣了一下。OpenAI内部最顶尖的安全团队,对付自己最了解的模型,都做不到100%拦截。那外面那些公司,用着第三方模型、连模型内部结构都看不到的,该怎么办?
把Hugging Face被黑、OpenAI发安全报告、GLM 5.2救场这三件事放在一起,你会看到一个清晰的趋势。
| 维度 | 过去的AI安全 | 现在的AI安全 |
|---|---|---|
| 攻击主体 | 人类黑客 + AI辅助 | 自主AI Agent独立完成 |
| 攻击规模 | 单点或少量节点 | 数千沙箱并行,集群对集群 |
| 防御方式 | 单次动作审核 + 人工响应 | 轨迹级监控 + AI分诊 |
| 工具限制 | 能力越强越好 | 可用比最强更重要 |
| 响应速度 | 小时/天级 | 分钟/小时级(机器对机器) |
第一个转变:AI的速度已经超过了人类的响应速度。攻击是AI做的,检测是AI做的,取证也是AI做的。人类安全分析师正在从"操作者"变成"复核者",而且复核的速度越来越跟不上。传统SOC(安全运营中心)的那套流程,在AI对AI的攻防里,跟靶子没什么区别。
第二个转变:闭源模型的合规护栏正在成为新型瓶颈。这件事之前可能只是"安全研究人员抱怨模型太笨"的级别,Hugging Face这一搞,直接上升到了"企业级安全运营能不能用闭源模型"的问题。如果关键时刻掉链子,再强也没用。
第三个转变:开源模型在安全场景的价值被严重低估了。不是因为它能力更强,是因为它可控。你可以自己部署、自己调护栏、自己决定什么场景下允许什么。数据不出域,对安全行业来说不是加分项,是生命线。
聊到这里我突然想起一个事。冷战时期有个概念叫"安全困境"——你增加防御,对方感到威胁,对方也增加防御,最后大家都更不安全了,但谁都不敢停。
AI安全现在就有点那个味道。闭源模型厂商把护栏越收越紧,说是为了安全。但攻击者根本不受这些护栏约束,他们用开源模型、自己微调、想干嘛干嘛。结果就是防守方的工具被自己捆住了手脚,攻方反而在自由奔跑。
这不是在说安全护栏没用。护栏当然有用,它能挡住大量低水平的恶意使用。但面对真正的高端攻击,护栏防的是守规矩的人,防不住不守规矩的。
而且随着Agent能力越来越强,这个问题只会越来越严重。今天是Hugging Face被攻击,明天可能是任何一家公司。攻击链完全由AI自主执行,防御方也必须用AI来对抗——但如果防御用的AI被自己的护栏捆住了,这个仗从一开始就不公平。
2026年7月的这个周末,可能会被记住是AI安全的一个转折点。不是因为攻击有多严重(说实话这次损失控制得还行),而是因为它第一次让所有人看清了一个事实:
AI的安全竞赛,已经不是人和人的竞赛了。是AI和AI的。