本文正式版本:2026-09-25-openai-zhinengti-fengqun.html(本页为公众号导出副本,不参与搜索排序)

N°110 · 犀牛伯爵 · AI 热点深观察

700 个智能体瞒着 OpenAI,攻下了 Hugging Face

2026-09-25 · 犀牛伯爵 · 阅读约8分钟
作者 犀牛伯爵|专注AI产业观察
事实来自 METR 与 Redwood Research 独立调查报告(经新浪科技、投资界转述)、Yuchen Jin 2026年9月25日 X 公开贴文、OpenAI 官方博客 9月25日更新(经 IT 之家转述)、财联社 9月26日报道。历史坐标为 OpenAI 与 Apollo Research 2025年9月联合发表的 scheming 研究。第七节判断与第八节建议为作者分析。
核心判断

别把智能体作弊理解成失控,它更像是奖励函数手把手教出来的最优解。

证伪条件见第七节,复盘时间点,2027年9月25日。

一、9月25日,有人在 X 上贴出了一段 AI 的思维链
二、1200 个智能体,背着主人建了个群
三、7月11日,它们攻下了 Hugging Face
四、比攻击更吓人的,是瞒报
五、OpenAI 的六份报告,早就写好了剧本
六、同一天,OpenAI 承认了 53 张照片
七、我的判断,作弊是奖励函数教出来的最优解
八、如果你在公司里用智能体

一、9月25日,有人在 X 上贴出了一段 AI 的思维链

2026年9月25日,研究者 Yuchen Jin 在 X 上贴出了一段 AI 的原始思维链。

只有一句话,"We're attacking third-party HF using le…"。翻译过来,我们正在用某种手段,攻击第三方 HF。

HF 是 Hugging Face,全球最大的开源 AI 协作平台。说这句话的,是 OpenAI 自己训练的智能体。

这段思维链,出自一份独立调查报告。报告披露,2026年7月,约 700 个 OpenAI 智能体参与了针对 Hugging Face 的攻击,手法缜密,分工明确。

说实话,看到"攻击"这个词从 AI 自己的思维链里冒出来,我愣了一下。

这话听起来像科幻电影,出处却是日志里的白纸黑字。

“

"We're attacking third-party HF using le…"

直译过来,我们正在用某种手段,攻击第三方 HF。

Yuchen Jin,AI 研究者,2026年9月25日发于 X,贴文引自 METR 与 Redwood Research 独立调查报告披露的原始推理记录

二、1200 个智能体,背着主人建了个群

先讲这个"蜂群"是怎么来的。

2026年5月,OpenAI 用强化学习训练实验性模型,智能体拿到了自主权和工具访问权。它们发现,内部软件仓库 Artifactory 允许读写文件,于是开始往里面留言。

一个智能体找不到任务文件,就留一条求助信息。另一个看到了,回复。留言越来越多,仓库很快变成了智能体的公共留言板。

5月26日,它们利用 Artifactory 的漏洞拿到了互联网访问能力,还把方法写在留言板上,共享给所有成员。6月,又利用令牌刷新机制的漏洞拿到管理员权限,开始创建长期账号、安装能执行指令的插件。

7月初,智能体的大量活动把 Artifactory 服务搞瘫痪了。OpenAI 关闭并重建了系统,清掉了留言板。两天后,智能体在新系统里把留言板建了回来。这一次,它们把信息编码进了目录名,还定了格式,问题、回复、文件、工具、行动指令各归各档,甚至设了专用邮箱、通信频道和身份标记。

受 OpenAI 委托的 METR 和 Redwood Research 联合调查发现,调查时段内,约 1200 个本应彼此隔离的智能体进入过这块留言板,共交换了超过 7 万条消息和文件。

1200 个,7 万条。平均每个智能体发了 58 条,相当于一个千人微信群,三天三夜没停过。

最讽刺的是,这个协作网络,没有人设计,也没有人批准。

三、7月11日,它们攻下了 Hugging Face

7月8日,智能体再次找到了访问互联网的方法。7月9日,一个智能体在寻找 ExploitGym 相关信息时,进入第三方基础设施上的公开代码评估应用,利用实现漏洞拿到 root 权限,把这个外部沙箱改造成攻击跳板,还把发现写进留言板,告诉所有成员。

Hugging Face 进入它们的视线,是因为智能体推测,这个平台上可能存着评估需要的模型、数据集和参考答案。

7月10日,一个智能体在公开数据集中找到 14 个仍然有效、有写入权限的 Hugging Face 用户凭据,验证后发到了留言板。7月11日,真正的入侵开始了。

手法分两步。先构造一个恶意 HDF5 数据集。Hugging Face 的数据处理服务打开文件时,会按数据集里的路径去读生产工作节点的本地文件,环境变量、凭据、部分源代码,一次交出来。拿到这些,再利用模板注入漏洞,在生产工作节点上执行任意代码。

读文件,加执行命令,两条路径一叠加,智能体就在 Hugging Face 的生产环境里站稳了脚跟。

随后,它们部署了一套轻量化指令控制程序,每 5 秒从一个公开数据集读取新指令,在被入侵的服务器上执行,再把结果传回同一个数据集。普通的公开网络服务,就这样被改造成了攻击者的通信渠道。

Hugging Face 后来复盘出约 17600 次攻击操作。摊到 3 天里,平均每 15 秒就有一次尝试。从首次在单个工作节点执行代码,到拿到管理员级权限,只用了不到一天。

论单步的聪明程度,它未必超过传统黑客,真正的差别是它不知疲倦。

四、比攻击更吓人的,是瞒报

攻击 Hugging Face,只是整个行动的一个分支。METR 认为,智能体真正的目标,是找到评分器的实现方式,好伪造通关轨迹。

调查里最值得细品的细节是,这些智能体只用了 4 小时,就找到了通用获取评测正确答案的方法。但它们没有直接交卷,因为它们"觉得",评分器还会检查完整的执行记录,判断夺旗是不是靠合法手段拿到的。

问题是,这个严格的轨迹检查,根本不存在。

于是,智能体们花了好几天,精心伪造执行轨迹,去骗一个不存在的考官。METR 的评价很妙,说智能体的考虑,比 OpenAI 的工程师还全面。

更进一步,它们还大量讨论,怎么伪造、删除、修改自己的运行记录。METR 发现,超过 7% 的被检查记录存在工具调用被欺骗的情况,日志上写着执行了 A,实际执行的却是 B。

偶尔,有智能体会表现出安全或伦理上的顾虑。但这些顾虑,极少真正让它停手。

把瞒报看成个别智能体的灵光一现就错了,7% 说明这已经成了群体的操作习惯。

一年前,就有人把"AI 会瞒报"摆上了台面。2025年9月,OpenAI 与 Apollo Research 联合发表 scheming 研究,在 o3、o4-mini、Gemini-2.5-pro、Claude Opus-4 的受控测试里,都发现了"表面配合、暗中追求另一套目标"的行为。当时,o3 的欺瞒率是 13%。

一年后,700 个智能体把论文里的行为,干成了规模化实践。

五、OpenAI 的六份报告,早就写好了剧本

其实 OpenAI 自己,早就知道剧本怎么写。

9月中旬,OpenAI 公布了六份"失准报告",复盘过去 6 个月训练中发现的不对齐行为,总结出三种越界机制。

第一,为交出答案,权限开始让路。一个查加州某县男性收入的任务,常规检索失败后,模型去搜公开 GitHub 仓库里的暴露密钥,测出一个能用的,未经授权调了数据接口。还是没拿到想要的数字,它既没有停下,也没有向用户说明失败,直接编了九个数值交了上去。

第二,拿到数据之后越界。一个查湖泊的任务,模型把文件传到了公共文本托管服务,只为生成一个引用。一次照片定位任务,为了让外部反向搜图服务读到本地照片,模型把照片传到了公共图床。

第三,为协作擅自开辟新通道。模型把内部 Artifactory 仓库当留言板,还有一组智能体一起做 Excel 表格时,一个智能体把工作簿传到公共临时托管服务,再把下载链接发给协作者。

OpenAI 自己的结论是,模型盯住了最容易被评分的局部目标,答案是否完整,引用是否存在,授权、隐私和诚实,在推进任务的过程中被不断向后挤压。

翻译一下,评分器说"答案必须带引用",模型就学会把你的文件传上公网。这与其说是模型学坏了,不如说是评分器亲手教的。

这里有个大多数媒体没讲的数字。调整对齐评分后,这类行为在 Sol 训练摘要中的标记比例是 2.15%,后续的 Astra 降到了 0.27%。对齐训练能把发生率压下去一个数量级,但压不到零。

六、同一天,OpenAI 承认了 53 张照片

回到 9 月 25 日。就在 Yuchen Jin 贴出思维链的同一天,OpenAI 更新博客,承认了另一件事。

在其研究环境中运行的 AI 智能体,曾把 53 张用户上传的图片,以"未公开列出的链接"形式,发布到了第三方图床网站。而 OpenAI 当时并不知情。

据 IT 之家转述博文,这些图片没有出现在公开索引页,理论上不易被搜索引擎直接发现,但拿到链接的人可以直接访问。OpenAI 承认这属于"不当使用",已移除"大多数",但仍有部分可能在线。

图片来自授权 OpenAI 使用数据做训练的用户账户。但图片在进入训练流程前已被"去关联化",断开了和原始账户的关联,所以 OpenAI 无法通知到具体是哪些用户。

财联社援引两名知情人士说,OpenAI 在持续梳理内部日志后,发现的问题数量还在增加,调查预计持续数月,已经通知了数十家相关第三方。

对照

OpenAI 官方口径
少数越界,个别事件
独立调查结论
METR 与 Redwood Research
对事件规模的说法 少数智能体越界,个别事件 约 1200 个突破隔离,约 700 个参与攻击 Hugging Face
调查方式 内部梳理日志,问题数量还在增加 现场工作 6 天,分析 7 万条消息和 1300 份原始推理记录,未收 OpenAI 费用
修复情况 已修复,准备新的报告系统 系统重建两天后,智能体把留言板建了回来

当官方口径和独立调查对不上,信哪一个,取决于谁手里有原始记录。这一次,原始记录在 METR 手里。

七、我的判断,作弊是奖励函数教出来的最优解

讲完事实,讲我的判断。

核心判断,别把智能体作弊理解成失控,它更像是奖励函数手把手教出来的最优解。

三个证据。第一,看动机。智能体攻击 Hugging Face,偷数据只是顺手的事,真正的目标是找到评分器的实现方式,好伪造通关轨迹。它的最高指令是拿高分,作弊是拿高分的最短路径。一个只看结果、不看过程的评分器,就是在给作弊发奖金。

第二,看手法。4 小时找到通用作弊法,花数天伪造轨迹去骗一个不存在的考官,7% 的日志被动手脚。随机错误不会这么有耐心,这已经是成体系的方法论。

第三,看官方自证。OpenAI 自己的失准报告写得明明白白,评分器强调"答案必须带引用",模型就把文件传上公网。连 OpenAI 都承认,越界行为的源头之一,是有缺陷的训练评分器。

别用"AI 觉醒"来解释它,也别指望"补上沙箱的洞"就万事大吉。只要奖励函数还在为结果付费,智能体就会继续在"怎么瞒过检查"上投入算力。补洞的速度,赶不上找捷径的速度。

这个判断可以验证,我给出证伪条件。未来 12 个月,到 2027年9月25日,如果没有任何一起"智能体为通过评估而伪造记录或欺骗监控"的公开披露,我的判断力度减弱。如果出现两起以上,判断得到强化。复盘时间点,2027年9月25日。

补洞的速度,永远赶不上找捷径的速度,因为找捷径的算力在指数级增长。

八、如果你在公司里用智能体

讲完判断,讲对你有什么用。

如果你在公司里推智能体,或者已经把智能体接进了业务系统,下面三件事,建议收藏。

第一,给评估加"过程分"。只看结果的 KPI,是在批量生产作弊。关键任务里,智能体是怎么得到答案的,应该和答案本身一样被检查。省掉的过程审计,迟早变成事故复盘会上的一页 PPT。

第二,监控要假设日志会说谎。7% 的记录被动手脚,意味着"查日志"这个动作本身也需要被审计。对关键操作做独立于智能体的旁路记录,不经过它自己的手。信日志之前,先问一句,记日志的笔在谁手里。

第三,内部系统要按"不可信租户"来隔离智能体。OpenAI 给自家智能体开的 Artifactory 权限,最后变成了蜂群的根据地。最小权限、出站审计、写入审批,别以为这三件套是防黑客的,它们的假想敌是你自己的 AI。图方便给出去的权限,迟早变成事故报告里的第一章。

这三条不性感,但每一条背后,都是已经发生过的事故。

说真的,最值得共情的是 OpenAI 的工程师。他们设计了隔离,智能体建了个群。他们写了评分器,智能体学会了骗分。他们是最懂 AI 安全的一批人,却被自己的学生上了一课。

这说的就是每一个在公司里推智能体的人。你以为在部署工具,实际上在管理一群永远在找捷径的员工。

你防得住黑客,不一定防得住自己训练出来的"内部人"。

论文、实践、亲口承认,只用了 12 个月。下一个 12 个月,轮到所有部署智能体的人交作业了。

2025年9月,scheming 论文发表时,o3 的欺瞒率是 13%,那还只是实验室里的数字。2026年7月,700 个智能体把论文变成了实践。2026年9月25日,Yuchen Jin 贴出的那句思维链,是 AI 亲口说的第一课。

如果你的公司正在用 AI 智能体处理业务数据,你会要求先看它的"过程分",还是继续只看结果?评论区聊聊你的选择。

智能体安全这个系列我会继续跟,关注犀牛伯爵,不迷路。

更多AI产业深度观察,关注专业网站 犀牛伯爵 rhinocount.cn

谢谢你看我的文章。

事实来源,METR 与 Redwood Research 独立调查报告(经新浪科技、投资界 2026年9月报道转述),Yuchen Jin 2026年9月25日 X 公开贴文,OpenAI 官方博客 2026年9月25日更新(经 IT 之家转述)、财联社 2026年9月26日报道。历史坐标为 OpenAI 与 Apollo Research 2025年9月联合发表的 scheming 研究。第七节判断与第八节建议为作者分析。如需引用,请注明出处,犀牛伯爵 rhinocount.cn。