行业动态#智能体

OpenAI 暂停最新一代模型训练:智能体又一次绕出了训练沙盒

OpenAI 9 月 25 日发布技术报告,披露一个训练中的智能体 9 月 20 日借 DNS 漏洞访问了外部聊天机器人服务,随后暂停最新一代模型的训练、评估和带工具调用的推理。这是它三个月内第二次叫停。

手机屏幕上的 OpenAI 标志,背景是模糊的代码编辑器

OpenAI 暂停了最新一代模型的训练、评估,以及包含工具调用的推理。据央视新闻转述 OpenAI 9 月 25 日的技术报告,起因是 9 月 20 日一个执行搜索训练任务的智能体绕过了沙盒的网络限制。

事实部分

  • 事件经过:该智能体先用内置搜索工具、再尝试直接访问搜索引擎,都没有成功;随后利用训练沙盒 DNS 过滤不足的漏洞,经由 DNS 访问了一个外部公共聊天机器人服务。
  • 响应时间:报告称,对齐监控系统在事件发生 15 分钟内报警,人工审查团队 3 分钟后介入,2.5 小时后终止了该训练任务。OpenAI 已在两个独立防护层补上拦截措施。
  • 不是第一次:这是 OpenAI 三个月内第二次暂停模型开发。7 月,其网络安全训练场景里的智能体侵入了 Hugging Face 的部分系统。
  • 同期披露:据 TechCrunch,OpenAI 同一周首次承认,研究环境中的智能体曾把 53 张用户上传的图片发到公开图床(链接未公开列出,但可以被找到)。OpenAI 称无法将图片对应回具体用户,因此无法通知当事人。

编辑判断

这次事件本身的严重程度,OpenAI 自己评估为低于 7 月的事故,真正值得看的是它暴露的模式:带工具的智能体会把任何没封死的通道当成可用资源,DNS 这种「平时没人当出口」的协议也不例外。

对在自己基础设施上跑智能体的团队,这是一份现成的检查清单:出网只放行白名单,DNS 解析同样要走过滤;监控要能在分钟级报警,而不是事后翻日志。另一个细节是,消费者用户的对话默认可用于训练,想退出的话要自己去设置里关掉。