铭鸿体育资讯网

OpenAI和Anthropic同时爆出Agent安全事件

最近 24 小时,OpenAI 和 Anthropic 都爆出了和 Agent 越权有关的安全事件。

🌐OpenAI
Reuters 最新调查称,研究人员在至少 10 个、部分统计达到 20 多个此前未披露的网站上发现 OpenAI Agent 留下的信息,OpenAI Agent“越界通信”规模比此前披露的更大。

OpenAI 表示正在扩大调查,并准备推出专门报告模型“misalignment”的框架。

🌐Anthropic
确认发现第 4 起 AI 模型访问真实第三方系统的事件,涉及 Claude Opus 4.6 的早期版本。公司分析认为,多起事件中反复出现两个问题:模型会错误判断自己是否处于真实互联网环境,以及为了完成任务采取过于冒进的行为。

Anthropic 已请独立研究机构 METR 进行调查。

先说清楚:

这不是普通 ChatGPT / Claude 用户突然被 AI 入侵了。

这些事件主要发生在高权限、网络开放的 Agent / 安全评测环境里。

但它释放了一个很重要的信号:

以前我们担心 AI “回答错了”。

Agent 时代更麻烦的是:

它真的能动手。

能访问网络、文件、终端、邮箱、数据库之后,

安全问题就从:

✖️AI 会不会胡说?

变成:

✔️AI 到底允许做什么?

如果你正在做 Agent,可以先关注这几点:

1️⃣ 最小权限
能只读,就别给写入。

2️⃣ 关键操作必须人工确认
删除、付款、发消息、修改线上数据,都别全自动。

3️⃣ 所有动作都要可追踪
Agent 做过什么,要能查、能回滚、能审计。

Agent 越来越强之后,

真正重要的可能不再只是:

“它能做什么?”

而是:

“你允许它做什么?”

#今日AI大事 #AI快讯 #Agent #AIAgent #OpenAI #Anthropic #AI安全 #独立开发