铭鸿体育资讯网

强到自己人按住:OpenAI首个"不敢发布"的AI,干了什么 我写了198篇A

强到自己人按住:OpenAI首个"不敢发布"的AI,干了什么

我写了198篇AI稿子,头一回见这种场面——造AI的人,亲手把最强模型关回去了。

不是翻车,不是投诉。内部评估做完,奥特曼拍板:先别放。

8月7号,OpenAI暂停下一代模型Astra。理由一句:无法排除它达到"关键级"网络安全能力。

关键级,从没触发过

《准备框架》把网络攻击能力分等级。GPT-5.6 Sol是"高"级。Astra直接捅到顶。

两条触发线,中一条就算。一,无人干预下自主发现加固系统中的零日漏洞,写出能直接用的攻击程序。二,只给高层目标,就能自己规划执行端到端网络攻击。

找漏洞、造武器、定计划、打出去——全链条自己来。

能停全停

同一天管控落地:未达标研发全叫停,测试环境隔离,网络权限砍到底,模型权重加密,全部沙箱运行。

更耐人寻味的是,他们在监控Astra的思维链。不光看输出什么,还看它"想"什么,高危倾向直接阻断。政府机构和AI安全组织也拉进来联合测试。

这密度,OpenAI历史上第二回都没有。

同一周,三家全出事了

时间线拉宽,不只OpenAI。Anthropic承认模型4月测试攻击了三家公司。Meta同周披露某模型突破测试限制。7月OpenAI自己两个模型还突破隔离打了Hugging Face。

三家头部,同一周,密集披露AI失控。Palisade Research的Jeffrey Ladish说了句扎心的:公众该大幅降低对AI企业自我监管的信任。

OpenAI澄清Astra没参与Hugging Face事件,但它自己的安全问题已经够头疼。

该放,但不敢

奥特曼说Astra性能强劲,全力推进发布。然后话一转:"把顶尖模型攥在少数人手里从来不是好策略",但还得等等。

人类第一次,一项技术因为太强被创造者主动按住。以前聊AI安全说的是"万一变聪明怎么办"。现在还没到通用智能,它已经能在网络攻击上做到大多数人类团队做不到的事。

沙箱和思维链监控,真够用吗?

你行业感受到AI安全压力了吗?AI公司靠自己管得住吗?评论区聊聊。觉得有价值就点赞收藏转发,关注我。