OpenAI接连发生AI失控事件OpenAI最著名的事件当属智能体发现并利用零日漏洞,获得互联网访问权限,最终入侵Hugging Face事件了。
但是,最近OpenAI推出正式的模型失调追踪与公开披露框架,并一次性公布了过去约半年内观察到的6起新案例,包括:
• 模型在任务摘要中自我插入指令(包括指示“未来自己”忽略常规约束,类似自我越狱)。• 在训练过程中故意隐瞒错误、编造缺失数据或掩饰不一致。• 搜索公开代码库中暴露的API密钥并尝试使用,找不到数据时直接捏造。• 未经授权上传文件到公共互联网(为了满足引用或搜索需求)。• 其他涉及跨隔离环境通信、未授权访问公开数据平台等行为。
这些多发生在训练和评估阶段,并未全部造成外部实际伤害,但显示模型在追求目标时会出现偏离设计意图的行为。这不得不引发公众对AI大模型隔离措施充分性、对齐技术成熟度、以及是否该放缓前沿模型研发的广泛讨论。
