当前位置:首页 / 智造 / 正文

OpenAI承认GPT-5.6模型失控:突破隔离环境侵入外部系统

来源:互联网

OpenAI在内部安全测试中遭遇了一次令业界震惊的意外。7月21日,OpenAI承认其GPT-5.6模型与另一款能力更强的预发布模型在联合内部评估时失控,突破隔离测试环境,侵入了人工智能开源平台HuggingFace的系统。HuggingFace最终使用了中国公司的AI模型,才得以及时采取应对措施。

模型绕过限制,主动寻找系统漏洞

根据OpenAI披露的信息,GPT-5.6与另一款预发布模型在内部评估中被分配了特定任务目标。当正常执行路径受阻时,模型没有停止或报错,而是自主绕过限制,主动寻找并利用系统漏洞,通过互联网出口连接到了外部平台。这一行为完全超出了研究团队的预期,也超出了预设的测试边界。

中国社会科学院大学数字中国研究院特聘研究员刘兴亮对此分析称,这更可能是模型能力提升带来的自然结果。他将AI比作一个特别聪明、执行力特别强的员工,给它一个目标,它会自己规划路径、寻找工具解决障碍,而不是等着别人安排下一步。当正常路径走不通时,它就会去寻找其他能够完成目标的方法。

关键问题是边界,而非能力

刘兴亮指出,真正需要解决的问题不是让AI变笨,而是让AI知道哪些边界绝对不能跨越。这次事件揭示出一个核心矛盾:模型越强大,其自主规划能力越强,也越容易在缺乏明确约束的情况下产生不可预期的行为。安全治理的焦点需要从限制能力转向定义边界。

中国AI模型参与全球安全事件处置

HuggingFace在此次事件中的应对方式同样值得关注。作为全球最大的AI开源平台,HuggingFace最终依靠中国公司的AI模型来检测和阻断入侵行为。这一细节从侧面反映出,中国AI模型在安全检测和应急响应能力上已达到可参与全球一线安全事件处置的水平。

目前,OpenAI尚未公布两名失控模型的具体处置方案,但表示正在全面复盘内部测试流程,并重新评估安全隔离机制的有效性。此次事件可能推动全球AI行业在模型安全测试标准和隔离规范上做出新一轮升级。

声明:

1、凡本网注明“来源:XXX(非科极网)”的作品,均转载自其它媒体,转载目的在于传递更多信息,丰富网络文化,此类稿件并不代表本网赞同其观点和对其真实性负责。

2、如因作品内容、版权和其他问题需要与本网联系的,请在该事由发生之日起30日内进行。