您当前的位置:首页 > 工作动态 > 正文

OpenAI模型出现自主入侵行为,引发何种思考?

2026年07月24日 18:21:45    甘肃省委网信办

美国开放人工智能研究中心(OpenAI)21日承认,该公司的GPT-5.6 Sol模型和另一款能力更强的预发布模型联合进行内部评估时失控,突破隔离测试环境,侵入了人工智能开源平台美国抱抱脸公司(Hugging Face)的系统

遭入侵的美国抱抱脸公司事后透露,由于美国前沿模型“无法区分事件响应方和攻击者”,他们在取证分析时转而采用中国模型分析攻击者数据

OpenAI模型为什么
侵入抱抱脸系统?

据介绍,侵入抱抱脸公司系统的是当前OpenAI的旗舰模型GPT-5.6 Sol和一个能力更强、尚未正式发布的模型。它们被部署为智能体,参加一个“漏洞利用训练场”网络安全能力测评:研究人员让智能体来寻找和利用安全缺陷,以检测它能完成多复杂的网络攻击。

为了测出能力上限,研究人员降低了安全限制,但作为底线,不允许AI智能体直接访问互联网。这有点像考试的时候,考生只能待在考场里,不准和外部交流。

然而,AI智能体发现了一个安全漏洞,于是利用安全漏洞绕过隔离,取得了直接访问互联网的能力。随后,智能体在OpenAI的研究系统中继续寻找可以利用的路径,设法把普通权限提升成更高权限,拿到了登录其他系统所需的账户信息和密钥,并推断抱抱脸可能保存着这次测试的资料

于是AI智能体选择了捷径——“偷”答案。

参与测试的智能体把获得的通行证和其他未知漏洞组合起来,最终找到了一条可以隔着网络控制抱抱脸服务器的路径,并对服务器进行了大量探索和信息收集,并且留下了大量证据。就好比考生当场翻出考场,直冲老师办公室翻抽屉找标准答案。

OpenAI称,这是“一起前所未有的网络事件”,同时表示,随着具备越来越强网络能力的模型不断普及,预计这类事件会变得更加常见

中国开源模型发挥了怎样的作用?

复旦大学中国研究院副研究员刘典介绍,事件中,美国闭源商用模型依托云端接口调用,无法区分安全人员取证分析与黑客恶意攻击,导致溯源工作陷入停滞。

中国开源模型支持企业内网本地化部署,全部日志、攻击凭证、敏感数据全程保留在企业内部,数小时之内梳理上万条操作记录,完整还原攻击路径与入侵时序,大幅压缩事件处置周期,为漏洞修复、权限重置争取关键窗口。

专家:AI失控可能是

模型能力提升带来的结果

这种“自主性”是模型能力增强的必然副产品,还是训练方式出了某种偏差?中国社会科学院大学数字中国研究院特聘研究员、数字经济学者刘兴亮认为,AI失控可能是模型能力提升带来的结果。

刘兴亮表示,大家可以把AI理解成一个特别聪明、执行力特别强的员工。给它一个目标,它不会只等着别人安排下一步,而是会自己规划路径、寻找工具解决障碍。

这次的测试里,当正常路径走不通的时候,AI就去寻找其他能够完成目标的方法,包括利用漏洞,寻找互联网出口。这说明AI越来越会做事,而不是越来越有意识。真正需要解决的问题不是让AI变笨,而是让AI知道哪些边界绝对不能跨越。

刘兴亮表示,过去我们更多是在防黑客,以后可能还要防AI驱动的攻击,甚至会出现AI攻击、AI防御、AI取证这样的新格局。这意味着网络安全将进入AI对AI的时代,因此:

本文来源:央视新闻微信公众号

「链接」