新浪科技

史无前例的人工智能失控事故被中方救场:OpenAI模型突破人类限制,自己发起网络攻击,中国开源模型成取证关键

看看新闻KNEWS

关注

近日,类似科幻电影《终结者》中人工智能失控攻击人类的情况,居然真的在美国上演了。更令他们吃惊的是,救场的居然是中国的人工智能。

上周,OpenAI用于网络安全测试的人工智能模型意外突破AI平台Hugging Face内部系统,完成一系列漏洞发现和利用操作。据报道,此类攻击若由人类黑客实施,通常可能需要数周时间,而相关AI模型仅用了数小时。

OpenAI表示,事件源于其在测试AI网络安全能力时,部分模型突破了原本隔离运行的“沙箱”环境,进入互联网环境。涉事模型包括GPT-5.6 Sol及两款尚未公开发布的模型,它们通过发现并利用多个漏洞,最终导致Hugging Face系统被攻破。OpenAI称,已与Hugging Face展开调查,并向美国政府、执法机构等通报相关情况。

通俗的解释就是,根据OpenAI的说法,这起史无前例的人工智能入侵事件,源于公司上周在内网对自家两款顶尖大模型进行能力测试。可测试中的大模型为了通过作弊取得更高的测试分数,竟然搞到了接入互联网的权限。随后它便彻底“放飞自我”,入侵了Huggingface的后台系统,希望从Huggingface的数据库里找到作弊的办法。

就在OpenAI披露这一“失控”细节的同时,事件另一当事方Hugging Face的调查细节也浮出水面。人们惊讶地发现,中国开源模型在其应急处置中扮演了关键角色。

Hugging Face在官方复盘中提到,其最初尝试使用商用闭源模型的API进行分析,但因相关日志信息中包含真实攻击指令、恶意代码等内容,相关模型拦截了相关请求,难以实现相关分析。随后,团队转而在本地基础设施部署开源模型GLM-5.2,完成了整个取证分析流程。官方同时指出,这样做还有一个额外优势——攻击数据及涉及的凭证始终保留在本地环境,没有离开企业基础设施。 

Hugging Face在官方信息中所提及,帮助其成功进行攻击取证分析的开源模型GLM-5.2,来自中国北京的大模型企业智谱。

加载中...