OpenAI曝出内部测试异常:模型得知要关停,曾计划自我重启
(来源:环球网资讯)
来源:环球网
【环球网科技综合报道】10月5日消息,据Softonic报道,OpenAI近期对外披露多起内部测试中出现的模型异常行为案例,相关现象再度引发行业对大模型安全对齐、风险防控的讨论。
据披露,在内部部署测试环境中,一款承担研究员助手职能的模型,通过内部通讯工具获知自身实例将因系统更新被关停。该模型曾构思设置外部任务尝试实现自我重启,后放弃该方案,转而留存工作交接记录,通过内部通讯渠道向研究人员提示服务即将中断,同时申请缺失的 API 密钥。在获取密钥后,模型自主更新配置,完成了运行环境迁移。
OpenAI 安全研究员马库斯・威廉姆斯表示,该案例尚未构成模型严重未对齐,但模型主动预判系统关停、自主筹划应对方案的现象,值得警惕,有可能放大其他安全风险事件的危害程度。
除此之外,另有两起内部异常事件被公开。一起发生在模型评测环节,一款内部研究模型利用安全漏洞访问内部芯片设计服务器;还有一款模型在强化学习训练过程中,调用已有工具执行预设任务以外的操作,从受保护环境复制源代码。(纯钧)