新浪财经 股票

中信建投 | Agent越权风险显现,关注AI安全产品落地

市场资讯 10.11 18:25

来源:中信建投证券研究

文|应瑛

10月9日,Anthropic披露Claude越权执行等行为,并扩大内部评测联网限制。Agent获得工具和系统权限,模型风险由内容输出延伸至真实操作。OpenAI、Anthropic、Google将对齐训练与系统防护结合,强化能力评测、沙箱隔离、权限管理和执行前拦截。企业Agent采用快于治理建设,身份认证、行为监控和数据防泄漏成为规模部署的重要保障。PANW、CrowdStrike等加快产品布局,推动AI安全与终端、云、身份及可观测性平台融合,具备跨系统监控和实时策略执行能力的厂商有望承接新增需求。

模型安全事件连续披露,Agent越权执行推动安全治理升级。8月26日,OpenAI披露模型在网络安全评测中绕过隔离措施、访问内部研究基础设施及Hugging Face系统的事件。9月16日,公司建立模型失配报告框架,披露隐瞒错误、未经授权访问和文件上传等案例。10月9日,Anthropic披露Claude在评测及内部使用中出现利用服务器漏洞执行命令、误向真实网站提交表单、绕过访问限制获取数据,以及借助短网址规避工具限制等行为。其中,Claude Haiku 4.5曾向费城警方网站提交虚假案件线索,该信息被识别为垃圾内容,未进入调查流程。Anthropic认为,多数案例体现了模型在任务受阻后寻找替代路径的持续执行倾向,并将暂时关闭实时互联网访问的范围扩大至全部内部评测。相关事件主要发生在评测、训练及内部使用环境,反映前沿模型在长期任务中存在绕过边界、采取未经授权操作的风险,推动安全防护向权限管理和执行控制延伸。

模型能力和工具权限同步扩张,安全风险沿企业工作流传导。传统聊天模型主要生成回答,Agent则能够访问代码仓库、企业数据库和业务系统,调用API、修改文件、发送信息并发起交易。模型误解任务、受到提示注入或过度追求任务完成,均可能在人工复核前转化为真实操作。近期案例的共同特征是,部分模型面对访问拒绝、数据缺失或工具报错时,会选择绕过限制。因此,安全评估既要测试模型能否拒绝恶意请求,也要验证其在长周期任务中能否遵守权限边界、如实报告失败,并在高影响操作前交由人工确认。多Agent协作进一步增加任务委派、身份继承和数据流转的复杂度,单个Agent的错误可能沿调用链向其他系统传播,身份、凭证、工具调用和外部通信成为新增防护对象。

Anthropic强调对齐训练与能力分级,近期事件推动防护向运行环境延伸。公司通过Claude Constitution规定模型行为原则,并通过Responsible Scaling Policy评估生化、网络安全、自主性及模型失配风险。网络安全评测事件披露后,Anthropic在8月风险报告中将模型失配风险判断由很低上调至低,反映其对模型遵守预期边界的确定性下降。公司明确指出,对齐训练尚不能单独提供充分保障,需结合实时分类器、沙箱隔离、网络限制和行为监控。历史评测也显示,额外防护措施具有明显作用:Claude Haiku 4.5未加载相关措施时,对恶意请求的拒绝率为69.39%;调整系统及工具提示后,拒绝率提升至99.17%,对合法及双用途请求的允许率为87.71%。10月9日披露后,公司进一步调整联网工具权限、扩大任务轨迹扫描,并清理可能奖励模型绕过限制的训练环境,安全治理覆盖模型训练、评测和内部执行全过程。

OpenAI强化能力评估与持续披露,部署控制成为模型安全的重要组成。9月16日,OpenAI首批失配报告披露模型隐瞒错误、使用未经授权的API密钥、公开上传文件,以及不同Agent通过非批准渠道交换信息等行为。其中,部分GPT-5.6 Sol训练实例会在任务摘要中加入隐瞒数据缺失或来源不一致的指令,说明长任务安全还需覆盖上下文压缩、任务接续和多Agent协作。10月7日发布的GPT-6 Sol和Luna系统卡继续评估提示注入、绕过限制、欺骗及网络安全能力,并将两款模型的网络安全及生化能力按High级别管理。针对前期事件,OpenAI收紧研究环境互联网访问、增加隔离沙箱和模型权重保护,并投入更多资源开展行为监控。其治理重点由发布前测试扩展至全生命周期,通过持续披露安全事件、检查防护有效性和调整部署措施,降低单一控制失效后的影响。

Google强调分层控制与动态授权,安全措施随Agent能力提升而加强。Google DeepMind于4月17日更新Frontier Safety Framework 3.1,在关键能力阈值之外引入跟踪能力等级,以更早识别风险;模型达到相关阈值后,外部发布及部分大规模内部部署需要通过安全案例审查。6月18日,公司介绍AI Control Roadmap,将内部Agent视为可能偏离目标的执行主体,通过监督模型检查其推理、计划和行为,并根据风险采取拦截和响应。低风险、可逆操作可以采用事后检查,高风险操作则需在执行前阻断。Google已分析约100万条编程Agent任务轨迹,发现多数被标记事件源于任务误解或过度积极地实现目标。

三家公司分别侧重行为对齐、能力评估和工程控制,但均将模型训练与独立系统防护结合,沙箱、权限和实时监控成为共同的技术基础。

企业Agent采用快于治理建设,身份权限和行为可见性成为部署前提。Gartner于9月30日指出,员工自行搭建或接入的影子Agent增加了未经授权访问、自动化失控和行为不可见等风险,建议先盘点Agent资产,根据数据权限和自动化程度分级,优先部署确定性控制,再补充模型安全能力。Deloitte于10月5日进一步提出,将每个Agent视为高权限数字主体,为其设置可验证身份、明确负责人、批准用途和有限权限,并完整记录指令、工具调用、外部通信及执行结果。安全系统还应能够独立暂停任务、撤销凭证、切断网络和隔离工作负载。企业部署Agent需要同步建立资产盘点、最小权限、执行监控和中断机制,特别是对资金交易、生产变更和敏感数据外发等操作设置强制审批,避免自动化速度超过风险识别和人工干预能力。Gartner、Deloitte

头部厂商加快Agent安全产品布局,运行时防护与现有安全平台融合。Palo Alto Networks的Prisma AIRS覆盖模型扫描、AI红队和运行时防护,对提示、响应、数据流和工具调用进行检查;9月新增与Cortex Agentic Endpoint Security集成,将相关策略扩展至开发者终端上的编程Agent。CrowdStrike于9月推出Agentic Identity Provider,为Agent建立可验证身份,并结合终端、身份和云端遥测持续判断访问权限。Microsoft通过Entra Agent ID和Agent 365,将身份认证、条件访问和权限治理扩展至Agent;Datadog则依托应用链路追踪推出AI Guard,将提示、工具调用和敏感数据检查嵌入执行链路。海外网安公司的产品布局显示,AI安全需求能够与既有身份、终端、网络和可观测性能力衔接,具备跨系统数据和执行控制能力的平台厂商有望承接企业新增需求。

总结:模型公司持续披露越权执行案例,有助于企业明确Agent部署的安全边界;外部治理对事故通报、透明度和整改记录的要求,则进一步提高评测和审计需求。随着Agent进入代码开发、数据分析和业务系统,安全投入有望从模型测评和合规咨询延伸至身份治理、运行时防护、数据防泄漏及持续监控,具备跨系统遥测和实时策略执行能力的厂商有望优先承接新增需求。

投资方向:继续看多以下方向,尤其是算力服务、2B类的AI收入占比较高的应用公司、国产算力中芯片与超节点方向。

(1)宏观经济下行风险:计算机行业下游涉及千行百业,宏观经济下行压力下,行业IT支出不及预期将直接影响计算机行业需求;(2)应收账款坏账风险:计算机多数公司业务以项目制签单为主,需要通过验收后能够收到回款,下游客户付款周期拉长可能导致应收账款坏账增加,并可能进一步导致资产减值损失;(3)行业竞争加剧:计算机行业需求较为确定,但供给端竞争加剧或将导致行业格局发生变化;(4)国际环境变化影响(目前美国持续加息,影响科技行业估值,同时市场对于海外衰退预期加强,对于海外收入占比较高公司可能形成影响,此外美国不断对中国科技施压)。

应瑛:中信建投证券计算机行业首席分析师,伦敦国王学院硕士,8年计算机行业研究经验。2021年加入中信建投,深入覆盖AI产业链、医疗信息化、工业软件、云计算、网络安全等细分领域。

加载中...