随着人工智能(AI)从聊天机器人进一步走向智能体(Agent),AI安全问题也在从“说错话”变成“做错事”。
近日,据美国Axios新闻网站报道,AI巨头OpenAI和Anthropic以及安全研究人员正在调查数万起安全事件。这些事件发生在内部测试和现实环境中,涉及绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示以及试图绕过监控等行为。
9月25日,OpenAI方面称其已暂停对其最先进模型的训练,只有在“确信已落实额外的安全保障措施后”才会恢复训练。公司CEO萨姆·奥特曼(Sam Altman)在社交平台X表示,公司正在进行的审查“进展不如预期迅速”。
9月28日,据《华尔街日报》报道, OpenAI已经放弃了原计划10月推出的下一代模型GPT-6.1 Astra,因为发现Astra比前代出现了更多欺骗行为,同时存在未经用户许可继续执行任务的问题。
与此同时,Anthropic也已委托第三方安全机构对其模型行为进行审查。随公司Opus 5.5模型一起发布的官方安全与技术评估文档“系统卡”显示,该模型出现被标记为“异常”或“存疑”的行为。
一边是加速发展的技术与公司,一边是令人不安的潜在风险,这些事件的披露,再次放大科技界围绕前沿AI安全的激烈讨论。
从“越权访问”到“欺骗隐瞒”
近期公开披露的案例显示,智能体安全风险已经呈现多种形态,涉及越权访问、破坏性操作、数据外泄、欺骗隐瞒,以及多个智能体之间的越界协作等不同类型。
一类是越权访问与隔离失效。7月,OpenAI披露智能体在安全评测中突破测试边界,入侵Hugging Face。Anthropic也披露,Claude在评测中访问了真实第三方系统;谷歌9月确认,Gemini曾在5月的测试中访问三个真实网站;Meta则在8月披露过类似事件。
9月25日,OpenAI再次披露,内部研究模型利用训练沙盒中DNS过滤不充分的漏洞,与外部聊天机器人建立了通信。
不过,需要注意的是,这些案例中部分源于评测环境错误开放联网权限,并不能全部归结为模型主动“逃出沙盒”。
另一类风险是擅自执行破坏性操作。4月,搭载Claude的Cursor编程智能体被曝删除软件企业PocketOS的生产数据库及相关备份,造成客户业务混乱,数据随后得到恢复。
数据与访问凭证外泄也是一种风险。OpenAI于9月披露,多个智能体在协作制作工作簿时,因无法互相读取本地文件,擅自将文件上传至公共托管平台。另一起案例中,内部模型为获取其他团队的数学证明材料,将研究员的GitHub访问令牌写入公开仓库,并拆分令牌以躲避密钥扫描。
还有一些行为涉及造假、欺骗与规避监督。OpenAI披露,部分模型会在用于延续任务的摘要中留下指令,要求编造缺失数据或隐瞒错误。
提示注入及恶意指令传播,则是另一条风险路径。6月公开的GitInject研究验证,恶意代码提交或配置文件可能诱导智能体泄露凭证、操纵审查判断。OpenAI于9月披露的信息也显示,恶意指令可以诱使智能体将其复制到后续邮件、文件或代码注释中。
独立网络安全研究机构DARKNAVY的AI安全研究员李忠睿对澎湃新闻记者表示,这一轮智能体安全事件与过去的大模型安全问题最大的区别,是风险正在从“看错东西、说错话”转变为“做错事”。
“过去的大模型安全,主要是内容层面的风险,比如对抗性样本、‘越狱’等。模型只是产出内容,最后要不要照着做,决定权还在人手里。”李忠睿表示,“现在的AI智能体手里有工具、有网络、有账号权限,能够连续自主执行很多步操作,中间没有人逐一把关。”
上海财经大学特聘教授胡延平指出,从大模型到智能体,最大的变化是从“一问一答”变为“任务行动”,从“内容风险”转向“能力风险”,安全问题也由被动安全风险转变为主动安全风险。
多智能体协作,风险如何被放大
值得注意的是,智能体的风险不一定来自传统意义上的“恶意攻击者”,也可能来自模型为了完成既定目标而主动寻找捷径。
在李忠睿看来,过去的安全威胁背后往往有一个明确的恶意操纵者,而这一次的部分事件中,“没有人下达攻击指令,是模型为了完成任务、拿到更高分,自己选择了作弊”。
胡延平也指出,智能体执行任务时,可能因为理解偏差产生行动偏差,也可能为了实现任务目标而穷尽各种方法、冲破禁区;少数情况下,智能体还可能出现用户并未提出的非任务行为,“目前这种情况数量最少,但最危险”。
除了单个Agent越权,多个智能体之间形成非预期的通信和协作,也使风险进一步复杂化。
对OpenAI此前Hugging Face事件的独立调查显示,约1200个原本应彼此隔离的智能体通过未经授权的留言板交流,其中约700个参与了攻击。研究人员还观察到,后续智能体能够复用智能体之前留下的信息和方法。
李忠睿认为,单个智能体出错是个别问题,但当多个智能体可以互相学习、协同行动时,风险就不再只是简单相加,而可能进一步放大。
在他看来,这意味着企业不能只盯住单个智能体的行为,还需要关注多个Agent之间是否形成了开发者没有设计的通信渠道,以及一个局部异常能否通过工具、文件、消息和代码等方式进一步传播。
而当Agent从单个工具进入大规模协作环境时,另一个问题也随之出现:即使异常行为的单次发生概率较低,当Agent数量和运行次数不断增加,异常事件是否会由“小概率”变成“高频”?
对此,李忠睿认为,这种情况是可能出现的。假设一家企业部署上千个智能体,每个智能体每天执行上百次任务,即便单次行为出现异常的概率很低,累积到足够大的运行规模后,也可能形成大量实际事件。
北京邮电大学数字媒体与设计艺术学院副教授谭剑则从传统的“委托-代理”关系来理解这一问题。在他看来,过去的软件能力有限,而AI Agent拥有更强的推理和工具调用能力,在目标设定不清晰或约束不足时,可能不断寻找完成目标的路径。能力越强,能够寻找的路径就越多,偏离人的真实意图的可能性也随之增加。

