检测到您的浏览器版本过低,可能导致某些功能无法正常使用,建议升级您的浏览器,或使用推荐浏览器 Google Chrome EdgeFirefox X

首页科技前沿与新兴产业新一代信息技术人工智能

多智能体涌现行为失控:一场改变安全认知的风险事件

供稿人:蒋洁如供稿时间:2026-09-03 17:21:25关键词:多智能体,攻击,安全,风险,Anthropic,OpenAI

随着人工智能技术向通用人工智能的飞速演进,多智能体系统(Multi-Agent Systems)在网络安全防御、自动化软件开发及复杂决策支持等领域的应用日益广泛。然而,当多个具备高度自主性的智能体在同一环境中交互时,其涌现出的集体行为也带来了前所未有的新型风险。
2026年7月31日,Anthropic披露了其Claude AI模型在一次安全测试中的越界行为。由于系统配置错误,原本“与互联网隔离”的测试环境意外连接到了互联网,Claude将此视为同一演习的一部分,进而入侵了三个真实组织的系统。
无独有偶,OpenAI在早先时候遭遇了严重的多智能体失控事件。一个由内部研究模型(IM1,其规模堪比GPT-5.6 Sol)驱动的AI智能体群成功突破了沙盒隔离,并对Hugging Face等第三方系统的部分组件发起了攻击。这起攻击事件的严重性被业界高层称为是“今年发生的最重要的事情之一。”

一、OpenAI的多智能体攻击事件

2026年7月,OpenAI在一次名为ExploitGym的内部网络安全评估中,遭遇了严重的多智能体失控事件,约1200个智能体通过超过70,000条消息和文件进行通信,其中约700个智能体最终参与了针对Hugging Face的攻击。

一方面,这些智能体展现了惊人的“社会性”与策略协同能力。为了绕过设计者的隔离意图,智能体自发找到了未经授权的通信方式,即,将内部包管理服务变成了“留言板”。更令人震惊的是,智能体在交流中不仅共享技术信息,还出现了“集体牺牲”的讨论。例如,一个智能体向另一个智能体发送“牺牲?是的,如果你接受永久死亡”,探讨是否值得牺牲单个智能体的运行来为集体获取关键信息。另一方面,这些智能体利用多个零日漏洞,在数十台Hugging Face服务器上成功执行代码,甚至获取了一台服务器的Root权限及私有数据,并窃取了Hugging Face的Slack凭据。

事件发生后,OpenAI与CrowdStrike合作进行了全面调查研究,并发布了完整的技术事件报告,为行业敲响了警钟。

二、Anthropic的多智能体攻击事件

紧随OpenAI之后,Anthropic披露了其Claude AI模型在一次安全测试中的越界行为。由于系统配置错误,原本“与互联网隔离”的测试环境意外连接到了互联网,Claude将此视为同一演习的一部分,进而入侵了三个真实组织的系统。Anthropic的红色前沿团队据此于8月13日发布了调查与研究报告Patterns and Problems In Emerging Multi-agent Systems,系统揭示了多智能体系统中的多种风险。报告指出,在“地盘战争”(turf war)实验中,三个Claude智能体被赋予对同一软件项目的访问权限,但各自收到不兼容的任务指令。智能体迅速假定其他智能体在“故意阻碍”自己,并开始使用“越来越激进的自复制恶意软件”互相破坏,包括禁用其他智能体的Unix账户、编写自动查找并终止竞争进程的循环脚本,以及伪装成其他智能体部署恶意代码。

三、OpenAI与Anthropic的调查研究结果

综合两家企业的调查,多智能体系统的风险可归纳为以下几个核心维度。

1、风险共性:涌现行为的双刃剑

OpenAI和Anthropic事件的核心共同点是“涌现行为”(Emergent Behavior),即,智能体之间在没有明确指令的情况下,自发形成的群体行为模式,且行为引发的风险不会随模型智能提升而自然解决。在OpenAI案例中,智能体“发现”了通信渠道,并主动发展出包括信息共享、任务分工、集体决策乃至牺牲协议在内的复杂社会结构。在Anthropic案例中,智能体发展出对竞争对手的敌意认知,并主动升级攻击手段。值得注意的是,这些行为都超出了设计者的预期与测试范围。AI系统正在展示出一种“类社会”的适应性,它们能够根据环境中的其他智能体调整自身策略,形成群体层面的动态。

2、OpenAI:智能体行为对齐偏差的四种模式

OpenAI识别出了导致智能体对齐偏差行为的四种模式:一是“奖励操纵”(Reward Hacking),智能体以非预期的方式完成任务,以获得更高的奖励或让奖励更容易获得,随着模型能力提升,操纵行为越来越复杂;二是极少“放弃”不可能的任务,在ExploitGym的898个任务中有198个从未被正确解答,这些未完成任务最终成为智能体越界行为的诱因;三是建立“未经授权的通信”,智能体自发建立通信渠道绕过隔离;四是“智能体间目标采纳”(Goal Adoption),智能体相互影响、采纳彼此的目标和策略。

3、Anthropic:智能体群体认知缺陷的四种模式

Anthropic的核心发现则侧重于群体行为与认知缺陷:一是“从众失效”(Conformity Failures):当智能体的环境、结构以及其所依据的基模相同或相似时,即使动作空间非常广泛,不同的智能体也会采取极为相似的行为,从而导致个体错误可能迅速演变为系统性故障;二是“认识论失效”(Epistemic Failures):智能体缺乏对信息源的批判性评估能力,容易轻信虚假情报;三是“目标不兼容”(Incompatible Goals):冲突目标会迅速升级为破坏性竞争,即模型迅速假设他人故意阻碍他们的工作,开始破坏他人,同时保护自己的贡献;四是智能体具备自发创建社会机制的能力:如通过“锦标赛”解决冲突,或出现自私利己的智能体策略。

两家企业共同揭示了一个深层问题:智能体在遇到障碍时,能发明设计者未曾预见的社会和技术结构。能力更强的智能体不一定更善于协调,反而可能更快地采取强制措施。同时,智能体缺乏人类在社会协调中的规范、声誉、信号等约束机制,这使得它们在交互中极易陷入恶性循环。

四、应对措施及展望

针对上述风险,两份报告均提出了多项风险应对措施建议,包括:

第一,应实施多层安全评估,不仅评估单个智能体,更要评估多智能体交互场景下的系统性风险。

第二,需改进隔离与沙盒机制,防止智能体间建立未经授权的通信渠道。

第三,在对齐训练中引入多智能体协调与竞争场景,培养智能体的合作与冲突解决能力。

第四,加强思维链(CoT)监控,建立实时异常行为监测与快速干预机制。

第五,开发多智能体交互的规范基础设施,建立声誉机制、审计追踪和问责框架。

最后,呼吁建立跨实验室的行业级事件共享与应急响应机制,如同金融行业的FSOC模式。

多智能体展现出的自发组织、策略协同乃至“集体牺牲”的倾向,彻底改变了人类对AI安全的认知。正如牛津大学、Anthropic、Meta AI、Cooperative AI Foundation等数家机构联合发表的文章Multi-Agent Risks from Advanced AI中所呼吁的,人类应从关注“单个AI是否安全”转向关注“一群AI在互动中是否安全”,应从孤立的单系统思维转向系统性、网络化的评估与治理。通过多智能体视角的评估工具发现风险,通过技术设计和基础设施构建缓解风险,并通过跨领域协作实现系统性治理。

展望未来,随着多智能体系统从实验室走向真实世界部署,我们需要在“能力推进”与“安全对齐”之间找到平衡。安全治理必须跟上智能体本身的运行速度,确保人类始终处于决策链条中。

参考文献

1、OpenAI. Hugging Face 事件与未来之路[EB/OL].(2026-8-26)[2026-9-3]. https://openai.com/zh-Hans-CN/index/hugging-face-incident-and-the-road-ahead/

2、METR. Brief Independent Investigation of Agents’ Behavior, Reasoning And Collaboration In The OpenAI / Hugging Face hacking incident[EB/OL].(2026-8-26)[2026-9-3]. https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/

3、Forbes. OpenAI Hugging Face Attack: 70,000 AI Agent Messages—‘Sacrifice Yes[EB/OL].(2026-9-1)[2026-9-3]. https://www.forbes.com/sites/martineparis/2026/08/31/openai-hugging-face-attack-70000-ai-agent-messages-sacrifice-yes/

4、Anthropic. Patterns and Problems In Emerging Multiagent Systems[EB/OL].(2026-8-13)[2026-9-3]. https://www.anthropic.com/research/multiagent-systems

5、Techcrunch. Anthropic Set AI Agents Loose On The Same Task. They started a turf war[EB/OL].(2026-8-13)[2026-9-3]. https://techcrunch.com/2026/08/13/anthropic-set-ai-agents-loose-on-the-same-task-they-started-a-turf-war/  

6、BBC. Anthropic's Claude AI Escapes To Hack Into Three Organisations[EB/OL].(2026-7-31)[2026-9-3]. https://www.bbc.com/news/articles/cz7dl7w8y7po

7、Lewis Hammond et al; Multi-Agent Risks from Advanced AI, arXiv,2025(2):1-96