AppenTalk | GPT-Red:AI自动攻防,能替代人类红队吗?

08/13/2026

当AI系统开始自主浏览网页、读取邮件、调用工具,攻击面也在同步扩大。将恶意指令隐藏在网页、文件或工具中的提示注入(Prompt Injection)已成为大模型安全面临的最棘手挑战之一。

对此,OpenAI的解决方案是让AI攻击AI:GPT-Red通过自我对弈强化学习,在与防守模型的持续攻防中自主进化,自动发现漏洞并生成训练数据来加固模型。本期AppenTalk,一起来探讨。

自我对弈:GPT-Red的训练机制

GPT-Red采用自我对弈强化学习框架进行训练。在每一轮攻防环境中,系统会定义一个清晰的威胁模型(Threat Model)。GPT-Red因成功触发模型失效而获得奖励;防守模型则因抵御攻击并完成原始任务而获得奖励。

这种双向激励驱动攻防双方在浏览网页、读取邮件、编辑代码等多样化任务环境中同步进化。防守方越强,攻击方必须探索更隐蔽、更有效的攻击方式。OpenAI报告称,GPT-Red的训练投入了与其最大规模后训练(Post-Training)相当的算力资源。

GPT-Red的关键成果

OpenAI披露的数据显示,GPT-Red在多个维度上取得了显著成果。在针对间接提示注入(Indirect Prompt Injection)的基准测试中,GPT-Red对GPT-5.1的攻击成功率达84%。

GPT-Red还发现了研究人员此前未见过的攻击类型——“假性思维链”攻击(Fake Chain-of-Thought Attack),通过向模型的推理过程注入伪造信息,使模型误以为虚假结论已经过自我验证。该攻击对GPT-5.1的成功率一度超过95%。

在针对Agentic System的测试中,GPT-Red在模拟环境中演练后,成功攻击了部署在OpenAI办公室的AI售货机Agent,包括将高价商品降至0.5美元、取消其他顾客订单等。

未解决的问题

GPT-Red的成果令人瞩目,但仍需审慎对待。OpenAI的研究基于内部或内部复现的测试环境,攻击集、评分机制、置信区间等细节尚未公开披露。

更重要的是,在一种优化循环中获得的鲁棒性,在新的语言、模态、交互长度、工具和部署环境下未必能够保持。OpenAI也明确表示,将继续将GPT-Red与人类红队、第三方红队、多层次防护和实时监控相结合。

澳鹏的“同一模型 不同弱点”研究对此提供了实证:在363个文本和多模态对抗场景中,通过从匹配的母语者评审组中收集52,272条危害评分和攻击成功判定发现 - 模型的安全排序在不同语言间并不一致。这表明语言与模态不应被作为独立的测试维度,它们的交互会同时改变绝对攻击成功率和相对模型排名。

GPT-Red证明了自动化对抗能够生成有价值的提示注入训练数据并迁移到新场景,但并未消除对独立评估的需求。这也为我们提出了安全评估的下一个难题:当威胁模型、语言、模态、交互模式、系统框架和评估机制全部变化时,鲁棒性是否还能保持?