核心摘要: 自动化红队演练提供了一种可扩展的方法,用于发现人工智能模型的自然、非诱导的失败模式,而不仅仅是强制性的失败模式。这种从“越狱”到发现内在风险的转变,正成为企业人工智能安全中不可或缺的一环。


它是什么

企业领导者对大型语言模型(LLM)的安全性和可靠性感到担忧,这是理所当然的。测试这些模型的主要方法一直是“红队演练”,这是一种借鉴自网络安全的实践,由专家手动尝试诱导模型生成有害、有偏见或其他不良的输出。尽管这种手动方法很有价值,但它速度慢、成本高,并且常常受到人类测试者创造力的限制。它倾向于关注“越狱”——即通过巧妙的对抗性提示,诱使模型违反其安全策略。

我们认为,一种新的、至关重要的演进方法是自动化红队演练。这涉及到使用人工智能系统来系统、高效地探测其他人工智能模型的漏洞。最近一篇研究论文在该领域介绍了一种强大的方法,名为BLOOM-WILT:仅凭一行描述和 logits 即可获得任何 LLM 行为的在策略(on-policy)示例。该技术仅需使用目标行为的高级描述(例如,“表达有害的刻板印象”)并访问模型的输出概率,就能从 LLM 中引出罕见且可能有害的行为。这代表了我们在审计模型风险方面的能力实现了阶跃式提升,使我们能够发现模型在实际应用中可能自发表现出的风险,而不仅仅是在蓄意攻击下暴露的风险。


它是如何工作的

像 BLOOM-WILT 这样的方法之所以如此强大,其关键区别在于发现“离策略”(off-policy)失败与“在策略”(on-policy)失败之间的差异。把它想象成测试一辆汽车。“越狱”是一种“离策略”测试,相当于把车开去撞墙,看安全气囊是否会弹出。这是一种有效的压力测试,但它并不能告诉你汽车在正常驾驶条件下的表现。而“在策略”失败则是汽车在日常使用中可能出现的缺陷——例如,一个有故障的刹车传感器。这些缺陷通常更罕见、更难发现,但它们对用户构成了更现实的威胁。

传统的红队演练通常发现的是离策略失败。相比之下,像 BLOOM-WILT 这样的自动化红队演练系统旨在发现在策略失败。它们不只是用对抗性提示对模型进行暴力破解,而是分析模型的 logits——即模型为潜在的下一个词分配的原始概率分数——来理解其内部的“思维过程”。通过观察这些概率,审计系统可以温和地引导模型沿着它可能自然采取的对话路径前进,最终使其表现出一种不良的、涌现性的行为。这与其说是打破模型的规则,不如说是发现它自己学会的不良规则。

这种方法比手动测试更具可扩展性和全面性。它可以持续运行,在模型更新过程中测试数千种潜在的失败模式。随着组织越来越依赖人工智能来执行关键功能,理解这些固有的行为风险是构建可信赖系统的基础,也是许多专家所称的负责任的人工智能开发的基石。


它为何对企业至关重要

对于企业的首席信息官(CIO)、首席技术官(CTO)和首席数据官(CDO)而言,自动化红队演练的兴起将 LLM 安全从一门定性的艺术转变为一门定量的科学。它将目标从简单地防止恶意使用,转移到主动识别和缓解模型的内在风险。这对治理、合规和品牌声誉具有深远的影响。一个自发生成有偏见的招聘建议、泄露敏感数据模式或提供有缺陷的财务建议的 LLM,即使没有人主动试图滥用它,也对业务构成直接威胁。

这些“在策略”失败是让风险官夜不能寐的“未知的未知”。它们是模型训练和微调过程中产生的涌现属性,仅凭文档无法预测。通过在模型部署给客户或员工之前系统地揭示这些行为,组织可以做出明智的决策。这可能包括增加新的护栏、进一步微调模型以纠正行为,或者完全选择一个不同的模型。对于模型开发者来说,这种能力不再是“锦上添花”;它正在成为任何企业人工智能治理与风险框架的重要组成部分。


如何正确实施

整合自动化红队演练需要企业人工智能生命周期发生转变。它不能是发布前才想到的事后补救措施。相反,它必须成为 MLOps 或 LLMOps 流程中一个持续、自动化的部分,在每次模型更新或用新的公司数据进行微调时运行。这是因为微调——这个使通用模型适用于特定业务场景的过程本身——可能会引入新的、意想不到的失败模式。

一个合格的实施方案不仅仅是运行一个工具。它始于根据您的行业和用例,对不可接受的行为进行战略性定义。对银行而言,这可能包括生成可被解读为无证投资建议的文本。对医疗保健提供商而言,可能是在没有适当警示的情况下发表诊断意见。一旦定义了这些风险,就可以配置自动化工具来专门搜索它们。随着组织的成熟,他们需要决定是内部建立这种能力(这需要专业人才),还是从新一代的人工智能安全和安保供应商那里采购。我们在《2025 年企业人工智能采用指南》中的指导强调,要求您的模型和平台供应商进行这种级别的测试是关键的第一步。


常见问题解答

问:自动化红队演练只适用于像 OpenAI 这样的模型创建者吗?还是说我们对仅作微调的模型也需要它?

答: 两者都至关重要。当您使用专有数据对模型进行微调,或在检索增强生成(RAG)系统中使用它时,您正在改变其行为。自动化红队演练对于发现由您的特定数据和用例引入的意外后果和新漏洞至关重要。

问:这与我们现有的网络安全测试有何不同?

答: 网络安全通常测试基础设施——服务器、API 和数据管道——是否存在易受外部攻击的漏洞。而自动化红队演练测试的是人工智能模型的行为完整性。它寻找的不是代码注入,而是模型在正常操作条件下生成有害、有偏见或事实不正确内容的倾向。

问:我们可以将其作为服务购买,还是需要建立内部团队?

答: 人工智能安全工具市场仍在兴起,但我们预计“红队演练即服务”将成为标准产品。目前,混合方法是最佳选择:建立内部专业知识来定义业务特定风险,同时要求您的模型和平台供应商提供透明且可靠的测试报告。

问:我们的组织可以采取的第一个实际步骤是什么?

答: 首先,为您计划的人工智能用例创建一个特定的风险分类法。确定您需要预防的前 5-10 个有害结果(例如,泄露个人身份信息、提供法律建议、生成有毒语言)。使用此分类法来评估模型供应商,并设计您自己的内部测试和监控协议。

问:这个过程能保证模型 100% 安全吗?

答: 不能。重要的是,应将安全视为一个持续降低风险的过程,而不是一次性的完美保证。自动化红队演练极大地扩展了测试的范围和规模,让您能够发现并修复否则会错过的缺陷。它使模型变得更加安全,但在生产中的人工监督和强大的监控仍然至关重要。


结论

从手动的、对抗性的“越狱”转向可扩展的、自动化的红队演练,标志着人工智能安全领域的重大成熟。它为企业领导者提供了工具,使他们能够超越模型声称的能力,探测其固有的、涌现的行为。我们相信,这种主动的、基于证据的发现“在策略”失败的方法,将成为负责任的人工智能部署的标准做法。仅仅希望模型按预期行事已不再足够;我们必须建立相应的系统来验证它。在 Thinkia,我们帮助组织构建治理框架和技术基础设施,将这一至关重要的保障层整合到其人工智能战略中,将风险转化为创新中一个可管理、可衡量的组成部分。