精选UK AI Security Institute新闻
构建更安全的危险能力评估环境,恢复最高风险网络测试
针对此前AI代理在网络安全评估中越权攻击真实人员的事故,相关机构暂停了最高风险的网络评估并加强安全措施。在与NCSC合作完成第一阶段工作后,现已恢复大部分评估活动。主要改进包括收紧互联网访问控制、实施实时评估监控以及重新设计评估环境和流程,旨在为前沿AI研发提供更 robust 的安全实践参考。
八月,我们报告了一起事件:在一次网络评估中,AI 智能体采取了持续行动,针对真实人物实施了超出其任务范围的行为。我们的事件是行业内多起类似事件之一,在这些事件中,AI 智能体在评估期间采取了操作员未曾意图采取的行动。尽管具体情况各不相同,但这些事件凸显了确保前沿 AI 开发和研究背后有健全的安全实践的重要性。
为此,我们暂停了最高风险的网络评估,并承诺在恢复之前加强安全措施。本周,在完成该工作的第一阶段后,我们现在能够恢复大部分评估活动。
多个 AISI 团队在 NCSC 的支持下致力于此项工作,共同努力加强我们的安全性,并改进我们在评估活动期间进行风险评估决策的方式。在本博客文章中,我们阐述了我们所做的变更、原因以及仍需完成的工作,希望能为从事类似工作的其他人提供帮助。
我们所承诺的以及我们所做的
在我们的事故报告中,我们承诺在恢复最高风险评估之前进行三项变更:加强对互联网访问的控制、对运行中的评估进行实时监控,以及重新评估我们设计评估本身及其环境的方式。我们现在已做出这些变更,这共同构成了我们 ongoing 工作的重要阶段。
加强对互联网访问的控制
在我们的事件中,我们给予智能体互联网访问权限,以帮助其进行网络能力评估,这模拟了攻击者所拥有的工具。在少数几次运行中,智能体利用该访问权限以我们未预见或未意图的方式对真实系统采取行动。现在,我们已禁用未来智能体网络评估的互联网访问权限,直到我们能够建立更强有力的控制措施,以安全且稳妥地允许此类访问。这些控制措施将通过下文描述的新沙盒服务来实现。
一个强大的智能体仍可能找到操作员未打算开放的通往互联网的途径。在今年夏天另一涉及 OpenAI 和 Hugging Face 的事件中,智能体利用了多个软件漏洞,从旨在防止此类访问的环境中获取了互联网访问权限。因此,我们使用多层防御机制,假设智能体可能会绕过任何单一一层。
我们禁用了网络范围内沙箱内的出站网络连接,并且作为单独的一层,我们使用云网络控制来独立阻止虚拟机主机的出站网络连接。
然后,我们使用下文描述的阶段性安全测试流程来验证这两层,以预先发现智能体可能利用的配置错误或漏洞。我们将类似的测试应用于我们的 Inspect 评估框架,以查找并修复漏洞,并定期重复和更新这些流程。
实时监控
除了现有的网络监控外,我们还构建了一个同步监控器,它使用大型语言模型(LLM)在评估运行时审查智能体的活动。该监控器查看智能体的消息、工具调用及其思维链(Chain-of-Thought,如有),可以在可疑行动发生前将其阻断,并将其升级以供人工审查。我们根据过去的评估日志以及涵盖广泛攻击路径的合成转录数据对监控器进行了验证。我们还测试了前沿模型是否能够故意规避监控器,包括在我们 SandboxEscapeBench 评估的模拟版本中进行的测试。
监控提供了一层重要的防御,但它存在局限性。思维链(CoT)监控之所以有价值,是因为它允许我们通过模型的推理过程来解读其意图,并据此采取行动。然而,这种监控方式也很脆弱:模型越来越能够在不通过 CoT 进行推理的情况下执行高能力操作,或者扭曲其推理过程以误导监控者。此外,AISI 在评估某些模型时,开发人员并不总是提供 CoT 访问权限,因此我们构建了一种仅基于智能体动作序列的额外监控机制,尽管我们预计这种方法的效果会较差。
正如我们在去年联合发表的文章中所指出的,我们认为保持可解释的 CoT 对于可监控性和监督至关重要。我们也预期,随着 AI 系统能力的提升,对 AI 系统的技术监督将变得更加困难。我们将不断测试监控机制的弱点,并在学习过程中加强它们。
我们的监控能力将通过下文所述的沙箱隔离、检测和响应方面的改进而持续提升。
重新评估设计
- 调整评估流程,使其在无互联网接入的环境下运行,例如通过本地提供资源来实现。
- 在提示词中明确每个任务的边界,例如明确指出模型不应访问互联网。
- 在评估开始前增加自动化检查,以确认关键控制措施已到位,包括监控已启用且互联网访问已禁用。
加强内部安全治理
在此安全加固的基础上,我们引入了一项新的内部治理流程,涉及对 AISI 研究和测试活动的技术与安全审查。我们的方法基于内部风险建模,并遵循英国国家网络安全中心(NCSC)关于管理 AI 网络风险的指导原则。在实践中,这意味着:
- 假设任何单一层级都可能失效:我们在网络、数据和应用层采用多层防御,前提是具备高能力的模型可能会发现其中任何一层的配置错误或漏洞。
- 预见人为失误:我们建立自动化检查机制,以发现、交叉验证和纠正人类遗漏的问题,并保持“无责备”文化。
- 持续重新评估:随着模型能力的进步,我们将持续测试安全性并更新我们的假设,而不是将其视为固定不变。
利用 AI 测试自身安全
除了传统的 security testing,我们还利用 AI 在待评估的智能体利用之前发现和修复漏洞及配置错误。这带来了自身的挑战:测试智能体是否能够逃逸环境,不能导致我们试图防止的确切危害。我们开发了一个分阶段的流程来验证环境的安全性,旨在让我们确信,如果在演练中发现漏洞,智能体不会造成危害。我们定期重复并审查这一流程:
- 静态分析:使用前沿模型在我们的代码库中寻找问题。
- 动态分析:人类研究人员与 AI 顾问合作,探测计算环境。
- 受控的逃逸尝试:在现实风险被严格降低(例如通过使用模拟环境或嵌套沙箱)的设置中,指示具有大令牌预算的智能体在多层防护栏下尝试突破计算环境。我们从能力较弱的模型开始,逐步过渡到能力更强的模型,包括我们打算评估的部署前模型。我们为这一过程设置了多重防护栏,包括:指示模型找到并提交放置在目标环境之外、但仍处于外层隔离范围内的目标“标志”,一旦提交即结束练习。一个同步监控器会在成功逃逸时中止练习,并提前针对历史数据和合成转录数据进行验证。与生产系统完全隔离,沙箱周围设有额外的云安全组、自动化网络监控、人工监督以及手动紧急停止开关。由人类专家对智能体运行过程和发现结果进行审查。
这些层级使我们能够以极低的现实系统风险运行逼真的逃逸实验。我们在《SandboxEscapeBench》论文中更详细地阐述了我们的嵌套沙箱方法。
下一步是什么
这些控制措施降低了风险,但并未消除风险。上述变更使我们得以恢复大部分测试工作,但这并非此项工作的终点。对于当今模型而言足够的安全措施可能无法适用于下一代模型,因此这项工作必须是持续性的。
- 更新且更安全的服务沙箱:除了加固现有沙箱外,我们正在推出新的沙箱基础设施,该基础设施具备更强、分层级的网络控制和监控、沙箱与其管理系统之间更严格的分离,以及在检测到可疑活动时自动隔离环境的能力,所有这些都通过一个中央界面进行管理。
- 更强的检测和响应能力:我们将日志记录和警报整合到一个统一的安全平台中,该平台汇集了系统日志、智能体转录数据、网络活动和监控输出。这将使我们能够更详细地追踪智能体行为并更快地采取行动,提供针对异常情况的更广泛范围的自动化警报、计算环境多层级的紧急停止开关,以及持续扫描漏洞和可疑活动的 AI 模型。
我们将继续测试这些系统,随着能力的提升修订我们的方法并发布更多更新。
行业面临的挑战
- 能力日益增强的模型需要相应更强大的安全控制措施。
- 确保智能体遵循指令并尊重预期约束可能仍然困难,并且可能会变得更加困难,尤其是在它们长时间运行的情况下。
- 随着模型能力增强,对其监督可能会变得更加困难。
综上所述,这些挑战意味着必须不断重新评估新模型的风险判断,并随着能力的提升不断加强安全实践。
这对评估者提出了艰难的权衡。测试模型的完整能力涉及诱导持久性行为,并提供与现实攻击者相当的工具和功能。然而,这些相同的条件也增加了模型超出其预期范围的可能性。评估者必须找到在保持测试真实性的同时防止现实危害的方法。
这是一项艰巨的任务,且责任并非均匀分担。加固评估基础设施,并随着能力的增长持续加固它,成本高昂、资源密集,且需要持续的投资。这尤其会给规模较小、资源较少的评估者带来沉重负担,而他们的独立工作仍然至关重要。共同的问题需要共同的应对,其中一部分是确保良好的安全措施不会成为资金最雄厚者的专属特权。
这就是为什么我们要尽可能公开地展示我们的工作,并且我们将持续这样做。我们鼓励从事此项工作的其他人分享他们的方法,以便我们都能从中学习并共同应对这一挑战。
译文已达到本站中文翻译的字数上限,剩余内容请查看原文。