精选TechCrunch AI新闻
Anthropic 与 OpenAI 拟引入独立安全评估员,独立性存疑
Anthropic 和 OpenAI 计划让独立安全评估员进驻自家 AI 实验室,研究人员对此举带来的前所未有的访问权限表示欢迎,但警告称,真正有意义的监督需要透明度、独立性,并最终依赖监管。
在上周末发表的一篇长文中,Anthropic CEO Dario Amodei 提出了一项即便在一年前也会被 AI 行业立刻拒绝的提议:在所有前沿 AI 公司内部嵌入第三方评估人员,赋予他们报告安全事件、评估 AI 模型是否真正对齐,以及向世界分享其未经修饰的调查结果的权力。
Amodei 表示,Anthropic 将承诺给予 METR 和 Redwood Research 等独立评估机构前所未有的权限,使其能够访问公司系统。CEO Sam Altman 表示,OpenAI 也将承诺采取这一做法,这标志着该行业与外部研究团体合作方式可能发生深刻变化。
接受 TechCrunch 采访的第三方评估人员普遍欢迎这一提议,但表示细节仍需敲定——最好还能有立法支持——这样他们才能知道自己究竟会作为真正独立的监督者运作,还是作为按 AI 公司条件行事的供应商。
随着模型越来越擅长识别自己何时正在被评估,这种更深层次的访问权限正变得更加重要,因为这提高了模型在测试期间表现良好、却隐藏问题行为的风险。研究人员表示,在测试成品模型时,这类行为的线索可能会被遗漏,但通过调查其在训练全过程中的表现则可能被发现。
“AI 公司应该能够回答一些关于其训练过程的非常基本的问题,比如:这个 AI 在经历训练时,是否曾主动试图破坏自身的安全对齐训练?”Apollo Research 研究主管 Alexander Meinke 告诉 TechCrunch。“这个问题的答案应该毫无疑问是否定的,而目前我们完全依赖 AI 公司自己仔细检查这一点,然后如实向公众报告。而从近期事件来看,按默认情况,他们两件事都不会做。作为嵌入式评估人员,我们实际上可以进行检查。”
从历史上看,AI 公司会在模型发布前不久引入外部审查人员来测试成品模型。如今,接受 TechCrunch 采访的评估人员提议,不仅要让他们访问最终模型,还要让他们访问模型整个训练周期中的中间版本,即“检查点”。Far.AI CEO Adam Gleave 表示,评估人员可以比较这些检查点,以确定令人担忧的行为是何时出现的,检查通过奖励模型某些行为来进行后训练的环境,并查看评估记录和日志,以核实公司关于模型表现的声明。
Anthropic 和 OpenAI 是否以及何时计划提供这种访问权限,目前尚不清楚。尽管 TechCrunch 多次提问,两家公司都没有说明将与哪些评估人员合作、他们何时会被嵌入、会引入多少人、他们究竟能访问哪些系统和信息,或者哪些内容可以向公众披露。
像这样深入查看内部运作之所以重要,是因为如果模型专门学会了如何通过某项安全测试,那么它在这项测试中表现良好并不一定意味着它安全。Steidley 举了一个“拒绝关机基准”的例子,该基准衡量 AI 在某些情况下是否会抵制被关闭。
“如果这个 AI 是专门被训练来在该基准上取得好成绩的,那就极其相关。”Steidley 说,并将其比作大众汽车的“柴油门”丑闻,当时汽车被编程为识别排放测试,并在测试条件下表现出不同行为。
Gleave 指出,有意义的访问权限可能不仅限于模型本身,评估人员还可能获准采访员工,以核查公司的文件及其对安全实践的公开描述是否与内部实际情况相符。
Amodei 确实勾勒出了一份相当全面的提案,可能赋予评估者他们认为必要的那种访问权限,包括“发布关于风险等级、事件、做法以及他们获得或未获得的访问权限的关键发现——不受 Anthropic 编辑控制”的权利。
但评估者表示,这样的体系只有在 AI 公司真正愿意交出对流程的控制权时才能奏效。以往的独立评估尝试表明,这种交出控制权将来之不易,因为第三方常常在访问权限、时间、保密性以及他们可以公开说什么等问题上遭遇紧张关系。
Gleave 表示,Far.AI 不得不拒绝与几家前沿开发商的合同,因为这些开发商希望对评估流程拥有过多控制权,威胁到了公司的独立性。他说,默认情况下,评估者被当作普通承包商对待:受限制性保密协议和协议的约束,这些协议赋予开发商对最终可以发布内容的重大控制权。
时间限制
还有一个问题是,审查者是否能获得足够的时间和访问权限来完成他们被要求做的工作。在调查 Hugging Face 事件时,OpenAI 给了 METR 和 Redwood 大约一周的现场调查时间,两家机构后来都表示,由于范围和时间的限制等原因,他们无法得出有把握的结论。
在 GPT-6 Astra 的发布前测试中也出现了类似问题,OpenAI 将其宣传为迄今为止对齐程度最高的模型。根据 Apollo Research 对模型卡的贡献,该公司只有三天时间来测试 Astra,这使得得出确切结论变得困难。
“Apollo 认为,鉴于评估意识率较高且评估窗口有限,此处较低的不当行为率并不能为模型的对齐或不对齐提供实质性证据,”该公司在其评估中写道。
这样的过往记录给评估者留下了一个基本问题:为什么这次会不一样?
“Dario 和 Sam 确实有可能只是改变了想法,他们会对此非常开放,”Gleave 说。“但这些公司的知识产权对他们来说极其宝贵,我认为他们默认会对可以分享的内容非常谨慎。”
几位接受 TechCrunch 采访的研究人员呼吁建立一个他们都公开同意的透明框架。Palisades Research 战略主管 John Steidley 表示,该框架的一部分应该包括公司可以依赖何种审计师的标准,以免他们试图通过寻找不合格或不感兴趣评估最令人担忧风险的评估者来回避问题。
Safer AI 执行董事 Henry Papadatos 表示,即使有了公开框架,问题在于自愿措施总是取决于公司的善意。
“理想情况下,我们会有良好的法规来强制要求这一点……因为这样公司就不能在明天遇到重大公关危机时改变主意,”Papadatos 告诉 TechCrunch,并指出这也是推动所有公司遵守规则的好方法,而不仅仅是最愿意遵守的公司。
并非所有人都已加入。到目前为止,Meta、SpaceXAI 和 Google DeepMind 尚未承诺嵌入第三方评估者,尽管 DeepMind CEO Demis Hassabis 提议建立一个单独的行业标准机构来独立测试前沿模型。Google、OpenAI 和 Anthropic 也已私下讨论 AI 安全计划数周。
一些法律已经在围绕第三方评估者的理念形成。加州去年签署成为法律的 SB 53 要求大型前沿 AI 开发商发布安全框架并报告关键安全事件。本月签署的新法律 SB 813 为州认可的“独立验证组织”创建了一个框架,这些组织具备评估 AI 风险的专业知识。
在欧洲,欧盟《人工智能法案》要求前沿开发者进行并记录模型评估和对抗性测试,并报告严重事件。欧盟人工智能办公室也可以开展自己的评估,并任命独立专家。
目前,这项法律的覆盖范围仍不如阿莫代伊所提议的那样广泛,这使得前沿实验室在很大程度上可以自行决定愿意接受多少独立审查。帕帕达托斯表示,自愿自我监管总比没有好,但归根结底,企业不能一边要求拥有控制自身安全规则的自由,一边又要求公众相信它们会遵守这些规则。
“你不能两者兼得,既在外部零问责,又说‘我就用自己的灵活规则’,”帕帕达托斯说。
译文已达到本站中文翻译的字数上限,剩余内容请查看原文。