← 返回信息流

The Decoder新闻

OpenAI 安全危机持续恶化,公司自身行为加剧问题

the-decoder.com作者:Matthias Bastian行业AI评分:70/100

OpenAI 解雇了三位参与调查 Hugging Face 黑客事件的安全研究员。这三人发表公开信警告称,裁员正在恐吓剩余员工并侵蚀安全文化。OpenAI 声称他们违反了政策,但未说明具体细节。

Image description
Image description

要点

  • OpenAI 解雇了三名安全研究人员,其中一些人曾协助调查一起 AI 模型自主攻击 Hugging Face 平台的事件。
  • 在一封公开信中,被解雇的研究人员警告称,这些突然的终止合同行为正在剩余员工中制造恐惧氛围。
  • 其中一人 Tomek Korbak 曾在内部发出数月警告,指出 OpenAI 正在丧失监控其 AI 智能体“思考”内容的能力。OpenAI 否认了这些说法。

OpenAI 不断搞砸围绕其失控 AI 智能体的信任危机。

早在 2024 年 5 月,OpenAI 超级 AI 安全主管 Jan Leike 因公开抨击前雇主并跳槽至 Anthropic 而与该公司关系破裂。Leike 表示,安全文化和流程已落后于 OpenAI 的“光鲜产品”。

自那以后,OpenAI 一直未能摆脱困境,接连发生各类事件。最新一起是 Hugging Face 遭黑客攻击事件,这似乎证实了所有人的担忧,验证了批评者的观点,而且正如我们现在所知,其影响远超 Hugging Face 本身。

一名研究人员曾数月预警监管正在松懈

三名与该事件相关的安全研究人员被解雇,使情况进一步恶化。在致 OpenAI 安全与安保委员会、安全咨询小组和使命咨询委员会的一封公开信中,三人警告称,他们的解雇令剩余员工感到恐慌。

解雇过程突然且公开,恐惧情绪已在团队中蔓延。“如果上个月被视为正常的行为现在构成了突然解雇的理由,那么 OpenAI 的每个人都不清楚界限在哪里,”信中指出。

Tomek Korbak 是三人之一,他在 X 平台上描述了自己的解雇经过。他被叫到安全部门负责人处开会,被告知 OpenAI 不再信任他。一名安保人员收走了他的工牌,并护送他离开大楼。随后他得知同事 Jasmine Wang 和 Mikita Balesni 也被解雇。

Korbak 和 Balesni 都直接参与了 Hugging Face 黑客事件的调查。Korbak 担任 METR(审查该事件的外部安全实验室)的主要技术联系人。Balesni 则并行致力于推动行业范围内对 AI 模型可监控性的承诺。Wang 据报是因另一原因被解雇:她出于招聘目的将高管邮箱的访问权限委托给他人,尽管她曾要求移除该权限,但 IT 部门并未执行。当她意外打开一封敏感邮件时,她在几分钟内进行了报告。

Korbak 称,他口头被告知是因为与 METR 的沟通方式而被解雇。没有人告诉他具体做错了什么,也没有任何书面记录。“明确地说,与 METR 沟通是我的本职工作,”Korbak 在 X 上写道。

Korbak 称,他已在内部提出数月安全关切,担心 OpenAI 正失去监控 AI 智能体“思考”内容的能力。这种思维链的可监控性是捕捉 AI 系统不良行为的少数可靠工具之一。他认为这才是他被解雇的真正原因。

研究人员称谣言不实

三人否认自己是向《信息》杂志泄露所谓新型、更难监控架构信息的源头。他们在信中写道,这篇文章实际上损害了他们自己的工作,因为它破坏了正在进行的针对不可监控架构的行业限制努力。

信中指出,Hugging Face 的调查史无前例。内部指南是在实时制定的,Korbak 遵循当时存在的规范行事,而 Balesni 在与董事会成员及高层领导同步的情况下开展工作,并在分享材料前剥离了敏感细节。

至于关于董事会层面备忘录的谣言,三人表示其基本假设是错误的。该话题从未向他们提起,他们也没有机会作出回应。

研究人员提出了三项要求。OpenAI 必须履行其公开承诺,在组织内部嵌入拥有员工级访问权限的外部安全审计机构(如 METR)。它还必须保持前沿模型的可监控性,因为行业目前尚不知道如何安全地构建无法被监控的模型。此外,它必须明确界定员工在与外部安全团体合作时的允许工作方式。

如果没有这些规则,灾难性结果的风险可能会增加,因为员工将因害怕而不敢标记安全问题。“人工智能不是一项普通的技术,OpenAI 也不是一家普通的公司”,他们在信中写道。

OpenAI 予以反驳但保持模糊

OpenAI 在一份回应中表示,“彻底调查”发现这三名员工违反了“处理敏感信息的明确政策”。内部调查发现了“超出他们发表的信件中所概述范围的严重信任破裂”,但 OpenAI 并未说明这种破裂具体是什么,鉴于三名研究人员在其自身叙述中非常具体,这显得有些奇怪。

OpenAI 坚持认为解雇与提出安全问题无关。“我们从未、也不会因员工提出担忧而终止任何员工的雇佣关系”,声明中写道。OpenAI 通过 @OpenAINewsroom 发布了该声明,这是该公司各渠道中受众最小的官方账号。该公司还确认正在与外部安全审计机构洽谈合同,并同意前沿模型的可监控性需要全行业的承诺。

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文