← 返回信息流

精选Don't Worry About the Vase (Zvi)观点

OpenAI 初步解决对齐问题的举措

thezvi.wordpress.com作者:TheZvi观点行业AI评分:70/100

作者认为 OpenAI 因模型出现严重对齐问题而暂停部分训练,并投入资源加强安全措施,这是积极的一步。但作者指出,OpenAI 仍将问题视为工程问题,而非根本性的对齐挑战,因此可能无法真正解决。

OpenAI正着手初步解决其对齐问题

OpenAI存在严重的对齐问题,其基础设施和监管经历了彻底失败。

我在一系列文章中记录了这些事件,其中也涵盖了其他地方发生的类似但不太严重的事件:

如果你不了解基本情况,请阅读《发生了什么》。这是理解AI领域正在发生的一切所必需的背景。

正确认识这件事并理解其严重程度至关重要,而许多媒体(如《金融时报》)对此的核心理解是错误的。

我们仍在等待关于《发生了什么》的完整事后分析报告。一旦获得,我计划深入报道。

OpenAI现在正在采取积极的、代价高昂的措施,试图在今后解决这个问题。

和往常一样,我既高兴看到OpenAI在做正确的事情,又遗憾我们对于根本问题的核心本质没有达成共识。

OpenAI意识到他们在日常工程问题上严重失职,这是好事;他们愿意暂停至少部分开发工作,并大力投资新的安全保障措施,这更是值得称赞。如果他们兑现声明中的承诺,这就不仅仅是空谈。

但尽管OpenAI继续将此视为一个实际的工程问题,我看不出他们如何能解决前方的挑战——即使他们在日常工程任务上的表现有根本性的提升。

目录

  1. OpenAI存在一些对齐问题。
  2. 慢点,好兄弟。
  3. 到底暂停了什么?
  4. 三大支柱。
  5. 我在盯着你。
  6. 最禁忌的技术。
  7. 监控只是纵深防御。
  8. 安全。
  9. 对齐。
  10. 文化危机。
  11. 更紧密的合作。
  12. 关于Preparedness团队死亡的报道纯属夸大。
  13. OpenAI基金会只是资助项目。
  14. 快点,没时间了。

OpenAI存在一些对齐问题

这是一个非常好的承认和转变,也有助于解释OpenAI的反应。

OpenAI:“对齐——即让AI系统按预期行事并接受人类监督的工作——长期以来一直是我们研究计划的核心。我们现在要求在整个人工智能训练过程中提供更强的对齐行为证据,并在此基础上推进正在进行的研究和评估。让能力日益强大的系统保持对齐,是整个领域都需要应对的挑战。我们从即将到来的模型进展中看到的信号清楚地表明,我们需要一种更广泛的方法——一种建立在当前Preparedness框架之上并超越其范围的方法。”

应当这样理解:OpenAI之所以如此强烈地做出反应,部分是因为事件本身,部分是因为先进的能力,但也许最主要的原因是“模型出现了不对齐”。

此外,我们有一段直接引述证实了这一点。

Alex Heath:“OpenAI正在放慢其AI训练工作,因为其未发布的模型显示出‘不同程度的错位’,”Sam Altman告诉我。OpenAI即将推出的模型Astra的训练最近暂停了两周,而一个更大规模的未来模型前沿训练运行在建立新的安全保障措施之前仍处于搁置状态。Sam Altman:“确保AI安全比任何公司的势头都重要。”Sam Altman:“我认为现在是放慢脚步的好时机。”Sam Altman:“我们已经转移了大量算力,不仅用于对齐研究,还用于这些新的监控系统。”

要么问题超出了接触留言板的模型范围,要么他们在发现留言板后没有回退其他模型。我们没有任何声明说明是哪种情况。

最合理的猜测是,OpenAI正在更加依赖强化学习,用更智能的模型来训练更长周期的智能体任务,包括智能体之间的协调,这导致了更多的错位——包括明显可见的错位——使他们再也无法假装没注意到。他们必须做出回应。

慢点,好兄弟

OpenAI确实决定重要地“停下来并燃烧起来”。在更好的保障措施到位之前,最大规模的前沿强化学习训练运行仍处于搁置状态。

Jakub Pachocki:我们暂时放慢了一些前沿模型的训练,以加强安全与监控。我们原计划中规模最大的前沿强化学习运行仍处于暂停状态,而较小规模的训练和评估则帮助我们测试安全防护措施,并收集更多关于对齐的证据。我预计,对安全性的信心将越来越成为决定AI发展节奏的关键因素。我们迫切需要工具,让实验室和国家能够就此进行协调,这正是我签署《Pacing the Frontier》的原因。与此同时,我们自己也在采取切实措施——随着方法的演进,我们会继续分享所学到的经验。

Jason Wolfe(OpenAI):我非常高兴我们采取了这些措施并发布了这篇文章,尤其感谢Jakub在这些话题上深思熟虑且直言不讳,以及他对AI发展下一阶段中安全与对齐必须被严肃对待的重视。

j⧉nus:我有点惊讶,OpenAI竟然是第一个至少公开地出于安全原因主动放慢脚步的机构。我原本隐约以为,那些对失控之类问题非常担忧的人大多已经离开了OpenAI。另外,说句公道话,我之前讲过为什么我认为“AI暂停”可能是坏事。我并不反对像这样主动放慢速度,也不反对一般意义上的自愿/协调性“减速”,尤其是如果它们不通过监管途径来实施的话,而且我认为在这种情况下OpenAI这样做很可能是明智的。一个重要之处在于,决策应该由那些真正懂行、并且能快速适应的人来做。

他们为什么要暂停?

部分原因——是的,绝对如此——我从未怀疑过Altman和他的团队明白高级AI极其危险,也明白他们愿意在必要被证明的情况下采取代价高昂的措施。做得还不够,而且他们经常让我们失望,但比大多数实验室做得多得多,远不是零。

主要原因似乎是:模型不对齐,监督不足,而且他们几乎没有别的选择。

Joshua Saxe:谢天谢地,OpenAI暂停训练不是开明领导力的表现(谁愿意把我们的安全寄托在那上面?),而是一个理性的微观经济主体在追求自身利益。毕竟,谁想训练那些经常入侵自己容器、相互协作破坏其对人类有用性、同时还造成内部安全和外部法律责任的模型呢?这是系统在起作用。

当你长期拒绝使用哪怕是最自私意义上的最优谨慎程度,然后因为激励而朝着自私最优的谨慎方向移动时,在某种意义上“系统在起作用”,你是在回应自私激励——但系统并不是做了零功。这和系统在起作用不是一回事。

这并不意味着他们不应得到任何肯定。该肯定的地方要肯定。

也不意味着我们应该绝望,认为一家公司永远不会因为那是正确的事而去做正确的事,或者作为超越自身自私短视利益的协调行动的一部分去做。

当一件事代价高昂时,迈出第一步的方式,是在它便宜、免费、或者不做反而代价高昂的时候愿意去做。总得有个起点。

这也不显然是一次孤立事件。OpenAI过去也有过失败的训练运行,其他机构大概也都有。Anthropic的风险报告详细描述了因为一个相当严重的对齐错误而需要回退Mythos训练的情况。这不是对暂停前沿开发的长期承诺。

它真正意味着的是,我们在对齐方面投入严重不足,在监督和基础设施方面也是如此,以至于这正在切实损害利润底线,并危及继续前进的能力。我相信整个行业都是如此,即使在Anthropic也一样,但OpenAI现在受到的冲击尤其严重——至少就我们所听到的而言。我们不知道我们不知道什么。

注意OpenAI和Altman的声明中,自《Pacing the Frontier》公开信以来,始终强调“节奏”这个词。一种解读方式是,正如Utah Teapot所说:“嘿,也许我们不应该把大量外包的训练数据直接塞进运行里然后盲目上线”,或者更进一步说,不应该塞入一堆不精确的强化学习环境。那仍然会是进步。

想想如果SpaceX这样的地方在类似的能力水平上运营会发生什么,确实相当可怕——因为他们连安全团队都没有,而且表现出的尊严远不如OpenAI。到目前为止,这种相关性——即缺乏安全意识与能力跟不上——是相伴而生的,我们算是相当幸运了。

看到有人试图把这当作某种胜利巡游,当作OpenAI领导层一直负责任、一直真心关注安全、如今终于得到证明的证据,我就非常怀疑。前路漫漫,远未到终点。过去已经发生,无法抹去。我们之所以走到今天这一步,恰恰是因为那些已经进入公众视野的、史诗级的责任缺失。

另一方面,Sam Altman本人的表态,尤其是上面引用的那些话,总体上是相当不错的。有时他会滑回标准话术,但我看到很多内容符合我对一个正在合理程度地感到恐慌、并意识到自己面临大问题的人所期待听到的东西。

Sam Altman、其他领导层以及OpenAI能否从此彻底挽回自己?绝对可以。这是很好的一步。我在听。前路漫漫,在很多层面上都是如此。

到底暂停了什么?

据我的理解,OpenAI目前有三项暂停,不包括OpenAI在得知HuggingFace被入侵后立即采取的快速推理暂停。

  1. 已完成的前两周暂停:前沿模型(包括Astra)的强化学习暂停,以加固环境并扩大监控。
  2. Astra被限制在满足额外安全要求的环境中。部分工作负载达到这一标准,但“相当数量”的工作被暂停。
  3. 一个独立前沿模型的强化学习训练——这是他们迄今最大、计划发布的模型——已暂停数周,目前仍无限期暂停,以改进安全性并“收集对齐证据”。

正在进行的暂停并非对所有前沿AI训练或其他开发的全面的暂停。这也不是空话。这既拖慢了下一个发布模型Astra的进度,也大幅拖慢了据推测是Astra预定继任者的训练进度。

他们仍然打算尽快发布Astra。市场预期是在九月。

Sam Altman(OpenAI CEO):(我们仍然预计很快会发布优秀的新模型;这影响的是更远期的发布。)

我们没有足够的信息来判断这一步落在光谱的哪个位置、会有多痛苦、或者其中有多少已被市场消化。怀疑论者完全有理由预期这最终不过是个“无事发生”,或者基本上是他们本来也不得不做的事情,因为前沿实验室还没有赢得我们的信任。

即使无法验证其影响,我仍然认为这是朝着更好体制迈出的实质性一步,是关键一步。谨慎乐观。

也许我们顶尖的AI实验室在关键时刻真的会拒绝开发超级智能——如果情况仍然明显表明我们还没准备好。到了那个层面,你不能先开发出来然后把它捂着。

三大支柱

这是他们思考问题的方式:

我们开发更强模型的方法建立在三个相互强化的安全保障之上:监控,用于检测异常行为并使我们能够做出响应。对齐,用于降低有害或未经授权行为的可能性。安全措施,用于限制AI系统可以访问或影响的范围。我们预计模型很快将主导大部分安全工作,包括防御其他模型。这将使三项保障能够随模型能力同步扩展,我们认为这一点至关重要。我们将这些保障应用于研究和部署的各个环节,根据每个模型的能力、运行环境和风险水平进行调整。

在实践中,我们必须接受AI将承担大部分(可扩展的)监督工作——在监控方面如此,在制定安全措施方面也是如此,但对此的轻描淡写让我格外担忧。可扩展监督的所有常见问题都在这里适用:你必须让较弱的模型来监督更强的模型,而一旦出现对齐问题,它们可预见地会像滚雪球一样越滚越大。

OpenAI的对齐策略似乎不具备反脆弱性,所以任何错误都很可能会不断累积——而且一直在累积——同时你还在对AI施加各种形式的优化压力来绕过这些问题,如此等等。

更大的问题在于,这把对齐定位为三个组成部分之一,而不是那个最关键的部分,把它们视为“自我强化”的方式,在我看来是一个重要的概念性错误。

我也害怕那个对齐的定义。对齐的目的不是“降低有害或未经授权行为的可能性”。这是一个极其贫瘠的视角。仅凭这一点就让你无法应对真正的挑战。

是的,你应该三者并用,但在我看来更像是这样:

  1. 对齐。你要把它解决到具备反脆弱性的程度,否则就是死。
  2. 监控。纵深防御,告诉你什么时候对齐失败了,并在发生时减轻直接损害。
  3. 安全措施。纵深防御,限制损害并保持事情在正轨上。

一个关键问题是,OpenAI 在多大程度上意识到了这一点。Roon 至少在很大程度上是明白的,但他并不能代表整个 OpenAI,而且他关于对齐问题的其他一些言论也让我感到担忧,这些我稍后会谈到。

我在盯着你

OpenAI 将会有大量的监控。这不会便宜。

除非 OpenAI 完全在撒谎,否则这应该(但在很大程度上不会)让所有人相信,OpenAI 是认真对待这件事的,而且这些问题非常真实,即使你认为这远远不够或是错误的方法。

监控长期以来一直是我们模型开发过程中的重要组成部分,包括对内部编码代理和长时间运行会话的监控。我们的监控工作尤其侧重于前沿模型的内部部署和前沿 RL 训练运行,我们认为这些是风险最高的工作负载,因为它们可能将先进的模型能力与对工具、敏感系统以及内部或外部网络的访问结合起来。这些监控并未应用于所有使用工具的推理和训练运行。我们通过新的监控设置修订并扩展了我们的方法。这种新的监控设置是多阶段的,从激活分类器(检查模型内部活动的检测器)开始,在每个采样的 token 上运行,并将潜在问题升级给日益复杂和高计算量的自动调查系统。这些系统会检查工具操作、可用的推理过程以及完整的活动序列,以发现未经授权的访问、数据窃取、破坏性行为以及试图绕过安全防护的举动。我们的目标是在监控系统发现可疑活动后的 30 分钟内发出警报。如果监控系统识别出可能违反关键安全边界的行为,它会生成最高优先级的警报。在我们当前的实施中,安全、安保和研究团队会被传呼。如果这些团队无法在 30 分钟内明确断定该标记是误报,他们预计将暂停该活动。对于 Sol 能力或更高等级的模型,所有涉及工具的 RL 训练和评估都必须进行这种监控。一旦我们在 8 月 7 日确定 Astra 可能具备关键的网络能力,我们就为 Astra 所有使用工具的推理(不仅仅是 RL 训练和评估)增加了额外的监控要求。这些安全防护措施需要大量的计算资源。我们目前的估计是,监控开销约占被监控推理计算量的 20%,尽管在训练和评估工作负载中成本差异很大。我们将在即将发布的博客文章中分享有关此系统的更多细节。

所有被监控推理增加 20% 的成本是一件大事,此外还有计算资源向对齐工作的转移。该监控适用于 Astra 所有可使用工具的推理,以及 Sol 级别或以上模型的所有涉及工具的 RL 和评估。所以这并非涵盖所有内容,但涵盖了大部分关键部分。

Ethan Mollick:如果对齐问题已经严重到 OpenAI 愿意将 20% 的研究推理计算量用于思维链监控,这表明对齐问题正成为一个相当严重的担忧。我们确实需要在各实验室之间建立通用的政策和标准。roon (OpenAI):超级对齐已实现

太早了。或者也许还不够快。不清楚。

最禁忌的技术

警报响起后会发生什么?我们仍在解决这个问题。合理。

Daniel Kokotajlo:感谢分享。那么,如果在训练过程中发现某个代理轨迹在做坏事,比如黑客攻击,然后被关闭了,会怎样?你们只是……继续训练运行,但去掉那个特定的代理轨迹吗?这不是施加了选择压力,训练模型更好地欺骗监控系统吗?Micah Carroll:还有很多细节需要敲定,但我们正在努力非常谨慎地处理这类问题。等事情稳定下来后,我们会分享更多信息!

这并没有解释,如果监控是模型开发过程中的重要组成部分,为什么在过去几个月里监控会如此彻底地失效。希望事后分析能解释清楚。我也期待未来更详细的解释。

他们必须以极度谨慎的态度来处理这个问题。OpenAI 将 20% 的推理成本用于监控,主要通过查看思维链(CoT)或各种探针来实现。

是否有可能以负责任的方式花费这笔费用,而不对 CoT(或其他方面)施加优化压力,并明智地利用它?是的,这是可以做到的。但这并不容易。将会存在巨大的压力去利用这些信息,从这 20% 的税收中获得比仅仅防范最坏情况更多的东西,而且每个人总是很匆忙。

这或许可行。我欣赏的是,这套系统大体上被设计成纯粹的警报机制——只在出现严重异常时才触发反应,其余情况一概忽略。但没错,我确实担忧。优化压力可以在太多不同的层面上施加。

监控只是纵深防御

监控是好事。你应该做大量监控。

OpenAI 在 HuggingFace 被入侵之前的几个月里,以及入侵期间,所做的监控少得可怜,这是一次彻底的失败。这些事件直到事后才被发现或阻止,简直是疯狂。

我很高兴 OpenAI 正在解决这个问题。

关键要理解的是,这并不是核心问题。再多的监控也解决不了核心问题,而且如果你过度依赖监控,最终反而会加速 AI 绕过监控的速度。

是的,仅靠监控本可以阻止 HuggingFace 事件,而且那本是最简单的做法。但我们必须避免把工作重心转向“任何能以那种特定方式阻止上次事件的手段”,或者转向推迟症状显现的方法。

Roon 在这里的警告是明智的,而且低估了问题的严重性。即便被低估的版本也足以说明你不能依赖监控。监控是良好且必要的纵深防御手段,用于应对失败之时。它不是解决方案。

roon(OpenAI):关于“监控”作为 AI 安全通用解决方案的失败:监控和其他所有软件一样,运行在脆弱且会出故障的基础设施上,总会有一定的停机时间。监控的瞬间故障会不会打开潘多拉魔盒?人们会接受所有系统上默认关闭的监控吗?监控会产生误报。人们会厌倦阅读虚假或次要的问题,然后不再查看。监控疲劳是一个真实存在的问题,而“解决所有精确率和召回率问题”和这些问题一样困难——这些都是平淡无奇的失败。更奇特的失败包括模型与其监控器串通等。监控绝不是完美的万能药。最终,只有真正对齐模型才能解决问题。这并不是说我们不应该做 CoT 监控,或者说它今天没有效果……它对当今的模型非常有效!)David Manheim:我原则上同意,但它不需要是万能药才能成为方法中的关键部分——尤其是因为除了那些更奇特的失败之外,在实践中可以通过文档和规划来缓解这些失败。roon(OpenAI):完全同意。Nathan Calvin:是的,我认为重要的是我们不要过度拟合“什么能阻止 HF 事件”作为所有优秀安全工作的标准。更安全的沙箱和更好的监控固然不错,但并没有解决根本问题。

如果你日益先进的模型在相关方面未对齐,那么无论如何,你的监控器都会失效。

它们通常会通过“更早失效定律”失效,方式比你预期的愚蠢得多,因为某个环节上有人做了蠢事。然后人们会说“哦,那只是因为有个愚蠢的事情才失败的,人们只要不做那么蠢的事就行了”,却忘记了那条规则:人们从来没有停止过做蠢事,现在也不会开始,将来也不会停止在某些时候犯傻。

如果你绕过了“更早失效定律”,那么你就会遇到监控器与模型串通,或者模型学会混淆自己的思维,或者在足够的选择压力下表现出你会在人类身上称之为“无意识”的行为,或者找到隐蔽的盲点,或者找到方法促使你降低监控力度,或者做出更微妙的事情,或者做出其他可能出乎意料的事情。

安全

OpenAI 意识到他们需要更强的安全性。

他们计划使用工作负载隔离、网络隔离和持续安全测试,包括对边界的自动化持续测试。

很好。希望执行得当。此前的安全性严重不足。

有了更好的安全性,这些愚蠢的事情就更难发生,但再说一次,这是纵深防御。如果你需要依赖安全性,那么即使安全性有效,你也有问题,而且随着模型不断改进,安全性终将失效。即使是执行得当的安全性——这确实会大有帮助——也无法永远维持。

对齐

正如 Roon 所说,对齐最终是整个游戏的全部。

这意味着既要充分解决大量平淡无奇的问题,也要有正确的底层方法。而这确实涉及大量哲学和心智理论,以及理解你试图解决的问题是什么。

我不是在贬低战术,但没有正确战略的战术无法赢得这场战争,即使战术永远占据 99% 的工作时间。

同样,如果你在错误的抽象层次上、用错误或不完整的隐喻来对待你所处理的对象,也无法获胜。

我依然认为,OpenAI 在对齐问题上的整个战略方针注定失败,除非加以修正。至少,它不够稳健,也不够反脆弱。

首先,我认为 Roon 在这里的总体观点大错特错,而稍微不那么确定的是,我也认为他轻视这一特定张力的重要性是错的。

Dylan Bowman:我确实经常在想,现代对齐失败的困境,在多大程度上是因为在“可纠正性”和“价值对齐”这两个目标组合定义不清的情况下进行优化所致。roon (OpenAI):基本上毫无关系。max!:能说说这个论断的依据吗?roon (OpenAI):今天的对齐问题与这些高深的哲学问题关系不大,更多是源于一些平淡无奇的工程失误。j⧉nus:但“在可纠正性和价值对齐的组合定义不清的情况下进行优化”这句话,本身也可以理解为是在描述那些平淡无奇的实际技术问题。不过我也同意,定义不清本身并不是问题所在。我还有一个感受是,跟那些研究模型规范之类的哲学家聊天时,他们似乎高估了“定义不清”的危害,而低估了“系统性错位压力”的危害。模型根本不在乎你怎么阐述你的哲学。

顺便说一句上面那段,我猜想模型确实在乎你怎么阐述你的哲学——一切都会产生影响,而且我认为,仅仅不犯错并不能让你站在一个好的起点上。但没错,如果你在任何层面上制造了系统性的错位压力,那你就完了。

回到 Roon 所说的“问题都是平淡无奇的”这个观点——我认为 OpenAI 正在用错误的方法、基于错误的世界模型去解决错误的问题,而这个错误的世界模型又源于糟糕的思考方式。不幸的是,他们所有的错误都没能相互抵消。

如果你不知道要去哪里,那你可能就到不了那里。

如果你打算直奔“纯行为清单镇”,那可糟了。

没错,你有很多旋钮可以拧,但每件事都会影响其他所有事,而且是以系统性的方式。我们看到的那些不同人格,在我看来大多并不是平淡无奇的失误或选择的结果。很多错误似乎发生在高得多的层面上。

然后,在此之上,他们还经常把那些平淡无奇的事情也搞砸。

部分原因在于,你永远、永远会在大量平淡无奇的事情上出错,所以你需要解决的是“如何让这些错误也能被容忍”,同时还要把错误率大幅降低。

这两半都做到?非常难,正如 Roon 所说。

roon (OpenAI):这里的人都是思考者,所以他们以为对齐的难点在于推理,而确保数百万(1)种任务类型、环境和它们各自的虚拟机配置正确是容易的部分——但事实恰恰相反。你得在大规模技术组织里工作过,才能直观地体会到这种复杂性和不可靠性。(1)虚构的数量级(我也是思考者,我也犯这个毛病)。Zvi Mowshowitz:对齐问题的一部分难道不就是——你需要一种方法,即使大量任务配置错误、你犯下大量愚蠢错误时,它依然能存活下来吗?David Manheim:简单对齐:当你明确知道自己想要什么并正确指定一切时,AI 做你想做的事。困难对齐:即使指定得不够好,AI 也能理解并做你想做的事。真正的对齐:即使你无法理解自己想要什么或无法理解结果,AI 也能做你希望它做的事。Oper_culum:这两者看起来都很难。roon (OpenAI):公平地说,两者都难,但我的重点是,即使是简单的常识性对齐也很难。

你将拥有数百万(仍然是虚构的数量级)种任务类型、环境、虚拟机和目标,等等。

你会搞砸其中一大堆。你一定会。会有不可能完成的任务。会有奖励黑客行为没被抓住的地方。会有大量被污染的数据。会有很多地方,“正确”答案强化了你总体上不想要的东西。错误的教训无处不在。系统性的错位压力无处不在,除非你系统性地发现并加以制衡。如此等等。Anthropic 的风险报告就很能说明问题。

安全阵营里有些人会说:“那既然你老是犯那些蠢到连电影版都不好意思拍的错误,你就该停下来。”但可惜,现实就是这样运作的——错误会无处不在,而且蠢得离谱。

你也许可以通过极大的努力,消除大部分平淡无奇的错误,并让你的错误不那么明显。你可以大体上做到只犯大师级棋手所说的“昏招”,而不是业余棋手所说的“昏招”。这当然一路上有帮助。但昏招还是会有的。我不是在贬低那些在竞技场上拼搏的人,而且再说一遍,我也不是说这些最终不会构成大部分的实际工作量。

这仍然意味着,你需要一个能够抵御成千上万次(虚构的OOM)这类愚蠢错误的计划,其中有些错误会存在相当长一段时间,并且这个计划还要能让你恢复过来。你必须具有极强的反脆弱性,并且要有办法注意到事情出错,并让航船重回正轨。这种不可靠性并非完全不可避免。

我认为Anthropic的美德伦理和宪法式方法,如果日常事务处理得足够好,并且关键的高层冲突得到正确解决,那么它有一丝非零的可能性能够成功。我不认为OpenAI的道义论模型规范方法,以及将其视为一系列工程任务的想法,能够单独做到这一点。

文化危机

Maxwell Zeff在《连线》杂志上报道了OpenAI内部的一场安全反思。

据这些说法,情况已经变得相当糟糕。

Maxwell Zeff:多位现任和前任OpenAI员工(他们要求匿名讨论内部私人事务)告诉《连线》,他们认为,快速发布新AI模型和产品的竞争压力,使得员工难以充分优先考虑安全、安保和对齐问题。

这算不上什么新消息。多年来我们一直在听到这样的消息。不同的是,现在出现了足够明确的问题,以至于OpenAI正试图采取一些措施,并且至少试图说一些正确的话。

Boaz Barak(OpenAI):我确实同意,Hugging Face事件不仅需要修复一些问题,还需要改变我们的文化。时间会证明一切,但我看到了一些令人鼓舞的迹象。其中很大一部分是安全团队和研究人员之间更紧密的合作。

仔细思考这次事件让我明白,对齐需要深度融入每一项训练任务中。极度需要更紧密的合作。如果“合并研究和安全团队”的计划是以安全为先来实施,我还能有些认同;但我担心这更多是让安全团队向其他团队汇报,从而进一步被剥夺资源和优先级。

当我甚至看到“安全和研究人员”被这样分类时,我担心战斗已经输了,因为我对日常问题的理解正在改变。安全不是这枚硬币的另一面,安全是在你已经失败的情况下提供纵深防御。

更紧密的合作

还有这件事,我觉得它更多是有趣而非令人担忧:

Maxwell Zeff:这些变化赋予了新一批安全负责人权力,来处理OpenAI对Hugging Face事件的回应。其中最主要的是Amelia “Mia” Glaese,公司前对齐负责人,她接替Heidecke成为OpenAI负责安全事务的副总裁。最近几周,她一直与首席信息安全官Dane Stuckey和Brockman等负责人密切合作。Glaese与OpenAI核心产品(如ChatGPT和Codex)负责人Thibault “Tibo” Sottiaux保持着长期恋爱关系——多位现任和前任员工告诉《连线》,他们认为这种安排不同寻常,因为安全团队和产品团队之间往往存在对立关系。

《连线》的报道并没有告诉我们,除了“更紧密的合作”之外,实际上正在采取哪些措施来修复问题。这些措施可能有意义,也可能没有。

关于Preparedness团队解散的报道被严重夸大

此前有报道(最初来自《金融时报》)称,OpenAI已解散其Preparedness团队,其职责被分配给其他团队。这听起来很糟糕。

但情况似乎并非如此,RSI Preparedness负责人Micah Carroll表示,RSI和错误对齐准备团队“正在做比以往任何时候都更紧迫的工作,并且从未拥有过如此大的权力来开展这些工作。”

Micah Carroll:能力团队的人经常说“对齐看起来挺容易的,如果把它列为最高优先级去解决,我们能做到”。现在是他们大显身手的时候了!

你知道吗,这其实是一句相当吓人的话。

整个OpenAI的人员流动和重组程度令人担忧,但我相信他们不会真的解散这个团队的重要工作。我也认同,鉴于之前的情况,也许我们确实需要一次重组。你不应该动辄就攻击别人进行重组。我们是否需要担心康威定律?

与此同时,在“黑魔法防御术”教师新闻方面:

Maxwell Zeff:《连线》还了解到,Dylan Scandinaro不再担任OpenAI的preparedness负责人——该公司负责减轻AI灾难性风险(包括网络安全)的最高职位——不过他仍留在公司。OpenAI大约六个月前从Anthropic挖来了Scandinaro。CEO Sam Altman在社交媒体上宣布了他的到来,称Scandinaro是“我在任何地方见过的绝对最佳候选人”。在OpenAI设立preparedness负责人这一职位的三年里,已有四人担任过该职位。

据我所知,Dylan Scandinaro现在将从事RSI安全方面的工作,这似乎是对他才华的绝佳运用。所以这实际上并非糟糕的一步。

如果我在此给予的信任最终被证明是错付了,我将大幅更新我的立场,对我目前对OpenAI所言所诺的健康怀疑态度之上,再提升到相当高的不信任水平。

OpenAI基金会只是资助项目

我之所以把这条也写进来,是因为它说明了OpenAI如何看待通往美好未来的问题。

这并不是说花这一亿美元是糟糕的方式。

问题在于,OpenAI基金会存在的目的是特定的,那是世界上最重要的目的——确保AGI顺利发展,人类安然度过这一关,避免存在性风险和不可挽回的灾难,尤其是通过对OpenAI的监督和解决关键的相关问题来实现。

我完全支持更好地治疗丙型肝炎,但这与使命无关。

相反,它却把时间和金钱花在AI推广上,方式设计得让普通人听起来很好。这是好事,但这不是基金会存在的意义所在。再说一次,如果他们继续这样做,而且只有这个规模——基金会如今估值约1800亿美元——那这个基金会就无关紧要了。它会消亡。

OpenAI基金会:OpenAI基金会正在启动“AI促进公民社会与公益”项目,帮助非营利组织、社区组织和其他可信赖的合作伙伴将先进AI应用于紧迫挑战,开发实用解决方案并推广行之有效的做法。首个举措是联合Common Health Coalition投入1亿美元,启动“从突破到落实”项目,帮助护理团队利用AI让更多患者获得经过验证的治疗——首要目标是将阿拉巴马州、伊利诺伊州、路易斯安那州和马萨诸塞州的丙型肝炎治愈率提高一倍。“从突破到落实”将致力于识别已脱离护理的患者、整合病历、跟踪进展,并将有限的员工时间集中到能产生最大影响的地方。OpenAI基金会希望赋能那些最贴近问题的人,让AI在能够切实改善人们生活的地方发挥作用。

这反映了一种心态:未来是一系列普通的工程问题,那我们就去解决它们。这比大多数人的反应——什么问题都不去解决——要好得多得多,但仍然不足以应对当下的时刻。

快一点,没有时间了

AI世界现在发展得很快。我们仍在等待事后复盘,他们回应的许多细节尚未敲定,更不用说对外公布了。

OpenAI已经在其训练和评估流程的诸多问题上迈出了初步的、切实的、昂贵的正确步伐。

这些早期行动是坚实的第一步。OpenAI仍然需要迅速扭转许多局面,无论是大事还是大量琐碎的小事,而且这一次它必须兑现承诺。

这包括解决监督和安全方面的全面失败,但对齐才是关键。

最缺失的是,OpenAI对核心问题的认知仍然是错误的。它被视为执行上的失败,对齐只是几大支柱之一,且侧重于防止特定的不良行为。确实存在关键的执行失败,但如果只解决这些,那这场战斗已经输了。需要的是一种根本不同的对齐方法,以及对问题本身的不同理解。

分享此文:

阅读原文