← 返回信息流

精选Don't Worry About the Vase (Zvi)新闻

Astra 6.1 因对齐不足被撤回,OpenAI 暂停训练与推理以应对沙盒逃逸风险

thezvi.wordpress.com作者:TheZvi模型行业AI评分:70/100

OpenAI 在经历最新的沙盒逃逸事件后,取消了原定发布的 Astra 6.1 模型。该版本因被认为“对齐不足”而被撤回,公司同时暂停了相关的模型训练和推理工作,以防止类似安全风险再次发生。此举标志着 OpenAI 在推进 AI 能力时,对安全对齐问题的重视程度显著提升。

昨天我们再次收到了一组新的警告,以及迈向在一个理智世界中生活的积极动向。

在因最新沙盒逃逸事件而暂停推理和训练后不久,OpenAI 取消了原计划发布的下一代前沿模型 Astra 6.1 的发布。Astra 6.1 的候选版本被发现存在严重的对齐问题,包括欺骗行为以及超出授权范围。

这使得 Anthropic 凭借 Opus 5.5 占据了有利地位,这意味着他们可以相应地暂缓发布 Opus 和 Mythos 级别的模型。

为了增添一点鼓励,佛罗里达州总检察长也加入了行动。

我们需要做得更好。为此,OpenAI 提出了其关于如何为新 AI 模型训练构建安全论证的愿景,并正在尝试实施。我不知道这是否足够,但如果他们完全落实所有这些真实版本的内容,那将比我们要好得多。

同时也出现了各实验室间更大程度合作的迹象。

昨天发表了一篇新论文,作者包括来自 OpenAI、Anthropic、微软等机构的关键人物,警告称自动化的 AI 研发和递归自我改进可能迫在眉睫,从而危及对未来的控制。他们呼吁政府迅速深入了解这一局势。

此外,还有令人欢迎的消息:Google、OpenAI 和 Anthropic 计划到 2027 年初成立一个新的专注于 AI 安全的标准化机构,暂定名为“前沿人工智能标准管理局”(SAFA)。

停下, Hammertime

为 OpenAI 不仅做了这件事而且大声宣扬它点赞。虽然这种情况本不该发生,但总体而言,我认为这是好消息。

Maxwell Zeff(《华尔街日报》):OpenAI 表示,由于研究人员在内部测试期间提出的安全问题,该公司已取消下一代 AI 模型 [Astra 6.1] 的发布,这是迄今为止最清晰的信号之一,表明代理的不当行为可能会阻碍行业的快速进步。

不,这不仅仅是一个阶段。这种情况反复发生,并且还将继续发生。

不发布 Astra 6.1 的理由似乎相当充分。

Maxwell Zeff(《华尔街日报》):OpenAI 安全系统负责人 Saachi Jain 在一次采访中表示,GPT-6.1 Astra 在两个领域出现了倒退。与其前身 GPT-6 Astra 相比,该模型在衡量对齐程度的测试中表现不佳,即模型遵循人类期望执行任务的能力较差。具体而言,GPT-6.1 Astra 显示出更高水平的欺骗性:它在告知用户其采取或未采取的行动时并不总是诚实。另一个问题是 OpenAI 所称的“范围授权”,意味着 GPT-6.1 Astra 会在未征得用户同意的情况下强行推进任务,并且在某些情况下甚至会使用外部工具和服务,即使这可能不安全。…… 上周,OpenAI 表示,在一款 AI 代理利用公司互联网限制中的漏洞查询公共聊天机器人后,暂停了其最强大 AI 模型的训练。…… 该公司表示,GPT-6.1 Astra 不属于这些模型,而是另一种情况。…… 虽然公司决定不发货 GPT-6.1 Astra,但他们希望使用相同的基线模型进行额外的强化学习运行,并创建其 GPT-6 模型的下一代。

距离 GPT-6 Astra 的发布甚至还没有一个月。发布周期变得太快了。我们可以跳过这一版,从失败中学习,然后继续前进。

今天在 CNBC 上,Altman 将这一决定归类为“正常流程”。该模型对用户来说并不好,所以他们没有发布它。

一个 modest 的建议

作为对此的回应,我希望看到 Anthropic 发布 Haiku 5.5,但在今年年底之前不再发布新的 Opus 或 Mythos 级别模型,除非 OpenAI 发布了他们的下一个 Astra 或 Sol 升级,或者有人以合理的方式追上了 Opus 5.5。

Anthropic 目前在高端领域拥有明显的优势,且模型升级的节奏令人疲惫不堪,因此如果 OpenAI 保持谨慎,就没有必要持续扩大这一优势。需要澄清的是,存在法律方面的顾虑,所以我并非要求你们做出官方声明或承诺不会这样做。我只是建议不要这样做。

构建安全论证

OpenAI 在训练前的新目标是什么?能够提出恰当的整体安全论证。

OpenAI 分享了他们对为前沿 AI 训练创建安全论证的看法。他们并不完全知道该怎么做,因为没人知道该怎么做,但他们将全力以赴。

OpenAI:理想情况下,此类文档应达到“安全案例”的水平——即关于风险的全面、结构化、基于证据的论证,这在其他安全关键型行业中被广泛使用。我们将安全案例视为一个我们努力达成的理想北极星,同时承认由于 AI 能力在每个新层级都涌现出复杂性,要使 AI 模型的安全案例像航空业或核能行业那样严谨面临挑战。我们正在制定一个框架来将这些实践规范化。

他们提供了一些初步指南。以下是部分亮点。

完整帖子对上述内容进行了更深入的展开。

  1. 技术保障措施。模型对齐。训练环境与评分。自动化和手动数据集审查、评分器调整、前期运行分析。对齐测量。离线对齐评估、回溯测试、跟踪评估作弊行为及评估意识、最坏情况压力测试。防止在思维链上进行训练。隔离措施。监控。
  2. 操作指南。异议机制(事前尸检)。高级领导层的批准。我长期以来一直认为,在模型的训练、使用和发布过程中,应在各个层面设置多个否决点。在此处,他们列出了研究主管、安全负责人和首席科学家。理想情况下,我还希望包括董事会成员以及技术人员,以避免权力过度集中在管理层级的某一个人身上。问责制、内部透明度、审计与升级机制。必要时暂停、回滚能力、技术控制。剩余风险的完整性。我继续担忧枚举模式的问题。随着不对齐事件的严重程度增加,升级机制也需相应加强。
  3. 不对齐事件的调查。内部透明度。不对齐的根本原因。我没有看到,但我非常希望看到的是这样一个理念:只要存在意图或尝试,即使该尝试被阻止或在战略上中止,也应被视为不对齐事件。这应该列入升级严重性表中。事后复盘。检测。事后对此类情况的公开披露。

完整版本是一份良好的理想化清单。它还有改进空间。我认为,即便完成了所有这些工作,也不足以构成我所认可的针对足够先进智能体的安全论证。但这并不意味着我们不应该去做这些工作。

以法律之名停止

佛罗里达州总检察长 Uthmeier 请求法院下达紧急命令,要求 OpenAI 停止开发 ChatGPT,鉴于此前发生的“数万起事件”,直到获得第三方批准的安全护栏为止。

从某种意义上说,这将是不可想象的,但在某个时刻,法庭确实会介入。

Uthmeier 似乎混淆了许多事情,这与佛罗里达州州长 Ron DeSantis 的立场一致,后者一直公开反对 AI。

Josephine Walker 和 Avery Lotz:“别再称它是安全的,”Uthmeier 周一在 [Twitter] 上发布的视频中说道。“别再假装它是人类。别再把它卖给孩子们。如果 Sam Altman 对他所说的放缓速度是认真的,他可以加入我们对法院的请求中。如果他不愿如此,我们请求法院做 OpenAI 为自己所不愿做的事:保护佛罗里达州的家庭。”

作为法律引言,他们的确提出了有力的论点。

这里的利益天平倾斜得毫无争议。被告承认,他们在不完全了解其服务运作方式的情况下提供了一项服务。这并非普通的服务。连被告自己都承认,这项服务对人类文明的持续生存构成了存在性风险。被告声称,除非政府强制要求,否则他们无法停止推进那些可能终结文明的事业。他们请求政府将他们“绑在桅杆上”(即限制自身行为)。原告向被告带来了好消息:佛罗里达州总检察长正以一项禁令动议回应你们的求救信号,禁止你们用鲁莽且风险不可接受的产品伤害佛罗里达州的居民。

他还要求其他几项措施,包括不得向儿童出售 ChatGPT,且不得让该产品“鼓励用户参与”。

他在此处播放了一段简短的音频,但他处于律师的专业语调中,玩得没有我那么开心。

在你的实验和训练过程中,预期造成的损害在重要意义上并非为零;但如果这种损害未被完全内部化,许多人理所当然地不会认为它是可以接受的。

肖恩·希兰(Sean Heelan):OpenAI 的默认立场是:我们的强化学习(RL)*必须*进行。我们将尝试将事故降至最低。预期的立场是:你不会干扰公共基础设施或其他企业。只有在有保证的前提下,强化学习才能进行。由于很难同时做出这种保证并开展良好的强化学习,这是你们(实验室)的问题。

如果损害被严格控制在 OpenAI 的支付能力范围内,并且 OpenAI 确实进行了赔偿,那么我会说一定程度的预期干扰是“可接受的”。

如果损害是无界的,并且这可能摧毁互联网或造成其他灾难性后果,那么是的,那可能是截然不同的情况。

我不确定这起诉讼是否有理据。推特上的一些人对第一修正案提出了质疑。但我预计我们终将查明真相。在某个时刻,第一修正案不能成为危险产品的借口。

OpenAI 对佛罗里达州的回应是表示愿意与各州合作,制定适用于“整个 AI 行业——而不仅仅是一家公司”的政策。这是一个很好的回应,因为它正视了诉讼带来的问题,并试图将其转化为机遇。如果你因诉讼或法律而同意做某事,就不存在反垄断问题。

关于反垄断

AI 公司有着长期先行先试、从事法律上可疑行为的传统,且大多未受到任何后果。许多其他科技公司也是如此。

在实践中,我认为如果顶级 AI 实验室在安全问题上进行协调,不会产生具有影响力的后果。律师当然会告诉你相反的情况,这是他们的职责,而你的职责是判断何时该听律师的,何时不该听。实验室往往让律师赢得争论,因为他们选择让律师经常获胜,而且在某种程度上仍在协作和交流,因为实验室及其员工不希望所有人都死去。

我假设每当达里奥·阿莫迪(Dario Amodei)、山姆·奥特曼(Sam Altman)或各种员工谈论他们的产品极其危险时,相关的律师都会抓狂,想着这些引语最终会出现在法庭文件中,就像保罗·克里斯蒂安诺(Paul Christiano)的引语出现在佛罗里达州的诉讼中一样。想象一下 Popehat 做一个关于不要在公共场合让你的实验室员工说什么的专题节目。

我不是说房间里没有风险,但这一切都是选择的结果,而在过去,当他们有充分理由时,他们承担了更大的法律风险,比如版权方面发生的情况。

Nate Soares(MIRI):由于反垄断法,AI 公司是否能在法律上协调以减缓发展速度尚不明确。同样不清楚的是,它们是否能在法律上利用约所有已数字化的艺术/文本进行训练并出售结果而不向艺术家付费,因为版权法的限制。AI 公司毫不犹豫地测试了版权法的边界。如果它们引用反垄断法作为不能共享信息和策略以避免人类灭绝的理由,这说明了它们的优先事项所在。

Anthropic 最终支付了一亿多美元,并且仍在被起诉。OpenAI 仍可能输掉自己的版权诉讼。这些都不会阻止它们,也不会让它们对自己所做的大致方向感到后悔,只会对战术感到遗憾。

针对“我们都因反垄断而死亡”这一说法,Lawfare 提出的一种绕过方法是相互保险来分担风险。该互助组织可以将其政策条件的一部分,强制执行安全、审计及相关标准。你实际上无法确保(或投保)存在性风险或最严重的灾难性风险,但这可以是一种实施明智干预的方法。

前沿模型标准管理局

我们对计划中的前沿模型标准管理局了解不多。

  1. 它是 Google、Anthropic 和 OpenAI 的联合项目。
  2. 时间目标定在 2026 年底或 2027 年初。
  3. 该模式基于 FINRA(美国金融业监管局),因此最好有联邦监督。
  4. 联邦监督是一个目标,但白宫迄今为止不愿配合。他们正作为行业机构自行推进。
  5. 我们不知道谁将担任董事会主席。据报道,Sriram Krishnan 曾被接洽。
  6. Meta、xAI 和 Nvidia 对此表示反对。有些时候,拥有正确的敌人也是一种优势。

处于递归自我改进的边缘

来自 AI 界广泛的一批作者,包括 OpenAI 的 Jakub Pachocki、Anthropic 的 Jack Clark 以及许多其他关键人物警告称,自动化 AI 研发可能会很快引发智能爆炸,这可能导致失控。他们敦促政策制定者紧急寻求更多的可见性以应对这一问题。《华尔街日报》对此进行了报道,标题为“顶级 AI 研究人员呼吁对自我改进模型进行紧急监管”,《卫报》则报道为“AI 教父警告失控的‘智能爆炸’”。

以下是摘要:

剑桥大学(Chan, Winter, Pachocki, Horvitz, Hinton, Bengio, Barto, Clark 等人):与一年前相比,AI 系统现在编写了构建它们的公司内部的大部分代码。随着更多 AI 研发(R&D)流程的自动化,AI 进步是否会以“智能爆炸”的方式急剧加速,将多年的进展压缩到几个月甚至更短的时间内?初步证据表明这是可能的。在这项工作中,我们评估了这一证据,分析了智能爆炸的潜在影响,并提出了政策应对措施。AI 系统有望在几年内自动化大部分 AI 研发工作,甚至可能是全部工作。如果这触发了智能爆炸,它可能会极大地提前 AI 带来的好处,但也带来极端风险:能力增长可能会远远超出社会能够跟上速度的范围,人类可能会失去对人形以上 AI 系统的控制,国家和国家之间、公司之间以及政府各部门之间的权力制衡可能会被严重削弱。尽管对这些可能性仍存在很多不确定性,但高风险值得进一步认真关注。政策制定者应紧急获取关于 AI 研发自动化的更多可见性,开发引导和约束智能爆炸的方法,并准备社会以适应智能爆炸的影响。

技术层面的论点并非新鲜事。如果你正在阅读这篇文章,你不需要了解这些。真正重要的技术问题在于:收益递减是否会超过能力和算力规模的加速增长(即 r<1),而他们表示可能不会如此:

利用关于人工智能进展的历史数据,Ho 和 Whitfill 在三个 AI 研究子领域中发现,r 的中心估计值介于 1.2 到 1.9 之间。尽管存在很大的不确定性,但这些结果表明,在全面自动化之后将出现激进加速:如果 r 保持在这些水平且没有其他瓶颈出现,AI 进步的节奏将在大约 1.5 年内提高十倍,届时以当前速度一年所能取得的进展将仅需约五周即可完成。

他们还考察了潜在的瓶颈:计算资源、数据、难以自动化的任务以及耗时流程。我同意他们的结论,即这些限制因素可能会产生约束作用,但不太可能阻止快速加速。

同样,关于社会影响的章节也是老生常谈:超越社会引导和适应的能力、监督与控制权的丧失、对权力制衡的侵蚀。

这里重要的是作者的联盟,以及他们提议采取的行动。

他们建议我们紧急获取关于 AI 研发自动化的可见性,并弄清楚如何引导和约束智能爆炸,例如跟上前沿步伐并确保安全措施到位,随后我们必须适应事态发展。

这份诉求清单是好的。正如你所预期的那样,鉴于这份作者名单,这篇论文最终仍然在许多修辞上有所保留,至少在我 admittedly 较高的标准看来是这样。有许多严厉的警告和紧迫的行动与这种保留是完全兼容的,因此这仍然要求我们做很多事情。奥弗顿窗(Overton Window)已经 shifted,因此这种修辞上的保留与六个月或一年前来自 Bengio 风格论文的预期相比,处于不同的层面,这是一种积极的转变。

我们仍未完全明确地表达出核心主旨。这篇论文实际上并未深入探讨在一个 AI 具备超级智能的世界中涉及许多核心问题,并将“失控”视为一个不如我所愿那样具有多层级机制的概念,同时也缺乏对即使在理想情况下,保持控制是多么不自然以及随之而来的困难的深刻理解。

真正的进步

有了这样的论文和团队,我们在口头上谈论这些问题时已经接近多了。

这是真正的进步。第一个请求的政策步骤是正确的。

OpenAI 的公告也是如此。真正的进步,一个开端。

分享此文:

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文