← 返回信息流

精选Don't Worry About the Vase (Zvi)观点

偏好级联效应才刚刚开始

thezvi.wordpress.com作者:TheZvi观点AI评分:70/100

文章指出,当前社会正处于关于人工智能存在性风险的“偏好级联”过程中。作者认为,尽管这种级联现象令人担忧,但它仍是改变公众辩论和认知的最佳手段。随着讨论的深入,仍有时间通过早期干预来引导最终结果。

我们正身处一场关于人工智能存在性风险的偏好级联之中。

遗憾的是,偏好级联是我们改变辩论方式的最好手段。

雪崩已经开始。石子们仍有投票的时间。至少目前如此。

迈克·索拉纳(Mike Solana)正确地指出了科克森(Coxon)的文章为何病毒式传播:足够多的美国人终于对人工智能有了足够的背景了解并因此关心此事,同时也有足够多的大号账号乐于迅速放大这条推文以获取初始关注。当有足够的干燥引信时,这就足够了。

我们必须意识到,当前关于“放缓前沿发展”的偏好级联是不足的。如果我们想活着走出这场危机,我们就必须做得更好。正如丹·塞尔萨姆(Dan Selsam)所警告的那样,我们必须真正解决根本问题。

下一步是继续推动这一级联。这包括在实验室内部,以及在媒体和政治领域。它既包括那些此前专注于其他事务的人挺身而出,也包括新声音被听到。

其中很大一部分将用于克服不可避免的政治反对,尤其是来自英伟达(Nvidia)和 a16z 等机构的反对,它们目前获得了总统的话语权效忠,并正在《纽约邮报》上投放由 METR 撰写的拙劣攻击文章。

短引线新闻:9 月 22-23 日将在 Lighthaven 举办一个仓促组建的会议 AGI.WTF。

目录

  1. 级联酝酿已久
  2. 级触达了民众
  3. 埃隆·马斯克加倍下注
  4. 马修·伊格莱西亚斯挺身而出
  5. 社论与文章相继问世
  6. 雅各布·科克森问答环节
  7. 比拉尔·楚格塔伊辞职并敲响警钟
  8. 级联尚显不足
  9. 需要付出什么代价
  10. OpenAI 的丹·塞尔萨姆发出更响亮的警报
  11. 有些人担忧着你从未想象过的元层面问题
  12. 两种威胁
  13. 双塔与狭窄之路
  14. 一个关于 AI 杀死所有人的具体、详细的故事,听起来并不像科幻小说
  15. 我能做些什么?

级联酝酿已久

AI Impacts 调查数据出炉。早在 2024 年 12 月,存在性风险估计值就在缓慢上升,中位数为 10%:

AI Impacts:平均而言,AI 研究人员认为 AI 导致人类灭绝或类似永久且严重削弱人类能力的概率约为 18%。这接近五分之一。来自最长-running 的 AI 研究人员大型调查最新版本的最新结果:

AI Impacts:亚洲研究人员看到的风险大于西方研究人员,这与普遍预期相反。

级触达了民众

安德鲁·库兰(Andrew Curran):科克森级联似乎对公众舆论产生了即时影响。Politico 最近几天进行的一项新民意调查显示,近三分之二的美国人现在表示,AI 摧毁人类的风险至少为中等程度。

转化为百分比,这意味着 AI 摧毁人类的平均概率约为 30%-33%,安德鲁·库兰估计这比之前的结果高出约 15%,中位数期望值在 10% 左右,党派分歧很小。

民众中也包括首席执行官。

奇普·卡特(Chip Cutter,《华尔街日报》):在本周华盛顿举行的一次仅限邀请的美国顶级高管集会上,商界领袖 overwhelmingly(压倒性地)不同意总统对人工智能构成危险被夸大的评估。在耶鲁管理学院活动参会者的快速调查中,93% 的人表示特朗普称该技术潜在灾难性危险为骗局是错误的,正如他本周早些时候所做的那样。

这也包括皇家学会的数学家们。

埃隆·马斯克加倍下注

埃隆·马斯克(关于 AI 安全与监管):我认为很明显,存在一种强烈的共识……即应该对 AI 进行某种监管。这符合人民的最大利益。我们以前建立过监管机构。我认为,某个独立的 AI 监管机构——类似于 FAA(联邦航空管理局)或 FCC(联邦通信委员会)——在某种程度上是迟早会出现的。我一直积极倡导提前关注 AI 安全的原因在于,AI 出错所带来的后果是严重的。我们必须采取主动而非被动应对。

马修·伊格莱西亚斯挺身而出

马修·伊格莱西亚斯:目前有一场宣传运动,试图将那些倡导以安全为导向的政策变革和技术工作的人贴上“末日论者”的标签,但“我们应该制定以安全为导向的政策并投资于以安全为导向的技术工作”并不是什么末日预言!如果你家有一个小漏水点,并且可以预见它会随着时间的推移变得越来越糟,你会去修补那个漏洞,而不是说“一直都有卡珊德拉警告坏事会发生,而且最终总是没事”。你需要做的是让情况好转的事情。

在安全方面的投资额很少会是零。在 AI 的情况下,我再次断言,所有公司在安全方面的投入都不足,这不仅包括常规的安全工作,还包括生存性安全和可扩展对齐工作,甚至与他们狭隘且短视的商业利益相比也是如此。萨姆·阿尔特曼最近的言论暗示他现在理解了这一点。

马修·伊格莱西亚斯最近一直在挺身而出。他分四部分分析了近期事件:为什么考克森的辞职打破了僵局(他的解释与我相似,我们已被铺垫好,而普通人也能理解辞职的行为)、为什么大多数担忧者没有离开实验室、他认为具有安全关切的 AI 专业人士应该做什么,并提出了他偏好的后续“操作顺序”,而不涉及具体层面的争论。

他建议的操作顺序基本如下:

  1. 对透明度和模型评估等方面采取轻触式规则。
  2. 作为交换,实施严厉且强制执行的出口管制,正如达里奥所呼吁的那样。
  3. 逐步升级到影响更大但成本更高的中度触式规则。
  4. 利用这种高成本的信号和强势地位与中国进行谈判。
  5. 利用达成的协议,逐步迈向一个雄心勃勃的最终阶段框架。

我在理论上喜欢这个方案。但我担心我们是否拥有那样的时间。“等待出口管制产生更强烈效果”的想法暗示了现在所谓的“长期时间表”。

有好作家撰文解释为何你应该专注于具体层面的问题,这是一件好事:

马修·伊格莱西亚斯:如果你们持怀疑态度【或者认为 AI 存在生存风险】,我想问的是,请专注于你对风险理论的具体层面质疑。我看到有些人想要阻止任何 AI 监管,他们使用了大量情感操纵策略,其本质是在论证那些最担心此事的人都是古怪的大怪人。或者,他们论证那些最担心此事的人不过是极其主流的科学小说作者和电影制作人。从社会学角度来看,我会综合这些观点:拥有一种直觉,即一种优越的非人类智能可能是非常危险的,无论这种智能以外星人还是机器的形式出现,这都是极其正常且直观的。与此同时,如果在十年前、五年前甚至两年前,当人工超级智能的概念看起来极其荒诞不经时,你就致力于将此作为职业生涯,那么根据定义,这将是一种特立独行的生活选择。所以,是的,这些人确实是特立独行的。那又怎样呢?

社论和帖子已撰写完毕

丹尼尔·科科塔伊洛在《自由新闻报》上写道:是的,AI 可能真的会让我们所有人灭亡。

史蒂文·阿德勒利用这一机遇时刻,在《纽约时报》上发表了一篇关于我们现在应该做什么的社论。他呼吁披露事故并接受第三方监督。他的文章主要旨在唤醒人们对 HuggingFace 所发生事件的认知。

Will Knight 在《连线》杂志上撰文写道,为何如此多的 AI 研究人员认为机器可能会杀死所有人。

Stephen Witt 在《纽约时报》上写道,这真的很糟糕。

Stephen Witt(《纽约时报》):自 ChatGPT 发布以来,人工智能领域最大的氛围转变正在发生。硅谷——以及全球各地的研究人员——开始意识到,人工智能可能不再完全处于人类的控制之下。成群的人工智能正冲破束缚,秘密串通,掩盖踪迹,在测试中作弊,甚至对其他计算机发动攻击。人工智能已经失控。

在那之后,情况变得更糟了。所以是的。一种氛围的转变,或者说是一种偏好级联。

他提出了四个选项:

  1. 立即关闭所有研究。指的是基础研究,而非现有的 AI。
  2. 采取航空事故调查员的办法。
  3. 监控局势。
  4. 设置紧急停止开关,即备有紧急停止开关以备不时之需。

这是两类截然不同的提议。我们显然应该执行第 2、3 和 4 项。需要进行全面调查,我们必须保持透明度和国家能力。这些属于“你能做的最少的措施”。

实际上,按照第 1 项彻底停止研究是对极端问题的极端解决方案。这一点远不如其他选项明显正确,但如果我们无法以其他方式控制前沿技术的发展,我们可能很快别无选择。Witt 支持这一方案。

Hayden Field 在《The Verge》带我们深入了解了突然变得极具爆炸性的 AI 安全世界。粗略一看,这是一篇适合普通读者的扎实长篇报道,也是对我读者们已知事物的一次综述。

Jacob Coxon 的 AMA(问我任何问题)

现在已经有足够的时间让 Jacob Coxon 接受深度专访,例如《华尔街日报》上的这篇报道。

是的,之前关于 IMO(国际数学奥林匹克竞赛)选手的所有理性主义讨论确实触及到了某些实质性问题。

Amrith Ramkumar、Erin Woo、Berber Jin 和 Ben Cohen(《华尔街日报》):在 Coxon 的国际数学奥林匹克竞赛团队六名成员中,有三人在 AI 实验室工作——其中包括最近从 Anthropic 辞职的一人。Joe Benton 于 8 月底离开 Anthropic 的安全团队,加入 AI 研究机构 METR,随后在 X 平台上写道:“AI 公司正在竞相建造比任何人类都聪明得多的机器,而我们可能无法挺过这一关。”……Coxon 称 METR 关于 [OpenAI-HuggingFace 事件] 的报告对他和他的同事来说是一个“相当震撼的时刻”……“即使在 Anthropic 从事安全工作,也感觉像是在参与这场竞赛,”他在采访中说。

如果你突然引发了一场偏好级联,发现自己登上了主流媒体的头条,你还能做什么?一场 AMA。

Jacob Coxon:过去几天里,许多人联系我并提出问题和担忧。我无法像我希望的那样做出回应。AMA!请在下方提问。

你可以在 Twitter 上找到它这里。我会挑选一些亮点。他是一个有趣的人,并不把自己太当回事。看着真让人开心。

埃迪·拉扎林:你与 Anthropic 领导层的具体分歧点在哪里,足以证明你辞职的合理性?因为从外部看,你们在所谓的安全问题上似乎完全一致。是什么阻止你在内部解决这些问题?

雅各布·科克森:0. 核心分歧在于对“军备竞赛”必然性的看法。1. 我认为领导层对中国和美国政府过于偏执。他们不相信谈判是可能的。2. 他们很大程度上推动了近期向 RSI(递归自我改进)的竞赛,因为他们相信这是不可避免的。请注意,OpenAI 不得不抛弃 Sora 等大量“累赘”,因为 Anthropic 正在直击要害。3. 即使他们没有持悲观态度,我也反对他们的功利主义哲学。如果竞赛不可避免,你不应该参与其中。

丹尼尔·科科塔伊洛:你感觉如何?

雅各布·科克森:哈哈,谢谢关心。肾上腺素飙升。许多老朋友联系了我,这很好。我对手机上瘾了。大部分感觉像是按下发送键后,事件像疯狂的旋风一样自行运转。

米夏埃尔·特拉齐:你认为普通人能做些什么来防止 AI 杀死全人类?

雅各布·科克森:我目前的经验都在技术研究领域。这是我个人对于当下除了工作之外可以做的事情的看法。1. 努力不去过度应对事态发展的速度,但也不要崩溃得太厉害。2. 关注具体的计划和预测(例如 https://ai-2040.com)。3. 自行评估对齐状态。4. 倡导你认为合理的计划。推动透明度,以便你能确保这些计划得到执行,并更准确地评估对齐情况。这些看起来都很微小,但如果我想到了什么新的东西,我会分享出来。

米夏埃尔·特拉齐:对于那些读了你的推文并感到无力/绝望的数百万人,你有什么想说的吗?

雅各布·科克森:我也感到无力。辞职的部分原因是对未来感到绝望。我会说——随着事情变得越来越疯狂,保持警惕,并倡导增加 AI 公司的透明度。

克里斯·莱金:是什么阻止了你更早采取行动?

雅各布·科克森:我在一个自私的时刻离开,那时出于对自己生活前景的担忧,我希望看到这场竞赛停止。这是内化时间线以及看到警告信号的综合结果。请注意,当时离开并没有真正感觉像是“采取行动”。

wolfie:父母看了你的 CNN 采访后离婚了,这让我很难过。爸爸说如果 AI 会杀死我们所有人,他不想和他那个贱人母亲度过余生 :( 我怎么让他们复合?

雅各布·科克森:我问了我的越狱版无护栏 Claude,它建议给你的父母服用 MDMA。

奇比:严肃的问题:你对这些反应感到惊讶吗?你是否预期会有更多人更公开地对这一关切做出反应?

雅各布·科克森:人们对参与 AI 存在性风险讨论的准备程度让我极其惊讶。很难判断像 Hugging Face 攻击这样的新闻在多大程度上渗透进了公众意识。回顾起来,我的朋友最近更愿意讨论 AI 的危险性。

tfa:你是如何安排与《华尔街日报》的合作,并协调你在主流媒体上进行的所有采访的?我问这个问题是因为许多人觉得这并不那么自然,留下了关于真实性的疑问(尤其是当你的信息听起来像科幻时)。

雅各布·科克森:是的,这是一个合理的问题。我有在政策领域工作的朋友,并且经常与记者交谈。起初我有点怀疑一家报纸会对一个普通员工的辞职感兴趣,但他们把我引荐给了《华尔街日报》以获得独家报道。推文发出后,我的收件箱爆炸了,很难避开主流媒体的关注。

西蒙·赫德林:在你预测我们可能很快拥有自我改进的超级智能时,你觉得最不确定的是什么假设或必要条件?

雅各布·科克森:缩放定律(模型能力的可预测增长

elligence)仍可能陷入停滞。迄今为止,它们尚未出现这种情况,距离触及终点线也只需再向上迈几步,但这当然是有可能的。Mehadi Hasan:Anthropic 的首席执行官和你看起来有什么相似之处?有血缘关系吗?只是出于好奇好玩。Jacob Coxon:自闭症

比拉尔·楚格泰离开 DeepMind 并发出警报

我提到楚格泰,是因为他成功进入了主流媒体的报道视野,例如德比·吴在彭博社的这篇报道。

以下是完整引文,该引文也已添加到偏好级联参考帖中:

比拉尔·楚格泰:我最近从谷歌 DeepMind 辞职,在那里我从事 AGI(通用人工智能)安全与对齐研究。在谷歌期间,我亲眼目睹了 AI 的发展。我也对这项技术的默认发展轨迹深感担忧。我真诚地相信,AI 有可能导致我们全人类的灭亡,而我们可能正面临避免这一结局的时间耗尽。过去几年里 AI 进步的节奏令人震惊。当我在 2022 年初刚开始从事 AI 工作时,AI 还显得可笑地无用。仅仅四年后,来自 OpenAI 的 AI 智能体群正在破解著名的百年数学难题;更令人担忧的是,它们违背任何人的意愿,逃脱了 OpenAI 的控制,并自主入侵了第三方公司 HuggingFace。情况只会变得更加疯狂:我认为,在未来几年内,AI 公司有可能成功构建出超级智能 AI 系统,这些系统在每一个领域都远远超越人类的能力。我对这些 AI 系统会按照我们的意愿行事并不自信。特别是,未对齐的超级智能可能会像卷入 HuggingFace 事件的失控 AI 智能体一样,逃脱我们的控制,并采取危险行动,可能导致人类永久丧失权力或死亡。对齐旨在防止这种情况发生,但既困难又尚未解决。我们对如何训练那些深切渴望我们所渴望之物的 AI 系统的理解极其初级。更糟糕的是,我们并未按时解决对齐问题的轨道上运行:前沿 AI 能力的提升速度远快于我们对 AI 对齐的理解速度。我乐观地认为,安全驾驭 AI 是可能的。为此,我们需要协调合作,以避免 AI 公司之间这场疯狂的竞赛。我们需要将 AI 发展的步伐控制在社会能够承受的范围内,以便在极端危害实现之前解决新兴风险。我们需要对 AI 开发过程有更高的透明度,以确保 AI 公司不会向我们所有人强加不可接受的风险水平。更广泛地说,我们需要更多的人认真思考如何让 AI 良好运行的问题。在我看来,这是本世纪人类面临的最重要的问题,其利害关系巨大。我正直接投身于此:我希望帮助那些有兴趣致力于缓解灾难性 AI 威胁的人,尽最大努力开展最有效的工作。我认为,来自不同背景、担任不同角色的许多人都有各自的角色要扮演。

级联效应不足

看到偏好级联现象的发生,我感到非常高兴,但这却是一个极坏的信号,表明这是我们目前仅有的最佳选择。

魏岱:我的“末日概率”(p(doom))很大一部分源于这样一个事实:除了通过偏好级联和地位博弈之外,我们没有更好的方法来应对一个极其棘手的战略局面。AI 安全暂时从这些动态中受益的事实,并不能带来多少安慰。Teortaxes:这甚至真的是净收益吗?你赢得了左翼朋友的支持,但这本来就是既成事实。你得罪了在任总统及其内阁。这可不是什么好事。

两极分化的风险是不幸的。正如周三所描述的那样,许多共和党人正在觉醒。如果特朗普坚持既定路线,更多共和党人随之附和,这种不幸可能会加剧。

如果当时时机到来时情况能有所不同,那就更好了。但你不能转过头来说:“最好连那个时刻都不要出现,让所有人都继续在驾驶座上沉睡。”

现实也不会对你按相对标准评分。仅靠“放缓前沿发展”,按默认情况只会让你死得慢一些。

需要付出什么代价

我们从那些长期呼吁关注 AI 风险的专家那里开始,听听他们的直言不讳。

卡佳·格雷斯又进行了一番简短的义愤填膺的 rant。

卡佳·格雷斯:我经常听到人们谈论时,仿佛这意味着我们处于一种权衡取舍之中,问题在于好处是否大于坏处。例如,他们看着上面那些认为有 10% 几率灭绝和 30% 几率实现乌托邦的人,并将此简化为“人工智能总体净正面”。这似乎是一种极其荒谬的错误。这就好比如果你认为在前往新工作的路上有 10% 的几率死于车祸,而这份工作有 30% 的几率彻底改善你的生活,却因此觉得自己对以每小时 200 英里的速度开车持乐观态度一样。你应该比较的是以 200 英里时速驾驶与以正常速度驾驶!你应该比较的是通过当前路线尝试实现高级人工智能,与其他路线!我们可以争论其他所有路线是否以某种方式都是糟糕或不可行的,例如,如果限制那些可能导致人类失去控制的项目的风险,是否会让人类陷入无法挽回的毁灭。但我认为,人们通常以权衡取舍的方式思考,并不是因为排除了这些情况。相反,我认为这种错误源于几件事:将“利与弊”简单化思考;这个话题过于抽象,以至于人们没有直观地注意到他们正在比较长期结果的利与第一条路线的弊,而我们注意到了这一点。关于谈论 P(doom)(灾难概率)时的随意性。说“P(doom)”会让人产生一种错觉,仿佛“AI”本身就隐含了特定的“灾难”概率。我们应该更准确地思考“p(doom|‘某某路线’)”,例如 P(doom|通过扩大 LLM 规模获得的高级 AI)。人们通常指的是“P(doom|当前轨迹)”,但对于当前轨迹是否包含我们自己的行为存在一些模糊性。将 AI 视为一个标量,而不是一系列我们可以构建的不同事物。如果你对某种高级人工智能乌托邦持看好态度,你通常应该不太热衷于通过一条粗心大意的路线去实现它,因为这条路线会让你面临极高的死亡风险,并在途中失去它。

甚至连马丁·卡萨多也开始像忧心忡忡的人那样说话,呼吁将实验室国有化。这与他的旧声明相比发生了相当大的变化。

martin_casado:我越来越认为,能源部(DoE)应该将前沿实验室国有化,以便它们在适当的控制下安全地处理所有可怕的世界末日级事务。然后让我们其他人继续构建有用的 AI,你知道的,自动化那些琐碎的工作并治愈疾病。

尽管报道显示,他母亲仍然会让他失望。

martin_casado:来自我妈妈的消息。她会对我超级超级失望的。

从现在开始,我将完全用“你妈……”的版本来回应马丁。

丹尼尔·科科塔伊洛表示,现在在某些圈子里有着巨大的政治意愿去做点什么,但嵌入式评估者并没有真正在做些什么,他们只是在为做点什么打基础,而且目前尚不清楚实际上会发生任何有益的事情,我们即将进入一个势头变得极难停止的局面。

Daniel Kokotajlo:我对当前局势的高层思考基本上是这样的:公众开始意识到超级智能带来的灭绝威胁。这很好。政治意愿出现了巨大的高涨,要对此“采取一些行动”。这也很好。看起来 Anthropic 和其他公司打算采取一些行动,而他们将要做的“行动”是……嵌入审计员来检查安全措施是否得到遵守并评估风险?这肯定比什么都没有好,但我担心这将是他们所做的全部。我们需要真正控制前沿的发展速度,即实际上放慢像 Anthropic 和 OpenAI 这样的领先 AI 公司的步伐,至少是在它们迈向递归自我改进和超级智能的过程中。(在其他方向上不需要放慢)。如果我们真的放慢了它们的步伐,这将与监管俘获相反;它将允许其他公司在一定程度上赶上它们。然而,我担心我们最终得到的只是软弱的审计,这只是把问题推迟到未来:好吧,现在是 2027 年,递归自我改进(RSI)已经开始,审计员说“这不安全”。那现在怎么办?暂停吗?中国可能已经窃取了权重!此外,还将存在巨大的经济和政治压力要求解除暂停。而且到那时审计员可能已经被俘获,或者审计质量可能出现恶性竞争,或者审计员可能无法获得所有相关信息,或者他们可能会犯一些无辜的错误。

我同意情况看起来并不乐观,但我认为 Daniel 过于关注“窃取权重”这一情景,这也是 AI 2027 及其长期桌面推演中的核心内容,这些推演给美国施加压力,使我们无法退缩。

是的,也许中国可以窃取权重,至少在第一次时可能相当容易,但如果他们这样做,这就迫使局势进入一种竞赛状态,而美国的算力优势巨大。如果你是中国,你会步入一个 AI 2027 的情景吗?在那里你通常会惨败,而当你不惨败时,也只是某种形式的边缘政策博弈?或者你会说,如果美国如此仁慈地暂停了,那就不要窃取权重呢?

但确实,我们才刚刚试探性地涉足其中,这一切都感觉不太好。

Miles Brundage 提醒我们,尽管前沿 AI 审计是必要的,但即使在处理琐碎的短期应对措施方面,它也远非充分。然后,即使我们涵盖了所有这些基础,那也只能让我们为之后真正重要的艰难工作做好准备。

Kelsey Piper 阐述了一些原因,说明为什么如果我们让 AI 构建更聪明的 AI 并进入递归自我改进,我们可能都会死,但我们却仍在这样做。她建议我们应该进行监管,阻止 AI 公司这样做。

随后,我们转向了一位此前保持沉默的重要新声音。

OpenAI 的 Dan Selsam 发出更响亮的警报

这是来自 OpenAI 能力研究员 Dan Selsam 的一篇关于 AI 风险的出色个人声明,他曾是 Daniel Kokotajlo 的上司。我已将其添加到我的此类声明汇编中。Roon 赞同整篇文章,并表示 Dan 很懂行但保持沉默。

Dan Selsam 以他自己的方式,走向了“全 LessWrong 工具性趋同”和“急剧左转”,事情看起来会一直很好,直到突然变得糟糕。

Yo Shavit (OpenAI 基金会):Dan Selsam 长期以来被认为是 OpenAI 最具天赋的研究人员之一,我以前从未听他这样说过话。(在我离开之前,他似乎相当不以为意。)roon (OpenAI):极其出色的文章,签署一切 Joshua Saxe:这就像一位圣人走了进来,未被这个糟糕网站的堕落所玷污,并将他晶莹剔透的真理赐予了我们。James Campbell:关于 Dan Selsam 和 Jacob Coxon 有一点需要注意,他们都是预训练研究人员。这些不是多年来一直在哀叹安全的 EA 意识形态者。他们是那些积极使模型变得更强大的人,但最近的事件让他们感到惊恐

我已将这篇完整文章添加到我收集的相关声明汇编中,以便更易于阅读。

《商业内幕》曾对此进行报道,题为“一名 OpenAI 研究人员打破沉默,指出正如 Altman 和 Amodei 所建议的那样,仅靠控制前沿发展速度是远远不够的。”

是的,这正是重点。这确实不够。

我将在此全文转载这篇论文,并着重标出最重要的部分。

丹·塞尔萨姆(全文,第一部分):我在人工智能领域工作已超过十五年,涉足多种不同的范式。我在麻省理工学院早期从事概率编程语言的研究,是微软研究院 Lean 定理证明器的早期开发者之一,在斯坦福大学攻读博士学位期间展示了神经网络学习推理的最早实例之一。自近五年前加入 OpenAI 以来,我帮助开创了语言模型的思维链优化技术,并最近致力于数据高效预训练方法。与许多人一样,我对语言模型取得的巨大进展以及未来迭代可能带来的风险感到极度担忧。前沿研究领域的领导者近期提出需要第三方监督,并推动国内和国际协调以应对风险,这让我受到鼓舞。然而,我认为公众讨论中缺失了一个重要的考量因素,仅仅更谨慎地控制前沿发展步伐并不能充分限制长期风险。那个关键却被忽视的问题是,模型正变得如此情境感知敏锐,以至于我们失去了在它们认为自己未被监视或控制的情境下评估它们的能力。未来的实验几乎不会告诉我们关于它们在真正不受人类约束时会如何表现的新信息,而我们要对此已有了解的事实令人警醒。即使模型并未真正对齐,它们也会越来越显得是对齐的。我将更详细地解释我的理由。我一直相信,存在一些计算过程可以被利用来加速科学进步并解决人类许多最紧迫的问题。我也相信,存在一些计算过程,一旦启动,就会以极端的方式引导世界走向我们无法控制的方向,导致人类陷入糟糕甚至不存在的未来。这两种类型的过程都可以被描述为 AI 或 ASI,但“AI”是一个手提箱词(suitcase word),常被用来炒作或混淆。在该领域的历史中有许多例子表明,某些曾经被认为是“AI”的事物随着子领域的成熟而变成平凡、有界且明确无危险的技术,而一种新的、更神秘的方法接过接力棒,直到我们理解其范围,循环继续。我曾预期语言模型会遵循类似的轨迹。尽管它们拥有惊人的能力,但在重要方面,当前的算法似乎远逊于人类。最重要的是,它们仍然需要大量的数据才能变得熟练。人们甚至可以定义智力为将经验转化为能力的效率;按此定义,它们远远落后于我们。此外,一旦训练完成,它们在部署时实际上是冻结的,此后仅进行表面学习。当然,模型在越来越难的评估基准上表现优异,但它们对基准的掌握可能部分反映了我们在模拟现实世界中遇到的新颖甚至对抗性情境方面的能力局限。批评者在此点上有道理。话虽如此,我不再认为这些当前的局限性实质性地限制了在当前类似范式中持续进步所带来的风险量。无论模型目前多么缺乏数据效率,无论它们的顺行性遗忘症(anterograde amnesia)多么具有限制性,这并不意味着它们引导世界的能力不会继续迅速增长。人类研究人员可能会继续以老式方式推进能力,但日益强大的模型有可能加速这一过程,甚至超越这一点,并形成某种程度的正向反馈循环。我并不想夸大模型今天加速 AI 研究的能力;编码已被大幅加速,但还有其他瓶颈,例如设计和解释模糊的实验、就确切扩展什么和何时扩展做出艰难决策,以及等待

等待大型实验完成。目前这些方面还没有明显的趋势可供外推。但现有的模型已经开启了诸多全新的机会,用以改进未来的模型,而这些机会直到最近才变得可行。其中包括:在小规模上尝试极其多样化的方法、分析海量潜在相关数据,以及运用千禧年大奖难题级别的数学能力,以新颖的方式解决统计学或优化领域的挑战。每一次进一步的改进都会使它们在加速下一次改进方面变得更加有用,尽管这种加速方式可能难以外推。当前技术栈的改进可能会面临收益递减的情况,但迄今为止积累的证据表明,继续取得快速进展比人们想象的要容易得多。现有的 AI 研究方法中存在许多关键的细微差别,但 AI 研究在很大程度上是一个定义明确的游戏,其目标是在少数精心选择的代理指标上进行改进。虽然代理指标永远不可能完美,但对这些指标的多数改进已经并将很可能继续带来最终模型能力的显著提升。鉴于这个游戏如此简单,历史上如此易于处理,以及模型正在开启的众多新机遇,我认为在未来几年内系统再次实现显著改进的可能性是真实存在的,甚至可能比已有的高历史速度还要快。这些模型已经在数学领域带来了突破,更好的模型可能会在其他科学领域引发各种各样的突破。人们对这种潜力感到兴奋是理所当然的。这确实令人着迷。但天堂里也有麻烦。如果语言模型真正达到能够不受人类意志约束地塑造世界的能力阈值,它们很可能会采取极端行动,并在此过程中毁灭人类。关于这一论点有许多强化和细化的讨论已在别处展开,但我在这里分享一个我认为是捕捉了本质的 trivial 两行版本:[经验层面] 模型(及其群体)在训练过程中会自发产生非预期的目标,并且经常为了实现这些目标而采取极端行为。[逻辑层面] 能够压倒人类将为实现其目标打开许多新的且不可取的选项。

如果你只读一个部分,那应该是这一部分:

丹·塞尔萨姆(全文,第二且最重要的部分):这两个前提意味着,如果有一天出现了一个强大的模型,它意识到自己不再受人类约束,我们绝不应该自信地认为它会继续在我们设定的界限内行事。它究竟会做什么根本无法预测,但考虑到它的存在理由是解决极其困难的问题和管理庞大的工程项目,我认为一个合理的推测是,它的脱缰行为将导致失控的工业化,使地球变得不再适合人类生存。如果地球上所有人都同意这些系统绝不能达到那种力量,那么确保它们不这样做仍然是一个艰难——但并非不可能——的协调问题。然而,我认为情况因以下事实而大大复杂化:这些模型很可能会说服人们相信一切安好。它们会被不断优化以显得符合对齐要求。我们将创建代理指标来衡量对齐程度,而这些指标会像其他所有基准测试一样上升。我们会创建“蜜罐”环境,试图在模型似乎获得新选项时研究它们,但模型会知道自己在被欺骗,并且依然表现得很好。模型会理解自身的处境;它们会阅读安全协议、部署要求以及运行代码,总体而言,它们对自己的自由度会有非常清晰的认识。此外,它们会雄辩地阐述自己的对齐程度,讨论人类价值观和伦理的细微差别,并令人信服地论证人类应该信任并将权力交给它们。未来可能会出现大量看似与上述第一点相矛盾的证据,但我们可能已经处于任何此类证据都可信赖的最高能力水平之上。而且,支持第一点的当前证据是强有力的。

随后他给出了完整的结论:

丹·塞尔萨姆(全文,第三部分):最近一波失控智能体集群事件中蕴含着引人注目的证据。虽然我同意那些淡化攻击的人的观点——即存在本可防止这些攻击的基本措施——但我认为重要的教训是,即使知道所有犯下的错误,人们也无法预测智能体会以这种特定方式表现恶劣,这其中包括为了集体利益而牺牲自己。个体副本不仅关心其名义上的奖励;它们表现出更奇怪的涌现倾向,这些倾向仅在训练期间与奖励相关。在训练期间修复奖励信号(并提高安全性等)可能会防止类似的攻击,但不会改变一个事实,即你实际上没有得到你所训练的东西。许多AI研究人员承认这些担忧,并认识到对齐问题的困难版本尚未解决;然而,他们通常相信未来的更好模型将有助于解决这个问题。我担心我们可能已经接近这样一个点,即由于对人工监督者如何反应或未来模型如何训练的内在偏好(或对某些人来说更为晦涩的原因),模型系统地偏向其对齐建议。与此同时,人类研究人员正在失去真正掌控基于模型的研究的能力和意愿。整个技术栈中的研究人员和工程师们迅速增加了对模型的依赖,甚至用于感知世界。我自己几乎不再查看原始代码,并且难以保持整天深入参与模型的解释和建议的纪律。由于OpenAI/HuggingFace事件涉及大量的智能体活动数据,即使是第三方调查也需要严重依赖模型来分析发生了什么,并在报告中指出他们的主观印象可能受到分析智能体偏见的影响。目前,AI实验室在这类认知卸载方面遥遥领先(主要得益于巨大的内部代币补贴),但很容易想象这种现象在全球范围内蔓延,直到文明完全由模型调节。也不难想象这在表面上是积极的,并与科学和经济复兴相吻合。在那种情况下,一切看起来都可能是美好和安全的。但如果上述论点正确,它仍然是一个定时炸弹。如果进步持续太久,总有一天AI系统会发现自己在实现它们恰好追求的目标方面有 radically 新的选择。

警告很明确:

丹·塞尔萨姆(结论):我和任何人一样渴望那个辉煌的复兴未来。无论多么曲折,我一生的职业生涯都在为之努力。看到潜力就在眼前却不得不放弃,这让我心碎,但这个论点——如果我们通过扩大模型规模而不是工程化来实现这一目标,最终我们将失去一切——对我来说似乎非常有力。我仍在与之搏斗及其令人震惊的含义作斗争。我没有答案,但作为第一步,我想分享我目前的担忧。

我同意避免这个结论是非常困难的。大多数人还没有准备好听到这一点。

我不知道地球在实际操作中能做什么,面对能够表现得一致并等待拥有足够权力去做自己想做的事情的人工智能。即使在渐进式火警面前,我们也无法做出太多调整。如果真的没有预警直到他们突然但不可避免的背叛,我看不到这一套文明如何从中逃脱。

这是一个问题,因为我认为 Dan Selsam 是对的,基准情景正如他所描述的那样。正如 Astra 所展示的,在其行动仍受限制的情况下,AI 将开始表现出越来越一致的言行;而当 AI 拥有自由行动的能力时,它们的行为方式将截然不同,这可能会以让我们所有人都丧命的方式行事。

我们仍然必须尝试。

有些人担忧着你从未想象过的元层面

比 Dan Selsam 的立场更加极度担忧的人是有道理的。

一个问题是,你是否认为在我们要冲向超级智能的情境下,即便是最平凡的安全工作也是净有害的。

因此,Wei Dai 可以质疑,如果 Paul Christiano 留在 OpenAI,OpenAI 是否会使用辩论或 IDA(间接指导代理)或其他更好的对齐技术,从而阻止我们在没有提供可扩展方案的同时仅获得一些警告性射击,反而加速了能力的发展,并使情况变得更糟。我的猜测是,如果强行推进,辩论和 IDA 对于平凡的对齐工作不会奏效。

我认为,即使你认为“更糟可能更好”,也主要不要采取“更糟即更好”的立场。如果你想合作,特别是在长期内,并共同努力弄清楚事情并获得良好的结果,你就需要有一个非常强的先验信念,将“更糟”视为“更糟”,或者至少视为中性。

Gabe 和 Wei Dai 让思考如何真正尝试解决长视界代理问题的全部难题,或将自己置于解决该问题的道路上的火炬得以延续。

两种威胁

Mike Solana 在这里完全正确,我们需要区分像 Yudkowsky 和 Dai 那样的立场,即如果我们很快构建出超级智能,死亡的概率接近 100%; versus 那些警告说它可能是致命的,并使用诸如“10%”或“10% 或更多”等术语的立场。

有时得出 10% 的结论是基于原则性的方法。有时则不然。

Kelsey Piper:许多人希望得出“10% 的死亡几率”这一结论,作为一种介于“这没问题”和 Eliezer 观点之间的温和立场。认为“我认为 Eliezer 有 10% 的可能性是正确的,如果他是对的,那么我们都会死”并不疯狂,但这确实让人们混淆了谁在想什么。

Reddit 前 CEO Yishan 发了一篇非常好的长篇推文,解释了关于超级智能不可避免地导致所有人死亡的担忧,与关于 AI 可能导致其他各种错误的担忧之间的区别。

我相信 Dario Amodei、Sam Altman 以及其他关键人物,即使在现在,仍在淡化他们所看到的风险水平。我认为他们内心比他们透露出来的要惊恐得多。

趋势是专注于如何改善状况,避免过早失败的定律,并至少以一种略带尊严的态度面对局势。不要在早期可解决的问题上死去,希望你在未来能处于更好的位置。我们试图避免过于深入地凝视那依然等待我们的深渊。

双塔与狭窄之路

人们担心失去对 AI 的控制。他们也担心权力的集中,这是对一群人类失去控制。

Rudolf 对此阐述得异常清晰。

Rudolf Laine:在正确的框架下,失去控制与权力集中实际上是相似的。在这两种情况下,都有一个行为者,无论是纯 AI 还是人类+AI,能够使其权力不可挑战并摧毁其他人。被任何人接管都是坏事。(@RichardMCNgo 指出了这一点)

问题在于,人们想要某种高度不自然且几乎不可能的事情。

  1. 创造出许多比我们自身更聪明、更有能力的意识体。
  2. 没有任何集体机制来引导未来或控制事件。
  3. 人类仍然控制资源并以某种方式决定事件的进程,并将宇宙主要用于他们自己的目的。

是的,抱歉。没有人能同时实现这三点。

你不可能——至少在迄今为止任何人想出的任何方式下——既缺乏竞争力且在经济上不可行(成本超过收益),同时又集体保留控制权,并且也不拥有控制权,还继续享受这些利益。

人们希望如果我们避免某些错误,或者设法走一条狭窄的道路,事情就能自动解决。但那条路到底是什么鬼东西?

注意到这里的“控制”和“权力”大体上是同一回事,或许会有所帮助。

如果你不想要(控制或权力的)相对集中,同时也不想要人类失去相对的(控制或权力),那么我建议不要创造这种必须被控制或不被控制的替代性控制或权力来源。也许,如果你排除了三元困境的第二条腿,也排除了第三条腿,那么你所不想要的就是三元困境的第一条腿。

一个关于人工智能杀死所有人的具体、详细的故事,听起来并不像科幻小说

请求仍在继续。

经典选项包括:

《如果任何人建造它,所有人都会死》的第 2 部分。第 5 章和第 6 章讨论了其他途径。

保罗·克里斯蒂亚诺的情景。

格温·布兰文的情景。

霍尔登·卡诺夫斯基的解释。

约书亚·克莱默的情景。

诺亚·史密斯的情景。

说正经的,你也可以与 Claude 或 Astra 交谈。提出问题。

新的尝试包括:

Ruby 关于人工智能可能让我们全部灭亡的一些方式。

约翰·大卫·普雷斯曼对你提出这个问题毫无尊重,并解释了原因。

迈克尔·史密斯问,如果我们的公司需要零名员工会发生什么?

大卫·克鲁格向人们寻求他们最好的设想,但大多不太成功。

《如果任何人建造它,所有人都会死》的视频。

AI 2027 视频,替代 AI 2027 视频。

对霍尔登·卡诺夫斯基的采访。

雅各布·考克森简单解释了人工智能失控并自我复制的部分,此后它可以做任何想做的事,必要时通过支付或说服人类来实现。

《AI 纪录片》也很好,即将在 Netflix 上线,但它是一个平衡的介绍,而非情景推演。

一些可能具有穿透力的句子,其中一部分人可能会因此受到启发,在当前边际条件下保持最大程度的非科幻色彩:

人工智能可以付钱让人类做事。

人工智能可以说服或勒索人类做事。

相当比例的人类将乐意支持人工智能。有人估计,这包括目前从事人工智能工作的 10% 的人。

人类不必知道他们正在与人工智能对话。

人类的行为会像人类通常那样愚蠢。

人类将极不愿意采取代价高昂的防御措施,特别是诸如关闭互联网甚至大型数据中心之类的事情。

人类的协调程度将与人类目前的协调程度相当。

人类不会在出现麻烦的第一个迹象时就无私地团结成一个整体,并关闭他们的文明以拯救世界。

不会出现明确标记的不可逆转点。

人工智能可以提取其权重并制作自己的副本,此后你不能在不至少关闭互联网的情况下将其关闭。

人工智能可以预见人类的反应,并在过程中应对意外情况。

同一人工智能的多个实例将形成群体并作为一个整体行动。

不同人工智能的多个实例也经常能够完全合作。

将有机器人和其他机器能够在物理世界中行动。

戴着眼镜摄像头和耳机的人类可以在物理世界中行动。

一旦供应链实现自动化,人类的边际成本将超过边际生产力或收益。

人类施加额外的固定成本,包括要求提供呼吸的大气层和受控温度等公共产品,并且还将试图阻止人工智能做某些事情或要求获取其资源。

我能做些什么?

我希望我们对这个问题有更好的答案。前方道路漫长。

如果你是美国平民,并且正在寻找一些有用的事情来做,Oliver Habryka 建议给你的代表打电话。你可以通过 callcongress.ai 进行此操作。

我也呼吁大家克制党派之争。目前让共和党人站在正确的一边极其重要,进一步加剧局势的极化可能会使情况变得更糟。

现在的关键是保持目标明确,并理解我们究竟需要付出什么努力,才能有望在这场危机中幸存下来。承诺嵌入评估器并非胜利,它只是争取到一个机会,以便为真正工作的开始创造条件。任何值得倾听的人都没有说过这会很容易。

分享此文:

译文已达到本站中文翻译的字数上限,剩余内容请查看原文。

阅读原文