精选Cohere Blog观点
谁来为 AI 制定规则?
作者主张:不应让少数硅谷市场主导型 AI 公司替全世界定义这项代际技术的规则与安全标准,同时决定其发展速度。论据是历史先例——1975 年 SEC 指定三家评级机构且不公开准入标准,二十五年后仍是三家,最终给次贷 AAA 评级几乎拖垮全球经济;1985 年欧洲汽车业以安全为由获得反垄断豁免,结果只是保护了在位者,欧盟花了约二十五年才拆解。作者认为 AI 需要护栏没有争议,争议在于谁来写、谁参与、保护谁的利益。
标题:谁有权为人工智能制定规则?
人工智能正在重塑我们生活的世界。在一代人的时间内,我们研发药物、管理电网、保护国家基础设施的方式将被彻底改变。许多人已经意识到这一点,并正在努力以负责任的方式建设那个未来。许多人低估了即将到来的变革的规模和速度。然而,有些人声称预见了这种变革,并利用它来服务于自己的目的。
有一个问题没有人足够清楚地提出:一小撮来自硅谷的、精选的、主导市场的人工智能公司,是否应该为全世界定义一项划时代技术的规则和安全标准?同时还要由它们来决定这项技术发展的速度?我们以前尝试过这种做法,结果非常糟糕。这些寡头企业再次以保护公众为借口,利用恐惧,要求放宽竞争规则,并被允许为其他所有人规定条件。披着羊皮的狼,换了个名字的卡特尔。
我相信人工智能技术有潜力为我们的世界带来益处,我也不会淡化风险。我经营一家公司,构建部署在银行、电信网络和国防部内部的人工智能系统。这些属于最高风险的环境,因为这些领域的失败可能产生远超单个用户的后果——大规模地扰乱金融系统、关键基础设施、国家安全和基本服务。那些能在你的代码中发现漏洞的能力,也能在别人的代码中发现漏洞,而网络攻击的成本下降速度快于防御能力的提升速度。这个差距应该让你和我们一样担忧。
人工智能需要护栏。这不是争议所在,从来都不是。争议在于谁来编写这些护栏,谁能参与其中,以及这些规则在保护谁的利益。问题的实质是:我们是否应该拥有基于科学证据做出选择的自由,还是应该把人类存在中最具影响力技术的缰绳交给少数几位硅谷高管。
我们以前来过这里
在我拆解大型实验室正在推行的自私框架并提出替代方案之前,让我们从近期的历史中汲取几个教训,并思考一下“卡特尔”这个词,因为这段历史是具体的,而这个术语是准确的。
1975年,美国证券交易委员会需要可靠的债券评级来支撑其资本规则。它指定了三家公司为“全国认可的统计评级机构”,却从未公布任何其他公司如何获得这一认定的标准。这些是政府认可的外部评估者,由它们所评级的证券的发行方支付报酬,坐在监管机构自己建造的壁垒后面。二十五年后,这样的评估者仍然只有三家。然后它们将次级抵押证券评为AAA级,几乎把全球经济拖垮。
欧洲在1985年又做了一次实验。汽车制造商游说争取一项全面的反垄断豁免——《机动车集体豁免条例》,理由是现代汽车是复杂的安全关键型机器,因此制造商需要对谁有资格销售和维修它们拥有控制权。随后的法规允许制造商制定场所、设备和员工培训的标准,明确以安全和可靠车辆的利益为名。但随之而来的并不是更安全的汽车。欧盟委员会花了大约二十五年的改革才将其解除,并确立了从一开始就应该显而易见的事情:你完全可以在不把满足标准的垄断权交给现有企业的前提下,维持严格的安全标准。
这两种情况都不是有人刻意要建立卡特尔。两次的公开目标都是安全。但结果却是一种保护在位者、限制竞争的市场结构,而这一切都打着服务公共利益的旗号。我不怀疑参与者的真诚:许多人确实担忧风险,并认真努力去解决。但复杂问题并不总能一次解决,任何负责任的科学家、工程师或立法者都知道,要解决新问题,就必须从历史中学习。
正在被提议的东西
这就引出了Anthropic CEO Dario Amodei本周发布的路线图,他以安全为名请求政府给予反垄断豁免。这份路线图是硅谷在位者近期一系列塑造AI监管格局努力中的最新一例。
我想明确我们认同什么。对高能力AI系统进行独立审查是个好主意,我们支持这一点。然而,该提案的许多方面引发了根本性问题:审查者所适用的标准由谁制定?审查由谁执行或监督?谁有权参与制定规则的对话?
在这些问题上,提案说得很清楚。少数几个位于同一个国家的最强大实验室将就共同标准以及技术推进速度的限制达成一致。而关键在于:由于竞争者通常不能合法地约定限制产量,该计划请求政府给予一项狭窄的反垄断豁免,使这种协调合法化。它还要求政府强制所有其他AI开发者盲目遵循参与者所确定的任何规则——尽管那些其他开发者和更广泛的社会既没有机会表达其影响,也没有机会分享他们对相关科学的看法。
这不是在对话中再增加一两家公司的问题。多加一把椅子从根本上解决不了问题。问题在于,竟然存在这样一份名单,而正在做出的决定却会影响到每一家公司、每一个政府,以及每一个从未被征询意见的公民。你不能两头都占。如果这是人类历史上最具后果的技术,那么它的规则就不能由一小群商业利益一致的公司在一项反垄断豁免的庇护下制定。这里没有公众评论期。没有协商,也没有投票。公众将被迫接受结果,无论愿意与否。
由少数实验室设计的安全制度,只会对他们已经建立起安全系统来评估的风险保持严格,而对其他一切完全沉默,从而进一步巩固其市场地位并限制竞争。在这些现有框架中,风险被定义为规模的函数,这使得拥有庞大系统的公司成为唯一有资格评判者。被认为适合评估的风险类型也是预先规定的,而不是留待科学辩论和校准。例如,该领域对于攻击性能力究竟在多大程度上来自原始模型规模,还是来自包裹其外的框架,存在真实分歧。较小的模型如果编排得当,使用工具和验证步骤,可以做到大模型做不到的事情。网络蜂群与单一模型是完全不同的风险面。而这一切都不会出现在一个完全围绕大规模算力阈值构建的制度中。
这篇文章中有一句话会让任何竞争主管机构感到不安。它承诺,协调一致的做法将让开发者有时间完成这项安全工作,而不必牺牲商业优势。但这是对谁的优势?起草这一框架的公司,正是如今坐在市场顶端的公司。一个在明确保留现有商业优势的同时让所有人放慢脚步的机制,并不会让AI更安全。它有可能把当今占主导地位的AI公司的现有优势变成安全竞争所需的最低门槛,从而固化这些公司的主导地位。安全规则应当降低风险,而不应考虑谁主导市场,或谁能从这些规则中获益。
提案中列出的准入门槛说明了其余一切。庞大的算力。持续监控基础设施。专门的安全组织。拥有工位和证件的常驻评估团队。关停架构。深到足以驾驭这一切的政府关系。一个已经小得惊人的“独立”评估者群体,而资助他们的,正是同一前沿实验室反复依赖的那少数几家组织。
让政府相信AI是一种生存性威胁,你就能让政府把你的竞争对手定为非法。其意图显而易见,而且它并不会创造一个更安全的世界。
更好的规则应该是什么样
那么,什么才能促成安全、负责任的AI发展?需要明确的是,我并不认为自己掌握所有答案——也不认为应该由我来制定规则。相反,我会尝试提出一些切实有效的想法,供政府和立法者在运用其民主权力确定前进方向时,与许多其他人的想法一并考虑。
- 基于证据的风险框架。首先,在任何强制测试或审计之前,我们需要一份达成共识并公之于众的说明,阐明我们关注哪些危害、哪些AI能力会导致哪些危害、在何种条件和情境下发生,以及政府应在何时介入。这份说明必须由所有正在开发这项技术的国家共同构建,并且公开进行,而不是以国家安全为名闭门造车。应建立一项协调的国际努力来制定这一框架,不由任何单一国家主导,而是由一组国家共同领导。让技术专家与政策专家以及金融和关键基础设施等关键领域的专家同处一室。纳入彼此存在分歧的研究人员和科学家,并公开这些分歧,因为一个诚实的过程会展示其论证而非直接宣布结论。通过公共研究机构和现有的行业风险管理系统来资助测试能力本身,使科学不依赖于被评估公司的预算。并制定基于AI系统能做什么而非由谁构建的具有约束力的规则,这样无论危险能力来自万亿美元的实验室还是大学院系,都应被同等对待。AI相关风险的科学不能也不应与企业和政府关于如何使用和部署AI的决策相分离,也不能与当今治理医疗、全球金融系统、国防和关键基础设施等关键领域的现有健全风险管理系统相分离。
- 强制性透明度。AI开发者应透明地披露其模型和系统是如何构建的、预期用途和能力、可能构成的风险,以及已实施的风险缓解措施。模型卡已在全行业广泛发布,适用于大规模部署的生成式AI模型,涵盖运行了哪些测试以及模型表现如何。但还有更多可以做的工作,特别是在开发和部署链条中各公司如何在其具有可见性和控制力的层面上报告严重事件,以及在真正造成伤害时追究真正责任的机制方面。
- 以证据为范围的测试。最先进的AI模型和系统应接受独立测试,但仅针对风险框架已确定为真正危险的能力和在相应情境下进行,而不是将这一界定权留给少数几家公司。在实践中,这很可能意味着测试生成网络攻击、合成欺诈和语音克隆、大规模操纵、物理或生化武器,以及任何涉及关键基础设施的能力。这并不意味着对每个系统测试每一种风险,也绝不能变成一种合规演练——不断膨胀以耗尽大型企业所能承受的任何预算。一个分层且成比例的框架——其中能力更强的模型和系统,或在特定情境中部署的模型或系统,面临更严格的测试,无论投入了多少开发资源——将对提升安全性发挥最大作用。测试那些可能伤害人和社会的方面,让证据决定什么需要测试,而不是由谁掌握话语权来决定。认证必须对每家公司开放,而不是仅限于被指定的某一层级AI开发者,标准必须由被评估公司以外的人共同商定。不能允许它变成一种昂贵的官僚体制,在小型实验室尚未发布任何产品之前就将其扼杀——当范围无限且由现有巨头来设定时,这恰恰就是会发生的事情。
- 真正的保证机制。决定AI模型和系统如何被测试的参数以及验证这些测试的机制必须真正独立,类似于金融机构获得许可、航空公司维护
严格的安全标准,核设施接受检查。这类高风险行业已经依赖于多层保障:开发者测试自己的系统,客户根据自身的风险要求对其进行验证,独立第三方在必要时提供额外保障,监管者则监督整个框架。AI应当建立在这些经过实践检验的方法之上,而不是声称史无前例的例外论,并假设安全依赖于某一类永久嵌入的评估者。保障机制在三个条件成立时才有效:第一,测试与验证基于集体制定并公开发布的标准;第二,任何参与的第三方必须获得授权以纳入多元意见,且绝不能由其所审查的一方支付报酬;第三,审查结果必须以某种不存在利益冲突的方式传达给公众。最重要的是保持灵活性,根据审计的关键程度以及专业知识和资源的最有效利用,判断哪些保障工作最适合以严格标准在内部完成,哪些需要第三方参与。这与已经提出的方案形成直接对比:那种保障体系所依赖的审计者不仅与被审计对象存在财务或意识形态上的利益冲突,而且是由被审计对象亲手挑选的。建议让少数主导公司青睐的审计者持续接触整个行业,这条道路通向的是监管俘获和意识形态俘获,而不是安全或信任。
恐慌所遗漏的
这些支柱构成了务实的、基于风险的方法的基础。现在把它与那些最大在位者目前正在武器化的科幻场景比较一下。
我认为在这里谈论科学极其重要。聪明人正在做出大量逻辑跳跃和结论。但重要的是,与其挥手带过,我们应当讨论这些是什么,以及它们意味着什么。
本周早些时候,一位研究员从一家大型实验室辞职,并大声警告说,超级智能系统可能会在十年内消灭人类。一位资深同事公开附和说,他认为概率高于百分之十。我不怀疑他们的担忧是善意且真诚的。但让我们记住,那些数字并非来自任何根本现实。它们是直觉、感觉,用小数表达出来,被有既得利益的高管放大,并被媒体当作数学分析报道了一周。
值得精确说明真正令人担忧的是什么:随着这些系统变得更有能力,我们所要求的东西与我们实际得到的东西之间的差距变得更难被注意到,而一旦错过,代价也更高。一个更擅长寻找漏洞的系统,也更擅长找到我们从未想过要检查的漏洞。给它能在世界中行动的工具,再给它一种快过我们审查其工作能力的改进速度,你就可以想象,问题会在早已无关紧要之后才被发现,而不是一开始就被拦住。
然而,声称这类问题意味着这些工具已不受我们控制,是一种判断,而不是一项发现。
但这个区别正是科学与科幻之间的全部差异,而它决定我们接下来应该做什么。这类开放问题,正是公开的、有争议的、基于证据的过程应当用来解决的事情。对于开放问题,你绝不应该做的是,把撰写有约束力规则并强加给其他所有人的权力,交给持有某一种特定观点的人。
我们在七月看到报道的失败,发生在世界上资源最充足的 two 家实验室内部,它们拥有最大的安全团队、最多的内部审查,而且在其中一个案例中,早在二月就已经通过 METR 以相当大的努力建立起了外部评估安排。拟议的补救措施或多或少就是它出事时已经存在的东西。能力阈值不会抓住它,因为那些系统当时正被积极训练和评估,以衡量其能力。算力限制也许会拖慢智能体,但不会降低它们的能力。失败的是指令的质量、测试周围围墙的强度,以及智能体被允许在无人观察的情况下继续工作多久。该提案没有解决其中任何一项。
真正有帮助的做法要平淡得多。要求严重事件必须上报,这样一家公司有缺陷的训练设置就会成为整个领域的教训,而不是博客文章里的一段话。针对已知会被利用的具体缺口测试系统。确保有测试时可观测性(或至少是日志记录)的标准,以保证不良行为能更早被发现。坚持要求任何接入关键基础设施的东西,从医院到变电站,都必须被隔离,最好是在本地部署,这样,一个追逐写得糟糕的评分标准的系统就无法触及任何重要事物。并且根据系统部署在哪里、能接触什么来适用这一切,而不是根据构建它的公司有多大。一个规格写得糟糕的小模型放在医院里,今天就是现实风险,而在只监管前沿模型的制度下,甚至没有人会看它一眼。
当服务于大型科技公司利益的叙事将此类事件拿来大做文章,把公众注意力集中在那些可能人类灭绝的、超级强大且无法控制的技术上时,它恰好分散了我们对这些公司正在做出的选择和犯下的错误的关注,以及对真实的人们当下正在遭受的伤害的关注。例如,比电话费还便宜的语音克隆工具可以在几分钟内清空一位养老金领取者的账户。同样,自动化决策系统可以对人们获得基本服务产生切实影响。我们需要一套为这些现实而建立的安全制度,解决当下直接影响公民和组织的问题,而不是一套为遏制假想中的超级智能而设计的制度。
谁来制定规则?
我们正处于一个转折点,未来几个月做出的决定将塑造整整一代人的全球经济。风险是真实的,它们需要严肃、可执行的保障措施。这正是为什么规则不能由那些本应被规则约束的公司在豁免权背后起草。两三家硅谷公司应该为地球上每一个政府充当AI的创造者、守门人和规则制定者——这个想法一经说出口就站不住脚。
关键基础设施不能通过从外国垄断者那里以封闭接口租用国家能力来保障安全。医院、支付网络和国防部门不能昧着良心将他们最敏感的运营数据和专有知识输送到别人的服务器上,然后盲目信任一纸供应商合同来守住底线。助长数据泄露的漏洞如今已经在被利用了。
我们创建Cohere正是因为这一现实。作为一家与世界各地政府密切合作的全球性企业,我们看到了维持这些经济体运转的机构真正需要什么。他们想要在自己的防火墙内运行的高能力系统,运行在他们自己控制的基础设施上,由对他们负责且可以被替换的供应商提供。安全来自主权、本地部署和技术多样性。一个拥有众多有能力的供应商的竞争性市场可以吸收其中一家的失败。一个国家认可的卡特尔则无处藏匿失败。
围绕AI的规则无论如何都在被书写。仍然悬而未决的是:它们是由一个任何人都能加入、证据任何人都能核查的群体来写,还是由一小撮公司在关起门的房间里来写。更多声音会让过程更慢。会让过程更难。其中一些声音会说我们其他人不想听的话。这正是重点。这是唯一能产生公众有理由信任的规则手册的版本。
一个值得拥有的过程应该包括那些甚至会做出不利于Cohere这类公司的裁决的人。没有商业利益的学者。认为这个行业中所有人都走得太快的公民社会团体。更小的实验室和开源开发者。有自己理由不轻信我们说法的政府。如果我们认同这项技术正在重塑我们生活的世界,那么一小撮CEO和他们付钱供养的团体就不能替所有人决定这项技术如何演进。我们需要更多声音参与其中。
你可以谈论安全、放慢脚步以确保进步是可持续的,以及需要其他人介入来确保你负责任地行事。或者你可以直接去做:以对社会可持续的速度负责任地建设,为你的合作伙伴实现主权,与立法者和安全专家合作并倾听他们的意见。在Cohere,我们选择后者。
译文已达到本站中文翻译的字数上限,剩余内容请查看原文。