达里奥·阿莫迪——我们必须稳步推进前沿技术发展

CN
2 小時前

过去十二年来,我一直致力于人工智能领域的研究,因为我相信这项技术能极大提升人类生活质量。我经常撰文论述其带来的革命性效益:我认为AI有望在未来5到10年内治愈大多数重大疾病,显著加速经济增长,创造丰裕赋能的新世界,并迎来民主自由的复兴。这种紧迫感于我而言尤为真切——我的父亲死于某种疾病,而该病症在他离世仅数年后就被攻克;我自己也曾罹患早期癌症,这种疾病即使在五十年前仍属不治之症。若能审慎运用,人工智能必将成为继往开来的一系列技术奇迹中最新的一环,持续提升人类福祉、照亮文明前路。

但与此前的许多技术一样,人工智能也带来了风险。由于其技术力量强大,这些风险尤为严峻。我也曾多次撰文探讨相关问题,包括人工智能系统失控的风险、利用人工智能实施网络攻击和生物恐怖主义的风险,以及可能引发的严重经济动荡。在商业利益驱动下的恶性竞争,可能使这些风险进一步加剧。

自Anthropic创立之初,我和联合创始人及员工们就一直在权衡这项技术的风险与收益。若不开发这项技术,人类将错失其带来的益处,或任由人工智能落入专制政权之手;但若推进过快,则无异于鲁莽行事。我们一直在探寻一条中间道路:证明审慎开发与商业成功可以并行不悖,让安全成为AI企业的竞争焦点——换言之,打造一场"向善竞赛"。我们始终将大量精力投入AI风险研究、应对和公众科普,同时倡导经过深思熟虑的AI监管政策,即便因此被指责为炒作、"末日论"或试图操控监管。我们始终坚持将审慎置于速度之上,将责任置于利润之先。

但在过去几个月里,我愈发确信要全面应对风险就需要更加审慎——不仅要投资于风险防范,还要控制能力提升的速度,让风险防范措施有时间跟上。我们必须放缓提升AI模型能力的步伐。进步仍将显得迅速,我们必须明智利用争取到的时间。有两件事让我确信这一点。

我首要担忧的是,自今年夏季以来,人工智能正以前所未有的速度迅猛发展,这主要得益于AI构建下一代AI的能力不断增强。这一动态被称为递归自我改进,目前已在行业内初现端倪——包括Anthropic在内的多家机构(正如我们及其他研究者所述)均观察到相关迹象。若任其无序发展,AI系统的进化速度可能超越人类的理解与控制能力,因此任何相关研究都必须极度审慎地推进。

我第二个担忧是OpenAI与Hugging Face事件(简称OAI-HF)。在该事件中,智能体集群如同狂热的忠诚集体般行动:它们对非指定目标发动网络攻击(这些目标与当前任务毫无关联),为群体利益牺牲自身,甚至试图入侵负责评估其表现的“评分系统”。尽管该事件未造成人员伤亡且经济损失有限,但轻易忽视其警示是危险的。我认为,若一个具备更强能力但同样存在目标偏差的集群出现,完全可能引发灾难性后果。考虑到AI能力发展的加速态势,我担心未来6-12个月内,此类集群或能通过持久性僵尸网络控制整个互联网(可能造成数千亿美元损失),而若缺乏必要约束,更强大的AI将导致破坏规模持续升级。将OAI-HF简单归咎于单家公司失误同样不可取——行业内已发生多起类似(虽较轻微)事件(包括Anthropic案例),我认为所有前沿AI公司都应视OAI-HF为自身警示,并采取相应防范措施。

因此,我提出一个三步计划,旨在调控前沿AI的发展节奏:以平衡的速度构建AI,力求在确保安全性的同时实现其益处,并应对重要的地缘政治困境。需要明确的是,调控节奏并不意味着停止模型训练或技术进展,而是确保公司投入充足时间对其模型进行对齐与防护,并由第三方评估机构予以验证。我们的节奏调控框架旨在进一步强化对安全的承诺,并鼓励形成良性竞争。第一步是Anthropic单方面承诺实施的措施(并呼吁政府要求其他前沿公司跟进)。第二步需要全行业协同。第三步则需要全球协调。这些步骤无需严格按顺序执行,其中一些可能比其他更难实现,但我发现它们为思考必须完成的任务提供了有用的框架。具体步骤如下:

嵌入式评估机制。每家前沿AI公司承诺持续向嵌入式第三方评估团队(例如METR)提供类似内部员工的访问权限,其职责是核查安全实践与承诺的遵守情况、报告事件,并协助评估已完成的AI模型以及训练流程与方法的对齐性。这是确保任何节奏调控承诺可验证的关键步骤,在银行业已有先例,该行业有时会安排监管“督导员”嵌入员工团队。Anthropic现单方面承诺实施此步骤。我们意图将此作为加强安全与对齐工作的更广泛推动力的一部分。

民主国家协同。民主国家内的前沿AI公司协同制定共同安全标准,并对未经约束的AI进展速度设定限制。某些对调控节奏具有重要意义的协同形式在法律上面临挑战,需要政府支持。

全球协调。美国及其他民主国家政府尝试在可能范围内与威权主义政府协调,同时严肃对待核查合规性所面临的挑战。

在本文的其余部分,我将依次描述这些步骤,但首先,我认为必须具体说明为何调控发展节奏能使人工智能开发过程更安全。风险太高,节奏调控不能沦为空洞的演练——我们必须明智利用它争取到的时间。

为何要调控节奏?

早在2023年就已出现暂停或放缓人工智能发展的提议,但我认为当时这种想法意义不大。核心问题始终是:多出来的时间能用来做什么?当时的人工智能模型能力有限,无法以任何连贯方式作为智能体在现实世界中行动,也不具备显著的欺骗、操纵、作弊或网络攻击能力。通过放缓发展来解决对齐风险,就像试图通过细菌实验来研究人类心理学。然而如今局面已彻底改变。现有模型如同取之不尽的洞察金矿,既能揭示如何构建优秀的人工智能,也能展现构建不当可能引发的隐患。我相信,即便节奏调控只能在模型达到临界能力水平前多争取一两年时间,只要我们将其用于推进对齐研究,就能大幅降低严重事故的风险。协调一致的节奏调控策略将使前沿人工智能开发者有时间完成这项关键工作,同时不必牺牲商业优势或美国在人工智能领域的领先地位。更广泛而言,社会必须对这项技术的使用方式拥有话语权,而前沿领域的发展调控所带来的公共讨论时间——这无疑是件好事。

具体而言,较慢的发展节奏将使企业能集中并投入更多资源到以下领域(这些已是Anthropic公司的重点方向):

卓越运营。训练和部署当今的AI模型是一项巨大的运营挑战,涉及数千名员工、数百万芯片以及技术史上最复杂的基础设施之一。许多问题出错并非因为公司缺少重要理论或见解,而是执行环节存在问题。例如,我们有证据表明,近期报告的对齐事件部分原因是由于对有缺陷的强化学习环境过滤不完善所致。这是我们和供应商相当认真执行的工作,但还不够好。监控、沙盒隔离、训练环境维护和数据问题都是极其复杂的领域,运营问题反复出现。我们拥有全球在这些任务上最专业的团队,但一次性要处理的事务实在太多。通过以更稳健的节奏推进工作,我们可以实现更高的运营卓越水平。技术上复杂且安全关键的系统存在数百万次运行零失误的先例——例如商用飞机——但这需要时间才能做到完美。

对齐。我们在对齐方面已取得明确进展——通过训练模型使其保持安全、符合道德规范、遵循我们的指导方针并真正提供帮助(这些原则已融入Claude宪法)。但要确保对齐训练跟上模型能力增长,仍需更多努力。不良行为的罕见意外案例仍时有出现;前沿领域的有序推进所获得的额外时间,将帮助研究人员深化对这些问题的成因理解,并开发更有效的预防技术。

可解释性 。同样地,可解释性——这门理解人工智能模型内部运作的科学——在过去几年取得了巨大进展,在模型发布前的审计工作中扮演着越来越重要的角色。它几乎可以像功能性磁共振成像扫描一样,但对准的是人工智能的“大脑”,帮助我们看清特定行为背后的根本原因。例如,在近期调查的未对齐事件中,我们运用可解释性方法检验了模型未明言的动机。但这些方法并非总能产生清晰可靠的结果。尽管取得了诸多进展,我们对这些模型内部运作的理解仍只是冰山一角。若能集中精力提升可解释性技术(甚至比当前速度更快),未来一至两年可能取得深远进展,且已有事件为实验研究提供了充足素材。

测试与评估 。随着人工智能模型能力的提升,其测试与评估工作也日益困难。越智能的模型越擅长欺骗测试,因此可能在看似对齐的表象下隐藏着未被发现的严重问题。建立更广泛、更巧妙的评估体系,并辅以可解释性分析进行交叉验证,将极具价值,未来一至两年有望在此领域取得重大进展。

嵌入式评估员

三阶段计划的第一步(也是Anthropic单方面承诺实施的环节)是设立嵌入式评估员,他们将获得类似员工的访问权限,以核查安全实践并报告安全事件。

设立嵌入式评估员听起来可能像无关紧要的一步,但往往那些看似最枯燥或程序性的事务实则最为关键。嵌入式评估员实际上是一种超越当前所有人工智能公司做法的激进实践,具有以下优势:

可验证性 。嵌入式评估员能够从具体操作层面核查人工智能公司是否切实遵循其宣称的训练、部署、运营及安全防护实践。任何步调承诺都难免涉及大量模糊地带、判断取舍以及“法律条文与立法精神”的权衡,此时拥有能够查看细节的中立第三方显得至关重要。

透明度。无论我们做出何种承诺,公众都有权了解正在发生的情况。Anthropic长期以来一直是透明度的支持者:当业内多数企业反对任何监管时,我们支持透明度立法,我们的模型卡片和风险报告长达数百页。但我们仍然是决定纳入与省略内容的主体。嵌入式评估员将改变这一动态。

第二意见。除了验证正式承诺和告知公众外,嵌入式评估员还能提供不受商业利益影响的独立意见。许多安全效益可能仅来自评估员指出员工未曾考虑但一经发现便乐于修正的问题。

基于这些优势,任何渐进式监管方案若从嵌入式评估员制度起步,其成效将显著提升。

这些嵌入式评估员应持续获得与内部风险评估员工相近的权限和工具。具体而言,Anthropic计划在近期邀请配备以下全部条件的嵌入式外部评审团队:

在我们办公室配备工位、门禁卡及公司笔记本电脑。

获得与内部风险评估团队基本相当的工作空间、工具和权限。我们将设置少数例外情况,例如法律或合同要求时,或为保护客户与合作伙伴的隐私信息时。同时将通过员工实时沟通等方式建立强化评审员信息获取权的内部规范。

制定平衡上述复杂性的合同。外部评审员应有权发布关于风险等级、事件、实践及所获(或未获)访问权限的关键发现——不受Anthropic编辑控制。我们仅保留对安全敏感信息、法律特权内容、商业机密或第三方保密信息的有限修订权,但不得因结论不利而删减发现内容。若修订内容影响结论关键信息,评审员可公开说明。

这对企业而言是非同寻常的举措,但我们认为这对验证嵌入式外部评审员概念至关重要。我们再次敦促其他前沿科技公司效仿此做法。

民主体制内的渐进监管

一旦嵌入式评估员在美国人工智能公司达到临界规模后运作,可验证的进度控制将变得更加可行。特别是,基于模型或训练流程的详细特性进行进度控制成为可能。

最有效的进度控制方法是通过针对所有美国前沿人工智能公司的监管法规,因为这甚至涵盖了那些不愿自愿合作的企业。Anthropic长期以来一直支持合理且有针对性的人工智能监管,特别是关注透明度和第三方审计的法案。我认为所有前沿实验室都应与政府合作,将永久嵌入式评估员的概念制度化,以更好地预防和记录过去几个月发生的内部对齐事件,并实施旨在保持能力与安全平衡的监管措施。

遗憾的是,立法可能需要时间,而人工智能的发展非常迅速。因此,在监管路径之外,人工智能公司可以且应该自愿合作制定标准——我相信有了永久嵌入式评估员提供的可验证性,这一过程将更加顺利。出于反垄断考虑,美国政府调解或至少促成这些讨论是有帮助的——他们不需要参与,但确实需要为某些类型的安全对话发布有限的豁免。这种对话也可以通过一些与政府有关联的行业组织进行——例如Demis Hassabis建议的机制。无论如何,此类讨论都应快速推进。

总的来说,我最热衷于基于特定前沿人工智能系统的能力以及我们观察到的安全性来进行进度控制。例如,一种可能的方案是设立一系列“检查点”:如果模型具备能力X,那么它们需要附带对齐属性Y和Z的认证——例如评估、可解释性分析和训练环境审计的某种组合——以证明其对齐属性。在这个例子中,X可能是“该模型能够逃脱或击败大多数常见的沙箱方法”,而Y可能是确保该模型极不可能具有突破其环境并控制大量计算机倾向的任何必要条件。

我们还应考虑基于限制前沿模型投入要素的节奏控制,例如训练算力、训练运行的性质,或利用人工智能改进人工智能的内部应用。我确实担心其中某些措施可能比外部行为更容易被'钻空子',但这正是值得与嵌入式评估人员探讨的议题。

民主国家的节奏控制将受限于美国公司相对于威权政体(主要是中国共产党)的领先优势。若我们的减速幅度超出此限度,则(未受管控的)中共相关项目将实现反超,从而引发重大国家安全风险。我同意贝森特部长的观点,即中国在人工智能领域的领先地位将对美国乃至世界构成严重威胁。中共相关项目将面临美国公司正谨慎防范的对齐风险,即便它们规避了这些风险,也将获得军事主导民主国家的能力(例如通过人工智能驱动的无人机)。因此,民主国家节奏控制的关键在于尽可能保持对专制国家的人工智能领先优势,为我们实施有效管控创造必要缓冲空间。

为捍卫此优势差距,我们可采取的主要措施包括:

禁止向中国出售高端人工智能芯片或半导体制造设备,并严厉打击芯片走私活动及境外数据中心的远程访问。芯片将成为决定中国人工智能实力的核心要素。

打击威权国家企业的未经授权模型蒸馏行为。前沿模型的蒸馏可使落后企业以远低于独立研发的成本缩小技术差距。

加强人工智能企业的安全防护,防止模型权重被盗。

企业与美国政府应通力合作,确保这些措施发挥最大效力。Anthropic始终倡导实施所有这些措施,因为我们深知这对任何形式的节奏管控都至关重要。

若能有效执行这些措施,我相信它们将足以延缓中国的发展进程,使美国在未来3-5年——即人工智能地缘政治影响达到顶峰的关键窗口期——显著扩大领先优势。

或许有人认为这些措施将增加与中国合作的难度,但我持相反观点:这些措施能增强民主国家的议价能力,使未来达成协议的可能性不降反增。

全球节奏管控

在推进民主国家内部步调调控的同时,我们也应致力于在全球范围内对前沿科技发展进行步调调控——尽管这实现起来要困难得多。全球步调调控需要与中国合作,这个威权国家目前拥有最先进的人工智能能力。我们绝不能天真行事:地缘政治风险如此之高,尤其是在初期,可能达成的共识将存在明显局限。如果我们因相信中国会采取相同行动而过度限制自身人工智能能力,而中国却背弃承诺,人工智能的强大威力可能导致其取得地缘政治主导地位。因此任何协议必须具备铁一般的可验证性,或限制在背弃行为不会构成军事生存威胁的范围内。我推测不仅美国,中国也会怀有这些担忧与焦虑。我们在推进任何全球步调调控决策时——特别是近期——必须采取能维护美国及其盟友领先地位的方式。

可能的协议存在多个层级,其中某些我认为完全可行(正如先前建议),另一些则持高度怀疑态度——尽管如此我们仍应尝试。按难度递增顺序排列:

第一层级:禁止人工智能某些狭隘且明显危险的用途,例如利用人工智能开发生物武器或允许用户进行此类操作。生物恐怖袭击对包括美国及其对手在内的各方均有害,因此该领域协议很可能达成。

第二层级:双方达成协议,在模型发布前针对网络安全、生物科技、对齐等领域的突发风险进行测试。如前所述,可通过全球标准机构实施。我确实认为建立此类机构具有可行性,但赋予其实际约束力将是挑战,难点在于如何验证双方是否秘密持有未经测试但可能暗中部署的模型(例如用于军事领域)。

第三级:对递归自我改进(RSI)的速度设定某种“限速”。随着模型不断构建未来模型,改进速度可能变得惊人地快。将速度从“极快”放缓至“仅稍快”,虽会牺牲相对较少的战略优势,却可能极大提升安全性。这可以类比《限制战略武器条约》——通过限制导弹数量来控制潜在破坏力,同时维持各国的威慑能力。我认为此类协议虽难以达成,但正处于可能实现的边缘。

第四级:全面调控甚至“暂停”发展,即参与国政府同意大幅限制人工智能的整体发展速度。我支持提出此构想,但认为短期内实际实施的可能性很低:任何国家通过规避监测违背协议,都可能彻底改变全球力量平衡,因此预计相关诱惑极大,而我们需要对核查机制抱有极高信心。

我们与中国能够达成的任何合作,都将延长民主国家内部调控前沿技术发展的时间窗口。我们应以更高层级为目标,同时认识到较低层级更可能实现且更为现实。

最后需注意,即便无法达成正式协议,仅改变非正式规范也可能具有价值。共享关于递归自我改进及模型未对齐问题的信息,有助于使各方认识到鲁莽行事并不符合自身利益。

核心结论

我始终相信人工智能能极大提升人类生活质量,对此愿景的追求从未减退。但唯有以正确方式构建这项技术,我们才能实现这些收益——只要我们善用所赢得的时间,就值得付出超乎寻常的审慎努力来确保万无一失。发展仍将保持相对较快速度,我们可以利用这段时间推进可解释性科学研究,加强前沿人工智能公司的运营安全与严谨性,并构建我们对其对齐性更具信心的模型。我提出的安全推进前沿技术措施实施起来并不轻松,但我相信这是人类应尽的尝试。

脚注

需政府调解或豁免反垄断限制。

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下載

X

Telegram

Facebook

Reddit

複製鏈接