Ilya Sutskever(伊尔亚·苏茨克维):从“扩展时代”回归“研究时代”,超级智能将是超级学习者

CN
1小时前

撰文:Techub News 整理

导语

近日,OpenAI 联合创始人、前首席科学家伊尔亚·苏茨克维(Ilya Sutskever)在离开 OpenAI 创办新公司 SSI(Safe Superintelligence Inc.)后,首次接受了播客主 Dwarkesh Patel 的深度专访。在这场长达 96 分钟的对话中,苏茨克维系统性地回顾了 AI 发展的“扩展时代”,剖析了当前大语言模型(LLM)的核心缺陷,并展望了通往超级智能的可能路径。作为深度学习的奠基人之一,从 AlexNet 到 GPT 系列模型,苏茨克维亲历并引领了 AI 过去十年的关键突破,他此时的发声,不仅是对行业现状的诊断,更是对未来技术方向的预判,其观点对理解 AI 发展的下一阶段至关重要。

摘要

  • AI 发展正从依赖数据与算力“扩展”的范式,回归到以基础研究突破为核心的“研究时代”。
  • 当前大模型在评测上表现出色,但在实际应用中泛化能力严重不足,其根本原因在于学习机制存在缺陷。
  • “价值函数”可能是提升强化学习效率、让 AI 具备更接近人类学习能力的关键组件。
  • 未来的超级智能(Superintelligence)更可能表现为一个能够快速、持续学习任何技能的“超级学习者”,而非一个全知全能的成品。
  • AI 对齐(Alignment)的挑战与“不可靠的泛化”问题紧密相关,渐进式部署和让 AI 具备对有情生命的关怀是值得探索的方向。

从“扩展时代”到“研究时代”:范式的再次轮回

伊尔亚·苏茨克维(Ilya Sutskever)开篇即提出了一个关于 AI 发展阶段的宏观框架。他认为,从 2012 年 AlexNet 到 2020 年左右,是“研究的时代”。彼时,研究者们主要依靠灵感和试错来推动进步。随后,以 GPT-3 和“扩展定律”为标志,行业进入了“扩展的时代”。这个阶段的核心信条变得极其简单:“扩展”——扩展数据、扩展参数、扩展算力。预训练(Pre-training)成为完美的“扩展配方”,只要按比例放大投入,性能就会可预测地提升。这种模式深受企业青睐,因为它提供了一条低风险的资源投入路径。

然而,苏茨克维指出,这个时代即将或已经结束。原因在于,可用于预训练的互联网文本数据是有限的,数据瓶颈终将到来。更重要的是,即便算力再增加 100 倍,仅靠现有的“扩展”配方,也无法带来质的飞跃。“我们正回到‘研究的时代’,只是这次我们拥有巨大的计算机。”苏茨克维总结道。这意味着,未来的突破将不再依赖于简单的规模堆砌,而需要回归到对机器学习根本原理的探索,寻找新的、更高效的“配方”。

当前,行业的焦点已从预训练转向强化学习(RL)。各大公司投入在 RL 上的算力甚至可能已超过预训练。但苏茨克维认为,这本质上还不是“扩展”,而是对计算资源的低效利用。问题的核心在于:如何更聪明地使用这些庞大的计算资源? 答案指向了基础研究的创新。

泛化鸿沟与“价值函数”的探索

苏茨克维花了大量篇幅阐述当前大模型最根本的缺陷:泛化能力(Generalization)远逊于人类。他以编程为例:一个模型可以在编程竞赛评测中达到超人水平,但在实际修复代码漏洞时,却可能陷入“引入新 Bug - 换回旧 Bug”的循环。这种“评测表现”与“真实世界表现”的巨大脱节,令人困惑。

他提出了一个生动的比喻来解释这种现象。想象两个学生都想成为优秀的竞赛程序员。学生 A 投入一万小时,专门练习竞赛题目,熟记所有算法和证明技巧,最终成为顶尖选手。学生 B 只投入一百小时,同样取得了好成绩。苏茨克维认为,在未来的职业生涯中,学生 B 通常会表现更好。因为学生 A 的学习是过度特化的,缺乏真正的理解和迁移能力。

“当前的模型更像学生 A,甚至更极端。”苏茨克维说。为了在某个评测上取得高分,研究者们会针对性地设计巨量的 RL 训练环境,这导致模型变成了一个“过度训练的专家”,其能力无法可靠地迁移到真实、复杂的场景中。这揭示了当前 RL 训练范式的一个深层问题:它鼓励的是对特定任务的“奖励黑客”行为,而非培养普适的智能。

如何解决?苏茨克维认为,价值函数(Value Function) 是一个关键方向。在传统的强化学习中,模型需要完成整个任务(如写出一段完整代码)后才能获得奖励信号,学习效率低下。价值函数的作用,是让模型在思考的中间步骤就能获得“这个方向是否有希望”的评估。就像下棋时,丢掉一个棋子你就知道不妙,无需等到终局。苏茨克维相信,尽管实现有难度,但价值函数将能大幅提升 RL 的效率,是未来不可或缺的组件。

他进一步将价值函数与人类的情绪(Emotion)进行类比。他引用了一个神经科学案例:一位因脑损伤失去情绪感知的病人,虽然智力测试正常,却变得完全无法做出决策。这表明,人类内置的、类似价值函数的情绪系统,是我们成为有效智能体的关键。这引发了一个深刻的问题:AI 能否以及如何从数据中获得这种稳健的、指导性的“价值感”?

人类学习、超级智能与“超级学习者”的形态

苏茨克维反复将 AI 与人类的学习能力进行对比,凸显了前者的不足。人类展现出了惊人的样本效率、鲁棒性和无监督学习能力。一个青少年只需约 10 小时练习就能学会开车,这背后是人类强大的视觉系统、运动协调能力,以及通过内在价值函数(如紧张、自信的感觉)进行自我纠正的能力。

那么,未来的超级智能会是什么样子?苏茨克维挑战了“人工通用智能(AGI)”这一概念的固有想象。他认为,AGI 这个概念本身是对“狭义 AI”的反动,而预训练的成功(让模型在所有任务上普遍提升)进一步强化了“AI 应该是全能的”这一印象。但这可能是一个误导。

苏茨克维提出了一个更具颠覆性的愿景:未来的超级智能,可能不是一个知晓一切的“成品”,而是一个具备超强学习能力的“超级学习者”。 它就像一个极其聪明、渴望学习的 15 岁少年,虽然初始知识有限,但可以快速学习成为程序员、医生或任何领域的专家。这种智能体将被部署到经济中,在不同的岗位上进行持续学习。

“部署本身将涉及一个学习、试错的过程,而不是直接丢出一个完成品。”苏茨克维解释道。这种模式下,智能的“超级”之处体现在其学习算法的效率上,而非其初始的知识库。他甚至认为,即使没有软件层面的“递归自我改进”,仅仅通过大量这样的智能体实例在各个领域学习,并将知识“合并”起来,就足以形成一个功能上超级智能的系统,因为人类无法像机器那样融合心智。

这将带来快速的经济增长,但也将世界置于一个微妙而强大的新均衡中。

对齐挑战、渐进部署与 SSI 的愿景

当对话转向如何让超级智能的发展“顺利”时,苏茨克维展现了他作为 SSI 创始人的思考。他承认,自己过去一年的想法有所演变,越来越重视 AI 的渐进式部署。因为超级智能的力量难以凭空想象,只有通过实际展示,社会、政府、甚至 AI 公司自身才能真正理解其影响并做出调整。他预测,随着 AI 能力变得“可感知”,竞争对手公司之间将开始前所未有的安全合作,整个行业对安全的偏执程度会急剧上升。

在技术对齐思路上,苏茨克维提出了几个值得探索的方向。一是构建“关怀有情生命(Sentient Life)”的 AI。他认为,这或许比仅关怀人类更容易实现,因为 AI 自身也将是有情的,并且人类大脑中用于理解自己的神经回路也常被用来理解他人(如镜像神经元),这为共情提供了基础。二是考虑对最强超级智能的能力设置某种上限。三是他并不喜欢但认为必须考虑的方案:人类通过脑机接口等技术,与 AI 深度融合,成为“半 AI”的存在,以确保在智能爆炸的时代人类不至于掉队。

苏茨克维将许多对齐难题也归结于“不可靠的泛化”。他认为,如果 AI 的泛化能力能像人类一样可靠,那么学习人类价值观、并稳健地优化这些价值观,可能会变得更容易。

关于他创办的 SSI,苏茨克维强调其核心是一个“研究时代”的公司。SSI 拥有充足的算力进行前沿研究,其区别于其他巨头实验室的根本在于独特的技术路径,即围绕“理解并解决泛化问题”这一核心展开探索。他坦言,如果研究成功,SSI 将成为前沿力量;如果现有技术路径陷入停滞(他预测这可能在 5 到 20 年内发生),而 SSI 找到了新路径,世界将会看到不同的可能性,并最终在技术和对齐策略上走向收敛。

在访谈的最后,苏茨克维分享了他传奇的“研究品味”的来源:一种对“AI 应该如何”的美学追求。这种美学源于对大脑工作原理的正确类比(而非表面模仿),追求简洁、优雅和深刻。正是这种自上而下的信念,支撑他在实验失败时坚持调试,而非轻易放弃方向。这或许也是他对整个 AI 行业在“研究时代”的寄语:在巨量算力的基础上,重新找回对智能本质的深刻洞察与美学追求。

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接