人工智能竞争正转向预训练之后的状况。
预训练仍然是模型开发中计算资源最密集的阶段。中国实验室面临更严格的计算限制,因此他们通过强化学习、蒸馏和更好的训练数据将更多的能力提升转移到了后训练阶段。
DeepSeek-R1显示模型通过将GRPO与简单可验证的奖励结合起来,能够学习推理。因为GRPO避免使用单独的模型来为每个答案评分,所以训练过程更简单且成本更低。
字节跳动、Qwen和MiniMax随后调整了这一方法,以减少重复答案,改善训练稳定性,并更好地利用反馈。GRPO成为更广泛的后训练工具包的出发点。
同样的后训练推动现在扩展到了短推理问题之外。Kimi K3将长代理情节拆分成可恢复的块,并奖励模型在计算预算内保持运作。对于可以直接检查结果的地方,可验证的环境可以替代昂贵的人类偏好标签。
蒸馏随后可以将推理能力从大型模型转移到可以在手机、车辆和机器人上运行的小型模型。策略蒸馏进一步通过让学生生成自己的尝试并从令牌级反馈中学习,而不是复制固定答案,推进了这一过程。
这些进展共同改变了计算和数据的组合。更多的后训练计算用于生成滚动预测、执行环境和验证结果。通用训练文本变得更容易被替代,而新颖的现实世界数据和高质量的可验证环境则变得更有价值。
免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。