阶跃发布 Step 5 Preview,大模型开始寻找新的平衡点

CN
2 小時前

作者Yoky
微信yokyliu617

过去几年,大模型的竞争点几乎没有悬念:更多参数、更多数据、更多算力,换来更强智能。

Scaling 远没有结束,但当模型开始从“回答一个问题”走向“完成一项可能连续数小时的任务”,新的竞争点也开始出现:模型当然还是要足够聪明,但只把能力上限推高已经不够了。同样重要的问题是,要用多少计算、多少成本、才能把这些智能更有效率地转化为结果。

换句话说,大模型竞争不仅要继续向上 Scaling,也要不断重塑智能与成本之间的最优边界——帕累托前沿。

阶跃星辰最新发布的旗舰模型 Step 5 Preview,正是把这条前沿,再次向前推进一步。

在 Artificial Analysis 最新评测中,Step 5 Preview 的 Intelligence Index 达到 44 分,达到全球开源模型前二水平;与此同时,其 Intelligence Index 单任务成本约为 0.7 美元。

这种变化首先来自模型本身。它拥有 600B 总参数,但每生成一个 Token,实际只激活约 27B 参数。

在 AA 的测试任务中,它平均生成约 6.4 万个输出 Token,加权平均解码时间约 12.1 分钟。这说明它要解决的并不是如何更快地给出一个答案,而是如何在长时间推理中持续推进任务。

但要判断 Step 5 Preview 是否真的找到了能力、效率和完成度之间的平衡,只看 Benchmark 还不够。还得是实测见真章——

1

在真实任务里寻找“帕累托前沿”

模型在真实任务中面对的困难并不相同:有些任务考验空间理解和视觉实现,有些考验复杂工程的组织能力,还有一些要求模型处理专业知识、冲突信息与可复核的数字。

我们首先选择制作 3D 互动游戏《我们的岛》,因为 3D 开发是一个很容易暴露模型能力边界的场景。它要求模型同时处理空间结构、几何建模、材质、光影、镜头和交互状态。任何一处修改,都可能引发穿模、遮挡或渲染异常。模型不仅要把功能写出来,还必须不断观察结果、发现问题并调整。

Step 5 Preview 最终交付了一个可以运行的 WebGL 游戏。玩家可以旋转和缩放浮岛,改变时间、天气与音乐,也可以放置建筑、家具、植被和灯光;不同选择还会生成一张“品味画像”,匹配相应的岛屿人格。

更重要的是,游戏中的岛屿、树木、房屋和灯塔没有借助 Blender 等外部建模工具,也没有调用现成的 3D 素材,而是全部由 Step 5 通过代码生成。它第一次交付就搭起了场景、玩法和反馈机制,后续主要调整光影、构图与交互细节,没有推翻原来的架构重新开始。

单看建模精度,它还无法代替专业美术;直接打开本地文件也会卡在加载页,需要通过 HTTP 服务运行。但把生成时间、首次完成度和外部工具依赖放在一起看,Step 5 Preview 已经在较短时间内,把一个原本需要程序、美术和产品协作的任务,推进到了可以运行和继续修改的阶段。

如果说 3D 游戏考验的是模型能否驾驭一个高度耦合的视觉系统,那么 Chrome 扩展测试的则是另一种能力:模型能否理解一个真实软件产品的完整交付标准。

一个网页摘要扩展并不只是做出摘要按钮。它还要适配不同网页,处理长文切分、模型调用、流式输出、原文引用、本地存储和浏览器权限;完成代码后,还要经过测试、构建和打包,才能真正安装使用。因此,我们让 Step 5 Preview 开发了一款 Chrome AI 网页摘要扩展。

最终交付物包含正文提取、长文分段、流式摘要、原文问答、引用定位、历史记录和模型设置,也包含 Manifest V3、Service Worker、扩展安装包、商店素材、隐私政策和权限说明。我们实际操作了摘要、问答和历史页面,主要流程可以正常完成,项目自带的 13 项单元测试也全部通过。

这个案例体现出的不是某一段代码有多复杂,而是 Step 5 Preview 能够理解任务中没有被逐项写明的部分,并把测试、打包和上架材料一起补齐。它交付的是一个结构完整的软件项目,而不是一张只能展示的界面。

最后,我们测试了金融的专业问题,金融场景是 Step 5 Preview 官方重点展示的专业能力之一:阶跃设置了实时信息检索、公司估值和深度研究三类内部金融评测;在外部的 FrontierFinance 测试中,Step 5 Preview 的表现也接近 Claude Opus 5。为了验证这种能力能否进入真实工作流,我们选择让它完成一项英伟达投资分析。

英伟达是一个难度较高的研究对象。公司增长快、财务口径变化多,实际业绩、管理层指引和第三方预期之间还存在大量冲突。模型不能只找到数字,还要判断数字属于哪个时期、使用什么口径,以及哪些信息是事实,哪些只是尚未得到验证的假设。

Step 5 Preview 最终交付了两份 Excel 模型、一份投资备忘录和一份证据清单。它从 SEC 文件、公司财报与电话会记录中提取数据,建立了从历史财务、收入预测到 DCF 和相对估值的完整链条,并通过不同增长率、毛利率和折现率测试估值结果。最终给出的加权目标价为 263.06 美元,较基准股价高 18.4%。

这里真正值得评价的不是“买入”结论是否正确,而是模型是否留下了可以复核的过程。Step 5 Preview 为关键数字保留了来源,主动列出数据冲突、缺失项和主观假设,也同时给出了乐观与悲观情景。但人工检查仍然发现了个别公式错误,说明它已经能够完成研究、建模和证据整理,最终数字却仍然不能跳过专业人员的审计。

从这些结果看,Step 5 Preview 的特点并不是某一项能力绝对领先,而是能够在较短时间内,把不同类型的复杂任务推进到接近交付的位置。第一次生成已经具备完整框架,后续工作更多是在调整细节,而不是重新解决问题。这正是“帕累托前沿”在真实任务中的具体表现。

1

从 Step 5 Preview 看懂阶跃

Step 5 Preview 不只是阶跃对现有模型的一次升级,它也体现了阶跃对下一代模型进化方向的判断:模型可以继续扩大,但真正的突破不能只依靠增加参数和算力,还要让模型思考得更深、让计算真正有效,并让 Agent 进入模型自身的数据与训练循环。

围绕这一目标,阶跃同时调整了模型架构、稀疏计算、数据生产和训练系统。Step 5 Preview 采用 92 层“窄而深”的设计,希望以更充分的计算深度处理复杂 Agent 任务中的长链路依赖;600B 总参数每个 Token 仅激活约 27B,并通过稀疏注意力等方式减少长上下文中的无效计算。与此同时,Agent 也开始参与高难度训练任务的构建,让真实执行过程中产生的轨迹和反馈重新进入下一轮训练。

这些变化并不依赖某一个单点创新。它要求模型、训练、推理和数据系统围绕同一个目标协同工作,也更考验一家基模公司的综合研发能力。

Step 5 Preview 的发布,因此也成为了一个重新观察阶跃的窗口。过去一个季度,阶跃先后更新 Step Edge、StepAudio 3 和旗舰基模 Step 5 Preview,完成了新一轮模型体系升级。前沿基模继续向上突破,全模态能力覆盖听、说、看、生成和操作,端侧模型则把这些能力进一步带到手机、汽车等真实设备中。

如果说 Step 5 Preview 回答的是“模型能够思考到什么程度”,那么全模态解决的是模型如何感知和理解更丰富的世界,而终端,则决定这些能力能否真正进入人的日常生活。据披露,阶跃模型已经规模化进入超过 4200 万台终端,日均服务近 2000 万人次。对模型而言,这意味着面对的不再只是 Benchmark 和实验环境,而是低时延、复杂噪声、高并发,以及持续发生的真实交互。

前沿基模决定智能上限,全模态拓宽智能边界,终端让智能进入现实。当这三项能力开始同时成熟,Step 5 Preview 的意义也就不再局限于一张榜单或一次模型发布,它更像一个节点:阶跃收束回到“Frontier 竞争”的主线剧情 ,此前在全模态和真实终端上积累的能力,也开始与前沿基模重新汇合。

所以,当大模型竞争从单点能力走向系统能力,对一家基模公司的判断也不再只取决于某一款模型能力多高,而在于它能否持续抵达 Frontier,并把这种能力带到真实世界。

如今,Step 5 Preview 已登场,阶跃的位置,也需要被重新审视了。

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下載

X

Telegram

Facebook

Reddit

複製鏈接