人工智能巨头在三周内推出四个前沿模型,竞赛进入加速阶段

CN
3小时前

关键要点

  • xAI于7月8日发布了Grok 4.5,每百万个令牌价格为$2/$6,价格比Opus 4.8低60%以上。
  • Anthropic于7月24日发布了Claude Opus 5,作为Claude Max订阅的新默认模型。
  • Moonshot AI发布了Kimi K3,这是其最大的模型,拥有2.8万亿个参数。

xAI的Grok 4.5、Anthropic的Claude Opus 5、OpenAI的GPT-5.6系列以及Moonshot AI的Kimi K3都针对同一个问题:让AI系统执行多小时的任务,从研究到编码再到结构化报告,而不失去计划的追踪。

xAI于7月8日发布了Grok 4.5。该模型运行在一个1.5万亿参数的基础上,部分训练于Cursor的真实使用数据,Cursor是SpaceXAI今年早些时候收购的编码平台。定价为每百万输入令牌$2和每百万输出令牌$6,具有500,000个令牌的上下文窗口。

Elon X帖子截图。

Elon讨论2026年7月8日Grok 4.5的发布。

Elon Musk描述Grok 4.5为一款Opus级模型,运行速度更快,成本更低。独立追踪者将其列为人工分析智能指数的第四名,超过了每个开放权重模型,价格低于Claude Opus 4.8和GPT-5.5超过60%。在Terminal-Bench 2.1上,这是一项测试模型完成命令行工程任务的表现的测试,Grok 4.5得分为83.3%。

更大的变化是令牌效率。xAI称,该模型仅需要Opus 4.8完成类似任务所需的输出令牌的约五分之一,这降低了长时间代理会话的运行成本。

Anthropic于7月24日发布了Claude Opus 5,将其定位为接近该公司最强大发布的Claude Fable 5的表现,而价格仅为Fable的$10输入和$50输出的一半。Opus 5本身的输入和输出定价分别与其前身Opus 4.8相同,均为$5和$25。

Claude X帖子截图。

Claude Opus 5通过X发布的公告。

该模型配备有1百万令牌的上下文窗口,最大输出令牌数为128,000,并提供可调的推理努力设置,范围从低到新的高档模式。Anthropic表示,Opus 5在Frontier-Bench和GDPval-AA这两个编码和知识工作评估中设定了新的记录,尽管在网络安全任务上落后于限制版的Claude Mythos 5。Opus 5现在是Claude Max的默认模型,并且是Claude Pro上的最强选项。

OpenAI于7月9日将GPT-5.6推向大众可用,此前进行了为期两周的预览,仅限于约20个由美国政府审核的组织,紧随与前沿模型安全审查相关的行政命令之后。该系列产品分为三个层级:Sol,旗舰产品,定价为每百万令牌$5输入和$30输出;Terra,一个中层模型,定价为$2.50和$15,OpenAI称其与GPT-5.5的功能匹配,成本仅为一半;Luna,一个快速、低成本的层级,定价为$1和$6。

OpenAI X帖子截图。

ChatGPT 5.6 Sol通过X发布的公告。

OpenAI报告称,Sol在人工分析编码代理指数中名列第一,在Terminal-Bench 2.1上得分88.8%,当模型在其新的超模式下并行运行四个子代理时,得分上升到91.9%。所有三个层级在网络和生物误用潜力方面都拥有OpenAI最高的内部风险评级,这在政府限制的预览期间触发了额外的审查。

Moonshot AI于7月16日发布了Kimi K3,这是一个2.8万亿参数的专家混合模型,拥有896个总专家,并在每个任务中激活16个。该模型具有1百万令牌的上下文窗口和本机多模态输入,API定价为每百万令牌$3输入和$15输出。Moonshot承诺在7月27日前发布完整的开放权重。

Kimi Moonshot X帖子截图。

Kimi K3通过X发布的公告。

K3是迄今为止发布的最大开放权重模型,约比之前最大广泛使用的开放模型大75%。独立追踪者将K3在当前前沿系统中排名第四,落后于Claude Fable 5和GPT-5.6 Sol,但领先于Claude Opus 4.8。

低于200,000个令牌的上下文窗口曾经迫使开发人员将大型代码库或研究包拆分为碎片。这个组中的每个模型现在的运行都在500,000个令牌或以上,四个模型中的三个在1百万令牌,这使得单个会话可以容纳一个完整的代码库或一堆主要的来源文档。

代理的可靠性也有所提升。2023年和2024年期间的系统常常在几次工具调用后失去其计划。本月发布的模型旨在支持数十个协调步骤,并在工具调用返回错误数据时恢复,而不是停滞不前。

对开发人员而言,实际效果是每个完成任务的成本降低,而不是对任何单一基准的更高上限。Opus 5中的努力控制、GPT-5.6中的分层定价以及Grok 4.5背后的效率声明均指向同一个目标:让团队选择一个任务应投入多少计算资源,而不是为每个请求支付旗舰价格。

对企业和决策者而言,政府限制下的GPT-5.6推出表明,监督现在已纳入最大模型的发布计划,而不是事后再添加。Anthropic在6月根据政府指示对Fable和Mythos的访问进行的短暂暂停是同一模式的早期版本。

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接