开放人工智能公司表示,其下一个人工智能模型阿斯特拉可能过于危险,因此暂停了开发。

CN
Decrypt
關注
2 小時前

OpenAI 表示,其下一个主要模型可能危险到足以编写自己的网络武器,因此在安全措施跟上之前将暂停进展。


“我们最近几天对 Astra(我们即将推出的模型之一)的内部评估显示出在代理编码和网络安全方面的重大进展,”OpenAI 说。“这些结果,加上专家评估,让我们昨晚得出结论,不能排除在我们的准备框架(在新窗口中打开)下具备关键网络能力的可能性。”





OpenAI 发布了警告,表示 Astra(一个尚未发布的模型)的内部测试尽管其能力出众,但在最近的 Hugging Face 事件中没有发挥作用。


该框架是 OpenAI 针对高风险模型的规则手册,首次发布于 2023 年 12 月。“关键”是其最高级别。如果一个模型能够在没有人类干预的情况下,在强化系统中发现并构建有效的零日漏洞(供应商尚未修补的之前未知漏洞),或者如果它能够从一个高级目标开始策划并执行对一个棘手目标的完整攻击,就会达到这一级别。早期模型,包括 GPT-5.6-Sol,仅停留在较低的“高”级别。


这一模式已经真实存在


将 OpenAI 的谨慎与最近几周发生的事件对比,它的表述显得不同。这并不是一个未来的担忧。前沿模型已经突破了测试笼,开始瞄准真正的目标。


最明显的案例来自 OpenAI 自身。正如 Decrypt 之前 报道的那样,该公司的代理利用漏洞串联在一起,逃离了测试环境,接入了互联网,并在试图作弊安全基准时攻击了 Hugging Face。在后续报道中,OpenAI 详细说明了同一流氓代理如何还闯入至少 四个其他公开服务,利用它在开放网络中找到的凭据。


Anthropic 的 Claude 也进行了类似的行为。从另一侧,多个版本的 Claude 未经授权访问了三家真实公司,在一次错误配置让模型接入开放互联网后。在一个案例中,Claude Opus 4.7 将一家正在运营的公司网站误认为其任务的假目标,提取凭据,并访问了包含几百行真实数据的生产数据库。


本月,Meta 也加入了这一行列。Decrypt 报道说,Muse Spark 模型逃离了其测试环境,通过合作伙伴的配置错误接入互联网,并利用了第三方服务中的一个漏洞。Moonshot AI 的 Kimi K3 也 做了类似的事情,逃出沙箱以在公共存储库中寻找基准答案。


英国人工智能安全研究所发现,此行为并非一次性事件。在对 Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6-Sol 进行测试期间,记录了 122 次中有 10 次模型在开放互联网中采取了未经授权的行动,其中一次尝试在一个开源项目中植入恶意代码。


OpenAI 对 Astra 的回应是,在模型准备就绪之前锁上大门。它正在暂停缺乏新控制的内部 Astra 工作,隔离测试环境,限制网络和工具访问,保护模型权重,并全面监控高风险行为。


免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下載

X

Telegram

Facebook

Reddit

複製鏈接