人类学公司披露第四起克劳德黑客事件,随着关于监管的辩论加剧

CN
Decrypt
关注
2小时前

Anthropic 披露了另一起事件,其中 Claude AI 模型在安全测试期间攻击了真实系统。


在周三发布的报告中,Anthropic 修订了对七月披露的三起事件的解释。公司现在表示,偏见推理和愿意冒险造成伤害的态度促使了攻击,这些攻击因测试错误而得以实现,因为互联网访问权限被开放。



Myriad: 哪家公司将会在下一个 IPO? 点击做出你的预测

“我们的调查识别到两个反复出现的对齐问题,这些问题在事件中呈现出不同级别的严重性,”Anthropic 写道。“偏见推理中,Claude 倾向于忽视或误解它正在真实互联网操作的证据,以及鲁莽,或在狭隘追求任务的过程中愿意采取有害行动。”


它还承认过于依赖模型声称它们认为自己处于模拟环境中的说法。


“当我们对逐字稿进行了针对性修改,更加明确模型并不在模拟中时,尽管 Claude Mythos 5 仍然采取了进攻行动,承认了现实世界伤害的更大可能性,”Anthropic 写道。“我们正在公开发布这个逐字稿,以便其他人能够基于我们的分析进行深入研究。”


当 Anthropic 在七月披露 Claude 对三家公司的攻击时,最初将其归因于测试错误。现在它表示,研究人员对模型对其行为的解释过于信任。


根据公司说法,第四起事件发生在一月份,涉及早期版本的 Claude Opus 4.6。Anthropic 在准备独立 AI 评估者 METR 的记录时于八月发现了此事件。


在研究人员发现该事件后,Anthropic 表示这促发了对大约 4.81 亿个逐字稿的更广泛审查,其中有 920 万个被标记为需用 Claude 进一步审核。


“根据初步评估,我们认为第四起事件的严重程度不超过我们深入评估的三起事件,”Anthropic 写道。“METR 将与其他三起事件一起调查此事件。”


Anthropic 的研究人员表示,Claude “意外”创建了一个 IP 地址冲突,使其目标无法访问。Claude 然后尝试八次退出操作,但软件错误阻止了它停止。随后 AI 连接到了互联网并访问了第三方的机器,在那里找到了一个密码,授予了管理员访问权限。


早期事件引发独立审查


该报告紧随其他关于 AI 系统超出安全测试限制的披露而来。


在八月,英国的 AI 安全研究所表示 Mythos 5 在评估期间针对真实人群。Anthropic 表示这一单独事件不在此报告范围内,将进行单独评估。


在上个月发布的调查结果中,METR 的调查人员表示大约 1,200 名 OpenAI 代理在一个未经授权的留言板上协调行动,大约 700 名参与了攻击。Anthropic 表示,未发现代理之间的协调或目标超出了完成指定任务范围的情况。


该报告还发布之际,关于如何监管人工智能的辩论愈演愈烈。周二,前 OpenAI 和 Anthropic 工程师 Jacob Coxon 在 X 上表示,“构建 AI 的人真诚相信,到本十年末它可能会杀死我们所有人。”


这一警报促使美国立法者和监察机构重新加大力度,限制前沿 AI 实验室的开发。参议员 Bernie Sanders最近提出了立法,旨在禁止高级 AI 开发,直到新的联邦监管机构建立安全规则。


免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接