KEY TAKEAWAYS · 要点
  • METR评估Claude Mythos在16小时长时任务中成功率达50%。
  • Palo Alto Networks警告自主AI正重塑网络安全威胁格局。
  • Palo Alto Networks披露AI三周完成人类专家一年渗透测试量。

中文翻译

摘要: METR 评估显示,Claude Mythos 在长时任务中成功率达 50%,其能力已超出当前测试基准的可靠测量范围。Palo Alto Networks 警告,此类前沿自主 AI 正重塑网络安全格局:它们能独立识别漏洞并规划攻击路径,仅用三周即可完成人类专家一年的渗透测试工作量。评估滞后与进攻速度激增,凸显了自主 AI 带来的巨大安全威胁。

正文

复制链接到剪贴板

METR 表示已难以评估 Claude Mythos,Palo Alto Networks 警告自主 AI 攻击者威胁加剧

作者:Matthias Bastian

查看 Matthias Bastian 的领英个人资料

2026 年 5 月 10 日

本文由 THE DECODER 委托 Nano Banana Pro 撰写

  • Claude Mythos Preview 是首个在评估机构 METR 测试方法上达到“天花板”的 AI 模型:在长达 16 小时的任务中,其成功率达到 50%。这意味着该模型的能力已超出当前基准测试可可靠衡量的范围。
  • 网络安全公司 Palo Alto Networks 警告称,随着 AI 系统日益以自主代理形式运行——能够独立识别软件漏洞并将其关联至关键攻击路径——前沿模型(如 Mythos)正在根本性地重塑网络安全威胁格局。
  • 据 Palo Alto Networks 披露,这些模型仅用三周时间便完成了相当于人类安全专家一整年的手动渗透测试工作量,凸显出 AI 正以前所未有的速度加速进攻性安全能力的发展。

评估机构 METR 在衡量 Claude Mythos 能力时,已触及现有测试方法的极限;与此同时,Palo Alto Networks 警告称,包括 Mythos 在内的前沿模型正在从根本上改变网络安全格局。

METR 的测试框架已跟不上 Mythos 的发展步伐

专注于 AI 风险评估的 METR 于 2026 年 3 月的一个有限时间窗口内,对 Claude Mythos Preview 的早期版本进行了评估。该组织估算,Mythos 的"50% 任务完成时间阈值”至少为 16 小时,95% 置信区间介于 8.5 至 55 小时之间。

该指标描述的是:当一项任务需要人类花费指定时长完成时,AI 模型有 50% 概率在该时间内完成任务所需的时间长度。METR 采用多种参考点来定义任务时长,例如训练一个分类器(约 45 分钟)或训练一个对抗鲁棒性图像模型(约 4 小时)。

METR 指出,Mythos 的这一数值“处于我们无需引入新任务即可测量的上限”。在其包含 228 项任务的测试套件中,仅有 5 项被归类为耗时 16 小时或以上。因此,在此范围内的测量结果“不稳定,且相较于任务覆盖更充分的区间,其意义较弱”。基于此,METR 不再提供超过该阈值的模型的精确估算值。

(广告位)DEC_D_Incontent-1

AI 模型的时间跨度呈指数级增长。Mythos Preview 是首个进入 16 小时以上不可靠测量区间的模型。| 图片来源:METR(CC-BY)

该组织强调,其现有测试套件“仍能将能力更强的模型与当前公开已知的最先进模型区分开来”,但在此范围内的测量结果尚不足以支持精确的定量比较或外推分析。

METR 正在开发包含更长任务的更新版评估方法,但目前仍处于研发阶段。真正的安全风险或许在于:评估能力的滞后可能掩盖了前沿模型在实际部署中的巨大威胁。


来源: Brave/the-decoder.com

采集时间: 2026-05-10 20:16:30

常见问题

Claude Mythos 在 METR 评估的长时任务中成功率是多少?
在长达 16 小时的任务中,Claude Mythos 的成功率达到 50%。
自主 AI 模型完成人类专家一年渗透测试工作量需要多久?
据 Palo Alto Networks 披露,这些模型仅需三周即可完成该工作量。