Anthropic 主动搁置内部更强模型 Model 2,AI 安全评级上调

8月14日,Anthropic 发布第二份长达 186 页的《风险报告》,首次披露公司内部存在一款未发布的更强模型”Model 2″,并明确表示”目前没有对外发布的计划”。这一罕见举动,被视为前沿 AI 实验室在安全治理上的一次标志性转向。

Anthropic 主动搁置内部更强模型 Model 2,AI 安全评级上调插图

内部模型,能力已超公开旗舰

报告显示,Model 2 仅供 Anthropic 内部使用,并未通过 API 或订阅对外开放。在由 449 道真实研发问题组成的内部基准 CoBench v2 上,Model 2 得分 62.8%,明显高于已公开的旗舰模型 Claude Mythos 5 的 50.3%。它在公司内部已被广泛用于编程、智能体任务、训练数据生成与工程自动化,但尚未跑完全部上线前评估。

Anthropic 在报告中写道:”我们目前没有向外部发布这款模型的计划。”这家一向以”负责任 AI”著称的公司,正在用行动表达一个立场:当能力增长快于对齐手段时,宁可先按下发布键。

评级上调,源于”评测失灵”

报告同时把”高风险场景下灾难性失对齐”的风险评级从”非常低”上调至”低”。值得注意的是,上调并非因为 Model 2 在安全测试中失败,而是因为公司对自身评估体系的信心下降——报告坦承,最具体的任务型评测已经”饱和”,无法再有效捕捉模型能力的增长。

Anthropic 估算,一个真正能全面替代其研发人员的系统,需要在 CoBench 上达到 85%,目前没有任何模型接近这一水平。当”尺子”先饱和、能力仍在涨,AI 的风险管理正从”测量问题”转向”判断问题”,这也给整个行业敲响了警钟。

来源:Axios、凤凰科技

© 版权声明
THE END
喜欢就支持一下吧
点赞11 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容