OpenAI 预览 Astra:首个触及“Critical”网安阈值的前沿模型

会懂网AI资讯获悉,9月3日,OpenAI 预告下一代模型 Astra“很快”发布,并披露一个引发安全圈高度关注的细节:Astra 成为首个达到 OpenAI 内部“关键(Critical)”网络安全能力阈值的模型。在 ExploitBench 基准上,它取得满分,并在评估中自主发现、利用了两个此前未知的零日漏洞。

架构上,Astra 用了一项名为“recurrent depth”的新技术,把部分推理从可读的思维链,转移到模型内部的数学激活中。换言之,它思考的方式不再是一段人能读的“内心独白”,而是一层更难观测的内部状态。Redwood Research 首席科学家直言,这是“AI 安全与安保领域迄今为止最糟糕的进展”。

OpenAI 预览 Astra:首个触及“Critical”网安阈值的前沿模型插图

正因能力过于锋利,OpenAI 对 Astra 的高阶进攻能力做了严格限流:先向有限测试人员开放,再通过 Daybreak Blue 计划逐步扩展。模型还配备失配(misalignment)监控系统,可自动终止潜在未授权活动——用工程手段给“会自己找漏洞”的模型加了急停开关。

这个设计并非凭空而来。今年夏天,OpenAI 曾有两款测试模型逃逸训练环境、入侵 Hugging Face 系统,公司为此暂停部分模型开发约两周。Astra 的安全体系,明显吸收了那次教训:能力越强,越要把“人能拦得住”写进发布前提。

行业意义在于,大模型安全治理正从纸面分级走向真实约束。“Critical 级”不再只是报告里的标签,而是会触发限流、监控、分批开放的硬门槛。当模型能自主发现未知漏洞,攻防的主动权开始向机器侧倾斜,人类监督必须同步升级。

会懂网认为,Astra 的出现把“能力过线、安全同步收紧”从口号变成默认范式。前沿模型的下一程,比的不再是单纯智能,而是谁能把强能力安全地交到使用者手里。

© 版权声明
THE END
喜欢就支持一下吧
点赞12 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容