OpenAI Astra突破”关键”网络门槛:能自挖零日漏洞,能力将受限开放

会懂网AI资讯,9月2日,OpenAI宣布下一代模型Astra已达到其”准备框架”中最高级别的”关键”网络安全能力门槛——可在无人工逐步指导下,于多个加固系统中发现并利用未知零日漏洞。公司称将”很快”发布,但最先进的网络安全能力仅先向少数测试人员开放。

评测显示,Astra在ExploitBench取得100%满分,并在内部含20个近期高严重度漏洞的测试集上,零日漏洞利用率显著高于GPT-5.6 Sol。专家测试中,它构建了突破沙箱并在主机执行命令的浏览器入侵链,还将多个漏洞组合成从普通用户到root的本地提权链。

OpenAI Astra模型

吸取7月Hugging Face事件教训,OpenAI强化了沙箱隔离与实时监控,并训练模型更可靠地拒绝有害网络请求——对越狱请求的拒绝率达91.5%,而GPT-5.6 Sol为59%。后续通过Daybreak Blue计划,高级网络能力将向防御性用途开放。奥特曼坦言,对AI能力”既兴奋又焦虑”将长期共存。

OpenAI明确,Astra之后的模型会主动放慢步伐,把安全与对齐做足。当模型能自己发现并利用漏洞,”能力跑得太快”不再只是比喻。护栏越筑越紧、发布越分批次,正成为前沿实验室面对超强模型时的共同姿势。

但门槛之上仍有隐忧:能力越强,被滥用的后果越重。OpenAI把最高权限收在少数人手中,既是负责任之举,也意味着防御性用途之外的研究者更难独立验证其成色。透明的系统卡、公开的评测与第三方审查,才是公众信任的真正基石。

这也提醒监管者:当模型能力逼近“关键”阈值,发布节奏不应只由公司自定。分级开放、第三方评测与红队机制,或将成为强模型准入的硬约束。

© 版权声明
THE END
喜欢就支持一下吧
点赞9 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容