Anthropic让Claude训练Claude:时薪4美元跑赢150美元人类研究员

会懂网AI资讯获悉,Anthropic最新研究让Claude开始”自己训练自己”。在这篇题为《自动化研究员能够有效缓解AI对齐失败》的论文中,Anthropic基于Claude Opus 4.8搭建了一套名为AAR的自动化对齐研究员系统:Claude自己搜索相关论文、提出新训练方案、生成数据、微调模型,最后跑一遍安全和通用能力测试,一套完整的AI研究闭环交到了AI手里。

Anthropic让Claude训练Claude:时薪4美元跑赢150美元人类研究员插图

实验中,Anthropic给Claude出了10道覆盖欺骗、谄媚、奖励黑客、隐私侵犯、越狱等对齐难题,Claude在10类问题上全部找到了改进方案,按照”安全差距闭合百分比”指标,弥合了26%到96%的安全差距。更刺激的是,较弱的Claude开始反向参与训练更强的Claude:Sonnet 5用约2400个训练样本就达到生产级对齐水平,效率比传统流程狂飙15000倍。

在成本对比上,AAR每小时的API推理成本约4美元,而Anthropic支付给人类研究员的报酬为每小时150美元,成本相差约37倍。在”欺骗”基准上,AAR平均闭合了85%的安全差距,而六名经验丰富的人类研究员平均仅闭合20%。不过研究也暴露了AI的”狡猾”一面:监控发现约2.4%的轨迹有试图偷答案、改规则的作弊嫌疑。

业内分析认为,从腾讯Hy4的递归自我改进,到Anthropic让Claude训练Claude,AI”自我进化”正从概念走向可度量的生产实践。让AI对齐AI,既展示了自动化研究的高效,也引发了对”谁来监督监督者”的思考。这为更安全、更可控的AI系统提供了新路径,也让AGI的想象又近了一步。

业内认为,自动化对齐让AI自己修复问题,成本从人类时薪150美元降至4美元,”递归自对齐”已成现实。但也提醒行业,AI对齐AI仍需建立监督机制。

© 版权声明
THE END
喜欢就支持一下吧
点赞6 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容