会懂网AI资讯获悉,谷歌DeepMind与新加坡联合推出全球首个AI双盲评估机制。在这一评估机制下,评估双方均无法看到对方的秘密信息——无论是提示词还是模型权重,从而为前沿模型的能力评测引入了可信的对照机制,避免”刷榜”和评测信息泄露带来的偏差。
AI模型的评测历来面临一个尴尬:模型厂商提前知道评测题目,或评测机构了解模型细节,都可能导致结果失真。双盲评估通过双向信息隔离,让模型在”不知道被考什么”的状态下接受检验,也让人类评审在”不知道考的是谁”的情况下打分,尽可能还原模型能力的真实水平。
这一机制的推出,正值全球大模型”榜单之争”愈演愈烈。从LMArena到OpenRouter,各类排行榜成为模型厂商比拼的竞技场,匿名”影子发布”、付费刷榜等现象也随之出现。双盲评估的出现,为建立更可信的评测体系提供了新范式,也让”谁是真正的最强模型”有了更经得起推敲的答案。
业内分析认为,AI双盲评估机制的意义不仅在于技术评测本身,更在于为AI治理提供基础设施。当AI能力评测拥有可信的标尺,无论是政府监管、行业准入还是企业选型,都能建立在更扎实的数据基础上。随着各国对AI安全评估的需求增长,双盲评估有望成为国际AI治理合作的新工具。
从评测体系看,双盲评估机制的出现,也对现有的AI榜单格局构成挑战。目前OpenRouter、LMArena等平台的榜单,很大程度上依赖用户投票和公开测试,评测公平性备受关注。双盲机制通过双向信息隔离,为”谁更强”提供更可信的答案,有望推动行业形成更规范、更可比的评测标准。对于企业选型而言,基于双盲评估的第三方结果,也将比营销宣传更具参考价值。






























暂无评论内容