腾讯混元 Hy4 开源轻量版:770B 权重压缩至 214GB,端侧跑通

会懂网AI资讯获悉,9月3日,腾讯混元交出一份让端侧圈眼前一亮的答卷:团队把 Hy4 preview 的模型权重从接近 1.5TB 压缩到约 214GB,让原本只能在数据中心跑的 770B 参数旗舰,第一次能被消费级硬件带动。这意味着“大模型端侧化”不再只是口号,而是有了可复现的工程路径。

压缩的核心是自研的 Sherry 稀疏三值量化。团队把四个权重编成一组、平均压到 1.25 比特,再用 MIX-STQ1_0 按各层敏感度逐层分配混合精度——对敏感层多给一点比特,对冗余层狠狠砍。实测下来,主流评测与 BF16 原版只差一两分,检索类基本不掉点,性价比相当能打。

腾讯混元 Hy4 开源轻量版:770B 权重压缩至 214GB,端侧跑通插图

更直观的是落地门槛。在“4090 笔记本 + 四卡 A4000”的异构联合推理下,Hy4 轻量版能跑到 1.02 token/s。速度不算快,但证明了一件事:不用堆机房,普通开发者的桌面就能跑起旗舰级模型。配合开源权重上架 HuggingFace、腾讯云和 OpenRouter,社区立刻有了把玩和二开的入口。

价格也顺势亲民。Hy4 preview 在 OpenRouter 上定价约 0.834 美元/百万输入 token,770B 总参数里只有 49B 被激活,走的是“大总参、小激活”的MoE路线。对预算敏感的中小团队,这种“贵模型、便宜用”的组合,比一味堆参数更务实。

这件事的行业意味在于,开源大模型的竞争维度正在从“谁分数高”转向“谁跑得动”。当旗舰能被塞进消费级硬件,端侧推理的应用想象空间会被彻底打开——隐私数据不必上云、离线场景也能用、边缘设备终于有了真脑子。

会懂网观察到,混元这一步和同期讯飞星火 X2.5 端侧模型形成呼应:国产大模型正从云端和端侧两端同时逼近实用化。谁先把“够用且跑得动”的模型送到开发者手里,谁就握住了下一轮生态的门票。

© 版权声明
THE END
喜欢就支持一下吧
点赞14 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容