会懂网AI资讯获悉,9月1日,腾讯混元团队推出Hy4 preview轻量版,将旗舰MoE模型Hy4 preview的权重从接近1.5TB压缩至约214GB,并同步在Hugging Face与GitHub开源,支持llama.cpp、vLLM、SGLang等主流推理框架。
压缩依托两项自研技术:其一是Sherry稀疏三值量化,将每4个路由专家权重分为一组,量化为{-1,0,1}并用5比特索引编码,平均每个权重仅1.25比特;其二是MIX-STQ1_0混合精度策略,依据校准数据逐层判断敏感度,敏感层保留IQ2_XXS、不敏感层采用更激进的STQ1_0,在不增加平均比特预算下降低量化误差。
实测显示,量化版与BF16原版差距仅一两分:长文理解与多轮长上下文检索基本持平,数学能力小幅回落,MCP-Atlas得分从83.7微降至83.2。这意味着压缩后的模型仍能覆盖日常编程辅助、工具调用、长文档处理与常规问答。

更关键的是部署门槛的坍塌。腾讯混元基于prima.cpp验证了一套异构设备联合推理方案:一台4090笔记本与一台四卡A4000服务器(显存合计80GB、内存64GB,分处两个局域网),协同跑通214GB模型,速度达1.02 token/s,比笔记本单机offload快约6倍。
业内认为,此举为资源有限的开发者提供了运行旗舰大模型的新路径——不必采购整套同构高端硬件,用手边异构设备拼接即可。当超大MoE模型从”只配跑在高端集群”走向”消费级设备可部署”,开源大模型的实用边界被显著拓宽。
这也呼应了行业对“大模型平民化”的期待:当旗舰模型的运行门槛从整机房降到几张消费级显卡,开发者生态与二次创新将被显著激活,开源的价值不再只是“能下载”,而是“真能用”。




















暂无评论内容