会懂网AI资讯获悉,9月3日,Meta Superintelligence Labs此前开源的Muse Glimmer模型持续引发开发者关注——这是一个约300亿参数、采用Apache 2.0许可的开放权重智能体模型,主打“始终在线的本地Agent工作流”。它从更大的Muse Spark蒸馏而来,经约4-bit量化后可在单张24GB显存的消费级GPU或Apple Silicon Mac上运行,无需联网。

这是Meta继今年4月以闭源的Muse Spark取代Llama之后,首个完全开放的权重发布;其许可甚至比Llama当年更宽松——Apache 2.0没有月活上限等附加条款,允许无条件的商业使用、修改与再分发。扎克伯格在X上发文称“很快也会开放Muse Spark 1.2的权重”,意味着整个Muse家族的开放序幕正在拉开。
Muse Glimmer不是通用聊天机器人,而是围绕“智能体循环”训练的:制定计划、调用工具、解读结果、失败恢复。它内置约18亿参数的ViT-G/14视觉编码器,可读取截图、图表与文档,支持超过100种语言,上下文长达13万token,知识截止2026年1月4日;音频不支持,视频按单帧处理。开发者可在系统提示里选择低、中、高、极高四档推理强度,按任务权衡质量与速度。
把30B塞进24GB是关键工程故事。全精度下它需要逾55GB显存,Meta用约4-bit量化把语言模型压到20GB以内,为KV缓存、视觉编码器与推测解码模型留出余量。配套的DFlash块扩散草稿模型一次前向提出16个token、主模型并行验证,在RTX 5090上将吞吐从74.9提升至233.4 token/秒,约3.1倍加速;M4 Max、M5 Max同样获得明显提速。权重已在Hugging Face放出BF16、GGUF与ExecuTorch版本,llama.cpp、MLX、vLLM、Ollama、LM Studio等首日支持。
基准上,Muse Glimmer在MCP Atlas(75.5)、DeepSearch QA(74.6)、SWE-Bench Pro(51.2)领先Google Gemma4-31B与阿里Qwen3.6-27B;但在OSWorld-Verified、TerminalBench等“驱动桌面与终端”任务上落后于Qwen。安全侧,Siren AgentDojo攻击成功率28.4、效用94.2;Meta称其未达自家前沿AI定义,化学/生物、网络与控制权丧失风险评为中度或更低。会懂网判断,Glimmer把“私有化、离线、低延迟”的Agent能力交到开发者手里,是本地智能体走向普及的一块重要基石。




















暂无评论内容