Perplexity开源端侧推理引擎Lily:为Qwen3.6在苹果芯片上深度定制

会懂网AI资讯获悉,9月4日,Perplexity开源了端侧推理引擎Lily。它采用Rust运行时加手写Metal内核,为Qwen3.6-35B-A3B在Apple Silicon上做了深度定制,执行路径中不依赖PyTorch或MLX。

Perplexity Lily 端侧推理

官方给出的数据很直接:在M5 Max上,Lily的prefill吞吐约为MLX-LM的1.23倍,decode约为1.35倍;4-bit量化权重仅19.4GB,意味着一台32GB内存的Mac就能把模型完整跑起来。对端侧推理而言,这两个数字分别对应“等得久不久”和“能不能装上”。

Lily的意义不在跑分本身,而在路线选择:不为通用性妥协,而是围绕单一模型、单一硬件做极限优化。当模型架构与推理引擎在同一目标下协同设计,省下的往往是通用框架中大量无谓的抽象开销。这也解释了为什么它能为一款开源模型做定制——模型是公开的,优化成果也能被社区复用。

端侧推理的价值在2026年被反复验证:数据不出设备、离线可用、没有按Token计费的账单。尤其在代码、文档与个人知识库这类高敏感场景,本地运行几乎是唯一可接受的形态。苹果统一内存架构恰好提供了“大内存、低功耗”的土壤,让35B级别的模型第一次真正可用。

另一个值得注意的细节是许可与生态。开源意味着任何人都可以审阅、修改并复用这套引擎,社区有机会针对不同模型与硬件做适配;而对Perplexity自身,这也是一次低成本的技术品牌输出——在模型能力越来越难拉开差距的当下,推理效率正在成为新的差异化战场。

会懂网判断,端侧推理正从极客玩具走向主流选项。它的上限受内存与功耗约束,但下限足够高——足以承接大量日常任务。对云厂商而言,这不是替代,而是分层:敏感与高频任务留在本地,重算力任务仍旧上云。Lily这类引擎,正是这条分层路线上最关键的“最后一公里”。

© 版权声明
THE END
喜欢就支持一下吧
点赞6 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容