资讯

Perplexity Open Sources Lily: A Rust + Metal Inference Engine for Qwen3.6-35B-A3B on Apple Silicon

marktechpost.com·2026/9/3 06:57:07🔗 原文

📋总体概括

Perplexity开源了其Perplexity Computer中Hybrid Compute功能背后的本地推理引擎Lily。该引擎用Rust编写,配备定制Metal内核,专为单一模型Qwen3.6-35B-A3B和Apple Silicon芯片家族深度优化。在40核、128GB内存的M5 Max上测试,Lily的平均prefill吞吐量达到MLX-LM的1.23倍,decode吞吐量达到其1.35倍。这表明针对特定模型与硬件的垂直优化可以显著超越通用推理框架,同时也反映出端侧AI推理竞争正从通用框架转向深度软硬协同定制。

关键信息

  • Perplexity开源本地推理引擎Lily,是Perplexity Computer中Hybrid Compute功能的底层引擎
  • Lily采用Rust编写,使用定制Metal内核,专为单一模型和单一芯片家族优化
  • 在40核、128GB的M5 Max上,prefill吞吐量为MLX-LM的1.23倍,decode吞吐量为1.35倍
  • 针对模型Qwen3.6-35B-A3B在Apple Silicon上的端侧推理进行了垂直优化

🔥犀利点评

1.23倍和1.35倍的提升不算颠覆,但值得玩味的是路径选择:Lily赌的是『一个模型配一套内核』的极致定制,而非MLX式的通用框架。这其实是把推理引擎做回了手工打磨时代——能开源说明Perplexity想借社区续命生态,同时也暴露了通用框架在端侧性能上的天花板。后续看点只有一个:模型迭代速度远快于内核打磨速度,这种定制路线的维护成本会不会反噬?

本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文