资讯
Kimi K3 (2.8T) at 1 token/s on a MacBook Pro, streamed from four SSDs
📋总体概括
开源项目Deltafin(Argonaut Labs发布于GitHub)实现了在MacBook Pro上以约1 token/s的速度运行参数量达2.8万亿的Kimi K3模型,权重不驻留内存,而是从四块SSD硬盘中流式读取。该成果登上Hacker News(29分、10条评论),展示了一种极端省内存的大模型推理思路:用磁盘带宽换取内存容量,让消费级设备也能跑超大规模稀疏模型。
⚡关键信息
- ▸Deltafin项目在MacBook Pro上运行2.8万亿参数的Kimi K3,速度约1 token/s
- ▸模型权重从四块SSD流式读取,而非加载进内存
- ▸项目开源于GitHub(argonautlabsai/deltafin)
- ▸该讨论在Hacker News获29分、10条评论,热度尚有限
- ▸思路本质是以磁盘带宽和稀疏激活换取内存容量瓶颈的突破
🔥犀利点评
1 token/s是个「能演示」但「不能日用」的速度,跑通2.8T参数更多是工程宣言而非实用方案。它的真正价值在于验证了一条路径:如果模型足够稀疏、单token只需激活极小部分权重,磁盘流式推理就能成立。但四块SSD的带宽是硬天花板,想快十倍就得堆盘或换企业级存储,成本一算就不如租卡。方向有趣,商业化还很远。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 Hacker News 阅读全文 →