资讯

RTX 4060 跑 35B 模型,每秒 39 Token?伯克利、MIT 联手开源 FreeToken

InfoQ中文·2026/9/5 17:00:00🔗 原文

📋总体概括

伯克利与MIT团队联合开源推理加速框架FreeToken,宣称能让RTX 4060这类消费级显卡跑动35B参数大模型,并达到每秒39 Token的生成速度。该工作的意义在于把大模型推理门槛从数据中心级硬件拉低到家用显卡级别,为端侧和低成本部署提供了新路径,也回应了具身智能与机器人领域对本地实时推理的刚需。

关键信息

  • 伯克利与MIT联合开源推理框架FreeToken
  • 在RTX 4060上运行35B参数模型,生成速度达每秒39 Token
  • RTX 4060为入门级消费显卡,显存有限,跑35B模型本身即是突破
  • 技术方向指向低成本、端侧大模型推理部署

🔥犀利点评

每秒39 Token对交互场景够用了,问题在于代价:低显存跑35B大概率靠量化加offload,长上下文和批处理表现如何、实际精度损失多大,demo和量产之间隔着一条鸿沟。但对机器人圈这是真刚需,具身智能等不起云端往返延迟,让便宜显卡跑大模型比刷榜有价值得多,值得盯后续实测。

本文由本站自动聚合,以下为原始来源:前往 InfoQ中文 阅读全文