资讯
国产芯片神速!寒武纪Day 0适配DeepSeek V4.1 Flash:模型发布当天就能跑
📋总体概括
寒武纪9月10日宣布基于vLLM框架完成对DeepSeek最新开源模型V4.1 Flash的Day 0适配,实现模型发布当天即可在寒武纪芯片上稳定运行。V4.1 Flash是总参数552B的MoE模型,KV缓存需求大幅下降,对HBM需求降至上一代1/4、SSD需求降至1/8,相对初代缩小437倍。寒武纪通过自研Torch-MLU-Ops算子库专项加速,并支持5D混合并行、PD分离等推理优化。此前9月8日寒武纪刚加入PyTorch基金会成为白金成员,已完成GLM、DeepSeek、Qwen、Kimi、MiniMax五大国产大模型适配。
⚡关键信息
- ▸寒武纪基于vLLM完成DeepSeek V4.1 Flash的Day 0适配,模型发布当天即可在寒武纪芯片上稳定运行
- ▸V4.1 Flash为总参数552B的MoE模型,输入侧激活仅8B、输出侧激活16B,原生具备多模态视觉理解能力
- ▸KV缓存压缩突破显著:HBM需求降至上一代1/4,SSD需求降至1/8,相对初代缩小437倍
- ▸寒武纪9月8日加入PyTorch基金会成为白金成员,与NVIDIA、AMD、Google、Microsoft等同级并获管委会席位
- ▸寒武纪已完成GLM、DeepSeek、Qwen、Kimi、MiniMax五大国产主流大模型的推理适配
🔥犀利点评
Day 0适配当然值得点赞,但别急着高潮——能跑和跑得好吃是两回事,NVIDIA生态的CUDA护城河从来不是靠「当天能跑」建立的。真正值得玩味的是寒武纪两天内连出两招:进PyTorch白金会员+秒适配热门模型,摆明了要借国产大模型热潮把软件生态的短板往死里补。KV缓存压缩437倍这类数据对国产芯片反而是利好——显存墙低了,硬件差距的叙事压力也小了。接下来就看真实吞吐和成本数据,别只交「能运行」的及格卷。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 驱动之家 阅读全文 →