资讯
DeepSeek AI Released DeepSeek-V4.1-Flash with 1M Context, FP4 KV Cache, and Cross-Layer Attention Reuse
📋总体概括
DeepSeek AI 发布 DeepSeek-V4.1-Flash,一款多模态混合专家模型,骨干参数552B,另有196B Engram参数,支持100万token上下文窗口。该模型针对长程智能体带来的输入密集型推理负载设计,围绕KV缓存这一瓶颈,采用FP4 KV缓存与跨层注意力复用等工程技术,以缓解百万级上下文对HBM显存、SSD容量和带宽的巨大压力,是面向Agent时代推理效率的针对性优化之作。
⚡关键信息
- ▸DeepSeek-V4.1-Flash为多模态MoE模型,骨干参数552B,另有196B Engram参数
- ▸支持100万token上下文窗口,瞄准长程智能体工作负载
- ▸采用FP4 KV缓存与跨层注意力复用技术降低推理资源消耗
- ▸设计动因是重复prefill和百万token上下文导致KV缓存挤占HBM、SSD容量与带宽
🔥犀利点评
这份稿件点破了一个行业真相:Agent时代推理成本大头不在算力而在内存与带宽。DeepSeek不在参数上内卷,而是把FP4 KV缓存和跨层注意力复用当成主卖点,说明其对系统级优化的押注已领先同行半个身位。所谓Flash,重点根本不是快,而是让百万上下文在经济上跑得起。不过196B Engram参数究竟是什么架构,原文语焉不详,还需实测验证成色。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文 →