资讯
DeepSeek V4.1重回国产一哥!全新架构非对称Transformer,Engram用上了
📋总体概括
DeepSeek发布V4.1 Flash,跑分重回国产模型第一。该模型为552B参数MoE,采用全新Causal-Encoder-Decoder非对称架构,输入激活仅8B、输出激活16B,推理成本显著低于同尺寸模型。此次为完全重新预训练,采用新数据、更大规模强化学习后训练,并接入Engram记忆组件与新版DeepSeek Harness v0.1.5。Flash在多数评测中超越自家Pro,且首次原生支持多模态视觉理解。9月14日起所有V4 Pro请求将重路由至该模型,V4.1 Pro上线前API仅提供这一个模型。
⚡关键信息
- ▸V4.1 Flash为552B参数MoE模型,采用Causal-Encoder-Decoder非对称新架构,输入激活8B、输出激活16B
- ▸架构输入输出不对称,成本显著低于已知同尺寸模型,测试中速度明显更快
- ▸完全重新预训练,使用新数据、更大规模强化学习,训练结合DeepSeek Harness v0.1.5并接入Engram
- ▸Flash评测成绩超越自家Pro(知识容量除外),重回国产模型跑分第一
- ▸首个原生支持多模态视觉理解的正式版模型,9月14日起V4 Pro请求全部重路由至Flash
🔥犀利点评
这次DeepSeek赌的是架构而非堆料:非对称Encoder-Decoder把输入激活压到8B,本质是用结构性省钱换速度,让Flash打赢Pro不再是玄学而是算账题。风险同样明显——单一模型扛全部API流量,赌的是性价比碾压,输的是用户偏好Pro的深度场景。V4.1 Pro上线前的窗口期,就是这套新架构的压力测试场。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 华尔街见闻 阅读全文 →