资讯

Baseten Adds DeepSeek-V4.1-Flash to Model APIs With 1M-Token Context

unite.ai·2026/9/11 22:24:02🔗 原文

📋总体概括

2026年9月11日,推理服务商Baseten宣布在Model APIs平台上线DeepSeek-V4.1-Flash。该模型为DeepSeek于9月9日发布的552B参数多模态MoE模型,预填充阶段激活8B参数、解码阶段激活16B参数,支持100万token上下文窗口,接受文本与图像输入并生成文本输出,模型开放权重已托管于Hugging Face,开发者现可在Baseten平台上直接调用该模型进行推理部署。

关键信息

  • Baseten于2026年9月11日在Model APIs上线DeepSeek-V4.1-Flash,距DeepSeek官方发布仅两天
  • 模型为552B参数的多模态MoE架构,预填充激活8B参数、解码激活16B参数
  • 支持100万token上下文窗口,接受文本和图像输入,输出文本
  • DeepSeek已在Hugging Face开放模型权重,官方公告日期为2026年9月9日

🔥犀利点评

老规矩还是MoE的稀疏激活戏法:552B总参数撑门面,实际干活只有8B到16B,推理成本对服务商友好。但预填充和解码用不同激活参数量的设计,对推理框架的调度能力是真考验,Baseten敢两天内跟进上线,说明其工程化能力在二线推理商里还算能打。真正的问题是:Flash这种轻量激活版本,和满血版到底差距多大,没人给出数据。

本文由本站自动聚合,以下为原始来源:前往 unite.ai 阅读全文