资讯

国产芯片神速!寒武纪Day 0适配DeepSeek V4.1 Flash:模型发布当天就能跑

驱动之家·2026/9/10 07:33:00🔗 原文

📋总体概括

寒武纪宣布基于vLLM推理框架完成对DeepSeek最新开源模型V4.1 Flash的Day 0适配,实现模型发布当天即可在其芯片上稳定运行。该模型为552B参数MoE架构,KV缓存相对初代缩小437倍,对HBM需求降至上代1/4。寒武纪通过自研Torch-MLU-Ops算子库与5D混合并行等技术优化推理效率,并已适配GLM、DeepSeek、Qwen、Kimi、MiniMax五大国产主流大模型,两天前还加入PyTorch基金会成为白金成员。

关键信息

  • 寒武纪基于vLLM完成DeepSeek V4.1 Flash的Day 0适配,模型发布当天即可在寒武纪芯片上稳定运行
  • V4.1 Flash为总参数552B的MoE模型,采用全新Causal-Encoder-Decoder结构,输入侧激活仅8B、输出侧激活16B,原生支持多模态视觉理解
  • KV缓存压缩突破显著:对HBM需求降至上一代1/4,SSD需求降至1/8,相对初代模型KV缓存缩小437倍
  • 寒武纪9月8日加入PyTorch基金会成为白金成员,与NVIDIA、AMD、Google Cloud、Microsoft等同一级别,并在管委会拥有席位
  • 寒武纪已完成GLM、DeepSeek、Qwen、Kimi、MiniMax五大国产主流大模型的推理适配,覆盖智谱、阿里、月之暗面等五家厂商

🔥犀利点评

Day 0适配听上去风光,本质是国产芯片的生存刚需——没有与开源模型同步的软件栈,硬件再强也没人敢用。寒武纪借vLLM和PyTorch白金 membership补生态短板,思路是对的;但真正考验不在发布日跑通,而在稳定商用场景下的性能与成本能否打动客户。KV缓存压缩降低了硬件门槛,对国产芯片是利好,可别把一天适配吹成生态翻身仗。

本文由本站自动聚合,以下为原始来源:前往 驱动之家 阅读全文