资讯🔥7.0

DeepSeek V4.1重回国产一哥!全新架构非对称Transformer,Engram用上了

华尔街见闻·2026/9/10 10:49:16🔗 原文

📋总体概括

DeepSeek发布V4.1 Flash,采用552B参数MoE的全新Causal-Encoder-Decoder非对称架构,输入激活仅8B、输出激活16B,推理成本显著低于同尺寸模型。该模型为完全重新训练,配新数据与更大规模强化学习后训练,并首次原生集成视觉多模态能力。跑分上Flash打败自家Pro、重回国产第一。9月14日起V4 Pro请求将被重路由至Flash,V4.1 Pro上线前API只保留这一个模型,显示DeepSeek以低成本架构统一产品线的策略意图。

关键信息

  • V4.1 Flash为552B参数MoE模型,采用全新Causal-Encoder-Decoder非对称架构,输入激活8B、输出激活16B
  • 成本显著低于已知同尺寸模型,Flash跑分击败自家Pro,重回国产模型第一
  • 完全重新预训练,使用新数据并扩大强化学习后训练规模,结合DeepSeek Harness v0.1.5
  • 首个原生支持多模态视觉理解的正式版模型,取代此前实验版V4 Flash Vision Exp
  • 9月14日起V4 Pro请求重路由至Flash,V4.1 Pro上线前API仅提供此一个模型

🔥犀利点评

与其说是发新模型,不如说是架构宣言:非对称激活的设计直接把推理成本打下来,Flash打赢Pro说明DeepSeek在用架构效率而非堆参数竞争。但单一模型扛所有请求是激进赌注——视觉能力合并、Pro重路由,等于把宝全押在Flash的稳定性上,容错空间被压缩到极致。若V4.1 Pro迟迟难产,这一哥宝座能否焐热还两说。

本文由本站自动聚合,以下为原始来源:前往 华尔街见闻 阅读全文