资讯
DeepSeek V4.1 Flash正式发布:性能全面超越V4 Pro 成本更低
📋总体概括
深度求索于9月10日正式发布DeepSeek V4.1 Flash,这是其全新模型结构系列中尺寸最小的一款,原生支持多模态视觉理解。该模型采用552B参数MoE架构与全新Causal-Encoder-Decoder结构,输入输出不对称设计使输入侧仅激活8B参数、输出侧激活16B参数,推理成本显著低于同尺寸模型。官方基准测试显示其多项成绩超越包括V4 Pro在内的旗舰模型。新架构旨在提升能力上限、加快推理速度,并为更大参数规模模型扩展奠定基础。
⚡关键信息
- ▸深度求索9月10日发布DeepSeek V4.1 Flash,为全新结构系列中最小模型,原生支持多模态视觉理解
- ▸采用552B参数MoE架构,引入全新Causal-Encoder-Decoder结构
- ▸输入输出不对称设计:输入侧仅激活8B参数,输出侧激活16B参数,推理成本低于已知同尺寸模型
- ▸官方基准测试显示多项成绩超越DeepSeek V4 Pro等旗舰模型
- ▸新架构为后续扩展至更大参数规模模型打下基础,经过更大规模强化学习后训练
🔥犀利点评
小模型反杀自家旗舰,这不只是参数调优,而是结构创新在兑现红利——不对称激活把MoE的成本优势真正打了出来。若官方测试口径可信,这套Causal-Encoder-Decoder架构或将迫使同行重新审视推理效率路线,拼参数堆料的军备竞赛该降温了。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 驱动之家 阅读全文 →