资讯

一台跑不动就上16台!英伟达DGX Spark集群成功跑通Kimi K3:生成速度达38 t/s

驱动之家·2026/9/5 03:13:00🔗 原文

📋总体概括

英伟达开发者论坛用户ciprianveg近日用16台DGX Spark组成集群,成功运行完整的Kimi-K3大模型,在16000深度下生成速度达38 t/s。DGX Spark本是面向本地AI开发推理的桌面设备,单台算力与显存难以承载Qwen、DeepSeek等千亿参数模型。该项目通过增加节点实现多机并行,用一台MikroTik CRS804-4DDQ核心交换机搭配4根400G转4×100G分支线缆完成互联,基于Inferact/Kimi-K3-DSpark环境以分布式方式首次启动模型,验证了桌面设备堆叠跑大模型的可行性。

关键信息

  • 开发者论坛用户ciprianveg用16台DGX Spark组成集群,成功跑通完整Kimi-K3大模型
  • 系统在16000深度下最高生成速度达38 t/s
  • 网络采用一台MikroTik CRS804-4DDQ核心交换机加4根400G转4×100G分支线缆串联全部GB10节点
  • 运行环境为Inferact/Kimi-K3-DSpark,模型以分布式方式首次启动
  • DGX Spark单台资源难以满足千亿参数模型需求,Qwen、DeepSeek等模型普及放大了这一矛盾

🔥犀利点评

38 t/s听着热闹,本质是拿16台桌面设备的钱和功耗硬堆出一个勉强能用的推理节点,性价比远不如租云算力或直接买数据中心级卡。但这事的真正意义不在性能,而在于证明了GB10生态能靠多机互联扩展,大模型本地化的门槛正在从资金问题变成工程问题。开源模型越来越肥,桌面玩家只能靠堆机器追赶,这本身就说明端侧算力供给已经落后于模型膨胀速度。

本文由本站自动聚合,以下为原始来源:前往 驱动之家 阅读全文