DGX Spark 极限压榨!深度优化 DeepSeek-V4:35token/s、单机承载 766K 上下文多智能体服务
英伟达开发者论坛用户 entrpi 于 7 月 15 日公开一套深度适配DGX Spark(GB10 Blackwell)的 DeepSeek-V4-Flash 推理分支 ds4-on-spark。早在 5 月初 antirez 发布原生 MLX 推理引擎 ds4 时,该开发者便在官方 CUDA 支持落地前,独立完成全套 CUDA 后端开发。上游官方引擎并未针对消费级 Blackwell 硬件做极致服务性能优化,因此作者持续迭代该分支,历经 10 周、409 次代码提交、新增 9 万余行代码,完成全栈深度优化,今日正式开源。