Meta 的 Superintelligence Labs 昨天放出了一个 30B 参数的开源模型,叫 Muse Glimmer。Apache 2.0 许可,单张消费级 GPU 就能跑。
这个数字放在今天有点反常。30B 在 2024 年算是大模型,到了 2026 年中,大家已经习惯了千亿甚至万亿参数,Mythos 5 是 8 万亿,字节跳动在训 10 万亿。Meta 在这个节点推一个 30B 的密集模型,等于在说:你们卷你们的规模,我赌本地部署才是真正的战场。

Glimmer 的定位是"always-on local agent",目标场景是离线也能跑、随时待命的 AI Agent。训练分三个阶段:预训练用了 Muse Spark 的 logit 蒸馏,中间训练塞了大量长上下文 Agent 数据和推理轨迹,后训练结合了 SFT 和强化学习。
性能方面,它在 Agent 基准测试上跟 Qwen3.6 27B 正面竞争,工具调用(MCP-Atlas、τ-Bench)和 SWE-Bench 上有优势。量化到 4-bit 后,语言模型部分不到 20GB,给 KV Cache 和感知编码器留出了空间,24-32GB 的显卡就能跑。还带了一个 DFlash 投机解码草稿模型,RTX 5090 上提速 3.1 倍,M5 Max 上 1.8 倍。

Hacker News 社区的讨论很有意思。有人拿它跟 Qwen3.8 27B(本周刚发布)对比,怀疑 Meta 提前发布是为了抢 Qwen 的风头——"beating it is not a small achievement",kolbe 说。dofm 实际跑过之后给的评价是"a cocky bastard in tone",说模型思考和对话风格有性格,推理追踪简洁有趣。
但更值得关注的是一段关于本地模型走向的争论。mmaunder 把当前时刻比作 Nginx 取代 Apache 的时代,认为"big iron era of AI"正在转向小型便携模型。dofm 对此泼了冷水——小型模型在编程助手这类任务上仍有根本性限制,效率提升可能只是渐进式的。nbardy 则直接反对本地模型取代数据中心的说法,指出大 GPU 上的并发推理效率远高于本地独立运行。

三方的说法都有道理,这恰恰说明"本地还是云端"不是非此即彼的选择。Glimmer 的价值不在于它有多强,而在于它证明了一个 30B 的模型——如果训练目标明确、数据配方得当——可以在特定场景下跑出可用的效果。对于需要离线、低延迟、隐私敏感的应用来说,这条路比继续堆参数更实际。
参考来源: