前两天报道过一篇分析(Fable 5 比开源模型贵三倍,Anthropic 的账怎么算?),讨论 Anthropic 的 Fable 5 比开源模型贵了三倍,商业模式能不能撑住。现在有一份硬数据来了。
AI 推理平台 Fireworks AI 跑了 1030 个真实 agent 任务,把 Kimi K3(Moonshot 的开源模型)和 Fable 5 放在同一个 harness 里做了对照测试。结论很简单:K3 在 SWE-bench 类任务上拿了 92.4%,Fable 拿了 92.6%——差距不到 0.3 个百分点。但在长 agentic 循环里,K3 的成本可以做到 Fable 的五十分之一。

这个测试不是跑几个 math benchmark 就收工的。1030 个任务分成五类:SWE 类真实仓库 bug 修复(460 题)、终端运维类长链路操作(安全、加密、逆向、系统管理)、算法题、六语言交叉实现、法律 agent 任务。每个任务都是完整 agent 循环,不是单次推理。
两个模型各有强项。K3 在符号数学和开发工具链上更强,终端任务里拿了 11 个 solo win(Fable 7 个),安全加密类集群里表现突出。Fable 在 Web 和数据可视化上更好,Java、Python、C++ 领先于 K3。但 JavaScript 和 Rust 基本持平。
真正有意思的不是单挑,是路由。Fireworks 做了一个 oracle router——每次任务选更便宜的那个正确模型。结果 93% 的通过率,高于任何一个单模型。K3 被选中了 72-96% 的任务,这意味着大多数时候开源模型就够用了。


为什么 K3 token 量更大(SWE 平均 55 轮、130 万 token vs Fable 的 21 轮、13 万 token)但成本反而低?Prompt caching 是答案。K3 虽然轮数多、token 多,但命中的基本都是缓存,实际推理成本极低。Fable 在终端任务里反而容易螺旋——64 轮、150 万 token,经常超时,成本翻了十倍不止。


Fireworks 的结论很直白:「单一模型既浪费,也不再是最佳方案。」它建议把 K3 作为默认底座,大部分任务开源模型已经够强了,只有少数复杂场景才路由到 Fable 级别的闭源模型。路由层本身才是护城河。
这份测试的背景值得留意。Fireworks 是推理平台不是模型厂,K3 和 Fable 都在它上面跑,它没有站队的动力。Moonshot 上周刚宣布 K3 会开源权重,这意味着任何推理服务商都能部署,闭源模型的价格压力只会更大。
参考来源: