Kimi K3 实战对标 Fable 5:开源模型在 SWE-bench 上几乎打平了
前两天报道过一篇分析(Fable 5 比开源模型贵三倍,Anthropic 的账怎么算?),讨论 Anthropic 的 Fable 5 比开源模型贵了三倍,商业模式能不能撑住。现在有一份硬数据来了。 AI 推理平台 Fireworks AI 跑了 1030 个真实 agent 任务,把 Kimi K3(Moonshot 的开源模型)和 Fable 5 放在同一个 harness 里做了对照测试。结论很简单:K3 在 SWE-bench 类任务上拿了 92.4%,Fable 拿了 92.6%——差距不到 0.3 个百分点。但在长 agentic 循环里,K3 的成本可以...
