比它聪明的没它便宜,比它便宜的——哦,没有比它便宜的。
Artificial Analysis 更新了 DeepSeek V4 Flash 0731 的完整评测。一张 Intelligence Index vs Cost per Task 的散点图上,13 个模型排成一列,V4 Flash 贴着底部:$0.03 一次任务。

V4 Flash 的 Intelligence Index 得分 50,在 101 个模型中排第 3。排在它前面的:Claude Opus 5(61 分)、Claude Fable 5(60 分)、GPT-5.6 Sol(59 分)、Kimi K3(57 分)、Grok 4.5(54 分)。然后是一串 51 分和 50 分的模型——GLM-5.2、Muse Spark 1.1、Gemini 3.6 Flash、MiniMax-M3,以及 DeepSeek 自家的 V4 Pro。
但看价格列。Claude Opus 5 每次任务 $2.34,GPT-5.6 Sol $1.86,Kimi K3 $0.86,Grok 4.5 $0.69。V4 Flash:$0.03。Opus 5 多 11 分,贵 78 倍;GPT-5.6 Sol 多 9 分,贵 62 倍。能和它拼价格的只有 DeepSeek V4 Pro($0.05),但 V4 Pro 智力得分也是 50。Flash 干翻了 Pro,还更便宜。
架构没变。MoE 284B 总参数,13B 激活参数,跟预览版一模一样。DeepSeek 纯粹靠重新后训练把分数拉了上来。上下文窗口 100 万 token,缓存命中价格 $0.003/百万 token,降了 98%。MIT 开源,权重已上传至 Hugging Face。

Hacker News 社区里的讨论主要集中在两点。一是有人把 OpenAI 前天的价格前沿图更新了——把 V4 Flash 0731 标上去,它正好踩在帕累托前沿上。二是有人提到 DeepSeek 的 Harness 框架(即将发布),这次跑分用的就是它,Code Agent 基准测试用 minimal 模式跑。评论区有人总结:"V4 Flash 是我的 daily driver,一整天写代码就花几分钱,完全没有 token 焦虑。"
把 13 个顶级模型的智力得分和成本放在一起看,V4 Flash 是唯一一个存在「反向定价」问题的模型——不是贵,是便宜到让人怀疑。13B 激活参数,排进全球前三,每次任务 3 美分。这不是「便宜替代品」,这是在一条完全不同的性价比曲线上。
参考来源: