OpenAI 宣布 GPT-5.6 Luna 价格下降 80%。输入从每百万 token 1 美元砍到 0.2 美元,输出从 6 美元砍到 1.2 美元。GPT-5.6 Terra 降 20%。旗舰 Sol 没降,但加了一个 Fast 模式——2.5 倍速度,2 倍价格,智商不变。

降价的理由不是市场竞争,不是清库存,是 Sol 自己把自己优化了。
这事分两步。第一步,OpenAI 把 GPT-5.6 Sol 部署上线。第二步,让 Sol 通过 Codex 自己去优化自己的推理基础设施。Sol 学了 Triton 和 Gluon 两种 GPU 编程语言,重写了生产环境的 GPU 内核,找出了哪些计算可以预计算、可以跳过、可以并行。重写的内核全部通过 FpSan 浮点精度校验才上线。端到端服务成本降了 20%。
然后 Sol 又自己设计了上百次 speculative decoding 架构实验,测试不同大小的草稿模型、不同结构、不同特征组合。实验跑着跑着硬件挂了或训练不稳定了,Sol 自己监控、自己处理。Token 生成效率提了 15% 以上。
还有 KV Cache 配置优化、负载均衡策略调优——这些以前是人类工程师手动调的参数空间,太大,调不过来。Sol 自己试、自己评估、自己上线。
这个闭环是:更强的模型优化了自己的推理效率 → 成本降低 → 同样的硬件能服务更多用户 → 更多用户反馈更多优化空间。一个正向飞轮。
把这些收益算清楚之后,OpenAI 直接改价格。同一天,Auto-review 从 GPT-5.4 升级到 GPT-5.6 Luna——结合 Luna 的新定价,审查成本大约降到原来的十分之一。Codex 和 ChatGPT Work 的用量计算方式也同步调整,让降价真正体现在账单上。
时机耐人寻味。同一天,DeepSeek V4 Flash 正式版上线,MoE 284B、激活 13B,Agent 能力全面碾压自家四月发的 Pro Preview。Luna 降到 0.2 美元之后,跟 DeepSeek 的价格差已经被拉到了一个很窄的区间。三周前 OpenAI 定价时大概没想过 Luna 会卖这个价——是 Sol 自己动手优化之后,才有这个降价空间。
国内 AI 圈最近流行一个说法:国产大模型的价格倒逼了 OpenAI。不管这个叙事准不准确,GPT-5.6 Sol 自我优化这件事说明了一件事——OpenAI 的降价不是被动出血,是效率提升后主动让利。这跟烧钱抢市场是两码事。
当然,没必要过度神话。Sol 优化的不是自己的神经网络权重——不是递归自我改进——它优化的是跑模型的卡车和路线,不是车上装的货。内核重写经过了自动化验证和人类审查才上线。OpenAI 的工程师决定目标、授予工具权限、把握部署节奏。这不是 AI 觉醒,是 AI 辅助工程效率的极致案例。
但方向是明确的。如果每一代新模型上线后都能自动优化上一代模型的推理成本,那么大模型的单位智能成本下降曲线会比摩尔定律更快。GPT-5.6 只用了三周就给自己砍了 20% 的运维成本。下一代呢?
参考来源: