开发者写了一篇博客,通过分析 Claude 和 GPT 系列模型的知识截止日期,来推断它们的实际预训练时间线。方法很简单:问模型一系列事件发生在什么时候,看它知道什么、不知道什么,从中画出知识边界。

结果发现了一些有趣的模式。模型的知识截止日期并不总是与官方给出的版本号匹配——有时一个模型声称是某个版本,但知识截止日期暗示它实际上是在更早或更晚的时间点训练的。AI 实验室发布模型的时间点,与模型完成训练的时间点之间,可能存在一个显著的延迟。


这个延迟引发了社区最核心的争论:模型厂商是否在"囤积"已训练好的模型,等待"合适的时机"才发布?
myworkaccount2 提出了这个疑问。simonw 反驳说,在竞争如此激烈的环境下,等待弊大于利——如果你手里有"最佳"模型,可能只有几周的窗口期,应该尽快发布以最大化领先时间。但 sshh12 的数据暗示,延迟确实存在,至少在某些模型上能观察到。
tobwen 提出了一个更细微的假设:模型对不同领域可能有不同的知识截止时间。历史文献几乎不变,技术知识定期更新,名人八卦则始终紧跟最新动态。但 sshh12 回应说,至少在编程知识与世界事件事实之间,他并未观察到明显的截止日期差异。tobwen 补充了一个具体测试案例:模型对 2024 年 6 月后的软件功能不熟悉,但知道 2025 年 4 月教皇去世的细节——却不知道特朗普第二次宣誓就职的具体时间。这说明知识截止日期本身可能也是不均匀的。
ddxv 指出了一个"黑箱"问题:像 "Opus 5" 这样的营销名称可能对应多个模型版本,而且有些问题可能被路由到更简单的模型处理。tedsanders(OpenAI 员工)解释了 OpenAI 的做法:API 中的模型保持固定不变,但 ChatGPT 中有时会静默更新模型,仅在重大变化时更换名称——"只是为了不让人们因为追踪小变化而疲惫"。
rad-b 对 Anthropic 声称未蒸馏 ChatGPT 进行训练的说法表达了怀疑,认为在 GPT-4 时代,当时处于劣势的 Anthropic 很可能这样做过。这是一个无法验证的质疑,但从知识截止日期的角度,蒸馏问题确实会混淆分析——如果模型通过蒸馏而非直接训练获得了某个知识,它的"知识截止日期"可能比实际训练时间晚。
参考来源: