Flash Attention 2 可能比我们所有人都活得久。
这句话不是来自某个技术博客,而是出自 Hieu Pham 的一条推文。Hieu Pham 是谁?他是 xAI 的早期工程师之一,在 Grok 训练基础设施团队工作过。近日他在 X 上发了一条帖子,列出了他认为现代 AI 领域最重要的三个开源项目。
第一个名字毫无悬念:Flash Attention 2。
Hieu 的理由很具体。FA 系列不需要解释,但 FA2 是他认为最重要的一个——复杂度恰到好处,刚好能驱动你去学 CuTe,但还没被那些"邪恶的" Hopper++ 优化所淹没,足够容易修改和适配。
更关键的是 FA2 的持久性。Hieu 说,他敢打赌世界上很多地方的人还在 Blackwell GPU 上跑 FA2,因为写出一个能击败 FA2 的 kernel 仍然太痛苦了。他引述了一位 kernel 大师的话:"FA-2 可能比我们所有人都活得久。"
这话听着夸张,但想想也合理。FA2 发布于 2023 年,三年过去,它仍然是大多数推理框架的默认注意力实现。一个 kernel 的寿命通常以月为单位,FA2 跨过了三代 GPU 架构,V100、A100、H100、B200 都能跑,而且性能不差。在 GPU kernel 这个领域,三年就是永恒。
第二个是 SGLang。
SGLang 是这两年崛起最快的推理框架之一。它的 RadixAttention 前缀缓存机制让它在 H100 上比 vLLM 高出 29% 的吞吐量。但 Hieu 对 SGLang 的感情很复杂——他直言有时厌倦了 SGLang 的代码复杂度,暗自希望 Mini-SGL 能够成为主流。但他随即补了一句:"然后我就从白日梦中醒来了。"
这个态度很真实。SGLang 近半年发展迅猛,但代码库的膨胀速度同样惊人。有社区成员在评论区提供了一组数据:SGLang 的 RadixAttention 在 H100 上比 vLLM 高出 29% 吞吐量,但 vLLM 的贡献者基数仍是 SGLang 的 3 倍。这种"性能领先但社区规模落后"的格局,也解释了为什么 Hieu 会希望有一个更轻量的 SGLang 替代品。
Banghua Zhu 在评论区补充得更有趣:"也许等 LLM agent 比现在强 10 倍的时候,我们会看到一个 Mini-SGL 成为主流 SGLang 的世界,每个人只需要在它上面 vibing 就够了。" Ying Sheng(SGLang 的核心作者之一)也出现在评论区,简单回了一句"Agreed with Banghua lol"。
第三个,也是最有争议的一个:DeepSeek v3。
Hieu 没有谈 DeepSeek 的技术细节,甚至说他通常不关心原始论文里那些模型的实现。他在乎的是"开放权重,以及它所点燃的、让开放性持续下去的火花"。
"这是导致所有后续时刻的时刻。"(It's the moment that leads to all the following moments.)
这句话的分量在于时间点。DeepSeek v3 发布于 2024 年底,之后发生了什么?DeepSeek R1 开源了推理模型,各大厂商跟进;开源社区开始认真挑战闭源模型的能力边界;国内和全球的开源模型生态进入了一个前所未有的活跃期。把这些事件串起来,Hieu 的判断就不是空话——DSv3 确实是那个"引发所有后续时刻的时刻"。
评论区也有不同的声音。有人提名 PyTorch/JAX——这个级别的项目确实更底层,影响面更广。也有人提名 vLLM。但 Hieu 的选择显然不是在做"影响力排名",而是有明确的个人标准:什么项目真正改变了 AI 开发者的工作方式,而且这种改变是持久的、不可逆的。
Flash Attention 2 让高效注意力计算从论文走进每一个生产环境。SGLang 让推理服务从一个"能跑就行"的问题变成了一个需要精细优化的工程领域。DeepSeek v3 让开放权重模型从"还行"变成了"可以打"。
这三个项目串在一起,恰好勾勒出了现代 AI 基础设施的骨架:高效计算(FA2)、高效服务(SGLang)、开放模型(DSv3)。
参考来源: