腾讯混元团队宣布正式全链路开源 AngelSpec,一个覆盖 drafter 训练、架构设计到线上部署的投机解码框架。本次将训练工具 + Hy3-A21B的 MTP / DFly drafter 权重与训练代码一次性放出。
公告称,新一代 drafter DFly 取得新 SOTA,4–64 全并发档位、六大 benchmark 均取得更高吞吐,较 AR 基线平均加速 1.98–2.40×(代码/数学峰值 2.86×),比 DFlash 再快 10.5–11.8%;平均接受长度较 DFlash +30%、约为 MTP 的 1.6 倍。
D-cut 榨干高并发,线上真实流量额外提升 +15.7% 吞吐;MTP + TTT 攻克对话场景训练-推理不一致,平均接受率 52.8%→66.4%、接受长度 2.58→2.99。从训练到线上,把投机解码的加速真正做到端到端可用。

DFlash 以扩散方式并行生成 block 内所有 token,draft 延迟几乎与 block 长度无关,但它有个短板:所有 draft 层共享同一份 target 上下文,且 block 内 token 互相不可见、后段接受率快速衰减。
DFly 针对性地做了三项改进:
- 混合 target 条件注入:结合 DFlash 的全连接共享投影(跨层交互)与 DFlare 的逐层加权融合(层特异性视角),每个 draft 层同时获得全局语义和匹配自身深度的 target 特征。
- 隐状态校正自回归头:并行主干之上加一个轻量校正头,用前一位置已选 token 修正当前位置的分布。主干保持全并行,只有这个小头从左到右执行。
- 面向接受率的训练目标:先用 D-PACE 加权的 LK 损失冷启动,再切换到端到端 TV 损失,直接优化期望接受长度。
三项叠加后,DFly 平均接受长度达 4.79,明显高于 DFlash 的 3.69 和 MTP 的 3.00;在结构性强的场景优势更大,Math500 达 5.23,HumanEval 达 5.52。

长 block 有一个部署侧代价:高并发下 target 验证成为计算瓶颈,被拒绝的 draft 后缀白白占用 batch 容量。实测 DFly 在并发 48 之后吞吐饱和,继续加并发只会拖慢每用户速度。
D-cut 在每个解码步做两件事:
- 用 drafter 的逐 token 置信度估计各请求在不同验证深度下的期望推进量,跨请求全局排序,保留收益最高的前缀;
- 结合启动时预先测好的延迟表,选择「期望收益 / 实际成本」最大的验证比例。

效果上,负载低时自动保留深 draft,负载高时主动裁剪。在 Hy3线上流量回放中,并发 48/56/64 相对 DFly 分别提升 +3.0% / +9.2% / +15.7%;同等每用户延迟下聚合吞吐高 14%。

AngelSpec 采用双 drafter 路线——DFly 负责代码/数学,MTP 负责高熵对话。
原始 MTP 块按单步 teacher forcing 训练,推理时却要递归消费自己的预测,深层位置接受率大幅下降。团队用 TTT(训练时对共享 MTP 块做同策略自回归展开)修复这一训练-推理不一致,配合 target 模型 rollout 生成的训练数据:平均接受率从 52.8% 提升至 66.4%,平均接受长度从 2.58 提升至 2.99。
在 Hy3-A21B 上和主流开源模上,DFly 在接受长度与真实吞吐上更优:平均接受长度进一步提升,并在线上真实流量的各并发档位上取得更好吞吐。

DFly-8 在 4–64 全部并发档位均取得平均加速 1.98–2.40×,代码 / 数学单项峰值 2.86×;再叠加 D-cut,高并发下还能额外提升 +15.7%。