Unsloth 今天发布了 Dynamic 3.0 量化方案,首发 Qwen3.8-27B 量化版本。相比 v2.0,新版本在同等磁盘空间下 top-1% 准确率提升超过 10%,KL Divergence 指标全面优于所有其他量化提供商。
准确率提升来自几个方面:更高质量的 imatrix 校准数据集(从多样化数据源构建,针对 agent 编程、聊和多语言场景优化),更好的层选择策略,以及更多新的量化技术。Unsloth 强调所有优化都是纯后训练量化(PTQ),没有使用 QAT 或 QAD,过拟合风险更低。


最亮眼的数据是下载量:Qwen3.8 的 Unsloth 量化版本仅在 5 天内就达到了 510 万次下载。这个数字说明社区对本地部署大模型的需求正在爆发。
一个新变化是,较小体积的量化版本(UD-Q2_K_XL 及以下,8.37GB 以下)去除了 MTP(Multi-Token Prediction)模块,能节省约 500MB 磁盘空间。如果需要 MTP,可以单独加载 Q4_0 MTP 模块。此外还推出了 UD-IQ1_S 1-bit 量化版本,仅 6.2GB,保留了 72% 的 top-1% 准确率,体积缩小了 89%。
Hacker News 社区的讨论集中在版本管理上——多位用户抱怨 Unsloth 的 GGUF 文件缺乏版本号命名,新旧文件完全同名,需要手动对比 SHA256 才能确认差异。一位用户发现他 4-5 天前下载的 Qwen3.8 Q8 和今天发布的 Dynamic 3.0 版本有不同的 SHA256 哈希值,但文件名完全一样。
Unsloth 还改进了一个容易被忽视但很重要的问题:top-1% 准确率(只看模型对第一个 token 的预测)并不能真实反映推理质量。他们构建了一个 Divergence-300@32 基准——从 Terminal-Bench、DeepSWE、Harbor、MathArena 等数据集中抽取 300 个 held-out 样本,进行 32 个 token 的 greedy 解码,对比 BF16 原始模型和各量化版本之间的输出轨迹差异。这个指标比单纯的 top-1% 更有说服力。
参考来源: