Unsloth Dynamic 3.0 量化技术发布
Unsloth Dynamic v3.0:动态量化技术全新迭代
Unsloth Dynamic v3.0是我们动态量化技术的新一代版本,相比v2.0实现了重大突破。
今日我们正式发布Qwen3.8-27B Dynamic v3.0量化模型,在模型体积完全相同的前提下,其Top-1%准确率比其他所有供应商高出10%以上。本次发布是对Dynamic v3.0早期预览版的正式更新,新版GGUF格式兼容llama.cpp等主流推理引擎,也可在Unsloth桌面端运行。
Dynamic v3.0在保持模型体积不变的同时,大幅提升了模型质量,在Divergence-300@32、KL散度等多项指标上表现更优。
在此特别感谢用户的支持!仅5天时间,Unsloth Qwen3.8的下载量就突破了510万次!

我们的全新技术方案融合了多项创新特性与改进:
- 采用了来源更广泛、质量更高的imatrix校准数据集,针对智能体编码、对话及多语言场景优化;
- 改进了层选择策略,引入更多量化技术,最大程度保留模型性能。
我们不会在校准数据集上进行训练,也不使用QAT(量化感知训练)或QAD(量化感知蒸馏),所有操作均基于**训练后量化(PTQ)**完成。我们使用的imatrix文件已开放给社区,供研究人员和开发者测试、评估及使用,欢迎大家基于Unsloth量化模型/imatrix对Qwen3.8进行变体开发与微调。相关过拟合分析可查看这篇文章。
- 针对
UD-Q2_K_XL及更小量化版本(8.37GB及以下),我们移除了MTP模块,可节省约500MB磁盘空间;若需使用MTP功能,可单独下载Q4_0MTP模块 - 推出了更小体积的UD-1bit量化版本,其中
UD-IQ1_S(不含MTP)仅6.2GB,保留了约72%的Top-1%准确率,体积比原模型缩小89% UD-Q2_K_XL的Top-1%准确率比竞品中表现最佳的模型高出8%左右,体积为9.83GB;该模型已能生成可运行的HTML程序,仅存在一处微小JS错误——此前同类量化模型往往无法完成这类任务

我们通常报告Top-1%准确率,例如Kimi-K3的“动态1-bit量化模型Top-1准确率约达78.9%,体积缩小62%”。但Top-1%是单预测结果的argmax计算值,无法有效衡量实际推理效果。
为此,我们从Terminal-Bench 2.1、DeepSWE、Harbor、MathArena 2025-26及非拉丁语/长文档提示词中选取300个未参与校准的样本,对BF16模型与所有量化模型、供应商的模型进行32token贪婪argmax解码测试。过拟合相关细节可查看过拟合分析。
该测试能帮助我们判断是否存在过拟合,以及量化模型的输出轨迹与BF16模型在多token生成过程中的相似度。相比Top-1%准确率,这一指标更具参考价值,相当于将KL散度Top-1%评估扩展到32token生成场景。

我们还针对所有供应商的模型进行了KL散度基准测试,报告Top-1%准确率与KL散度均值。结果显示,在所有量化层级,尤其是小体积量化模型中,Unsloth UD-3量化模型在相同磁盘占用下,Top-1%准确率最高可提升10%!
所有图表在计算磁盘空间时均剔除了MTP模块,以确保公平对比。


在未见过的Wikitext与代码数据集上对比旧版UD-2,我们发现UD-3在KL散度指标上提升显著,但大体积量化模型的提升相对有限。因此目前大体积模型仍使用旧版UD-2,后续我们会继续优化这部分模型。
我们通过完全分离校准与测试数据集、尽可能避免数据泄露来控制过拟合风险。测试使用未见过的数据集,且仅采用纯PTQ技术,不使用QAD/QAT,因此相比其他QAD/QAT方案,过拟合风险更低。

同样,🔀 Divergence-300@32使用来自DeepSWE、Terminal Bench等数据集的300个未见过的提示词,可作为另一项过拟合检测指标——结果显示我们的新UD-3技术未出现过拟合。
Unsloth Dynamic v2.0:量化技术重大升级
我们推出Unsloth Dynamic v2.0量化技术,是对过往量化方案的重大升级。该技术性能超越主流量化方法,在Aider Polyglot、5-shot MMLU、KL散度等基准测试中创下新纪录。
这意味着你现在可以在最大程度保留准确率的前提下,运行并微调量化大语言模型(quantized LLMs)!2.0版本的GGUF模型可在llama.cpp、Unsloth Studio等多数推理引擎上运行。
2026年4月20日更新:查看我们针对Qwen3.6和Gemma 4的全新GGUF基准测试结果。
2026年2月27日更新:点击查看 Qwen3.5已发布,我们修复了工具调用对话模板的部分问题,并针对所有GGUF模型进行了困惑度与KL散度基准测试。查看测试结果
使用Unsloth工具包与量化模型的核心优势在于,我们会积极修复主流模型的漏洞。我们已与Qwen3、Meta(Llama 4)、Mistral(Devstral)、Google(Gemma 1–3)、Microsoft(Phi-3/4)的开发团队直接合作,提交的修复方案有效提升了模型准确率。


你还可以查看Benjamin Marie针对LiveCodeBench v6、MMLU Pro等数据集完成的真实场景基准测试:


从中可以看到,Unsloth的GGUF模型比非Unsloth量化模型体积小约8GB,性能却更优。
以下是我们的基准测试与评估细节:
- GGUF与safetensors模型的层选择优化:Unsloth Dynamic 2.0现在能更智能、全面地选择量化层。不再仅针对部分层调整,而是为每一层、每个模型动态匹配最优量化类型与组合。
- 现有及未来上传的所有GGUF模型都将采用Dynamic 2.0技术与全新校准数据集。该数据集包含超过150万token(数量因模型而异),由高质量人工筛选、清洗的数据构成,可大幅提升对话模型性能。
- 此前我们的动态量化技术(如DeepSeek-R1 1.58-bit GGUF)仅适用于MoE架构。Dynamic 2.0现在支持所有模型(包括MoE与非MoE架构)。
- 模型专属量化方案:每个模型都采用定制化量化策略。例如Gemma 3与Llama 4的量化层选择存在显著差异。
- 为提升Apple Silicon与ARM设备的运行效率,我们新增了Q4_NL、Q5.1、Q5.0、Q4.1、Q4.0等格式。
为确保基准测试的准确性,我们搭建了内部评估框架,使其与Llama 4、Gemma 3官方公布的5-shot MMLU分数一致,实现了全精度模型与Dynamic v2.0、QAT、标准imatrix GGUF量化模型的公平对比。


未来所有GGUF模型都将采用Unsloth Dynamic 2.0技术,我们的动态4-bit safetensors量化模型也将在后续版本中受益于该技术。
论文《Accuracy is Not All You Need》指出,即使只裁剪非必要层,模型的“答案翻转”情况也会出现显著差异。“答案翻转”指模型答案从错误变为正确,或从正确变为错误。研究表明,裁剪层或量化操作可能不会降低MMLU分数,因为部分错误答案可能“翻转”为正确答案。我们的目标是匹配原模型性能,因此“答案翻转”是一项有效的评估指标。


根据《Accuracy is Not All You Need》的研究结论,KL散度应作为量化误差的核心评估标准之一。使用困惑度评估并不准确,因为输出token的误差可能相互抵消,因此必须采用KL散度或更严格的基准测试(如Aider)。
研究还发现,KL散度与答案翻转高度相关,因此我们的目标是在尽可能少增加磁盘占用的前提下,降低KL散度均值。
多数框架使用维基百科文章作为测试集,报告困惑度与KL散度。但我们发现,若校准数据集也与维基百科相关,量化模型会出现过拟合,从而获得更低的困惑度分数。我们使用Calibration_v3与Calibration_v5数据集进行公平测试,其中包含部分维基文本及其他类型数据。此外,指令模型有独特的对话模板,纯文本校准数据集对指令模型无效(基础模型适用)。事实上,多数imatrix GGUF模型的校准都存在此类问题,因此它们在基于维基百科的KL散度测试中表现自然更优,本质是模型针对该领域做了优化。
为确保评估公平可控,我们在KL散度基准测试中不使用自身优化过的对话场景校准数据集,而是采用通用维基百科数据集,直接对比Dynamic 2.0与传统imatrix方法的性能。
- 复现MMLU 5-shot测试极具挑战性。由于细微的实现差异,我们无法复现Llama 3.1(8B)Instruct、Gemma 3(12B)等多款模型的官方MMLU结果。例如Llama 3.1(8B)的官方MMLU分数应为约68.2%,但错误实现下仅能达到35%的准确率。

- 使用朴素MMLU实现时,Llama 3.1(8B)Instruct的5-shot MMLU准确率为67.8%。但我们发现Llama的分词器会将“A”和“_A”(前面带空格的A)识别为不同的token ID。若同时考虑带空格与不带空格的token,准确率可提升至68.2%(+0.4%)。
- 这类细微问题还有很多,因此为实现可控环境下的基准测试,我们直接参考github.com/hendrycks/test,从零开始设计了自己的MMLU实现,并通过多模型验证、与官方报告结果对比确保了准确性。
Gemma团队发布了两款Gemma 3的QAT(量化感知训练)版本:
我们对所有Q4_0 GGUF版本进行了基准测试,并针对12B模型展开了大量实验。结果显示,12B Q4_0 QAT模型的5-shot MMLU准确率为67.07%,而全精度bfloat16 12B模型的准确率为67.15%,表现十分出色!27B模型的性能也已接近全精度版本。
MMLU 5-shot测试结果
| 模型版本 | 准确率 | 磁盘占用 | 效率值* |
|---|---|---|---|
| (低精度基准) | 26.12% | 0.93GB | 1.20 |
| (中精度基准) | 55.13% | 2.94GB | 10.26 |
| 12B Q4_0 QAT | 67.07%(BF16为67.15%) | 7.52GB | 5.59 |
| 27B QAT | 70.64%(BF16为71.5%) | 16.05GB | 2.84 |
我们设计了全新的效率值指标,综合考量模型的实用性、磁盘占用与MMLU 5-shot分数:
KL散度对比(与基础模型相比,数值越接近0性能越好)
| 量化版本 | 旧版KL散度 | 旧版效率值 | 新版KL散度 | 新版效率值 |
|---|---|---|---|---|
| IQ1_S | 1.035688 | 5.83 | 0.972932 | 6.06 |
| IQ1_M | 0.832252 | 6.33 | 0.800049 | 6.51 |
| IQ2_XXS | 0.535764 | 7.16 | 0.521039 | 7.31 |
| IQ2_M | 0.26554 | 8.84 | 0.258192 | 8.96 |
| Q2_K_XL | 0.229671 | 9.78 | 0.220937 | 9.95 |
| Q3_K_XL | 0.087845 | 12.51 | 0.080617 | 12.76 |
| Q4_K_XL | 0.024916 | 15.41 | 0.023701 | 15.64 |
若对比磁盘占用增幅与KL散度降幅的比值,Dynamic 2.0的优势会更明显!我们的动态2bit Q2_K_XL模型将KL散度降低了约7.5%。
以下是Gemma 3(27B)的MMLU测试结果摘要:
- 我们的动态4bit模型比QAT版本小2GB,同时准确率高出1%!
- 从效率值来看,2bit Q2_K_XL等模型表现十分优异!
| 量化版本 | Unsloth准确率 | QAT准确率 | 磁盘占用 | 效率值 |
|---|---|---|---|---|
| IQ1_M | 48.10 | 47.23 | 6.51GB | 3.42 |
| IQ2_XXS | 59.20 | 56.57 | 7.31GB | 4.32 |
| IQ2_M | 66.47 | 64.47 | 8.96GB | 4.40 |
| Q2_K_XL | 68.70 | 67.77 | 9.95GB | 4.30 |
| Q3_K_XL | 70.87 | 69.50 | 12.76GB | 3.49 |
| Q4_K_XL | 71.47 | 71.07 | 15.64GB | 2.94 |
| Google QAT | 70.64 | - | 17.2GB | 2.65 |
| 量化版本 | Unsloth准确率 | 第三方准确率 | 磁盘占用 | 效率值 |
|---|---|---|---|---|
| IQ1_S | 41.87 | 43.37 | 6.06GB | 3.03 |
| IQ1_M | 48.10 | 47.23 | 6.51GB | 3.42 |
| IQ2_XXS | 59.20 | 56.57 | 7.31GB | 4.32 |
| IQ2_M | 66.47 | 64.47 | 8.96GB | 4.40 |
| Q2_K | 68.50 | 67.60 | 9.78GB | 4.35 |
| Q2_K_XL | 68.70 | 67.77 | 9.95GB | 4.30 |
| IQ3_XXS | 68.27 | 67.07 | 10.07GB | 4.18 |
| Q3_K_M | 70.70 | 69.77 | 12.51GB | 3.58 |
| Q3_K_XL | 70.87 | 69.50 | 12.76GB | 3.49 |
| Q4_K_M | 71.23 | 71.00 | 15.41GB | 2.98 |
| Q4_K_XL | 71.47 | 71.07 | 15.64GB | 2.94 |
| Q5_K_M | 71.77 | 71.23 | 17.95GB | 2.58 |
| Q6_K | 71.87 | 71.60 | 20.64GB | 2.26 |
| Q8_0 | 71.60 | 71.53 | 26.74GB | 1.74 |
| Google QAT | 70.64 | - | 17.2GB | 2.65 |
我们还协助修复了Llama 4的部分漏洞:
- Llama 4 Scout在官方仓库中修改了RoPE缩放配置,我们协助llama.cpp解决了适配问题——查看修改记录

- Wolfram Ravenwolf测试显示,通过llama.cpp运行我们的GGUF模型,准确率远高于第三方推理供应商。这很可能是上述实现问题与量化技术差异共同导致的。

如我们的图表所示,我们的4-bit动态QAT量化模型在5-shot MMLU测试中表现更优,同时体积更小。
以运行Llama 4 Scout为例,步骤如下:
- 克隆llama.cpp仓库
- 下载我们的Scout动态v2.0量化模型
- 开始推理!
最后更新时间: 本文是否对你有帮助?