Reed's News
← 返回精选

Unsloth Dynamic 3.0 量化技术发布

AI 64 jonesy827 2026/8/19 1643 字 原文 ↗

Unsloth Dynamic v3.0:动态量化技术全新迭代

Unsloth Dynamic v3.0是我们动态量化技术的新一代版本,相比v2.0实现了重大突破。

今日我们正式发布Qwen3.8-27B Dynamic v3.0量化模型,在模型体积完全相同的前提下,其Top-1%准确率比其他所有供应商高出10%以上。本次发布是对Dynamic v3.0早期预览版的正式更新,新版GGUF格式兼容llama.cpp等主流推理引擎,也可在Unsloth桌面端运行。

Dynamic v3.0在保持模型体积不变的同时,大幅提升了模型质量,在Divergence-300@32KL散度等多项指标上表现更优。

在此特别感谢用户的支持!仅5天时间,Unsloth Qwen3.8的下载量就突破了510万次!

我们的全新技术方案融合了多项创新特性与改进:

  • 采用了来源更广泛、质量更高的imatrix校准数据集,针对智能体编码、对话及多语言场景优化;
  • 改进了层选择策略,引入更多量化技术,最大程度保留模型性能。

我们不会在校准数据集上进行训练,也不使用QAT(量化感知训练)QAD(量化感知蒸馏),所有操作均基于**训练后量化(PTQ)**完成。我们使用的imatrix文件已开放给社区,供研究人员和开发者测试、评估及使用,欢迎大家基于Unsloth量化模型/imatrix对Qwen3.8进行变体开发与微调。相关过拟合分析可查看这篇文章

  • 针对UD-Q2_K_XL及更小量化版本(8.37GB及以下),我们移除了MTP模块,可节省约500MB磁盘空间;若需使用MTP功能,可单独下载Q4_0 MTP模块
  • 推出了更小体积的UD-1bit量化版本,其中UD-IQ1_S(不含MTP)仅6.2GB,保留了约72%的Top-1%准确率,体积比原模型缩小89%
  • UD-Q2_K_XL的Top-1%准确率比竞品中表现最佳的模型高出8%左右,体积为9.83GB;该模型已能生成可运行的HTML程序,仅存在一处微小JS错误——此前同类量化模型往往无法完成这类任务

我们通常报告Top-1%准确率,例如Kimi-K3的“动态1-bit量化模型Top-1准确率约达78.9%,体积缩小62%”。但Top-1%是单预测结果的argmax计算值,无法有效衡量实际推理效果。

为此,我们从Terminal-Bench 2.1、DeepSWE、Harbor、MathArena 2025-26及非拉丁语/长文档提示词中选取300个未参与校准的样本,对BF16模型与所有量化模型、供应商的模型进行32token贪婪argmax解码测试。过拟合相关细节可查看过拟合分析

该测试能帮助我们判断是否存在过拟合,以及量化模型的输出轨迹与BF16模型在多token生成过程中的相似度。相比Top-1%准确率,这一指标更具参考价值,相当于将KL散度Top-1%评估扩展到32token生成场景。

我们还针对所有供应商的模型进行了KL散度基准测试,报告Top-1%准确率与KL散度均值。结果显示,在所有量化层级,尤其是小体积量化模型中,Unsloth UD-3量化模型在相同磁盘占用下,Top-1%准确率最高可提升10%!

所有图表在计算磁盘空间时均剔除了MTP模块,以确保公平对比。

在未见过的Wikitext与代码数据集上对比旧版UD-2,我们发现UD-3在KL散度指标上提升显著,但大体积量化模型的提升相对有限。因此目前大体积模型仍使用旧版UD-2,后续我们会继续优化这部分模型。

我们通过完全分离校准与测试数据集、尽可能避免数据泄露来控制过拟合风险。测试使用未见过的数据集,且仅采用纯PTQ技术,不使用QAD/QAT,因此相比其他QAD/QAT方案,过拟合风险更低。

同样,🔀 Divergence-300@32使用来自DeepSWE、Terminal Bench等数据集的300个未见过的提示词,可作为另一项过拟合检测指标——结果显示我们的新UD-3技术未出现过拟合。


Unsloth Dynamic v2.0:量化技术重大升级

我们推出Unsloth Dynamic v2.0量化技术,是对过往量化方案的重大升级。该技术性能超越主流量化方法,在Aider Polyglot、5-shot MMLU、KL散度等基准测试中创下新纪录。

这意味着你现在可以在最大程度保留准确率的前提下,运行并微调量化大语言模型(quantized LLMs)!2.0版本的GGUF模型可在llama.cpp、Unsloth Studio等多数推理引擎上运行。

2026年4月20日更新:查看我们针对Qwen3.6Gemma 4的全新GGUF基准测试结果。

2026年2月27日更新点击查看 Qwen3.5已发布,我们修复了工具调用对话模板的部分问题,并针对所有GGUF模型进行了困惑度与KL散度基准测试。查看测试结果

使用Unsloth工具包与量化模型的核心优势在于,我们会积极修复主流模型的漏洞。我们已与Qwen3Meta(Llama 4)Mistral(Devstral)Google(Gemma 1–3)Microsoft(Phi-3/4)的开发团队直接合作,提交的修复方案有效提升了模型准确率。

你还可以查看Benjamin Marie针对LiveCodeBench v6、MMLU Pro等数据集完成的真实场景基准测试:

从中可以看到,Unsloth的GGUF模型比非Unsloth量化模型体积小约8GB,性能却更优。

以下是我们的基准测试与评估细节:

  • GGUF与safetensors模型的层选择优化:Unsloth Dynamic 2.0现在能更智能、全面地选择量化层。不再仅针对部分层调整,而是为每一层、每个模型动态匹配最优量化类型与组合。
  • 现有及未来上传的所有GGUF模型都将采用Dynamic 2.0技术与全新校准数据集。该数据集包含超过150万token(数量因模型而异),由高质量人工筛选、清洗的数据构成,可大幅提升对话模型性能。
  • 此前我们的动态量化技术(如DeepSeek-R1 1.58-bit GGUF)仅适用于MoE架构。Dynamic 2.0现在支持所有模型(包括MoE与非MoE架构)
  • 模型专属量化方案:每个模型都采用定制化量化策略。例如Gemma 3与Llama 4的量化层选择存在显著差异。
  • 为提升Apple Silicon与ARM设备的运行效率,我们新增了Q4_NL、Q5.1、Q5.0、Q4.1、Q4.0等格式。

为确保基准测试的准确性,我们搭建了内部评估框架,使其与Llama 4、Gemma 3官方公布的5-shot MMLU分数一致,实现了全精度模型与Dynamic v2.0、QAT、标准imatrix GGUF量化模型的公平对比。

未来所有GGUF模型都将采用Unsloth Dynamic 2.0技术,我们的动态4-bit safetensors量化模型也将在后续版本中受益于该技术。

论文《Accuracy is Not All You Need》指出,即使只裁剪非必要层,模型的“答案翻转”情况也会出现显著差异。“答案翻转”指模型答案从错误变为正确,或从正确变为错误。研究表明,裁剪层或量化操作可能不会降低MMLU分数,因为部分错误答案可能“翻转”为正确答案。我们的目标是匹配原模型性能,因此“答案翻转”是一项有效的评估指标。

根据《Accuracy is Not All You Need》的研究结论,KL散度应作为量化误差的核心评估标准之一使用困惑度评估并不准确,因为输出token的误差可能相互抵消,因此必须采用KL散度或更严格的基准测试(如Aider)。

研究还发现,KL散度与答案翻转高度相关,因此我们的目标是在尽可能少增加磁盘占用的前提下,降低KL散度均值。

多数框架使用维基百科文章作为测试集,报告困惑度与KL散度。但我们发现,若校准数据集也与维基百科相关,量化模型会出现过拟合,从而获得更低的困惑度分数。我们使用Calibration_v3Calibration_v5数据集进行公平测试,其中包含部分维基文本及其他类型数据。此外,指令模型有独特的对话模板,纯文本校准数据集对指令模型无效(基础模型适用)。事实上,多数imatrix GGUF模型的校准都存在此类问题,因此它们在基于维基百科的KL散度测试中表现自然更优,本质是模型针对该领域做了优化。

为确保评估公平可控,我们在KL散度基准测试中不使用自身优化过的对话场景校准数据集,而是采用通用维基百科数据集,直接对比Dynamic 2.0与传统imatrix方法的性能。

  • 复现MMLU 5-shot测试极具挑战性。由于细微的实现差异,我们无法复现Llama 3.1(8B)Instruct、Gemma 3(12B)等多款模型的官方MMLU结果。例如Llama 3.1(8B)的官方MMLU分数应为约68.2%,但错误实现下仅能达到35%的准确率

  • 使用朴素MMLU实现时,Llama 3.1(8B)Instruct的5-shot MMLU准确率为67.8%。但我们发现Llama的分词器会将“A”和“_A”(前面带空格的A)识别为不同的token ID。若同时考虑带空格与不带空格的token,准确率可提升至68.2%(+0.4%)。
  • 这类细微问题还有很多,因此为实现可控环境下的基准测试,我们直接参考github.com/hendrycks/test,从零开始设计了自己的MMLU实现,并通过多模型验证、与官方报告结果对比确保了准确性。

Gemma团队发布了两款Gemma 3的QAT(量化感知训练)版本:

我们对所有Q4_0 GGUF版本进行了基准测试,并针对12B模型展开了大量实验。结果显示,12B Q4_0 QAT模型的5-shot MMLU准确率为67.07%,而全精度bfloat16 12B模型的准确率为67.15%,表现十分出色!27B模型的性能也已接近全精度版本。

MMLU 5-shot测试结果

模型版本 准确率 磁盘占用 效率值*
(低精度基准) 26.12% 0.93GB 1.20
(中精度基准) 55.13% 2.94GB 10.26
12B Q4_0 QAT 67.07%(BF16为67.15%) 7.52GB 5.59
27B QAT 70.64%(BF16为71.5%) 16.05GB 2.84

我们设计了全新的效率值指标,综合考量模型的实用性、磁盘占用与MMLU 5-shot分数:

KL散度对比(与基础模型相比,数值越接近0性能越好)

量化版本 旧版KL散度 旧版效率值 新版KL散度 新版效率值
IQ1_S 1.035688 5.83 0.972932 6.06
IQ1_M 0.832252 6.33 0.800049 6.51
IQ2_XXS 0.535764 7.16 0.521039 7.31
IQ2_M 0.26554 8.84 0.258192 8.96
Q2_K_XL 0.229671 9.78 0.220937 9.95
Q3_K_XL 0.087845 12.51 0.080617 12.76
Q4_K_XL 0.024916 15.41 0.023701 15.64

若对比磁盘占用增幅与KL散度降幅的比值,Dynamic 2.0的优势会更明显!我们的动态2bit Q2_K_XL模型将KL散度降低了约7.5%。

以下是Gemma 3(27B)的MMLU测试结果摘要:

  • 我们的动态4bit模型比QAT版本小2GB,同时准确率高出1%!
  • 从效率值来看,2bit Q2_K_XL等模型表现十分优异!
量化版本 Unsloth准确率 QAT准确率 磁盘占用 效率值
IQ1_M 48.10 47.23 6.51GB 3.42
IQ2_XXS 59.20 56.57 7.31GB 4.32
IQ2_M 66.47 64.47 8.96GB 4.40
Q2_K_XL 68.70 67.77 9.95GB 4.30
Q3_K_XL 70.87 69.50 12.76GB 3.49
Q4_K_XL 71.47 71.07 15.64GB 2.94
Google QAT 70.64 - 17.2GB 2.65
量化版本 Unsloth准确率 第三方准确率 磁盘占用 效率值
IQ1_S 41.87 43.37 6.06GB 3.03
IQ1_M 48.10 47.23 6.51GB 3.42
IQ2_XXS 59.20 56.57 7.31GB 4.32
IQ2_M 66.47 64.47 8.96GB 4.40
Q2_K 68.50 67.60 9.78GB 4.35
Q2_K_XL 68.70 67.77 9.95GB 4.30
IQ3_XXS 68.27 67.07 10.07GB 4.18
Q3_K_M 70.70 69.77 12.51GB 3.58
Q3_K_XL 70.87 69.50 12.76GB 3.49
Q4_K_M 71.23 71.00 15.41GB 2.98
Q4_K_XL 71.47 71.07 15.64GB 2.94
Q5_K_M 71.77 71.23 17.95GB 2.58
Q6_K 71.87 71.60 20.64GB 2.26
Q8_0 71.60 71.53 26.74GB 1.74
Google QAT 70.64 - 17.2GB 2.65

我们还协助修复了Llama 4的部分漏洞:

  • Llama 4 Scout在官方仓库中修改了RoPE缩放配置,我们协助llama.cpp解决了适配问题——查看修改记录
  • Wolfram Ravenwolf测试显示,通过llama.cpp运行我们的GGUF模型,准确率远高于第三方推理供应商。这很可能是上述实现问题与量化技术差异共同导致的。

如我们的图表所示,我们的4-bit动态QAT量化模型在5-shot MMLU测试中表现更优,同时体积更小。

以运行Llama 4 Scout为例,步骤如下:

  1. 克隆llama.cpp仓库
  2. 下载我们的Scout动态v2.0量化模型
  3. 开始推理!

最后更新时间: 本文是否对你有帮助?