Reed's News
← 返回精选

只接触五年级以下语料的语言模型会怎样

AI 71 porridgeraisin 2026/8/16 485 字 原文 ↗

现代大语言模型(LM)的训练数据包罗万象,因此很难判断一项新技能是模型真正习得的,还是仅仅被激发出来的。为此,我们对训练数据分布进行了严格限制:构建一个符合美国小学课程标准、规模达880亿词元的语料库,让模型从零开始在该语料库上训练,并设置未过滤数据的对照组进行对比。

LittleCurriculum(小学课程语料库)

这是一个从FineWeb-Edu中提炼出的880亿词元语料库,通过五阶段过滤流程严格对齐美国共同核心州立标准(K–5,即幼儿园至五年级)。所有五年级以上的概念、事实与词汇均被明确排除。

LittleLearner(小学学习者模型)

我们基于LittleCurriculum从零训练了三个参数量级的模型(06亿/13亿/50亿),这些模型具备对话能力,且知识边界清晰可解释。每个模型都配有对应的未过滤数据对照组,便于开展严谨对比研究。

是激发,而非习得

实验表明,模型参数量扩容、SFT+GRPO后训练、上下文学习等方法,仅能强化语料库所教授的内容,对超出语料库范围的任务表现无显著提升。这说明预训练阶段的数据过滤为模型划定了能力上限。

模型 checkpoint

LittleLearner包含三个参数量级(06亿/13亿/50亿),每个量级都配有对照组——两者架构、训练词元总量、训练流程完全一致,唯一区别是对照组使用未过滤数据训练。

Base(基础版):仅经过预训练的模型。

GRPO(数学专精版):在MathCAMPS数据集上完成后训练的数学专精模型,输出内容可能带有明显的数学导向。

Chatty(对话版):针对通用对话场景调优的模型变体。

| 参数量级 | LittleLearner · 小学K–5版 | 对话版 | 对照组 · 未过滤数据版 | |---|

能力始终局限于课程范围

常规干预手段能否让模型突破预训练数据设定的知识边界?借助我们可控的知识边界,就能清晰回答这个问题。实验显示,所有干预手段仅能提升模型在课程范围内的表现,对超出范围的任务无显著改善。

参数量扩容

增大模型参数量,能提升其在可控知识范围内的表现,对同学习路径上的进阶问题也有小幅提升,但对需要超出该范围的高阶能力的问题,几乎没有效果。

不同参数量模型的MathCAMPS准确率(按年级划分)

后训练

通过GRPO进行后训练,能显著提升模型在K–5范围内的能力,但即便使用超出K–5范围的数据训练,也无法让模型掌握该范围外的能力。

后训练仅强化K–5能力,无法缩小与超K–5水平的差距

上下文学习

我们测试的上下文学习提示,无法让50亿参数量的LittleLearner掌握K–5范围外的新推理能力。

不同提示条件下的准确率

你想教它什么?

由于LittleLearner的训练数据范围被明确限定,其行为与表征变化可直接对应到你引入的特定概念。我们认为以下三个研究方向极具潜力:

强化学习(RL)能否创造新能力?

模型的先验知识被严格限制在K–5范围内,因此强化学习过程中涌现的新能力,可直接归因于RL流程本身。这为研究奖励驱动的能力形成提供了一个易处理的实验载体。

观察概念习得的全过程

引入负数概念,测量模型的样本效率、知识留存率与知识干扰情况。或是在知识边界附近测试模型行为:它会给出答案、主动弃权,还是生成幻觉内容?

机器学习者vs.人类儿童学习者

明确的训练数据范围,让人机对比研究得以可控开展。模型与儿童学习分数概念时,是否需要相似的学习量?在应用题上是否会犯相似的错误?

提出你的问题

清晰的知识边界,能让你的想法转化为严谨的实验!

若本研究对您有帮助

请引用我们的论文:

@misc{littlelearner2026,
title={LittleLearner: Language Models Under Pedagogically-Controlled Knowledge Exposure},
author={Fanfei Li and Jana Zeller and Manuel Prada-Corral and Thaddäus Wiedemer and Prasanna Mayilvahanan and Ryan Cotterell and Wieland Brendel},
year={2026},
eprint={2608.13545},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2608.13545}
}