Sumi:从头训练的7B开源均匀扩散语言模型
Sumi: Open Uniform Diffusion Language Model from Scratch
Sumi(日语“墨”)是一个完全开源的7B参数均匀扩散语言模型,从零开始在1.5T模型token上预训练。它在知识、推理和编程评测中与同等token预算的自回归模型表现相当,但在常识推理benchmark上略逊,教育密集型数据混合可能是原因之一。Sumi开放模型权重、检查点及完整训练配方(含公开语料数据混合说明),为社区提供首个大规模均匀扩散模型的基准参考。
Sumi 是第一个完全从零预训练的大规模均匀扩散语言模型,填补了社区在这方向的研究空白,做扩散语言模型的人终于有个可以摸的起点。
![]()
东北大学
Keito Kudo
![]()
东北大学
池田亘
![]()
东北大学
松田亮介
![]()
东北大学
坂口圭介
![]()
东北大学
铃木润
![]()
东北大学
摘要
扩散模型已成为自回归模型的一种有前景的替代方案。其中,均匀扩散语言模型(UDLM)允许在任何步骤更新任何 token,原则上能够实现更灵活的生成。然而,目前还没有任何 UDLM 在大的参数量级和大的 token 预算下从头开始进行预训练。自回归建模和掩码扩散建模都已经有大规模的可运行模型供社区研究和在此基础上发展;而均匀扩散模型则没有。一个从头预训练的大规模 UDLM 将为一个干净的参考点,用于研究扩展行为、生成动态、可控性,以及与已建立的自回归模型和掩码扩散模型之间的权衡。为此,我们推出了 Sumi(日语中意为“墨”),这是一个完全开源的 7B 参数均匀扩散语言模型,在 1.5T token 上从头开始预训练。在知识、推理和编程基准测试中,Sumi 的表现与在可比 token 预算下训练的自回归模型不相上下,但在常识基准测试中表现不佳,而我们偏向教育类数据的混合策略很可能是造成这一结果的原因之一。我们发布了模型权重、检查点以及完整的训练方案,包括在公开可用的语料库上数据混合的完整说明。我们希望这次发布能让社区研究原生大规模均匀扩散模型,并推动对其尚不为人所熟知的方面的研究工作。
1 引言
扩散语言模型已成为自回归(AR)模型的一种有前景的替代方案。掩码扩散语言模型(MDLM),如 LLaDA [Nie et al., 2026],已扩展至 80 亿参数和超过 2 万亿训练 token,性能可与强大的自回归基线模型相媲美。均匀扩散语言模型(UDLM)则放宽了掩码过程中的一个关键限制:一旦 MDLM 填充了一个掩码 token,该 token 便无法再修改;而均匀扩散允许任何 token 在任意步骤被更新,原则上能够实现更灵活的生成和自我修正 [von Rütte et al., 2025]。
近期一项大规模开源发布——DiffusionGemma [DeepMind, 2026]——通过适配预训练的自回归模型而非从头预训练,实现了均匀扩散。然而,目前尚无 UDLM 在大型参数和 token 规模上从头进行过预训练:现有最大的模型是在相对较小的 token 预算上训练的计算最优检查点 [von Rütte et al., 2026],而唯一在数据丰富条件下训练的模型仅有 17 亿参数 [Sahoo et al., 2026]。因此,大型均匀扩散模型在现代语言模型的数据丰富条件下的行为仍有待探索。
为此,我们推出了 Sumi(日语中意为“墨”,寓意文本从均匀扩散的噪声中逐渐浮现),这是一个完全开源的 70 亿参数 UDLM,在 1.5 万亿 token 上从头预训练而成。Sumi 基于广义插值离散扩散(GIDD)[von Rütte et al., 2025] 框架及其改进版本 [von Rütte et al., 2026],后者通过信噪比(SNR)对 GIDD 的 ELBO 进行了重新参数化。在我们的评估中,Sumi 在通用知识、推理和编程基准测试上,与在可比 token 预算下训练的自回归模型表现相当,但在 PIQA、HellaSwag 和 WinoGrande 等常识推理任务上存在明显差距。我们的数据混合以教育类内容为主,这很可能是造成这一差距的原因之一,但我们并未直接验证这一归因。
除了模型本身,我们还报告了一组探索性的推理时探测结果,涉及生成任务(§4)。这些探测在每个任务上运行了30个问题,具有方向性而非结论性,但它们指出了我们认为值得在原生训练的均匀扩散模型中研究的开放性问题。最具体的观察结果是,Sumi在其训练的画布范围内流畅生成,而在范围外则性能下降,在所有四个任务中,短画布下的下降最为显著,对于某些任务(如GSM8K),长画布下也会出现下降。我们全程使用单一的2048画布长度,这位于我们评估的每个任务的流畅区间内。其余观察结果更具试探性。基于置信度的采样似乎在一个原本与顺序无关的模型上施加了一种自组织的承诺顺序;这种结构允许在编码任务上进行有限的并行解码;而在我们的设置中,显式的修订预算并未产生自我修正效果。我们发布了模型权重、检查点和完整的训练方案,包括公开语料库上数据混合的完整说明。
我们希望此次发布能让社区大规模研究原生均匀扩散模型,并推动对其尚不明确方面的研究工作。
2 训练
2.1 训练细节
架构。
Sumi是一个70亿参数、时间无关的双向Transformer,采用GIDD目标[von Rütte等人,2025]的SNR重参数化形式[von Rütte等人,2026]进行训练,在纯均匀噪声下实例化,log-SNR限制为遵循后者。
我们使用传统的LLaMA风格模块:36层,隐藏层大小4096,SwiGLU MLP(FFN大小12288),分组查询注意力(32个头,8个KV组,头维度128),RMSNorm(),未绑定的输入/输出嵌入,无偏置或丢弃,以及注意力中的off-by-one softmax [Miller, 2023]以缓解注意力汇聚问题[Bondarenko等人,2023,Gu等人,2025,Xiao等人,2024]。我们针对训练稳定性进行了优化。因此,训练在训练损失和训练中基准监控分数方面整体保持稳定。
我们设置了 RoPE [Su et al., 2024] 的参数。我们使用 OLMo 3 [Olmo et al., 2025] 分词器,词汇表大小为 100,278,该分词器在我们的训练集上实现了最佳的 token 效率。我们基于 Megatron-LM [Shoeybi et al., 2019] 构建了训练框架。
硬件与算力。
我们在 288 块 NVIDIA H100 GPU 上训练 Sumi-7B。预训练消耗 35,776 GPU 小时,两个中间训练阶段额外消耗 7,531 GPU 小时,总计 43,308 GPU 小时。
预训练。
我们对 Sumi 进行预训练,使用约 1.3T 个 token,序列长度为 1,184,全局批次大小为 4,608 个序列(每步 5.5M 个 token),采用 bfloat16 精度;选择该序列长度是为了在硬件上最大化吞吐量。遵循 von Rütte et al. [2026] 的方法,我们最小化未加权的 ELBO 作为代理损失,同时在评估时报告真实的 ELBO。我们使用 AdamW [Loshchilov and Hutter, 2019] 优化器,权重衰减为 0.1,梯度裁剪阈值为 1.0,并辅以系数为 的 z-loss [Chowdhery et al., 2023]。
中间训练。
预训练之后,我们在特定领域的数据混合集(§ 2.2)上执行两个中间训练阶段:首先在原始序列长度 1,184 上训练 130B 个 token,然后在扩展长度 4,864 上训练 120B 个 token,每批次包含 1,152 个序列,以保持每步的 token 批次大小大致恒定在 5.6M 个 token。
一个统一的 WSD [Hu et al., 2024] 学习率调度策略贯穿所有三个阶段:2,000 步的预热阶段,学习率升至峰值 ;一个恒定阶段;以及在最终中间训练阶段结束时,2,000 步的线性衰减至 。
2.2 训练数据
预训练。
我们的预训练语料库基于 llm-jp-corpus-v4 [LLM-jp, 2025] 构建。我们仅使用该语料库的英文部分,并排除了其中源自 FineWeb 的子集,保留了剩余的英文子集以及 StarCoder 代码子集 (code_olmo-starcoder)。此外,我们还加入了来自 swallow_code_v2 [Fujii et al., 2025] 的 Python 代码,该数据集也已被纳入 llm-jp-v4 语料库。剩余的预算由 llm-jp-corpus-v4.1 [LLM-jp, 2026] 中的 en_fineweb-rescored 子集填充,在该子集中,每个 FineWeb 文档都按照 FineWeb-Edu 方法论 [Lozhkov et al., 2024] 被赋予了一个教育评分,评分过程使用了从 Qwen3-32B [Yang et al., 2025] 标注中蒸馏出的轻量级分类器;我们遵循 LLM-jp-4 数据配方,使用这个重新评分后的版本替代原始的 FineWeb 拆分部分。我们按评分降序选择子集,构建了一个包含 1.3T 模型 token 的数据集。图 1a 总结了最终的构成。
中期训练。
我们的中期训练混合数据基于 llm-jp-corpus-midtraining-v2 [Kodama and Oda, 2026] 的英文部分,除三项改动外,其余均按原样使用。首先,我们将 nemotron_pretraining_code_v2 从其完整的 491B 模型 token 下采样至 63B,以避免代码权重过高。其次,我们额外加入了来自 llm-jp-corpus-v4.1 的 en_megamath-web-pro-max-oss,这是 MegaMath-Web-Pro-Max [Wang et al., 2025] 的一个开源重构版本,其中使用 gpt-oss-120b [OpenAI et al., 2025] 来标注和改写文档;我们根据继承自原始 MegaMath 语料库 [Zhou et al., 2025] 的 math_score 字段进行过滤,保留了评分最高的文档,总计不超过 48.9B 模型 token。第三,对于推理数据,我们仅保留长度不超过约 4,096 模型 token 的样本,以匹配模型的上下文长度,这保留了该数据桶中约 45% 的模型 token。最终混合数据总计约 250B 模型 token,分布在四个数据桶中(图 1b):编码(81.4B,32.5%)、数学(74.3B,29.7%)、通用(52.4B,21.0%)和推理(42.0B,16.8%)。¹¹¹所有模型 token 计数均使用我们采用的 OLMo 3 分词器进行测量,因此与原始语料库发布中报告的数字有所不同。
数据可用性。
所有训练数据均来自公开语料库,可从上述各自来源获取;我们并未重新分发这些数据,而是在本节中记录了筛选流程,并在图 1 中展示了最终的混合比例。结合上游发布的信息,我们认为这足以重建一个功能上等效的训练语料库。
3 评估
3.1 评估设置
我们使用 lm-evaluation-harness [Gao et al., 2024] 运行所有评估,仅对其进行了修改以支持基于扩散模型的评分。在整个评估过程中,我们区分了两个量。画布长度是指在生成开始时分配的 token 位置数量,即模型填充的缓冲区大小。生成长度是指实际参与评分的位置数量。对于似然任务,答案之后直至生成长度的位置用随机 token 填充;对于生成任务,仅允许在生成长度内更新 token,而超出该长度的位置则保持其随机初始化状态。
我们在生成区域与尾部随机 token 之间插入了一个 <EOS><BOS> 边界,以匹配训练期间看到的打包分布。这是一种变通方法:我们在训练期间没有应用注意力掩码,因为我们优先考虑了吞吐量,并且我们硬件上可用的最快内核不支持自定义注意力掩码。
我们对所有任务使用 2048 的画布长度。我们发现模型在此长度下表现最佳,而在明显更短或更长的画布上性能会下降。这与我们发布的生成函数的默认行为一致,该函数初始化 2048 个 token 位置,放置提示词和请求的生成长度,用 <EOS><BOS> 边界将两者分隔,并按照 [von Rütte et al., 2026] 的方法,用随机 token 填充剩余部分。
对于生成任务,我们将 BBH 的生成长度设为 512,GSM8K 设为 64,HumanEval 和 MBPP 均设为 256。对于似然任务,我们用随机 token 填充画布的剩余部分。
| 在我们的协议下评估 | 先前工作报告的结果 | |||||
| Sumi-7B | Falcon-7B | Llama 2-7B | OLMo-7B | LLaDA-8B | Llama 3-8B | |
| 范式 | 均匀扩散模型 | 自回归 | 自回归 | 自回归 | 掩码扩散模型 | 自回归 |
| 训练 Token | T | T | T | T | T | T |
| 训练数据 | 完全公开 | 部分公开 | 未公开 | 完全公开 | 未公开 | 未公开 |
| 通用知识 | ||||||
| MMLU | ||||||
| RACE | ||||||
| TruthfulQA | ||||||
| 推理与数学 | ||||||
| GSM8K∗ | ||||||
| ARC-Easy | ||||||
| ARC-Challenge | ||||||
| BBH∗ | ||||||
| GPQA | ||||||
| 编程 | ||||||
| HumanEval∗ | ||||||
| MBPP∗ | ||||||
| 常识 | ||||||
| PIQA | ||||||
| HellaSwag | ||||||
| WinoGrande | ||||||
3.2 基准测试
我们在四个类别的 13 个基准测试上评估 Sumi:
通用知识:MMLU [Hendrycks et al., 2021]、RACE [Lai et al., 2017] 和 TruthfulQA [Lin et al., 2022]。
推理与数学:ARC-Easy 和 ARC-Challenge [Clark et al., 2018]、GPQA [Rein et al., 2024]、BIG-Bench Hard [Suzgun et al., 2023] 以及 GSM8K [Cobbe et al., 2021]。
编程:HumanEval [Chen et al., 2021] 和 MBPP [Austin et al., 2021]。
常识:WinoGrande [Sakaguchi et al., 2020]、PIQA [Bisk et al., 2020] 和 HellaSwag [Zellers et al., 2019]。
3.3 基线模型
Sumi 在 1.5T 个 token 上训练。为了最大化可比性,我们在与 Sumi 相同的协议下,评估了三个参数数量相近、token 预算可比的开放自回归模型:Falcon-7B [Almazrouei et al., 2023]、Llama 2-7B [Touvron et al., 2023] 和 OLMo-7B [Groeneveld et al., 2024]。我们还报告了 LLaDA-8B 和 Llama 3-8B 的参考得分,这些得分取自 Nie et al. [2026] 和 Ye et al. [2025];这些模型未在我们的协议下评估,仅作为上下文参考提供。在上述模型中,Sumi 和 OLMo 是仅有的两个完全公开其训练数据的模型。
3.4 结果
表 1 报告了各项基准测试得分。在通用知识和编程方面,Sumi 在我们协议评估的模型中取得了最佳成绩,这反映了我们数据混合中教育和代码内容的占比较高。在推理和数学方面,由于我们中期训练混合中相关数据相对有限,Sumi 与 Llama 2-7B 水平相当,且大多领先于 Falcon-7B。
在常识方面,Sumi 是我们评估的模型中最弱的之一。我们以教育为主的数据混合可能是造成这一差距的原因之一。已有研究观察到,教育和质量过滤能够提升知识和推理密集型基准测试的表现,但同时会降低 HellaSwag 和 PIQA 等常识基准测试的得分 [Penedo et al., 2024, Allal et al., 2025]。我们提醒不要将数据混合视为完整的解释:这一差距过大,无法仅归因于数据构成,我们将更全面的解释留待未来研究。
4 讨论
最后,我们对 Sumi 的生成行为进行了一系列小规模、方向性的分析。这些是探索性的探测,而非有对照的论断,我们将其报告出来,以激励未来对原生训练的均匀扩散模型进行更深入的研究。
所有实验均从四个生成任务中均匀随机采样 30 个问题:GSM8K、HumanEval、MBPP 以及 BBH 子任务 logical_deduction_three_objects(简称 BBH-Logic3)。我们选择这个特定的 BBH 子任务,是因为其答案格式易于提取,且 Sumi 在该任务上取得了其最强的 BBH 分数(74.8)。我们探究了四个问题。第一个问题确定了 Sumi 能够流畅生成的画布长度区间;其余探究范围均在此区间内运作。这些探究涉及模型在该区间内如何提交 token:使用何种采样器、以何种顺序、每步提交多少、以及是否可逆。
总之,我们的初步证据表明:Sumi 仅在一个画布长度区间内能流畅生成,该区间的宽度取决于任务,但单一设置即可良好适配我们所有任务;在此区间内,基于置信度的自适应采样器为原本无序的生成过程施加了有用的、任务相关的结构;这种结构在编码任务上免费带来了有限的并行性;而简单的额外计算并不能转化为自我修正。我们再次强调,本文的所有讨论均是基于小样本的方向性观察,旨在为原生训练的均匀扩散模型中值得研究的问题指明方向,而非在本报告中给出定论。
4.1 可用的生成画布是否取决于任务?
我们遍历生成画布长度,并以 Falcon-7B 在 Sumi 生成结果上的困惑度来衡量流畅性,同时将每个任务的生成长度固定为表 1 中使用的设置。Falcon 困惑度仅是一个粗略的流畅性代理指标,但其随画布长度变化的趋势具有参考价值。
图 2 显示,流畅度同时取决于画布长度和任务,其中任务似乎是主导因素。GSM8K 最为脆弱:一旦画布超出训练范围,其困惑度就会急剧上升,模型输出近乎随机的文本,在短画布上最为严重。其他三个任务的退化则温和得多,且退化集中在短画布上;在长画布上,当长度达到最长训练序列长度的约 2.5 倍时,困惑度保持平稳甚至有所下降。
4.2 置信度采样是否会对 token 的确定顺序施加约束?
置信度采样 [von Rütte 等人,2026] 显著提升了 Sumi 在生成型任务中的得分。该采样器在设计上是顺序无关的:它会选择那些仍然存在噪声、且模型对当前 token 以外的某个 token 赋予高概率的位置,即潜在改进空间较大的位置。我们假设,这种性能提升可以解释为:模型先确定它已经能够判定的位置,而将剩余位置推迟处理——这是一种采样器自行发现而非编码实现的自适应调度策略。为了探究这一点,我们记录了每个位置的确定顺序,定义为该位置首次达到最终值的去噪步骤,并将分析范围限定在提取出的答案窗口内。
图 3 对比了自适应采样与祖先采样。在自适应采样下,每个位置的确定顺序是自组织的,并且在多次生成中可见;而在祖先采样下,该顺序基本是无结构的。因此,使用完全顺序无关目标训练的模型,默认情况下并不会按照固定的规范顺序进行确定;是置信度引导才引入了这种结构。
4.3 并行解码如何影响生成质量?
据报告,掩码扩散语言模型为了达到最佳准确率,每一步需要一个 token,这在实际应用中限制了并行解码。我们通过每步提交 token 并统计正确答案数量,来测试 Sumi 是否也存在同样的情况。
图 4 显示,在 GSM8K 之外,每步最多四个 token 时,准确率基本保持不变:HumanEval 和 MBPP 在达到某个点之前,与单 token 基线相比,差异保持在一到两个样本以内,MBPP 仅在某个点出现急剧下降。GSM8K 是个例外,它会立即退化,在某个点就已经损失了准确率。BBH-Logic3 是非单调的,并且由于只有 30 个样本,其在某个点出现的明显峰值更像是采样噪声,而非可靠的提升。总体情况是,均匀扩散在编码任务上允许适度的并行解码,而多步算术仍然对顺序敏感;在我们的样本量下,逻辑推理子任务尚无定论。
4.4 在给定修订预算的情况下,模型是否会修正自身的 token?
均匀扩散原则上可以覆盖已提交的 token,因此我们探究额外的去噪是否会产生自我修正。我们对生成区域进行过度去噪,分别运行生成长度的 1 倍、2 倍、4 倍和 8 倍,这为模型提供了 0 次、1 次、3 次和 7 次额外的机会来修订已提交的 token(即修订预算),以探究模型是否真的能改进已经去噪完成的 token。
表 2 报告了结果。很大一部分修订步骤确实覆盖了已提交的 token(58% 到 100%),然而净效果微乎其微:最终 token 中与第一次生成结果不同的比例最多为 1%,提取出的答案几乎从未改变(最多 30 个中有一个),并且每个任务的准确率都没有变化。检查这些轨迹发现,覆盖操作主要是往返式的,而非定向编辑。一种解读是,Sumi 在这些任务上的能力已接近上限,模型不知道如何改进已提交的答案;针对错误设计的修订设置是否会改变这一点,有待未来研究。
| 任务 | 编辑步骤(%) | 净 token 变化(%) | 答案已更改 |
| GSM8K | 58 | 1.0 | 1/30 |
| HumanEval | 89 | 0.2 | 0/30 |
| MBPP | 100 | 0.4 | 0/30 |
| BBH-Logic3 | 100 | 0.1 | 0/30 |
5 结论与未来工作
我们推出了 Sumi,这是一个完全开源的 7B 参数均匀扩散语言模型(UDLM),从零开始在 1.5T 模型 token 上进行了预训练,也是首个在大型参数和模型 token 规模上原生训练的 UDLM。在通用知识、推理和编程基准测试中,Sumi 的表现与在可比 token 预算下训练的自回归模型具有竞争力,但在常识基准测试中表现稍逊;我们偏向教育和代码的数据混合可能是造成这一差距的原因之一。我们公开了模型权重、中间检查点和完整的训练方案,包括基于公开语料库的数据混合的完整说明,以便社区能够研究大规模均匀扩散。
除了模型本身,我们的推理时探针揭示了关于原生训练均匀扩散的四项观察。生成流畅性对画布长度敏感,且存在一个任务相关的有效区间;对于我们的所有任务,2048 的单一画布长度均落在此区间内,这也是我们在整个评估过程中使用的长度。在该区间内,置信度采样会在原本无序的模型上诱导出一种自组织的承诺顺序。这种结构在编程任务中实现了适度的并行解码,而多步算术仍然对顺序敏感。最后,明确的修订预算并未带来自我修正:额外的去噪过程会覆盖已承诺的模型 token,但这些编辑主要是往返操作,最终输出和准确率保持不变。我们将这些探针结果视为方向性而非结论性的发现。
我们看到了未来工作的几个方向。我们正在准备 Sumi 的指令微调版本,并将在未来的更新中发布。在通用修订预算下缺乏自我修正能力,这留下了这样一个问题:针对可能错误设计的方法是否能够恢复这种能力。更广泛地说,在匹配的评估协议下进行受控比较,将有助于厘清 Sumi 的哪些生成行为是均匀扩散所固有的——本报告提出了这一问题,但并未给出定论。
局限性与风险
我们的推理时分析是方向性的,而非结论性的。这些分析基于每项任务抽取的30个样本问题,并使用Falcon-7B的困惑度作为粗略的流畅度代理指标,我们并未进行与掩码扩散模型和自回归模型的匹配对比——而这类对比是判断这些行为究竟源于统一扩散范式本身、还是Sumi模型所必需的。常识性差距比我们以教育和代码为主的数据混合所能解释的范围更大,我们也没有直接测试这种数据构成归因。
Sumi作为预训练基础模型发布,未经过任何指令微调、对齐或安全过滤。因此,它继承了此类模型的常见风险。对抗性或粗心的提示词可能诱发生成有害、冒犯或其他敏感文本,且在没有提示的情况下也可能产生类似输出,例如作为预训练语料库中偏见的反映。Sumi同样没有确保事实准确性的机制,可能以看似自信的方式陈述虚假信息。我们发布该模型是为了支持研究而非直接部署,并鼓励任何在其基础上进行开发的人员根据自身场景权衡这些风险,并独立验证事实性主张。
致谢
本研究使用了东京科学大学的TSUBAME4.0超级计算机,该资源由TSUBAME Grand Challenge大规模计算计划提供,我们衷心感谢其慷慨的计算资源支持。在评估实验中,我们使用了由九州大学信息技术研究所HPCI研究项目类别提供的计算资源,以及由产业技术综合研究所(AIST)和AIST Solutions提供、并得到“ABCI 3.0开发加速使用”项目支持的ABCI 3.0系统。本研究得到了文部科学省“旨在确保生成式AI模型透明度与可靠性的研发中心”项目、JST Moonshot研发资助项目编号JPMJMS2011-35(基础研究)、JSPS KAKENHI资助项目编号JP25KJ0615以及JST BOOST(日本)资助项目编号JPMJBS2421的支持。
参考文献
- Allal 等人 [2025] L. B. Allal, A. Lozhkov, E. Bakouch, G. M. Blázquez, G. Penedo, L. Tunstall, A. Marafioti, H. Kydlíček, A. P. Lajarín, V. Srivastav, J. Lochner, C. Fahlgren, X.-S. Nguyen, C. Fourrier, B. Burtenshaw, H. Larcher, H. Zhao, C. Zakka, M. Morlon, C. Raffel, L. von Werra, 和 T. Wolf. Smollm2: 当小模型变大——以数据为中心的小语言模型训练, 2025. URL https://arxiv.org/abs/2502.02737.
- Almazrouei 等人 [2023] E. Almazrouei, H. Alobeidli, A. Alshamsi, A. Cappelli, R. Cojocaru, M. Debbah, Étienne Goffinet, D. Hesslow, J. Launay, Q. Malartic, D. Mazzotta, B. Noune, B. Pannier, 和 G. Penedo. Falcon 系列开放语言模型, 2023. URL https://arxiv.org/abs/2311.16867.
- Austin 等人 [2021] J. Austin, A. Odena, M. Nye, M. Bosma, H. Michalewski, D. Dohan, E. Jiang, C. Cai, M. Terry, Q. Le, 和 C. Sutton. 基于大语言模型的程序合成. arXiv 预印本 arXiv:2108.07732, 2021. URL https://arxiv.org/abs/2108.07732.
- Bisk 等人 [2020] Y. Bisk, R. Zellers, R. Le Bras, J. Gao, 和 Y. Choi. PIQA: 关于自然语言中物理常识的推理. 载于《AAAI 人工智能会议论文集》, 第 34 卷, 第 7432–7439 页, 2020. URL https://ojs.aaai.org/index.php/AAAI/article/view/6239.
- Bondarenko 等人 [2023] Y. Bondarenko, M. Nagel, 和 T. Blankevoort. 可量化 Transformer: 通过帮助注意力头不做事来消除异常值. 载于《神经信息处理系统进展》(NeurIPS), 2023. arXiv:2306.12929.
- Chen 等人 [2021] M. Chen, J. Tworek, H. Jun, Q. Yuan, H. P. d. O. Pinto, J. Kaplan, H. Edwards, Y. Burda, N. Joseph, G. Brockman, 等. 评估在代码上训练的大语言模型. arXiv 预印本 arXiv:2107.03374, 2021. URL https://arxiv.org/abs/2107.03374.
- Chowdhery 等人 [2023] A. Chowdhery, S. Narang, J. Devlin, M. Bosma, G. Mishra, A. Roberts, P. Barham, H. W. Chung, C. Sutton, S. Gehrmann, P. Schuh, K. Shi, S. Tsvyashchenko, J. Maynez, A. Rao, P. Barnes, Y. Tay, N. Shazeer, V. Prabhakaran, E. Reif, N. Du, B. Hutchinson, R. Pope, J. Bradbury, J. Austin, M. Isard, G. Gur-Ari, P. Yin, T. Duke, A. Levskaya, S. Ghemawat, S. Dev, H. Michalewski, X. Garcia, V. Misra, K. Robinson, L. Fedus, D. Zhou, D. Ippolito, D. Luan, H. Lim, B. Zoph, A. Spiridonov, R. Sepassi, D. Dohan, S. Agrawal, M. Omernick, A. M. Dai, T. S. Pillai, M. Pellat, A. Lewkowycz, E. Moreira, R. Child, O. Polozov, K. Lee, Z. Zhou, X. Wang, B. Saeta, M. Diaz, O. Firat, M. Catasta, J. Wei, K. Meier-Hellstern, D. Eck, J. Dean, S. Petrov, 和 N. Fiedel。PaLM:利用 Pathways 扩展语言建模。《机器学习研究期刊》,24(1),2023 年 1 月。ISSN 1532-4435。
- Clark 等人 [2018] P. Clark, I. Cowhey, O. Etzioni, T. Khot, A. Sabharwal, C. Schoenick, 和 O. Tafjord。你以为已经解决了问答问题?试试 ARC,AI2 推理挑战。arXiv 预印本 arXiv:1803.05457,2018 年。URL https://arxiv.org/abs/1803.05457。
- Cobbe 等人 [2021] K. Cobbe, V. Kosaraju, M. Bavarian, M. Chen, H. Jun, L. Kaiser, M. Plappert, J. Tworek, J. Hilton, R. Nakano, C. Hesse, 和 J. Schulman。训练验证器以解决数学应用题。arXiv 预印本 arXiv:2110.14168,2021 年。URL https://arxiv.org/abs/2110.14168。
- DeepMind [2026] DeepMind。DiffusionGemma。https://deepmind.google/models/gemma/diffusiongemma/,2026 年。访问日期:2026-06-16。
- Fujii 等人 [2025] K. Fujii, Y. Tajima, S. Mizuki, H. Shimada, T. Shiotani, K. Saito, M. Ohi, M. Kawamura, T. Nakamura, T. Okamoto, S. Ishida, K. Hattori, Y. Ma, H. Takamura, R. Yokota, 和 N. Okazaki。重写预训练数据可提升大语言模型在数学和代码方面的性能,2025 年。URL https://arxiv.org/abs/2505.02881。
- Gao 等人 [2024] L. Gao, J. Tow, B. Abbasi, S. Biderman, S. Black, A. DiPofi, C. Foster, L. Golding, J. Hsu, A. Le Noac’h, H. Li, K. McDonell, N. Muennighoff, C. Ociepa, J. Phang, L. Reynolds, H. Schoelkopf, A. Skowron, L. Sutawika, E. Tang, A. Thite, B. Wang, K. Wang, 和 A. Zou。语言模型评估工具包,2024 年 7 月。URL https://zenodo.org/records/12608602。
- Groeneveld 等人 [2024] D. Groeneveld, I. Beltagy, E. Walsh, A. Bhagia, R. Kinney, O. Tafjord, A. Jha, H. Ivison, I. Magnusson, Y. Wang, S. Arora, D. Atkinson, R. Authur, K. Chandu, A. Cohan, J. Dumas, Y. Elazar, Y. Gu, J. Hessel, T. Khot, W. Merrill, J. Morrison, N. Muennighoff, A. Naik, C. Nam, M. Peters, V. Pyatkin, A. Ravichander, D. Schwenk, S. Shah, W. Smith, E. Strubell, N. Subramani, M. Wortsman, P. Dasigi, N. Lambert, K. Richardson, L. Zettlemoyer, J. Dodge, K. Lo, L. Soldaini, N. Smith, 和 H. Hajishirzi。OLMo:加速语言模型科学。载于《第 62 届计算语言学协会年会论文集(第 1 卷:长论文)》,第 15789–15809 页,泰国曼谷,2024 年 8 月。计算语言学协会。10.18653/v1/2024.acl-long.841。URL https://aclanthology.org/2024.acl-long.841/。
- Gu 等人 [2025] X. Gu, T. Pang, C. Du, Q. Liu, F. Zhang, C. Du, Y. Wang, 和 M. Lin。注意力汇聚何时在语言模型中涌现:一项实证研究。载于《国际学习表征会议(ICLR)》,2025 年。arXiv:2410.10781。
- Hendrycks 等人 [2021] D. Hendrycks, C. Burns, S. Basart, A. Zou, M. Mazeika, D. Song, 和 J. Steinhardt。衡量大规模多任务语言理解能力。载于《国际学习表征会议(ICLR)》,2021 年。URL https://arxiv.org/abs/2009.03300。
- Hu 等人 [2024] S. Hu, Y. Tu, X. Han, G. Cui, C. He, W. Zhao, X. Long, Z. Zheng, Y. Fang, Y. Huang, X. Zhang, Z. L. Thai, C. Wang, Y. Yao, C. Zhao, J. Zhou, J. Cai, Z. Zhai, N. Ding, C. Jia, G. Zeng, dahai li, Z. Liu, 和 M. Sun。MiniCPM:通过可扩展训练策略揭示小型语言模型的潜力。载于《第一届语言建模会议》,2024 年。URL https://openreview.net/forum?id=3X2L2TFr0f。
- Kodama 与 Oda [2026] T. Kodama 与 Y. Oda。双语及多类别指令预训练的综合研究。载于《计算语言学协会发现:EACL 2026》,第 1323–1340 页,摩洛哥拉巴特,2026 年 3 月。计算语言学协会。URL https://aclanthology.org/2026.findings-eacl.68/。
- Lai 等人 [2017] G. Lai、Q. Xie、H. Liu、Y. Yang 与 E. Hovy。RACE:来自考试的大规模阅读理解数据集。载于《2017 年自然语言处理经验方法会议论文集》,第 785–794 页,丹麦哥本哈根,2017 年。计算语言学协会。URL https://aclanthology.org/D17-1082/。
- Lin 等人 [2022] S. Lin、J. Hilton 与 O. Evans。TruthfulQA:衡量模型如何模仿人类错误陈述。载于《计算语言学协会第 60 届年会论文集(第 1 卷:长论文)》,第 3214–3252 页,爱尔兰都柏林,2022 年。计算语言学协会。URL https://aclanthology.org/2022.acl-long.229/。
- LLM-jp [2025] LLM-jp。LLM-jp Corpus v4。https://gitlab.llm-jp.nii.ac.jp/datasets/llm-jp-corpus-v4,2025 年。访问日期:2026-06-11。
- LLM-jp [2026] LLM-jp。LLM-jp Corpus v4.1。https://gitlab.llm-jp.nii.ac.jp/datasets/llm-jp-corpus-v4.1,2026 年。访问日期:2026-06-11。
- Loshchilov 与 Hutter [2019] I. Loshchilov 与 F. Hutter。解耦权重衰减正则化。载于《国际学习表征会议》,2019 年。URL https://openreview.net/forum?id=Bkg6RiCqY7。
- Lozhkov 等人 [2024] A. Lozhkov、L. Ben Allal、L. von Werra 与 T. Wolf。Fineweb-edu:最优质的教育内容集合,2024 年。URL https://huggingface.co/datasets/HuggingFaceFW/fineweb-edu。
- Miller [2023] E. Miller。注意力机制偏差一位。https://www.evanmiller.org/attention-is-off-by-one.html,2023 年 7 月。博客文章,访问日期:2026-06-15。
- Nie 等人 [2026] S. Nie、F. Zhu、Z. You、X. Zhang、J. Ou、J. Hu、J. ZHOU、Y. Lin、J.-R. Wen 与 C. Li。大规模语言扩散模型。载于《第三十九届神经信息处理系统年度会议》,2026 年。URL https://openreview.net/forum?id=KnqiC0znVF。
- Olmo 等人 [2025] T. Olmo, A. Ettinger, A. Bertsch, B. Kuehl, D. Graham, D. Heineman, D. Groeneveld, F. Brahman, F. Timbers, H. Ivison, J. Morrison, J. Poznanski, K. Lo, L. Soldaini, M. Jordan, M. Chen, M. Noukhovitch, N. Lambert, P. Walsh, P. Dasigi, R. Berry, S. Malik, S. Shah, S. Geng, S. Arora, S. Gupta, T. Anderson, T. Xiao, T. Murray, T. Romero, V. Graf, A. Asai, A. Bhagia, A. Wettig, A. Liu, A. Rangapur, C. Anastasiades, C. Huang, D. Schwenk, H. Trivedi, I. Magnusson, J. Lochner, J. Liu, L. J. V. Miranda, M. Sap, M. Morgan, M. Schmitz, M. Guerquin, M. Wilson, R. Huff, R. L. Bras, R. Xin, R. Shao, S. Skjonsberg, S. Z. Shen, S. S. Li, T. Wilde, V. Pyatkin, W. Merrill, Y. Chang, Y. Gu, Z. Zeng, A. Sabharwal, L. Zettlemoyer, P. W. Koh, A. Farhadi, N. A. Smith, and H. Hajishirzi. Olmo 3, 2025. URL https://arxiv.org/abs/2512.13961.
- OpenAI 等 [2025] OpenAI, :, S. Agarwal, L. Ahmad, J. Ai, S. Altman, A. Applebaum, E. Arbus, R. K. Arora, Y. Bai, B. Baker, H. Bao, B. Barak, A. Bennett, T. Bertao, N. Brett, E. Brevdo, G. Brockman, S. Bubeck, C. Chang, K. Chen, M. Chen, E. Cheung, A. Clark, D. Cook, M. Dukhan, C. Dvorak, K. Fives, V. Fomenko, T. Garipov, K. Georgiev, M. Glaese, T. Gogineni, A. Goucher, L. Gross, K. G. Guzman, J. Hallman, J. Hehir, J. Heidecke, A. Helyar, H. Hu, R. Huet, J. Huh, S. Jain, Z. Johnson, C. Koch, I. Kofman, D. Kundel, J. Kwon, V. Kyrylov, E. Y. Le, G. Leclerc, J. P. Lennon, S. Lessans, M. Lezcano-Casado, Y. Li, Z. Li, J. Lin, J. Liss, Lily, Liu, J. Liu, K. Lu, C. Lu, Z. Martinovic, L. McCallum, J. McGrath, S. McKinney, A. McLaughlin, S. Mei, S. Mostovoy, T. Mu, G. Myles, A. Neitz, A. Nichol, J. Pachocki, A. Paino, D. Palmie, A. Pantuliano, G. Parascandolo, J. Park, L. Pathak, C. Paz, L. Peran, D. Pimenov, M. Pokrass, E. Proehl, H. Qiu, G. Raila, F. Raso, H. Ren, K. Richardson, D. Robinson, B. Rotsted, H. Salman, S. Sanjeev, M. Schwarzer, D. Sculley, H. Sikchi, K. Simon, K. Singhal, Y. Song, D. Stuckey, Z. Sun, P. Tillet, S. Toizer, F. Tsimpourlas, N. Vyas, E. Wallace, X. Wang, M. Wang, O. Watkins, K. Weil, A. Wendling, K. Whinnery, C. Whitney, H. Wong, L. Yang, Y. Yang, M. Yasunaga, K. Ying, W. Zaremba, W. Zhan, C. Zhang, B. Zhang, E. Zhang, 和 S. Zhao. gpt-oss-120b 与 gpt-oss-20b 模型卡,2025. URL https://arxiv.org/abs/2508.10925.
- Penedo 等 [2024] G. Penedo, H. Kydlíček, L. B. allal, A. Lozhkov, M. Mitchell, C. Raffel, L. V. Werra, 和 T. Wolf. FineWeb 数据集:从网络中提取最优质的大规模文本数据,2024. URL https://arxiv.org/abs/2406.17557.
- Rein 等 [2024] D. Rein, B. L. Hou, A. C. Stickland, J. Petty, R. Y. Pang, J. Dirani, J. Michael, 和 S. R. Bowman. GPQA:一个研究生级别的、无法通过谷歌搜索解决的问答基准测试。收录于第一届语言建模会议 (COLM),2024. URL https://openreview.net/forum?id=Ti67584b98.
- Sahoo 等 [2026] S. S. Sahoo, J.-M. Lemercier, Z. Yang, J. Deschenaux, J. Liu, J. Thickstun, 和 A. Jukic. 超越掩码扩散语言模型的规模化研究,2026. URL https://arxiv.org/abs/2602.15014.
- Sakaguchi 等人 [2020] K. Sakaguchi, R. Le Bras, C. Bhagavatula, 和 Y. Choi. WinoGrande:一种大规模对抗性 Winograd 模式挑战. 载于《AAAI 人工智能会议论文集》,第 34 卷,第 8732–8740 页,2020 年. URL https://ojs.aaai.org/index.php/AAAI/article/view/6399.
- Shoeybi 等人 [2019] M. Shoeybi, M. Patwary, R. Puri, P. LeGresley, J. Casper, 和 B. Catanzaro. Megatron-lm:使用模型并行训练数十亿参数的语言模型. arXiv 预印本 arXiv:1909.08053,2019 年.
- Su 等人 [2024] J. Su, M. Ahmed, Y. Lu, S. Pan, W. Bo, 和 Y. Liu. Roformer:具有旋转位置编码的增强型 Transformer 架构. Neurocomput.,568(C),2024 年 2 月. ISSN 0925-2312. 10.1016/j.neucom.2023.127063. URL https://doi.org/10.1016/j.neucom.2023.127063.
- Suzgun 等人 [2023] M. Suzgun, N. Scales, N. Schärli, S. Gehrmann, Y. Tay, H. W. Chung, A. Chowdhery, Q. V. Le, E. H. Chi, D. Zhou, 和 J. Wei. 具有挑战性的 BIG-bench 任务以及链式推理能否解决它们. 载于《计算语言学协会发现:ACL 2023》,第 13003–13051 页,加拿大多伦多,2023 年. 计算语言学协会. URL https://aclanthology.org/2023.findings-acl.824/.
- Touvron 等人 [2023] H. Touvron, L. Martin, K. Stone, P. Albert, A. Almahairi, Y. Babaei, N. Bashlykov, S. Batra, P. Bhargava, S. Bhosale, D. Bikel, L. Blecher, C. C. Ferrer, M. Chen, G. Cucurull, D. Esiobu, J. Fernandes, J. Fu, W. Fu, B. Fuller, C. Gao, V. Goswami, N. Goyal, A. Hartshorn, S. Hosseini, R. Hou, H. Inan, M. Kardas, V. Kerkez, M. Khabsa, I. Kloumann, A. Korenev, P. S. Koura, M.-A. Lachaux, T. Lavril, J. Lee, D. Liskovich, Y. Lu, Y. Mao, X. Martinet, T. Mihaylov, P. Mishra, I. Molybog, Y. Nie, A. Poulton, J. Reizenstein, R. Rungta, K. Saladi, A. Schelten, R. Silva, E. M. Smith, R. Subramanian, X. E. Tan, B. Tang, R. Taylor, A. Williams, J. X. Kuan, P. Xu, Z. Yan, I. Zarov, Y. Zhang, A. Fan, M. Kambadur, S. Narang, A. Rodriguez, R. Stojnic, S. Edunov, 和 T. Scialom. Llama 2:开放基础模型与微调聊天模型,2023 年. URL https://arxiv.org/abs/2307.09288.
- von Rütte 等人 [2025] D. von Rütte, J. Fluri, Y. Ding, A. Orvieto, B. Schölkopf, 和 T. Hofmann。广义插值离散扩散。第四十二届国际机器学习大会,2025年。URL https://openreview.net/forum?id=rvZv7sDPV9。
- von Rütte 等人 [2026] D. von Rütte, J. Fluri, O. Pooladzandi, B. Schölkopf, T. Hofmann, 和 A. Orvieto。离散扩散语言模型的缩放行为。第十四届国际学习表征大会,2026年。URL https://openreview.net/forum?id=GDYaNzxt9T。
- Wang 等人 [2025] Z. Wang, F. Zhou, X. Li, 和 P. Liu。Octothinker:中期训练激励强化学习缩放。arXiv 预印本 arXiv:2506.20512,2025年。预印本。
- Xiao 等人 [2024] G. Xiao, Y. Tian, B. Chen, S. Han, 和 M. Lewis。利用注意力汇聚点的高效流式语言模型。国际学习表征大会(ICLR),2024年。arXiv:2309.17453。
- Yang 等人 [2025] A. Yang, A. Li, B. Yang, B. Zhang, B. Hui, B. Zheng, B. Yu, C. Gao, C. Huang, C. Lv, C. Zheng, D. Liu, F. Zhou, F. Huang, F. Hu, H. Ge, H. Wei, H. Lin, J. Tang, J. Yang, J. Tu, J. Zhang, J. Yang, J. Yang, J. Zhou, J. Zhou, J. Lin, K. Dang, K. Bao, K. Yang, L. Yu, L. Deng, M. Li, M. Xue, M. Li, P. Zhang, P. Wang, Q. Zhu, R. Men, R. Gao, S. Liu, S. Luo, T. Li, T. Tang, W. Yin, X. Ren, X. Wang, X. Zhang, X. Ren, Y. Fan, Y. Su, Y. Zhang, Y. Zhang, Y. Wan, Y. Liu, Z. Wang, Z. Cui, Z. Zhang, Z. Zhou, 和 Z. Qiu。Qwen3 技术报告,2025年。URL https://arxiv.org/abs/2505.09388。
- Ye 等人 [2025] J. Ye, Z. Xie, L. Zheng, J. Gao, Z. Wu, X. Jiang, Z. Li, 和 L. Kong。Dream 7B:扩散大语言模型。arXiv 预印本 arXiv:2508.15487,2025年。
- Zellers 等人 [2019] R. Zellers, A. Holtzman, Y. Bisk, A. Farhadi, 和 Y. Choi。HellaSwag:机器真的能帮你把句子说完吗?第57届计算语言学协会年会论文集,第4791–4800页,意大利佛罗伦萨,2019年。计算语言学协会。URL https://aclanthology.org/P19-1472/。
- Zhou 等人 [2025] F. Zhou, Z. Wang, N. Ranjan, Z. Cheng, L. Tang, G. He, Z. Liu, 与 E. P. Xing. 《Megamath:突破开放数学语料库的极限》. arXiv 预印本 arXiv:2504.02807, 2025. 预印本.
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org