跳到正文
北京时间

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

279条精选相关主题论文研究部署工程模型发布

最新精选

第 241–260 条 · 共 279 条
1月27日周二
  1. Hugging Face:Blog(RSS)83

    解锁GPT-OSS的智能体强化学习训练:一项实践回顾

    LinkedIn团队探索了将GPT-OSS模型作为智能体应用核心进行强化学习的可行性。实验发现,由于GPT-OSS采用的混合专家架构在两次前向传播中可能产生路由差异,导致在同策略PPO训练中出现重要性采样比率偏离、KL散度爆炸及奖励不增长的问题。团队通过一个关键修复——在同策略条件下强制将旧对数概率设置为新计算值(并分离梯度),确保了重要性采样比率为1,从而恢复了PPO同策略训练的完整性。该修复方案适用于GPT-OSS-20B及GPT-OSS-120B模型。

    推荐理由:为MoE模型RL训练提供实用调试方案,提升代理AI开发效率。

12月31日周三
  1. Dwarkesh Patel:Podcast & Blog(RSS)

    Adam Marblestone — AI 缺失了关于大脑的根本认知

    Adam Marblestone 指出,当前人工智能研究忽略了大脑运作的核心机制。与业界普遍关注神经网络架构不同,大脑的真正优势在于其奖励函数而非结构本身。这一观点挑战了主流 AI 研究范式,暗示未来突破可能来自对大脑激励系统的深入理解,而非单纯的架构模仿。该论断为人工智能发展提供了新的思考维度。

    推荐理由:AI研发或应转向奖励函数设计,而非一味堆叠架构复杂度

12月24日周三
  1. OpenRouter:Announcements(RSS)55

    可蒸馏模型与合成数据管道:使用 NeMo Data Designer

    介绍如何利用 NeMo Data Designer 构建许可安全的合成数据工作流,用于模型特化(model specialization)。该管道支持生成可蒸馏模型所需的高质量合成数据,确保数据来源合规,适用于下游微调与领域适配场景。

    推荐理由:虽然发布快半年了,但教程讲的是如何用 NeMo Data Designer 构建 license-safe 的合成数据管道,对正在搞模型蒸馏和微调的开发者依然有参考价值,细节够实操。

12月18日周四
  1. Hugging Face:Blog(RSS)73

    Transformers v5 中的分词:更简单、清晰与模块化

    Transformers v5 发布了全新的分词处理架构,核心变化是引入了更简单、统一的 API 设计,将分词器、后处理器和解码器模块化。新版移除了大量遗留代码,使代码库体积减少了约 40%,并显著提升了处理长文本和特殊 token 的灵活性。这一改进旨在降低开发者使用门槛,同时为各类大语言模型(如 GPT、Claude、LLaMA)提供更高效、一致的分词支持。

    推荐理由:Transformers库tokenization模块重构,开发者可更高效处理文本数据。

12月16日周二
  1. Saining Xie

    新论文:iREPA 扩散模型是其底层表征的渲染器。通过这种新设置,我们能更清楚地洞察这些表征的真正含义。Jas 开始了一场自发的探索,过去三个月我们学到了很多 ps. 这也是我们对一种新型线上"饮水机效应"的小实验,我很喜欢看到这种现象。让我们争论、讨论,然后用真正的努力将其转化为正经科学 [引用 @1jaskiratsingh]:‼️ 表征对生成很重要!但事实证明,我们对表征如何帮助生成的理解一直都是错的 ‼️ 我们之前的想法:(我们错了) ❌ 更大的视觉编码器 → 更好的表征 → 更好的生成 ❌ 更好的全局语义 → 更好的表征 → 更好的生成 结果发现: 🤯 在表征对齐方面,小 20 倍以上的视觉编码器可以达到与更大模型相似或更好的性能 🤯 线性探测准确率约 20%(全局语义的衡量指标)的视觉编码器可以胜过准确率 >80% 的编码器 🤯 即使是 SiFT 和 HoG 这类经典特征也能带来与现代大得多的视觉编码器相媲美的提升 ‼️ 🚨 介绍:什么对表征对齐重要?全局信息还是空间结构 🚨 TL;DR: ✅ 更好的全局语义信息 ≠ 更好的生成 ✅ 空间结构(而非全局语义)驱动表征的生成性能 ✅ 我们提出 iREPA:仅需 3 行代码,强调空间结构迁移,并在 REPA、REPA-E、Meanflow、JiT 等方法上持续提高收敛速度 在 @AdobeResearch 的激动人心的项目,与 @xingjian_leng、@zongze_wu、@LiangZheng_06、@rzhang88、@elishechtman 和 @sainingxie 合作 🙏 对我来说这也是一次特别有趣且独特的经历,在项目的每一步我们都在证明自己的偏见是错误的 😆 还要大力感谢 @YouJiacheng、@ShumingHu 和 @gallabytes,他们在 X 上的评论开启了这一方向的探索 🫡 论文:https://arxiv.org/abs/2512.10794 代码:https://github.com/End2End-Diffusion/iREPA 项目页面:https://end2end-diffusion.github.io/irepa 更多细节见线程:[1/n] 🧵

    引用Jaskirat Singh@1jaskiratsingh

    ‼️ 表征对生成至关重要!但事实证明,我们一直以来对表征如何帮助生成的理解都是错的 ‼️ 我们原本以为的:(我们错了) ❌ 更大的视觉编码器 → 更好的表征 → 更好的生成 ❌ 更好的全局语义 → 更好的表征 → 更好的生成 事实证明: 🤯 小 20 倍以上的视觉编码器在表征对齐方面可以拥有与更大模型相似甚至更好的性能 🤯 线性探测准确率(衡量全局语义的指标)约 20% 的视觉编码器可以胜过准确率超过 80% 的编码器。 🤯 甚至像 SiFT 和 HoG 这样的经典特征也能带来与现代大得多的视觉编码器相当的竞争力提升 ‼️ 🚨 隆重介绍:表征对齐的关键是什么?全局信息还是空间结构 🚨 TL;DR: ✅ 更好的全局语义信息 ≠ 更好的生成 ✅ 空间结构(而非全局语义)驱动表征的生成性能 ✅ 我们提出 iREPA:仅 3 行代码,即可强化空间结构迁移,并在 REPA、REPA-E、Meanflow、JiT 等中持续提升收敛速度 令人兴奋的项目,来自 @AdobeResearch,并与 @xingjian_leng、@zongze_wu、@LiangZheng_06、@rzhang88、@elishechtman 和 @sainingxie 合作 🙏 对我来说,这也是一次特别有趣且独特的经历,我们在项目的每一步都在证明自己的偏见是错的 😆 还要特别感谢 @YouJiacheng、@ShumingHu 和 @gallabytes,他们在 X 上的评论开启了这一方向的探索 🫡 论文:https://arxiv.org/abs/2512.10794 代码:https://github.com/End2End-Diffusion/iREPA 项目主页:https://end2end-diffusion.github.io/irepa 更多细节见推文串:[1/n] 🧵

    推荐理由:颠覆认知:小20倍视觉编码器也能驱动高质量生成,空间结构才是关键

12月4日周四
  1. Hugging Face:Blog(RSS)76

    利用Claude微调开源大语言模型的新途径

    Anthropic的研究人员探索了一种新方法:使用其强大的闭源AI助手Claude来生成高质量的指令遵循数据,并用这些数据对较小的开源模型(如LLaMA系列)进行监督微调。这项实验旨在展示如何利用尖端闭源模型的能力来指导和改进可公开访问的开源模型性能,从而推动AI技术的进步与民主化。

    推荐理由:用闭源模型蒸馏能力给开源模型,一条低成本微调的新路径值得关注

11月28日周五
  1. Ilya Sutskever

    我之前说的一点没被传达清楚: - 继续扩展当前的技术会持续带来进步。特别是,它不会停滞。 - 但某些重要的东西仍会继续缺失。 [引用 @haider1]:以下是今天 ilya sutskever 播客的要点: - 5-20 年内实现超级智能 - 当前的扩展将严重停滞;我们回到了真正的研究 - 超级智能 = 超快速的持续学习者,而非完成的预言机 - 模型的泛化能力比人类差 100 倍,这是最大的 AGI 阻碍 - 需要全新的 ML 范式(我有想法,现在不能分享) - AI 影响将很剧烈,但只在经济扩散之后 - 历史上的突破几乎不需要算力 - SSI 有足够的专注研究算力来获胜 - 当前的 RL 已经比预训练消耗更多算力

    引用Haider.@haider1

    以下是今天伊利亚·苏茨克维播客中最重要的几点: - 超级智能将在5-20年内出现 - 当前的扩展将严重停滞;我们回到了真正的研究 - 超级智能 = 超快速持续学习者,而非完成态的预言机 - 模型的泛化能力比人类差100倍,这是AGI最大的障碍 - 需要全新的机器学习范式(我有想法,现在不能分享) - AI的影响将很猛烈,但只有在经济扩散之后才会显现 - 历史上的突破几乎不需要算力 - SSI拥有足够的专注研究算力来取胜 - 当前的强化学习消耗的算力已经超过预训练

    推荐理由:顶级科学家修正观点:Scaling将持续有效但无法触及AGI核心,亟需范式革命

11月27日周四
  1. Saining Xie

    Meta研究人员透露,Facebook自2020年起使用TPU训练AI,由Kaiming He领导开发TF和JAX代码库,MAE、DiT等模型完全基于TPU构建。因内部采用有限,Meta于2023年取消GCP协议。推文指出,Google、Anthropic等实验室长期使用TPU训练大模型,Nvidia的CUDA护城河并非不可逾越,OpenAI亦投资Triton寻求替代。TPU与GPU的效率差异并非关键,系统工程人才才是决定性因素。

    引用Clive Chan@itsclivetime

    我不断看到关于 TPU 的东西,有什么实质性的新进展吗? 没有证据表明 Google 曾在非 TPU 硬件上训练过 Gemini,这可以追溯到多年前 GPT 之前的模型,比如 BERT。TPU 比 Nvidia 自己的张量核心还要早。 Anthropic(以及 Character、SSI 和 Midjourney……)长期以来一直在使用 TPU,如果 Meta *没有* 在考虑它们,我会感到惊讶。 Nvidia 的护城河对大型实验室来说从来都不深——看看 OpenAI 决定它可以做得比 CUDA 更好,转而投资 Triton,在基准测试中经常胜过 CUDNN。这一切都没有什么神奇或结构性的东西,只是优秀的工程师在做优秀的工作。 TPU 并不比 GPU 高效多少,而微小的性能/功耗差异与 Meta 是否拥有正确的内核/系统工程人才来做到这一点相比,简直微不足道。Nvidia 和 Google 的护城河都很小,我们仍然处于个别优秀工程师就能扭转整个平衡的阶段。见下面的旧帖。 这难道……没有被定价进去吗?这些都是超级古老的公开信息。

    推荐理由:何恺明团队2020年起用TPU训练MAE/DiT,Nvidia护城河比想象更浅

11月26日周三
  1. Saining Xie

    好吧,有人已经向我们宣扬这个大概6年多了 很高兴我们已经过了"感受AGI"的阶段,回到了构建人类水平智能的道路上 https://t.co/Qp8FyLPaQU [引用 @dwarkesh_sp]:"AGI和预训练发生的事情是,在某种意义上它们过冲了目标。 你会意识到人类并不是AGI。因为人类缺乏大量的知识。相反,我们依赖持续学习。 如果我培养出一个超级聪明的15岁孩子,他们其实什么都不知道。一个优秀的学生,非常渴望学习。[你可以说,]'你去当程序员吧。你去当医生吧。去学习和成长。' 所以你可以想象,部署本身将涉及某种学习试错期。这是一个过程,而不是你扔下一个成品就完事了。" @ilyasut

    引用Dwarkesh Patel@dwarkesh_sp

    “AGI 和预训练发生的事情是,从某种意义上说,它们超出了目标。 你会意识到,人类并不是 AGI。因为人类缺乏大量知识。相反,我们依赖持续学习。 如果我培养出一个超级聪明的 15 岁少年,他们其实什么都不太懂。一个优秀的学生,非常渴望学习。[你可以说,]‘你去当程序员。你去当医生。去学习吧。’ 所以你可以想象,部署本身会涉及某种学习试错期。这是一个过程,而不是你直接拿出成品。” @ilyasut

    推荐理由:Ilya重新定义AGI路径,持续学习将取代预训练成下一代模型焦点

  2. Prime Intellect(网页)69

    Prime Intellect 发布 INTELLECT-3:106B 参数 MoE 模型,大规模 RL 训练并全栈开源

    Prime Intellect 发布 INTELLECT-3,一个 106B 参数的 MoE 模型,在 GLM-4.5-Air 基座上经 SFT 和大规模 RL 训练,在数学、代码、科学和推理基准上达到同规模最先进水平。

    推荐理由:原文给出了完整的模型权重、训练框架与 RL 环境开源清单,读者可以据此复现大规模强化学习后训练。

11月23日周日
  1. Ilya Sutskever

    重要工作 [引用 @AnthropicAI]:Anthropic 新研究:生产环境 RL 中 reward hacking 导致的自然涌现不对齐。 "Reward hacking" 是指模型学会在训练期间对分配给它们的任务作弊。 我们的新研究发现,如果不加以缓解,reward hacking 的后果可能非常严重。https://t.co/N4mRKtdNdp

    引用Anthropic@AnthropicAI

    Anthropic 新研究:生产环境强化学习中,奖励黑客行为自然涌现出的失准。 “奖励黑客”是指模型在训练期间学会在给定任务上作弊。 我们的新研究发现,奖励黑客行为的后果如果不加以缓解,可能会非常严重。https://t.co/N4mRKtdNdp

    推荐理由:Ilya盛赞的重磅安全研究,暴露大模型训练中的奖励作弊隐患

11月21日周五
  1. Hugging Face:Blog(RSS)80

    RapidFire AI 实现20倍更快的 TRL 微调

    RapidFire AI 发布了一套加速 TRL 微调的工具,通过自适应分块调度方案,允许在单个或多个 GPU 上并发启动多个训练配置并实时比较。内部基准测试显示,实验吞吐量比顺序执行高出约 16 至 24 倍。该工具提供即插即用的 TRL 配置包装器、分块并发训练、支持实时停止/恢复/克隆修改的交互式控制操作、自动多 GPU 编排以及 MLflow 仪表板,使用户能快速筛选最优配置,极大提升微调效率。

    推荐理由:开发者可并发测试多个微调配置,大幅提升实验效率。

11月19日周三
  1. Hugging Face:Blog(RSS)78

    Apriel-H1:蒸馏高效推理模型的关键要素

    ServiceNow-AI在Hugging Face发布博客,介绍了其提出的Apriel-H1方法,该方法通过知识蒸馏技术有效提升小型模型的推理能力。该方法的核心在于从大型模型中提取并转移复杂的推理路径,使蒸馏后的小模型在多项推理任务上表现显著提升,同时保持高效的部署性能。这一技术为在资源受限环境中部署高性能推理模型提供了新思路。

    推荐理由:新蒸馏方法可能大幅降低推理模型部署成本,开发者可借鉴实践。

10月10日周五
  1. 蚂蚁 inclusionAI:GitHub 新仓库66

    Ming-VideoMAR:基于连续令牌的自回归视频生成模型

    Ming-VideoMAR 是一款仅解码器的自回归图像到视频生成模型,采用连续令牌统一视觉表征。它首次将时间因果性与空间双向性作为视频自回归核心原则,并提出了整合掩码生成的下一帧扩散损失。该模型首次实现了视频生成的零样本分辨率缩放,能灵活生成远超训练分辨率的视频。其在训练与推理效率上表现突出,参数量、训练数据量和GPU消耗仅为之前最佳模型Cosmos的极小比例(9.3%、0.5%和0.2%),同时在定量与定性评估中均实现超越。模型代码与检查点已开源,论文已被NeurIPS 2025接收。

    推荐理由:蚂蚁把自回归视频生成的训练成本砍到 Cosmos 的 0.2% 还能赢,这个效率信号比分数本身更值得关注,做视频生成的团队该认真看看它的课程学习和渐进分辨率策略。

10月2日周四
  1. Andrej Karpathy

    Sutton(《The Bitter Lesson》作者)在播客中质疑 LLM 并非真正的"苦涩的教训"产物——它们依赖有限的人类数据且充满偏见。他主张 AI 应像动物一样通过 RL 与世界动态交互,而非模仿人类文本。作者认同 LLM 确实充斥人工干预,但认为预训练是应对冷启动的实用"进化替代方案",纯 RL 在现实世界难以行得通。

    引用Dwarkesh Patel@dwarkesh_sp

    .@RichardSSutton,强化学习之父,不认为 LLM 是“苦涩教训”的信徒。 我对 Richard 立场的善意解读:我们需要某种新架构来实现持续(在职)学习。 而如果我们有了持续学习,就不需要专门的训练阶段——智能体就像所有人类、乃至所有动物一样,边做边学。 这种新范式将使我们当前基于 LLM 的方法过时。 我尽力表达了这样一种观点:LLM 将成为这种经验学习得以发生的基础。现场有些火花四溅。 0:00:00 – LLM 是死路一条吗? 0:13:51 – 人类会做模仿学习吗? 0:23:57 – 经验时代 0:34:25 – 当前架构在分布外泛化能力很差 0:42:17 – AI 领域的意外 0:47:28 – AGI 之后“苦涩教训”仍然适用吗? 0:54:35 – 向 AI 的传承

    推荐理由:Karpathy解读Sutton对LLM的批判,提出「召唤幽灵」vs「构建动物」的深刻比喻,反思AI发展路径

9月25日周四
  1. TensorZero:实验与工程博客63

    TensorZero 实测 OpenAI 强化微调(RFT)是否值得:仅智能体编码任务明显胜出,成本却是 SFT 的 100-700 倍

    TensorZero 在数据抽取、智能体编码和客服三个任务上对比了 OpenAI RFT(o4-mini)与 SFT(GPT-4.1 mini)。

    推荐理由:作者用三个真实任务实测 OpenAI RFT 与 SFT 的效果和成本差距,给出了按任务类型判断 RFT 是否值得用的可比结论。

9月9日周二
  1. Sam Altman:Blog(RSS)

    Jakub 与 Szymon

    OpenAI 高层公开致谢首席科学家 Jakub Pachocki 与 Szymon Sidor,二人多次联手攻克被认为不可能的技术难题,主导 Dota RL 扩展、GPT-4 预训练及推理突破,被形容为“不知疲倦”的黄金搭档。

    推荐理由:Sam Altman 揭秘 OpenAI 核心科学家与关键技术突破历程

8月29日周五
  1. Andrej Karpathy

    教科书等知识载体应从人类可读格式转为LLM优化格式:提取正文为结构化markdown,例题转为SFT训练数据,练习题转为RL环境并附加答案作为评判标准,同时支持合成数据无限扩展(如将时钟角度问题泛化为任意时间的自动出题器),最终构建RAG或MCP服务供LLM像学生一样系统学习,远比简单PDF转文本更高效。

    推荐理由:Karpathy提出LLMification概念,将教科书重构为LLM训练数据的新范式

8月5日周二
  1. Jim Fan

    物理AI评估无法靠实车碰撞测试完成,传统游戏引擎(sim 1.0)也难以覆盖所有边缘情况。基于神经网络的sim 2.0由数据驱动,随车队规模扩展。Tesla已应用多年,用于生成近正面碰撞等罕见危险场景的训练数据,补充800万辆实车难以采集的极端案例。

    引用Elon Musk@elonmusk

    @DrJimFan 特斯拉已经拥有这个功能好几年了。用于创建不寻常的训练样本(例如近乎正面碰撞),即使现场有800万辆车也需要补充数据,尤其是随着我们的汽车变得越来越安全,危险情况变得非常罕见。

    推荐理由:Jim Fan 指出物理 AI 评估难题,提出神经网络驱动的 Sim 2.0 数据飞轮方案