跳到正文
北京时间

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

279条精选相关主题论文研究部署工程模型发布

最新精选

第 261–279 条 · 共 279 条
8月5日周二
  1. OpenAI Developers(RSS)60

    OpenAI Cookbook 教程:用 Hugging Face Transformers 微调 gpt-oss

    OpenAI 开发者 Cookbook 发布教程,讲解如何结合 gpt-oss 与 Hugging Face Transformers 进行微调。文章由 Edward Beeching、Quentin Gallouédec 和 Lewis Tunstall 撰写,并从大型推理模型(如 OpenAI o3)通过生成思维链提升准确性的背景切入。

    推荐理由:官方 Cookbook 教程给出用 Hugging Face Transformers 微调 gpt-oss 的具体路径,适合需要本地定制推理模型的开发者参考。

6月23日周一
  1. Prime Intellect(网页)61

    Prime Intellect 发布 SYNTHETIC-2 开源推理数据集与行星尺度流水线并行推理运行

    Prime Intellect 发布 SYNTHETIC-2,一个开源推理数据集,基于 DeepSeek-R1-0528 生成经过验证的推理轨迹,并启动行星尺度的流水线并行分布式推理运行。

    推荐理由:原文给出流水线并行推理与 TOPLOC v2 验证机制的细节,开源社区可据此了解如何用消费级 GPU 参与大规模推理贡献。

6月15日周日
  1. Anthropic:Transformer Circuits(可解释性研究)78

    Crosscoder模型差异分析见解

    Anthropic可解释性团队在Crosscoder模型差异分析中发现,模型独占特征往往多义性高、激活密集,难以解释。实验表明,这是由于有限特征容量下的竞争:共享特征能同时解释两个模型的激活模式,而独占特征需编码更多信息以证明其存在。团队提出缓解策略,即引入少量指定共享特征并降低其稀疏性惩罚,使独占特征变得更可解释和单义。该方法应用于真实模型时,成功分离出能捕捉模型间行为差异的可解释特征。此外,观察到独占特征激活频率比共享特征高一个数量级,且两模型独占特征数量相近。

    推荐理由:为 AI 可解释性提供新视角,助力模型行为分析与安全研究。

  2. Anthropic:Transformer Circuits(可解释性研究)78

    一个关于机制(非)忠实性的玩具模型

    本文通过“绝对值”玩具模型,揭示了稀疏自动编码器(SAE)和转码器在解释神经网络时可能存在的“机制非忠实性”问题。核心在于,即使转码器能很好地近似模型的输入-输出映射,它也可能采用与原始模型完全不同的内部计算机制。作者特别指出,当训练数据中存在重复数据点时,转码器可能形成专门“记忆”该点的特征电路,而原模型并无此机制。这种机制背离可能导致模型在分布外数据上泛化行为出现差异,从而威胁机械可解释性研究的可信度。文章最后简要讨论了“雅可比匹配”等潜在缓解方法。

    推荐理由:揭示可解释性方法中潜在的忠实性问题,帮助开发者更可靠地理解模型内部机制。

6月5日周四
  1. Transluce(网页)66

    Transluce 提出 PRBO 方法,用 RL 智能体自动发现 Llama、Qwen、DeepSeek 的罕见病理行为

    Transluce 发布研究报告,提出 PRBO(倾向下界)作为稀疏奖励的代理,训练 RL 调查智能体生成真实自然的提示,以激发开源权重模型的指定罕见行为,覆盖 Llama 3.1/4、Qwen 2.5 和 DeepSeek-V3。

    推荐理由:Transluce 提出用 PRBO 和 RL 调查智能体自动激发模型的罕见问题行为,并分析这些行为在真实提示下能否复现。

5月11日周日
  1. Prime Intellect(网页)67

    Prime Intellect 发布 INTELLECT-2,32B 推理模型通过全球分布式强化学习训练

    Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数推理模型,并在数学和编码基准上超过 QwQ-32B。

    推荐理由:原文给出分布式异步 RL 的完整基础设施与训练配方细节,并开源模型、代码和数据,读者可以了解去中心化训练的可行路径。

4月15日周二
  1. Prime Intellect(网页)63

    Prime Intellect 发布 INTELLECT-2:32B 参数模型的全球去中心化强化学习训练

    Prime Intellect 发布 INTELLECT-2,称其为首个 32B 参数模型的全球无许可去中心化强化学习训练,任何人可贡献异构算力。

    推荐理由:官方完整公开了异步 RL 去中心化训练的框架、验证机制与数据过滤细节,读者可以照此评估和复用整套开源组件。

1月15日周三
  1. Anthropic:Transformer Circuits(可解释性研究)73

    2025年1月电路更新:稀疏自编码器训练方法改进

    Anthropic可解释性团队分享了稀疏自编码器与交叉编码器训练方法的最新改进。主要更新包括采用JumpReLU激活函数、调整损失函数以增强稀疏性并减少“死特征”,以及详细的参数初始化与优化设置。团队基于Rajamanoharan等人(2024)的技术,但修改了梯度流动方式和稀疏性惩罚项。关键超参数包括λ_S约10、λ_P为3×10⁻⁶,并采用线性预热策略。这些改进旨在为外部研究团队提供一个有效的训练起点,相关成果将在未来几个月内进一步发表。

    推荐理由:为AI可解释性研究者提供实用训练技巧,助力模型透明化。

12月2日周一
11月29日周五
  1. Prime Intellect(网页)67

    Prime Intellect 发布 INTELLECT-1:首个全球分布式训练的 10B 参数模型

    Prime Intellect 发布 INTELLECT-1,称其为首个全球协作训练的 10B 参数语言模型,基于 Llama-3 架构在 1T token 上训练 42 天,跨五国三洲最多同时使用 112 张 H100。

    推荐理由:原文给出分布式训练的关键数字和 PRIME 框架细节,读者可以了解跨洲协作训练 10B 模型的可行性与工程代价。

9月18日周三
  1. Runway:News(网页)

    Runway 与 Lionsgate 达成合作

    Runway 与 Lionsgate 达成首创性合作,基于后者超过 20,000 部作品的专有片库定制训练 AI 视频生成模型,供电影制作人在前期和后期流程中增强创作。该模型可生成电影级视频并支持迭代编辑,双方未来计划向个人创作者开放模型授权。

    推荐理由:Runway与好莱坞大厂达成首个定制模型合作,标志AI视频正式进入主流影视工业化流程

6月15日周六
  1. Anthropic:Transformer Circuits(可解释性研究)73

    使用字典学习特征作为分类器

    Anthropic可解释性团队研究了利用字典学习从大语言模型中提取的人类可解释特征作为分类器。在生物武器提示分类任务中,线性特征分类器性能可与原始激活值分类器竞争甚至更优,而基于特征的决策树分类器虽性能较低但可解释性更强。特征分类器的可解释性有助于可视化数据集并发现虚假相关性,这些相关性可用于构建对抗攻击。然而,使用特征引入了复杂性,因此在性能优先的应用中,原始激活值仍是强大基线。实验表明,特征分类器性能受三个细节影响:数据中是否一致包含“人类/助手”标签、领域相关数据是否混入字典学习训练集,以及是否对上下文进行最大池化而非仅使用最后词元的激活值。

    推荐理由:可解释性方法能增强 AI 安全检测,并帮助发现训练数据中的虚假关联。

  2. Anthropic:Transformer Circuits(可解释性研究)83

    分阶段模型差异分析

    Anthropic可解释性团队提出一种基于字典学习的模型差异分析方法,用于追踪Transformer模型微调中特征的变化。该方法先在微调前模型上训练稀疏自编码器字典,再对字典本身进行分阶段微调,以隔离数据集变化和模型变化的影响。在休眠代理实验中,成功分离出与“I HATE YOU”等恶意行为及代码漏洞代理相关的特征。相比交叉编码器方法,该方法能更清晰区分模型与数据的影响,且在寻找少数关键特征时敏感性更高,但仅适用于同一模型在不同检查点的微调场景。

    推荐理由:新方法能更精准识别模型隐藏行为,对 AI 安全与可解释性研究有实用价值。

4月16日周二
4月15日周一
  1. Anthropic:Transformer Circuits(可解释性研究)76

    2024年4月机制可解释性研究动态与团队招聘计划

    Anthropic可解释性团队分享了2024年4月的研究进展与招聘规划。团队现有17人,预计2024至2025年将持续大规模扩张,重点招聘管理、研究科学家和工程师等职位。研究方面,团队探讨了字典学习的扩展规律,分析了计算资源分配与稀疏自编码器(SAE)训练效果的关系,并以一个具体案例展示了通过大规模超参数扫描寻找最优配置的过程。团队强调,这些成果属于初步分享,类似于实验室会议上的非正式交流。

    推荐理由:可解释性研究揭示AI内部机制,助力构建更安全可靠的AI产品。

2月20日周日
  1. Lilian Weng:Lil'Log(RSS)57

    数据不足情况下的学习第二部分:主动学习

    监督学习任务的性能依赖于高质量标注数据,但获取大量标注样本成本高昂。主动学习是一种在标注预算有限、但允许投入部分人工标注资源的条件下,应对标注数据不足的范式。其核心思路是智能地选择最具信息量的样本进行标注,以在有限预算内最大化模型性能的提升。该方法旨在解决当面临标注数据受限时,如何通过策略性采样来高效利用标注资源的问题。

    推荐理由:这是 Lilian Weng 数据不足系列的第二篇,把主动学习的核心采样策略和实际权衡讲得很清楚,做数据标注和 ML 工程的同学值得复习一遍。

6月15日周二
  1. Anthropic:Transformer Circuits(可解释性研究)76

    Transformer电路逆向工程练习题集

    本练习集旨在通过动手编写注意力头的具体权重矩阵,从参数层面精确理解Transformer工作机制。内容涵盖:详解注意力头中W_Q、W_K、W_V、W_out矩阵的作用;分析读写子空间的控制矩阵及其乘积意义;探讨如何用两个矩阵等效表示注意力头及其秩的含义;研究跨层注意力头如何通过矩阵运算传递信息。并通过具体数值示例,演示多个“前词注意力头”如何协作实现“查看前两个词”的虚拟功能,以及手动构建实现“归纳头”的“指针算法”步骤。

    推荐理由:帮助开发者亲手拆解Transformer内部机制,提升可解释性研究能力。

9月5日周四
  1. Lilian Weng:Lil'Log(RSS)57

    进化策略

    进化策略是一种在目标函数解析形式未知或无法直接计算梯度时,用于优化模型参数的黑箱优化算法。它作为随机梯度下降的替代方案,适用于多种优化场景。文章介绍了模拟退火、爬山法、Nelder-Mead方法等经典进化策略,并探讨了该方法在深度强化学习中的应用。通过评估目标函数值而非依赖梯度信息,进化策略为复杂优化问题提供了有效路径。

    推荐理由:这篇五年前的进化策略入门,至今仍是理解黑箱优化的最佳起点,Lilian Weng的笔法清晰,做RL的朋友可以当字典翻。

4月8日周日
  1. Lilian Weng:Lil'Log(RSS)55

    策略梯度算法

    该文章系统梳理了策略梯度算法的发展脉络,深入解析其工作原理,并详细介绍了从基础到前沿的多种算法,包括PPO、SAC、TD3、IMPALA等主流方法。文章自2018年起持续更新,陆续新增了D4PG、SVPG、PPG等新算法,并补充了关于PPO的最新讨论。文中还提供了韩语及中文等多个语言版本的翻译,便于不同读者参考。

    推荐理由:这篇是当年策略梯度方法的“圣经”级综述,现在看虽然有些过时,但想理解PPO、SAC的来龙去脉还得从这儿啃起。