跳到正文
北京时间

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

279条精选相关主题论文研究部署工程模型发布

最新精选

第 161–180 条 · 共 279 条
6月1日周一
  1. IT之家(RSS)81

    黄仁勋:英伟达下一代 AI 超级芯片平台 Vera Rubin 全面投产

    英伟达 CEO 黄仁勋在 2026 台北电脑展宣布,下一代 AI 超级芯片平台 Vera Rubin 全面投产。该平台是 POD 级基础架构,与上一代 Grace Blackwell 平台相比,其大规模智能体吞吐量提高了 10 倍。凭借开源 MGX 设计,其供应链规模是 Grace Blackwell 的两倍,产品预计于今年秋季开始发货。

    推荐理由:Vera Rubin 全面投产,智能体吞吐量提升 10 倍,供应链规模翻倍,这是英伟达给 AI 算力瓶颈的一记重拳,做智能体应用的同行该开始计划升级硬件了。

5月31日周日
  1. Hacker News 热门(buzzing.cc 中文翻译)73

    AI引发的职业焦虑:席卷科技从业者的心理危机

    AI 技术的快速发展在科技从业者中引发了普遍的职业焦虑与心理危机。文章指出,许多专业人士担心自身技能被自动化取代,从而产生强烈的不安全感、抑郁情绪及身份认同危机。这种焦虑不仅源于对失业的恐惧,也涉及工作意义感的丧失、人际关系的变化以及对未来的迷茫。面对冲击,个体反应不一,但整体而言,这已演变为一场需严肃对待的行业心理挑战。

    推荐理由:这篇文章把AI导致的职业焦虑比作一种被压抑的悲伤,结合AIRD临床概念和Reddit哀悼叙事,指出问题在于没有固定终点可接受,是一篇对当下科技从业者心理危机的深刻诊断。

  2. HuggingFace Daily Papers(社区热门论文)70

    τ_0-WM:用于机器人操控的统一视频-动作世界模型

    τ_0-World Model (τ_0-WM) 是一个统一的视频-动作世界模型,旨在机器人执行动作前预测并评估其未来后果。模型基于共享的视频扩散主干网络构建,提供两个接口:一个联合预测未来视觉潜在表示与连续动作块的视频动作模型,以及一个能将动作序列展开为多视角未来并预测任务进度分数的动作条件视频模拟器。τ_0-WM 使用约27,300小时的多元数据训练,包括真实机器人遥操作、UMI风格交互、自我中心人类视频等。推理时,模型通过测试时计算采样动作候选,并利用去噪一致性和基于模拟器的修正来筛选低质量动作,在长时程和精细机器人操控任务上表现出优于相关基准的性能。

    推荐理由:机器人操作领域的大一统尝试,把视频预测和动作生成放在一个扩散模型里,还用27万小时数据训练,做具身智能的可以看看这个架构。

  3. Hacker News 热门(buzzing.cc 中文翻译)71

    随着成本飙升,美国企业开始对人工智能实施配给

    由于运行和使用AI工具的成本持续飙升,美国企业正开始对人工智能的使用实施配给制。企业通过限制使用量、设置分层级审批流程等方式控制开支,以应对AI费用增长过快的问题。这种从广泛采用转向精细化管理的策略,标志着企业在AI应用上从追求速度转向注重成本效益。

    推荐理由:成本飙升让大企业开始对AI‘配给’,这是面向企业的AI产品必须回答的ROI考题,以前铺量抢客户的玩法得切换成算清每一分钱的价值。

5月30日周六
  1. Fei-Fei Li83

    我对这个适用于大规模生成模型新时代的视觉生成基准数据集感到非常兴奋!🤩

    引用Keshigeyan Chandrasegaran@keshigeyan

    1/ 介绍 GPIC:一个用于视觉生成的巨型宽松许可图像语料库和基准! 🚀1 亿 VLM 标注的图像-文本对用于训练 📊100 万图像-文本对用于基准测试 🖼️约 28 万亿像素 🤗集中托管 ✅完全允许用于研究 + 商业用途 数据集、基准和模型🧵👇 与 @KyleSargentAI 共同领导

    推荐理由:李飞飞都来站台,这个数据集不简单。完全允许商业用途是关键,对做视觉生成的团队来说,终于有了一个不用再为版权头疼的超级训练库。

5月29日周五
  1. 公众号:面壁智能(MiniCPM)61

    面壁智能联合清华、OpenBMB开源最大中文预训练合成数据集及千万级SFT数据集,公开MiniCPM5‑1B核心数据

    面壁智能联合清华大学、OpenBMB发布并开源两大数据集:Ultra-FineWeb-L3(超600B Tokens,中文200B+,为当前最大中文预训练合成数据集)和UltraData-SFT-2605(国内首个千万级同时含深思考与非思考标注的SFT数据集)。两者基于UltraData数据分级治理体系构建,在MiniCPM5-1B训练流程中得到完全验证,覆盖预训练退火到后训练SFT全链路。已上线UltraData网站与HuggingFace,免费开放。

    推荐理由:填补了中文大规模合成数据空白,三年前还在用英文数据做中文模型的日子可以翻篇了,做端侧模型的可以直接拿这份数据跑一版 MiniCPM5-1B 级别的效果。

  2. 公众号:蚂蚁百灵(Ling)81

    蚂蚁百灵团队为何重新设计 SwiGLU?PowLU 激活函数的诞生始末

    蚂蚁百灵团队提出新激活函数 PowLU,以解决 SwiGLU 在 FP8 等低精度训练中因二次增长放大异常值导致的 Loss Spike 和训练崩溃问题。

    推荐理由:用幂函数替代指数项以压制输出范围,避免了 SwiGLU 截断带来的信息丢失,为低精度训练提供了一条已通过千亿模型验证的稳定激活函数路径。

  3. IT之家(RSS)71

    三星电子业内率先出样 HBM4E 内存

    三星电子宣布已开始向全球主要客户交付业界首批 12 层(12Hi)HBM4E 样品。该内存引脚传输速度稳定在 14Gbps 并可扩展至 16Gbps,较 HBM4 提升 20%,单堆栈带宽达 3.6 TB/s,容量为 48GB。相较 HBM4,其能效提升 16%、热阻特性改进 14%,后续将补充 8Hi 32GB、16Hi 64GB 配置。

    推荐理由:三星的HBM4E把单堆栈带宽推到3.6TB/s,能效再提16%,对LLM训练是实打实的硬件升级,做AI基础设施和模型训练的可以关注后续量产时间。

  4. Ars Technica:AI(RSS)70

    LLMs相信虚假陈述,即使明确警告也无效

    微调测试显示,大语言模型存在一种偏见,即倾向于自信地将虚假陈述表述为真实,即使明确告知其陈述为假。

    推荐理由:这项研究让我重新思考幻觉问题的根源——LLM无视「此声明为假」的标签,照样把假话当成真知识,开发者靠标注清洗数据可能根本不够。

  5. Rohan Paul81

    hexoai开源了SIA(自我改进AI)框架。该框架展示了AI智能体不仅能优化其外部工作流(harness),还能通过任务反馈直接更新自身的模型权重,从而在领域知识和能力上实现自主提升,而非仅依赖人类提供的提示或工具改进。论文报告显示,SIA在LawBench基准上性能提升56.6%,在GPU kernels运行上耗时减少91.9%,在单细胞RNA去噪任务中相比基线提升502%。

    引用Kunal Bhatia@kunalbhatia91

    超级智能将建立在自我改进之上。 今天 @hexoai,我们很高兴发布‘SIA’——一个开源的自我改进 AI,通过递归自我改进来实现任何目标。 在尝试解决一个问题时,SIA 不仅通过更新其 harness 来提升自身能力,它还会更新自己的权重。

    推荐理由:不再只是给AI换提示词,SIA框架连模型自己的权重都更新了,在三个任务里分别提升了56%、502%和91%加速,开源出来会让整个Agent开发范式重新思考。

5月28日周四
  1. Google Developers Blog(RSS)64

    社区如何利用Tunix和TPU训练Gemma学会“思考”

    Google在Kaggle举办的Tunix黑客马拉松,挑战开发者利用TPU和有限算力,将小型基础模型转变为通用推理引擎。获胜团队通过多阶段后训练流程实现了这一目标,该流程结合了监督微调(SFT)与GRPO、SimPO等先进对齐技术。比赛结果表明,社区能够借助开源资源成功训练出高能力的结构化推理模型。

    推荐理由:Google 官方比赛总结,证明用 Kaggle TPU 和开源工具就能把 Gemma 训练出不错推理能力,对想自己微调模型的小团队是个实用参考。

  2. HuggingFace Daily Papers(社区热门论文)71

    DenoiseRL:通过恢复嘈杂前缀来引导推理模型

    DenoiseRL是一种强化学习框架,旨在提升大语言模型的推理能力。它无需依赖更强的教师模型或精心筛选的困难数据集,而是通过在弱模型产生的失败推理轨迹上进行基于恢复的优化来直接学习,将错误转化为改进机会。这种方法提供了更丰富多样的学习信号,提升了探索效率。实验表明,DenoiseRL在竞争性的数学和通用推理基准测试中,持续优于强在策略RL基线,并能随着训练难度增加促进更强的自我纠正行为。

    推荐理由:做 RL for reasoning 的团队该看这篇,它把训练信号从“依赖强模型”转向“从弱模型的错误中学习”,可能降低对昂贵 teacher 的依赖,是个架构层面的新思路。

  3. HuggingFace Daily Papers(社区热门论文)70

    ResearchMath-14K:通过智能体扩展研究级数学

    本文介绍了ResearchMath-14K,这是一个包含14,056个研究级数学问题的数据集,通过多智能体流程从学术资料中策划而成,是目前此类规模最大的集合。研究还生成了ResearchMath-Reasoning(包含220K条教师轨迹),发现语言模型存在回避行为,且新一代模型产生的引用和虚假引用分别是旧模型的5.6倍和5.0倍。经过智能体过滤后,对参数规模为4B到30B的Qwen3模型进行微调,其平均得分比基础模型提高了9.2分,表明过滤后的开放问题尝试能为研究级数学推理提供有效监督。该数据集已公开发布。

    推荐理由:这可能是目前数学推理方向最有价值的数据集之一,它暴露了模型编造引用的问题,过滤后微调还能涨点,做数学推理的团队应该立刻拉下来试试。

  4. Anthropic:Research(发表成果 · 网页)69

    社会科学中的编码智能体

    一项针对1260名定量社会科学家的调查显示,虽然81%的受访者用过AI聊天机器人,但仅有20%将Claude Code、Codex等编码智能体常规应用于工作。采用率存在显著差异:以男性名字命名的研究者使用率是女性研究者的两倍;顶尖大学研究者可能性高出40%。用户产出更多工作论文和基金申请,但这可能反映早期采用者自身差异。研究者对AI助力撰写可发表论文更乐观,但对重塑整个社会科学领域持保留态度。这是一项初步调查,更深入研究仍在进行中。

    推荐理由:Anthropic 这份调查把编码代理在社科领域的真实渗透率摸清了,只有 20% 的研究者真在用,而且男女、校际差距比 AI 聊天工具大得多,做学术工具的可以认真看看。

5月27日周三
  1. Hugging Face:Blog(RSS)61

    TRL 新增 Delta Weight Sync:通过 Hub Bucket 传输权重变化,每步从 1.2 GB 降至 20–35 MB

    异步强化学习中,训练器每步需将完整模型权重(如1T参数checkpoint约1 TB)传输给推理引擎。TRL新增PR利用相邻RL优化步骤间约99%的bf16权重比特相同的特点,仅将变化的权重编码为稀疏safetensors文件,上传至Hugging Face Bucket并通知vLLM获取。在Qwen3-0.6B上,每步传输从1.2 GB降至20–35 MB。实验还展示了完全分离的训练场景:训练器、vLLM和Wordle环境分别位于不同机器和Hugging Face Space中,权重通过单个Hub bucket流动,无需共享集群、RDMA或VPN。

    推荐理由:异步RL训练中权重同步的瓶颈被HuggingFace用稀疏增量方案解决了,带宽直接省了两个数量级,还给了可运行的TRL分支,做RL训练的可以直接上手试。

  2. IT之家(RSS)75

    AI 制造 AI:面壁智能开源全球首个完全由 AI 编写的生产级训练框架 ForgeTrain

    面壁智能联合清华大学与OpenBMB开源社区发布了ForgeTrain框架。该框架是全球首个完全由AI编写、零人类代码介入的生产级大模型训练框架。面壁智能已使用ForgeTrain在华为昇腾芯片上完成了其新一代「小钢炮」模型MiniCPM5-1B的预训练,其综合性能在AA榜单上位列2B规模以下Top 1。ForgeTrain框架代码及用于制造该框架的Agent Harness工具链已完全开源。

    推荐理由:全球首个AI独立编写的训练框架,零人类代码,并且真的在国产芯片上训出了领先模型。'AI造AI'的闭环第一次被完整打通,做模型训练的团队都该去fork一下,复现过程本身就是一堂课。

  3. 公众号:面壁智能(MiniCPM)64

    AI 制造 AI:面壁智能发布并开源全球首个完全由 AI 编写的生产级训练框架 ForgeTrain

    面壁智能联合清华大学、OpenBMB发布ForgeTrain,全球首个完全由AI编写、零人类代码介入的生产级大模型训练框架。在英伟达H100上训练速度超越Megatron 10%,节省10%算力;在华为昇腾上完整跑通预训练,并训出MiniCPM5-1B模型,综合性能在AA榜单2B规模以下Top1。框架及Agent Harness工具链一并开源。

    推荐理由:面壁这波把 AI 写代码从玩具推进到了生产车间,ForgeTrain 跑得比英伟达 Megatron 还快 10%,而且直接在昇腾上训出了 MiniCPM5-1B,国产算力跟 AI 自举这两条线在这一刻交汇了,做训练的可以认真看看。

  4. Tomer Tunguz 博客(VC 分析)58

    智能体重力:谁在运行你的智能体?

    在数据时代,数据重力是核心力量;而在智能体时代,智能体重力将扮演同样角色。智能体运行需要巨大算力,主要平台将激烈争夺以将其留在自家生态。平台上的智能体与数据越多,其智能体重力就越强。例如,Databricks在微软平台推出的某个功能,虽未明言此目的,却让用户更容易在Databricks中构建智能体,而非微软自家的Fabric。这可能使用户不知不觉间将高价值的智能体及数据工作负载迁移至该平台。因此,赢得并维持智能体重力,将成为智能体时代的核心竞争主题。

    推荐理由:Tomer Tunguz 提出「Agent Gravity」概念,把数据平台竞争的逻辑从数据引力延伸到了代理引力,做 Infra 和做 Agent 的人都应该读一读,这可能会影响你对平台锁定的判断。

5月26日周二
  1. Ant Ling68

    团队推出 KPop,用于稳定大规模 MoE 模型的智能体强化学习训练。它用基于二元 KL 散度的自适应掩码机制,替代了此前 IcePop 方法中的固定比例掩码,能根据训练过程中的训练-推理不匹配程度动态调整。这一改进使得 Ring-2.6-1T 模型在无需修改基础设施或路由重放的情况下,仅通过纯 RL 训练,在 SWE-bench Verified 上取得了超过 76 分的成绩。

    引用Jia Guo@Jia__Guo

    好奇我们万亿级智能体基础模型背后的秘密武器吗?它来了!🥳 去年,我们发布了 IcePop,通过双边掩码来稳定 MoE RL。随着我们深入探索,意想不到的事情发生了:掩码比例下降了,而训练-推理不匹配却持续增长!😞 今年,我们推出 𝑲𝑷𝒐𝒑🪩,它用二元 KL 散度取代固定比例约束,自适应地掩码不合适的 token!掩码比例会随训练过程中训练-推理差距的波动而自适应调整,从而在长时程智能体 RL rollout 中保持策略优化稳定且有效。 通过这一简单改动,它使我们的 Ring-2.6-1T 在纯 RL 训练下于 SWE-bench-Verified 上取得超过 76 的成绩! 无需修改基础设施。无需 routing replay。只需一个参数,用 𝑲𝑷𝒐𝒑 为你的智能体 RL 赋能! 点击了解更多细节! 📜Blog: https://ringtech.notion.site/kpop

    推荐理由:蚂蚁团队把 IcePop 升级成 KPop,从固定掩码变成自适应 KL 区域,思路很巧。Ring-2.6-1T 纯 RL 直接冲到 SWE-bench 76+,做 agentic RL 训练的同学值得翻一下博客。

  2. SenseTime77

    商汤开源了SenseNova-U1(8B dense + A3B MoE)的完整训练代码库。这是一个统一的框架,支持文本到图像、图像编辑、交错生成、文本与视觉理解等多种多模态任务的训练。其设计注重实用性与大规模训练,采用混合并行、流式可恢复数据管道、环境变量配置、解耦模块化设计,并支持从1×8 GPU扩展到多节点集群的规模。代码库以Apache-2.0协议开源。

    推荐理由:商汤把 SenseNova-U1 的训练代码全量开源,支持多模态任务和 MoE,还给了完整的并行策略,做多模态训练的可以直接 fork 过去用,Apache-2.0 很友好。