跳到正文
北京时间

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

279条精选相关主题论文研究部署工程模型发布

最新精选

第 221–240 条 · 共 279 条
4月10日周五
  1. Epoch AI:研究、数据与评测66

    Epoch AI 分析伊朗战争对AI的影响:芯片产能影响有限,海湾投资或受冲击

    Epoch AI 的 Josh You 分析伊朗战争与霍尔木兹海峡封锁对AI产业的影响。海峡中断了约10%的全球石油和20%的LNG供应,欧洲与亚洲天然气价格涨幅约70%,但TSMC等芯片厂能源成本占收入比例很低,可承受电价大幅上涨,AI芯片生产不太可能受扰。

    推荐理由:作者以计算供应链为主线,逐项评估能源、氦气与海湾资本对AI的实际冲击程度,结论克制且有依据。

4月7日周二
  1. Epoch AI:研究、数据与评测63

    Epoch AI 分析:算力贫乏的 AI 实验室能否靠效率追赶 GPT 前沿

    Epoch AI 分析指出,Anthropic 去年在算力上的支出超过 Minimax 与智谱 AI 之和的十倍,OpenAI 的差距更大,中国与开源模型公司因此处于"算力贫乏"状态。文章梳理了三条提升算力效率的路径:更快研发新算法、复现前沿实验室的创新、利用对手模型生成合成数据训练,其中只有第一条有望实现反超。

    推荐理由:原文逐项检验算法创新、模仿与蒸馏三条效率路径能否弥补十倍算力差距,并给出中美与开源模型格局的分层判断。

4月4日周六
  1. Nathan Lambert

    开源模型成功的核心并非基准分数,而是即时且长期的工具支持与可微调性。Gemma 过去在这些方面表现挣扎,而 Qwen 则表现出色,这才是决定模型成败的关键因素。

    引用Interconnects@interconnectsai

    Gemma 4 以及开源模型成功的要素 提示:不是基准分数。 https://www.interconnects.ai/p/gemma-4-and-what-makes-an-open-model

    推荐理由:HF研究员指出开源模型成功关键在工具链与微调支持而非基准分数

3月31日周二
  1. Hugging Face:Blog(RSS)83

    以165美元成本训练25个物种的mRNA语言模型:构建从结构预测到密码子优化的AI流程

    OpenMed团队构建了一个覆盖蛋白质结构预测、序列设计和密码子优化的端到端AI流程。在密码子优化环节,CodonRoBERTa-large-v2模型以4.10的困惑度和0.40的斯皮尔曼CAI相关性显著优于其他架构。研究将训练扩展至25个物种,仅用55个GPU小时训练了4个生产级模型,并建立了独特的物种条件化系统,实现了从蛋白质概念到合成就绪DNA序列的快速转化。完整代码与实验结果已开源。

    推荐理由:低成本开源生物AI管道,可加速蛋白质工程和药物开发。

  2. Google Developers Blog(RSS)81

    Boost Training Goodput: 连续检查点功能如何优化 Orbax 和 MaxText 的训练可靠性

    Orbax 和 MaxText 引入了连续检查点新功能,旨在优化模型训练中可靠性与性能的平衡。它改变了传统固定频率检查点的模式,通过在前一个保存操作成功完成后才异步启动新操作,最大化I/O带宽并降低故障风险。基准测试表明,该方法显著缩短了检查点间隔,并实现了可观的资源节约,这在平均故障间隔时间较短的大规模训练任务中效果尤为突出。

    推荐理由:大规模模型训练的可靠性和效率提升,开发者可优化资源使用。

3月23日周一
  1. Epoch AI:研究、数据与评测61

    Epoch AI 分析 OpenAI、MiniMax 与 Z.ai:最终训练运行只占研发算力支出的少数

    Epoch AI 基于 MiniMax 和 Z.ai 的 IPO 披露数据估算,最终训练运行占研发算力支出的比例分别为 OpenAI 9.6%、MiniMax 22.6%、Z.ai 12.3%,三家均不足四分之一。这一模式与公司规模、国家和商业模型差异无关;MiniMax 较高的比例与追赶型公司可减少实验的假说一致,Z.ai 则不符合,三个数据点证据仍不充分。

    推荐理由:文章用 MiniMax 和 Z.ai 的 IPO 披露数据,把此前只针对 OpenAI 的训练占比估算扩展到三家不同规模和地区的公司。

3月21日周六
  1. Hugging Face:Blog(RSS)70

    一日之内构建领域特定嵌入模型

    英伟达在Hugging Face平台发布技术博客,分享了一种在24小时内快速构建高质量领域特定嵌入模型的方法。该方法通过结合高效微调技术与领域数据,显著提升了模型在专业任务中的语义理解与检索性能,为企业和开发者提供了低成本、高效率的定制化嵌入解决方案。

    推荐理由:一天内搞定领域专属 Embedding 微调,RAG 检索效果可显著提升

3月14日周六
  1. Dwarkesh Patel:Podcast & Blog(RSS)

    Dylan Patel — 深度剖析 AI 算力扩展的三大瓶颈

    Dylan Patel 深度解析了制约 AI 算力规模扩张的三大核心瓶颈:电力基础设施限制、先进制程芯片产能不足以及网络互联带宽瓶颈。尽管 NVIDIA H100 已发布三年,受供需严重失衡及新一代芯片交付延迟影响,其市场价格与战略价值持续攀升,当前实际价值甚至超过发布初期。文章指出,这些结构性约束正重塑 AI 基础设施的投资逻辑与部署节奏。

    推荐理由:顶尖硬件分析师拆解AI算力扩张的三大瓶颈,揭示H100为何比三年前更值钱

3月12日周四
  1. Answer.AI 官方研发博客(RSS)66

    Answer.AI 用 PyPI 数据检验 AI 生产力效应:包创建未见激增,热门 AI 包更新频率翻倍

    Answer.AI 分析 PyPI 数据后发现,ChatGPT 发布后 Python 包创建率没有明显上升,整体更新频率的缓慢增长早在 2019 年就已开始。但热门 AI 相关包更新频率跃升至每年 21-26 次中位数,是热门非 AI 包(约 10 次)的两倍多。

    推荐理由:原文用 PyPI 数据检验 AI 生产力说法,发现效应集中在热门 AI 相关包,给出两个可检验的解释假设。

3月11日周三
  1. Noam Brown

    当今前沿推理模型的训练路径与 AlphaGo 高度一致:先模仿大量人类数据,再扩展推理计算(从蒙特卡洛树搜索到思维链),最后用强化学习突破模仿上限。Demis Hassabis 称,十年前 AlphaGo 的"第37步"预示 AI 可攻克真实科学难题,这些思路对构建 AGI 仍至关重要。

    引用Demis Hassabis@demishassabis

    十年前,AlphaGo 在首尔的那场传奇对局,宣告了现代 AI 时代的开启。它那著名的"第 37 手"向我们表明,AI 技术已经准备好应对科学等领域的现实问题——而受这些方法启发的思路,对于构建 AGI 至关重要 https://t.co/8EibfAByaG

    推荐理由:Meta 研究员揭示推理模型与 AlphaGo 的技术传承,点明 RL 超越模仿的核心路径

3月10日周二
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)

    改进前沿 LLM 的指令层级

    IH-Challenge 训练模型优先处理可信指令,改进指令层级、安全可控性,并提升对提示词注入攻击的抵抗能力。

    推荐理由:OpenAI改进指令层级研究,增强模型抗提示注入攻击能力

  2. Hugging Face:Blog(RSS)83

    Hugging Face Hub 正式推出 Storage Buckets 存储服务

    Hugging Face Hub 发布 Storage Buckets,这是一种为机器学习工作流设计的可变、类 S3 的对象存储服务。它基于 Xet 存储后端,能对跨文件共享内容的 ML 工件进行高效去重,从而节省带宽、加速传输并降低存储成本。该服务还提供“预暖”功能,可将数据预先迁移至靠近计算资源的云区域,以提升分布式训练等场景的效率。目前支持 AWS 和 GCP,用户可通过 CLI 或 Python 库在 2 分钟内快速创建和同步存储桶。

    推荐理由:ML 开发者可高效管理训练数据和检查点,节省存储成本并加速工作流。

3月9日周一
  1. Hugging Face:Blog(RSS)76

    Ulysses Sequence Parallelism: 实现百万令牌上下文的训练

    研究团队发布了Ulysses序列并行方法,这是一种用于训练大型语言模型的新技术。该方法通过将长序列在设备间进行特定维度的分割与重组,实现了对极长上下文的并行处理。其核心变化在于能高效训练上下文长度高达百万令牌的模型,突破了现有方法在序列长度上的扩展瓶颈。这一进展使得在保持高训练效率的同时,处理书籍、长文档等超长文本成为可能,为推进AI的民主化与开源发展提供了关键技术支撑。

    推荐理由:百万 token 训练的序列并行方案,长上下文模型训练的关键工程突破

3月4日周三
  1. Hugging Face:Blog(RSS)70

    PRX 第三部分 —— 24小时内训练一个文本到图像模型!

    Photoroom团队在Hugging Face上发布博客,宣布成功在24小时内完成一个文本到图像模型的训练。这一突破将此类模型的典型训练周期从数周大幅缩短至仅一天。实现的关键在于采用了名为PRX的高效训练方法,该方法优化了计算资源分配与数据处理流程。此举显著降低了模型训练的时间与成本门槛,为快速迭代和部署高质量的图像生成AI模型提供了新的可能性。

    推荐理由:Photoroom 分享 24h 内训练文生图模型的实战路径,想快速复现的团队可直接参考

3月1日周日
  1. Cognition 模型 / Devin 博客(网页)60

    Cognition 发布 SWE-1.6 早期预览并分享 RL 训练研究进展

    Cognition 发布 SWE-1.6 早期预览,当前 checkpoint 在 SWE-Bench Pro 上比 SWE-1.5 高 11%,达到 51.7%,速度同为 950 tok/s,并向小部分用户开放早期访问。

    推荐理由:官方给出 SWE-1.6 预览版成绩与 RL 训练细节,并提出基准之外的 Model UX 问题,对做智能体训练的人有参考价值。

2月26日周四
  1. Jim Fan

    研究团队提出EgoScale方法,基于20,000小时第一人称人类视频预训练GR00T N1.5,仅用4小时机器人数据即可掌握组装模型车、操作注射器等高灵巧度任务,性能较从头训练提升54%。研究发现人类视频量与动作预测损失呈对数线性缩放关系(R²=0.998)。该方法利用22-DoF手部与人类的运动学相似性,无需复杂迁移算法即可重定向动作。策略可跨硬件迁移至Unitree G1(7-DoF),性能提升30%以上,且仅需单个示教即可学习新任务。

    推荐理由:人类视频学习呈现完美缩放定律,机器人仅需单演示即可掌握新技能,具身智能迎来数据革命

2月25日周三
  1. Nathan Lambert:Interconnects(RSS)

    蒸馏对中国 LLM 到底有多重要?

    针对 Anthropic 关于"蒸馏攻击"的最新论述,分析模型蒸馏技术对中国大语言模型的实际影响。探讨通过蒸馏 GPT、Claude 等模型来训练中国 LLM 的效果与争议,评估该方法在提升模型性能与降低训练成本方面的作用,以及可能引发的知识产权与安全问题。

    推荐理由:技术权威视角拆解'蒸馏攻击',厘清中国大模型能力来源争议

2月24日周二
  1. Liquid AI 模型与工程博客(网页)64

    Liquid AI 发布早期检查点 LFM2-24B-A2B,24B 总参数仅 2.3B 激活

    Liquid AI 发布 LFM2 系列最大模型 LFM2-24B-A2B 的早期检查点,为 MoE 架构,24B 总参数、每 token 约 2.3B 激活,可放进 32GB 内存部署于云端和边缘设备。

    推荐理由:官方给出架构配方和与 Qwen3、gpt-oss 的吞吐对比,读者可以据此评估这款 24B MoE 在笔记本和边缘部署上的实际可行性。

2月23日周一
  1. Together AI 研究与产品博客(RSS)63

    Together AI 发布 SF Streets 基准,揭示语音模型街名转写错误率达 39% 并用跨语言风格迁移降低 60% 错误

    Together AI 发布 SF Streets 与 US Streets 两项基准,测试 15 个先进 ASR 模型在街名转写上的表现,发现平均错误率达 39%,非英语母语者准确率比英语母语者低 18 个百分点(46% vs 64%)。

    推荐理由:原文用自建基准量化了 ASR 在街名转写上的短板,并给出可复用的合成数据改进方法,对语音部署有直接参考价值。

2月5日周四
  1. Nathan Lambert:Interconnects(RSS)

    Nvidia 为何构建开源模型:对话 Bryan Catanzaro

    Interconnects 第17期访谈中,Nvidia 副总裁 Bryan Catanzaro 系统回顾了 Nemotron 开源模型项目的技术演进与战略定位。访谈涵盖该系列模型从研发初期到当前版本的迭代历程,剖析了英伟达在开源 AI 领域的布局逻辑,并披露了 Nemotron 在合成数据生成与模型训练效率方面的最新进展及未来规划。

    推荐理由:NVIDIA副总裁亲述开源模型战略,揭示芯片巨头如何通过开放生态锁定行业标准