跳到正文
北京时间

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

279条精选相关主题论文研究部署工程模型发布

最新精选

第 41–60 条 · 共 279 条
8月11日周二
  1. 蚂蚁 inclusionAI:HuggingFace 新模型64

    蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基座模型

    蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基座模型,采用高度稀疏(1/64)MoE 架构,512 个路由专家中每 token 仅激活 8 个,总参数量 124B,激活参数仅 5.1B。该系列原生融合线性注意力,并以加权检查点合并替代传统学习率衰减。此次发布包含预训练、中期训练及合并(WSM)等多个训练阶段的检查点,支持继续预训练与微调,模型采用 MIT 许可证。

    推荐理由:把训练中间态作为可下载 checkpoint 开放,配合 WSM 合并替代学习率衰减,做继续预训练或 MoE 研究时可从中间阶段开始,省去重复前置训练成本。

  2. 蚂蚁 inclusionAI:HuggingFace 新模型63

    蚂蚁 inclusionAI 开源 Ling-3.0 系列中间训练检查点

    蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基础模型,并发布预训练、中间训练及合并(WSM)等多个训练阶段检查点,支持继续预训练、微调与研究。

    推荐理由:训练检查点分层开放,且用加权合并替代学习率衰减,为持续预训练和动态数据扩展提供了可复用的实验基座,减少不同策略的重复训练成本。

  3. HuggingFace Daily Papers(社区热门论文)74

    RynnValue:用时间距离扩展机器人价值基础模型

    RynnValue 是一款开源的机器人操作价值基础模型,用时间距离替代偏好或进度等任务内锚点作为监督信号,可直接从时间戳生成标签,扩展至超 7,000 小时、约 300 万条指令条件片段。

    推荐理由:用时间距离替代偏好标注,让价值模型能利用原始时间戳规模化训练,跨具身、任务和视角的泛化能力为无偏好数据的机器人策略提供了新的奖励接口。

8月8日周六
  1. HuggingFace Daily Papers(社区热门论文)78

    Ego-OSCAR:开源低成本头戴式立体惯性采集系统

    Ego-OSCAR 是一款开源硬件、低成本的头戴式立体惯性采集设备,单台物料成本低于 200 美元,仅使用商用组件和 3D 打印部件。设备搭配硬件同步全局快门立体相机、6 轴 IMU 和嵌入式 Linux SBC,并开源完整软件栈及约 550 小时带同步 IMU 的日常室内环境第一视角立体视频。数据集提供开放词汇动作标注和逐帧 3D 手部重建,旨在降低大规模众包第一视角数据采集门槛。

    推荐理由:Ego-OSCAR 把以我为中心的数据采集成本从数万美元压到200美元以下,附带标注的550小时数据集让分布式众包采集变得可行,小团队也能启动规模实验。

8月7日周五
  1. Apple Machine Learning Research(RSS)64

    扩展分类流映射(Categorical Flow Maps)规模

    连续扩散与流匹配模型有望成为语言建模中自回归方法的有力替代,可解锁加速采样与倾斜等连续模态优势。近期研究通过高斯分布与one-hot编码数据分布间的简单流匹配过程,实现离散数据的连续生成,并借助分类流映射(CFMs)验证了加速采样的可行性,样本质量具有竞争力。

    推荐理由:研究将分类流映射扩展到大规模语言建模,为连续扩散替代自回归提供了实验证据,可能影响模型架构选择。

  2. 公众号:小红书技术(dots.llm)65

    小红书联合浙大、复旦提出 CULTURE-MT:首个面向社媒翻译的「文化有效性」评测基准,入选 ICML 2026

    小红书联合浙江大学、复旦大学提出 CULTURE-MT,这是首个面向中英社媒笔记翻译、兼顾文化符号传递与情感共鸣的评测基准,并首次提出「文化有效性」评估标准与自动评估模型 JUDGER(准确率 86.03%)。

    推荐理由:CULTURE-MT将翻译评测从字面准确拉到文化传递,自动评估模型与开放榜单提供了可复现的评测-训练闭环,让改进不再凭感觉。

  3. SemiAnalysis 长文 RSS(RSS)84

    SemiAnalysis 分析 DeepMind 高层动荡与 Gemini 掉队,判断 GCP 成为最大受益方

    Google 于 8 月 5 日宣布全面调整 DeepMind 领导层,Demis Hassabis 退出日常运营,Jeff Dean 将联同 Sanjay Ghemawat、Quoc Le、Oriol Vinyals 离职创办新实验室 Discovery Loop,Koray Kavukcuoglu 接掌 DeepMind/Gemini。

    推荐理由:原文以 DeepMind 高层变动和 TPU 出售数据论证 Google 重心转向 GCP 云业务,读者可获得一条解释 Gemini 掉队的分析框架。

8月6日周四
  1. HuggingFace Daily Papers(社区热门论文)72

    可解释性随规模提升:Steerling-8B 将可解释性纳入训练流程

    一项新研究挑战“可解释性牺牲能力”的假设,将可解释性作为训练约束与语言建模目标共同优化。在三个数量级的算力范围内,自回归与扩散语言模型的表征随规模增大而更解耦、更对齐人类概念。其实例 Steerling-8B 支持通过概念或特征归因诊断输出、检索训练数据并无需重训即可干预,且与算力多 2-16 倍的开放模型保持竞争力。

    推荐理由:论文打破了可解释性与能力对立的假设,验证了训练时加入可解释性约束可以让模型概念随规模自然解耦,并支持不重训的闭环干预,为可解释模型的规模化提供了新路径。

  2. MarkTechPost(RSS)71

    用 Google Meridian 构建端到端贝叶斯营销组合模型:媒体测量、ROI 分析与预算优化

    本教程使用 Google Meridian 构建完整的贝叶斯营销组合建模工作流,涵盖数据加载、ROI 先验配置、NUTS 采样拟合及收敛性评估。通过 Analyzer API 提取渠道贡献、ROI、边际 ROI、adstock 与饱和曲线等后验指标,并计算渠道间 ROI 比较概率。最后用 BudgetOptimizer 优化固定与灵活预算,生成可分享的 HTML 报告并保存模型复用。

    推荐理由:完整工作流把先验设定、后验采样、诊断和预算优化串联为可执行步骤,让营销分析团队能自行量化渠道贡献与 ROI 不确定性。

8月5日周三
  1. HuggingFace Daily Papers(社区热门论文)76

    Any-OPD:面向流匹配模型的异构同策略蒸馏框架

    Any-OPD 提出首个支持任意异构流匹配生成器对的同策略蒸馏框架,仅通过冻结的 DINOv2 表示空间桥接教师与学生模型,无需共享 VAE、架构或噪声调度。将 FLUX.1-dev 蒸馏至 SD3.5-Medium 后,学生模型 PickScore 与 HPSv3 均显著提升,以教师五分之一的参数量达到接近其性能,而直接潜在回归训练完全失败。

    推荐理由:将异构流匹配蒸馏转化为在独立视觉空间求解固定点,配合噪声级对齐跨过VAE与架构差异,2.5B学生模型在偏好指标上逼近12B教师。

  2. Tomer Tunguz 博客(VC 分析)71

    SpaceXAI 资本开支狂飙:单季 AI 投入 160 亿美元,逼近微软

    SpaceXAI 上季度资本开支达 183.7 亿美元,其中 158.3 亿投向 AI,约为微软同期总资本开支的 40%。其运营现金流仅覆盖资本开支的 12%,远低于微软的 155% 和 Meta 的 106%,主要依赖举债和股权融资。尽管股价较 6 月峰值腰斩、6 月发行的 250 亿美元债券跌破面值,公司仍以 Grok 4.5(智能指数 54 分)和 Cursor 生态持续加码竞争。

    推荐理由:原文用现金流与债券价格数据拆解 SpaceXAI 的资本开支结构,读者可以据此比较其与超大规模云厂商在融资方式上的差异。

  3. LlamaIndex:产品、工程与评测66

    LlamaIndex:文档 OCR 不会被前沿模型商品化,LlamaParse Agentic 以 84.9% 领先

    LlamaIndex 发文反驳文档 OCR 正被前沿模型商品化的观点,称帕累托前沿仍远高于最新前沿模型。其开源的 ParseBench(约 2,000 个人工核验的企业页面、167,000+ 条测试规则)显示,GPT-4o 到 GPT-5.5 三代模型解析准确率提升约 24 分但每页成本约翻四倍,最新最贵模型仍比专用前沿低 20 分。

    推荐理由:文章用 ParseBench 数据论证文档 OCR 不会被前沿模型商品化,并给出路由、蒸馏、文本层复用等可迁移的工程方法。

8月4日周二
  1. NVIDIA Blog(RSS)62

    NVIDIA 开源 cuFile API,推动 GPU 直连存储

    NVIDIA 在 FMS 大会上宣布开源 cuFile API 及底层存储软件栈,让 GPU 可直接读写存储,访问延迟降至微秒级。其 Vera CPU 在两级压缩与加密流水线中吞吐量比 x86 CPU 最高提升 3.21 倍,并联合 40 多家厂商推出 Storage-Next 计划。

    推荐理由:cuFile 开源让 GPU 直存访问成为可跨平台协作的开放标准,这会改变 AI 基础设施团队评估存储架构的方式,不再只绑定单一厂商的实现。

  2. MarkTechPost(RSS)79

    Reflex 开源 XY:基于 Rust 的超快 Python 绘图库,可保持 1 亿点图表交互流畅

    Reflex AI 发布 Apache-2.0 许可的 Python 交互式 2D 绘图库 XY,通过 Rust 原生核心、二进制缓冲传输和 WebGL2 渲染,在 1 万至 1 亿点范围内保持约 0.08 秒的渲染时间。

    推荐理由:通过Rust核心和二进制输出,XY将千万级点的交互渲染稳定在0.08秒,并让HTML导出体积从259 MiB缩至258 KiB,这对金融、基因组学等需原始数据钻取的大数据场景有直接落地价值。

  3. Hacker News 热门(buzzing.cc 中文翻译)81

    Swiftlet:在 Mac 上运行 80B 版 Qwen(内存 4.3 GB),在 iPhone 上运行 35B 版

    Swiftlet 是一个 Swift + Metal 运行时,可在普通 Apple 设备上运行 Qwen3-Next 和 Qwen3.5/3.6 MoE 混合模型,仅将小型稠密核心驻留内存,按需从存储流式加载路由专家权重。

    推荐理由:用流式专家加载把 80B 模型塞进手机,具体 RAM 和速度数字让开发者能直接判断自己设备的上限,而不是停留在商详口号。

  4. HuggingFace Daily Papers(社区热门论文)70

    SwanTale:面向指令与零样本任务的统一多说话人语音与音频生成

    SwanTale 提出统一的多说话人语音与音频生成模型,同时支持零样本与指令任务。研究配套推出 SwanData-Caption 数据方案,通过清洗、合成覆盖与多级标注解决数据稀缺问题,并引入 SwanVAE、Unified MoE、GRPO 后训练等技术。实验显示,SwanTale 在多项零样本与指令指标上领先,并在两项任务的表达力评分中均取得最佳成绩。

    推荐理由:通过 SwanData-Caption 数据管线和统一模型,让内容创作者能够以自然语言描述生成定制声音,并复用参考音频,减少了动画、游戏等场景中音频合成的碎片化。

  5. TechCrunch:AI(RSS)70

    Palantir 强劲季度后,CEO Alex Karp 称 AI 行业“马克思主义”

    Palantir CEO Alex Karp 在季度股东信中警告,前沿 AI 实验室对企业过于不可信,并称其意图“占有所谓合作伙伴的生产资料”,带有“马克思主义色彩”。该公司第二季度营收 19 亿美元,同比增长 93%,利润 11 亿美元。Karp 主张 Palantir 提供模型无关的 AI 与分析软件,让企业掌控自身数据与 AI“废气”(提示词、编排、上下文)。

    推荐理由:卡普用马克思主义比喻点出的担忧,即AI实验室通过企业token消耗汲取专有知识并转化为竞争产品,正被更多行业领袖提及,这会影响企业与模型厂商的合作条款设计。

8月1日周六
  1. The Decoder:AI News(RSS)73

    德国法院裁定AI音乐生成器Suno侵犯版权,驳回合理使用抗辩

    慕尼黑法院裁定,AI音乐生成器Suno在训练过程及输出结果中均侵犯版权,并驳回其合理使用抗辩。法院认定Suno 3.5和4版本模型可复现六首知名歌曲的原创元素,构成“记忆化”侵权,且责任归于Suno而非用户。该判决还认定美国版权法下的合理使用不适用于此案,目前尚未最终生效。

    推荐理由:裁决将版权责任归于模型开发者而非用户,区分了音乐与文本模型,但提示词针对性可能削弱结论的一般性,对后续 AI 版权诉讼有参考价值。

7月31日周五
  1. IT之家(RSS)73

    国家发改委:人工智能相关行业保持 30% 以上高增长,全国智能算力规模达去年同期 2.8 倍

    国家发展改革委在 7 月新闻发布会上介绍,上半年人工智能自主创新加快,首个全国产 10 万卡人工智能超集群正式投用,截至 6 月底全国智能算力规模达去年同期 2.8 倍。深度求索、月之暗面等本土企业发布多个万亿级参数开源大模型,国产大模型全球总下载量突破 100 亿次。相关行业保持 30% 以上高增长,上半年规模以上工业企业集成电路产量同比增长 23.1%,出口额同比增长 88.7%。

    推荐理由:这是发改委首次披露上半年AI产业核心数据,算力暴增2.8倍,国产大模型下载破百亿,这些数字会直接写进下半年投资报告的支撑页。虽然只是发布会口径,但数据含金量高,做AI基础设施和政策的从业者值得记下来。