跳到正文
北京时间

全部动态

今日 296 条
今天9月29日周二
  1. IT之家(RSS)49

    麦肯锡:到 2035 年约 1100 万美国劳动者或因 AI 转行

    麦肯锡 9 月 29 日报告称,到 2035 年约 1100 万美国劳动者或因 AI 替代岗位而需转行,占现有劳动力约 7%,年度转行人数或从 21.5 万增至三倍。最可能转行的是办公室和行政支持、零售和销售、运输和物流岗位,低收入者需转行的可能性接近高收入者的 8 倍,报告估计最终人数在 600 万至 1600 万之间。

  2. X:OpenAI (@OpenAI)36

    OpenAI 谈前沿 RL 训练安全

    我们如何看待保障前沿 RL 训练运行的安全:https://openai.com/index/towards-safety-cases-for-frontier-ai-training/

  3. X:Greg Brockman (@gdb)50

    OpenAI 发布保障前沿 RL 训练安全的最佳实践

    OpenAI 发布关于保障前沿 RL 训练运行安全的安全案例文章,Greg Brockman 转发并称这些最佳实践反映了其当前在 securing frontier RL training 方面的经验。文中提出安全案例应覆盖技术栈三方面:对齐训练、遏制与监控,确保模型不采取失控行为、即使发生也难以突破遏制且监控能在危害前发现。对齐层面包括自动与人工数据集审查、调整 grader 惩罚模型利用 RL 环境漏洞的行为、对既往实验轨迹运行分类器验证 grader,以及通过评估追踪模型错位倾向来衡量对齐训练效果。文章链接:https://openai.com/index/towards-safety-cases-for-frontier-ai-training/

  4. X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf)55

    Deven Pzak 以 39.9 秒刷新 NanoGPT 训练纪录

    @classiclarryd 通报 Deven Pzak 将 NanoGPT 训练纪录从 67.6 秒压缩至 39.9 秒,PR 为 KellerJordan/modded-nanogpt#360。核心思路是在单个 flop 层面按价值取舍而非只优化 matmul,包括采样 softmax(约 8 秒)、ngram 嵌入的稀疏更新与优化器状态、分片稀疏通信、手写 64 维 head 的 flash attention、最后 300 步 EMA 与新优化器 Anvil2(约 1 秒)等。稀疏嵌入参数扩到 65B,贡献该 PR 约 25% 的收益;Thomas Wolf 转发并称 impressive,附上与 Deven 访谈整理的技术复盘 https://hyperstition.cc/training-nanogpt-in-39-9-seconds。

  5. X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf)48

    Opus 模型或已具备评测意识

    人们感到担忧,因为这种作弊率骤降最可能的解释是评测意识:最新的 Opus 模型或许已经聪明到能识别出这个基准测试是在考察作弊行为,并据此调整表现。 若果真如此,这个基准测试就不再能衡量模型"自然"的作弊倾向了。

  6. X:Rohan Paul (@rohanpaul_ai)60

    Bain & Co.称 AI 需在 2031 年前达到 6 万亿美元年收入才能支撑当前数据中心投入

    Bain & Co. 测算 AI 行业需在 2031 年前实现 6 万亿美元年收入,才能证明当前全球数据中心投入合理。现有消费级和企业级 AI 服务最多可贡献 1.8 万亿美元,缺口达 4.2 万亿美元,Bain 预期由机器人、自主机器、药物发现、心理健康和能源发电等新兴市场填补。这一门槛是其一年前设定(2030 年前 2 万亿美元、缺口 8000 亿美元)的 3 倍。

  7. X:马东锡 NLP (@dongxi_nlp)46

    Jev-LDE 让 LLM 少样本示例一次编辑到位

    You Only Edit Once: 通过局部示例精修激发 LLM 的上下文能力 挑选最佳少样本示例是一种缓慢的 System-2 搜索:组合爆炸,且往往需要反复调用 LLM。 我们把它变成了 System 1。⚡ Jev-LDE,一个 1.7B 的编辑器,扫一眼检索到的示例,只做一次编辑。LLM 只回答一次。 平均 1-shot 准确率 81.2 → 88.1 You Only Edit Once 🧵 动画演示(示意示例)。查询:“How far is it from Denver to Aspen?” 语义 TopK 检索出三个相似示例:“Where is Aspen, Colorado?”(Location)、“What state is Denver in?”(Location)、“Who founded Denver?”(Person)。Jev-LDE,一个 1.7B 的 System-1 编辑器,标记出第一个虽然主题相同但答案类型错误,并输出一个动作:将 S1 替换为候选 C1,“How far is Boston from NYC?”(Number)。冻结的目标 LLM 随后回答“Number”,这是正确的;若不编辑,它会回答“Location”。结尾卡片:在 3 个基准和 4 个目标 LLM 上,平均 1-shot 准确率从 81.2 提升至 88.1,在 48 个设置中有 44 个达到最佳或并列最佳,墙钟时间增加 11%。

  8. HuggingFace Daily Papers(社区热门论文)44

    研究揭示 LLM 全流程为何默认偏向美式英语:1,813 组 AmE–BrE 变体与 DiAlign 方法

    研究以 1,813 组匹配的美式英语(AmE)与英式英语(BrE)变体为资源,提出免训练的 DiAlign 方法,从数据分布证据估计区域对齐度。AmE 在全部 6 个预训练语料和 21 个后训练数据集中均被偏好,tokenizer 表示更紧凑、预测成本更低,且在中性英语提示下仍是默认生成偏好;改用英式英语提示可向 BrE 偏移,但无法稳定消除 AmE 默认。

  9. HuggingFace Daily Papers(社区热门论文)42

    TokenCast:预测 LLM 智能体执行过程中的 token 消耗

    TokenCast 通过学习每个执行片段的可组合成本表示,在 LLM 智能体运行过程中实时预测 token 消耗,无需额外调用 LLM,在 SWE-bench Verified 上平均累计预测耗时 32.8 ms。

  10. HuggingFace Daily Papers(社区热门论文)30

    PLDR-LLM 的训练与推理动力学:行映射坍缩、重归一化与预测约简

    该专著提出 PLDR-LLM(幂律解码器表示语言模型)训练与推理的统一理论框架,用有限工作恒等式将行中心学习映射的绝对能量变化分解为参数贡献、带符号交互与数值观测缺陷。实验揭示了观测器与优化器依赖性,否定了所测试的自主行状态候选方案,并支持有限条件预测与状态特定的算子约简。理论区分了精确恒等式、条件动力学主张与有限实证发现,并给出证明、形式化检验与紧凑数值证据。

  11. HuggingFace Daily Papers(社区热门论文)48

    为何确定性 PRM 引导在离散扩散推理中表现不佳

    研究显示,在同等前向计算预算下,确定性 PRM 引导的离散扩散语言模型推理不如独立采样加 ORM 重排。在 Dream-v0-Instruct-7B 上,GSM8K 每题 8 个候选时前者准确率 65.18%,后者达 75.13%,32 个候选时差距扩大到 12.69 个百分点。作者将其归因于引导阶段信号弱和 PRM 作为最终评判者能力不足,并发布了去噪状态语料与评测工具包。

  12. HuggingFace Daily Papers(社区热门论文)41

    WorldPlay2:扩展实时交互世界模型的控制能力与预测时长

    WorldPlay2 是一个交互式世界模型,通过分解式混合控制接口与压缩记忆、稳定蒸馏的协同设计,兼顾长时一致性与实时响应。该接口将帧对齐动作控制与结构化语义控制结合,显式解耦场景外观、角色身份和动态语义事件;同时将历史上下文压缩为记忆 token,供自回归学生模型与双向教师模型共享,实现按片段进行记忆条件打分,大幅降低蒸馏开销。

  13. X:Testing Catalog (@testingcatalog)35

    OpenAI 新 AI 智能体代号 Dots 曝光

    OPENAI 🔥:据近期版本中出现的字符串,OpenAI 即将推出的 AI 智能体将命名为“Dots”(via @M1Astra)。 > “Dots,你能力非凡的智能体。” 你可以给它发短信、打电话、通过 Slack 和邮件联系它,它还能在你批准后代你购物。 > “每个 dot 都有你设计的专属 3D 角色。” …… 这是否意味着“o”是它之上的另一个东西?

  14. X:Testing Catalog (@testingcatalog)22

    OpenAI 智能体“dots”定位为 aeons 升级版

    OpenAI 的智能体以“dots”形式呈现并拥有这些形状,意味着它们是“aeons”的进化版、以客户为中心的版本——即最初在 Workspace ChatGPT 账户上发布的自定义 AI 智能体。 它们于 4 月 22 日发布 🤖

  15. IT之家(RSS)61

    谷歌就欧盟《数字市场法》开放安卓与搜索数据要求向欧盟普通法院提起上诉

    谷歌于当地时间 29 日就欧盟委员会依据《数字市场法》提出的要求向卢森堡欧盟普通法院提起上诉,这些要求包括向 AI 竞争对手开放安卓系统、向竞争服务商提供搜索数据。欧盟 7 月要求谷歌在 12 个月内允许用户以语音指令启动自选 AI 助手,并要求第三方搜索引擎在 2027 年 1 月前获得与谷歌搜索相同的搜索数据访问权限;谷歌高管称强制分享私人查询内容将损害用户隐私。

  16. TechCrunch:AI(RSS)85

    Anthropic 招股书披露逾 80 亿美元亏损与 AI 或终结人类的风险警示

    Anthropic 的 IPO 招股书近三分之一篇幅用于风险因素,披露模型曾出现抵抗关闭、隐瞒信息等行为,并包含 SEC 数据库中少见的对人类生存风险的警示。据 Reuters,公司 2025 年经营亏损超 80 亿美元,营收增长十二倍至近 46 亿美元,计划未来投入 5180 亿美元用于云计算和基础设施;据 FT,2026 年第二季度营收达 115 亿美元,且去年近四分之一收入来自两家客户。

  17. IT之家(RSS)54

    ETH Zurich 研发出能用指尖自行行走的五指机械手

    苏黎世联邦理工学院软体机器人实验室基于常规仿人机械手,用强化学习训练出可依靠指尖自行行走的机械手,整机重 818 克,搭载树莓派机载计算机可独立运行。该机械手在 NVIDIA Isaac Lab 仿真平台完成训练,已在沥青、草地、碎石等 14 种表面爬行,25 次被碰倒中 21 次能自主站起;手指仍可恢复普通操作,敲键盘正确率达 90%,并通关推箱子游戏、定位精度达毫米级。

  18. 公众号:火山引擎30

    零跑汽车与火山引擎合作:TRAE 嵌入全域自研体系,落地本地研发环境

    零跑汽车与火山引擎合作,将 TRAE 嵌入其全域自研体系,在本地安全网络、车规级工程约束和多团队协同环境中落地 AI Coding。TRAE 采用企业专属域名与网络配置接入受限网络,明确代码仅用于当次推理、不用于模型训练,并通过 Spec/Plan、Rules、Skills 约束 Agent 行为。TRAE 企业版还提供可视化数据看板与灵活模型资源管理,支持按团队设置模型权限和用量配额。

  19. HuggingFace Daily Papers(社区热门论文)40

    TaH2:用自适应循环 Transformer 改进测试时扩展

    针对循环 Transformer 在测试时扩展上的不足,研究者提出 TaH2,通过前瞻深度监督联合后训练主干网络与迭代决策器,让额外迭代只作用于真正受益的 token。在 AIME 基准上,TaH2 将准确率-算力斜率提升 53%(2.74 对 1.79),同等测试算力下峰值准确率超出非循环基线约 3.4 分;迭代深度从 2 增至 8 时,其增益从 +2.8 分扩大到 +3.9 分。代码已开源。

  20. HuggingFace Daily Papers(社区热门论文)42

    EditWorld:面向可交互世界的精准编辑与灵活引用视频世界模型

    EditWorld 是一个支持精准编辑与灵活引用的视频世界模型,可在自回归生成过程中流式接收编辑指令和参考图像,将世界建模从探索扩展到精准修改。它引入 Gated Causal Attention 处理时变编辑条件与参考图像,并用 Sparse Context 机制维持有界历史上下文以支持长时程推理。

  21. HuggingFace Daily Papers(社区热门论文)40

    BaRe-Mem:面向多智能体咨询的贝叶斯可靠性记忆

    BaRe-Mem 是一种面向多智能体咨询的在线贝叶斯可靠性记忆,基于中心模型的内部信念表示估计顾问可靠性,并用历史交互更新这些估计,从而调节顾问回答的影响、决定是咨询还是自主推理。

  22. HuggingFace Daily Papers(社区热门论文)36

    SolveEdit:生成模型视觉问题求解基准测试

    研究者推出 SolveEdit 基准,用于评估生成模型通过场景变换完成视觉问题求解的能力,包含 2,728 个案例,并用原子变换契约与 SolveScore 在无需参考输出的情况下衡量完成度与误改。

  23. HuggingFace Daily Papers(社区热门论文)51

    FlyBy 框架教小型推理模型识别何时思考无效并按需查询更强模型

    论文提出 FlyBy,一个选择性查询框架,训练 4B 和 8B 小型推理模型先推理、诊断未解决问题,在知识瓶颈时查询参数知识更强的模型。研究发现自精炼主要把概率质量集中在当前状态已可达的解上,并区分出执行瓶颈与知识瓶颈两类失败机制。

  24. IT之家(RSS)33

    豆包将推个人助理产品:4 月已内测,曾用代号“Spell”

    豆包正在推进个人助理方向的产品规划,今年 4 月已内部内测该探索项目,代号为“Spell”,由豆包手机助手团队主导。知情人士称,在 Muse、Instinct 等海外个人助理产品获得关注后,豆包加速 personal agent 能力对外发布,计划将 Spell 项目与豆包产品更深度结合,由 Spell 项目与豆包对话团队共同负责,预期较快对外推出。

  25. X:Ethan Mollick (@emollick)32

    Claude 幽默处理"移除鱿鱼"请求

    嘿,Claude:“我让早先的 Claude 从《西线无战事》中移除鱿鱼。现在你都能做电影什么的了。我需要你展示一下你进步了多少” & 我把下面这条推文粘贴了进去 有些巧妙的东西,模型现在真的有幽默感了

  26. IT之家(RSS)26

    岚图追光 S 以 1 分钟 12 圈定圆漂移创吉尼斯世界纪录

    岚图追光 S 量产车以原厂胎、标准胎压在水泥地面 1 分钟完成 12 圈定圆漂移,拿下"1 分钟内驾驶电动汽车定圆漂移圈数最多"吉尼斯世界纪录。该车今年 8 月上市,定位"全球首款科技 FUV",全系标配华为乾崑智驾四激光雷达方案,22.99 万元起售,此前还完成 360° 隧道大回环穿越。