Zyphra 发布 ZAYA1-8B:全 AMD 集群训练的 MoE 模型
Zyphra 发布 ZAYA1-8B,一个活跃参数不足 10 亿的 MoE 模型,是首个完全在 AMD Instinct MI300 集群(1,024 个节点,与 IBM 合作构建)上完成预训练、中期训练和监督微调的模型。
推荐理由:原文给出活跃参数不足 1B 的 MoE 模型在数学和编码基准上的具体成绩,以及全 AMD 集群训练和 Markovian RSA 测试时计算方法。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Zyphra 发布 ZAYA1-8B,一个活跃参数不足 10 亿的 MoE 模型,是首个完全在 AMD Instinct MI300 集群(1,024 个节点,与 IBM 合作构建)上完成预训练、中期训练和监督微调的模型。
推荐理由:原文给出活跃参数不足 1B 的 MoE 模型在数学和编码基准上的具体成绩,以及全 AMD 集群训练和 Markovian RSA 测试时计算方法。
构建长时间运行的智能体,并对智能体执行拥有更多控制。 Agents SDK 中的新功能: • 在受控沙箱中运行智能体 • 检查并自定义开源 harness • 控制记忆的创建时机及其存储位置
推荐理由:OpenAI 把 Agents SDK 带到了 TypeScript,而且直接上了沙箱和开源 harness,做 Node.js 代理的可以扔掉自研的调度层了。
MolmoAct2 是一个为实际部署设计的全开放动作推理模型,在五个方面取得进展。其核心是专为空间与具身推理训练的 VLM 骨干 MolmoER,基于 330 万样本语料库训练。团队发布了三个新数据集,包括迄今最大开放双手数据集 MolmoAct2-BimanualYAM(720 小时遥操作轨迹),并开源了动作分词器 OpenFAST。模型采用层间 KV 缓存条件化架构,嫁接连续动作专家,还引入自适应深度推理变体 MolmoThink,以极低延迟保持几何基础。在广泛实证研究中,MolmoAct2 在 7 个仿真与真实世界基准上超越 Pi-05 等基线,MolmoER 在 13 个具身推理基准上超过 GPT-5 和 Gemini Robotics ER-1.5。模型权重、训练代码与数据均已公开。
推荐理由:开源具身动作推理模型首次全面超越 GPT-5 和 Gemini Robotics,还附赠最大的双手操作数据集和全套训练代码,做机器人的同学本周必读。
Redis创始人Salvatore Sanfilippo提交了为Redis新增数组数据类型的PR,引入了包括ARCOUNT、ARDEL、ARGREP等在内的18个新命令。其中最引人注目的是ARGREP命令,它利用新集成的TRE正则表达式库,可直接在服务器端对数组值进行正则搜索。目前该功能已在一个分支中实现,开发者Simon Willison借助Claude Code构建了一个交互式在线沙盒,通过运行在浏览器中的WASM版Redis子集,供用户体验这些新命令。Salvatore还撰文详细介绍了在AI辅助下开发此功能的历程。
推荐理由:Redis 加数组类型可能改变很多缓存设计,Simon 这个 WASM playground 是把 PR 变成可试产品的最快路径,后端同学可以直接上手体会 ARGREP 的快乐。
加州大学圣地亚哥分校的研究团队在谷歌TPU上成功部署了DFlash,一种基于块扩散的推测解码方法。该方法突破传统自回归草稿生成的序列性瓶颈,通过单次前向传播并行“绘制”整个候选令牌块,而非逐个预测。系统平均实现了3.13倍的推理加速,峰值性能接近EAGLE-3等现有方法的两倍。这一开源方案已集成至vLLM生态系统,通过利用“免费”的并行验证能力和针对复杂推理任务的高质量草稿预测,显著优化了TPU硬件的利用效率。
推荐理由:把扩散式的 speculative decoding 在 TPU 上跑出了 3 倍推理加速,峰值快到 EAGLE-3 的两倍,还直接集成了 vLLM,做推理优化的赶紧试一下。
基于开源模型和商用GPU的广告支持型AI在经济上可行。计算表明,一个由4块B200 GPU组成的集群服务300名用户时,每小时成本约18美元。通过广告收入即可覆盖成本:在内容网络中每3分钟展示一条广告(CPM 3.12美元),或在搜索广告中每39分钟展示一条(CPM 38.40美元),这一广告频率已与常见的移动和网页应用相当。对于代码代理等高强度任务,可采用混合盈利模式:用户每月支付10美元订阅费并每日观看8条广告,即可支持约200万token的用量,这证明了该模式的实用性。
推荐理由:Tunguz 用一页纸的算账说清了广告支持 AI 的经济账,一天看 8 条广告就能换两百万 token,这对做免费 AI 产品的团队是个真正有说服力的模型。
这是一个名为 Ableton Live MCP 的开源项目,它通过模型上下文协议(MCP)将 Ableton Live 音乐制作软件与大型语言模型(如 GPT、Claude)连接起来。该项目在 Hacker News 上获得了 100 点热度,其核心功能是让 LLM 能够读取和控制 Ableton Live 的会话数据,从而可能实现基于自然语言指令的音乐创作与自动化流程。
推荐理由:给 Ableton Live 接上了 LLM 的大脑,让 AI 能直接操作 DAW,虽然还只是原型,但已经能看到未来音乐制作的人机协作模式。做音频 Agent 的可以拿来玩。
Sierra 从新老投资者处筹集 9.5 亿美元,估值超过 150 亿美元。资金将用于构建基于 AI 的客户体验平台。
推荐理由:9.5亿美元的融资让Sierra成为Agent领域估值最高的公司之一,虽然已是两个月前的旧闻,但作为行业信号仍然值得关注。
推荐理由:OpenClaw 这个版本把 agent 协同和实时控制做得更顺手了,如果你在用多节点 agent,这个升级能省不少调试功夫。
DeepClaude项目在GitHub上发布,它是一个结合了DeepSeek V4 Pro模型的Claude代码代理循环工具。该工具的核心优势在于显著降低了使用成本,其价格仅为原Claude方案的1/17,即便宜了约17倍。这一开源方案为开发者提供了一个高性能且极具成本效益的代码生成与处理替代选择。
推荐理由:用 DeepSeek V4 Pro 跑 Claude Code 代理循环,成本直接打到一杯奶茶钱,虽说不一定每个任务都能媲美原版,但便宜成这样还要什么自行车?
ClawSweeper 0.2.0 🦞 OpenClaw 维护机器人现在处理整个循环: issue → @clawsweeper fix/build → 受保护的 PR → 审查 → 修复 → 重新审查 → 自动合并 仍然保守。手动操作少得多。 https://clawsweeper.bot
推荐理由:开源维护者的救命稻草,把 issue 到 automerge 的冗长循环扔给 ClawSweeper 自动修复,保守但足够实用,fork 就能用在任何仓库。
CODEX 技能,残酷检验任何创业点子! 大多数创业点子听起来都不错。 这个 Codex 技能会告诉你它们为什么很可能行不通。 只需把你的点子交给 Codex,它就会替你进行压力测试 -> 找出核心假设 -> 暴露致命缺陷 -> 检查问题是否真实存在 -> 梳理真正的竞争对手 -> 规划你的前 10 个客户 -> 定义 2 周 MVP 安装: npx --yes codex-startup-pressure-test-skill@latest 100% 开源。 仓库在个人简介里
推荐理由:我觉得种子轮前用它榨干想法很值,Greg Brockman 转发的开源技能,输入创业想法就能自动找出核心假设和致命缺陷。
codex宠物分享的图库: 提交入口已开放,可通过下方链接提交👇
构建了 Petdex,一个公开画廊,用于发现、分享并通过一条 curl 命令安装 Codex 宠物。 提交入口在下方链接开放 👇
推荐理由:Greg Brockman 亲自转发的社区画廊,把 Codex pets 的发现和安装简化成一条 curl 命令,对于正在玩 Codex Agent 的开发者来说是个实用的工具箱。
推荐理由:这不只是一篇模型切换体验,它其实回答了那个让人不安的问题——你的 AI 助手换模型后还是它吗?如果不想每次更新都重新认识一个陌生人,这篇里的 SOUL.md 写法和五层身份结构可以照着抄。
DeepSeek发布了V4版本模型,其性能已接近行业最前沿水平,但在价格上具有显著优势,仅为主要竞争对手的一小部分。该模型在多项基准测试中表现出色,能以极低的成本提供顶级的AI能力,有望大幅降低企业和开发者的使用门槛,推动AI技术的更广泛普及。
推荐理由:Simon Willison 实测结论很直白,DeepSeek V4 性能几乎摸到前沿,价格却便宜一个量级,对预算卡死的团队是重大利好。
推荐理由:可解释性工具从学术走向工程,Qwen-Scope 把内部特征操控、数据合成、问题溯源打包成套装,做模型调试和长尾优化的团队值得立刻上手试试。
Ling-2.6-1T 于上周发布,今日正式开源。该模型定位为面向复杂任务的万亿级综合旗舰模型。
推荐理由:蚂蚁开源万亿参数模型 Ling-2.6-1T,虽然一个多月后才看到,但这是目前国内参数最大的综合性基座,做复杂多模态 agent 的团队可以直接拿来用,省去从头训练的麻烦。
LMSYS团队针对SGLang中的强化学习工作负载,提出了一种基于RDMA的点对点权重更新机制,作为传统NCCL广播方法的补充。该设计利用源端CPU引擎副本和Mooncake TransferEngine进行P2P RDMA传输,将拥有1T参数的Kimi-K2模型的权重传输时间从53秒大幅缩短至7.2秒,提速7倍。其代价是每个训练等级需在CPU内存中额外占用一个32G的推理引擎副本。此优化最大限度地减少了网络冗余,允许推理服务器更快恢复rollout过程,且兼容所有主流开源模型。
推荐理由:LMSYS 把分布式 RL 训练的权重同步从 NCCL 广播改成 RDMA P2P,1T 参数模型传输快了 7 倍,做大规模 RL infra 的团队该认真看看这个工程方案。
恭喜 @AntLingAGI 开源发布 Ling-2.6-1T!🎉 面向真实世界智能体工作流的新旗舰——Day-0 vLLM 支持已就绪。 📖 http://recipes.vllm.ai/inclusionAI/Ling-2.6-1T
推荐理由:vLLM 对 1T 模型的 Day-0 适配,说明开源推理栈对大尺寸模型的跟进速度越来越快,做私有化部署的可以直接参考官配 recipe 跑起来。
🚀 今天,我们推出 Ling-2.6-1T,一款专为精确执行指令任务而设计的万亿参数旗舰模型。通过优先采用“快速思考”机制,它以超低 token 开销实现 SOTA 智能,让 token 效率成为一等公民。
推荐理由:蚂蚁把万亿参数模型开源了,但强调的不是大,而是省 token,这对成本敏感的生产环境是真正的性价比之选,做 agent 的可以上手测测。