DiffusionGemma 技术报告:基于离散扩散的高效文本生成模型
DiffusionGemma 是一个实验性开源权重语言模型,通过离散扩散并行迭代精炼 256 个 token 的块,而非逐 token 解码,从而避免自回归模型的顺序解码瓶颈。
推荐理由:扩散生成首次在文本领域将吞吐推高至约1500 token/s,此前这类速度仅见于非文本生成架构,为实时交互和批量生成场景提供了新的可行上限。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
DiffusionGemma 是一个实验性开源权重语言模型,通过离散扩散并行迭代精炼 256 个 token 的块,而非逐 token 解码,从而避免自回归模型的顺序解码瓶颈。
推荐理由:扩散生成首次在文本领域将吞吐推高至约1500 token/s,此前这类速度仅见于非文本生成架构,为实时交互和批量生成场景提供了新的可行上限。
推荐理由:Inkling-Small 将 Inkling 的性能塞进 1/4 大小的模型,权重完全开放,还支持文本、图像、音频,对想用低成本体验顶尖能力的开发者是个值得上手的信号。
Microsoft Research 推出 Echoverse,为 computer-use agent 构建了 12 个合成训练世界(10 个深度领域世界和 2 个能力世界),9B 模型训练后在全部环境上平均分从 36.5% 升至 67.1%,与 GPT-5.4(80.7%)相差 14 个点。
推荐理由:原文给出深度世界对比浅层世界的实验数据和可复用的环境构建方法,并开源了四个世界,读者可据此评估训练环境的做法。
RadixArk 与 Google Cloud 合作,将开源推理框架 SGLang 引入 Google TPU,开发者可通过 SGL-JAX 在最新 TPU 上运行 Gemma、Qwen、DeepSeek 等大语言模型及多模态模型。
推荐理由:SGLang 正式登陆 TPU,推理框架的硬件自由终于实现,选 GPU 还是 TPU 从此只看性价比不看兼容性,做推理服务的团队可以重新算账了。
一项新研究通过“影子评估”测试前沿 AI 智能体能否独立完成开放式 AI 研究。智能体在六天和数千美元算力下完成了全部工程任务,但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展,被原作者明确拒稿。研究识别出五大失败模式,包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。
推荐理由:这篇论文给「AI即将自我进化」的说法泼了盆冷水,虽然代理能跑通工程,但在解决开放性研究问题上全线溃败,对打算用AI做科研的团队是个重要的现实检验。
OSReward 是一个用于评估视觉语言模型(VLM)作为计算机操作智能体(CUA)轨迹评判者的高质量基准,并衍生出聚焦困难案例的 OSReward-Hard 与细粒度评分的 OSReward-Multi。
推荐理由:该项基准比较了VLM法官在计算机使用轨迹上的可靠性,揭示其系统性宽大偏误;同时开源的OS-Shepherd奖励模型以更低成本提供与商业模型相当的评估信号,影响智能体训练的反馈设计。
推荐理由:Perplexity开源Numbat,把agent安全检测从黑箱变为可观测可拦截的层,虽小众但对依赖agent生产环境的团队是个实用工具。
一个开源引擎让 Gemma 4 26B 模型能在任何 M 系列 Mac 上运行,仅需 2 GB 内存。该项目已发布在 GitHub 上,大幅降低了本地运行大语言模型的硬件门槛。
推荐理由:这是我见过最极端的端侧优化,把 26B 参数塞进 2GB 内存,意味着所有 M 系 Mac 都能本地跑大模型了,开发者值得马上 clone 试试。
推荐理由:做推理加速的可以试试这个端到端推测解码框架,腾讯开源了完整代码和权重,在 Hy3 上提速近 2.4 倍且吞吐更高,拿来即用。
腾讯混元开源覆盖训练到部署的投机解码框架 AngelSpec,并放出 Hy3-A21B 的 MTP 与 DFly drafter 权重及训练代码。
推荐理由:AngelSpec 将投机解码从训练到部署全链路开源,DFly 和 D-cut 在真实流量下带来额外加速,对需要优化推理成本的团队有直接落地价值。
作者将Claude Code与Codex的协作工具搭子升级至2.0版,通过deep_reasoner、fast_worker、arbiter三种身份及跨项目模型混编,把每周500美元的API账单压缩至400美元。2.0新增本地配置UI、一键试跑、Goal哈希校验和带证据链的小票,并支持按host分命名空间独立配置两个Agent。
推荐理由:从两个Agent的串行交接升级为三身份团队的并行协作,把模型按推理、执行、仲裁分派任务,为多模型工作流提供了可复用的成本控制方案。
Deltafin 项目成功在 64 GB M1 Max 上运行了 2.8T 参数的 MoE 模型 Kimi K3,当前中位推理速度为 0.0687 token/s(14.6 秒/token)。完整安装需约 1.7 TB 本地磁盘,流式模式仅需 215 GB 但推理速度降至 3 分钟以上/token。项目提供 OpenAI 兼容 API 服务器,支持聊天和代码补全,但建议客户端超时设为小时级别。
推荐理由:这是个在 M1 Max 上跑 2.8T MoE 的工程 hack,把不可能变成可能,虽然慢得只有聊天室节奏,但玩法足够硬核,玩硬件的看完会想开 issue 贡献数据。
Together AI 宣布与 Moonshot AI 达成战略合作,成为其模型发布平台,Kimi K3 已上线并可零日访问,未来 Moonshot 每个开源权重模型都将在 Together 首发。
推荐理由:作者作为合作方说明 K3 的架构要点和托管选项,读者可据此评估开源前沿模型在生产环境的可用路径。
推荐理由:OpenAI Codex团队把代码安全扫描做成开源CLI和SDK,直接能跑在CI里,对在意AI生成代码安全的开发者来说,算是个实用工具,不妨一试。
月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。月之暗面已开源 KDA 内核、vLLM 实现及模型权重。
推荐理由:Kimi Linear首次在公平对比中证明了线性注意力可以全面超越full attention,KV缓存降低75%,解码吞吐量提升6倍,所有做长上下文和RL团队的必读论文。
Microsoft 发布 MAI-Cyber-1-Flash,一款 137B 总参数(5B 活跃参数)、256k 上下文窗口的稀疏 MoE 网络安全模型,是 MAI-Code-1-Flash 的微调版本。
推荐理由:微软这个安全模型把漏洞挖掘系统推到95.95%,关键是90%任务由5B模型完成成本砍半,路由设计比模型本身更值得关注,做漏洞挖掘的可以马上跑起来试试。
Feyn Labs 推出 FeyNoBg,一个用于自动背景去除的 SOTA 模型。它在八个基准测试中的四项上取得最佳 S-measure 分数,其余四项与领先者差距在 2% 以内。该模型基于 BiRefNet 架构,参数量从 222M 扩展至 263M,同时开源了训练库 NoBg,模型和代码分别可在 Hugging Face 和 GitHub 获取。
推荐理由:FeyNoBg 在多个背景去除基准上达到或接近最佳,还开源了训练库,做图像处理的产品可以直接集成,是个实在的工具发布。
月之暗面发布 2.8 万亿参数的混合专家模型 Kimi K3,支持原生视觉理解和 100 万 token 上下文窗口。其规模化效率较 Kimi K2.5 提升 2.5 倍,并同步开源模型权重、技术报告及 MoonEP、FlashKDA、AgentEnv 三项 Infra 技术。
推荐理由:Kimi K3 的完全开放是一个明确信号,月之暗面把最核心的模型权重和技术细节全部公开,国内开发者从此有了媲美国际顶尖开源的底座。虽然部署门槛不低,但开放本身推动了生态发展。
推荐理由:从模型失败中反向定义原子感知,把视觉感知从推理里拆出来很聪明,开源数据和方法对做视觉评测的产品人很有参考价值。
Liquid AI 发布 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M 两个基于 LFM2 混合架构的双向编码器,支持 8,192 token 上下文,已在 Hugging Face 开放下载。
推荐理由:原文给出双向编码器的架构改动、17 项任务微调评测和长上下文 CPU 吞吐对比,读者可以据此评估其在边缘和本地部署中的适用性。