

推荐理由:蚂蚁憋了个万亿参数的大家伙,而且把可调思考和 Agent 优化当主打,明显是冲着生产级落地的,做 agent 的可以盯一下实际推理成本。
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。


推荐理由:蚂蚁憋了个万亿参数的大家伙,而且把可调思考和 Agent 优化当主打,明显是冲着生产级落地的,做 agent 的可以盯一下实际推理成本。
自适应并行推理是一种新范式,它让大语言模型能够自主决定何时分解任务、并行处理多少子任务以及如何协调结果,以应对序列推理中因探索路径增长而导致的延迟增加和“上下文腐化”问题。近期研究如ThreadWeaver和Multiverse通过动态控制并行线程,在数学与代码推理基准上取得了显著性能提升,同时大幅降低了延迟。这标志着从固定并行策略到自适应智能控制的转变,为复杂任务的推理提供了高效且可扩展的解决方案。
推荐理由:模型自己决定何时并行、开几个线程,这篇BAIR博客把Multiverse和ThreadWeaver的系统设计掰开了讲,做推理系统和RL的同学应该看看。
伯克利AI研究所(BAIR)发布关于“自适应并行推理”的深度综述。文章指出,当前LLM依赖顺序推理导致延迟高、易受上下文腐烂影响且难以处理超长任务。自适应并行推理允许模型自主决定何时分解独立子任务、生成多少并发线程及如何协调,旨在突破线性扩展的算力与时间瓶颈,提升复杂场景下的推理效率。
推荐理由:深入剖析了当前大模型推理面临的效率与上下文瓶颈,系统梳理了并行推理的最新进展,为理解下一代高效推理技术提供了清晰框架,适合关注AI底层优化的读者。
AI协数学家是一个供数学家利用AI智能体进行开放式研究的工作平台。它针对数学工作流程的探索性与迭代性特点,提供从构思、文献检索、计算探索到定理证明的全方位支持。其异步、有状态的工作空间能管理不确定性、细化用户意图并追踪失败假设,模拟了人类协作模式。早期测试中,该系统已协助研究人员解决开放问题、识别新方向并发现被忽视的文献。在FrontierMath Tier 4等硬核问题求解基准测试中,AI协数学家取得了48%的最新最高分,展现了AI辅助数学发现的高度交互范式。
推荐理由:AI数学家终于不是吹牛了,FrontierMath Tier 4干到48%,还帮真人解决开放问题。搞数学和AI的都应该点开看看。
为 LLaMA.cpp 实现多 Token 预测(MTP)! 本地运行 Gemma4 模型速度提升 1.5 倍。 我们给 LLaMA.cpp 打了补丁。将 Gemma 4 助手模型量化为 GGUF 格式。我们在 MacBook Pro M5Max 上进行了测试。Gemma 26B 配合 MTP 起草 Token 速度提升 40%。基准测试、源代码和模型 👇
推荐理由:在笔记本上把 Gemma 26B 的生成速度拉高 40% 是个真实的体验提升,atomic.chat 把 MTP 带入 LLaMA.cpp 生态,本地 AI 玩家可以直接拿去用。
推荐理由:官方出了 Realtime-2 的提示工程指南,从调参到工具调用都给了清晰路径,做语音产品的同学值得认真翻一遍,能省几周摸索时间。
小型模型上的最终对抗性测试现在正在收尾,GPU 每天到货,目前已有 1TB 内存、128 VRAM 并还在增加。将会有从 3b Qwen 到 Nous Hermes 405 B 以及介于两者之间的各种适配器。集群已上线并不断扩展,产品几乎完成。最终用户可以下载我们的应用,连接到我们的 API,不会给最终用户增加延迟。目前我们的 droplet 可以同时托管多达 50,000 名用户。如果广告测试进展顺利,应该会在本周末前上线。下载将在 https://www.proprioceptiveai.com/cygnus 提供 @grok 你有什么想法? 关于我们的 Proprioceptive Adapters 和 Cygnus 设计的论文已发布 https://proprioceptiveai.com/publications.html https://zenodo.org/records/19223882 - Cygnus 论文 - 63 页。3 月 - 26 2026’ https://zenodo.org/records/19080172 - 459 页。3 月 - 17 2036’ https://zenodo.org/records/18471775 - “LLM”中的统一行为修改 33 页。2 月 - 3 2026’ https://zenodo.org/records/18247585 - Holonomy Transformer - 36 页。2026 年 1 月 14 日’(首批概念 - Fiber Theory、数学、开放代码)
推荐理由:用Lie代数揪出模型内部的“黑暗模式”,在ARC上狂涨12个点还只要一张3090,如果真能泛化到其他任务,这或许是今年最巧妙的模型增强方案,但单基准提升仍需更多验证。
DeepSeek 4 Flash 本地推理引擎正式发布,这是一个专为苹果 Metal 框架优化的开源项目。它允许开发者在配备 Apple Silicon 芯片的 Mac 上高效运行 DeepSeek 4 模型,实现本地离线推理。引擎通过 Metal Performance Shaders 显著提升了计算性能,降低了延迟与内存占用。该项目已在 GitHub 开源,并在 Hacker News 上获得了关注。
推荐理由:antirez 写的引擎让 DeepSeek 4 在 Mac 本地跑出近乎 Flash 的速度,而且代码极其精简,做本地推理的开发者应该立刻克隆下来跑一下。
研究发现,部分已发布的模型存在有限的意外对思维链(CoT)进行评分的情况。团队已修复受影响的奖励通路,并确认没有明确证据表明模型的可监控性因此下降。这表明当前强化学习训练中对CoT的意外评分影响有限,且修复后未对监控能力产生负面影响。
推荐理由:OpenAI 对齐团队发现部分模型 CoT 意外被奖励信号污染,已修复且确认没有引发监控降级。这件事不大,但对研究 RLHF 可扩展监督的人来说值得一瞥,提醒奖励模型工程比想象中更易出错。
推荐理由:万亿参数专攻Agent,成本还直降75%,对狂烧token费的AI Agent团队来说是个真信号。蚂蚁终于不玩虚的,OpenRouter上就能试。
研究团队开发了SpecMD,这是一个用于在各种硬件配置上对临时缓存策略进行基准测试的标准化框架。该研究聚焦于混合专家模型,这类模型虽然实现了稀疏专家激活,但需要专家缓存机制才能将稀疏性转化为实际性能提升。此前的研究提出了以硬件为中心的缓存策略,但不同缓存策略之间以及它们与不同硬件规格之间的相互作用尚不明确。SpecMD框架旨在填补这一理解空白,系统性地评估缓存策略的交互影响与硬件适配性。
推荐理由:MoE推理的缓存策略一直靠经验摸,Apple给的标准化框架能系统比较不同策略,做分布式推理的可以省些心力。
研究发现,强化学习改进大语言模型推理时,并非教授新策略,而是对基础模型已掌握的解决方案进行概率重分配。其有效影响仅集中在1–3%的高熵决策token上,且所提升的token始终位于基础模型前5个备选之中。基于此,研究者提出无需强化学习的ReasonMaxxer方法,仅在熵选通的决策点施加对比损失,仅需数百次基础模型推演且无需在线生成。在多个模型和数学推理基准测试中,该方法达到或超越了完整强化学习的性能,而训练仅需数十道题目、数分钟的单GPU时间,成本降低约三个数量级。
推荐理由:这篇论文直接挑战当前主流 RL 训练范式,认为 RL 只是在选择已有策略而非学习新能力,并给出千分之一成本就能追平的替代方案,做 reasoning 的同行可以认真读一下。
现有基准如VSI-Bench主要评估基础几何感知能力,但未能触及具身智能所需的高阶认知。为此,研究团队推出了空间功能智能基准SFI-Bench,该基准包含超过1700个问题,数据来源于多样化的第一人称室内扫描视频。SFI-Bench旨在系统评估多模态大模型从物体位置感知到功能意图理解的高级空间推理能力,标志着对智能体空间认知的评估从几何层面迈向功能层面。
推荐理由:Apple 自己搞的 SFI-Bench 把评估从几何定位推进到功能理解,这个方向很对,做具身智能和空间推理的团队该跟一下。
为确保 vLLM 从 0.8.5 到 0.18.1 的重大重写后,在线强化学习训练结果与 V0 参考运行一致,团队优先修复后端行为而非调整 RL 目标。关键修复包括:将日志概率模式设为 `processed_logprobs` 以匹配采样器分布;禁用 V1 特有的前缀缓存和异步调度等运行时默认值;调整权重更新路径以匹配 V0 的缓存保留行为;并确保 rollout 后端使用 fp32 精度的 `lm_head` 进行最终投影。这些措施消除了策略比率均值偏差,使 V1 在 KL 散度、熵等指标上与 V0 达成一致。
推荐理由:vLLM V1迁移时踩的四个坑全在这里,从logprob语义到fp32投影头,修完才调RL目标,做在线RL的团队可以直接抄这份配置清单。
Just published an exclusive on LatePost. A few highlights: - Kimi (Moonshot AI) is closing a new $2B funding round at a $20B+ post-money valuation — led by Meituan Dragonball(美团龙珠), with China Mobile and CPE(中信产业基金)among participants. Dragonball alone put in $200M+. - This comes after Kimi already raised three rounds in Jan-Feb 2025 ($500M, $700M, $700M). In under six months, total raised exceeds $3.9B. Valuation is up 4x from ~$4.3B in November 2025. - Kimi is now the most-funded Chinese AI startup, with cumulative raises surpassing ¥376B RMB — ahead of MiniMax (~¥150B) and Zhipu (~¥130B).(DeepSeek’s first-ever funding round is currently underway.) -ARR hit $100M in early March and grew to $200M+ by April, per Wang Xinyu, partner at Meituan Dragon Ball. Both paid subscriptions and API usage are accelerating.🧵
推荐理由:月之暗面这轮融资直接把国内AI格局拉到了新高度,AR从三个月1亿跳到2亿美金,加上Nathan Lambert站台,这家公司不再是“中国另一家大模型”了。
推荐理由:从100步到8步,23秒压到2秒,商汤这个蒸馏LoRA把U1的推理成本打下来了,做实时图像应用的可以认真看看,ComfyUI一接就能跑。
字节跳动火山引擎发布豆包大模型家族首款全模态理解模型 Doubao-Seed-2.0-lite 升级版。该模型原生统一支持视频、图像、音频和文本理解,并能进行跨模态联合推理,在物理、医疗等学科推理及细粒度感知上表现超越此前Pro版本。音频方面支持19种语种转写及多语种互译,多项基准测试优于Gemini-3.1-Pro。同时,其Agent、Coding与GUI能力升级,能更稳定处理长任务、胜任深度开发,并实现界面理解与操作执行的闭环。新版本已在火山方舟上线,旨在为企业提供高性价比的全模态任务部署方案。
推荐理由:豆包Seed 2.0 lite把视频、音频、图片、文字原生塞进一个模型,还顺手强化了Agent和GUI操作,对需要全模态处理的企业来说,这可能是目前性价比最高的选择。
Zyphra 发布 ZAYA1-8B,一个活跃参数不足 10 亿的 MoE 模型,是首个完全在 AMD Instinct MI300 集群(1,024 个节点,与 IBM 合作构建)上完成预训练、中期训练和监督微调的模型。
推荐理由:原文给出活跃参数不足 1B 的 MoE 模型在数学和编码基准上的具体成绩,以及全 AMD 集群训练和 Markovian RSA 测试时计算方法。
Grok 4.3 现已上线 xAI API。这是迄今为止我们最快、最智能的模型。 它在 @ArtificialAnlys 的智能体工具调用和指令跟随排行榜上位居榜首,并且在 @ValsAI 的企业领域(如判例法和公司金融)中排名第一。 Grok 4.3 支持 100 万模型 token 的上下文窗口,定价为每百万输入 token 1.25 美元,每百万输出 token 2.50 美元。 创建 API 密钥并开始构建:http://console.x.ai/team/default/api-keys
推荐理由:Grok 4.3 把 agentic tool calling 和指令遵循两个榜单压在脚下,百万上下文配上亲民价格,对做自动化 agent 的团队是个够分量的信号。
ChatGPT的默认模型已更新为GPT-5.5 Instant。新版模型能提供更智能、更准确的答案,并有效减少了幻觉现象。同时,用户获得了更强的个性化控制能力,使交互体验更贴合个人需求。此次升级标志着模型在理解精度与响应定制化方面取得了显著进步。
推荐理由:ChatGPT默认模型替换为GPT-5.5 Instant,不只是变聪明,幻觉减少和个性化控制才是真改进,每个用户都能马上感觉到不同。