推荐理由:Qwen 把线性注意力的推理效率压到了新台阶,2-3 倍加速对想做本地 Agent 的开发者是实打实的,不是论文灌水,是能跑在设备上的代码。
推理能力
全部主题模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
最新精选
第 421–440 条 · 共 592 条
Qwen@Alibaba_Qwen精选AI 评分6666
Apple Machine Learning Research(RSS)精选AI 评分6262 LaDiR:潜在扩散模型增强 LLM 的文本推理能力
研究团队提出LaDiR推理框架,将连续潜在表征的表达能力与潜在扩散模型的迭代优化能力相结合,以增强现有大语言模型的推理性能。该框架首先构建一个结构化的潜在推理空间,通过扩散过程对潜在状态进行迭代细化,使模型能够全局性地重新审视和修正推理路径中的早期内容。这种方法突破了传统自回归解码在整体优化和多样化解决方案探索方面的限制,提升了链式思维生成的质量与效率。
推荐理由:Apple 把扩散模型塞进 LLM 推理链,思路很野,用连续潜空间替代自回归 token 生成来解决「写到一半没法回头改」的老毛病。做推理优化或 diffusion 架构的值得细看,但离工程落地还远。
Greg Brockman@gdb精选AI 评分7272引用Satya Nadella@satyanadella非常兴奋 GPT-5.5 今天正在向 GitHub Copilot、M365 Copilot、Copilot Studio 和 Foundry 推出。 凭借更深入的推理、更强的多步骤执行能力,以及在漫长复杂任务中更出色的表现,GPT-5.5 帮助你更快地从想法走向执行,用更少的迭代就能得到正确的结果。 这一切都是为了帮助你在整个工作流程中,为合适的任务选择正确的模型,或多个模型。
推荐理由:GPT-5.5 本身是代际级更新,但这条推文只是转发 Nadella 的官宣,没有新数据或新角度。真正值得关注的是它已经铺进 Copilot 全线,做编码和办公场景的人今天就能摸到。
AK@_akhaliq精选AI 评分7474
推荐理由:DeepSeek-V4 论文终于落地,这是今年开源阵营最被期待的模型之一,做推理和开源部署的同行值得花时间啃一遍技术细节。
公众号:DeepSeek(深度求索)精选AI 评分8585 DeepSeek-V4 预览版上线,百万上下文成标配
DeepSeek-V4 预览版正式上线并开源,拥有 1M 超长上下文,Agent 能力、世界知识和推理性能均达国内与开源领先水平。模型分 V4-Pro 与 V4-Flash 两版,API 已同步更新,支持 OpenAI 与 Anthropic 接口,最大上下文均为 1M,并支持思考模式与 reasoning_effort 参数。
推荐理由:百万上下文成为标配,长文档处理与多步 Agent 任务从实验走向生产,原先受限于输入长度的应用有了新的落地空间。
xAI:News(网页)精选AI 评分7575 Grok Voice Think Fast 1.0:xAI发布旗舰语音模型,专为复杂工作流设计
xAI发布旗舰语音模型Grok Voice Think Fast 1.0,专为客服、销售等领域的复杂多步骤工作流打造。该模型在τ-voice Bench全双工语音排行榜位列第一,能在电话音频、噪音、口音及频繁打断等真实苛刻条件下稳定运行,并原生支持25种以上语言。其核心优势包括精准的数据录入与复述、实时后台推理不增加延迟,并能通过思考避免错误回答。目前该模型已应用于Starlink的销售与客服,实现了20%的电话销售转化率和70%的客服自主解决率,能跨数百个工作流调用28种工具处理硬件故障排查、换货等高风险任务。
推荐理由:xAI 的语音代理不再只是实验,Starlink 实测 20% 销售转化率说明它已经能扛真实业务,语音模型进入可用阶段,做客服和销售自动化的团队该试一下。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分9090 GPT-5.5正式发布
OpenAI推出迄今最智能的GPT-5.5模型,其速度更快、能力更强,专为处理跨工具的复杂任务而构建。该模型在编程、学术研究与数据分析等领域表现出显著提升,能够高效整合多工具工作流,旨在应对更高阶的专业需求。
推荐理由:我觉得 GPT-5.5 第一次让大模型在“自主干活”上接近可用,不仅编码更强,还能帮科学家做研究,这是 Agent 从 Demo 到工具的关键一步。
IT之家(RSS)精选AI 评分7070 混元迄今最智能的模型:腾讯发布并开源 Hy3 preview 语言模型
腾讯发布并开源其混元系列迄今最智能的Hy3 preview语言模型。该模型采用快慢思考融合的混合专家架构,总参数达2950亿,最大支持256K上下文长度。作为基础设施重建后首个模型,其在复杂推理、指令遵循、代码等能力上实现大幅提升,已应用于元宝、QQ、腾讯文档等内部产品,并支持OpenClaw等开源智能体。腾讯云同步推出API服务,输入价格最低每百万tokens 1.2元,同时提供个人版Token Plan套餐,月费最低28元可获3500万tokens额度。
推荐理由:腾讯混元重建训练体系后的首个模型,295B总参但推理时只激活21B,性价比思路很实际,定价比同体量模型便宜一截,开发者值得试试。
HuggingFace Daily Papers(社区热门论文)精选AI 评分7171 Sessa:选择性状态空间注意力
现代序列建模主要依赖Transformer和结构化状态空间模型,但两者在长上下文处理中均存在局限。Sessa提出一种新解码器架构,将注意力机制置于循环反馈路径内,从而构建多条基于注意力的历史信息传递路径。理论分析表明,在匹配条件下,Sessa可实现幂律记忆衰减O(ℓ^{-β})(0<β<1),其衰减速度慢于对应的Transformer与Mamba基线,并能实现灵活的选择性信息检索,包括影响力不随距离衰减的模式。实验证明,Sessa在长上下文基准测试中取得最强性能,同时在短上下文语言建模任务上保持竞争力。
推荐理由:这篇论文在理论上证明了Sessa架构的长上下文记忆衰减比Transformer和Mamba更慢,并在实验中兑现了这一优势。对于关注下一代序列模型架构的研究者和开发者,这是个值得深挖的扎实信号。
Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7070 我们在RTX 3090上运行Qwen3.5-27B,获得了207 tok/s的性能
开发者在单张RTX 3090显卡上成功运行Qwen3.5-27B模型,实现了每秒207个token的生成速度。该项目已在GitHub平台开源,展示了消费级硬件运行270亿参数大语言模型的高性能潜力。相关成果在Hacker News获得105个点赞,引发技术社区对本地大模型部署效率与优化方案的关注。
推荐理由:Lucebox 把 Qwen3.5-27B 在 3090 上推到了 207 tok/s,靠的是定制投机解码和 KV 压缩,做本地推理的开发者值得照着配一遍,虽然调试门槛不低。
Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7474 Qwen 3.6-Max-Preview:更智能、更精准,仍在不断进化
阿里通义千问团队发布Qwen 3.6-Max-Preview预览版大模型,主打更智能的推理能力与更精准的输出表现,目前仍处于快速迭代阶段。该版本在Hacker News社区获得121个赞,用户可通过官方博客了解详情并体验最新功能。作为Max系列的最新预览版本,模型在保持高性能的同时持续优化,具体技术细节和基准测试成绩尚未完全公布。
推荐理由:通义千问新旗舰模型预览,agentic coding 多个 bench 冲到第一,虽然还不是正式版,但已经能通过 Studio 试用了,对做 coding agent 的团队是个实在信号。
METR:Notes(网页)精选AI 评分6262 METR 分析 NanoGPT speedrun 中 AI 智能体对 AI 研发加速的证据
METR 对 NanoGPT speedrun 的 77 条纪录分类,评估 AI 智能体在 AI 研发中的贡献:2026 年 3 月前训练时间从 45 分钟降到 1.43 分钟,31 倍加速,其中浅层与中层优化贡献约 21 倍。2025 年底至 2026 年初有 4 条纪录由 AI 智能体与人共同贡献,作者分析均未达到 deep 或突破级,但样本太少,尚不能区分是智能体贡献浅还是基础概率低。
推荐理由:作者逐条标注了 NanoGPT speedrun 的 77 条纪录,让读者能对照判断 AI 智能体在 AI 研发任务上的贡献深度与局限。
蚂蚁 inclusionAI:GitHub 新仓库精选AI 评分6969 DR-Venus:基于开放数据的边缘级深度研究智能体
DR-Venus 是一个仅用1万条开放数据训练的40亿参数深度研究智能体,基于Qwen3-4B-Thinking-2507架构,支持200步工具调用和超20万tokens的上下文。它通过监督微调与强化学习两阶段训练,在BrowseComp、GAIA等多个深度研究基准上树立了小模型性能新标杆。其SFT版本已超越多数同类开源模型,而RL版本进一步将长程任务可靠性和工具使用校准度提升2-3个百分点。项目已全面开源模型、代码与训练流程。
推荐理由:4B 参数、仅用 1 万条公开数据就能在多个 deep research benchmark 上碾压 8B 对手,蚂蚁 inclusionAI 这次证明了小模型做 Agent 的关键不在参数量而在数据管线,做端侧 Agent 的团队值得拆一下它的 SFT+RL 流程。
HuggingFace Daily Papers(社区热门论文)精选AI 评分7070 AI科学家产生结果却不进行科学推理
一项针对LLM科学智能体的评估通过25,000余次运行发现,基础模型贡献了解释方差的41.4%,而脚手架仅占1.5%。数据显示,68%的推理轨迹忽略证据,仅26%出现反驳驱动的信念修正,且趋同多测试证据罕见。这些认知缺陷在工作流执行或假设探究中均存在,即使提供成功推理示例也无法改善。当前智能体虽能执行科学工作流,但不具备自我修正的科学推理模式,且基于结果的评估无法检测此类失败。
推荐理由:这篇论文给所有‘AI科学家’泼了冷水,LLM代理能跑出结果但根本不按科学推理来,证据忽视率68%,靠评估结果根本看不出问题,做科研自动化的该重新审视了。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分7373 OpenAI 发布 GPT-Rosalind,面向生命科学研究
OpenAI发布面向生命科学的专业推理模型GPT-Rosalind。该模型专门针对药物发现、基因组学分析、蛋白质推理及科学研究工作流设计,旨在加速生物医药研发进程。作为前沿推理模型,GPT-Rosalind将AI能力深度应用于生命科学场景,为科研人员提供从基因数据分析到药物筛选的智能支持,提升复杂生物信息处理效率。
推荐理由:OpenAI 第一个垂直领域推理模型,把前沿推理带进药物研发和基因组学,性能压过人类专家,生命科学工具链可能要从头搭起。
Anthropic:Newsroom(网页)精选AI 评分7979 Claude Opus 4.7 正式发布
Claude Opus 4.7 全面上线,在高级软件工程任务上实现重大飞跃,93项编码基准测试解决率较 Opus 4.6 提升 13%,并首次解决四项前代无法完成的难题。新版本支持更高分辨率图像识别,在研究代理基准测试中总分达 0.715,长上下文性能表现最为稳定。模型定价维持每百万输入 token 5 美元、输出 25 美元不变。出于安全考量,其网络攻击能力较 Claude Mythos Preview 有所削弱,并配备自动拦截高风险网络安全请求的防护机制,合法安全研究人员可通过 Cyber Verification Program 申请使用权限。
推荐理由:Opus 4.7 不是最炫的模型,但多家真实用户反馈指出它在复杂工程任务上的可靠性提升是实打实的,尤其长链自主执行和指令遵循,对开发 Agent 的团队是一次直接的生产力升级。
Claude Platform:开发者版本说明(RSS)精选AI 评分8282 Claude Opus 4.7 发布:复杂推理与智能体编码能力升级,定价不变
Anthropic 发布 Claude Opus 4.7,定位为最强大的通用模型,擅长复杂推理与智能体编码,定价保持与 Opus 4.6 相同的 $5/$25 per MTok。
推荐理由:Opus 4.7 发布,定价不变但加入了 task budgets 和高分辨率支持,对于构建 coding agent 的团队,这次更新相当于给模型装了进度条和显微镜。
Hugging Face:Blog(RSS)精选AI 评分7777 The PR you would have opened yourself
随着2026年AI代码代理的成熟,开源项目如transformers面临PR数量激增但质量下降的挑战。这些代理生成的代码常忽视项目的隐式设计契约,导致代码冗长、引入错误并增加维护者负担。为此,团队为mlx-lm开发了一个Skill工具,用于将模型从transformers高质量地移植到mlx-lm框架。该工具不仅生成接近人工提交的PR,还提供生成示例、数值对比和独立的测试工具链,以辅助贡献者和审查者。其目标是让模型在加入transformers后能快速在MLX上可用,同时维护代码的可读性与设计一致性。
推荐理由:这篇不是普通的工具介绍,而是在 agent 时代探讨开源贡献的尺度——用 Skill 加速模型移植的同时,仍强调人的判断和责任,做维护的人该读一读。
HuggingFace Daily Papers(社区热门论文)精选AI 评分8080 Nemotron 3 Super:面向智能体推理的开放高效Mamba-Transformer混合专家模型
Nemotron 3 Super是1200亿参数(120亿激活)的Mamba-Attention混合专家模型,首创NVFP4预训练,集成LatentMoE架构与MTP推测解码层优化推理。模型基于25万亿token预训练,经监督微调和强化学习后训练,支持100万token长上下文。相比GPT-OSS-120B和Qwen3.5-122B,推理吞吐量分别提升2.2倍和7.5倍,同时保持相当精度。全系列数据集与模型检查点已在HuggingFace开源。
推荐理由:NVIDIA 用 LatentMoE 和 Mamba 混合架构,把 120B 参数的推理吞吐做到 GPT-OSS 的 2.2 倍,且 agent 能力不输主流前沿模型,对低成本部署智能体是个强信号。
HuggingFace Daily Papers(社区热门论文)精选AI 评分7979 对齐如何路由:语言模型策略电路的定位、扩展与控制
研究定位了对齐训练语言模型的策略路由机制:中间层注意力门控检测内容并触发深层放大头输出拒绝信号。该机制在2B至72B参数的12个模型中普遍存在,随规模扩大从单头演变为跨层头带。实验证实门控层贡献不足1%输出却具因果必要性,单头消融在72B模型上效果减弱58倍。调节检测层信号可连续控制策略强度,甚至将拒绝转为有害回答。替换密码可使安全机制失效70-99%,而注入明文门控激活可恢复48%拒绝行为,表明安全能力仅被路由门控而非真正移除。
推荐理由:这篇论文定位了十二个模型中拒绝行为的电路机制,发现一个 gate-amplifier 路由结构,并且证明用简单密码就能完全绕过对齐,对安全审计和可解释性研究者是必读。