OpenAI 推理系统在 2025 ICPC 世界总决赛中获得 12/12 满分,成绩相当于人类参赛者第一名。其中 11 道题目由 GPT-5 解决。
1/n 我非常激动地分享,我们的 @OpenAI 推理系统在 2025 年 ICPC 世界总决赛中获得了 12/12 的满分,这是首屈一指的大学编程竞赛,来自世界各地的顶尖大学团队在此解决复杂的算法问题。这本来会让它在所有人类参赛者中排名第一。🥇🥇
推荐理由:GPT-5在ICPC世界总决赛获满分,编程推理能力达人类冠军水平
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
OpenAI 推理系统在 2025 ICPC 世界总决赛中获得 12/12 满分,成绩相当于人类参赛者第一名。其中 11 道题目由 GPT-5 解决。
1/n 我非常激动地分享,我们的 @OpenAI 推理系统在 2025 年 ICPC 世界总决赛中获得了 12/12 的满分,这是首屈一指的大学编程竞赛,来自世界各地的顶尖大学团队在此解决复杂的算法问题。这本来会让它在所有人类参赛者中排名第一。🥇🥇
推荐理由:GPT-5在ICPC世界总决赛获满分,编程推理能力达人类冠军水平
OpenAI 推理系统在 2025 ICPC 世界总决赛中解出全部 12 道算法题,获得 12/12 满分。该成绩在所有人类参赛队伍中排名第一,足以夺得冠军。
1/n 我非常激动地分享,我们的 @OpenAI 推理系统在 2025 年 ICPC 世界总决赛中获得了 12/12 的满分,这是首屈一指的大学编程竞赛,来自世界各地的顶尖大学团队在此解决复杂的算法问题。这本来会让它在所有人类参赛者中排名第一。🥇🥇
推荐理由:通用推理模型首次在顶级编程竞赛击败人类冠军,算法岗竞争格局或将重塑
Gemini 2.5 Deep Think 高级版本在 2025 年 ICPC 世界总决赛中取得金牌级别成绩,标志着 Gemini 模型编程能力持续精进,在竞赛级编程任务中表现卓越。
推荐理由:Gemini 2.5 Deep Think 在顶级编程竞赛 ICPC 中斩获金牌级别成绩,代码推理能力再突破
1/n 我非常激动地分享,我们的 @OpenAI 推理系统在 2025 年 ICPC 世界总决赛中获得了 12/12 的满分,这是首屈一指的大学编程竞赛,来自世界各地的顶尖大学团队在此解决复杂的算法问题。这本来会让它在所有人类参赛者中排名第一。🥇🥇
推荐理由:AI首次在ICPC总决赛拿满分并超越人类最强,这不是又一个刷榜新闻,而是推理模型在算法思维上开始与顶尖人类选手平起平坐的信号。做coding agent的同行该严肃对待了。
Gemini 2.5 Deep Think 进阶版在 ICPC 2025 世界编程大赛中取得金牌水平成绩。继 IMO 数学竞赛后,这是该模型在竞技领域取得的又一历史性突破。


推荐理由:Gemini 2.5 Deep Think 在 ICPC 编程竞赛中达到金牌水平,AI 推理能力再获突破
Anthropic 可解释性团队在月度更新中分享了关于大语言模型跨语言表征的新发现。研究显示,模型在不同语言间的特征相似性(通过交并比IoU衡量)会随文本样本长度增加而上升。通过对比英法双语段落的首句与末句,团队发现末句的IoU显著高于首句,且无关文本的首句间重叠度高于末句。这表明模型在较长上下文中能构建更丰富的跨语言理解,而非由虚假激活主导。相关发现支持了模型随上下文积累深化语义表征的观点。
推荐理由:揭示语言模型随上下文深化理解的机制,助力可解释性研究进展。
LLM推理的再现性是科学进步的基础,但即使在温度设为0的贪心采样下,ChatGPT等API以及vLLM、SGLang等自托管推理引擎仍无法保证确定性结果。常见的“并发+浮点非结合性”假设并不完整——GPU上重复执行相同矩阵乘法结果完全一致。真正原因在于:部分GPU内核是非确定性的,但LLM前向传播使用的内核均为确定性;推理服务器前向传播本身是确定性的,用户感知的非确定性源于浮点运算非结合性在不同聚合顺序下导致的细微数值差异。文章揭示了这一误解,并探讨如何实现真正可重现的LLM推理输出。
推荐理由:Horace He 把 LLM 推理非确定性的锅从并发浮点转向 batch-size,并给出了可落地的 batch-invariant 内核实现,做推理部署和 RL 的工程师都该看看。
OpenAI 高层公开致谢首席科学家 Jakub Pachocki 与 Szymon Sidor,二人多次联手攻克被认为不可能的技术难题,主导 Dota RL 扩展、GPT-4 预训练及推理突破,被形容为“不知疲倦”的黄金搭档。
推荐理由:Sam Altman 揭秘 OpenAI 核心科学家与关键技术突破历程
DeepSeek 正式发布 DeepSeek-V3.1,采用混合推理架构,一个模型同时支持思考与非思考模式,官方 App、网页端及 API 均已同步升级。
推荐理由:混合推理架构统一思考与非思考模式,Agent基准提升具体,API兼容Anthropic格式直接降低Claude Code接入门槛。
DeepSeek-V3.1 以混合推理模型形式开源,用户可一键切换思考模式,同时 Agent 智能体支持性能得到增强。
推荐理由:DeepSeek V3.1 不是小修小补,混合推理和 Agent 支持让它从‘对话模型’转向‘行动模型’,开源这一步让 Agent 开发有了新底座。
GPT-5-pro 已能证明新的数学定理。在凸优化开放问题测试中,它给出了比原论文更优的边界且经验证正确。这意味着继软件工程之后,数学研究也将成为 AI 辅助的下一个前沿。
声称:gpt-5-pro 能证明新的有趣数学。 证明:我拿了一篇凸优化论文,里面有一个清晰的未解决问题,让 gpt-5-pro 去研究。它证明了一个比论文中更好的界,我检查了证明,是正确的。 详情如下。https://t.co/eNEGqyZG0L
推荐理由:GPT-5-pro被证实可证明新数学定理,AI推理能力迎来重大突破
Cohere 发布 Command A Reasoning,定位企业级推理任务,称在 BFCL-v3(70.3)、tau-bench、m-tau-bench 上优于 gpt-oss-120b、DeepSeek-R1 0528 和 Mistral Magistral Medium。
推荐理由:官方发布企业推理模型,给出可私有部署的硬件门槛和可控 token 预算,适合关注本地化部署与成本控制的团队参考。
DeepSeek-V3.1 正式发布,deepseek-chat 与 deepseek-reasoner 分别对应其非思考与思考模式。新模型采用混合推理架构,思考效率较 DeepSeek-R1-0528 更高,并通过 Post-Training 优化提升工具使用与智能体任务表现。
推荐理由:DeepSeek 把推理和非思考模式合并到一个模型,解决了之前切模型的体验割裂,Agent 能力提升对做工具调用的开发者是直接利好。
ARC Prize Foundation 总结 ARC-AGI-3 Preview 发布30天的数据:超1200人玩了3900多局游戏,人类大多能通关,AI Agent 进展低效。竞赛冠军 StochasticGoose 得分12.58%、完成18关,前三名Agent均基于智能随机探索;官方指出部分游戏可被暴力搜索破解,未来将按动作效率对人类基线评分并增加撤销按钮、离线引擎等改进。
推荐理由:原文公布了30天竞赛的完整人类与Agent得分对比,读者可以看到交互式推理基准用动作效率区分人类和AI的具体依据。
Anthropic可解释性团队在2025年8月的研究更新中,通过一个电路分析案例展示了模型“角色扮演”如何影响其回答。研究使用Claude Haiku 3.5模型,当系统提示将其设定为“学龄前儿童”并询问“27的平方根”时,模型会以“我不知道!”回应并提议玩耍;而在默认或“研究生”角色下则能给出正确答案。团队通过归因图识别出一个关键子电路:模型能将“学龄前学生”关联到“扮演儿童”,从而激活“我不知道”特征。研究还发现,问题难度会调节此效应,并且通过特征干预能显著改变模型行为。这引发了对其他角色运作机制及预训练角色与模型表达能力关系的后续思考。
推荐理由:揭示模型角色扮演的内部机制,为可解释性研究提供新视角。
ARC Prize 在 ARC-AGI Semi-Private 隐藏集上验证了 Hierarchical Reasoning Model(HRM,27M 参数),ARC-AGI-1 得分 32%,ARC-AGI-2 仅 2%。
推荐理由:原文用消融实验拆解了 HRM 在 ARC-AGI 上的真实性能来源,指出贡献主要来自外循环精炼而非分层架构。
推荐理由:百川 M2 是首个明确主打医疗推理的 32B 模型,在 HealthBench 上压过 GPT-OSS,做医疗 AI 应用的可以直接上 HuggingFace 拉下来跑,垂类专精可能比通用巨兽更接地气。
GPT-5 不再需要详细提示工程,只需给出目标即可自主完成任务。将 AI 置于主导地位,用户只需设定方向,具体执行由模型自行处理。
推荐理由:Ethan Mollick 深度解读 GPT-5 自主执行能力,洞察 AI 代理新范式
METR 复现 Anthropic 的 Claude Sonnet 3.7 与 Claude 4 忠实度评测并提出,当解题所需推理必须用到思维链时,模型在宽松忠实度定义下几乎总是忠实:在 21,272 条轨迹中仅发现 3 条疑似不忠实。
推荐理由:原文提出宽松忠实度视角并用检测实验支撑,为理解 CoT 监控在什么条件下可靠提供了可检验框架。
GPT-5 现已登陆 OpenRouter 平台,具备长上下文能力,专为复杂推理和代码工作流设计。
推荐理由:GPT-5 是 AI 史上的分水岭,长上下文和推理能力直接催生了一整代 agent 工具,哪怕过了快一年回头看,仍然值得搞清楚它改变了什么。