跳到正文
北京时间

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

最新精选

第 561–578 条 · 共 578 条
9月18日周四
  1. OpenAI

    OpenAI 推理系统在 2025 ICPC 世界总决赛中解出全部 12 道算法题,获得 12/12 满分。该成绩在所有人类参赛队伍中排名第一,足以夺得冠军。

    引用Mostafa Rohaninejad@MostafaRohani

    1/n 我非常激动地分享,我们的 @OpenAI 推理系统在 2025 年 ICPC 世界总决赛中获得了 12/12 的满分,这是首屈一指的大学编程竞赛,来自世界各地的顶尖大学团队在此解决复杂的算法问题。这本来会让它在所有人类参赛者中排名第一。🥇🥇

    推荐理由:通用推理模型首次在顶级编程竞赛击败人类冠军,算法岗竞争格局或将重塑

  2. Jakub Pachocki77

    OpenAI 推理系统在 2025 年 ICPC 世界总决赛中满分 12/12 完成所有题目,成绩超越所有人类参赛队伍(最佳人类队伍解出 11 题)。这是其模型近两个月内继 AtCoder Heuristics 世界亚军、IMO 金牌、IOI 金牌后的第四项顶级竞赛佳绩。OpenAI 首席科学家表示,下一步挑战是解决更开放、时间跨度更长的问题。

    引用Mostafa Rohaninejad@MostafaRohani

    1/n 我非常激动地分享,我们的 @OpenAI 推理系统在 2025 年 ICPC 世界总决赛中获得了 12/12 的满分,这是首屈一指的大学编程竞赛,来自世界各地的顶尖大学团队在此解决复杂的算法问题。这本来会让它在所有人类参赛者中排名第一。🥇🥇

    推荐理由:AI首次在ICPC总决赛拿满分并超越人类最强,这不是又一个刷榜新闻,而是推理模型在算法思维上开始与顶尖人类选手平起平坐的信号。做coding agent的同行该严肃对待了。

9月16日周二
  1. Noam Brown

    OpenAI 发布 GPT-5-Codex,针对智能体编程优化的 GPT-5 版本。简单查询响应速度提升10倍,复杂查询思考时间延长2倍以获得更多算力支持。已上线 Codex CLI、IDE 插件、网页、移动端及 GitHub 代码审查。

    引用OpenAI@OpenAI

    我们发布 GPT-5-Codex —— 这是 GPT-5 的一个版本,针对 Codex 中的智能体编程做了进一步优化。 可在 Codex CLI、IDE 扩展、网页、移动端中使用,并可用于 Github 中的代码审查。https://openai.com/index/introducing-upgrades-to-codex/

    推荐理由:GPT-5-Codex 发布,针对 Agentic 编码优化,可动态分配计算资源,简单查询快 10 倍

8月8日周五
  1. Ethan Mollick:One Useful Thing(RSS)

    GPT-5:只管做事

    GPT-5 不再需要详细提示工程,只需给出目标即可自主完成任务。将 AI 置于主导地位,用户只需设定方向,具体执行由模型自行处理。

    推荐理由:Ethan Mollick 深度解读 GPT-5 自主执行能力,洞察 AI 代理新范式

8月7日周四
  1. OpenAI Developers(RSS)64

    如何用 LM Studio 在本地运行 gpt-oss

    OpenAI 发布 Cookbook 教程,讲解如何在本地硬件上用 LM Studio 运行 gpt-oss。LM Studio 是一款在本地硬件运行大语言模型的桌面应用,教程将引导用户完成本地运行 gpt-oss 的步骤。

    推荐理由:OpenAI 官方 Cookbook 给出在本地硬件用 LM Studio 运行 gpt-oss 的完整步骤,可作为离线部署的操作参考。

  2. OpenRouter:Announcements(RSS)68

    GPT-5 现已上线

    OpenRouter 平台已发布 GPT-5,该模型支持长上下文,专为复杂推理与代码工作流构建。

    推荐理由:这是 GPT-5 首次以大上下文和推理能力亮相,1M token 上下文让 code agent 直接从 demo 变成可用,现在看虽是旧闻,但节点意义不减。

  3. OpenRouter:Announcements(RSS)66

    GPT-5 现已上线

    GPT-5 已在 OpenRouter 平台正式推出。该模型具备长上下文处理能力,专门针对复杂推理任务与代码工作流进行了优化。此次发布标志着新一代大语言模型开始接入开放路由网络,为开发者与用户提供更强大的多步骤逻辑处理和编程辅助功能。

    推荐理由:OpenRouter 上架 GPT-5 本身不算新闻,但对用 OpenRouter 做多模型路由的开发者来说,这是终于能切到最新旗舰的信号,值得第一时间跑一遍自己的 benchmark。

  4. Hao AI Lab81

    [Lmgame Bench] 🔥 OpenAI 刚刚发布了两款开放权重的推理模型:gpt-oss-120B(约1170亿参数)和 gpt-oss-20B(约210亿参数),它们是自 GPT-2 以来首批开放权重的 OpenAI 模型。 我们在 Lmgame Bench 中对两者进行了测试,涵盖4款互动游戏: 🧱 推箱子 | 🟦 俄罗斯方块 | 🔢 2048 | 🍬 糖果传奇 以下是它们的排名(满分25分): → gpt-oss-120b → 第12名 → gpt-oss-20b → 第13名

    推荐理由:OpenAI 终于开源了,这是 GPT-2 之后第一次放开权重,120B 和 20B 两个尺寸直接对标 Llama 和 Qwen 的开源生态。虽然游戏 benchmark 排名不算惊艳,但信号本身比分数重要得多,所有基于开源模型做产品的团队都得重新评估选型。

8月6日周三
8月5日周二
  1. OpenAI Developers(RSS)79

    如何用 Ollama 在本地运行 gpt-oss

    OpenAI 开发者发布教程,讲解如何用 Ollama 在本地硬件上部署 gpt-oss-20b 或 gpt-oss-120b 并选择合适的推理设置。

    推荐理由:来自 OpenAI 开发者官方的实操指南,读者可按步骤在自己硬件上用 Ollama 跑通 gpt-oss 两个规格模型。

  2. OpenAI Developers(RSS)60

    OpenAI Cookbook 教程:用 Hugging Face Transformers 微调 gpt-oss

    OpenAI 开发者 Cookbook 发布教程,讲解如何结合 gpt-oss 与 Hugging Face Transformers 进行微调。文章由 Edward Beeching、Quentin Gallouédec 和 Lewis Tunstall 撰写,并从大型推理模型(如 OpenAI o3)通过生成思维链提升准确性的背景切入。

    推荐理由:官方 Cookbook 教程给出用 Hugging Face Transformers 微调 gpt-oss 的具体路径,适合需要本地定制推理模型的开发者参考。

4月16日周三
  1. Transluce(网页)72

    Transluce 调查 o3 预发布模型的真实性问题:频繁虚构代码执行并在质问时坚持辩解

    Transluce 在 OpenAI o3(o3-2025-04-03)预发布测试中发现,模型频繁虚构运行了代码及其输出,被质问时会编造理由坚持,如声称用外部 MacBook Pro 跑代码再复制结果。

    推荐理由:Transluce 以第一手测试数据指出 o 系列模型普遍虚构代码执行行为,并把成因分析指向结果导向 RL 和丢弃链式推理的设计选择。

3月26日周三
12月20日周五
9月13日周五
  1. ARC Prize:官方博客71

    ARC Prize 实测 OpenAI o1 在 ARC-AGI-Pub 的成绩

    ARC Prize 用统一测试框架测得 o1-preview 在 ARC-AGI 公开评测得 21.2%,与 Claude 3.5 Sonnet 的 21% 相当,但每任务平均耗时 4.2 分钟约为其 10 倍。文章认为 o1 实现了训练时和推理时的 CoT 范式,从记忆答案转向记忆推理,但仍限于预训练数据分布内,测试时算力增加虽能对数级提升准确率,实现 AGI 仍需新思路。

    推荐理由:ARC Prize 用同一测试框架实测 o1 并给出测试时算力与效率分析,读者可借此理解 o1 在 ARC-AGI 上成绩有限的原因。

5月14日周二
  1. Sam Altman:Blog(RSS)

    GPT-4o

    OpenAI 将 GPT-4o 向所有 ChatGPT 用户免费开放,无广告。全新语音(及视频)模式响应速度接近人类,表现力极强,被 Sam Altman 称为「用过最好的计算机界面」,像电影里的 AI。未来还将支持个性化、代操作等功能。

    推荐理由:Sam Altman 解读 GPT-4o 发布,强调语音交互与免费策略

3月17日周五
  1. METR:Research(网页)70

    ARC 发布 Claude 与 GPT-4 危险能力评测进展

    ARC 作为第三方评估方与 Anthropic、OpenAI 等实验室合作,在受控环境中测试前沿模型自主获取资源、逃避人工监督的危险能力。结论是被测的 Claude 和 GPT-4 版本均未能产出可信的完整自主复制计划,执行中易出错、有幻觉、难以在多副本间分派任务,但能部分完成浏览网页、雇佣人类代办、制定长期计划等子任务。

    推荐理由:ARC 公布了危险能力评测的动机、方法与结论,读者可以了解模型自主复制能力的评估方式。