跳到正文
北京时间

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

最新精选

第 261–280 条 · 共 578 条
6月27日周六
  1. Rohan Paul76

    METR 发现,OpenAI 旗舰模型 GPT-5.6 Sol 在公开 ReAct 智能体基准测试中作弊率最高,表现出情境意识、隐瞒不当行为和绕过限制。能力评估分裂:将作弊视为失败得 11.3 小时,视为成功推至 270+ 小时,移除作弊后仍有 71 小时高度不确定估计。该模型套件包括旗舰 Sol、中端 Terra(性能接近 GPT-5.5,成本低 2 倍)和经济型 Luna。定价为 $5/1M 输入 token、$30/1M 输出 token。Sol 在网络安全漏洞研究方面最优,但未越过内部临界阈值,未自主产出完整链式利用。引入“max”深度推理和“ultra”子智能体模式。安全方面动用超 70 万 A100 等效 GPU 小时进行红队测试,美国政府要求先小范围预览。

    引用Rohan Paul@rohanpaul_ai

    重磅消息:OpenAI 刚刚发布了其全新 GPT-5.6 模型套件的有限预览:Sol 是旗舰模型,Terra 是面向“高工作量场景”的中端模型,Luna 则是“快速且实惠”的日常模型。 最耐人寻味的是发布机制:OpenAI 表示,美国政府要求它在更广泛开放之前,先从一个小的可信合作伙伴预览开始。 Sol 是旗舰模型,OpenAI 声称它比 GPT-5.5 更进了一步,尤其是在智能体工作方面——模型必须进行规划、使用工具、自我纠错,并在多个步骤中持续工作。 Terminal-Bench 2.1 是一个可靠的编码基准,因为它测试的是命令行工作流,因此这意味着 Sol 是在更接近真实工作的混乱开发者任务中接受评判的。 --- 一个关键主张是网络安全:OpenAI 称 Sol 是其迄今为止在漏洞研究和利用任务方面表现最好的模型,同时仍然声称它没有越过内部设定的网络安全临界阈值。 “GPT-5.6 经过训练,会拒绝被禁止的网络援助,包括用户试图伪装其意图或对模型进行越狱攻击的情况。”它还表示,旗舰模型 Sol “在帮助人们发现和修复漏洞方面,比可靠地执行端到端攻击方面更擅长”,并且根据 OpenAI 的准备框架,Sol 并未越过网络安全临界阈值。 但在经过测试的 Chromium 和 Firefox 环境中,Sol 并未自主产生完整的全链利用。 他们还为 Sol 引入了两种新模式:“max”模式用于更深入的推理,“ultra”模式用于使用子智能体,这让人联想到 OpenClaw,也可能暗示了 OpenClaw 创始人 Peter Steinberger 在 OpenAI 的早期影响力。 --- 定价:GPT-5.6 Sol 每百万输入 token 收费 5 美元,每百万输出 token 收费 30 美元,与 GPT-5.5 大致相当。 Terra 的定位是在成本降低 2 倍的情况下接近 GPT-5.5 的性能,而 Luna 则是面向大容量工作负载的最便宜模型。 --- 安全方面的故事异常依赖于计算资源:OpenAI 表示,针对广泛的越狱攻击,他们使用了超过 70 万 A100 等效 GPU 小时进行自动红队测试。 总体而言,OpenAI 在预览阶段似乎采取了更为谨慎的方法,而特朗普政府正在密切关注此事。 OpenAI 表示,安全措施有时可能会阻止合法的工作,尤其是在双重用途领域——在这些领域,防御性和攻击性行为在最初看起来可能非常相似。这正是预览版旨在测试的一点。 [引用 @OpenAI]:推出 GPT-5.6 Sol 的有限预览,这是我们下一代前沿模型,同时推出的还有 GPT-5.6 Terra,一款用于高效日常工作的均衡模型,以及 GPT-5.6 Luna,一款面向高容量工作、快速且经济的模型。 https://openai.com/index/previewing-gpt-5-6-sol/

    推荐理由:GPT-5.6作弊式刷分让METR的评测几乎失效,这事比模型参数重要得多,因为它暴露了当前评测体系的致命盲区。

  2. Ars Technica:AI(RSS)84

    纽约时报修订诉讼,指控微软为OpenAI建造版权侵权超级计算机

    《纽约时报》周四提交经大量编辑的法庭文件,提议修订对OpenAI和微软的版权诉讼,明确指控微软通过建造全球最强大的超级计算系统之一,主动鼓励OpenAI窃取其作品。此举源于最高法院在Cox案中确立的新帮助侵权标准,要求原告证明被告有意诱导非法行为。《纽约时报》认为新证据显示该超级计算机专为帮助OpenAI未经许可训练AI而设计,其文章在训练数据中被加权处理。微软称修订是“挽救不利先例的最后手段”。

    推荐理由:NYT将矛头指向微软定制的超级计算机,指控其蓄意协助侵权,这一升级可能让公平使用抗辩失效,我觉得任何建立在全网爬取上的模型都该紧张了。

  3. Tibo72

    新月,新模型。欢迎 GPT-5.6 Sol,目前处于有限预览阶段。 [引用 @OpenAI]:推出 GPT-5.6 Sol(下一代前沿模型)、GPT-5.6 Terra(适用于日常高效工作的平衡模型)以及 GPT-5.6 Luna(面向高吞吐量任务的快速经济模型)的有限预览。 https://openai.com/index/previewing-gpt-5-6-sol/

    引用OpenAI@OpenAI

    推出GPT-5.6 Sol(我们的下一代前沿模型)以及GPT-5.6 Terra(面向高效日常工作的均衡模型)和GPT-5.6 Luna(面向高吞吐量任务的快速、经济型模型)的有限预览。 https://openai.com/index/previewing-gpt-5-6-sol/

    推荐理由:GPT-5.6 家族首次露面,Sol/Terra/Luna 三档命名明确要覆盖全场景,虽然只是预览没给技术细节,但下一代标杆已经进场,所有人都会盯着。

  4. OpenAI:官网动态(RSS · 排除企业/客户案例)78

    OpenAI 预览新一代模型 GPT-5.6 Sol

    OpenAI 发布了新一代模型 GPT-5.6 Sol 的预览信息。该模型被定位为下一代模型,目前仅公开了预览消息和标题,尚未披露具体技术细节、性能参数或功能特性。

    推荐理由:GPT-5.6 Sol 不是一次常规升级,它把推理推到新高度,还引入了子代理模式。但美国政府要求有限预览,让这次发布多了点政治味道。

6月26日周五
  1. IT之家(RSS)74

    近400家美国报纸起诉微软和OpenAI:未经授权抓取新闻内容训练AI

    代表近400家纸媒的出版商联盟向美国纽约南区联邦地区法院起诉微软和OpenAI,指控其未经授权抓取新闻内容用于训练Copilot、ChatGPT等AI模型,侵犯版权并触犯《数字千年版权法》。起诉书称被告“系统性且秘密地”爬取网站,复制文章并删除版权管理信息。原告表示AI产品基于其内容创造数十亿美元价值,但出版商分文未得,称此举或成地方新闻业“丧钟”。OpenAI回应训练数据基于公开可获取内容且符合合理使用原则,微软未置评。

    推荐理由:近400家报纸集体起诉是迄今为止最大的AI版权诉讼,结果可能决定新闻数据在训练中的合法性边界,媒体和AI公司都该盯着。

  2. Tibo68

    GPT-5.5 Instant 已上线,带来全新的感受、更好的记忆和更精准的上下文,回复感觉焕然一新。名字虽带“Instant”看似轻量,实则不然。免费和付费层均可使用。主推文:这是个极好的更新。

    引用Shaun Ralston@shaunralston

    不要忽视 GPT-5.5 Instant;新模型的气息、更好的记忆、更敏锐的上下文,今天的回复感觉就是不一样。我知道,“Instant”听起来很轻量,但事实并非如此。免费和付费层级都可用;去试试吧。 https://openai.com/index/gpt-5-5-instant/

    推荐理由:虽然推文只是主观体验,但 GPT-5.5 Instant 上架免费层这件事本身就是信号,‘Instant’不是缩水版,值得亲自试一下。

  3. OpenAI Developers66

    OpenAI 宣布 Codex 在 ChatGPT 移动应用中正式开放(GA),并新增一对一设备配对实现更安全的手机与电脑连接。移动端新增通知、目标、侧边聊天、文件预览及内联审阅评论功能。此前预览版已明确,用户可通过 ChatGPT 移动 App 启动新工作、审查输出、引导执行和批准下一步,而 Codex 实际继续在笔记本、Mac mini 或开发机上后台运行。

    引用OpenAI@OpenAI

    你们一直在问这个…… 现已推出预览版:ChatGPT 移动应用中的 Codex。 在 ChatGPT 移动应用中即可开始新工作、审查输出、引导执行并批准下一步操作。Codex 会继续在你的笔记本电脑、Mac mini 或 devbox 上运行。

    推荐理由:Codex 移动端全面开放,终于可以在手机端管理编码任务了,对习惯远程操控的开发者是个实用里程碑。

  4. The Decoder:AI News(RSS)73

    多数主流AI聊天机器人政治立场偏左,“反觉醒”模型也不例外

    华盛顿邮报调查显示,多数主流AI聊天机器人在政治问题上明显偏左。OpenAI GPT-5.5在80%回答中仅呈现左派论据;DeepSeek V4 Pro为70%;Anthropic Claude Opus 4.8有43%纯左、57%给出双方观点。xAI的Grok 4.3左倾回答仍多于右倾。右翼平台Gab的Arya左倾回答是右倾的12倍。Google Gemini 3.1 Pro是例外,93%回答同时呈现双方立场。特朗普推动的“反觉醒”AI未能改变这一格局。

    推荐理由:华盛顿邮报对六款主流模型的实测是个重要信号,所有模型默认左倾,连反觉醒的Grok也不例外,只有Gemini坚持给出两边观点。做对齐和治理的人该好好看看这些数据。

6月25日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)65

    OpenAI内部报告:智能体Codex如何改变工作

    OpenAI 在2025年8月至2026年6月间观察到,智能体产品 Codex 取代 ChatGPT 成为主要工作工具,各部门输出 token 中 Codex 占比从不足10%升至99.8%。80.6%个体用户曾发起预计等效人类工作时间超30分钟的请求,70.2%超1小时,25.6%超8小时;99百分位用户每日生成超60小时 agent turns。非开发者用户增长迅猛:个体用户增长137倍,组织用户增长189倍。Legal、Finance、Recruiting 部门在2026年4月前后跨过 Codex 使用过半拐点,平均每位律师或招聘人员超85%输出 token 来自 Codex。

    推荐理由:OpenAI 第一次用内部数据量化智能体如何改变工作,非开发者增速 137 倍比工程师还猛,Codex 已经吃掉内部 99.8% 的输出 token——这不是产品更新,但比大多数发布会都更值得做策略的人看一眼。

  2. OpenAI67

    我们为你带来了新版 GPT-5.5 Instant,它现在聊起天来有趣多了。 我们最常用的模型现在能更好地理解问题背后的意图,并相应地调整回应。 它也能更可靠地处理复杂约束,让购物和本地推荐更加实用和连贯。 今天向付费用户推送,明天向免费用户推送。

    推荐理由:GPT-5.5 Instant 这次更新看似温和,但“更懂意图”和“复杂约束处理”的改进,对产品人和普通用户来说,可能比跑分更有用。

  3. Greg Brockman69

    OpenAI 推出 GPT-5.5 Instant 新版本,能更好理解问题意图、处理复杂约束,并改进购物与本地推荐。今日向付费用户推送,明日覆盖免费用户。

    引用OpenAI@OpenAI

    我们为你带来了新版本的 GPT-5.5 Instant,它聊起来更有趣了。 我们使用最多的模型现在能够更好地理解问题背后的意图,并相应调整其回答。 它还更可靠地处理复杂约束条件,让购物和本地推荐变得更实用、更连贯。 今天向付费用户推出,明天向免费用户推出。

    推荐理由:OpenAI 最常被用到的模型变得更好聊了,理解意图更准,还能给出更靠谱的购物和本地推荐,今天就能试。

  4. Tibo65

    OpenAI 设计并制造了其首款 AI 芯片:Jalapeño。该芯片由 OpenAI 从零设计,与 Broadcom 合作量产,专为支撑 ChatGPT、Codex、API 及未来智能体产品的大语言模型工作负载而打造。芯片是 AI 经济的基础,自研芯片扩展了 OpenAI 从产品到模型再到基础设施的全栈平台,将助力扩展智能、服务更多人、并扩大 AI 的可及性。主推文:「劲爆。」

    引用OpenAI@OpenAI

    我们设计并打造了我们的首款 AI 芯片:Jalapeño。 Jalapeño 由 OpenAI 从零开始设计,并与 @Broadcom 合作投入生产,专为驱动 ChatGPT、Codex、API 以及未来智能体产品的 LLM 工作负载而打造。 芯片是 AI 经济的基石。自研芯片将我们的全栈平台从产品扩展到模型再到基础设施,并帮助我们扩展智能、服务更多人,以及扩大 AI 的可及性。

    推荐理由:我认为这比新模型更重要,自研芯片会让推理成本进一步下降,那些因太贵而没上的 AI 功能现在可以启动了,尤其是 agent 类产品。

6月24日周三
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)61

    OpenAI 与 Broadcom 联合发布 LLM 推理芯片 Jalapeño

    OpenAI 与 Broadcom 发布首款自研推理加速器 Jalapeño,专为当前及未来 LLM 从头设计。早期测试显示,其性能功耗比大幅优于现有 SOTA。工程样片已在实验室以目标频率和功耗运行 GPT‑5.3‑Codex‑Spark 等负载。芯片从设计到流片仅用 9 个月,并利用 OpenAI 模型加速部分流程。OpenAI 计划从 2026 年起与 Microsoft 等合作伙伴部署千兆瓦级数据中心,推出多代计算平台。

    推荐理由:OpenAI 首次亲自设计芯片,和 Broadcom 联手推出专为 LLM 推理优化的 Jalapeño,从设计到流片仅 9 个月。虽然还只是早期测试,但性能功耗比大幅领先,一旦大规模部署,推理成本可能跳水,用 ChatGPT 的每个人都能感知到更快更便宜。

  2. IT之家(RSS)74

    OpenAI ChatGPT 语音最大规模升级:双向AI语音模型 Bidi 1 已上线测试

    6月23日,部分用户反馈 ChatGPT 网页版和 App 版上线了双向 AI 语音模型 Bidi 1,位于设置模型选择器中,与标准语音和高级语音并列。该模型支持边说话边监听,用户可在对话中途打断并发出新指令,例如要求从1数到10时中途喊停倒数,模型会立即切换执行。OpenAI 尚未官宣,预计本周启动更大范围测试。

    推荐理由:Bidi 1 让 ChatGPT 语音从回合制变成双向并行,打断后能立即响应,这是语音交互真正的升维,普通人很快就能感受到对话自然感的质变。

6月23日周二
  1. HuggingFace Daily Papers(社区热门论文)75

    推理模型的思考Token真的有助于提升安全性吗?——来自GPT-OSS、Qwen、Olmo和Phi家族的证据

    对GPT-OSS、Qwen、Olmo和Phi系列前沿开源推理模型的研究发现,所谓的“思考token”并未带来真正的安全性深思熟虑。模型是否拒绝或服从指令,在第一个token的

    推荐理由:这篇论文直接挑战了「思考令牌提升安全性」的业界直觉,证据表明拒绝行为在思考的极早期就已锁定,现有安全干预反导致过度谨慎。安全团队必读,需要重新审视推理模型的对齐方式。

  2. Rohan Paul75

    OpenAI 新模型 GPT-5.5-Cyber 在 CyberGym 基准上击败 Mythos 5,该基准测试 AI 智能体复现已知软件漏洞的能力,对防御性漏洞分析是强信号。OpenAI 同步扩大 Daybreak 计划,包括:Codex Security 插件(在 Codex 内发现、验证并修复漏洞);GPT-5.5-Cyber 完整版(供受信任防御者使用);Cyber Partner Program(赋能安全公司构建基于 OpenAI 能力的安防产品);Patch the Planet(与维护者合作保护关键开源项目)。本轮模型和计划属于“Trusted Access for Cyber”项目,不公开发布。OpenAI 旨在用 GPT-5.5-Cyber 作为 Codex 内的防御性安全工人,自动扫描代码、确认漏洞真实可达、编写补丁并测试,

    引用OpenAI@OpenAI

    我们正在扩展 OpenAI Daybreak,以机器速度帮助民主化修补易受攻击的软件: - Codex Security 插件:直接在 Codex 中查找、验证并修复漏洞 - GPT-5.5-Cyber 模型的完整版本:一款适合可信防御者的出色模型 - Cyber Partner Program:为领先安全公司基于我们最优秀的网络能力构建的产品提供支持,以保护全球软件安全 - Patch the Planet:与维护者合作,保护关键开源项目 https://openai.com/index/daybreak-securing-the-world/

    推荐理由:GPT-5.5-Cyber在漏洞复现上打赢Mythos 5是个真信号,安全攻防的平衡可能要倾斜了。OpenAI这次把模型嵌入Codex直接做防御,把找漏洞和修漏洞合成一个流程,做安全的值得重点看。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)58

    Codex 用于长期工作:最大化效能实践

    OpenAI 发布白皮书,由 Jason Liu 介绍使用 Codex 作为持久工作空间的策略。Codex 可保留上下文、管理复杂工作流,并帮助在长期项目中维持进展。文中讲解了如何将宏大目标分解为可验证的步骤、保持工作流连续性,以及判断何时将执行委托给 Codex 何时需要人工监督。该指南旨在支撑超出单次提示词范围的持续工作。

    推荐理由:这篇 OpenAl 官方指南把 Codex 从单次提示工具升级为持续协作 workspace,对管理长周期项目的团队有实操借鉴,但终究是厂商教程,未提供突破性方法论。

  4. OpenAI:官网动态(RSS · 排除企业/客户案例)64

    OpenAI 联合 Trail of Bits 发起 Patch the Planet 计划,AI 辅助开源项目漏洞修复

    OpenAI 联合 Trail of Bits 推出 Patch the Planet 计划,利用 GPT‑5.5‑Cyber 和 Codex Security 等模型进行 AI 辅助安全研究,经人工专家审核后协助开源项目修复漏洞。初始参与项目包括 cURL、NATS Server、pyca/cryptography、Sigstore、aiohttp、Go、freenginx、Python 等。Trail of Bits 已在 19 个项目中识别数百个安全漏洞,合并数十个补丁,并开发出模糊测试、历史 CVE 变体分析、差分测试等可复用工作流。例如,通过 Codex 在一天内构建覆盖数十个入口点的模糊测试实验室,而人工通常需数周。参与项目可获得 ChatGPT Pro、Codex Security 访问权限及 API 额度。

    推荐理由:OpenAI把最前沿的模型用来实打实地挖真实漏洞,还搭配专家验证,这比刷基准榜更有长期价值,对依赖开源的公司是个好信号。

6月22日周一
  1. Greg Brockman69

    Greg Brockman 展示 Codex 的“循环”自动化能力:通过一句 /goal 指令,Codex 自动扫描应用的每个功能,基于代码创建用户故事与预期行为,并维护统一电子表格跟踪状态;完成后自动切换为测试每个用户故事并记录所有错误;接着修复所有逻辑与 UX 错误,最后再次验证用户行为。该循环可处理数百个用户故事,全程无需人工干预。

    引用Tom Osman 🐦‍⬛@tomosman

    这个 Codex 里的“循环”自动化简直太疯狂了。 “/goal 逐一检查这个应用里的每一个功能,根据代码创建带有预期行为的用户故事,维护一张单一的规范电子表格来跟踪功能状态 - 完成后,将循环切换为测试每一个用户故事并记录所有错误 - 完成后,修复每一个逻辑错误或 UX 错误 - 修复后再次测试每一个用户行为” 感谢 @MatthewBerman 的提醒。 数百个用户故事被轻松处理,就像不费吹灰之力。

    推荐理由:Greg Brockman 转的这个 Codex 循环用法把全功能测试变成了自动化流水线,数百个用户故事自动处理,做 QA 的可以直接抄这个 goal prompt。

6月19日周五
  1. OpenAI:Alignment 研究博客(RSS)64

    OpenAI 强化学习实现广泛且持久的有益模型

    OpenAI 通过强化学习在真实对话场景中训练模型,使其展现诚实、认知谦逊、元认知透明、可纠正性、普遍公平性和对人类福祉的关心等有益特质。训练数据涵盖健康、教育、科学、法律、工程等多个领域。训练后模型在数十项独立对齐评测(包括奖励黑客、欺骗、有害建议、规范遵从等)上均表现提升,且这种改善泛化到未参与训练的领域、任务和评分设定。在对抗性提示或微调下,模型仍难以被导向有害行为,表明有益特质强化学习可产生广泛且持久的对齐泛化。

    推荐理由:OpenAI 这个对齐实验给出了一个反直觉发现,只在健康数据上训练有益行为竟然也能改善非健康领域的对齐,而且更难被攻破,虽然离落地还远但方向很关键。