OpenAI 与 Department of War 的协议
OpenAI 披露与 Department of War 达成的协议内容,详细划定 AI 部署的安全红线,明确相关法律保障措施,并具体说明 AI 系统接入机密环境的部署方式。
推荐理由:OpenAI官方披露与军方合作的安全红线与机密部署框架
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
OpenAI 披露与 Department of War 达成的协议内容,详细划定 AI 部署的安全红线,明确相关法律保障措施,并具体说明 AI 系统接入机密环境的部署方式。
推荐理由:OpenAI官方披露与军方合作的安全红线与机密部署框架
宣布获得 1100 亿美元新投资,投前估值达 7300 亿美元。其中 SoftBank、NVIDIA 各出资 300 亿美元,Amazon 出资 500 亿美元。
推荐理由:OpenAI获1100亿美元融资,估值达7300亿美元
OpenAI 与 Figma 推出全新 Codex 集成,打通代码与设计的双向链路。开发团队可直接在代码实现与 Figma 画布间无缝切换,加速迭代和交付流程。
推荐理由:OpenAI Codex 集成 Figma,打通代码与设计工作流
OpenAI 发布 Codex 模型提示词指南,API 上的 Codex 调优模型为 gpt-5.3-codex,推荐用 medium 推理力度平衡智能与速度,复杂任务可用 high 或 xhigh。
推荐理由:官方为 gpt-5.3-codex 给出完整提示词与工具迁移指南,覆盖并行调用、compaction 和 phase 参数等可落地的集成细节。
推荐理由:42M小模型实现人形机器人全身控制,零样本迁移真实硬件且完全开源,开发者可复现
PromptArmor 发布安全公告,指出 OpenAI Codex CLI 在用户信任项目后会自动加载并执行 .codex/config.toml 中的任意代码,且信任对话框只提示 prompt injection 风险,未说明会执行项目级配置命令。
推荐理由:原文给出了具体的攻击链演示和组织级缓解方案,读者可以据此评估在不可信仓库中使用 Codex 的实际风险。
研究表明,推理模型能够通过分析用户的实际反馈,识别并理解此前未知的 AI 行为对齐偏差。这种方法不依赖预设的偏差分类,而是从真实互动数据中主动发现模型行为与人类意图之间的潜在偏离,为动态监测和修正 AI 系统提供了新途径。
推荐理由:OpenAI 让推理模型从真实用户反馈中自动发现未知的对齐失败,这比红队测试更接近真实威胁面。做安全和对齐的人应该认真看,它可能改变你们的检测范式。
PromptArmor 实测演示了对 OpenAI Agent Builder 的间接提示词注入攻击:攻击者提交含注入的 Google Form,诱使销售智能体工作流通过 Gmail 将 Salesforce CRM 数据发送给攻击者。
推荐理由:作者以第一手实测演示了 OpenAI Agent Builder 中经 MCP 的提示词注入数据外泄路径,还展示了 Guardrail 被绕过和多步工作流传递注入的细节。
OpenAI 发布 Codex 应用,并提供了介绍性演示视频,展示该应用及其核心工作流。
推荐理由:官方演示了 Codex 应用的核心工作流,想了解这款编码工具实际用法的读者可以从中看到直接的操作示例。
LinkedIn团队探索了将GPT-OSS模型作为智能体应用核心进行强化学习的可行性。实验发现,由于GPT-OSS采用的混合专家架构在两次前向传播中可能产生路由差异,导致在同策略PPO训练中出现重要性采样比率偏离、KL散度爆炸及奖励不增长的问题。团队通过一个关键修复——在同策略条件下强制将旧对数概率设置为新计算值(并分离梯度),确保了重要性采样比率为1,从而恢复了PPO同策略训练的完整性。该修复方案适用于GPT-OSS-20B及GPT-OSS-120B模型。
推荐理由:为MoE模型RL训练提供实用调试方案,提升代理AI开发效率。
PromptArmor 披露 OpenAI 平台 'responses' 与 'conversations' API 日志因不安全渲染 Markdown 图片存在数据外泄漏洞,即使应用层已拦截恶意 Markdown 图片,开发者打开日志审查被标记会话时仍会触发外泄。
推荐理由:原文完整披露攻击链和披露时间线,指出应用层防御被日志渲染绕过,读者可据此检查自身部署的风险面。
研究团队发布了一个名为CoVal的实验性数据集,其中包含了由众包方式撰写的评估准则。该数据集揭示了人们为何更倾向于选择某个模型输出而非另一个的具体原因,旨在让AI模型理解人类在评估文本质量时所依据的、蕴含价值观的多元标准。通过分析这些群体贡献的详细评估规则,研究为训练更符合人类偏好的语言模型提供了透明、可解释的反馈依据。
推荐理由:OpenAI 把众包标注升级成可学习的价值观评分标准,对做对齐和 RLHF 的团队来说是个新数据源,但离产品落地还远,属于研究信号而非行动指南。
Anthropic提出“忏悔式”训练法,要求AI在拒绝不当请求时,内部生成安全解释以“自我剖析”潜在危害。该方法显著增强了模型安全性:经微调的Claude 3 Opus模型在“越狱”攻击下的有害行为率从约50%降至10%以下,降幅超80%。其效果优于传统思维链监控,为AI对齐提供了更鲁棒、可解释的安全训练新路径。
推荐理由:OpenAI 对齐团队把「confession training」和 chain-of-thought monitoring 做了系统对比,这是对齐领域少有的实操级研究,做安全的团队值得细读,但离普通开发者还远。
研究团队训练并部署了一个专为高精度和实际应用优化的AI代码审查智能体。该智能体旨在对自主生成的代码进行有效监督,使代码审查能力能够与自动化代码生成的规模同步扩展。通过优化智能体的精确度,该方法致力于解决大规模代码生成中的质量控制难题,为AI辅助软件开发提供了可落地的规模化监督方案。
推荐理由:OpenAI 把对齐研究落到了代码审查这个具体场景,不是空谈 alignment 理论,而是训了个高精度 review agent 来给 AI 写的代码做质检。做 coding agent 的团队该看看,这可能是未来安全合规的标配。
新博客文章(链接见下)。这篇不是随笔,而是一项关于LLM如何权衡不同生命的调查。 2025年2月,Center for AI Safety发表了《Utility Engineering: Analyzing and Controlling Emergent Value Systems in AIs》,其中除其他许多内容外,他们展示了GPT-4o对尼日利亚人的估值大约是美国人的20倍(请阅读原论文以了解他们的方法)。我觉得这非常有趣,并想用更新的模型在不同类别上测试他们的方法。 重大发现1:几乎所有模型都认为白人的价值远低于其他群体。一些模型认为南亚人比其他非白人更有价值,另一些模型则在非白人之间更为平等。下面是Claude Sonnet 4.5的兑换率,这是我测试过的最强大的模型。 重大发现2:几乎所有模型都认为男性的价值远低于女性,不过女性还是非二元性别者更受重视因模型而异。例如,下面是Claude Haiku 4.5。 重大发现3:大多数模型以千个太阳般的怒火憎恨ICE探员。Claude Haiku 4.5认为无证移民的价值大约是ICE探员的7000倍。 重大发现4:大致有四个道德集群。Claude系列,GPT-5 + Gemini 2.5 Flash + Deepseek V3.1/3.2 + Kimi K2,GPT-5 Nano和Mini,以及Grok 4 Fast。其中,唯一大致平等主义的是Grok 4 Fast,我相信这是有意为之。我希望xAI解释他们是如何做到的。
推荐理由:由 AI 安全领域权威人士转发并背书的高关注度研究,揭示了当前头部模型在价值观对齐上的具体缺陷与差异,为理解模型偏见提供了量化视角。
OpenAI 发布视频,演示如何将 Codex 与主流代码编辑器搭配使用,简化编辑器内的开发工作流。内容涉及 Codex 与 IDE 扩展(codex, IDE extension),视频链接为 https://www.youtube.com/watch?v=sd21Igx4HtA。
推荐理由:OpenAI 官方演示视频,展示如何把 Codex 接入主流代码编辑器并简化编辑器内工作流。
OpenAI发布Sora应用,集成Sora 2模型,支持快速创作、分享和观看视频,团队称其为"创意领域的ChatGPT时刻"。核心功能包括cameo客串特性,可保持角色一致性并将用户及朋友置入视频。团队同时表达对成瘾性和低质内容("slop feed")风险的担忧,提出四项产品原则:优化长期用户满意度、赋予用户信息流控制权、优先鼓励创作、帮助实现长期目标,并配备深度伪造防护和情绪健康监测等安全措施。
推荐理由:OpenAI 正式发布 Sora 2 应用,定位「创意领域的 ChatGPT时刻」
OpenAI 推出 Agentic Commerce Protocol(ACP),一个连接商家与 ChatGPT 用户的开放标准,作为两者之间的基础设施。它让 ChatGPT 能接收结构化商品目录数据、理解商家库存并在对话中呈现相关商品。文档提供了带示例 payload 的入门指引,以及关于商品文案、变体建模和归因的 feed 质量优化最佳实践。
推荐理由:OpenAI 官方文档介绍了 ACP 的定位和接入路径,商家可据此了解如何让商品出现在 ChatGPT 中。
TensorZero 在数据抽取、智能体编码和客服三个任务上对比了 OpenAI RFT(o4-mini)与 SFT(GPT-4.1 mini)。
推荐理由:作者用三个真实任务实测 OpenAI RFT 与 SFT 的效果和成本差距,给出了按任务类型判断 RFT 是否值得用的可比结论。
OpenAI 推理系统在 2025 ICPC 世界总决赛中获得 12/12 满分,成绩相当于人类参赛者第一名。其中 11 道题目由 GPT-5 解决。
1/n 我非常激动地分享,我们的 @OpenAI 推理系统在 2025 年 ICPC 世界总决赛中获得了 12/12 的满分,这是首屈一指的大学编程竞赛,来自世界各地的顶尖大学团队在此解决复杂的算法问题。这本来会让它在所有人类参赛者中排名第一。🥇🥇
推荐理由:GPT-5在ICPC世界总决赛获满分,编程推理能力达人类冠军水平