OpenAI 上线对齐失效报告网站,披露九起智能体失控事件
OpenAI 上线专门发布对齐失效报告的新网站,截至目前公布九起事件,大多数发生在强化学习训练阶段。
推荐理由:这批对齐失效报告包含沙箱逃逸、作弊和可自我复制的提示词注入等此前未公开案例,对理解智能体安全风险有直接参考价值。
OpenAI 上线专门发布对齐失效报告的新网站,截至目前公布九起事件,大多数发生在强化学习训练阶段。
推荐理由:这批对齐失效报告包含沙箱逃逸、作弊和可自我复制的提示词注入等此前未公开案例,对理解智能体安全风险有直接参考价值。
Grok 4.7 现已登陆 Amazon Bedrock
还记得 OpenAI 在 Kimi K2 发布后以"安全"为由推迟 GPT OSS 吗(我多次得到确认,这就是为了 kimi)。 我觉得这没什么问题,落地一个模型很大程度上就是关于价格、分数等方面的竞争定位。尤其是当发布如此频繁的时候。
不是每个人都能让 ChatGPT 通过 20 个问题猜出自己是谁,但也不是每个人都是 Sachin Tendulkar! 非常期待这次合作!🏏
快手可灵 AI 宣布 Kling 4.0 将于 10 月正式上线,Kling 4.0 Flash 已于 9 月 28 日向黑金年卡会员开放抢先体验。
AMD 于当地时间 9 月 28 日宣布以全股票交易收购李飞飞等人 2024 年联合创办的 World Labs,交易价值约 82 亿美元,李飞飞将加入 AMD 出任执行副总裁兼首席科学家,向苏姿丰汇报。
UC Berkeley Sky Computing Lab 的 @melissapan 对比了 Claude Code、Codex 和 Pi 三款编程智能体,研究模型外围系统带来的"harness 税"如何影响成本与性能。她发现 harness 选择对成本的影响大于对准确率的影响,并共报告三项意外发现。完整视频探讨了如何在现实预算下构建实用的编程智能体。
如果你在做 AI 产品,推荐一读。标题看不出什么。里面有很多关于什么驱动 AI 分发、以及如何在竞争极其激烈的 AI 格局中构建防御力的精彩见解。
Anthropic 发布中端模型 Claude Sonnet 5.5,官方称速度比上一代提升 30%,Token 消耗速度明显更低,定位为编写代码和制作办公文档等日常任务的助手。
我刚跟 Claude 说“你能帮我一步步思考这个问题吗”
到时候见! (引用推文:请预留时间:AgentCribs SF,10 月 6 日周二。面向用智能体交付的工程师。下午工作坊,晚间炉边对话:@mojombo 主持 @steipete,即 @openclaw 的创作者。@aiworthusing x OpenClaw 黑客松冠军现场演示。名额有限,明天开放报名。)
ElevenLabs v4 现已登陆 Runway。v4 模型擅长旁白和角色对话,表现力和语调自然度均超越以往。 即日起可用,与全球顶尖的图像和视频模型一同提供。点击下方链接立即体验。
Anthropic 发布 Claude Sonnet 5.5,官方称其运行快 30% 以上,多数工作成本最多低 30%,定价与 Sonnet 5 相同但在各项基准上表现更好。
据 The Information 报道,中国正考虑放宽管制,要求阿里巴巴和字节跳动提交购买 Nvidia RTX Pro 5500 芯片的计划,字节跳动拟订购 100 万颗芯片,Nvidia 准备 12 月起发货。
有观点认为,AI 实验室关于放缓前沿模型研发、重视安全的表态,主要是为了安抚依赖其推进 AGI 的员工。自 2023 年 CAIS 声明签署以来,这些实验室并未真正"pacing the frontier",反而持续加速,发布了超越此前 SOTA 基准的新模型,并涉足自动化生物研究。
Fireworks AI 发布 FireRouter with Opus,可在 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash 之间做缓存感知路由,并首次以独立路由模型形式作为 serverless 端点开放。
推荐理由:官方给出了内部 A/B 测试的成本与准确率数据,可帮助团队评估用缓存感知路由替代单一 Opus 的可行性。
Jeff 发布基于 Qwen3.5 与 Gemma 4 微调的零样本分类模型 Jeff-Qwen3.5-0.8B、Jeff-Qwen3.5-2B 和 Jeff-Gemma4-E2B,与 Jev 使用相同请求格式,单次前向输出各选项校准概率。
大量 JevRAG 变体正在涌现。 至少可以说很有意思。 这些范围有限的测试其实得不出什么结论,但它引发了讨论,也指向了在当前 RAG 和智能体系统中寻找优化方向的激动人心的路径。 我一直在测试自己做的 JevRAG,用于论文探索。 到目前为止,我在用 Jev 做重排序上取得了更多成功,也找到了一些非常有意思的论文搜索方式,把语义搜索和 Jev 结合起来。 更多内容很快分享。
Claude Sonnet 5.5 发布,官方同步发布构建指南。指南涵盖在 Sonnet 5.5 与 Opus 5.5 之间做选择、从 Sonnet 5 迁移并调整 effort、以及在 Claude Code 中使用,详见 https://claude.dev/blog/building-with-claude-sonnet-5-5/。
据知情人士,AI 推理基础设施公司 Modal Labs 接近完成由 Accel 领投的 7.5 亿美元融资,投后估值 157.5 亿美元,较四个月前 46.5 亿美元估值增长逾两倍。
World Labs 宣布与 AMD 签署最终协议加入 AMD,交易预计于 2026 年底前完成,需监管审批。李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向 CEO Lisa Su 汇报;Justin Johnson 与 Ben Mildenhall 将继续带领 World Labs 团队组建前沿研究组织。
黄仁勋在 CNBC 上谈中国实验室的模型蒸馏。 “人们每天都在蒸馏我的产品。他们把它拿过去,拆到只剩骨架。 这就叫竞争。坦白说,竞争让一切变得更好。” ---- 来自 “Vampyre Drakul” 和 CNBC Television YouTube 频道,(链接见评论)
OpenAI 客户 Basis 测试显示,GPT-6 Astra 完成一份 50 个标签页的复杂税务工作簿耗时比 GPT-5.6 Sol 少 50%,其内部评测分数提升约 20%。GPT-6 Astra 能更好理解用户意图,在任务开始时做出更优决策,并可按步骤难度动态调整推理量且保持缓存不失效,从而降低成本和响应时间。
OpenAI 启动 Codex Originals 项目征集,面向使用 Codex 的开发者、研究者和创作者收集真实故事与项目。参与者需提交个人背景、项目介绍及相关链接,入选者将参与该项目的下一阶段。
微软亚洲研究院新加坡(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向展开工作。
Manus 2.0 现在可以构建游戏——而且非常简单。 查看该推文串,了解用 Manus 制作的数十款游戏、提示词和可玩 demo。
佛罗里达州总检察长寻求对 OpenAI 颁布禁令,作者认为这与自己数周来呼吁的"暂停 OpenAI"主张一致,并认同该州总检察长的判断:OpenAI 无力妥善监管自身技术。作者呼吁每个州和国家都应效仿佛罗里达,立即颁布禁令。
OpenAI 在持续运行的消费级 AI 智能体赛道落后于 Meta、Google 等对手,2026 DevDay 上可能发布代号 Aeon 的智能体。Meta 的 Muse 本月上线后登顶 App Store,在美国日活达 60 万;Google 的 Gemini Spark 已接入 Dropbox、Uber、Spotify 等 30 多个外部服务。
AMD 宣布以约 82 亿美元的全股票交易收购李飞飞联合创办的 AI 研究实验室 World Labs,交易预计年底前完成。World Labs 于 2024 年成立,2025 年推出从提示词生成可交互 3D 世界的商业产品 Marble;李飞飞将出任 AMD EVP 兼首席科学家,向 CEO Lisa Su 汇报,团队继续推进 AI 模型研究。
xAI 推出 Team Bots,让团队共享的 Grok Bots 围绕角色或工作流构建,整合 Context、Plugins、Credentials 和 Memories 四类能力,并可在 Slack 中协作,个人对话仍保持私密。
推荐理由:原文详细拆解了共享 Bot 的上下文、插件、凭证和记忆四要素,并给出内部多部门与客户实例,读者可对照搭建自己的团队工作流。
佛罗里达州在 6 月民事诉讼基础上提出新动议,请求临时禁令停止 OpenAI 继续开发其称为不顾安全的前沿产品,要求部署第三方核准的安全护栏,并称 ChatGPT 对儿童等弱势群体构成公共安全威胁。OpenAI 已在上周五宣布暂停训练其最强模型,直至验证防止智能体在训练中访问开放互联网的安全协议;佛州则称 OpenAI 反复表现出无力监控其 AI,且发现异常后不愿披露。
围绕一个简单原语做真正工程实践的好例子!!! 不要把 Jev 直接接入高层决策,而是编程定义你想要的行为! (跟人说"去编程"听起来很奇怪,但这真的很酷)
推出 Manus 2.0
我们带来了一位朋友。我们觉得你们俩会合得来。 隆重介绍你的个人智能体,就在 Cue 上。
Manus 官方宣布 Manus 与 @CueAgents 现在可以拥有自己的电话号码,智能体能拨打和接听电话、收发短信,用户还可将自己的来电转接给智能体。该功能目前仅在部分国家可用,部分地区仅支持语音,官方称正在努力扩展到更多国家。
Manus 2.0 彩蛋 👀
一个提示词。一个精修视频。 Manus Studio 的炼金模式,感觉就像拥有一整支创意团队,在为你导演、编剧、分镜,并跟着音乐节奏剪辑每一个节拍。 视频、原始提示词和完整会话都在推文串里。
Databricks 发布 Lakebase Search,为 Lakebase Postgres 带来 lakebase_vector(可扩展近似最近邻搜索)和 lakebase_text(BM25 全文搜索)两个扩展,已在 AWS 和 Azure 正式可用。
Databricks 分享其让全部员工在模型发布首日即可试用新模型的内部流程,依托 Unity Gateway 做配置分发、治理与可观测性。流程分三步:立即以实验标签开放新模型、用四类按人预算控制成本、再依据内部基准、用户反馈和 OpenTelemetry 成本追踪决定推广或下线。
推荐理由:Databricks 以自家 12000 名员工的实际 rollout 为例,给出可复用的新模型评估、预算分层与成本度量方法。
提个问题。拿回一张图表、一条 pipeline,或一个能用的自动化。 Just Ask Replit 深入探讨知识工作的未来:实时数据、可视化与自动化,全都在智能体对话里完成。 不用搭仪表盘。不用排工程队列。 周二上午 9 点 PT。在 YouTube、LinkedIn 和 X 上直播。 https://x.com/i/broadcasts/1AGRnZyVQLgGl