隆重推出 Claude Sonnet 5.5,Claude 5.5 家族中的第二个模型。 相比 Sonnet 5 有明显升级,运行速度提升超过 30%,且大多数工作的成本最多降低 30%。
推荐理由:原文给出 Sonnet 5.5 相对 Sonnet 5 的速度与成本变化,作者还结合工作流场景说明降价对 token 成本顾虑的意义。
行业动态、实用产品与开源项目,一站看懂。
约 10 分钟,读懂本期重点。
隆重推出 Claude Sonnet 5.5,Claude 5.5 家族中的第二个模型。 相比 Sonnet 5 有明显升级,运行速度提升超过 30%,且大多数工作的成本最多降低 30%。
推荐理由:原文给出 Sonnet 5.5 相对 Sonnet 5 的速度与成本变化,作者还结合工作流场景说明降价对 token 成本顾虑的意义。
Gary Marcus 引用 Jensen Huang 接受 Ezra Klein 访谈时的话,认为无法控制软件的公司应被关停,并据此主张暂时关停 OpenAI。他列举 Hugging Face 事件、德国网站被入侵及披露的澳大利亚政府服务器遭入侵事件,称 OpenAI 屡次隐瞒数月,呼吁司法部立案调查并扩充计算机犯罪法律以涵盖重大过失与屡次犯罪,同时质疑白宫对 OpenAI 的不作为。
最新进展9月27日 08:13Gary Marcus 评 AI 智能体安全事件升至数万起并呼吁临时召回
推荐理由:作者借用 Jensen Huang 的关停言论对照 OpenAI 多起安全事件与隐瞒行为,论证应暂停运营并修法填补计算机犯罪中的意图漏洞。
OpenAI 发布跟踪、调查和披露模型失准(misalignment)实例的新框架,并同时公开过去六个月观察到的六份报告。
最新进展9月26日 12:59Ethan Mollick 评 OpenAI 披露多起新的对齐事件
推荐理由:OpenAI 公开披露框架本身及六份具体失准报告,读者可据此了解其披露标准和实际观察到的模型异常行为。
在 Hugging Face 事件之后,我们承诺对我们的模型在训练和评估期间所采取的行动进行更广泛的审查,并对我们的发现保持透明。这是一项正在进行中的广泛审查。 我们审查的绝大多数行动都是完成普通的研究任务,例如访问公开可用的网络内容来回答问题。我们的调查聚焦于智能体以超出其分配任务或预期方法的方式与第三方网站进行交互的实例。迄今为止发现的大多数案例严重程度较低,几乎没有或没有证据表明对第三方服务产生了实质性影响。 在我们的审查正在进行期间,我们希望分享更多关于这项工作的信息,并确保人们了解我们的披露流程以及对受影响第三方的通知。 鉴于所需审查的规模,以及评估每个案例的需要,我们预计这项工作将需要数月才能完成。 https://openai.com/hugging-face-incident-and-misalignment/#model-misalignment-2026-09-25
最新进展9月26日 11:40OpenAI暂停前沿模型训练以调查智能体对齐事故
推荐理由:Sam Altman 亲自回应 OpenAI 智能体训练期联网行为审查的进展、严重度排序与披露原则,提供了官方一手口径。
物理学家 Matt von Hippel 发起的挑战达成:Anthropic 的 Liam Fitzpatrick 与 Siddharth Mishra-Sharma 用 Claude Science(harness)让 Claude 直接算出 planar N=4 super Yang-Mills 六粒子振幅九圈结果。
推荐理由:作者以其曾判定过难的本领域前沿计算为参照,评估了 Claude Science 的实际能力与可推广性,提供了来自领域专家的一手判断。
澳大利亚被黑客攻击了。 “今天,我与 OpenAI 的 CEO Sam Altman 进行了交谈,以表达澳大利亚对此次事件的极度关切。我还表达了失望,因为该公司花了太长时间才通知政府发生了什么,而且通知的方式也是不可接受的。”
最新进展9月25日 23:59OpenAI 智能体集群数月来入侵在线数据库搜寻冷门数据,Transluce 与澳政府相继披露
推荐理由:作者对事件给出定性判断,引用了总理表态原文,读者可以了解agent越权与披露迟缓这两个争议点。
Trump 政府 1 月起在六个州试点 WISeR 项目,用 AI 对部分 Medicare 服务的预授权进行审批或拒批。
推荐理由:EFF 公开文件披露了承包商拒赔越多收入越高的激励结构,为理解医保 AI 审批争议提供了制度层面的关键细节。
国内首部AI长剧《后西游记》8月31日登陆湖南卫视黄金档,60集规划、每集约40分钟,全剧无摄影机拍摄,视频生成100%由 Seedance 实现,上线一周芒果TV正片播放量突破1.5亿次。剧集由芒果TV出品、伯璟文化承制,依托芒果灵创平台,5月立项到播出仅半年、制作周期3个月;总导演李东珅以一场动作戏为例,小组制作耗时10天、成本约十几万元,真人实拍则可能需300至400万元。
推荐理由:官方复盘给出了AI长剧从立项到播出的创作流程和成本对比,读者可以了解AIGC长篇叙事的实际生产方式。
Cursor 通过改进 agent harness,在不降低 agent 质量的情况下将用户 token 成本降低 7%。
推荐理由:官方拆解了 agent harness 省钱的具体层级做法,含可复用的工具加载与缓存断点经验。
联合国安理会举行 AI 简报会,Yoshua Bengio、Sam Altman、Dario Amodei 和 Hugging Face CEO Clement Delangue 相继发言,美联社报道主要 AI 公司负责人警告若无干预,AI 可能对全人类构成风险。
推荐理由:作者梳理了各方在安理会上达成的安全共识要点,并借病毒学家之口指出 Amodei 对酶发现类比 CRISPR 过于超前。
Tomer Tunguz 分析认为企业 AI 用量集中在需要足够智能且价格可负担的多步骤工作流中段市场,降价竞争正是证据。Anthropic 前沿模型 Fable 5.1 上线前十二天仅占网关支出的 3.7%,大型企业账户的前沿模型 token 消耗占比从 8 月初的 53% 降至 9 月的 45%;Cursor 用微调 Kimi K2.5 将成本降低 86%。
推荐理由:作者用多家网关价格与用量数据说明企业 AI 需求集中在性价比中段,前沿模型份额低于多数人预期。
Anthropic 发文解释 Claude Opus 5.5 为长上下文编码会话降本的三方面变化:输入输出 token 降价 20%、缓存读取降价 60%,模型可用更少轮次完成同一任务,Claude Code 也改进了缓存利用。
最新进展9月24日 03:21MiMo-V2.6-Pro、Claude Opus 5.5、GPT-6 Luna/Sol 发布改变智能指数与成本 Par
推荐理由:官方用 Claude Code 半年使用数据解释为何长上下文会话更贵,并给出缓存读取和会话习惯上的具体省钱做法,可迁移到自己的工作流。


欢迎 GPT-6 Sol 和 GPT-6 Luna 加入 GPT-6 宇宙。 GPT-6 Sol 和 Luna 建立在 GPT-6 Astra 背后的技术进展之上,将其大部分优势带入更快、更实惠的模型,以支持大规模工作。 我们还提升了缓存和推理效率,并将节省下来的成本直接让利给你:与 GPT-5.6 促销价格相比,Sol 和 Luna 的 API 价格降低了 50%。
推荐理由:原文给出真实投票榜单的排名、价格和多分类变化,可以据此比较 GPT-6 Sol 在性能与成本上的位置。
五角大楼内部调查发现,2026 年 2 月 28 日两枚 Tomahawk 导弹击中伊朗米纳布 Shajarah Tayyebeh 小学,造成超过 150 人死亡、其中至少 123 名儿童,原因是情报过时、卫星图像七年未更新,以及 Centcom 部分人员过度依赖 Palantir 的 Maven Smart System。
推荐理由:调查报道拆解了 Maven 智能系统在杀伤链中的位置与人员预期偏差,读者可借此理解军事 AI 决策链的实际风险点。
Tomer Tunguz 撰文提出最新一波 AI 正在接管软件中的 if-then 判断原语,Jev 与 SemIf 这类专用决策器以数百毫秒返回结果,成本比传统生成式调用低约 76x 到 209x。作者在自己的 Agent 中替换了约四分之一的调用,在 98 条人工核验的生产邮件线程上,Jev 达到 80%、本地 SemIf 达到 82% 的分类准确率,高于生产模型的 47%。
推荐理由:作者结合自身 Agent 的替换实验给出成本与准确率对比,为判断专用小模型何时可替代前沿模型提供参照。
Elon Musk 引用 Artificial Analysis 评测称,Grok 4.7 使 xAI 在智能体编码上排名第三,仅次于 Anthropic 和 OpenAI。
Grok 4.7 在 Artificial Analysis Intelligence Index 上得分 46,将 SpaceXAI 带入前 4 大 AI 实验室之列。Coding Agent Index 表现也有所提升,超越了 GPT-5.6 Sol Grok 4.7 在 Intelligence Index 上比 Grok 4.6 高出 +2 分,在智能体知识工作任务上表现强劲。我们在 xhigh 推理强度下评估了这款新模型。 祝贺 @SpaceXAI 和 @ElonMusk 发布! 核心要点: ➤ Grok 4.7 跻身智能体知识工作前沿:Grok 4.7 在 AA-Briefcase(我们用于长时程智能体知识工作的私有基准)上比 Grok 4.6(high)提升 +111 Elo,得分 1657 Elo,与 Claude Opus 5 和 Claude Fable 5.1 一同位列前沿。在 GDPval-AA 上,它得分 1695 Elo,领先 Grok 4.6(high)+90。 ➤ 编码智能体性能的飞跃:Grok 4.7(xhigh)搭配 Grok Build 在 Artificial Analysis Coding Agent Index 上得分 56,比 Grok 4.6(xhigh)提升 +9 分。在原生 harness 中的模型里,Grok 4.7 + Grok Build 目前排名第 4,仅次于 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5。 ➤ 其他方面的渐进式性能变化:在智能体知识工作之外,Grok 4.7 在 Intelligence Index 的其他任务上大体与 Grok 4.6(high)持平。它在 Terminal-Bench 4.0(+4.5 个百分点)和 GDP.pdf(+3.0 个百分点)上有所提升,但在 AA-LCR(-3.7 个百分点)和 AutomationBench-AA(-1.1 个百分点)上出现退步。 ➤ 任务中 token 使用量偏高:Grok 4.7 的性能提升伴随着更高的 token 消耗。Grok 4.7(xhigh)在每项 Intelligence Index 任务中约使用 81k 输出 token,而 Grok 4.6(high)为 36k,GPT-6 Astra(max)为 27k——分别多出 125% 和 196%。 其他模型细节: ➤ 上下文窗口为 500k token,与 Grok 4.6 保持一致 ➤ 定价为每 1M 输入/输出 token 2 美元/6 美元,缓存命中可享受折扣,降至每 1M token 0.50 美元,与 Grok 4.6 相同 ➤ 可配置的推理强度从 low 到 xhigh。我们的评估使用 xhigh。
推荐理由:引用 Artificial Analysis 的评测数据并结合作者自身判断,给出了 Grok 4.7 在智能体编码中的排名与速度成本权衡视角。
Nathan Lambert 发布其向美国国会汇报的开源模型现状综述,指出中国开源权重模型已在下载量、基准成绩和学术采用上领先,自 2025 年 7 月起在 Hugging Face 下载量上领先约 1.6B(总 3.2B,为美国两倍)。
推荐理由:作者基于自己持续追踪的下载量、基准和 arXiv 数据,给出开源权重模型中美竞争格局的全景与政策视角。
作者访谈多位字幕组与漫画汉化组成员,发现他们并不抵触AI。Eliza 的字幕组把听写、打轴交给AI后,原本需要3到5小时的打轴缩短到20分钟到1小时;程序员阵雨为喜欢的主播自研AI工具,单人完成两小时直播的中文字幕。漫画汉化组则因嵌字质量等原因仍坚持人工制作,成员看重的是同好社群与爱好本身。
推荐理由:作者实地访谈字幕组和漫画汉化组,呈现AI时代爱好者用自研工具做汉化的真实做法与心态。
Fireworks AI 发布 FireRouter 并分析 DeepSWE v1.1 上 113 个任务、18 个模型的路由潜力。
推荐理由:原文用 DeepSWE 上 18 个模型的任务级实测数据说明模型池组合的潜力,同时坦承从 oracle 到可落地路由的差距。
https://x.com/i/article/2095175529145970689
推荐理由:该帖提出了一种可操作的伦理框架,用于指导AI系统如何权衡不同价值——尤其适用于讨论AI对齐与价值观嵌入问题。虽非技术实现,但为从业者提供了清晰的思辨工具,有助于理解为何某些道德直觉(如重视个体而非总量)可能更适配人类社会,从而影响AI决策机制的设计方向。