Fable模型被美国临时关闭,AI安全管控时代来临
The Flat Curve Society
美国政府短暂关闭了Mythos类中的Fable模型,标志着AI模型已越过危险门槛。作者预测最多两三代模型后,超级智能将像核武器一样被管控,大多数Fortune 500企业无法访问或仅受控使用。开源模型落后前沿约七个月,且面临算力和政府锁定的双重壁垒。人类的“辨别地平线”使许多人感觉模型进步停止,但实际指数增长未停——只是用户缺少足够困难的问题。Fable类已能解决此前Opus 4.8无法完成的复杂任务(如React客户端),AI将彻底改变编程和知识工作,但多数人只能使用当前等级模型。
Steve Yegge这篇判断很冷也很实:多数人能接触的模型智能将停滞,但背后指数仍在跑,SaaS反而因此安全。他抛出的AI素养三阶模型,对正头痛如何推动团队用AI的leader是现成框架。

平坦曲线协会
嗨,我们在这部大家一起在 X 上观看的电影里,已经走到了这样一个时刻:模型智能变得危险了。Dario 多年前就预测这会在今年发生。随着 Fable 被美国政府(USG)短暂关停,这是我们已驶入险恶水域的第一个高度可见的信号。
这真是太可惜了,真的。我本来希望我们还能再经历几代模型升级,强大到足以说服所有剩余的怀疑者,然后才会遇到一个构成安全问题的模型。但 Mythos 级别(Fable 就是他们上周发布的那款护栏做得草率的版本)让所有人都感到恐慌。
既然我们知道模型正变得危险,我们就可以做一些推断了。
AI 竞赛不会放缓,AI 的能力将继续呈指数级增长。遗憾的是,你们中的大多数人再也看不到它的进展了。
我现在属于这样一个阵营:相信我们距离 AI 最终像核武器一样被管控,最多只差两到三代模型。只有少数人能够获得超越我们今年所见模型类别的超级智能。据我所知,大多数《财富》500 强公司要么完全无法获得访问权限,要么只有公司中一小部分人能获得严格管控的访问权限。而且它将受到监督。
我认为,那些能够使用强大前沿模型的人会像自动售货机一样出售智能:你给他们一份软件规格说明或一个待解决的问题,他们的模型就会在他们的服务器上、用你的钱替你实现它。而由于大多数公司不会愿意把自己的代码和问题发送给模型供应商,我认为这个世界将学会与我们所能够使用的模型共存。

被锁起来并严加看管的超级智能
每个政府都会各自行动,限制访问。核武器之所以稀缺,是因为很难获得浓缩铀。AI 正走上同一条路,其瓶颈在于供应链——而这恰恰是政府真正能够加以管控的东西。中国会像美国政府一样,把超级智能牢牢锁在自己的国境之内。而如果中国最终取得前沿领先地位,那也只是改变了权力集中的地点,而不会改变我们即将置身其中的这个世界的整体形态。
一个平庸模型的世界
我们许多人曾希望开源模型能让我们保持在指数曲线上。它们落后前沿大约七个月。但它们之所以能留在这条曲线上,靠的是用算力进行训练,而获取这些算力越来越需要达到国际关系级别的交易斡旋。也许知识蒸馏或某种巧妙的点对点训练方案能让它们留在竞赛中。但要想突破 Fable 级别,它们就必须在整个硬件和软件供应链像核供应链那样被锁死的情况下做到这一点。而前沿实验室本身也将拒绝帮助训练下一个危险的开放模型。
如果开源模型明年无论如何都达到了 Fable 级别,那对世界来说是件好事。但开放模型不会超越 Fable 级别,在巨大的算力壁垒和政府封锁即将来临的情况下,绝无可能。
所以再说一次,今天的模型大致就是我们能达到的最好水平了。
尽管在某些方面我觉得这令人失望,但我仍然觉得有很多值得高兴的积极面。因为今天的模型,尤其是 Fable 级别的,已经足够好了。它们仍将彻底改变编程和知识工作。只是这不会是一帆风顺的事。转型需要付出巨大的、长达数年的努力。
在本文剩余部分,我将假设我们都会重新获得 Fable,甚至可能在进一步进展变得只有极少数人才能触及之前,还能获得一个更高级别的模型。
你们中的许多人一直预期 AI 的曲棍球棒式进步曲线很快就会趋于平缓,拒绝相信它真的处于指数曲线上,可能最终会比人类聪明得多。你们预测 AI 无法取代人类工程师。
从某种意义上说,你们确实是对的。以一种非常实际的方式。
实际上,在幕后,这条曲线根本没有趋于平缓;指数增长将继续下去,你将能够看到它外在可观察的迹象,例如数据中心的增长。
但对你来说,这条曲线会通过两种不同的现象显得趋于平缓。
第一个原因就是我们前面已经提到的:他们会把最聪明(因而也最危险)的模型牢牢攥在手里,不让我们接触。所以我们大多数人根本没机会去试用它们。而如果我们用都用不上,这些模型自然也就谈不上取代工程师了。
另一个原因则颇为有趣,我花了好一阵子才看出来,它其实和第一个原因是同一个道理,只是换了副面孔罢了。
一个平庸用户的世界
已经有人反映,他们分不清 Opus 4.8 和 Fable 5 之间的差别。我一直把这种现象称为“辨识地平线”:每个人对模型智能都有一个感知上限,一旦超过这个上限,所有模型感觉起来都差不多。
但实际上存在两个上限,它们都是观察当下所发生之事的有益视角。
第一个我称之为需求地平线。它由你所能提出的最难问题决定。如果你手头只有简单的问题,那它们根本不会给更聪明的模型留出任何拉开差距的空间——输出看起来都一样,因为这个问题从未让任何一个模型真正施展拳脚。需求地平线指的就是:你分辨不出两个模型的差别,是因为你没有一个足够难的问题。
我把自己那些难题称为“口袋评测”,并且会不断收集它们。每当我交给模型一个项目,而它做不出来时,我就把它加入我的口袋评测清单。之后每当有新模型发布,那感觉就像过圣诞节一样。我会拿它把我所有的口袋评测都跑一遍,看看现在它能解出哪些。

口袋评测集
具体例子:没有任何 Opus 级模型能为我那个游戏写出 React 客户端;它实在太复杂、太琐碎了。Fable 却轻松搞定。这让我很容易看出它与 Opus 的差距。但我还有其他问题,对 Fable 来说也会太难。我会在它啃食我的工作过程中急切地收集这些问题。你只需要有野心,就能创建自己的口袋评测集。
所以我的需求地平线非常高,至少还能再撑三到四代模型,前提是我能获得那种级别的智能——而这似乎不太可能。我并不抱太大希望。但至少我能用我的评测集判断它是否真的那么聪明。
需求地平线其实相当温和,甚至有点恭维意味:它只意味着你目前的工作还不够难。但哪天你带来一个异常困难的问题,你的地平线就会当场拓宽——你会看着便宜模型在某个昂贵模型轻松搞定的任务上笨拙挣扎。就像我的 React 客户端那样。
还有一条更暗的地平线,我称之为真正的辨识地平线。这条线不是由你能提出的最难问题决定的,而是由你能判断的最难答案决定的。越过这条可怕的分界线,你就无法判断模型是否正确,因为检查工作本身已经超出了你的能力。
自从我写《醉汉 rant》那会儿起,我就一直在琢磨这个问题。当时我写到,面试一个比你聪明的人有多难。如果他们在你一无所知的领域自称专家,你怎么知道他们不是骗子?你根本做不到。
每个人都有自己的辨识力地平线,Dario 也不例外。超过某个能力水平之后,没有任何在世的人能够验证模型的输出。

辨识力地平线
这就把我们完整地绕回到了为什么他们开始锁定模型。你不可能把一个无人能监督的智能引擎交出去。拥有它毫无意义,因为你不知道它是在帮你,还是在把你引下悬崖。超越人类意味着无法验证。
所以安全派看到的是潜在的武器,而我们其他人看到的是一把无法有效监督的工具。两种情况下,你都不需要也不想要更强大的模型。你想要的是更安全的那个,即便它能力更弱。
公司同样拥有这两条地平线。对许多公司来说,Fable 已经越过了需求地平线——他们遇到的每一个问题,它都能处理,而一个更聪明的模型不会改变任何他们能衡量的东西。对更硬核的团队而言,约束性的极限是辨识力:AI 产出的工作没人能打分。这是一个糟糕的结果——前提是你不打算把整个业务完全交给 AI。
这一切的结果是,对我们大多数人来说,曲线正在变平。我认为商品化的智能很快就会停止指数级增长,或者至少,它会看起来如此,而我们都会当作这是真的来行事。
我从未花太多时间去考虑智能曲线会趋于平缓的可能性。但既然这似乎正在发生,让我们来看看这对行业的一些清晰而明显的影响。
SaaS 回来了,宝贝
要重建金字塔顶端的所有 SaaS,显然成本太高了。是的,会有模型能做到,但访问权限和成本都将令人望而却步。
SaaS 实际上在过去一个月里自行强势回归,此前它在过去一年的大部分时间里都岌岌可危,遭到来自四面八方的打击——既有内部重写的威胁,也有对 Claude 将吞噬一切的恐惧。
随后,各公司以惨痛的方式领教了 token 效率的教训,一些大企业几个月内就烧光了一整年的预算。几个月前,大家还都打算告诉自己的 CFO,他们可以取消一堆 SaaS 订阅,把依赖项收归内部。如今不再如此。现在,买还是自建的决策已大幅倾向于买。如果你足够厌恶自己当前的 SaaS,那当然,你可能有动力用 AI 重写它。但购买 SaaS 的成本是可预测的,而且通常已经列入预算,而 vibe-coding 替代方案则可能是一场昂贵的赌博。
如果我们看到可获取的模型能力出现停滞,那么我们对 AI 在 SaaS 中的其他设想也会随之消退:不仅是取代 SaaS,还包括用智能体行为和监控来改造它。如今的模型还不足以取代一个人(可被越狱、容易被混淆等),所以你没法直接用一个智能体替换 SRE 或训练有素的客服代表。而那些能够可靠取代人类的模型,可能危险到不能交给大多数人使用。
所以 SaaS 看起来可能没什么问题,即使没有智能体行为也是如此。它只需要帮你省下自行构建和维护的成本就够了。
SaaS 仍有它的问题:用户为 80% 用不上的功能买单,资金从本地经济体中被抽取去充实硅谷,劣化效应沿着金字塔向上蔓延。但它本质上仍然是关于知识的结晶化。一群人构建出棘手的东西,那些你不想自己动手做的东西,然后租给你。而那些强大到足以“轻松”取代其中大部分的 AI 模型,要么无法获取,要么贵得令人望而却步。
在我看来,SaaS 模式会继续存在下去。
AI 素养入门 101
如今的模型虽然相当有能力,但仍然非常难以驾驭。即便是 Fable 大概也在大型单体架构和其他复杂的遗留代码布局上苦苦挣扎。要达到始终如一的高质量标准很难。当然,效率也是一个巨大的问题。
我一直希望模型能足够聪明,以至于你不需要太多训练就能上手使用它们。但就如今的模型而言,你不能指望人们天生就具备 AI 素养。他们需要帮助,才能使用当下的编程智能体和各类工具框架。
在下一节中,我会给出一个相当精确且可衡量的 AI 素养定义。这不是我发明的,但我相信它对你的规划和对我的规划来说都足够好用。
不过首先,你的员工是否具备 AI 素养,为什么这件事很重要?答案有点复杂,但归根结底取决于两个因素。其一是你的公司必须转向使用 AI。其二是你所有的员工都对 AI 感到焦虑。这种张力正在全球所有公司中真实上演。
转向 AI 至少会稍微改变每个人的工作,而且很可能会大幅改变你公司的形态。而这又反过来加剧了焦虑,形成一个循环。
如果你在公司里推动变革,却没有先以既量化又深度共情的方式解决 AI 素养问题,那么你就是在助长焦虑、怨恨和抵触。你的组织会抗拒变革。
AI 落地是 2026–2027 年的关键文化挑战。如果你能设法让你那些(充满敌意的)员工跨过这道坎,并真正让他们对自己如何用 AI 加速自身工作感到兴奋,那么奇迹就会发生。他们会自动开始共同重塑你的业务流程,朝着使用有监督的智能体工作流的方向演进。
我到处都看到这种情况发生,但具体来说,Gene 和我在四月份于 Arkana Labs 亲眼目睹了这一点,当时是在他们的工程副总裁 Owen Parker 的指导下。Arkana 提供世界一流的过夜肾病诊断服务,他们拥有完全独特的业务流程。但这些流程都可以在各个环节借助 AI 加速。鉴于 Arkana 在文化上对快速且准确的周转如此执着,员工们自己对各种机会感到兴奋,并在智能体可能实现的能力上大力推进。
在见识了足够多这样的情况后,我坚持认为,一旦大多数人“理解”了 AI,你只需要引导他们,他们就会开始为你的团队广泛地做正确的事情。
反过来,只要你的队友仍然不具备 AI 素养,他们就会抵制 AI。这意味着,在你的组织跨越这道坎之前,你将面临抵触、焦虑,甚至可能是士气问题。
那么我们要如何解决这个问题?我们如何让人们“理解”AI?
事实证明,Netflix 已经给了我们答案。谢谢你,Netflix!
AI 素养:初学者小组

氛围编程工作坊
四月份我观看了一场令人脑洞大开的演讲,演讲者是 Ezra Savard,他在 Netflix 从十二月到三月开展了一项培训研究/实验。他在圣何塞 Gene Kim 的 AI Summit 上做了这场演讲。该研究的目标是培训 Netflix 工程师进行智能体编程,并衡量其影响。
Ezra 的演示完全严谨,也做了必要的免责说明(例如针对轻微的选择偏差),但他们相当确信这些结果在方向上是正确的,所以这些我就略过了。
请注意,我会把这套框架称为“AI 素养”,但这是我的说法,不是 Ezra 的,他在演讲中从未提到过素养。他谈的是从非用户,到用户,再到高级用户的旅程。但 AI 正在成为现代知识工作的一项基础技能,所以我将在本文中论证,我们谈论的是一种新形式的素养。
Ezra 要分享的第一个重大发现是,他们发现了三个群体,我将其称为 AI 素养的初级层次。Ezra 用他们在使用 AI 的“合格”日(即大量使用 AI 的日子)的平均 token 消耗量来描述这些群体。他们需要每周至少 3 天达到这一标准,才能归入该群体。
以下就是他们发现的三个初级群体,按消耗量划分:
- 0M tokens/天:不在日常工作中使用编码智能体的开发者
- 4M tokens/天:在整个工作日中同步使用单个智能体
- 12M-15M tokens/天:让 2 到 4 个智能体在无人看管的情况下工作
所以:先是无智能体,然后是单智能体,再然后是多智能体。我认为这是对基线 AI 素养的一个可靠的可操作定义。如果你的整个组织连单智能体素养都没有达到,那么他们就会在引入更多 AI 这件事上跟你作对,哪怕只是消极抵抗。
Ezra 分享说,他课程中一些进阶的重度用户确实在花费高得多的金额,超过每天 5000 万。
但他也提醒说,超过每天 1500 万这个门槛之后,token 花费就不再是一个有价值的衡量指标了,因为到那时人们已经足够聪明,能编造出各种理由来烧 token。(在那之后,你就转向衡量结果,我将在下文讨论这一点。)
然而,最妙的地方在于,在达到那个水平(每天 1500 万 token)之前,以粗略的粒度衡量员工的 token 消耗量,可以为你提供强有力的洞察,让你了解你的组织在 AI 素养方面处于什么位置,以及前方还有多少培训工作要做。
幸运的是,Ezra 在这方面有好消息告诉你:人们可以在 5 小时内实现群体跃迁。在合适的培训环境中,人们从 AI 文盲蜕变为 AI 熟练者,就需要这么长时间。而且他们会一直保持在这个水平。就像拨动一个开关。96% 的受训者在课程结束六周后仍停留在第二个群体中,没有表现出任何退步的迹象。
你问什么才是正确的培训设置?Ezra 的团队花了相当大的精力打磨这套方案。培训必须以团队为单位进行,每队 5 到 10 人,包括他们的经理。经理必须让整个团队报名参加,在正常工作时间进行,作为公司“钦定”的工作时间。参训者必须带上自己的实际工作,讲师会帮助他们学习如何用智能体来完成这些工作。
他们发现,只要在任何环节偷工减料——缩短课程、扩大听课人数、改为个人自愿报名——效果就大打折扣,根本“留不下来”。
至于第三批学员:一旦经理手下有一整队单智能体用户,就可以让团队报名参加多智能体课程。这又是 5 个小时,教他们驾驭多个异步智能体所需的额外技能,同时保持高质量标准。这门课程同样获得了很高的参与度,绝大多数人投身多智能体工作并一直坚持下来。
所以,让一名员工达到基本素养大约需要 5 小时的专注培训。再经过几周实践,还需要另外 5 小时才能让他们成为高级用户。
至于影响,Ezra 报告了一些令人意外的发现,比如使用智能体编程的人产出的代码量存在巨大差异。但深入调查后,他们发现这完全归因于他们额外编写的测试代码。总体而言,他们发现这门课程对参训者的生产力产生了很大的积极影响。
如果你想开始与公司内部讨论向 AI 转型,那我强烈建议你从一次 AI 素养审计开始,然后对所有人进行培训,至少让他们达到单智能体群体的水平。
进阶群体
帮助人们克服 FUD 心理障碍,并教他们通过消耗 token 来加速自己的工作,这就解决了你的第一个文化问题。而且在你讨论如何引入 AI 时,这会给你带来极大的帮助,不会遇到那么多阻力。
Netflix 给了我们一个克服 FUD 障碍的优化方案。你培养一些“线厨”讲师来教授入门课程。Ezra 告诉我和 Gene,他们是从我们的书开始的,这还挺酷的。但具体的课程内容其实不太重要;你可以按自己喜欢的方式去教。然后让所有人完成培训,每次 5 小时、10 个人一批。
一旦你教会了所有人如何消耗 token,你的第二个文化问题就出现了,那就是教人们如何不消耗 token。Token 效率是一个相当进阶的话题。模型有很多很多种方式把你带偏,而最高效的智能体编程者专注于在给定的 token 预算下最大化产出。
说到这里,我应该分享一个 Pierre Racz 讲的笑话,他是 Genetec 的创始人兼 CEO,才华横溢,Genetec 是全球最大的物理安全监控公司之一。他更喜欢手写代码,当我向他描述这些度量方式如何运作时,他打趣道:“那这么说来,不是我没在用 AI,我只是极其节省 token。”
这是个有趣的玩笑,但背后也有一个更深层的道理:如果一件事你随手就能做,那就亲手做!久而久之,只要你多留个心眼,就能省下大量 token。直接输入 !git push,而不是让智能体去做,这个习惯平均每次推送大概能帮你省下 100k token。
你知道那个钟形曲线的梗吧——最底下的原始人和最顶上的绝地武士,做的其实是同一件事?在这里,那个新手和绝地大师共同掌握的技能,就是低 token 消耗。

从新手到大师的旅程
token 消耗只在上升阶段代表你的熟练度。它是你逐步建立起来的一项技能。但随后情况会反转,这时你需要开始衡量的是 token 浪费。把浪费降到最低,又是另一套技能。
你会发现,你的新手群体简直是 token 消耗大户,这没关系。鼓励他们去探索、去学习。他们必须先掌握花钱的技能,才能专注于省钱。
你会发现,人们并不会自然而然地懂得如何节省 token。他们会在对话里聊到 200k token 之深,然后问 AI 现在几点了。唉!或者问某个文件是否存在于他们的主目录里。这也是一项需要训练的技能。
所以到了某个阶段,你大概会想要开设第三门培训课程,这门课讲的是效率技巧和良好的 token 卫生习惯。
然后,给你那些刚掌握 AI 的员工预算。让他们用真实的成果来赢得预算增长。无论你怎么做,衡量成果都将变得至关重要,这样你才能把高效的建设者与虚荣的建设者区分开来。
我们已经讨论过入门级的 AI 素养群体(基于花费)和进阶群体(效率、浪费管理)。在 AI 素养曲线的顶端,你的思考会变得更具战略性。你会操心如何在实现预期成果的同时节省大量 token。
每个人遇到的第一个例子就是买还是自建。你会让你的工程师尝试重写某个随机的 SaaS,还是干脆续约、接受已知的花费?你必须开始在智能体项目分配上采取战略性思维。
你面临的另一个有趣挑战是:你如何把每项任务都路由到能处理它的最笨的模型上?你需要能够为工作打上智能层级的标签,并构建一个路由器。那个路由器就是把辨别力地平线编码成了基础设施。大多数工作都位于这条线之下,交给便宜的模型处理,而偶尔冒到线之上的任务则被升级到昂贵的层级。
在最高层次上,AI 素养会变成一门以最少花费取得卓越成果的艺术。
一门手艺需要一个平台期
我们正在目睹智能的停滞。这种停滞是人为的:指数级增长仍在幕后继续,只是被挡在了你视线之外。而到了某个节点,即便你能看到它,也分辨不出它还在变好。智能曲线就像地球是圆的一样真实,但从你所站的位置看去,它同样平坦。欢迎来到平坦曲线协会。
Mythos 这一届毕业生将成为公众所接受的、能力与风险之间的权衡。我们会看到一些修补边缘情况行为的增量更新,但不会再有过去几年我们习以为常的那种跃升。
停滞不是坏事。停滞让我们得以扎营,开始建设。我们一直站在不稳定的地面上。想想最近当一名创业公司创始人有多难,你构建的一切都会随着每一次模型发布而变得过时。这种局面终于开始放缓了,它会给我们一个坚实的地基。
我们面前有一个工程问题。无论 Opus 和 Fable 有多出色,它们都有各自的局限。我们都需要学会任务分解和拆解软件单体架构的艺术,让它们始终处于这些局限之内。我们仍然需要工程师,也需要工程。我们会拥有超级聪明的助手,但整体格局仍将与今天相当相似。
我有点喜欢即将到来的这个平台期。稳定性感觉像是用这些超级聪明的助手构建软件这一新技艺的前提条件。模型越弱,这门技艺就越难,也越有价值。Sonnet 级和 Opus 级模型在未来数年内仍将保持相关性,因为即便前沿继续推进,它们依然能省钱并且广泛可用。而那些会让当今这门技艺中来之不易的技术过时的模型,显然太危险了,无论如何都不会交到我们手上。
目前全世界都在尝试搭建 24x7 自主智能体,而看起来我们今天在那里面临的困难,明天依然会伴随着我们。眼下有一项庞大的工程努力,正在构建能让当今的模型运营当今大型企业的控制平面。那同样是一门技艺,或者至少,它是这一行当工具箱的一部分。
训练你的平曲线者
这里的关键结论(除了如果你是 SaaS 厂商,先别急着切腹自尽之外)是,我们面前有一个巨大的 AI 训练与素养问题。但它是可以解决的。只是需要时间和努力。
我们今天拥有的模型,以及今年即将到来的模型,都不会一次性搞定你整个《财富》100 强级别的代码库。它们有能力做出惊人的事情,但仍然需要成熟的人类监督。
这意味着你需要工程师。我们聊过的所有那些酷炫的事情——临时组建的 2-pizza 团队、2 到 3 人团队成为最佳配置、角色开始彼此模糊(或至少彼此之间沟通更多)——很可能会继续下去。但每个人都需要培训、时间、耐心以及细致的预算管理。
AI 素养不会凭空而来。你唯一能免费得到的是 AI 焦虑。但教人们花掉 token 相当容易。教他们节省 token?嗯,那才是新的元技能。祝你好运。先确保他们能按 Pierre 的方式来做。
这就是我今天这篇博文的全部内容。希望你喜欢。月底在旧金山举办的 AI Engineer Conference 上见!

Campground Craft
来源:Steve Yegge:Medium(RSS) · steve-yegge.medium.com