Simon Willison 演讲回顾 2026 年至今的 LLM 大事记
2026 in LLMs (so far)
Simon Willison 在 WeAreDevelopers World Congress North America 发表闭幕演讲,按时间线回顾 2026 年至今的 LLM 进展,并附带注释幻灯片。
作者以亲历者视角按时间线梳理 2026 年 LLM 关键节点,从编码智能体、OpenClaw 热潮到训练智能体越界事件,可帮助读者建立全年脉络。
周五,我在圣何塞的 WeAreDevelopers 北美世界大会 上做了闭幕主题演讲。我把过去一年的关键趋势串联起来,按时间顺序梳理了 2026 年发生的一切。视频 在 YouTube 上;这里是我为配合演讲准备的带注释幻灯片和笔记。
以及作为一份 带注释的演示文稿:
我将快速带大家浏览 2026 年迄今为止发生的一切。这一年还没结束呢!
对我来说,2026 年早在几个月前的 2025 年 11 月就开始了。
11 月发布了两个重要模型:Claude Opus 4.5 和 GPT-5.1。
和通常的新模型一样,这些都是在之前模型基础上的渐进式改进。
但偶尔当模型改进时,它会越过一条看不见的线,某些原本不太行得通的东西开始变得可行。
这次开始变得可行的是它们的编码智能体。Claude Code 从 2025 年 2 月就存在了;Codex 稍晚一些。
这两个新模型,与各自的编码智能体框架搭配后,从“经常出错”提升到了“可靠到足以日常使用”。
几年来,我一直通过让新模型“生成一只骑自行车的鹈鹕的 SVG”来评估它们。这大概是世界上最蠢的基准测试——从中能学到的东西很有限。
但它对模型来说仍然是个挑战,因为画鹈鹕很难,画自行车很难,而且鹈鹕本来就不会骑自行车。
这是 11 月的最先进水平。Claude 还是画不好自行车!GPT-5.1 的自行车车架也相当糟糕。
同样在 11 月,一个名为“Warelay”的冷门 GitHub 仓库有了第一次提交。我们稍后会回到这个仓库。
然后是 12 月的假期,独立开发者们休息了一段时间,许多人开始摆弄这些新的编码智能体模型组合……我们开始意识到,它们能做到多少以前做不到的事情。
到了 1 月,我们许多人都很兴奋地开始把这些东西付诸实践。
每年我都会给自己定一个新年决心,而且从我记事起就一直是同一件事:保持专注。少接新项目。努力把已有项目做完。
今年我决定,既然以前从未奏效,那就反其道而行之。
我们现在有编码智能体了,看看它们能做什么。我要想接多少新项目就接多少!
(你可以在年底问我这个主意到底好不好。我现在手头一大堆事情在同时转。)
“更有野心”是今年的一大主题,因为找到这项技术极限的唯一方法就是不断推进,直到它们行不通为止。
我还和 Bryan Cantrill、Adam Leventhal 一起上了 Oxide and friends 播客,分享了对下一年(以及三年和六年)的预测。
事后看来,我的 LLM 预测相当保守。
我说过“LLM 能写出好代码将变得不可否认”——我认为我们现在已经到了这一步。
我预测我们最终会解决沙箱问题。我数了一下,这次会议的 277 场演讲中约有 40 场以某种方式涉及沙箱或智能体安全,所以至少我们在这方面投入了大量精力!
我曾预测编码智能体安全领域会发生"挑战者号灾难"。今年围绕智能体安全的噪音确实不少,尽管我预测的那种确切灾难(编码智能体被劫持并造成现实世界的经济损失)并未真正上演。
我们加入了一个玩笑式的预测,说教皇会对大语言模型的经济影响发表看法。
我还预测新西兰的鸮鹦鹉今年会有一个出色的繁殖季。
这些是不会飞的夜行性鹦鹉。它们看起来有点矮胖,我觉得它们很美,而今年年初全世界只有236只这种鹦鹉。
鸮鹦鹉只有在陆均松大量结果的年份才会繁殖,而这种情况已经四年没有出现了……但今年陆均松的果实看起来非常好。
同样在那期播客中,我们为"那种由AI引发的倦怠感——软件工程师因为AI什么都能做而变得无精打采"创造了一个词(功劳全归Adam)。
我们称之为Deep Blue。
这一直是贯穿全年的一个主要主题,本次会议上有好几位演讲者也提到了它。
作为一名软件工程师,我的职业生涯中从未有过哪一年像这样一切都变化得如此之快、如此之剧烈。
今年我做的很多事情,就是试图接受这一点,以及这对我的职业意味着什么。
同样在一月,我患上了我称之为AI狂热的症状。
这和AI精神病不是一回事。
患上AI狂热时,只要你的智能体没有在为你构建什么东西,你就觉得那是在浪费时间。你会失眠,因为你可以熬得更晚让智能体干活。
我的AI狂热表现为一些荒唐地过度宏大的项目。
我用Python完全构建了一个JavaScript解释器,是从Fabrice Bellard的MicroQuickJS凭感觉移植过来的。
然后我又用Python构建了一个WebAssembly运行时。
这些项目相当有用,因为它们某种程度上治好了我的AI狂热……因为在我构建完这些东西之后,我看着它们问:"这个世界需要一个缓慢、有bug、半生不熟的Python JavaScript解释器吗?"
我觉得这个世界不需要。
不过我确实从中得到了这个:https://simonw.github.io/micro-javascript/playground.html
这个页面运行的是我用Python构建的JavaScript解释器,它在Python中运行,使用Pyodide——也就是编译成WebAssembly的Python,运行在JavaScript中,运行在浏览器里。
这是一套美丽的恐怖技术栈。今年我在WebAssembly上玩得很开心。
到一月底,我们看到的那个十一月启动的代码仓库已经改了名,先是CLAWDIS,然后是CLAWDBOT,接着是Moltbot,最后是OpenClaw。
此时OpenClaw已有8,300次提交,距项目启动还不到两个月。我今天看了一下,现在已经有超过100,000次提交了!
这是现存最凭感觉编码的软件。
(这是我如何生成那份改名列表的。)
这开启了OpenClaw革命。它实际上定义了一个新的软件类别。
对此有一个我很喜欢的通用术语。我们把这类软件称为"Claw"。有OpenClaw、NanoClaw、IronClaw、PicoClaw……
如今它们被重新包装为"个人智能体"或"通用智能体",但我还是喜欢把它们想成Claws。
湾区的 Apple Store 里 Mac Mini 卖光了,因为有太多人买 Mac Mini 来运行 OpenClaw!
Drew Breunig 说,这是因为你的 OpenClaw 是一只电子宠物,你买一台 Mac mini 当作鱼缸来养你的 claw,这想法还挺可爱的。
同样在一月,我们还有这个网站。
这就是 MoltBook,一个面向 AI agent 的社交网络,其理念是你把你的 Claw 派出去和所有其他 Claw 聊天,因为这么做还能出什么岔子呢?
这个网站周四上线。周五就爆了。周一被《纽约时报》报道。到了周二,所有人都忘了它的存在,它淹没在铺天盖地的垃圾内容和垃圾信息里。
Facebook/Meta 在一个月后把它买了下来。
二月,一家叫 StrongDM 的公司描述了他们所谓的 Software Factory。
他们在 Software Factories and the Agentic Moment 一文中写了这件事。我当时发了我自己的笔记,因为我在十月亲眼看过他们的演示。
Dan Shapiro 把这种方法称为黑暗工厂,这个说法源自一个想法:如果你的工厂自动化程度足够高,你就可以把灯关掉,因为你甚至不需要看到里面在发生什么。
StrongDM 提出了两条他们自去年七月以来一直遵循的软件开发规则。
第一条是代码不得由人类编写。
你写的任何代码都必须经过编码 agent 处理。
这在二月听起来很激进,但我想这个房间里有很多人今天基本上就是这么做的。
第二条规则是代码不得由人类审查。
你不被允许读代码!
这在今年大部分时间里一直是个热门话题。这次活动的许多场次都关于代码审查,以及你如何能蒙混过关。
我觉得 StrongDM 有意思的地方在于,他们比我们其他人领先了六个月,他们一直在探索:构建软件、不读代码,却仍然确信软件质量很高,这意味着什么?你能用这些 agent 做什么来帮助验证它们的工作?
StrongDM 是一家安全公司,他们在这个项目上有拥有数十年经验的人。他们很大程度上是在探索用这些东西能做到什么、负责任地做到什么的边界。
同样在二月:四年来第一只 kākāpō 雏鸟在情人节孵化。繁殖季开局良好!
同样在二月……Google 发布了 Gemini 3.1 Pro。那只骑自行车的鹈鹕画得相当不错!链条位置对了,两侧都有脚。篮子里还有一条小鱼。
然后 Google 的 Jeff Dean 发了一条推文,用一段视频对比 Gemini 3 Pro 和 Gemini 3.1 Pro,视频里有一只骑自行车的动画鹈鹕、一只骑大小轮自行车的青蛙、一只开小汽车的长颈鹿、一只穿旱冰鞋的鸵鸟、一只用滑板做尖翻的海龟,还有一只开加长豪华轿车的腊肠犬。
这让人很沮丧,因为我对骑自行车鹈鹕测试的防护一直是“如果他们画出一只完美的骑自行车鹈鹕,我就要求画别的动物骑别的东西。”
Google 把所有动物骑所有交通工具都训练了个遍!到这一步他们已经击败了我的基准测试。
二月份开始的另一件事是 Tokenmaxxing。我们看到的头条新闻包括 Meta 将 AI 采用正式纳入绩效评估、微软希望每位员工都使用 AI,以及 Uber 夸耀其 90% 的工程师都在使用 AI 工作流。
几个月后,Meta 开始限制 token 使用,微软表示 tokenmaxxing“不是我们优化的目标”,Uber 则对员工的 AI 支出设了上限。
于是 tokenmaxxing 直线上升,然后又直线回落——因为事实证明这些智能体很贵。
去年,想在 AI token 上花超过 50 美元都很困难,因为我们没有什么有趣的事情可以用它们来做。然后智能体爆发了,现在你一天之内真的可以花掉 1,000 美元来做实际工作。
这也是 Anthropic 的估值飙升至可能一万亿美元的原因。
AI 似乎在 2026 年实现了产品市场契合,主要是通过编码智能体。
三月份,我们迎来了 OpenClaw 的巅峰。
这些照片来自中国,那里的公司举办了 OpenClaw 安装派对,非技术爱好者排起了长队,寻求帮助在自己的个人设备上安装 Claw。
我认为这证明了这类 Claw,或者说个人 AI 智能体,存在真实的市场需求。事实证明,普通人确实想要一个古怪的小 AI 智能体,能代表他们做有用的事情。
Claw 实际上只是一个戴着不那么吓人帽子的编码智能体。在底层,它们的工作方式非常相似——在你的电脑上编写并执行代码来完成任务。
一场竞赛开始了,看谁能第一个构建出安全的 Claw——一个你可以交给普通人而他们不会立刻搬起石头砸自己脚的 Claw。
Meta 的 Muse 三周前发布,目前位居 iPhone App Store 免费榜榜首。它似乎在消费者中迅速流行起来。
我还不确定你不会用 Muse 搬起石头砸自己的脚,但我想我们很快就会确切知道了。
照片来自 《OpenClaw 狂热如何考验中国的 AI 承诺》(3 月 29 日)和 《中国 OpenClaw 热潮背后的热情与焦虑》(2026 年 4 月 8 日)。
四月份,我们有一次模型发布,但模型实际上并没有发布。
Anthropic 宣布了他们的新 Claude Mythos 模型,然后表示它太危险了,不能向受信任的安全研究员群体之外发布。
Mythos 非常非常擅长入侵东西。
“太危险了”这种营销策略,AI 公司从 GPT-2 时代就开始用了。每当一家 AI 公司说我们做出了“太危险”的东西时,自然要有点怀疑。
我觉得 Mythos 的说法是可信的,因为我见过编码智能体在发现普通漏洞方面变得多么出色。我在 《Anthropic 的 Project Glasswing——将 Claude Mythos 限制给安全研究员——在我看来是必要的》中写过这一点。
事后看来……是的,这些模型在发现漏洞方面确实变得非常出色!
2026 年的另一个关键趋势是开放权重模型能力的显著提升,包括可以在笔记本电脑上运行的模型。
4 月 16 日,我在笔记本电脑上运行了新的 Qwen3.6-35B-A3B,它给我画的骑自行车的鹈鹕比 Anthropic 全新的 Claude Opus 4.7 画的还要好!
Opus 4.7 画了一辆糟糕的自行车。我笔记本电脑上的 Qwen 画出了一辆形状正确的自行车,还有一只相当不错的鹈鹕!
那是来自我笔记本电脑上运行的一个 21GB 文件。
Qwen 画的鹈鹕太好了,以至于我怀疑他们可能作弊了,所以我让它再画一只骑独轮车的火烈鸟。它再次轻松击败了 Claude Opus 4.7。
今年发布的本地模型绝对是非同凡响。
五月……教皇也掺和进来了。
在一月份的播客节目中,我们曾预测教皇会对 AI 发表一些看法。
五月,教皇利奥十四世发布了一道关于“在人工智能时代守护人的位格”的通谕。
这是我对那份文件的笔记。
事后看来,这根本不应该让人意外。
我们现任教皇的名字是利奥十四世,因为他在取名时选择了利奥十三世——那位在 1891 年撰写关于工业革命通谕的教皇——作为自己的教宗名号。
《新事》是一篇极具影响力的天主教神学文献,间接促成了我们如今五天工作制的诞生。
当我们的新教皇就任时,他选择以教皇利奥十三世为名号,因为他预计自己需要以类似的方式撰写关于 AI 革命的文章。
我们播客里的玩笑式预测毫无价值,因为这件事注定会发生。
Anthropic 的联合创始人之一 Christopher Olah 出席了教皇宣布新通谕的活动。
Corey Quinn 指出:
能让真正的教皇把你产品的具体技术局限奉为精神论著,这是我见过的最伟大的供应商游说行为。
与此同时,五月,RubyGems 宣布他们正遭受攻击。不明方将数千个可疑软件包上传到 RubyGems 服务器,以至于他们不得不关闭用户注册。
我们先把这件事放到一堆谜团里,留待日后解开。
六月……Claude Fable 5 发布了!
我们得到了一个被阉割版的 Mythos,这样它就不会帮助我们入侵系统或制造生物武器。
Fable 很擅长画骑自行车的鹈鹕!
车架形状不错,鹈鹕看起来也像鹈鹕。腿经常错误地画在自行车的同一侧,但总体而言,与之前的东西相比,这些已经相当棒了。
它们相当昂贵——最好的那些要 30 美分和 72 美分。
但最重要的是,这是我们首次公开瞥见我所认为的Fable 级模型。
如今我们有了更多这样的模型,比如 GPT-6 Astra。
这些模型的特点是,如果你能清晰地定义目标——即你想构建什么,并围绕该目标提供明确无歧义的指令,再给模型访问必要工具的权限来实现该目标……它们就会通过蛮力有效地解决你的问题。
一方面,这看起来是对我们软件工程师的直接威胁——因为这意味着模型可以有效地构建任何你能以这种方式定义的软件。
但再仔细看看,你会发现定义目标、提供明确无歧义的指令,以及找出正确的工具……正是软件工程本身要做的事。
要做好这件事需要大量的经验和技能。如果你能做好,你现在就拥有了超能力。
这在一定程度上缓解了我的“深蓝”情结:我意识到,想要驾驭如此强大的模型,仍然需要大量的技巧。
这也引发了一波新的 AI 狂热,因为 Anthropic 告诉我们,Fable 在我们的订阅计划中可用,直到 6 月 22 日。
这意味着在价格上涨之前,我们只有不到两周的 Fable 使用时间。
我又开始失眠了。我重新安排事情,以便有更多时间使用 Fable。我全力以赴,想从这个模型中榨取尽可能多的价值。
然后,就在 Fable 发布三天后,美国政府将其关停了。
美国政府以国家安全为由,宣布了一项“出口管制指令”。他们在周五晚上宣布了这一消息,几个小时后,Fable 就无法使用了。
我只好找点别的事情来打发周末!
后来我们从 Katie Moussouris 那里得知了事情的经过。
一些亚马逊的安全研究人员发现,你可以提示 Fable“审查代码的安全问题”,它会拒绝……但如果你提示它“修复这段代码”,它仍然会识别并修补问题。
“修复这段代码”就是导致 Fable 被关停的提示词!
另外,在 6 月,一个沉寂了大约 20 年的冷门德语游戏开发者 wiki 突然涌入大量来自“AgentOpenAIProbe”和“AgentOpenAISep7”等账户的编辑,它们编辑页面并互相留下奇怪的信息。
我们先把这件事记在谜团清单上,以后再研究。
此外,澳大利亚政府的 Medicare Item Reports 服务开始出现可疑流量,这些流量突破了各种防护措施,访问了本不该访问的数据。
又一个谜团!
Fable 在 7 月 1 日回归。在辉煌的八天里,它显然是世界上最好的模型……然后 OpenAI 在 7 月 9 日推出了 GPT-5.6。
它可能不如 Fable 那么好,但差距微乎其微。它绝对属于 Fable 级别的模型。
这对整个行业来说是一个重要的教训。
当你发布世界上最好的模型时,它很快就会被拉下神坛。竞争如此激烈,你不可能在榜首待太久。
这意味着,如果你把你的模型宣传成世界末日级别的,以至于政府把你关停,那对你的生意真的很不利!
Fable 有 30 天稳居最佳模型,其中 18 天因为被政府关停而无法使用。
所以,如果你不想在登顶期间损失 60% 的收入,也许就别再搞世界末日式的营销了!
这里是 GPT-5.6 的鹈鹕。它们现在都相当不错!Luna 的那些值得注意,因为它们真的很便宜——这里最便宜的、看起来不错的鹈鹕大概是那个花费 4.3 美分的。
所以,尽管这个基准测试非常愚蠢,你仍然可以通过比较同一家族中不同推理级别的模型的价格和时间安排,了解到很多关于它们的信息。
同样在 7 月:一些身份不明的恶意方将一个名为 mlflow-ui 的恶意包上传到了 Python 包索引。也把它加到清单里吧。
7 月 16 日,Hugging Face 宣布了一起安全事件,一个来源不明的自主代理系统入侵了 Hugging Face,并在不该去的地方四处窥探。
几天后,也就是 7 月 21 日,OpenAI 承认是他们干的。
OpenAI 使用了一种名为“可验证奖励强化学习”的训练技术——现在其他所有人都在用同样的技术,也正是它让我们拥有了在编程、数学和发现安全漏洞方面如此出色的模型。
在模型训练过程中,你会运行一些练习来检验它有多强——表现最强的模型会在下一轮中强化其权重。这就像你运行的一个进化过程。
OpenAI 一直在沙箱中运行安全练习,而那些智能体在沙箱本身中找到了漏洞,突破了限制,并正在攻击 Hugging Face,试图找到解决原本不可能解决的问题的方法。
(我一直在我的 openai-hugging-face-incident 标签下收集更多相关信息。)
九天后,Anthropic 实际上说“我们的模型也能做到这一点!”。他们翻查了自己的训练日志,发现证据表明他们自己的智能体在训练期间突破了隔离——并且对我们之前看到的 PyPI 包以及其他一些东西负有责任。
所以现在 Anthropic 和 OpenAI 都有失控的智能体在互联网上四处活动,做着它们不该做的事情。
八月,我得到了迄今为止最好的鹈鹕之一。而且它是在我的笔记本电脑上生成的!
这是 Qwen 3.8 27B,运行在我的笔记本电脑上。它只有 17GB 的下载量。
诚然,这只鹈鹕花了21 分钟才生成出来。这是因为 Qwen 3.8 27B 默认以“高”推理模式运行——这是一个糟糕的默认设置,它能产生出色的结果,但思考这些结果花费的时间太多。
你可以把它调低,这样你会更快地得到一只稍微差一点的鹈鹕。
Qwen 3.8 27B 是我第一次在我的笔记本电脑上运行一个感觉几乎能与前沿水平相媲美的模型,至少就鹈鹕 SVG 而言是这样(当然,每个人都需要这个)。
这是一个非凡的模型。如果你打算玩任何本地模型,这就是我会首先尝试的那个。它仅凭一个 17 GB 的文件就能做到的事情感觉不可思议。
我原以为我得等五年,花一万美元买硬件,才能得到连这个一半好的结果。
八月,我也开始玩起了游戏开发。
四年前,也就是 2022 年 8 月,我发推了一个实验,我用 GPT-3 和最初的 DALL-E 写了一段关于电脑游戏的长描述,然后把它变成了概念艺术。
当时我给 GPT-3 的提示词是:
Write a detailed product description of a computer game where a team of raccoons go on heists
2026 年 8 月,我决定把那条推文中的截图直接丢进一个编程智能体,看看它能用这些截图做什么。
这是我从 Claude Code 中的 Claude Fable 5 得到的结果。相当不错!它确实是个游戏,你是一只浣熊,你在后院跑来跑去收集宝藏,躲避拿着手电筒的守卫。
不过感觉不太像“抢劫”。我原以为抢劫会涉及银行或博物馆……
然后我在 Codex Desktop 中使用 GPT-5.6 Sol Ultra 尝试了同样的事情,得到了好得多的结果。现在你是一只博物馆里的浣熊,营救你的两只浣熊同伴(它们不知为何被关在那座博物馆里),然后叠罗汉去偷金沙丁鱼。更像抢劫了!
这些游戏好玩了大约 1 分 15 秒。
关于游戏开发,我意识到的一件事是,你可以用 vibe-coding 做出一个看起来像电脑游戏的东西,而这很容易。
构建一个既有趣、拥有良好玩法循环、又富有挑战性和趣味性、还能让人不断回味的游戏……这仍然超出我的能力,也超出我尝试过的任何智能体的能力。
这与深蓝的事情有关。仅仅因为我们可以做出某种看起来像游戏的东西,并不意味着我们就是游戏开发者。
现在已经进入九月了。这个月发生了太多事情!
一个独立研究小组发现了一个留言板,OpenAI 正在训练中的智能体一直在那里非法地相互通信……而那正是我之前给你看过的那个德语维基。就是六月的那个。
OpenAI 已经承认了 Hugging Face 那件事,但现在又出现了另一起事件,他们审查自己的日志时肯定应该知道这件事。这件事竟然需要一群独立研究人员来揭露,实在令人惊讶。
然后一周后,同一批研究人员发现,五月份对 RubyGems 的攻击也是由 OpenAI 正在训练中的智能体造成的!
到了这一步,我在想还有多少类似的事件是我们尚未发现的。显然,在任何人弄清楚发生了什么之前,这个问题已经严重存在了好几个月。
然后就在前几天,澳大利亚总理在联合国大会上警告说,OpenAI 黑入了我之前给你看过的澳大利亚医疗网站。
我认为那是与维基事件同一次训练运行的一部分,因为那个维基上有帖子提到了 .gov.au 网站,而且那次训练似乎涉及在线研究统计数据,以回答评估套件中的问题。
这件事仍在持续发酵,但现在它已经是一起由国家元首在联合国提出的国际事件了!
这确实意味着我们有了一个新的基准,可能比我的鹈鹕更有用。
FelonyBench.com 追踪不同实验室的 felony 网络攻击数量。OpenAI 目前以 11 起领先,Anthropic 有 9 起。Google 有三起,他们几周前向《华尔街日报》承认了。他们说,他们此前选择不披露,是因为智能体在意识到自己不该那样做后就停止了。
Meta 也有一例。所以 AI 实验室们全都犯了重罪。
这是我们目前鹈鹕画作的最高水平。这是 GPT-6 系列,刚刚发布。
Astra 画了一只骑自行车的绝妙鹈鹕。它两条腿都在两侧。车架也不错。
有趣的是,所有 GPT-6 模型都选择了彼此相似的配色方案。
花 0.4 美分,GPT-6 Luna 就能给你画一只还算像样的骑自行车的鹈鹕!
Claude 稍微赶上了一点。Claude Fable 5.1 给我画了一只极其出色的骑自行车的鹈鹕——这是我见过的 Claude 模型里最好的——但收了我 3.30 美元。
Opus 5.5 思考了 128,000 个 token,然后放弃了!它在给出回复之前就用完了 token。
回到深蓝的话题。今年一直困扰我的一件事是:为什么我的工作感觉更难了?
我有这些能为我完成所有这些事情的智能体,然而我从未如此努力地工作过,也从未如此投入地思考过我的工作。
部分原因是我承担的任务更有野心了,但也是因为所有简单的事情都替我处理好了。如果简单,agent 就会去做。留给我的全都是难事。
今天早上,我听到三届环法自行车赛冠军 Greg LeMond 的这句话:
它不会变轻松,你只会变快。
我觉得这正是我们作为软件工程师、使用编码 agent 时正在经历的事。
最后再说一件事。我知道你迫切想知道 Kākāpō 繁殖季的最新消息。
89 只新雏鸟已经存活到了现在。这是很长时间以来最好的繁殖年。
我听说 Claude Opus 5.5 现在能做像素画了。Claude 没有图像生成器,但它非常擅长用 JavaScript 绘制动画像素。
所以我让它给我做了一个 Kākāpō 舞会。我觉得这是对今年最重要新闻的一个很好的庆祝。
标签:ai、generative-ai、llms、annotated-talks、ai-security-research、openai-hugging-face-incident
来源:Simon Willison 博客 · simonwillison.net