跳到正文
北京时间

大佬观点

行业关键人物在想什么:创始人访谈、研究者论战、投资人判断的观点集合。

283条精选相关主题现象与趋势行业动态

最新精选

第 221–240 条 · 共 283 条
2月5日周四
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)78

    用并行Claude智能体团队从零构建C编译器

    研究人员采用“智能体团队”方法,让多个Claude实例在无人工干预下并行协作开发代码。为进行压力测试,团队指派16个智能体从零编写一个能编译Linux内核的Rust版C编译器。项目消耗近2000次会话和约2万美元,最终产出10万行代码的编译器,可成功在x86、ARM和RISC-V架构上构建Linux 6.9内核。研究重点在于设计支持长时间自主运行的智能体团队框架,包括如何编写测试以保持智能体不偏离方向,以及如何通过基于文本文件的锁机制协调多智能体并行任务分配。

    推荐理由:Anthropic 研究员用 16 个 Claude 并行写了个能编译 Linux 内核的 C 编译器,2000 次会话花了两万刀。真正值钱的不是编译器本身,而是他总结的 agent 团队协作方法论,做多 agent 系统的人该逐段拆。

2月4日周三
  1. Jim Fan72

    作者指出,AI预训练正经历从“下一个词预测”到“世界建模”的根本性范式转变。世界模型的核心是预测给定行动后的下一个物理状态序列,本质上是可学习的物理模拟器,并将视觉置于首位。相比之下,当前主流的视觉语言模型本质是语言优先,视觉是次要输入。生物智能中视觉处理占据皮层计算的主导地位,是连接大脑、动作与物理世界的高带宽通道。作者以猿类为例,证明强大的物理智能可独立于高级语言存在。他预测,2026年大型世界模型将为机器人技术和多模态AI奠定真正基础,而YouTube等平台的海量视觉数据将远超文本规模,推动这一新范式发展。

    推荐理由:Jim Fan 把世界模型定义为第二次预训练范式转移,核心论点是视觉优先而非语言优先,这个框架对做机器人和多模态的人是真正的路线判断,不是又一篇水文。

1月28日周三
  1. Ethan Mollick:One Useful Thing(RSS)

    管理是 AI 的超能力

    智能体(agents)时代,管理能力将成为人类 thriving 的核心超能力。在 AI 主导的未来,懂得如何管理比单纯的技术能力更能决定成败。

    推荐理由:沃顿教授 Ethan Mollick 深度解析 Agent 时代的管理变革与机遇

1月27日周二
1月22日周四
  1. Nathan Lambert:Interconnects(RSS)

    精通 Agents

    AI Agents 的能力正逼近关键临界点,其性能飞跃已超出传统工作模式的承载范围。这要求从业者必须重新界定工作范畴、重构项目管理流程并革新任务执行策略。从需求规划到交付标准,现有方法论面临全面调整,组织与个人亟需掌握与智能体协作的新范式,以适应这一技术变革带来的深层影响。

    推荐理由:Agent工具迫使开发者重构工作流,资深研究者分享进阶路径

  2. METR:Notes(网页)62

    METR 时间视界论文作者澄清时间视界的局限

    METR 时间视界论文主要作者发文澄清该指标的常见误读,称过去 9 个月 AI 时间视界增长约 6 倍。

    推荐理由:作者作为论文主要作者逐条澄清方法局限,读者可据此更准确地使用和理解时间视界这类指标。

1月21日周三
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)72

    设计抗AI技术评估的实践

    Anthropic性能优化团队负责人Tristan Hume分享了设计抗AI技术评估的经验。自2024年初,团队使用带回家测试评估候选人优化模拟加速器代码的能力,超1000人参与,成功招聘数十名工程师。但随着Claude模型快速迭代,Opus 4已超越多数人类申请者,Opus 4.5甚至匹配顶尖候选人,导致在时间限制下难以区分人类与AI输出。为此,作者三次重设计测试,探索抗AI评估要素,详述原始设计、模型破解方式及非常规对策。最终,团队将原始测试作为公开挑战发布,因无时间限制时人类表现仍优于Claude。

    推荐理由:Anthropic 性能优化负责人亲手写了三版面试题被自家模型逐一击穿的全过程,这种坦诚的工程复盘比任何 AI 能力排行榜都更真实地告诉你,模型到底强到了什么程度。

1月10日周六
  1. Nathan Lambert:Interconnects(RSS)

    Claude Code 与众不同

    Claude Code 集成 Opus 4.5 模型实现关键突破,编程智能体跨越重要能力阈值。此次升级标志着编码代理在自主性和工程处理能力上达到新水平,可应对更复杂的开发任务。Opus 4.5 显著提升了代码生成、调试及复杂问题解决的表现,使 AI 辅助编程从基础工具向高效协作伙伴转变,为开发者带来质的不同的使用体验与效率提升。

    推荐理由:编码 Agent 跨越关键门槛,Claude Code 能力跃升将重塑开发者工作流

1月1日周四
  1. Dario Amodei:Blog(网页)

    技术的青春期

    Dario Amodei 将当前 AI 发展阶段定义为「技术的青春期」,认为人类即将获得难以想象的力量,但社会和政治系统是否具备驾驭成熟度仍存疑。文章强调需避免「末日论」式恐慌,以务实、基于事实的方式讨论风险,同时承认 AI 发展速度和风险的不确定性。作者主张通过企业自愿行动与精准政府监管相结合,在避免过度干预的前提下应对潜在危险,为可能到来的更强有力行动储备证据和方案。

    推荐理由:Anthropic CEO 长文剖析 AI 文明风险与治理路径,值得深读。

12月31日周三
  1. Dwarkesh Patel:Podcast & Blog(RSS)

    Adam Marblestone — AI 缺失了关于大脑的根本认知

    Adam Marblestone 指出,当前人工智能研究忽略了大脑运作的核心机制。与业界普遍关注神经网络架构不同,大脑的真正优势在于其奖励函数而非结构本身。这一观点挑战了主流 AI 研究范式,暗示未来突破可能来自对大脑激励系统的深入理解,而非单纯的架构模仿。该论断为人工智能发展提供了新的思考维度。

    推荐理由:AI研发或应转向奖励函数设计,而非一味堆叠架构复杂度

12月29日周一
  1. Jim Fan

    硬件方面,Optimus等虽工程精湛,但可靠性不足严重限制软件迭代,且维护成本高昂。基准测试领域仍处混乱,缺乏统一的硬件平台、任务定义和评分标准,cherry-picking现象普遍,可复现性堪忧。VLA(Vision-Language-Action)方法基于VLM存在本质缺陷:VLM为视觉问答优化,参数侧重语言知识而非物理理解,且视觉编码器丢弃低层细节,不利于精细操作。作者认为视频世界模型是更优的预训练目标。

    推荐理由:NVIDIA科学家揭示机器人学三大痛点:硬件拖累迭代、基准混乱、VLA路线存在根本缺陷

12月27日周六
  1. Jim Fan

    2024:AI 是 copilot 2025+:人类是 copilot Copilot 是新的工程技能。离开驾驶座并不容易——我们必须学会用 AI 的方式思考,并适应陌生的工作流。帮助 AI 帮助我们自己。 [引用 @karpathy]:作为程序员,我从未感到如此落后。这个职业正在被剧烈重构,因为程序员贡献的比特越来越稀疏且穿插其间。我感觉如果能恰当地串联起过去大约一年里出现的东西,我可以强大 10 倍,而未能获得这种提升感觉绝对是技能问题。除了下面通常的层之外,还有一个新的可编程抽象层需要掌握,涉及代理、子代理、它们的提示词、上下文、记忆、模式、权限、工具、插件、技能、钩子、MCP、LSP、斜杠命令、工作流、IDE 集成,以及需要建立一个全面的心理模型来理解那些本质上随机的、易错的、不可理解的且不断变化的实体的优势和陷阱,这些实体突然与过去那种传统的工程实践交织在一起。显然某种强大的外星工具被传递开来,只是它没有附带说明书,每个人都必须弄清楚如何握持和操作它,而由此产生的 9 级地震正在震撼这个职业。卷起袖子以免落后。

    引用Andrej Karpathy@karpathy

    作为一名程序员,我从未感到如此落后。这个职业正在被剧烈地重构,程序员所贡献的比特越来越稀疏、零散。我有一种感觉,如果我能把过去大约一年里涌现出来的东西妥善地串联起来,我可能会强大 10 倍,而未能抓住这波提升,感觉分明就是能力问题。有一层新的可编程抽象层需要掌握(除了下面那些惯常的层级之外),涉及智能体、子智能体、它们的提示词、上下文、记忆、模式、权限、工具、插件、技能、钩子、MCP、LSP、斜杠命令、工作流、IDE 集成,并且需要为那些从根本上随机、易错、难以理解且不断变化的实体建立起一个包罗万象的心智模型——这些实体突然与过去那种老派良好的工程实践混杂在一起。显然,某个强大的外星工具被传了一圈,但它没有附带说明书,每个人都得自己摸索怎么拿、怎么操作,而由此引发的 9 级地震正在撼动整个职业。卷起袖子干吧,别掉队。

    推荐理由:顶级研究者警示编程职业正被重构,掌握Agent编排成为工程师新必修课

12月24日周三
  1. Jim Fan

    作者虽晚购特斯拉却率先体验FSD v14,认为这是首个通过"物理图灵测试"的AI系统:疲惫下班后只需按下按钮放松休息,已无法分辨是神经网络还是人类在驾驶。尽管深知机器人学习原理,方向盘自动转动时的流畅表现仍令人震撼。这项技术正从超现实体验转变为日常习惯,最终如智能手机般不可或缺。这种对"神级技术"的深度依赖,正在从根本上重塑人类行为模式。

    引用Phil Duan@pduan

    参与无监督 FSD 测试的随行体验 https://t.co/AsyBHnndj8

    推荐理由:当AI驾驶让你无法区分人机时,出行方式的底层信任逻辑将被重写

12月23日周二
  1. Saining Xie

    不想陷入哲学辩论,但这本书确实改变了我对这个话题的看法,让我更加谦逊。人类智能令人印象深刻,但称其为"通用"并不太客观。我的猫会不同意。 在我看来,人类智能更应被视为社会驱动的认知适应,而且我们仍不理解、也远未用当前 AI 复现的智能领域还有巨大 WORLD。 [引用 @demishassabis]:Yann 在这里完全错了,他把通用智能和 universal intelligence 混淆了。 大脑是我们在宇宙中所知最精致、最复杂的现象(迄今为止),而且它们实际上极其通用。 显然,没有人能规避 no free lunch theorem,因此在实际且有限的系统中,总是必须围绕正在学习的目标分布有一定程度的专门化。 但关于通用性的要点在于,理论上,在 Turing Machine 的意义上,这种通用系统的架构能够在给定足够时间和内存(以及数据)的情况下学习任何可计算的东西,而人脑(和 AI foundation models)是近似 Turing Machines。 最后,关于 Yann 对国际象棋棋手的评论,人类竟然能发明国际象棋(以及现代文明的所有其他方面,从科学到 747s!),更不用说像 Magnus 这样的人能下得如此出色,这本身就令人惊叹。他可能不是严格最优的(毕竟他有有限的记忆和有限的决策时间),但考虑到我们的大脑是为狩猎采集而进化的,他以及我们能用大脑做到这些,实在令人难以置信。

    引用Demis Hassabis@demishassabis

    Yann在这里完全说错了,他把通用智能和万能智能混为一谈了。 大脑是我们在宇宙中(迄今为止)所知的最精妙、最复杂的现象,而且它们事实上极其通用。 显然,人们无法绕过“没有免费午餐”定理,因此在一个实际且有限的系统中,总得围绕所学习的目标分布存在某种程度的专门化。 但关于通用性的要点在于,从理论上讲,在图灵机的意义上,这样一个通用系统的架构能够在给定足够时间、内存(和数据)的情况下学习任何可计算的东西,而人脑(以及AI基础模型)都是近似的图灵机。 最后,关于Yann对国际象棋棋手的评论,令人惊叹的是人类竟然能首先发明国际象棋(以及现代文明从科学到747飞机的所有其他方面!),更不用说像Magnus这样的人能把它下得如此出色。他可能并非严格意义上的最优(毕竟他的记忆有限,做决定的时间也有限),但考虑到他和我们的大脑是为狩猎采集而进化出来的,我们能用大脑做到的事情实在令人难以置信。

    推荐理由:顶级科学家对AGI本质的深刻思辨,重新定义通用智能的边界与局限

12月3日周三
  1. Dwarkesh Patel:Podcast & Blog(RSS)

    对 AI 进展的思考(2025年12月)

    作者对人工智能发展作出阶段性预判:短期内持温和看跌态度,认为行业可能面临调整期或增速放缓;长期来看则极度看涨,预期将迎来爆发式增长。这一观点揭示了技术成熟度曲线中短期波动与长期变革潜力之间的典型张力,为2025年底的 AI 发展态势提供了审慎而前瞻的研判框架。

    推荐理由:顶级AI播客主持人对AGI发展节奏的宏观判断,短期谨慎与长期爆发的前瞻视角值得参考

11月28日周五
  1. Ilya Sutskever

    我之前说的一点没被传达清楚: - 继续扩展当前的技术会持续带来进步。特别是,它不会停滞。 - 但某些重要的东西仍会继续缺失。 [引用 @haider1]:以下是今天 ilya sutskever 播客的要点: - 5-20 年内实现超级智能 - 当前的扩展将严重停滞;我们回到了真正的研究 - 超级智能 = 超快速的持续学习者,而非完成的预言机 - 模型的泛化能力比人类差 100 倍,这是最大的 AGI 阻碍 - 需要全新的 ML 范式(我有想法,现在不能分享) - AI 影响将很剧烈,但只在经济扩散之后 - 历史上的突破几乎不需要算力 - SSI 有足够的专注研究算力来获胜 - 当前的 RL 已经比预训练消耗更多算力

    引用Haider.@haider1

    以下是今天伊利亚·苏茨克维播客中最重要的几点: - 超级智能将在5-20年内出现 - 当前的扩展将严重停滞;我们回到了真正的研究 - 超级智能 = 超快速持续学习者,而非完成态的预言机 - 模型的泛化能力比人类差100倍,这是AGI最大的障碍 - 需要全新的机器学习范式(我有想法,现在不能分享) - AI的影响将很猛烈,但只有在经济扩散之后才会显现 - 历史上的突破几乎不需要算力 - SSI拥有足够的专注研究算力来取胜 - 当前的强化学习消耗的算力已经超过预训练

    推荐理由:顶级科学家修正观点:Scaling将持续有效但无法触及AGI核心,亟需范式革命

11月27日周四
  1. Saining Xie

    Meta研究人员透露,Facebook自2020年起使用TPU训练AI,由Kaiming He领导开发TF和JAX代码库,MAE、DiT等模型完全基于TPU构建。因内部采用有限,Meta于2023年取消GCP协议。推文指出,Google、Anthropic等实验室长期使用TPU训练大模型,Nvidia的CUDA护城河并非不可逾越,OpenAI亦投资Triton寻求替代。TPU与GPU的效率差异并非关键,系统工程人才才是决定性因素。

    引用Clive Chan@itsclivetime

    我不断看到关于 TPU 的东西,有什么实质性的新进展吗? 没有证据表明 Google 曾在非 TPU 硬件上训练过 Gemini,这可以追溯到多年前 GPT 之前的模型,比如 BERT。TPU 比 Nvidia 自己的张量核心还要早。 Anthropic(以及 Character、SSI 和 Midjourney……)长期以来一直在使用 TPU,如果 Meta *没有* 在考虑它们,我会感到惊讶。 Nvidia 的护城河对大型实验室来说从来都不深——看看 OpenAI 决定它可以做得比 CUDA 更好,转而投资 Triton,在基准测试中经常胜过 CUDNN。这一切都没有什么神奇或结构性的东西,只是优秀的工程师在做优秀的工作。 TPU 并不比 GPU 高效多少,而微小的性能/功耗差异与 Meta 是否拥有正确的内核/系统工程人才来做到这一点相比,简直微不足道。Nvidia 和 Google 的护城河都很小,我们仍然处于个别优秀工程师就能扭转整个平衡的阶段。见下面的旧帖。 这难道……没有被定价进去吗?这些都是超级古老的公开信息。

    推荐理由:何恺明团队2020年起用TPU训练MAE/DiT,Nvidia护城河比想象更浅

11月26日周三
  1. Saining Xie

    好吧,有人已经向我们宣扬这个大概6年多了 很高兴我们已经过了"感受AGI"的阶段,回到了构建人类水平智能的道路上 https://t.co/Qp8FyLPaQU [引用 @dwarkesh_sp]:"AGI和预训练发生的事情是,在某种意义上它们过冲了目标。 你会意识到人类并不是AGI。因为人类缺乏大量的知识。相反,我们依赖持续学习。 如果我培养出一个超级聪明的15岁孩子,他们其实什么都不知道。一个优秀的学生,非常渴望学习。[你可以说,]'你去当程序员吧。你去当医生吧。去学习和成长。' 所以你可以想象,部署本身将涉及某种学习试错期。这是一个过程,而不是你扔下一个成品就完事了。" @ilyasut

    引用Dwarkesh Patel@dwarkesh_sp

    “AGI 和预训练发生的事情是,从某种意义上说,它们超出了目标。 你会意识到,人类并不是 AGI。因为人类缺乏大量知识。相反,我们依赖持续学习。 如果我培养出一个超级聪明的 15 岁少年,他们其实什么都不太懂。一个优秀的学生,非常渴望学习。[你可以说,]‘你去当程序员。你去当医生。去学习吧。’ 所以你可以想象,部署本身会涉及某种学习试错期。这是一个过程,而不是你直接拿出成品。” @ilyasut

    推荐理由:Ilya重新定义AGI路径,持续学习将取代预训练成下一代模型焦点

  2. Dan Hendrycks78

    AI 安全研究者 Dan Hendrycks 在 X 上发布对 Claude Opus 4.5 与 Google Gemini 3 的横向评测,包含文本、视觉与安全三个维度的指数得分。结果显示:在控制推理令牌数后,两者文本能力相当;Gemini 3 在图像/视觉任务上显著领先;而 Opus 在对抗性测试(如越狱、诚实性)中表现更优。图表显示了 7 模型的文本能力(Gemini 3 Pro 47.6 领先)、视觉能力(Gemini 3 Pro 57.1 最高)及安全指数(Opus 33.6 最低,即最安全)。

    推荐理由:该评测由知名 AI 安全研究者主导,数据维度全面(文本、视觉、安全),且直接对比当前头部模型,为读者提供了可量化的横向参考;尤其安全指标反常识(越低越好),有助于理解“能力”与“安全性”的权衡,对选型和风险评估有实用价值。

11月19日周三
  1. Ethan Mollick:One Useful Thing(RSS)

    从 GPT-3 到 Gemini 3 的三年

    GPT-3 发布至 Gemini 3 的三年间,大模型技术完成从聊天机器人(chatbots)到智能体(agents)的范式跃迁。

    推荐理由:Ethan Mollick 深度回顾 AI 三年演进,剖析从聊天机器人到 Agent 的变革趋势