跳到正文
北京时间

大佬观点

行业关键人物在想什么:创始人访谈、研究者论战、投资人判断的观点集合。

283条精选相关主题现象与趋势行业动态

最新精选

第 181–200 条 · 共 283 条
4月27日周一
  1. Hacker News 热门(buzzing.cc 中文翻译)71

    为什么 SWE-bench Verified 不再衡量前沿编码能力

    OpenAI宣布停止使用SWE-bench Verified基准评估前沿编码能力。该基准基于GitHub历史问题构建,其任务分布已无法准确反映当前AI编码助手需解决的实际问题类型。随着模型性能提升,基准测试集趋于饱和,区分度下降,现有模型表现已接近人类水平。因此,团队将转向更具挑战性和现实复杂度的新评估方法。

    推荐理由:OpenAI 亲自给 SWE-bench Verified 判了死刑,这比任何第三方评测都有说服力。做 coding agent 选型的人该认真想想,你的 benchmark 体系是不是也该换了。

4月24日周五
  1. Simon Willison 博客74

    通过半官方Codex后门API为GPT-5.5生成“骑自行车的鹈鹕”

    尽管GPT-5.5的官方API尚未发布,但作者利用OpenAI为OpenClaw等工具开放的订阅集成机制,通过反向工程开源Codex CLI,开发了一个LLM插件。该插件允许付费订阅用户通过Codex后端API调用GPT-5.5模型。文章以生成“骑自行车的鹈鹕”SVG图像为例,展示了其使用效果,并指出高推理强度设置能显著提升输出质量,但耗时更长。目前,OpenAI表示正与合作伙伴制定API大规模服务的安全要求。

    推荐理由:Simon Willison 不只评测 GPT-5.5,还顺手逆向 Codex 做了个用订阅跑 API 的插件。定价翻倍、xhigh 模式四分钟出图这些细节,比官方通稿有用十倍,做选型的人该看这篇而不是 OpenAI 博客。

4月23日周四
  1. Cognition 模型 / Devin 博客(网页)63

    Cognition 复盘两年构建 Devin 云智能体基础设施的经验

    Cognition 基于两年 Devin 开发经验复盘构建云智能体的两大投入:基础设施与组织变革。文章指出容器共享内核存在逃逸风险、无法在异步间隙可靠保存状态,其方案是 microVM 隔离和 hypervisor 级整机状态快照;编排层花了超过三个季度才能管理数千并发 VM。

    推荐理由:Cognition 以两年 Devin 建设经验拆解云智能体在隔离、状态快照和编排上的真实投入,并给出组织落地的具体路径。

4月22日周三
  1. Cognition 模型 / Devin 博客(网页)72

    Cognition 复盘多智能体实践:写操作单线程加辅助智能体才真正有效

    Cognition 发布长文复盘,称自《Don't Build Multi-Agents》十个月后,其多智能体系统已在生产中可用,核心模式是写操作保持单线程、其他智能体只贡献智能。

    推荐理由:作者基于自家生产环境实验总结多智能体落地模式,给出干净上下文评审、跨模型路由等可迁移的工程经验。

4月21日周二
  1. Gary Marcus:The Road to AI We Can Trust(RSS)60

    请不要相信你的聊天机器人提供的医疗建议

    四项独立研究一致表明,不应信任聊天机器人提供的医疗建议。这些研究均指向同一结论,显示AI对话系统在医疗咨询场景中存在显著的可靠性缺陷与安全隐患,可能给出不准确甚至危险的健康指导。专家强烈警告用户避免依赖ChatGPT等工具进行疾病诊断或用药决策,强调寻求专业医疗人员帮助的必要性。

    推荐理由:Gary Marcus 用四篇新研究再加个人悲剧,把“别用聊天机器人看病”这件事讲成了必须认真对待的警告。数据扎实,故事揪心,值得每一个随手问 AI 的普通人读一下。

  2. Nathan Lambert:Interconnects(RSS)60

    解读当前开放与封闭模型的性能差距

    文章剖析了决定开源与闭源AI模型单一评估数字的复杂因素,探讨了当前两者之间的性能鸿沟及其成因,同时预测了未来这一差距的演变趋势。分析指出,评估指标背后涉及数据质量、训练规模、架构优化等多重变量,而随着开源社区技术迭代和评估体系完善,开放模型与封闭模型的能力边界将持续动态变化。

    推荐理由:Nathan Lambert 把开源闭源差距从单一数字拉回到任务演化的动态里,做产品的人读完后会对那些追赶 benchmark 的宣传多一层怀疑,值得一读。

4月17日周五
  1. Linear:Now(RSS)61

    设计不是产出:AI 工具无法替代对问题的理解

    设计行业常将“设计”误解为产出界面或代码的行为,但真正的核心在于理解问题本身,找到形式与上下文的良好匹配。AI 工具能快速生成看似精美的输出,却往往绕开对底层问题的深入探索,导致产品表面光鲜但实际使用中脆弱、缺乏整合。设计仍需判断、对话、张力与时间,其价值在于通过动手工作逐步获得理解,而非仅仅依赖生成结果。

    推荐理由:这篇文章直指AI设计工具的误区,生成界面不等于做设计。真正难的是理解问题而不是产出视觉形式,做产品的都该读一读。

4月16日周四
  1. Dwarkesh Patel:Podcast & Blog(RSS)79

    黄仁勋谈 TPU 竞争、对华芯片销售与 Nvidia 的供应链护城河

    黄仁勋表示,Nvidia 已具备支撑未来数年万亿美元级业务规模的供应链体系。这一表态印证了公司在 AI 芯片领域的供应链护城河优势,回应了市场对其产能扩张能力的关切。访谈同时涉及应对 Google TPU 竞争及向中国出售芯片的策略考量,凸显 Nvidia 在复杂市场环境下的长期布局信心。

    推荐理由:Jensen首次承认没投Anthropic是错判,对华芯片禁运的态度也极其强硬,这期访谈是他近半年最坦诚的战略交底,做硬件和做政策的都该听一遍。

4月10日周五
  1. Nathan Lambert:Interconnects(RSS)60

    Claude 神话与对开放权重的误导性恐慌

    针对开放权重模型的恐慌情绪缺乏事实依据,围绕 Claude 等模型的安全争议存在明显的神话化倾向。作者批评这种对开源 AI 的恐惧散布是误导性的,认为所谓开放权重威胁论如同"又一场围绕开源的舞蹈",呼吁业界理性看待开源模型的安全性与价值,避免被无根据的安全恐慌所左右。

    推荐理由:Nathan Lambert 对 Claude Mythos 引发的反开放权重恐慌提出关键反驳,认为问题被简化为全面禁令,忽略时间滞后本身就是安全阀,观点冷静且值得政策讨论者细读。

4月5日周日
  1. Andrej Karpathy

    AI正赋能民众反向提升政府透明度与问责制。历史上政府使社会"可读",而AI让民众具备解析政府海量数据的能力。政府问责的瓶颈并非数据公开,而是处理原始信息的智能——如冗长法案虽法律透明却难以实用理解。AI不仅赋能专业记者,更让普通民众能解析预算、立法差异、游说关系等复杂信息,地方政府场景同样适用。尽管技术存在双刃剑风险,但作者对民主社会因参与度和透明度提升而改善持乐观态度。

    引用Harry Rushworth@Hrushworth

    英国政府是一头复杂的巨兽。几十个部门、数百个公共机构、数不清的公司…… 其复杂程度之高,以至于连一张组织架构图都没有。 好吧,以前没有…… 隆重推出 ⚙️Machinery of Government⚙️ https://t.co/YRt8r3yHyn

    推荐理由:AI让普通人能读懂4000页法案,政府透明度与问责制将迎来质变

  2. Greg Brockman

    一项针对515家初创企业的实地实验显示,AI使用正成为提升商业表现的关键技能。研究向一半企业展示AI成功应用案例,结果显示这些企业的AI使用率提升44%,收入增长1.9倍,所需资本减少39%。研究表明AI能显著加速业务发展并降低创业门槛,但企业面临的核心挑战在于如何理解和有效应用这项技术。

    引用Ethan Mollick@emollick

    这是一篇重要论文:对515家初创公司进行的实地实验,其中一半被展示了初创公司如何成功使用AI的案例研究。 这些公司使用AI的频率高出44%,收入高出1.9倍,所需资本减少39%: 1)AI加速业务发展 2)挑战在于理解如何使用它 https://t.co/3verMMjO3e

    推荐理由:OpenAI 总裁分享研究数据,AI 使用使初创企业收入提升 1.9 倍

4月4日周六
  1. Nathan Lambert

    开源模型成功的核心并非基准分数,而是即时且长期的工具支持与可微调性。Gemma 过去在这些方面表现挣扎,而 Qwen 则表现出色,这才是决定模型成败的关键因素。

    引用Interconnects@interconnectsai

    Gemma 4 以及开源模型成功的要素 提示:不是基准分数。 https://www.interconnects.ai/p/gemma-4-and-what-makes-an-open-model

    推荐理由:HF研究员指出开源模型成功关键在工具链与微调支持而非基准分数

  2. Nathan Lambert:Interconnects(RSS)

    Gemma 4 与开放模型成功之道

    Gemma 4 的发布揭示了开放模型成功的真正标准。文章指出,决定模型成败的关键并非基准测试分数(benchmark scores),而是其他因素。当前 AI 领域过度关注 leaderboard 排名,但高分数不等于实际应用价值与社区采用率。真正的成功取决于模型解决真实场景需求的能力、开发者友好度以及生态建设,而非单纯的技术指标领先。这一观点挑战了以 benchmark 为导向的行业评估范式。

    推荐理由:开源模型成败不只看榜单分数,Hugging Face 大佬揭秘真实胜负手

4月2日周四
  1. Gary Marcus:The Road to AI We Can Trust(RSS)

    关于就业,先别恐慌——至少现在还不必

    就业市场即将面临剧烈变革,但短期内无需过度恐慌。尽管未来形势将趋于复杂动荡,大规模冲击不会立即显现,当前仍处于变化酝酿阶段。这种渐进式演变意味着就业者尚有调整与准备的时间窗口,不必对即时性失业风险过度反应。然而,长期结构性转变不可避免,需保持警惕并提前规划。

    推荐理由:Marcus认为AI就业替代不会瞬间发生,但剧烈变革正在路上,理性看待当前焦虑

4月1日周三
  1. Ethan Mollick:One Useful Thing(RSS)

    Claude Dispatch 与界面的力量

    AI 能力已足够强大,但人们仍缺乏趁手的工具和界面来完成实际工作。Claude Dispatch 强调,优秀的界面设计才是释放 AI 全部潜力的关键。

    推荐理由:Ethan Mollick 深度解析 Claude 与 AI 界面力量,洞察工具与能力的鸿沟

3月30日周一
  1. François Chollet

    作者以"Glurg"游戏(实为 chess)假设情境论证:借助现有外部认知基础设施(计算机、互联网等),人类顶尖团队能在24小时内从规则解析开发出3000 Elo引擎,三周内可达3500 Elo且计算效率提升10倍。这表明人类智能已具备即时掌握复杂策略系统的能力,而非从零缓慢进化。该论述回应了关于现实世界更接近 chess 而非 Go 的争论,强调人类利用工具扩展认知边界的即时优势。

    引用Eliezer Yudkowsky@allTheYud

    关于 @fchollet 的观点(我来概括一下):现实生活这个领域更接近国际象棋而非围棋,人类的棋力已经接近最优,顶尖机器也只能让一个马;而不是像人们认为围棋那样,上帝要让五子。(当然,他是在开玩笑。)

    推荐理由:Chollet 用思想实验揭示:人类可从零规则快速构建专家系统,这正是当前 AI 与 AGI 的核心差距

3月29日周日
  1. Gary Marcus:The Road to AI We Can Trust(RSS)

    当前前沿模型视觉理解的幻象

    当前前沿多模态大模型在标准胸部X光问答基准测试中,无需访问任何图像即可获得顶级排名。这一反常现象暴露出模型视觉理解能力的严重缺陷,表明其性能可能依赖数据偏见或文本线索而非真实的图像解析能力。研究揭示了现有视觉语言模型评估体系的深层漏洞,指出所谓"视觉理解"可能只是缺乏真实感知能力的幻觉。

    推荐理由:揭示多模态基准测试漏洞,医学AI应用需警惕数据泄露风险

3月28日周六
  1. Andrej Karpathy

    推主先用LLM花费数小时精心完善博客论点,随后要求其论证相反立场,结果原观点被彻底推翻。这揭示了LLM具备强大的双向论证能力,可令人信服地支持几乎任何立场。这种特性使其成为有效的思维训练工具:通过主动寻求对立观点,可突破认知盲区,形成更独立的判断。但需警惕模型的sycophancy倾向,避免被其迎合性论证误导。

    推荐理由:Karpathy分享用LLM反向论证避免确认偏误的实用技巧,揭示模型可塑性与认知偏差风险

3月27日周五
  1. Andrej Karpathy

    构建现代应用的最大挑战并非代码本身,而是 DevOps 中繁琐的服务集成、API 密钥管理和部署配置。作者期待未来 AI 智能体能自动完成从文档阅读到生产环境部署的全流程,无需人工点击网页或手动配置。Stripe 推出的 Projects 正是朝此方向迈进:开发者可通过 CLI 命令自动配置 PostHog 等第三方服务,实现账户创建、密钥获取和计费设置的自动化,真正将基础设施生命周期转化为代码。

    引用Patrick Collison@patrickc

    当 @karpathy 构建 MenuGen(https://karpathy.bearblog.dev/vibe-coding-menugen/)时,他说: "Vibe coding menugen 作为本地演示是一段令人兴奋又有趣的冒险,但作为已部署的真实应用,就有点像是痛苦的苦差事了。构建一个现代应用有点像组装宜家的未来。有各种各样的服务、文档、API 密钥、配置、开发/生产部署、团队和安全功能、速率限制、定价层级。" 我们在用智能体构建时都遇到过这个问题:你必须匆匆忙忙地去创建账户,在浏览器里点来点去,仿佛回到了 2023 年那种上古时代,才能解除阻碍它那超级智能的进展。 所以我们决定构建 Stripe Projects,帮助智能体从 CLI 即时配置服务。 例如,只需运行: $ stripe projects add posthog/analytics 它就会创建一个 PostHog 账户、获取一个 API 密钥,并(在需要时)设置计费。 Projects 今天作为开发者预览版发布。你可以在 http://projects.dev 注册获取访问权限(我们很快就会向所有人开放)。我们还将在未来几周内推出对许多新提供商的支持。(如果你想让你的服务可用,请联系我们。) https://projects.dev

    推荐理由:Karpathy指出Vibe Coding最大痛点是DevOps集成,Stripe Projects让Agent直接CLI配置服务免人工点击

3月26日周四