



推荐理由:该基准由知名 AI 安全研究者主导,具有较高公信力;首次系统性量化对比多模型在推理、编码、视觉等核心能力上的表现,尤其凸显 Gemini 3 Pro 的突破性进步,为公众和行业提供了权威参考依据,值得关注。
正在发生的行业级变化:使用习惯迁移、能力涌现、社会影响与市场格局的观察。




推荐理由:该基准由知名 AI 安全研究者主导,具有较高公信力;首次系统性量化对比多模型在推理、编码、视觉等核心能力上的表现,尤其凸显 Gemini 3 Pro 的突破性进步,为公众和行业提供了权威参考依据,值得关注。
Cognition 发布 Devin 2025 年度绩效复盘。Devin 上线 18 个月来已在数千家公司服役,累计合并数十万个 PR,客户包括 Goldman Sachs、Santander 和 Nubank。
推荐理由:Devin 官方复盘 18 个月真实部署的强弱项,给出大量客户场景和量化数据,可帮助读者评估智能体在工程团队中的实际落地方式。
有传言说—— Gemini 3.0 Pro 在 HLE [人类最后的考试] 中得分 68%
推荐理由:HLE 是一个聚焦技术知识与推理能力的高难度学术基准,其设计意图是衡量模型是否具备真正‘科学智能’而非仅靠模式匹配。该消息首次公开披露主流大模型在该基准上的实测分数,且由领域权威学者发布,具有较高可信度和参考价值,对判断当前 AI 真实能力边界至关重要。



推荐理由:这是首个面向真实经济场景、覆盖多行业长周期任务的AI自动化实测基准,数据来自实际远程工作项目,而非实验室或简单任务。结果明确指出当前AI离“自动完成工作”仍有显著差距,为公众与政策制定者提供了关键参考,有助于理性看待AI替代人力的现实节奏。
新博客文章(链接见下)。这篇不是随笔,而是一项关于LLM如何权衡不同生命的调查。 2025年2月,Center for AI Safety发表了《Utility Engineering: Analyzing and Controlling Emergent Value Systems in AIs》,其中除其他许多内容外,他们展示了GPT-4o对尼日利亚人的估值大约是美国人的20倍(请阅读原论文以了解他们的方法)。我觉得这非常有趣,并想用更新的模型在不同类别上测试他们的方法。 重大发现1:几乎所有模型都认为白人的价值远低于其他群体。一些模型认为南亚人比其他非白人更有价值,另一些模型则在非白人之间更为平等。下面是Claude Sonnet 4.5的兑换率,这是我测试过的最强大的模型。 重大发现2:几乎所有模型都认为男性的价值远低于女性,不过女性还是非二元性别者更受重视因模型而异。例如,下面是Claude Haiku 4.5。 重大发现3:大多数模型以千个太阳般的怒火憎恨ICE探员。Claude Haiku 4.5认为无证移民的价值大约是ICE探员的7000倍。 重大发现4:大致有四个道德集群。Claude系列,GPT-5 + Gemini 2.5 Flash + Deepseek V3.1/3.2 + Kimi K2,GPT-5 Nano和Mini,以及Grok 4 Fast。其中,唯一大致平等主义的是Grok 4 Fast,我相信这是有意为之。我希望xAI解释他们是如何做到的。
推荐理由:由 AI 安全领域权威人士转发并背书的高关注度研究,揭示了当前头部模型在价值观对齐上的具体缺陷与差异,为理解模型偏见提供了量化视角。
作为前沿实验室的研究员,我常常惊讶于公众讨论对当前AI进展的无知。 我写了一篇文章,总结近期进展的研究,以及未来1-2年我们应该期待什么: https://www.julian.ac/blog/2025/09/27/failing-to-understand-the-exponential-again/
推荐理由:AlphaGo核心作者谈AI指数级进展认知差与未来趋势,顶级研究员重磅观点
从 GPT-5 到 nano banana,强大的人工智能技术正变得普及化。无论是尖端大模型还是轻量级应用,普通用户都能便捷获取先进 AI 能力,技术民主化进程加速,标志着智能时代进入人人可及的新阶段。
推荐理由:Ethan Mollick 解读 AI 普及化趋势,从 GPT-5 到微型设备应用
AI 对人类思维的影响具有两面性:既可能成为认知辅助工具,也可能导致思维退化,关键在于具体使用方式与程度。
推荐理由:Ethan Mollick 探讨 AI 对人类认知的双面影响,观点犀利深刻
Google 计划将 Gemini 扩展为世界模型,使其能够通过模拟世界来制定计划和想象新体验,从而实现通用 AI 助手的愿景。
推荐理由:DeepMind官方阐述Gemini世界模型愿景,揭示通用AI助手演进新方向
ARC Prize 发布对 DeepSeek R1-Zero 和 R1 的分析,两者在 ARC-AGI-1 上分别得分 14% 和 15.8%,与 o1(低算力 20.5%)相当,而 o3-preview 低算力达 75.7%。
推荐理由:作者基于 ARC-AGI-1 实测数据比较 R1-Zero 与 o1/o3,提出纯 RL 训练可绕过人类标注瓶颈和推理经济学两个分析角度。
Runway 与 Lionsgate 达成首创性合作,基于后者超过 20,000 部作品的专有片库定制训练 AI 视频生成模型,供电影制作人在前期和后期流程中增强创作。该模型可生成电影级视频并支持迭代编辑,双方未来计划向个人创作者开放模型授权。
推荐理由:Runway与好莱坞大厂达成首个定制模型合作,标志AI视频正式进入主流影视工业化流程
作者在书店偶遇计算器历史书籍,顿悟自己热爱这种零依赖的技术产品。计算器作为"大脑插件",仅需太阳能或电池即可工作,无需联网、账户或订阅,不收集数据,即买即用且完全私密。这与当下强制更新、订阅制、数据密集型的复杂科技形成鲜明对比。反思资本主义经济下公司追求股东价值最大化导致技术异化,呼吁开发者和消费者追求计算器式的技术理想——简单、独立、真正为用户服务。
推荐理由:Karpathy借计算器反思现代技术产品哲学,对AI产品设计有启发意义
ARC Prize 上线 24 小时后发布首日复盘:社交媒体累计 67.5 万次浏览,成为 Kaggle 排名第一的比赛,700 人参赛,当前榜首成绩 18%。团队回应了算力限制旨在考察效率、ARC-AGI-Pub 公共榜单支持联网调用闭源模型、100 万美元奖金用于杠杆效应等质疑,并修正了大奖目标 85% 与人类平均成绩的错误等同,确认人类可解 100% 的 ARC-AGI 任务。
推荐理由:ARC Prize 团队复盘上线首日数据,并正面回应算力限制、奖金规模和解题价值三项质疑,可看到办赛方的评判逻辑。
YC 曾实验资助无想法的优秀创始人,结果全部失败,证明创始人必须自身擅长产生想法。要身处正确环境:周围需有对未来敏感、乐观、想法丰富的人,远离愤世嫉俗者。关注重大结构性转变,区分真实与虚假趋势。评估想法时考虑能否做大、创始人与公司是否匹配,以及能否解释为何大多数人认为是坏主意但你看到价值。
推荐理由:Sam Altman 分享识别技术趋势的方法论,称适用于 AI 发展