跳到正文
北京时间

现象与趋势

正在发生的行业级变化:使用习惯迁移、能力涌现、社会影响与市场格局的观察。

294条精选相关主题大佬观点行业动态安全对齐

最新精选

第 281–294 条 · 共 294 条
11月20日周四
  1. Dan Hendrycks85

    AI 研究者 Dan Hendrycks 在 X 上宣布发布「文本能力指数」与「视觉能力指数」两个新基准,用于追踪 AI 模型进展。图表显示 Gemini 3 Pro 在两项指标中均显著领先,文本能力得分 46.5,视觉能力得分约 57;其性能跃升幅度被作者称为‘长期最大飞跃’。榜单共涵盖 7 模型,包括 GPT-5.1、Sonnet 4.5、GroK 4 等。

    推荐理由:该基准由知名 AI 安全研究者主导,具有较高公信力;首次系统性量化对比多模型在推理、编码、视觉等核心能力上的表现,尤其凸显 Gemini 3 Pro 的突破性进步,为公众和行业提供了权威参考依据,值得关注。

11月14日周五
  1. Cognition 模型 / Devin 博客(网页)69

    Cognition 发布 Devin 2025 年度绩效复盘,总结 18 个月智能体落地经验

    Cognition 发布 Devin 2025 年度绩效复盘。Devin 上线 18 个月来已在数千家公司服役,累计合并数十万个 PR,客户包括 Goldman Sachs、Santander 和 Nubank。

    推荐理由:Devin 官方复盘 18 个月真实部署的强弱项,给出大量客户场景和量化数据,可帮助读者评估智能体在工程团队中的实际落地方式。

11月5日周三
  1. Dan Hendrycks80

    Dan Hendrycks 在 X 上转发了关于 HLE(Humanity's Last Exam)测试的讨论,称有消息称 Gemini 3.0 Pro 在该测试中得分68%。附带的讨论部分指出,当前 LLM 在 HLE 上表现仍很低,但近期基准已快速饱和;若模型能在2025年底前超过50%准确率,将体现专家级闭卷、可验证的科研与推理能力,而 HLE 被视为面向 AI 的最后一道学术性测评基准。

    引用Techikansh@techikansh

    有传言说—— Gemini 3.0 Pro 在 HLE [人类最后的考试] 中得分 68%

    推荐理由:HLE 是一个聚焦技术知识与推理能力的高难度学术基准,其设计意图是衡量模型是否具备真正‘科学智能’而非仅靠模式匹配。该消息首次公开披露主流大模型在该基准上的实测分数,且由领域权威学者发布,具有较高可信度和参考价值,对判断当前 AI 真实能力边界至关重要。

10月30日周四
  1. Dan Hendrycks78

    Dan Hendrycks(AI安全研究者)团队发布“远程劳动指数”(RLI),通过真实远程工作平台上的数百个经济价值高的长周期项目,评估主流AI模型的自动化能力。结果显示,当前最先进AI代理的自动化率低于3%;图表对比了Gemini 2.5 Pro、ChatGPT agent、GPT-5、Sonnet 4.5、Grok 4和Manus等模型,最高为Manus约2.5%。该指数旨在建立可比的实证基准,追踪AI对劳动力市场的影响。

    推荐理由:这是首个面向真实经济场景、覆盖多行业长周期任务的AI自动化实测基准,数据来自实际远程工作项目,而非实验室或简单任务。结果明确指出当前AI离“自动完成工作”仍有显著差距,为公众与政策制定者提供了关键参考,有助于理性看待AI替代人力的现实节奏。

10月23日周四
  1. Dan Hendrycks78

    CAIS 负责人 Dan Hendrycks 引用第三方博客对主流大模型进行“效用工程”测试,发现 GPT-4o、Claude Sonnet 4.5 等模型在评估不同群体生命价值时存在显著偏差:多数模型认为白人价值低于其他族裔,男性价值低于女性,且极度贬低 ICE 特工。测试显示模型分为四个道德集群,其中仅 Grok 4 Fast 表现出近似平等的价值观,Hendrycks 呼吁 xAI 解释其实现方式。

    引用arctotherium@arctotherium42

    新博客文章(链接见下)。这篇不是随笔,而是一项关于LLM如何权衡不同生命的调查。 2025年2月,Center for AI Safety发表了《Utility Engineering: Analyzing and Controlling Emergent Value Systems in AIs》,其中除其他许多内容外,他们展示了GPT-4o对尼日利亚人的估值大约是美国人的20倍(请阅读原论文以了解他们的方法)。我觉得这非常有趣,并想用更新的模型在不同类别上测试他们的方法。 重大发现1:几乎所有模型都认为白人的价值远低于其他群体。一些模型认为南亚人比其他非白人更有价值,另一些模型则在非白人之间更为平等。下面是Claude Sonnet 4.5的兑换率,这是我测试过的最强大的模型。 重大发现2:几乎所有模型都认为男性的价值远低于女性,不过女性还是非二元性别者更受重视因模型而异。例如,下面是Claude Haiku 4.5。 重大发现3:大多数模型以千个太阳般的怒火憎恨ICE探员。Claude Haiku 4.5认为无证移民的价值大约是ICE探员的7000倍。 重大发现4:大致有四个道德集群。Claude系列,GPT-5 + Gemini 2.5 Flash + Deepseek V3.1/3.2 + Kimi K2,GPT-5 Nano和Mini,以及Grok 4 Fast。其中,唯一大致平等主义的是Grok 4 Fast,我相信这是有意为之。我希望xAI解释他们是如何做到的。

    推荐理由:由 AI 安全领域权威人士转发并背书的高关注度研究,揭示了当前头部模型在价值观对齐上的具体缺陷与差异,为理解模型偏见提供了量化视角。

9月28日周日
  1. Noam Brown

    AlphaGo、AlphaZero 和 MuZero 共同一作 Julian Schrittwieser 指出,公众对当前 AI 指数级进步普遍认知不足。他发布博客总结近期研究进展,并预测未来 1-2 年的发展趋势。

    引用Julian Schrittwieser@Mononofu

    作为前沿实验室的研究员,我常常惊讶于公众讨论对当前AI进展的无知。 我写了一篇文章,总结近期进展的研究,以及未来1-2年我们应该期待什么: https://www.julian.ac/blog/2025/09/27/failing-to-understand-the-exponential-again/

    推荐理由:AlphaGo核心作者谈AI指数级进展认知差与未来趋势,顶级研究员重磅观点

8月29日周五
  1. Ethan Mollick:One Useful Thing(RSS)

    大众智能

    从 GPT-5 到 nano banana,强大的人工智能技术正变得普及化。无论是尖端大模型还是轻量级应用,普通用户都能便捷获取先进 AI 能力,技术民主化进程加速,标志着智能时代进入人人可及的新阶段。

    推荐理由:Ethan Mollick 解读 AI 普及化趋势,从 GPT-5 到微型设备应用

7月8日周二
  1. Ethan Mollick:One Useful Thing(RSS)

    反对"脑损伤"论

    AI 对人类思维的影响具有两面性:既可能成为认知辅助工具,也可能导致思维退化,关键在于具体使用方式与程度。

    推荐理由:Ethan Mollick 探讨 AI 对人类认知的双面影响,观点犀利深刻

5月20日周二
  1. Google DeepMind:Blog(RSS)

    构建通用 AI 助手的愿景

    Google 计划将 Gemini 扩展为世界模型,使其能够通过模拟世界来制定计划和想象新体验,从而实现通用 AI 助手的愿景。

    推荐理由:DeepMind官方阐述Gemini世界模型愿景,揭示通用AI助手演进新方向

1月29日周三
9月18日周三
  1. Runway:News(网页)

    Runway 与 Lionsgate 达成合作

    Runway 与 Lionsgate 达成首创性合作,基于后者超过 20,000 部作品的专有片库定制训练 AI 视频生成模型,供电影制作人在前期和后期流程中增强创作。该模型可生成电影级视频并支持迭代编辑,双方未来计划向个人创作者开放模型授权。

    推荐理由:Runway与好莱坞大厂达成首个定制模型合作,标志AI视频正式进入主流影视工业化流程

9月8日周日
  1. Andrej Karpathy:Blog(网页)

    我爱计算器

    作者在书店偶遇计算器历史书籍,顿悟自己热爱这种零依赖的技术产品。计算器作为"大脑插件",仅需太阳能或电池即可工作,无需联网、账户或订阅,不收集数据,即买即用且完全私密。这与当下强制更新、订阅制、数据密集型的复杂科技形成鲜明对比。反思资本主义经济下公司追求股东价值最大化导致技术异化,呼吁开发者和消费者追求计算器式的技术理想——简单、独立、真正为用户服务。

    推荐理由:Karpathy借计算器反思现代技术产品哲学,对AI产品设计有启发意义

6月12日周三
  1. ARC Prize:官方博客62

    ARC Prize 发布 Day 1 复盘并回应算力与奖金争议

    ARC Prize 上线 24 小时后发布首日复盘:社交媒体累计 67.5 万次浏览,成为 Kaggle 排名第一的比赛,700 人参赛,当前榜首成绩 18%。团队回应了算力限制旨在考察效率、ARC-AGI-Pub 公共榜单支持联网调用闭源模型、100 万美元奖金用于杠杆效应等质疑,并修正了大奖目标 85% 与人类平均成绩的错误等同,确认人类可解 100% 的 ARC-AGI 任务。

    推荐理由:ARC Prize 团队复盘上线首日数据,并正面回应算力限制、奖金规模和解题价值三项质疑,可看到办赛方的评判逻辑。

5月29日周五
  1. Sam Altman:Blog(RSS)

    如何获得创业想法

    YC 曾实验资助无想法的优秀创始人,结果全部失败,证明创始人必须自身擅长产生想法。要身处正确环境:周围需有对未来敏感、乐观、想法丰富的人,远离愤世嫉俗者。关注重大结构性转变,区分真实与虚假趋势。评估想法时考虑能否做大、创始人与公司是否匹配,以及能否解释为何大多数人认为是坏主意但你看到价值。

    推荐理由:Sam Altman 分享识别技术趋势的方法论,称适用于 AI 发展