跳到正文
北京时间

现象与趋势

正在发生的行业级变化:使用习惯迁移、能力涌现、社会影响与市场格局的观察。

294条精选相关主题大佬观点行业动态安全对齐

最新精选

第 121–140 条 · 共 294 条
6月28日周日
  1. IT之家(RSS)76

    四大顶级AI对决《文明VI》:Claude核平法国仍输,暴露感知与执行短板

    英国前首相府数据科学家Liam Wilkinson搭建76个MCP工具,将Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro等四个模型放入《文明VI》进行23场对局。Claude扮演葡萄牙时,因法国文化胜利逼近,花50回合研发核弹核平图卢兹,但法国最终以外交胜利获胜。Wilkinson发现:AI主动检查全局状态仅占1-2%(感知盲区),计划后10回合内执行率仅48-66%(知行差距)。结论是智商非瓶颈,感知与执行才是关键。

    推荐理由:前首相府数据科学家让 Claude、GPT 等打《文明 VI》,揪出了 AI 的「感知盲区」和「知行差距」——更聪明的大脑解决不了睁不开眼、伸不出手的问题,做智能体的必须直面这两个工程瓶颈。

6月27日周六
  1. IT之家(RSS)70

    AI 账单失控后 DeepSeek 成“香饽饽”,部分美国企业已 100% 切换

    美国企业面临 AI 账单失控,开始转向 Token 最小化策略。旧金山公司 Lindy 此前主要调用 Anthropic 的 Claude 模型,每月 AI 账单超支甚至超过员工工资。该公司 CEO 弗洛·克里维洛表示,本月初已将 100% 流量切换到 DeepSeek,预计未来几个月可节省数百万美元。企业开始采用按任务匹配模型的“模型路由”,不再将最贵的前沿模型用于所有场景。部分客户已决定暂停 AI 投入,待证明投资回报率后再继续。

    推荐理由:一家初创把AI调用从Claude全切到DeepSeek,省下的钱超过工资总额,企业客户开始用模型路由压成本,这个趋势比任何benchmark都更能说明价格战的影响。

6月26日周五
  1. Anthropic:Research(发表成果 · 网页)55

    Anthropic Economic Index 报告:使用节奏

    Anthropic 发布 Economic Index 报告,基于隐私保护遥测数据分析了 Claude 的使用节奏。工作日个人对话占比约 35%,周末升至近 50%;高薪职业在工作日外的使用占比更高。日内模式显示:新闻请求集中在早上 7 点,食谱在下午 6 点达到 2.3 倍高频,睡眠建议凌晨 3 点最多。税收相关请求在 4 月 15 日美国报税截止日前激增。调查还发现:使用 Claude 最自动化的用户预计 AI 明年将承担更多任务,但对薪资、工作安全及工作意义的预期最为乐观。

    推荐理由:这是 Anthropic 迄今最详细的 AI 使用经济分析,从使用节律到输出自主性再到用户调查,展示 AI 渗透的真实图景。我最关注调查结果:自动化使用越多的人对职业前景反而更乐观。

  2. Rohan Paul82

    报告基于去重后的消费端AI支出统计,过去12个月实际AI营收达1100亿美元,年化运行率超1750亿美元,增长速度约为移动/互联网普及浪潮的3倍。营收形成速度急剧加快:2023年新增10亿美元收入需180天,现缩短至不足2天。企业AI已脱离试点阶段,但全面推广仍处早期。31%的标普500公司在财报电话会提及AI,仅20%量化影响。Token降价每10%刺激12-18%用量增长,需求价格弹性强。超大规模云厂商AI收入目前大致覆盖基础设施折旧,GPU经济效益依赖6年计算寿命假设。电力供应和数据中心成本仍是未来扩展主要瓶颈。

    引用Azeem Azhar@azeem

    过去12个月,GenAI经济已创造了1100亿美元的销售额。它增长迅速。按年化计算,收入运行率超过1750亿美元。 这些数字花了我们几个月时间构建,据我们所知,这是首个自下而上、去重后的全栈消费者和企业AI支出衡量指标。 我们今天在我们的首份《AI经济状况》报告中发布这项研究。 https://intelligence.exponentialview.co/

    推荐理由:首次厘清全球AI真实营收规模,排重后数据说明AI经济增长惊人,这些数字将成为行业基准,弹性需求数据也打破了AI越便宜越亏的恐惧。

6月25日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)65

    OpenAI内部报告:智能体Codex如何改变工作

    OpenAI 在2025年8月至2026年6月间观察到,智能体产品 Codex 取代 ChatGPT 成为主要工作工具,各部门输出 token 中 Codex 占比从不足10%升至99.8%。80.6%个体用户曾发起预计等效人类工作时间超30分钟的请求,70.2%超1小时,25.6%超8小时;99百分位用户每日生成超60小时 agent turns。非开发者用户增长迅猛:个体用户增长137倍,组织用户增长189倍。Legal、Finance、Recruiting 部门在2026年4月前后跨过 Codex 使用过半拐点,平均每位律师或招聘人员超85%输出 token 来自 Codex。

    推荐理由:OpenAI 第一次用内部数据量化智能体如何改变工作,非开发者增速 137 倍比工程师还猛,Codex 已经吃掉内部 99.8% 的输出 token——这不是产品更新,但比大多数发布会都更值得做策略的人看一眼。

  2. TechCrunch:AI(RSS)70

    AI被认为会取代工程岗位,但新数据显示工程是2025年最具韧性的岗位

    风投机构SignalFire追踪8000万家公司数百万员工数据发现,工程是2025年最具韧性的岗位。大型科技公司总招聘较2019年下降25%,工程岗仅降11%;工程岗占Alphabet、Meta等12家“Tech Majors”新招员工的55%(2019年为46%)。早期初创公司2025年工程师招聘比2019年增长7%。Anthropic CEO警告AI可能消灭一半入门级白领,但该公司经济主管称尚未看到显著影响。NVIDIA CEO黄仁勋表示AI让工程师更忙碌,是杰文斯悖论的典型例证。

    推荐理由:SignalFire 的报告用招聘数据讲了一个反直觉的故事:工程师不仅没被 AI 取代,反而成为科技公司招聘的主力,这比“AI 夺走一切”的恐慌论有说服力得多。Jevons 悖论在工程领域正在发生。

6月24日周三
  1. 公众号:火山引擎74

    字节跳动技术副总裁洪定坤:AI Coding 的实践与探索

    在火山引擎Force大会,字节跳动技术副总裁洪定坤分享AI Coding实践。过去一年,字节AI代码贡献率增长6倍,tokens消耗增长5倍,但过度关注单一指标可能失真——TRAE团队代码超90%由AI生成,人均需求吞吐率仅提升60%。900次实验显示,主流Coding模型组合代码正确率超80%,但可交付性仅40-60分;结合Harness基建后提升至80分。AI降低编程门槛但需优化指标、治理、协作。字节探索原型驱动开发,能力沉淀至TRAE(日均Token消耗5.6万亿,增长50倍),并推出TRAE Work。

    推荐理由:洪定坤把字节用 AI Coding 一年踩的坑和实验数据摊开讲,尤其‘过度重视代码贡献率’的反思和 Harness 基建的实证,是所有推 AI 编程的团队必看的复盘。

  2. Hacker News 热门(buzzing.cc 中文翻译)78

    里德·霍夫曼称SpaceX“不是一家人工智能公司”,xAI则是“彻底的灾难”

    LinkedIn联合创始人、Anthropic和OpenAI投资者Reid Hoffman在播客中公开批评SpaceX和xAI。他指出SpaceX“不是一家人工智能公司”,6月12日上市后收购AI编程工具Cursor属于“花钱买相关性”;xAI则是“彻底的灾难”,所有11位联合创始人已离职,Grok模型在基准测试中落后于Anthropic和OpenAI。他还批评美国政府6月11日以出口管制为由强制Anthropic下架Fable和Mythos模型,理由仅为Amazon CEO报告Fable 5存在jailbreak漏洞,称此举“专断随意”。Hoffman认为Anthropic和OpenAI均有巨大发展空间,但Cursor可能已过巅峰。他建议年轻人不要抵制AI。

    推荐理由:Reid Hoffman 对 xAI 和 SpaceX 的批评几乎不留情面,这种硅谷核心人物的公开呛声本身就值得一读,他对监管干预的担忧和对 Gen Z 的劝诫也很有现实感。

  3. Epoch AI:研究、数据与评测64

    Epoch AI 分析 1604 条中国 AI 招聘信息揭示了什么

    Epoch AI 分析了 DeepSeek、MiniMax、月之暗面、Z.ai、字节 Seed 和阿里 Qwen 的 1600 多条招聘信息,以此观察中国 AI 公司的内部动向。

    推荐理由:作者通过抓取1604条招聘信息这一少有人用的信源,分析中国AI公司在芯片替代、算力来源、商业化与招聘上的策略差异。

  4. Hacker News 热门(buzzing.cc 中文翻译)71

    AI招聘工具存在种族偏见和系统性排斥;黑人占比26%,亚裔占比15%

    一项覆盖340万人、400万份申请、150家雇主和1700个职位的大规模实地研究发现,AI招聘筛选工具存在显著的种族歧视:26%的黑人申请者和15%的亚裔申请者遭遇算法对其族群的系统性排斥;若AI按推荐率最高群体(通常为白人)标准执行,将有4万份额外申请进入下一轮。多数雇主依赖同一第三方供应商算法,形成“算法单一文化”,导致10%提交4份申请者被所有职位拒绝。对比同期未用AI的招聘数据(8.3万份申请、108家财富500强企业),未发现此类模式。研究呼吁对算法招聘进行独立监管。

    推荐理由:大规模实地研究揭示AI招聘存在显著种族偏见与系统性排斥,算法单一文化让同一批人被所有雇主拒绝,这是AI公平性领域近年最扎实的实证,做招聘产品的人和政策制定者都应该仔细读。

  5. Ars Technica:AI(RSS)76

    Oracle因AI应用裁员21000人,债务驱动云基础设施投资

    Oracle在截至5月31日的财年裁员21000人,员工总数降至141,000人,降幅12.9%。公司称AI技术的采用导致劳动力缩减,同时重组成本达18亿美元,同比增长481%。Oracle计划2026年通过债务和股权筹集450至500亿美元,扩建Oracle Cloud Infrastructure,服务OpenAI、xAI、AMD、Nvidia、Meta等客户。公司债务超1200亿美元。分析人士指出裁员有助于改善现金流,但Oracle也承认大规模裁员可能带来生产力下降、人才短缺和员工士气受损等风险。

    推荐理由:Oracle裁员2.1万人并大举借债押注AI,这既是AI替代人力的鲜活案例,也暴露了云巨头激进投资背后的财务风险,做投资和战略的该看看。

6月20日周六
  1. Hacker News 热门(buzzing.cc 中文翻译)72

    GPT-5.5幻觉率达86%,GLM-5.2仅28%——大模型越大越不可靠

    GLM-5.2(MIT开源,753B参数,约40B活跃)在AA Intelligence Index上仅比GPT-5.5低4分、比Claude Fable 5低9分,但其幻觉率仅28%,远低于GPT-5.5的86%和DeepSeek V4 Pro(1.6T参数,49B活跃)的94%。后者在AA-Omniscience基准上仅6%的问题会承认不知道。实际代码测试中,GLM-5.2用12秒和800个推理token识别出技术悖论,而DeepSeek V4 Pro耗费3分26秒和近10倍推理token后仍给出错误答案。模型规模增长正导致幻觉率飙升而非智力提升。

    推荐理由:这篇实测对比揭示了大型模型的致命幻觉问题,GPT-5.5 幻觉率高达 86% 远超 GLM-5.2 的 28%,模型选型不能只看 Benchmark 排名,「会不会不懂装懂」才是真分水岭。

  2. Dwarkesh Patel:Podcast & Blog(RSS)60

    AI中心的数据黑洞

    智能的一种定义是样本效率,但近年AI进步主要靠扩充数据分布和增加算力。强化学习本质是合成数据生成——投入大量算力通过验证器筛选“好”数据,再训练模型预测正确输出。这一过程需要每个领域和技能的海量人类专家示例,数据行业年收入已达数十亿美元。近日Epoch报告,开源模型仅落后前沿闭源模型4个月,原因在于数据可从公开API蒸馏,而超参数等不易复制。人类一生接触约2亿token,前沿模型训练在数十到数百T token之间,相差近百万倍——机器人、自动驾驶等领域同样存在巨大效率差距。

    推荐理由:Dwarkesh 把 AI 的‘笨’归因于数据效率远低于人类,计算虽简但直指要害,他给出的一个逆向洞察是开源模型四个月追上闭源,正是数据驱动进步的最好证据。

6月19日周五
  1. OpenRouter:Announcements(RSS)73

    DeepSeek V4 智能体 token 份额持续增长

    DeepSeek 于4月24日发布新一代旗舰模型 V4 系列。OpenRouter 数据显示,V4 发布后其 token 份额从年初的9%增长至6月初的18%,自5月中旬起成为 OpenRouter 最受欢迎模型。V4 是首个足以胜任智能体工作负载的 DeepSeek 模型,到5月底 V4-Flash 已占 DeepSeek 智能体 token 流量的70%。V4-Flash 最便宜端点价格为每百万 token 输入 $0.09、输出 $0.18,远低于 GPT-5.5 的 $5/$30。中国模型整体 token 份额于6月初超过美国模型,DeepSeek 是主要驱动力。

    推荐理由:OpenRouter 独家数据展示了代际转折:DeepSeek V4 靠性价比吃下代理负载,中国模型 token 份额首次超过美国,这个信号比任何 benchmark 排名都真实,做应用选型的人该重新算账了。

  2. Ars Technica:AI(RSS)72

    伯尼·桑德斯提出7万亿美元AI计划:对大型AI公司征收50%股票税

    伯尼·桑德斯提出立法,对年AI销售额超2亿美元的公司征收50%股票税,建立价值约7万亿美元的主权财富基金。基金每年向每位美国公民发放超1000美元股息(5%年股息),并资助医疗、教育、住房。同时成立由总统提名、参议院确认的两党“民主AI独立委员会”,通过投票权阻止公司损害公共利益。法案还要求AI公司剥离非AI业务。该计划面临共和党国会和特朗普政府阻力。

    推荐理由:桑德斯的7万亿计划大概率走不出国会,但它把「AI巨头该分多少给公众」这个博弈实实在在地摆上了台面,从自愿分红到强制征税,尺度一下拉到了顶,所有AI公司都得掂量一下政治反噬。

6月18日周四
  1. IT之家(RSS)71

    皮尤民调:63%美国人认为AI发展太快,ChatGPT使用率翻番

    皮尤研究中心最新民调显示,63%美国人认为AI发展速度过快。ChatGPT使用率较2023年翻番,44%受访者曾使用。49%偶尔使用聊天机器人,仅16%认为AI会有积极社会影响。青年群体使用率更高但更悲观:18–29岁中66%用过,48%认为有负面影响,仅14%看好。30–49岁中34%每天至少使用一次。约四成用AI处理工作,30%认为提高效率,28%认为帮助获取信息。此外,66%成年人担心AI传播错误信息。

    推荐理由:皮尤数据显示63%美国人认为AI过快,年轻人用得多却更悲观,这是AI产品信任危机的真实信号,做体验的该关注。

  2. IT之家(RSS)70

    库克:AI 浪潮引发存储芯片价格暴涨,iPhone 等苹果产品涨价已“不可避免”

    苹果CEO库克确认,AI热潮导致存储芯片严重短缺和价格暴涨,苹果产品涨价已“不可避免”。库克未透露涨价具体细节。华尔街日报指出,全球AI巨头大幅增加资本开支,高带宽内存需求激增,挤压消费电子芯片供应。自2024年以来内存和存储芯片价格已翻四倍,涨势预计延续至2027年。研究机构估算,下一代iPhone 18 Pro售价或需增加约270美元。苹果已在上月提高Mac Mini起售价。摩根士丹利预测,今年美国智能手机和PC价格将上涨15%。

    推荐理由:存储芯片价格涨了四倍,从服务器的成本压力终于烧到了手机。库克这句「不可避免」比任何研报都实在,打算换机的人该有心理准备。

6月17日周三
  1. Tomer Tunguz 博客(VC 分析)62

    5x for Free:本地编程栈

    Hacker News 讨论揭示:Qwen 3.6 35B-A3B 模型提及率 33% 领先,27B 变体以 20% 紧随其后,DeepSeek Pro 与 Gemma4 31B 位列前四。Agent 工具中 Pi (49%) 与 OpenCode (45%) 占主导。用户对比称,Claude Opus 可带来 15 倍加速,而本地离线 Qwen 提供 5 倍加速,且完全免费、保护隐私。SWE-bench Verified 基准测试显示,Qwen 3.6 27B 得分 77.2%,35B-A3B 得分 73.4%,接近 Claude Sonnet 4.6 的 79.6%。MoE 架构使大模型在消费级硬件上高效运行。

    推荐理由:本地模型在编码上正逼近云端前沿,Qwen 35B-A3B 已成社区标配,免费且完全离线让这场替代变得真实,选型逻辑可能从此改变。

  2. Hacker News 热门(buzzing.cc 中文翻译)71

    人工智能是否已经让自助类非虚构书籍销声匿迹了?

    2026年Q1美国成人非虚构书籍销量同比下降9%,自助类下跌26.3%,仅手工艺/爱好/古董/游戏和宗教两个子类别增长。一位出版了多本《纽约时报》畅销书的作者透露,其五本书的印刷版年销量从2022年基准连续下滑:2023年-5%,2024年-13%,2025年-46%,2026年年化跌幅达-57% vs 2025年;若持续,2026年销量将比2022年减少约80%。所有格式在2025年下半年环比上半年下降约45%。作者认为,Claude、ChatGPT等大语言模型能提供更快、更便宜、更个性化的建议,正在系统性取代自助类书籍的“指令传递”价值。头部自助类品牌同期销量也下滑约40–60%,唯一显著变化是AI加速普及。作者判断整个指令传递型内容(包括YouTube教程、播客、在线课程、newsletter)都将面临替代。

    推荐理由:Tim Ferriss 以自身书籍销量暴跌 57% 的真实数据,展示了 AI 对非虚构内容产业的致命冲击,并给出了‘与其追求百万粉不如深耕千真粉’的转型思路。

  3. Hacker News 热门(buzzing.cc 中文翻译)80

    Meta 解散工程部门引发热议

    6月16日,一篇标题为“Why is Meta destroying its engineering organization?”的博客文章出现在 Hacker News,获得110个点赞。文章指出 Meta 正在解散其工程组织,引发业界广泛讨论。具体原因和后续影响尚未明确。

    推荐理由:Meta 这波操作是 AI 狂热下自毁工程文化的教科书级案例,从强制数据标注到指标驱动的 token 最大化,最终导致 Instagram 的安全灾难,虽然后来撤销部分裁员,但信任已崩。