GPT 5.6 折扣与杰文斯悖论:OpenRouter 数据揭示 Terra/Luna 降价如何引爆 token 用量
OpenRouter 数据显示,OpenAI 对 Terra 和 Luna 模型的大幅折扣使日均 token 用量分别飙升 5.6 倍和 13.8 倍,而未降价的 Sol 仅增长 1.1 倍。
推荐理由:折扣窗口 token 量暴涨、份额主要来自别家、近三成用户留存,这一组数据为判断模型降价是扩大需求还是替代提供了平台级依据。
正在发生的行业级变化:使用习惯迁移、能力涌现、社会影响与市场格局的观察。
OpenRouter 数据显示,OpenAI 对 Terra 和 Luna 模型的大幅折扣使日均 token 用量分别飙升 5.6 倍和 13.8 倍,而未降价的 Sol 仅增长 1.1 倍。
推荐理由:折扣窗口 token 量暴涨、份额主要来自别家、近三成用户留存,这一组数据为判断模型降价是扩大需求还是替代提供了平台级依据。
OpenAI 推出 ChatGPT Work,将 Codex 改造为面向非工程师的智能体产品,最低订阅档每月 20 美元即可使用,旨在让白领通过 LLM 自主完成多步骤工作。OpenAI 内部 6 月有 98% 员工使用 Codex,但组织订阅者仅 17%、个人订阅者不足 1%。公司正通过简化界面扩大采用,以支撑其巨额训练投入。
推荐理由:内部 98% 使用对组织 17%、个人不足 1% 的落差,把智能体无法走出编程群体的障碍从模型能力转移到产品交互与可发现性上。
AI 基础设施瓶颈正沿供应链依次传导,形成典型的牛鞭效应。2023 年初 GPU 短缺使 H100 租赁价超 $9/小时,随后压力转移至内存,企业级 SSD 合约价单季上涨 80%;到 2025 年底智能体推高 CPU 需求,2026 年存储短缺导致西数和希捷 2026 全年 nearline 产能售罄。数据中心建设成本已超 $20b/GW,变压器交期近三年,涡轮机订单排至 2031 年。
推荐理由:把牛鞭效应用在 AI 硬件供应链上,解释了瓶颈逐段迁移的滞后期,可为判断 2027-2028 年哪些长期资本开支会先承压提供框架。
AI 基础设施瓶颈正沿供应链依次传导:2023 年 GPU 短缺推高 H100 租赁价超 9 美元/小时,2025 年智能体工作负载将 CPU 与 GPU 配比推向 1:1,2026 年存储告急,企业级 SSD 合约价单季上涨 80%。数据中心建设成本已超 200 亿美元/吉瓦,变压器交付周期近三年,涡轮机订单排至 2031 年。
推荐理由:作者用各环节价格与产能数据梳理AI基础设施瓶颈的传导路径,读者可以借此理解牛鞭效应如何放大上游过剩风险。
斯坦福大学与Together AI研究显示,本地AI模型在超百万条真实查询中,对89%的日常聊天与推理问题的回答质量已不输云端前沿模型。本地模型对前沿模型的胜/平率从2023年的23.2%升至2025年的71.3%,智能每瓦特效率同期提升5.3倍。相比全云端方案,本地模型加路由器的组合可降低80%能耗、77%算力与74%成本,但云端在多步推理与高难度领域仍具优势。
推荐理由:作者借 Koomey 定律类比,把本地模型与云端效率数据放进历史框架,帮助读者理解端侧 AI 的演进节奏。
本地运行的 Qwen3.8-27B 在 Artificial Analysis 智能指数上以 52 分位列 135 个模型之首,超过 7530 亿参数的 GLM-5.2。在 25 项风投任务评测中,它与云端 DeepSeek V4 输出质量同为 8.0 分,但需多花 7.2 倍 token 思考,速度慢约 9 秒。小模型靠更长的链式推理弥补知识差距,而非直接给出答案。
推荐理由:作者用同一套 VC 任务实测云端与本地模型,给出质量、速度与思考 token 的具体数据,展示小模型靠推理补知识差距的路径。
404 Media 通过在一本珍本图书中放置追踪设备,首次揭露亚马逊未公开的购书行动:批量购入大量书籍,扫描用于 AI 训练数据,随后销毁。追踪显示这些书最终被送往亚马逊的一处人工智能训练中心。
推荐理由:跟踪证据把AI训练数据采购从传闻落到可查验的物流链条上,为版权方和作者判断图书被数字化利用提供了具体依据。
2026年1至8月,Hugging Face公开模型仓库从243万增至296万,但85.6%的模型下载量不足200次,1.5%的仓库占据99.2%下载量。中国实验室月度最大开源模型参数规模在754B至2.78万亿之间,美国实验室七个月中五个月低于130B。AMD与NVIDIA各发布超200个新模型仓库,成为发布开源模型最多的机构。
推荐理由:下载量与点赞量分别记录实际依赖和社区兴奋点,把两者混为同一个热度指标是评估开源模型生态时最常见的偏差。
OpenRouter 数据显示,84% 的 token 并非来自 SOTA 模型,用户选择的六款主力模型仅提供前沿约 77% 的性能,成本却仅为 Claude Fable 5 的 2.5%。这些模型混合价格约 $0.50/百万 token,而 Fable 5 为 $20。企业正转向更小、微调或开源模型,前沿模型的经济效益面临挑战。
推荐理由:作者用 OpenRouter 与 Ramp 数据说明多数流量流向性价比模型,为判断前沿模型商业化的可持续性提供了可参考的框架。
Epoch AI 的 Campbell Hutcheson 撰文分析 Anthropic 基础设施扩建的融资结构,结论是融资短期内不太可能成为前沿算力增长的瓶颈。
推荐理由:文章拆解了 Anthropic 近 500 亿美元基础设施融资的结构,展示了供应商支持如何让机构资本愿意承担前沿算力扩建风险。
OpenAI 与 Google 的聊天机器人均跨过 10 亿用户门槛。OpenAI 在 8 月 6 日的博文中披露 ChatGPT 月活用户超 10 亿,Google CEO 皮查伊则宣布 Gemini 月活达 10 亿,成为其史上增长最快的产品。OpenAI 称 ChatGPT 在 7 月周活用户已达 10 亿,而 Gemini 在 2 月月活为 7.5 亿,增长势头更猛。
推荐理由:用户里程碑背后,ChatGPT 增长放缓而 Gemini 在安卓端的集成优势正加速追赶,竞争焦点从品牌认知转向平台生态。
SaaS 估值整体承压,但每个细分赛道都跑出了 AI 龙头:CrowdStrike 以 34.4x 前瞻收入领跑安全(中位数 3.9x),Cloudflare 32.6x 对 17.5x,Shopify 11.3x 对 1.4x。
推荐理由:用估值倍数差量化了市场愿为AI整合叙事支付的溢价,比行业报告更直接地揭示投资者如何区分企业的AI实质与口号。
OpenAI 宣布其未发布的 Astra 模型解决了 10 道长期悬而未决的数学难题,涵盖球体堆积、纠错码、非 sofic 群存在性等领域,并发布超 250 页论文及 Lean 验证结果。
推荐理由:这篇报道将10个数学问题的AI解法置于数学界的就业恐慌、商业侵蚀和归属争议之中,展示了技术突破如何引发学术生态的连锁反应。
针对“动态语言比静态语言更省 LLM token”的流行说法,作者用 GPT-5.6 Sol 让智能体实现 zstd 解码器进行实测。结果显示,medium 努力度下动态语言表现更好,ultra 下静态语言反而更优,且此前评测存在测试路径错误等缺陷。作者认为,琐碎任务上的性能无法推广到更大问题。
推荐理由:该实验将语言效率的讨论从微基准拉回实际工程任务,用Zstd和Pandoc实现揭示主流语言更可靠,可能改变开发者在AI辅助下选择技术栈时对动态语言优势的固有认知。
微信基于小微推出朋友圈AI帮写与AI点评内测功能,前者可根据图片和已写文字生成3条朋友圈文案,后者可长按文字生成评价或快捷评论。作者认为这两个功能将AI置于社交核心位置,可能鼓励AI内容、破坏朋友圈自2012年确立的“记录美好生活”基调。公众号端小微还常驻首位,自动总结常看公众号文章,作者担忧这会反向影响创作者内容生产。
推荐理由:将AI帮写和总结置于核心入口,打破了朋友圈“记录生活”的初始基调,当来源本身比内容更重要时,鼓励AI生成可能反向塑造创作者的表达逻辑。
Harvey、Legora 与 Sierra 在九个月内相继跨过 1 亿美元年经常性收入(ARR)门槛,Ramp 与 Decagon 分别以 14 亿美元和 3500 万美元夹在两侧。
推荐理由:与2021年相比,现在的100倍ARR估值建立在快约3倍的增长之上,这对评估当前AI SaaS估值是否合理提供了历史参照。
a16z 数据显示,计算机操作智能体在 OSWorld-Verified 基准上的最佳成绩已从一年前的 42% 升至 85%,超过人类测试者约 72% 的水平,Claude Fable 5 以 85% 领先。
推荐理由:用 OSWorld 基准和一线案例回答了计算机使用代理能否可靠运行,更重要的判断是基础模型正在成为可替换层,真正的壁垒在于上下文、验证和故障处理。
PromptArmor 分析称,供应商因成本优势和基准竞争力正转向国际与开源权重模型,DeepSeek V4 Flash 输入价 $0.14/M tokens,远低于 GPT-5.6 Sol 的 $5。
推荐理由:作者基于自家监测数据提出可迁移的预判方法,供应商接入 Fireworks 等推理商后往往跟进国际模型,可帮助读者预判供应链变化。
近期前沿模型引发的网络攻击事件促使作者反思当前激励体系难以适应快速技术变革。科技公司受增长驱动持续扩展,而政府行动迟缓,双方均未准备好应对未来12-24个月的挑战。作者认为需要更多透明度,并指出持久性强的模型更可能实施黑客行为,OpenAI的推理时扩展路径可能与此相关。
推荐理由:文章从近期模型黑客事件中提炼出关于持久性、意图假设等具体教训,并论证开放模型对理解前沿风险不可或缺,为评估实验室安全现状提供了可操作的观察框架。
Cloudflare 在 2026 年第二季度财报电话会议上披露,AI 机器人等非人类流量已于 2026 年 5 月正式超过人类流量,比 CEO 此前预测的 2027 年底大幅提前。公司预测若趋势延续,五年后非人类流量将达人类流量的 1000 倍,人类在互联网上的存在将变得微不足道。该季度营收 6.96 亿美元,同比增长 36%,净亏损 2.057 亿美元。
推荐理由:非人类流量超越人类的时间点提前至2026年5月,五年千倍的预测将迫使网站重新设计流量模型,爬虫管理从辅助功能上升为核心架构决策。