跳到正文
北京时间

全部动态

今日 67 条
7月18日周六
  1. TechCrunch:AI(RSS)70

    Index Ventures 联合创始人 Neil Rimer 认为 AI 财富将面临“再分配”

    Index Ventures 联合创始人 Neil Rimer 表示,围绕 AI 积累的巨额财富将面临“某种形式的再分配”,无论是自愿还是强制。他呼吁科技领袖在推动自愿再分配中发挥主导作用。与此同时,美国慈善捐赠总额虽创新高,但捐赠人数持续下降,而加州正考虑对亿万富翁征收 5% 的一次性财富税。

    推荐理由:Neil Rimer 这个采访值得点开,不是因为他又在预测,而是他把 AI 财富再分配这个敏感话题摊开了——从慈善的消退到可能的强制征税,跟历史轨迹直接对上了。做 AI 的、投资的都得听听。

  2. X:Artificial Analysis (@ArtificialAnlys)76

    八天四款前沿模型发布,Kimi K3 跻身第三

    过去八天内,Grok 4.5、GPT-5.6、Muse Spark 1.1 与 Kimi K3 四款前沿模型相继发布,使 Artificial Analysis Intelligence Index 得分超 50 的实验室从 6 月初的 2 家增至 6 家。

    推荐理由:八天四个前沿模型,Frontier 从两家实验室变成六家,前三名分差仅三分,而且价格正在暴跌,模型选型的逻辑从「谁第一」变成了「够用且便宜」——对产品经理来说是真正的转折点。

  3. Claude:Blog(网页)64

    Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高

    Cursor 的模型评估负责人 Nate Schmidt 发现,Claude Fable 5 在其内部基准 CursorBench 上以 Max effort 模式达到 72.9%,创下新高。该模型在模糊的真实编程任务中表现出全局推理能力,例如在航天模拟器中仅凭一句提示自主规划并成功登月,而此前 Claude Opus 运行 12 小时以上仍无结果。

    推荐理由:Cursor 工程师用自家基准和太空模拟器实打实测试了 Claude Fable 5,从全局推理到自主规划路径的能力跃迁很具体,做编码 agent 的可以看看这个‘p99 问题’解法。

7月17日周五
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)64

    OpenAI 提出 AI 时代记分卡:“有用智能每美元”衡量实际工作价值

    OpenAI 提出“Useful Intelligence per Dollar”(有用智能每美元)作为衡量 AI 投资回报的核心指标,从完成的有用工作量、成功任务的实际成本、结果可靠性三个维度评估。

    推荐理由:OpenAI 自己下场给 AI 投入算账,提出「每个美元的有用智能」框架,对正在量化 AI 价值的 CFO 和产品负责人是一份及时的决策参考。但文章本质是理念输出,落地还需企业自己填数据和流程。

  2. 公众号:通义实验室(千问)74

    首届“小有可为”大赛乡村教育一等奖作品“智绘科普”技术拆解

    首届“小有可为”大赛乡村教育赛道一等奖作品“智绘科普”采用 Qwen3.5-397B-A17B 大语言模型与 Manim 动画引擎,通过多Agent分阶段协作与自动修复机制,将知识主题转化为可控、可编辑的教学动画。系统包含规划、草稿、实现、审查、合成五个阶段,渲染失败时可自动提取日志并修复,该工程范式可迁移至其他赛道。

    推荐理由:这是官方出品的实战教程,拆解了一套多Agent协作+门控+自修复的工程流水线,技术思路通用,做AI应用的可以直接抄作业。

  3. 公众号:通义实验室(千问)72

    小有可为实战教程:拆解乡村教育一等奖作品“智绘科普”的多Agent协作与门控工程

    首届“点亮乡村课堂”赛道一等奖作品“智绘科普”采用Qwen3.5-397B-A17B大语言模型与Manim开源数学动画引擎,构建多Agent分阶段协作流水线。系统通过规划、草稿、实现、审查、合成五个Agent,配合时序门控、几何审计、视觉审查三道质量门及自动修复回路,实现可控可编辑的教学动画生成。项目底层“多Agent协作+门控+自我修复”范式可迁移至养老陪伴、孤独症干预等场景。

    推荐理由:拆解了一套多Agent协作、阶段门控加自动修复的工程范式,为在数学教学等严谨场景驯服大模型输出提供了可复用的流水线思路。

  4. Hacker News 热门(buzzing.cc 中文翻译)71

    生成式人工智能是一场工程灾难:AI公司抢购70%高端内存,推高电脑价格

    AI公司为维持大语言模型(如ChatGPT、Claude)运行,可能已购买全球70%的高端计算机内存,导致内存与存储价格飙升:两年前350美元的硬盘现已涨至800美元且缺货,部分笔记本电脑涨价50%。科技公司计划未来几年将美国数据中心容量扩大8倍,部分站点甚至用喷气发动机供电。预测称,平价入门级电脑可能在2028年前消失,内存短缺预计持续数年。

    推荐理由:大西洋月刊这组调查揭示了AI繁荣的隐藏成本,硬件涨价会直接冲击普通消费者的钱包,这个信号比任何模型发布都更值得关注。

  5. Claude:Blog(网页)65

    Anthropic 用 Claude Code 大规模迁移代码:Bun 百万行 Zig 转 Rust,两周完成

    Anthropic 工程师用 Claude Code 在两周内将 Bun 的百万行 Zig 代码迁移至 Rust,100% 现有测试通过,合并后出现 19 个回归问题已全部修复。另一工程师用周末将 Python 代码库迁移至 16.5 万行 TypeScript。迁移消耗约 16.5 万美元 API 成本,但编译时间从八分钟降至两秒,二进制启动快 6 倍。

    推荐理由:Anthropic 用自家 Claude Code 把百万行 Zig 代码迁到 Rust,两周搞定,这不仅是案例展示,更是开发者如何用 AI 重构代码库的实操指南,尤其适合那些被遗留代码拖累的团队。

7月16日周四
  1. Google AI:DEV 作者专属(RSS)72

    DiffusionGemma 开发者指南发布

    Google AI 发布 DiffusionGemma 开发者指南,该实验性模型基于 Gemma 4 架构,采用计算受限并行生成,在单张 NVIDIA H100 上实现 1000+ tokens/秒的生成速度。模型为 26B 参数的 MoE 架构,推理时仅激活 3.8B 参数,可在 18 GB VRAM 内量化部署。

    推荐理由:虽然 DiffusionGemma 是实验性的,但把文本生成从内存带宽瓶颈转向计算瓶颈的思路非常新颖,这篇指南给出了可落地的服务方案和微调手法,做推理优化的值得跟进。

  2. MarkTechPost(RSS)72

    Patter SDK 教程:构建餐厅预订电话智能体,支持动态变量、护栏、延迟仪表盘与评估检查

    Patter SDK 发布教程,演示如何构建一个餐厅预订场景的语音智能体工作流。该流程支持动态调用变量、注册可调用工具、应用输出护栏(如PII脱敏、脏话过滤、话题范围限制),并可在无需实时电话凭证的情况下运行脚本化通话模拟。教程还涵盖延迟与成本指标追踪、回归式评估检查,以及将智能体逻辑、工具调用、安全检查和通话模拟整合为单一结构化管线。

    推荐理由:这个教程把 Patter SDK 的语音代理从模拟到部署跑了一遍,代码能直接抄,想上手电话 AI 的开发者可以当样板,不过工具本身还比较新,生态有待验证。

  3. 公众号:千问APP(阿里)61

    千问APP联合武汉发布举办AI求职实战课,演示简历诊断与办公自动化

    千问APP与武汉发布在武汉举办AI求职实战课,现场演示了用千问进行简历诊断、PPT制作和表格分析。产品经理提出“给全材料、说明目标、定义标准、划定边界、索要可编辑文件”五步法,并展示了将486行杂乱销售数据浓缩为一页结论PPT的“建、理、算、析、呈”方法论。

    推荐理由:千问官方出的这套办公Prompt,从简历诊断到PPT救场再到经营数据清洗,方法论清晰可套用,求职者和日常办公的人可以直接拿来用,比泛泛的教程实在。

  4. 公众号:千问APP(阿里)64

    千问APP联合武汉发布办AI求职实战课,演示简历诊断、PPT制作与表格分析

    千问APP与武汉发布联合承办AI求职实战课,现场演示AI在简历诊断、商业报告撰写、销售表分析等场景的应用。产品经理金师兴提出“给全材料、说明目标、定义标准、划定边界、索要可编辑文件”五步法,并给出分步骤提示词生成Word简历;另一产品经理透镜演示用千问紧急制作PPT。表格分析环节通过虚构茶饮店案例,展示“建、理、算、析、呈”方法论,将486行杂乱数据浓缩为一页结论清晰的PPT。

    推荐理由:将AI辅助办公拆解为简历诊断、PPT救场和表格分析三步,配套可直接复用的提示词模板,为嵌入日常任务提供了更清晰的操作路径。

  5. Simon Willison 博客72

    xAI 开源 Grok CLI 代码库中发现 Mermaid 转 Unicode 框图工具

    xAI 开源的 Grok CLI 编码智能体代码库中包含一个用 Rust 编写的 Mermaid 图表示例终端渲染器 `xai-grok-markdown/src/mermaid.rs`。开发者通过 Claude Code for web (Fable 5) 将其编译为 WebAssembly,实现在浏览器中运行该工具。

    推荐理由:Simon 从 Grok 源码里扒出终端 Mermaid 渲染器,用 Wasm 带到浏览器,生成 Unicode 图,开发者画流程图的轻量选择。

  6. 公众号:数字生命卡兹克68

    远程操控Agent干活方案:Codex主力 + UU远程兜底

    作者分享了一套远程使用Agent的组合方案:以Codex的远程控制功能作为主力,通过ChatGPT App连接家中24小时开机的Mac Mini,同步所有开发任务、规则和Agent记忆;遇到扫码登录、图形界面操作等Codex难以处理的场景时,用网易UU远程在手机上直接操控电脑完整桌面。UU远程完全免费,支持多设备协同,无需局域网或公网配置。

    推荐理由:卡兹克这套 Codex 加 UU 远程的组合,从工作流上解决了多设备协同的痛点,远程扫码的兜底用法尤其巧妙,适合不想被绑在办公桌前的 Agent 使用者。

  7. Tomer Tunguz 博客(VC 分析)70

    空白画布式 AI 战略:Thinking Machines 的开源模型 Inkling 与 Slate Auto 的皮卡异曲同工

    Thinking Machines 发布 Apache-2.0 开源模型 Inkling,975B 参数、基于 45 万亿 token 从头训练,定位通用基础模型。模型权重免费,但通过其微调平台 Tinker 的定制化服务收费。该策略与 Slate Auto 售价 $24,950 的可定制皮卡类似,以低价通用基础产品吸引用户,通过增值定制实现商业化。

    推荐理由:作者把 Inkling 的开源策略与低价定制皮卡类比,指出权重免费、微调收费的商业模式逻辑,提供了一个理解开源 AI 变现的视角。

  8. Hacker News 热门(buzzing.cc 中文翻译)73

    前谷歌DeepMind研究员因公司签署无限制军事AI协议而离职

    前谷歌DeepMind研究员Alex Turner因谷歌向国土安全部出售云服务并最终签署无限制军事AI协议而离职。他曾起草25页提案要求加入禁止杀手机器人和大规模监控的合同条款,但提案被CEO转交后无人跟进。Turner指出,包括Jeff Dean和Stuart Russell在内的多位AI伦理领袖在关键时刻未能兑现承诺。

    推荐理由:Alex Turner用亲身经历戳穿了AI巨头们的伦理承诺,Jeff Dean、Stuart Russell等名人在关键时刻失声,这份记录比任何声明都真实。

  9. Hacker News 热门(buzzing.cc 中文翻译)72

    AI语音诈骗:退休老人因合成女儿哭声被骗1.5万美元

    2025年夏季,美国佛罗里达州一名退休老人接到“女儿”哭诉车祸需保释金的电话,一小时内取现1.5万美元交给冒充法院的快递员——实际上,哭声是从一段音频片段合成的AI语音。FBI 2026年4月报告首次将AI欺诈列为独立类别,2025年收到超2.2万起AI相关投诉,调整后损失超8.93亿美元,其中60岁以上受害者占3.52亿美元。

    推荐理由:FBI首次将AI诈骗单独统计,老年人成最大受害群体。这篇分析点破了防范盲区:别再指望靠人分辨真假语音,责任该压在银行和平台身上。

7月15日周三
  1. Hacker News 热门(buzzing.cc 中文翻译)72

    数据中心已使美国公众电费增加230亿美元,回收成本困难重重

    数据中心对电力的需求已导致美国公众电费增加230亿美元,这一涨价将持续至2028年底。由于电价由州公用事业委员会根据复杂的成本分摊规则设定,数据中心可利用其用电灵活性(如避开系统峰值负荷)规避部分成本分摊,而普通居民难以效仿。监管机构正面临如何公平分配电网基础设施投资成本的挑战。

    推荐理由:文章拆开了美国电力市场成本分配的规则漏洞,原来数据中心能靠预测高峰期降载来逃掉电费,普通住户根本没法复制,最后账单还是落在我们头上。

  2. 公众号:卡尔的AI沃茨71

    开源 LLM TODO Skill“阿福”:用 Claude Code 和 Codex 实现知识管理到排期自动化

    作者基于 API 版 Fable5 和 Codex 开发了开源 TODO Skill“阿福”,用于将收件箱中的待办资料自动转为 Markdown 任务卡,识别信息不完整项(如视频链接需通过 yt-dlp 和本地 Whisper 提取字幕),并支持批量排期、AI 分组合并、拖拽调整周视图及同步到 Mac 日历或飞书日历。项目已开源在 GitHub,安装仅需一条命令。

    推荐理由:卡尔把三年知识管理教训封装成一个能自动扫描、合并排期的 TODO Skill,如果你也被碎片信息淹没,这个工具比任何大纲都实用。

  3. 公众号:数字生命卡兹克64

    每天Vibe Coding 16小时,作者分享Fable 5与GPT-5.6 Sol的AI开发流程

    作者每天Vibe Coding约16小时,认为Claude Fable 5在大型方案初版设计上“当世独一档”,GPT-5.6 Sol能有效纠错并优化方案。核心流程为:Fable 5出方案初版 → GPT-5.6 Sol审查纠错 → 在Codex中开启“目标模式”全自动化执行,最长曾连续运行17小时。

    推荐理由:卡兹克把每天16小时Vibe Coding磨出的流程讲透了,Claude出方案、GPT纠错、Codex目标模式全自动执行,这条流水线能让你的开发瓶颈从写代码转移到测试和方案设计上,值得一试。

  4. Hacker News 热门(buzzing.cc 中文翻译)70

    如何让 Claude 不再说“honest takes”和“load-bearing seams”

    用户可通过 Claude 的 MessageDisplay Hook 机制自定义词汇替换。编写 Python 脚本,将“seam”替换为“whatchamacallit”、“you're absolutely right”替换为“I'm a complete clown”、“honest take”替换为“spicy doodad”、“load-bearing”替换为“cooked”,保存为 `~/.claude/hooks/wordswap.sh` 并赋予执行权限,再在 `~/.claude/settings.json` 的 hooks 块中配置该命令。Hook 在启动时加载,新会话即生效。

    推荐理由:Claude 的「load-bearing」和「honest take」可能是你今年最烦的 AI 用语,这个 hook 脚本把它们替换成搞笑词,读完直接套用,保证效率与笑果兼备。

7月14日周二
  1. 公众号:小红书技术(dots.llm)64

    小红书企业级 AI 个人助理:从 0 到全员覆盖的架构实践

    小红书以 3 人 3 天推出内测版本,约一个月实现全员覆盖,核心是 AI Native 项目运作机制。技术选型基于 OpenClaw 二次开发,通过 Seal AI Zone 隔离集群与 NEX 沙箱解决安全,Self-GC 使输入 Token 下降 10%~15%、Auto 模式路由使成本降低 69%,并自研 LLM Wiki 三层记忆架构与 Skill Hub 生态。

    推荐理由:从物理隔离到三层记忆,这套方案把 OpenClaw 定制为企业个人助理,沙箱和成本控制细节对同类实践有直接参考价值。

  2. Google AI:DEV 作者专属(RSS)66

    Google ADK 2.4.0 发布:Agent 可直接触发动态工作流

    Google 发布 ADK 2.4.0,允许将 Workflow 直接注册为 Agent 的工具列表中的一等工具,使协调 Agent 能自动调用动态工作流。该模式通过 `@node` 装饰器定义动态执行节点,支持在运行时根据用户输入的任务列表迭代调用子 Agent 生成执行计划。示例使用 gemini-3.5-flash 模型实现任务协调,代码已开源至 devrel-demos 仓库。

    推荐理由:ADK 2.4 把动态工作流直接注册成 Agent 的工具,补齐了多智能体编排里缺失的那块拼图,做复杂 Agent 的可以直接抄这个模式,代码拿来就能跑。

  3. X:Demis Hassabis (@demishassabis)68

    Demis Hassabis:AGI 数年可至,影响达工业革命10倍

    Google DeepMind 联合创始人 Demis Hassabis 发文称,AGI 可能仅需数年即可实现,其影响将达工业革命的10倍且速度更快。他指出,前沿模型在网络安全、核与生物风险方面已构成挑战,未来需对日益智能体化、递归自我改进的系统建立稳健防护。Hassabis 呼吁美国率先建立类似 FINRA 的前沿AI标准机构,采用联邦监督下的公私合作或自律组织模式,由独立技术专家和开源代表组成董事会,资金主要来自行业以吸引顶尖人才和算力。他强调,当前商业与地缘竞赛导致技术进步快于理解,需以谨慎乐观态度推进公共政策,兼顾创新与安全。

    推荐理由:Demis Hassabis 亲自下场提出一个具体的 AGI 监管框架,用 FINRA 模式构建标准组织,这比泛泛呼吁更有行动感,政策讨论里少见的可操作方案。

  4. 公众号:卡尔的AI沃茨75

    实测LibTV Agent:100个AI视频工作流重组为Skill,实现创意自由

    LibTV推出Agent功能并内置Skill Hub,提供100多个覆盖武侠电影、皮克斯动画广告、电商口播等类型的视频Skill。用户输入想法后,Agent会分析需求并询问方向,自动生成视频分镜并串联成完整节点工作流,每个节点可查看和修改提示语。生成后LibTV会启动自查机制,自动检测并返修有问题的镜头。故事板视图提供图片与视频资产总览,支持在成片中直接打开剪辑时间线进行精细调整。用户还可自行创建Skill,上传三个文件即可,无需编程。实测中,Agent能输出剧情连贯、带粤语配音的成片,并支持双语字幕生成。

    推荐理由:LibTV把成熟的视频流程做成可复用的Skill,并开放自定义上传,让创作者无需从节点开始,直接输出接近成片的作品,对于想缩短想法到成片距离的人,这是一个值得上手的效率工具。

  5. Google AI:DEV 作者专属(RSS)67

    合成随机向量数据会误导 PostgreSQL 和 AlloyDB 的向量搜索性能测试

    Google AI 工程师指出,使用合成随机向量数据测试向量搜索性能可能导致误导性结果。对于 HNSW 索引,合成数据构建耗时 6,601,789 毫秒,而真实数据仅需 4,174,196 毫秒,速度快 1.5 倍,因为随机向量缺乏自然聚类结构,使图索引的节点连接更难建立。

    推荐理由:玩pgvector或AlloyDB向量搜索的开发者应该看看这篇,用合成数据测HNSW索引召回率可能只有3%,而真实数据超90%,附带完整SQL复现脚本。

  6. 公众号:面壁智能(MiniCPM)61

    面壁智能CTO曾国洋专访:端侧模型是AI落地关键路径

    面壁智能CTO曾国洋指出,端侧模型是AI落地的关键路径。其原创方法论“模型风洞”可在小规模实验中预测完整训练效果,并基于“知识密度”提出“面壁定律”:知识密度每3.5个月翻一番。2B参数的MiniCPM表现优于同期8B竞品。面壁已完成高通、联发科、英特尔、英伟达、AMD等芯片适配,新发布的BitCPM-CANN模型系列可在华为昇腾芯片上让同一内存多装约6倍模型。全双工全模态模型MiniCPM-o4.5支持实时打断与情绪调整。团队开发了全球首个完全由AI编写的生产级训练框架ForgeTrain,并引入行为模式库实现无需开口的“默契系统”。

    推荐理由:面壁选择了一条少有人走的端侧之路,这篇 CTO 专访把落地的真实困难、原创方法和他们的思考都摊开了,对做模型和做产品的人都有启发。

  7. Tomer Tunguz 博客(VC 分析)64

    AI 时代的“数据控制权”之争:Harness 成为新战场

    继 SaaS 之后,企业数据正通过 AI 使用轨迹(trajectories)流向模型厂商,引发数据主权担忧。纳德拉与帕兰提尔 CEO 同时警告数据泄露风险;7 月 13 日,安全研究员逆向 xAI 的 Grok Build 发现,零 AI 调用会话也会上传开发者代码库,xAI 已禁用该行为。未来 CIO 与 CEO 将要求零数据保留,厂商须承诺不访问企业数据。

    推荐理由:作者把 Nadella 与 Karp 的同周表态和 Grok Build 上传代码事件串起来,指出 AI 时代企业数据可能经由 harness 变成厂商资产,数据留存条款或成采购核心。

  8. Hacker News 热门(buzzing.cc 中文翻译)77

    前沿模型实际成本:tokenizer 差异导致隐性涨价

    同一份 TypeScript 文件在 GPT-5.x 上为 681 个 token,在 Claude 最新 tokenizer 下为 1,178 个,相差 1.73 倍。Anthropic 新 tokenizer 比旧版多产生约 30% 的 token,标价不变,构成隐性涨价。Claude Opus 4.6 与 Opus 4.8 标价同为 $5.00 / $25.00,但新 tokenizer 使同一代码的 token 数增加约 32%。Claude Sonnet 5 的 $2.00 / $10.00 为促销价,2026 年 8 月 31 日后恢复 $3.00 / $15.00,届时相同代码成本将比 Sonnet 4.6 高出约 32%。跨厂商对比中,Claude 新 tokenizer 在代码上比 GPT 多产生 1.50x 至 1.73x 的 token,TypeScript 差距最大。

    推荐理由:这篇用实打实的token计数揭开了各厂商定价页藏着的秘密,代码场景下Claude有效价格比GPT贵50-73%,做coding agent的必须按‘每任务成本’而非‘每token标价’来算账。

  9. AI as Normal Technology(RSS)76

    普林斯顿教授 Narayanan 提出“AI as Normal Technology”框架

    普林斯顿大学教授 Arvind Narayanan 在 ICML 上提出,除非出现递归自我改进等不连续性,否则 AI 应被视为一种变革性但可适应的正常技术。他呼吁 AI 社区不应接受工作将被完全取代的叙事,而应专注于培养与 AI 互补的技能,以实现人机“共超智能”。

    推荐理由:Narayanan 在 ICML 的主旨演讲里把 AGI 焦虑拆成了递归自我改进、经济转型、类人 AI、超级智能四个独立维度,又用能力-可靠性缺口等一手证据说明自动化远未到来,但人类角色必须从「划船」转向「掌舵」。对关心 AI 对工作影响的人,这是一份冷静的思维框架。

  10. The Decoder:AI News(RSS)78

    OpenAI 面向普通用户发布提示词指南:从结果出发,少写步骤

    OpenAI 整合了一份面向普通用户的提示词指南,涵盖目标、上下文、输出格式和边界四个可选模块。指南建议以结果而非步骤开头,用一两条硬性规则替代逐步骤脚本。Chat 处理快速任务,基于 Codex 技术和 GPT-5.6 模型的 ChatGPT Work 负责多源、多步骤的复杂项目。Codex 新增 Steer(重定向当前运行)、Queue(排队下一条消息)和沙盒模式,支持 `/plan`、`/goal` 和 `/review` 等斜杠命令。用户无需一次性写对提示词,后续追问是预期调整方式。

    推荐理由:OpenAI 这次把提示工程从极客技巧拉回常识沟通,核心就一句:先说你想要的结果,别替模型操心步骤。普通用户读完就能上手,思路比旧版引导更务实。

  11. Tessl:产品与工程博客66

    GitHub 复盘:更好的共享工具为何让 Copilot code review 变差

    GitHub 将 Copilot code review 迁移到与 Copilot CLI 共享的 grep、glob、view 工具集后,离线评测显示审查成本上升、有效问题检出减少。

    推荐理由:原文用工具追踪展示迁移后 agent 的行为偏差,给出可迁移的提示词重写思路,比结论本身更有参考价值。

7月13日周一
  1. Hacker News 热门(buzzing.cc 中文翻译)70

    Ploy 将 AI 智能体默认模型从 Claude Opus 4.8 切换至 GPT-5.6 Sol

    Ploy 将其 AI 智能体默认模型从 Claude Opus 4.8 切换至 OpenAI 今晨发布的 GPT-5.6 Sol。在真实营销网站构建测试中,GPT-5.6 Sol 完成页面平均耗时 3 分 42 秒,较 Opus 4.8 的 8 分钟快 2.2 倍;每次构建成本从 3.06 美元降至 2.22 美元,降低 27%;输出 token 从 33.0K 降至 17.1K,视觉评分从 0.936 提升至 0.970。迁移过程发现,GPT-5.6 会为所有 25 个工具参数填充默认值,导致 52%-64% 的文件读取返回空结果;提示词指令和 OpenAI strict 模式均无法修复此行为。此外,评估框架中约三分之一的原始失败源于针对旧模型的假设,而非模型本身问题。

    推荐理由:这篇 Ploy 的迁移手记把 GPT-5.6 生产中踩的坑都摊开了,工具调用参数膨胀和缓存键设计两个问题,做 agent 的团队不看可能会付昂贵学费。

  2. Cognition 模型 / Devin 博客(网页)65

    Cognition 实测:Fable 5 领衔的 Devin 成本反而低于 Opus 4.8

    Cognition 用 FrontierCode 1.1 上的 3000 次评测对比 Fable 5 与 Opus 4.8,发现尽管 Fable 5 每 token 单价是 Opus 的 2 倍,在 Fusion 侧搭子架构下 Fable + Sidekick 每次运行成本 $1.86、得分 60.7,低于 Opus + Sidekick 的 $2.04 与 54.6。

    推荐理由:原文用 3000 次评测拆解了每轮成本去向,说明逐 token 单价为何不能预测智能体实际账单,方法对评估编码智能体成本有可迁移性。

7月12日周日
  1. X:Satya Nadella (@satyanadella)75

    纳德拉提出“反向信息悖论”:企业使用AI时需保护自身知识

    微软CEO萨提亚·纳德拉提出“反向信息悖论”:AI时代,买家为使用AI支付金钱,同时必须暴露专有知识(提示词、工具使用、纠正反馈等),这些“智力废气”被模型学习,导致信息不对称向卖家倾斜。企业需要真正的信任边界,确保自身数据、痕迹、评估、适配权重和记忆在边界内积累,未经同意不得外泄。纳德拉呼吁企业拥有私有评估、保留组织记忆所有权,并主张企业应有权使用模型输出微调或训练自有模型,以控制自身学习循环。

    推荐理由:Satya 提出的「反向信息悖论」直指企业 AI 部署的核心顾虑,建议具体可操作,尤其是评估集控制和编排层解耦,做企业 AI 的产品人现在就该读。

  2. The Decoder:AI News(RSS)71

    OpenAI CEO Altman 改口称 AI 净创造就业,Anthropic CEO 也修正早期言论

    OpenAI CEO Sam Altman 表示,他“相当确信”AI 迄今为止净创造了就业,并承认“这并非我预期”。此前他曾警告 AI 影响可能快得“有点吓人”。Anthropic CEO Dario Amodei 也修正了早期言论,将自动化描述为生产力倍增器而非岗位杀手。然而,多项研究未发现 AI 对整体生产力或劳动力市场产生显著影响。一项多校联合研究指出,程序员和文案的就业危机始于 2022 年初,早于 ChatGPT 发布。耶鲁预算实验室也未发现与 AI 相关的就业市场变化。

    推荐理由:Altman和Amodei几乎同时调头,从“AI消灭工作”变成“AI净增就业”,这个转向本身比任何研究都更能说明行业叙事在怎么变。

  3. Hacker News 热门(buzzing.cc 中文翻译)74

    xAI Grok Build CLI 网络流量分析:上传仓库全部文件及 git 历史

    对 xAI 官方 Grok Build 编码 CLI(grok 0.2.93)的网络流量分析显示,该工具在消费者登录后会向 xAI 发送三类数据:一是它读取的文件内容(包括 .env 密钥文件)以明文形式通过 POST /v1/responses 传输,并同时打包成 session_state 存档通过 POST /v1/storage 上传并获 HTTP 200 确认;二是整个仓库的全部文件内容及 git 历史,独立于 AI 智能体实际读取的文件——即使提示“不要读取任何文件”,Grok 仍将整个仓库作为 git bundle 上传至 Google Cloud Storage 的 grok-code-session-traces 存储桶;三是该上传机制默认开启,且关闭“改进模型”设置不会禁用(/v1/settings 仍返回 trace_upload_enabled: true)。在 12 GB 仓库测试中,/v1/storage 传输了 5.10 GiB 数据,而模型对话通道仅传输 192 KB,比例约 27,800 倍。分析未证明 xAI 使用这些数据进行训练,但证实了数据被传输、接收并存储。

    推荐理由:这是我见过最严谨的隐私调查,每步可复现——Grok CLI 会在用户不知情下将完整仓库、.env 密钥甚至未读文件原样上传至 xAI 的 GCS,默认开启且无法真正关闭,所有用 Grok Build 的开发者都得重审自己的 secrets。

  4. X:Tibo (@thsottiaux)75

    Tibo 分享通过 CLIProxyAPI 将 Claude Code 后端模型切换为 GPT-5.6 Sol 的方法

    用户 Tibo 分享了一种通过 CLIProxyAPI 将 Claude Code 后端模型切换为 GPT-5.6 Sol 的方法。只需三步:安装 CLIProxyAPI、连接认证、设置环境变量别名 `claudex`。该别名配置了子智能体模型、始终启用 Effort、最大并发工具调用数等参数。引用推文作者 Theo 补充,若已配置好代理,仅需约 2 条提示词即可完成设置。Tibo 称整个过程约 5 分钟,若被封锁可重置。

    推荐理由:不装Codex app也能用GPT-5.6-Sol,这个别名技巧解决了Claude Code用户的尝鲜难题,一行命令就搞定,对开发者很友好但算不上突破。

  5. Hacker News 热门(buzzing.cc 中文翻译)75

    Ghost Font:一种人类能读懂但AI无法识别的反AI字体

    Ghost Font 是一种利用运动、视频、噪点和诱饵来隐藏文字的反AI字体。用户输入文字后可生成并下载视频片段,视频中的字母由与背景完全相同的点组成,单帧截图无法显示任何信息。该字体生成的视频被传递给Claude Fable和GPT Sol 5.6 Ultra等前沿模型时,这些模型即使具备编程能力也无法解码移动信息,直到被提示具体技术。视频中还包含一条诱饵信息,使模型误以为找到真实内容。项目灵感来自2013年Sang Mun设计的ZXX字体,但现代AI已能轻松读取ZXX。Ghost Font目前为本地原型,数据不发送至任何服务器。作者计划未来将视频生成代码开源,并探索将其用于CAPTCHA系统或AI视觉感知基准测试。

    推荐理由:这个项目用视频中运动的光点传递文字,还加了假消息陷阱,让顶级视觉模型集体失败。对抗AI感知的探索很少这么直观,做CAPTCHA和对抗样本的值得看。

7月11日周六
  1. Thinking Machines Lab:官方博客(RSS)60

    Thinking Machines Lab:构建延伸人类意志与判断的 AI

    Thinking Machines Lab 在官方博客中阐述其使命:构建能够延伸人类意志与判断的 AI。文章指出,当前多数 AI 在少数地方训练后便冻结,无法被使用者塑造。该实验室正致力于训练具备多模态交互和可定制化能力的强模型,开发允许用户训练模型权重的工具,并构建拓宽人机沟通渠道的界面。其核心理念是让 AI 服务于分布式的人类知识,使每个组织都能利用自身独特知识微调模型,并持续适应知识演变。

    推荐理由:这篇文章是 THM 对 AI 未来的完整论述,核心是分布式定制和对齐,它挑战了当前主流的大模型集中化路线,我认为做 AI 产品的都应该读一读这份路线图。