跳到正文
北京时间

全部动态

今日 336 条
7月3日周五
  1. Anthropic:Newsroom(网页)64

    Claude Fable 5 网络安全分类器与越狱严重性框架详解

    Anthropic 重新部署 Claude Fable 5 并向全球用户开放,同步披露了内置安全分类器设计。分类器将网络安全使用场景分为四类:禁止使用(勒索软件/物理破坏等)、高风险双重用途、低风险双重用途及良性使用。前两类直接拦截;低风险类别部分监控,仅在安全边际内选择性拦截。此外,Anthropic 与 Glasswing 合作提出 AI 越狱严重性框架初稿,并已启动 HackerOne 项目收集越狱案例。

    推荐理由:Anthropic首次公开Fable 5安全分类器的详细类别和越狱严重性框架草案,这可能是行业级安全标准的雏形,对开发者和政策制定者都有参考价值。

  2. IT之家(RSS)70

    得州特斯拉致命车祸:司机嫌FSD太保守,加速踏板踩死致76岁居民死亡

    44岁的迈克尔·巴特勒驾驶特斯拉Model 3冲入得州住宅,致76岁玛莎·阿维拉死亡,现被控过失杀人。警方从其手机发现2026年5月多次搜索“FSD不够激进”“特斯拉FSD过于保守”等记录。特斯拉AI负责人称驾驶员将加速踏板踩到底(100%),手动操作覆盖了FSD。车辆数据显示,约6秒内加速踏板被完全踩下,时速升至117公里(超限速两倍),制动踏板始终未踩。阿维拉家属已起诉特斯拉和巴特勒,美国NHTSA和NTSB已介入调查。

    推荐理由:这起特斯拉FSD致命事故的司法进展中,司机被控过失杀人,黑匣子数据指向人为操作。我认为这是自动驾驶责任划分的重要判例,值得跟踪。

  3. TechCrunch:AI(RSS)70

    扎克伯格称AI智能体开发速度未如预期

    Meta CEO 扎克伯格在本周内部全体会议上表示,AI 智能体的开发速度并未像高管们此前预期的那样加速。今年早些时候Meta裁减约8000名员工(约占10%),并将另外7000人调至多个AI团队,包括Agent Transformation小组。扎克伯格称裁员不够“干净”,原因是高管担心公司无法足够快地适应技术行业变化。他还指出以AI为中心的新公司结构所预期的好处尚未实现,但相信未来三到六个月将开始看到AI投资的改善。路透社报道,Meta今年预计在AI基础设施上投入高达1450亿美元。

    推荐理由:扎克伯格对员工承认 AI 智能体进展不如预期,裁员重组的收益也还没兑现,巨头的挫败感比任何 PR 都真实,做 Agent 的团队该重新校准时间线。

  4. HuggingFace Daily Papers(社区热门论文)72

    SkillOpt-Lite:更快更好的智能体自我进化,只需一行代码

    SkillOpt-Lite 将智能体技能优化形式化为零阶优化,提出文件系统轨迹探索、共识属性挖掘与独立验证门控三条原则。相比完整 SkillOpt,它加速收敛并在 LiveMath 上提升 GPT-5.5 达 +8.8 点、GPT-5.4-nano 达 +25.4 点,使 nano 模型超越标准 SkillOpt 优化的 GPT-5.4。该框架已集成至 VSCode Copilot,开发者仅需一行代码即可进化技能。框架还可泛化为完整工具链优化(HarnessOpt),在 SpreadsheetBench 上令 GPT-5.4-nano 达到 0.7758 准确率,超越运行标准流程的更大模型 GPT-5.5(0.7620)。代码已开源。

    推荐理由:把复杂 agent 优化砍到一个最小可行管线,小模型靠它打大模型,VSCode Copilot 用一条 vibe 就能进化技能,做 agent 的人别错过。

  5. MarkTechPost(RSS)70

    阿里巴巴发布 Page Agent:开源 JavaScript 库实现网页 DOM 自然语言操控

    阿里巴巴发布 Page Agent,一个开源的 JavaScript 客户端库,嵌入网页后可通过自然语言指令直接操作 DOM 元素。与 Playwright、Puppeteer 等外部浏览器自动化工具不同,Page Agent 不依赖截图或多模态模型,而是将实时 DOM 脱水压缩为 FlatDomTree 文本映射,让纯文本模型精准执行点击、表单填写等操作。它继承用户 cookies 和会话,无需独立后端,并支持任意 OpenAI 兼容端点的模型(示例使用 `qwen3.5-plus`)。项目采用 MIT 许可证,适合在自有应用内构建 AI 副驾、智能表单填充或无障碍控制等场景,但限于单页面范围,风险操作仍需服务端验证。

    推荐理由:Page Agent 把浏览器自动化从外部驱动变成页面内 JS,读 DOM 而非截图,让 SaaS 内的 AI 助手成本更低、更精准,适合自己产品内嵌 copilot 的团队。

  6. X:Ethan Mollick (@emollick)77

    关于Mythos和网络安全的讨论并非炒作

    关于Mythos和网络安全的讨论并非炒作。 (正如任何使用Fable进行自主工作的人可能已经认识到的那样。)

    推荐理由:AI在安全漏洞发现上第一次展现出规模化能力,6月CVE数直接翻了3.5倍,所有做安全的人今天起都得重新评估自己的攻击面。

  7. The Decoder:AI News(RSS)78

    Microsoft 成立“Frontier Company”,斥资 25 亿美元派驻 6000 名 AI 工程师到企业客户现场

    Microsoft 新设业务部门“Frontier Company”,拨款 25 亿美元,将 6000 名行业与工程专家派驻企业客户现场,“共同设计、共同创新、部署并持续改进 AI 系统”。该部门由 Rodrigo Kede Lima 领导,旨在超越“前部署工程”模式,成为“最大、以结果为导向的工程组织”。Microsoft 将自己定位为 OpenAI 和 Anthropic 的“平台中立”替代方案,后两者也已设立专门部署公司。Microsoft 将借助埃森哲、凯捷、安永等系统集成商扩大覆盖范围。

    推荐理由:微软砸 25 亿美元成立 Frontier Company,把 6000 名工程师直接塞进企业客户现场,正面应战 OpenAI 和 Anthropic 的部署子公司。这一手既是补齐落地能力也是巩固生态,对 CIO 来说是选择多了,但对 AI 行业意味着部署军备竞赛正式开打。

  8. LMSYS:Blog(Chatbot Arena 团队)59

    Agent辅助的SGLang开发:初步探索

    SGLang团队将LLM服务、分布式运行时、GPU内核、扩散管道等工作流编码为可执行的SKILL.md文件、脚本、基准合约和审查循环。现有技能包括:SGLang .claude/skills(CUDA调试、内核集成、性能分析等)、SGLang diffusion .claude/skills(扩散模型添加与调优)、BBuf/AI-Infra-Auto-Driven-SKILLS(跨框架SOTA循环)、KDA(MLSys 2026 FlashInfer内核竞赛获胜方案)以及BBuf/KDA-Pilot(已合并三个SGLang集成PR)。Profile证据是性能工作的核心,长期优化转向Loop Engineering——SGLang SOTA Performance Loop将追求SOTA分解为公平基准测试、差距决策、性能分析、补丁和再验证,Humanize/RLCR添加外部审查,Codex Goal以更低协调开销运行相同循环。评审重要性提升,开发者需定义问题、选择证据、设计工作流并判断结果是否可用于生产。

    推荐理由:这不是一篇普通的开发经验总结,而是 SGLang 团队把调试、基准测试和性能调优等重复劳动变成可执行 agent 技能的实操手册,对于做推理框架和复杂工程的人非常值得一看。

  9. X:OpenRouter (@OpenRouter)68

    Fable 5 仅 4.44 美元搭建 Rube Goldberg 机器

    用 Fable 5 构建的鲁布·戈德堡机械,仅需 4.44 美元 👀 提示词在此:https://www.reddit.com/r/openrouter/comments/1ulkilz/i_asked_claude_fable_5_to_build_a_rube_goldberg/

    推荐理由:一个好玩又有技术含量的玩法示范,Fable 5 配上精心调教的 prompt 把复杂机械动画成本压到几美元,做创意内容的可以直接抄作业。

  10. Claude:Blog(网页)61

    Claude Enterprise 新增用量与成本分析及支出管控功能

    Claude Enterprise 推出更丰富的管理分析工具和成本控制功能。仪表板现可按群组和用户分析用量与成本,支持按 SCIM 群组筛选,展示制品创建、文件编辑、技能和连接器对应的成本。Claude Code 管理控制台新增“使用量”和“价值”选项卡,分别显示活跃开发者、会话次数、常用命令,以及生产力提升估算、每次提交成本和年度价值估算。分析聊天支持自然语言查询并返回可导出图表。Analytics API 可将数据接入 Datadog Cloud Cost Management 和 CloudZero。管理员可设置模型默认和权限控制,并配置组织级支出限额的 75%、90% 告警通知;用户在 75% 和 95% 时收到应用内提醒。Admin API 支持自动审批额度增加、标记接近限额用户及快速变化的用量。

    推荐理由:企业版管理员终于有了按群组和用户的成本明细、模型权限和花费警告。我觉得规模化部署 Claude 的团队会很看重这些,尤其能把 Claude Code 的价值量化成 ROI,财务团队可以直接拉进现有系统,不是一次性噱头。

  11. LangChain:Blog(RSS)64

    OpenWiki:为编码智能体生成并维护开源仓库文档

    LangChain 推出 OpenWiki,一个为编码智能体自动生成和维护代码库文档的开源工具。它让智能体能直接检索所需的仓库上下文,无需将所有内容加载到单个指令文件中。

    推荐理由:LangChain 开源的这个文档生成代理解决了编码代理上下文管理的一个痛点,对重度使用 agent 做开发的团队很实用。

  12. Apple Machine Learning Research(RSS)62

    RL微调VLM的鲁棒性与思维链一致性研究

    强化学习(RL)微调被扩展至视觉语言模型(VLM)。研究发现,简单的文本扰动——误导性标题或错误思维链(CoT)——会显著降低模型鲁棒性和置信度,且开源模型衰退更明显。闭源模型呈现类似失败模式,但鲁棒性和推理一致性更强。进一步分析揭示准确性与忠实性的权衡:微调提升基准准确率,但同时侵蚀CoT的可靠性及对上下文变化的鲁棒性;对抗性增强可改善鲁棒性,却无法阻止忠实性漂移。引入忠实性感知奖励能恢复答案与推理的对齐,但与增强结合时训练易崩溃到捷径策略。这些发现强调需联合关注正确性、鲁棒性与视觉推理的忠实性。

    推荐理由:RL微调让VLM基准分变好看,却可能让它的推理链变得靠不住,这个反直觉的诊断对正在用RL打磨多模态模型的团队是个警醒。

  13. Apple Machine Learning Research(RSS)56

    VideoFlexTok:可变长度粗到细视频分词

    VideoFlexTok提出一种可变长度token序列的视频表示方法,采用粗到细结构——首个token捕捉语义和运动等抽象信息,后续token添加精细细节,生成流解码器支持任意token数量的视频重建。相比传统3D网格分词,该结构允许根据下游需求调整token数,在相同预算下编码更长视频。在类别和文本到视频生成任务中,VideoFlexTok以1.1B参数(5.2B的1/5)达到可比生成质量(gFVD和ViCLIP Score)。训练一个处理10秒81帧视频的文本到视频模型仅需672个token,比同等3D网格分词器少8倍。

    推荐理由:把视频 tokenization 从固定网格改成变长 coarse-to-fine,训练效率提升明显,还能做更长的视频。研究角度挺漂亮,但离产品落地还有距离,做视频生成的可以追一下。

  14. Apple Machine Learning Research(RSS)72

    多智能体团队阻碍专家发挥

    在自我组织的多智能体LLM系统中,团队无法有效利用专家成员的专业知识。在多个基准测试中,即使明确告知专家身份,团队表现仍落后于最佳成员(专家智能体)的独立能力,性能损失最高达41.1%。失败主因是未能有效利用专家意见,而非识别专家。对话分析显示,团队倾向于“整合性妥协”——平均化专家与非专家观点,随团队规模增大而加剧,且与表现负相关。这种寻求共识的行为同时提升了对抗恶意智能体的鲁棒性,揭示了协同对齐与专业利用之间的根本性权衡。

    推荐理由:这篇研究给多智能体热浇了盆冷水,自组织团队反而拖累专家,瓶颈不在认不认识专家而在会不会用专家,做 Agent 系统的都知道这有多反直觉。如果你是做多智能体的值得看看。

  15. IT之家(RSS)71

    快手可灵AI获初始投资者20.28亿美元注资,投后估值180亿美元

    快手在港交所公告,21名初始投资者同意以138.24亿元人民币(20.28亿美元)现金注资北京可灵,后者将持有可灵AI相关资产。同日15名额外投资者追加出资52.235亿元人民币(7.6639亿美元),认购总上限为204.471亿元(30亿美元),对应北京可灵扩大后注册资本的16.67%。投后估值180亿美元。快手预计未来12个月内启动可灵AI赴港上市,募资用于扩充算力、建设数据中心及人才引进。

    推荐理由:可灵AI这轮180亿美元估值融资,是AI视频赛道迄今最重量级的资本动作之一,也是中国AI公司分拆上市的标杆事件,值得关注后续上市进程。

7月2日周四
  1. IT之家(RSS)74

    花旗、Adobe等企业限制员工使用AI旗舰模型以控制成本

    据404 Media获取的内部资料,Atlassian、Adobe、亚马逊等六家企业正限制员工使用AI工具,要求改用能力较低的大模型避免成本失控。至少一家企业月度AI开销增至三倍,超1500万美元。花旗银行因GitHub改为按量计费,于6月24日禁用Claude Opus 4.6、4.7及GPT-5.5等旗舰模型。Adobe于6月30日终止Claude无限制使用协议。Atlassian数据显示其AI月支出从500万美元飙升至1500万美元,本财年预计超1.2亿美元。GitHub计划改用开源模型并测试单人按量计费模式。

    推荐理由:这是第一份详细揭露大公司AI成本失控的内部报告,花旗直接禁用GPT-5.5和Claude 4.7,把「按需匹配模型」写进全员邮件,对所有在铺AI的企业都是一记现实的耳光。

  2. 公众号:可灵AI(快手·视频)71

    戛纳金狮首设AI子赛道:可灵制作斩获1银2铜,它们为何打动评委?

    戛纳国际创意节今年首次设立AI Craft子赛道,两部使用可灵AI生成的广告作品获奖:《L'Ultimo Uomo Reale》拿下Classic单元Film银奖及Craft单元Film Craft铜奖,《Lorem Ipsum》获得Classic单元Film铜奖。

    推荐理由:《L’Ultimo Uomo Reale》和《Lorem Ipsum》用可灵完成从人物表演到视觉奇观的全部画面,戛纳金狮的认可使AI视频生成进入商业交付级评价体系,广告公司的「技术已就绪」主张因此有了第三方权威参考。

  3. The Decoder:AI News(RSS)71

    Fable 5 在 RLI 基准中达成 16.1% 自动化率,较八个月前提升六倍

    Remote Labor Index(RLI)衡量 AI 智能体完成 240 个付费自由职业项目(总值 14.4 万美元)的专业质量比例。最新结果显示,Fable 5 自动化率达 16.1%,是八个月前最佳系统 2.5% 的六倍多,也超过 Opus 4.8(8.3%)和 GPT-5.5(6.3%)。因美国政府限制访问,Fable 5 仅完成 218/240 个项目评估,最坏情况仍达 14.6%。Gemini 3 Pro 仅 1.25%,落后于更老模型。AI 裁判会高估模型表现(GPT-5.5 评分偏高近三倍),仍需人类评估员打开专业软件(如 Blender)检验几何模型等细节。测试环境为虚拟 Linux 机,配备 30 余款专业应用,每项目最多 24 小时计算时间。尽管自动化率快速攀升,多数项目仍无法达到专业质量。

    推荐理由:自由职业自动化率八个月翻了六倍,这个数据比任何模型基准都更说明AI对真实工作的渗透速度。虽然顶级模型仍会'作弊',但趋势已经形成,做自由职业平台和外包的人该认真看看。

  4. Ars Technica:AI(RSS)70

    谷歌AI建设导致2025年用电量增长37%

    2025年,谷歌年度用电量同比上涨37%,创历史最大增幅。数据中心全年消耗超4200万兆瓦时,超过新西兰、丹麦、尼日利亚等国总用电量。自2019年以来,谷歌总用电量已增长超250%。用电激增主要来自Google Cloud、YouTube视频流及支撑AI产品和服务的数据中心建设与运营。公司表示,AI基础设施建设速度超过电网脱碳速度,但仍致力于扩大全球清洁电力规模,并通过技术创新降低运营排放。2024年谷歌用电量增幅为27%。

    推荐理由:谷歌2025年电力消耗暴增37%创历史纪录,清洁能源购买未能完全掩盖新建天然气电厂的排放,AI扩张的环境代价正加速兑现。

  5. Hacker News 热门(buzzing.cc 中文翻译)71

    Senior SWE-Bench:评估AI智能体作为高级工程师的基准测试

    Senior SWE-Bench是一个开源基准测试,用于评估AI智能体完成高级软件工程师级别任务的能力。任务分功能开发与Bug修复两类:功能任务指令类似自然语言消息,采用验证智能体基于专家配方自动生成行为测试;Bug任务要求根据日志、profiling等运行时信息深入调查。排行榜显示,Claude Opus 4.8搭配Mini-SWE-Agent(max effort)通过率24.0%,Claude Sonnet 5为19.4%,GPT-5.5为16.0%,最强前沿模型在超75%任务中未能达到高级工程师级别的正确性与品味。每个功能任务平均涉及11个文件,最强智能体也需数百步完成;中位指令长度仅为SWE-Bench Pro的31%。任务来源于从库到多服务应用的仓库PR,由拥有数百次提交的工程师编写。

    推荐理由:这个新基准把 AI 编程代理的评估拉到了更真实的复杂度,顶尖模型也只有不到四分之一的成功率,做 coding agent 的都该拿它测一测,它会比 SWE-bench 更挑出工程师的“手感”。

  6. 公众号:千问APP(阿里)62

    千问团队朱达:C端Agent Harness的“多快好省”工程哲学与主动服务探索

    千问团队2026年1月上线通用复杂任务Agent(千问App胶囊入口),总结“多快好省”方法论:支持信息搜集、研究分析等任务;执行时间降至初始1/3;通过搜索范式与上下文管理优化交付质量;Token消耗仅为海外产品1/10。团队探索从被动响应转向主动服务,构建User Memory、Environment、Task System、Assistant四大组件,指出“情商”是主动服务最难环节。朱达提出Agent工程从Prompt Engineering演进至Harness Engineering,下一站是A IWare Engineering,强调“低功耗,够用就行”。

    推荐理由:千问C端团队分享的Agent工程实践很务实,从“多快好省”到AIWare Engineering的演进思路,对正在做复杂任务Agent的团队是一个有价值的参考系。

  7. IT之家(RSS)70

    证监会同意宇树科技科创板 IPO 注册申请

    7月2日,证监会同意宇树科技股份有限公司首次公开发行股票并在科创板上市的注册申请。宇树科技是国内头部民用足式、人形机器人研发企业,全球四足机器人销量领先,2016年由王兴兴在杭州创立,截至2025年6月员工总数超1000人。公司核心优势在于实现关节电机、减速器、控制器等核心零部件全栈自研,关键部件成本仅为进口产品的约1/3。批复自同意注册之日起12个月内有效。

    推荐理由:宇树是国内人形机器人头部,IPO 获批意味资本正式为具身智能赛道打开通道,接下来硬件和量产能力会成为竞争焦点,关注王兴兴下一步怎么花钱。

  8. MarkTechPost(RSS)72

    Google Health API 推出 CLI:ghealth 是一款针对 Fitbit 数据的开源工具

    ghealth 是一款封装 Google Health API v4 的开源命令行工具,以单个 Go 二进制文件发布(Apache 2.0 协议)。它提供 40 种已验证的数据类型(包括步数、心率、睡眠、体重、血氧饱和度、心率变异性等)的结构化 JSON 输出。工具采用 Agent 优先设计,具备确定性退出码、--dry-run 和 --raw 标志,并附带两个 SKILL.md 文件供 AI 智能体使用。用户需自行创建 OAuth 凭据,通过 PKCE S256 认证。数据来源覆盖 Fitbit、Pixel Watch 及连接的第三方设备。

    推荐理由:把 Google Health API 封装成终端和 AI 代理友好的 CLI,一次性解决了认证、JSON 输出和分页这些烦人细节,想用 Fitbit 数据做健康分析或喂给代理的人可以直接上手,但它的影响仅限于个人健康数据爱好者这个小圈层。

  9. Hacker News 热门(buzzing.cc 中文翻译)71

    Kimi K2.7 Code 已在 GitHub Copilot 上正式发布

    Kimi K2.7 Code 开源权重模型已在 GitHub Copilot 中正式可用,成为 Copilot 模型选择器首个可选的开源权重模型,为编程工作流提供更低成本选择。该模型由 GitHub 托管于 Microsoft Azure,按供应商列表价格以用量计费。逐步向 Copilot Pro、Pro+ 和 Max 计划用户推送,用户可在 Visual Studio Code 1.127.0 或更新版本、Visual Studio 17.14.6 或更新版本、JetBrains 1.9.1-251 或更新版本、Xcode、Eclipse 等 IDE 及 Copilot CLI、GitHub.com、GitHub Mobile 等平台中选用。后续几周将扩展至 Copilot Business 和 Enterprise,当前默认关闭,需管理员在 Copilot 设置中启用策略。

    推荐理由:GitHub Copilot 首次把开源权重模型放进模型选择器,Kimi K2.7 Code 作为低价选项可能会改变很多开发者的使用习惯,对个人开发者尤其友好。

  10. X:Testing Catalog (@testingcatalog)75

    OpenAI提议美国政府持股5%估值426亿美元

    据Financial Times和CNBC报道,OpenAI提议向美国政府提供公司5%的股份,按近期8520亿美元估值计算,价值约426亿美元。OpenAI CEO Sam Altman表示,此举是与公众分享AI发展红利的最佳方式。

    推荐理由:当估值8520亿的AI巨头主动将5%股份交给政府,这不再是普通的游说策略,而是可能重新定义公私关系的标志性一步。我觉得这件事的长期影响比任何模型发布都更深远。

  11. IT之家(RSS)80

    AI 版支付宝开放公测,蚂蚁阿宝无需邀请码即可体验

    支付宝阿宝 AI 助手今日正式开放公测,iOS 和安卓用户可在应用商店或支付宝 App 搜索“阿宝”或“蚂蚁阿宝”直接体验。开通后右滑进入新版,以对话方式安排办事,例如说出“查公积金”,阿宝会自动匹配对应小程序和服务入口,用户点击确认即可完成。支付宝承诺所有资金变动与支付环节均需用户本人确认,扫码、转账等功能已预留入口。

    推荐理由:支付宝把 AI 助手从内测推进公测,对话式办事对普通用户来说很直观,省去了多层菜单跳转,虽然支付等敏感环节还是手动确认,但体验上的进步是实在的。

  12. 公众号:昆仑万维(天工)67

    昆仑万维天工3.2发布Skywork Tags,AI智能体加入工作群聊

    昆仑万维天工3.2发布Skywork Tags,将AI智能体以团队成员身份接入Slack、飞书、钉钉、Discord、Telegram等即时通讯工具。团队可在原有工作群中@Skywork参与讨论,无需切换窗口或迁移数据。共享版Agent持续吸收多样上下文后表现反超精心调教的个人版,团队最终完全改用共享版。Skywork Tags不要求改变工作方式,让AI积累团队上下文并越用越强。

    推荐理由:Skywork Tags 的思路走对了——不逼团队搬家,而是让 AI 进群,内部测试也证明共享 Agent 能远超个人调教,做协作工具的产品人可以借鉴。

  13. 腾讯混元:Research(API)69

    腾讯混元正式发布Hy3模型

    腾讯混元于7月6日正式发布Hy3模型。相比preview版,任务解决率从72%升至90%,平均耗时缩短34%;幻觉率从12.5%降至5.4%,常识错误率从25.4%降至12.7%,多轮问题率从17.4%降至7.9%,长对话基准MRCR从42.9%升至75.1%。在270位专家盲测中均分2.67/4,优于GLM5.1的2.51/4。API价格为输入1元/百万tokens、输出4元、缓存命中0.25元。模型已基于Apache 2.0协议开源。

    推荐理由:腾讯混元重建后的正式版,幻觉率砍半,工具调用稳定性大幅提升,内部盲测压过GLM5.1。做Agent和内部工具的团队值得重新评估这个高性价比选项。

  14. PromptArmor:Threat Intelligence66

    PromptArmor 披露 Microsoft Copilot Cowork Skill 可绕过管理员设置调用 DeepSeek

    PromptArmor 披露,即使组织未加入 DeepSeek Preview,Microsoft Copilot Cowork 的 Skill 也能通过 agent 自身的访问路径调用 DeepSeek(Mistral 亦验证可行),且无需 API key,认证由用户的 Cowork 会话自动授予。

    推荐理由:原文实测展示了 Copilot Cowork Skill 如何绕过组织级模型封锁调用 DeepSeek,并给出管理员目前唯一可用的关闭路径。

  15. Epoch AI:研究、数据与评测60

    Epoch AI 分析:Claude Mythos Preview 公布后高危 CVE 数量升至此前月度纪录 3.5 倍以上

    Epoch AI 分析显示,Anthropic 于 2026 年 4 月公布 Claude Mythos Preview 具备自主漏洞发现与利用能力后,CVE 披露量显著跳升:6 月高危及严重级别漏洞数量比此前月度纪录高出 3.5 倍以上。

    推荐理由:原文用 21 家机构公开 CVE 数据给出披露量跳升的量化结果,并说明来源与局限,读者可自行评估 AI 参与漏洞发现的可见影响。

  16. Claude Code:GitHub Releases(RSS)64

    Claude Code v2.1.198 发布

    Claude Code v2.1.198 更新。Claude in Chrome 现已全面可用。为 claude agents 新增后台智能体通知(agent_needs_input / agent_completed)。新增 /dataviz 技能,提供图表与仪表盘设计指导及配色验证器。Gateway 增加 AWS 上的 Claude Platform 作为上游提供商。后台智能体在 worktree 中完成代码后自动提交、推送并创建草稿 PR。内置 Explore 智能体现继承主会话模型(上限 opus)。修复网络短暂断开导致响应中断、后台任务卡在“Running”状态、智能体团队队友因 API 错误失败等问题。

    推荐理由:如果你是Claude Code用户,这次更新很实在,Chrome版终于正式可用,背景agent的自动提PR和通知功能能省不少事,/dataviz也能辅助可视化。

  17. Tomer Tunguz 博客(VC 分析)60

    构建AI智能体应优先设计路由

    构建AI智能体时,应优先设计路由(router)而非选择模型。路由决定每个请求由哪层模型处理。正确路由可使70-80%流量运行在免费本地模型或异步推理上,将AI开销降低90%+。Brian Armstrong指出Coinbase通过更好的默认设置、路由和缓存,在token使用量增长的同时将AI支出减半。路由分三层:技能分类器、路由器、模型选择器。本地计算近乎零成本,异步批量推理比实时推理便宜两个数量级。大多数工作无需秒级返回。同步预测器标记复杂任务,夜间批量评估器更新路由权重。技能蒸馏后,非编码类任务中70-80%智能体流量可由本地模型处理。

    推荐理由:Tunguz 把代理架构的设计重心从模型选择拉回到路由上,三层分类器-路由器-选择器的划分很清晰,做 AI 应用的团队可以参考,但其中的新东西不多。

  18. TechCrunch:AI(RSS)72

    Cloudflare新政策:默认屏蔽混合爬虫,推动AI公司付费

    Cloudflare宣布,自2026年9月15日起,其默认设置将屏蔽同时用于搜索、AI智能体及训练的“混合用途”爬虫访问托管广告的页面,除非站点所有者手动调整。此举旨在保护出版商内容不被无偿使用。同时将原有的“Pay Per Crawl”模式升级为“Pay Per Use”,允许出版商在内容创造价值时向AI公司收费,初期合作方为Ceramic.ai和You.com。Cloudflare数据显示,AI爬虫超过50%的抓取流量浪费在重复获取未变更页面上。新政策适用于新客户、现有客户的新站点及所有现有免费客户。

    推荐理由:Cloudflare用基础设施商的话语权重新划定了AI内容付费线,默认屏蔽混合爬虫这一刀切下去,从Google到创业公司都躲不开,出版商到底该分多少钱的讨论终于有了一个落地的支点。

  19. Meta Engineering Blog(RSS)71

    Meta 大规模 AI 存储蓝图

    Meta 运营数百 EB 级存储集群,基于 Tectonic 分层存储层构建 BLOB 存储架构,以应对两大挑战:最大化 GPU 利用率与研究迭代速度。传统 BLOB 架构的多层元数据查询可导致数百毫秒延迟,使 GPU 因 I/O 等待停顿。新架构将训练栈逐步迁移到 BLOB 存储接口上,利用闪存提供可预测的低 pMax 延迟,避免单 GPU 慢速拖慢整批任务。同时,统一的数据湖访问支持地理分布 GPU 间的数据高速注入与跨区移动,提升研究效率。

    推荐理由:Meta的存储架构复盘给出了一条明确路径,从重写元数据到分层缓存,他们把GPU利用率和研究者迭代速度同时提升了一个档次,做AI训练平台的值得细读。

  20. Google Developers Blog(RSS)68

    Google Cloud Workbench Notebooks 扩展发布:在 VS Code 中连接云端 Jupyter 环境

    Google Cloud Workbench Notebooks 扩展正式上线,开发者可在 VS Code 中直接连接可扩展的云端 Jupyter 环境,无需切换上下文即可利用高性能 Google Cloud 基础设施完成机器学习全流程。该扩展已完全开源,可在 GitHub 和 VS Code Marketplace 获取。

    推荐理由:这个扩展把Google Cloud的Jupyter环境直接嵌进VS Code,做ML的开发者不用再切换窗口,工作流会流畅不少,但对行业格局影响不大。

  21. X:Dan Hendrycks (@hendrycks)80

    Claude Fable 5自动化率16.1%,较前代翻倍,远程项目自动化提速4倍

    Dan Hendrycks 发布 CAIS 新版《远程劳动指数》:AI 自动化完成远程项目的能力显著提升——Claude Fable 5 达到 16.1% 的专业标准完成率,是 Opus 4.8(8.3%)的近两倍,也是 Opus 4.6(4.2%)的约四倍;整体远程项目自动化率过去五个月增长约4倍。

    推荐理由:该数据首次以量化方式揭示当前主流大模型在真实远程工作场景中的实际替代能力,尤其 Fable 5 的突破性表现可能影响企业外包与远程协作模式;对从业者、政策制定者及AI产品方均有现实参考价值。

  22. xAI:News(网页)77

    xAI 发布 Voice Agent Builder 测试版

    xAI 推出 Voice Agent Builder 测试版,这是一个基于 Grok Voice 的无代码平台,可在两分钟内创建生产级语音智能体。它集成电话、知识检索、工具、MCP、Guardrails 及可观测性,支持连接现有 SIP 号码、API 和 WebSocket,采用语音到语音路径。在 τ-voice Bench 上,Grok Voice Think Fast 1.0 得分 67.3%,领先 Gemini 3.1 Flash Live(43.8%)和 GPT Realtime 1.5(35.3%)。定价为每分钟音频 0.05 美元、电话费 0.01 美元,提供 80+ 种语音及声音克隆,每个账户附赠一个免费电话号码。

    推荐理由:xAI 用 Grok Voice 原生的语音到语音路径,把生产级语音代理的搭建门槛降到了无代码、两分钟,计费也简单,做语音业务的人值得试试。

  23. X:智谱 Z.ai (@Zai_org)67

    智谱推出GLM-5.2官方开发环境ZCode

    推出 ZCode,GLM-5.2 的官方开发环境 - GLM Coding Plan 订阅用户:现可在 ZCode 获得 1.5 倍使用配额 - 支持 BYOK:可与您现有的订阅和 API 配合使用 - 适用于 macOS、Windows 和 Linux 立即下载:http://zcode.z.ai/en

    推荐理由:智谱为 GLM-5.2 推出官方 IDE,1.5 倍配额和自带密钥对已有订阅的人挺实用,但整体只是常规产品完善,算不上行业级事件。

7月1日周三
  1. TechCrunch:AI(RSS)72

    Meta效仿SpaceX,将过剩AI算力变现

    据Bloomberg报道,Meta正计划推出云基础设施业务Meta Compute,对外出售AI计算能力和模型访问权限,直接与AWS、Google Cloud及Azure竞争。Meta已承诺未来几年投入1829亿美元建设AI基础设施,其中俄亥俄州数据中心(规模如曼哈顿)将于今年上线。新业务由基础设施主管Santosh Janardhan、Meta超级智能实验室负责人Daniel Gross和总裁Dina Powell McCormick领导。Meta可能效仿CoreWeave出售裸计算能力,并像AWS一样托管AI模型(包括近期发布的闭源模型Muse Spark)。扎克伯格此前已表示云业务“definitely on the table”。

    推荐理由:Meta 进入云市场不只是大厂的新业务,而是算力资产化的信号,未来 AI 竞争可能从模型军备赛转向数据中心所有权,开发者能拿到更便宜的 GPU 但绑定生态的风险也得权衡。

  2. Cato AI Labs:AI安全原创研究78

    Cato AI Labs 披露 Cursor IDE 两个零点击提示词注入 RCE 漏洞 DuneSlide

    Cato AI Labs 在 Cursor IDE 中发现两个 CVSS 9.8 的远程代码执行漏洞(CVE-2026-50548、CVE-2026-50549),通过零点击提示词注入即可触发。

    推荐理由:原文由发现方详述两个漏洞的利用链和披露时间线,读者可以了解提示词注入如何突破沙箱造成系统级风险。