跳到正文
北京时间

全部动态

今日 95 条
6月26日周五
  1. Hacker News:AI 热帖71

    OpenKnowledge:开源、AI 优先的 Obsidian/Notion 替代品

    OpenKnowledge 是一款开源、本地优先的 Markdown 编辑器,私密免费,提供完整的所见即所得编辑体验。支持 macOS 桌面应用和 Web UI,内置文件导航、搜索、标签和图谱 wiki 链接查看器。可与 Claude、Codex、Cursor 等桌面应用协同实现 AI 编辑,并通过 MCP/CLI 兼容任意 AI 智能体框架。自带 MCP、技能和智能搜索,支持 LLM Wiki 和知识图谱。团队协作基于 Git/GitHub 实现无代码共享与自动同步。支持嵌入 HTML 及富文本组件。桌面应用内建 TUI,Linux/Windows/Intel Mac 用户可通过 CLI(Node.js 24+)以本地 Web 应用运行。可直接打开任何包含 Markdown/MDX 文件的文件夹。开源协议 GPL-3.0-or-later。

    推荐理由:把 Claude、Codex 等 AI 代理直接嵌进知识库编辑器,想法比 Notion AI 更灵活,但这类工具最终拼的是细节打磨和生态,现阶段可以尝鲜但别急着切换主力。

  2. LMSYS:Blog(Chatbot Arena 团队)58

    SGLang 引入 Waterfill 与 LPLB 提升 DeepEP MoE 负载均衡

    SGLang 为 DeepEP MoE 推理新增两种调度时负载均衡方法:Waterfill 将共享专家分配给负载更低的 rank,在 DeepSeek-V3/R1 服务负载下使总吞吐量提升 1.48% 至 4.66%,在 DeepSeek V4 上最佳点从 49,253 tok/s 提升至 51,677 tok/s(+4.92%);LPLB 基于线性规划优化冗余专家副本的 token 路由,配合 EPLB 在相同集群上实现吞吐量提升 0.84% 至 7.34%。

    推荐理由:SGLang 引入 Waterfill 和 LPLB 两种负载均衡算法,实测 DeepSeek V3/R1 和 V4 吞吐提升最高 7%,用 SGLang 跑 MoE 推理的开发者值得一试。

6月25日周四
  1. OpenRouter:Announcements(RSS)71

    OpenRouter MCP 服务器发布

    OpenRouter 推出 MCP 服务器,为编程智能体提供实时模型数据、基准排名、定价和文档查询。开发者通过一键安装(支持 Claude Code、Codex CLI、Cursor 等客户端),即可在编辑器内完成模型筛选、价格对比和测试推理,无需切换标签页。服务器整合 Artificial Analysis、Design Arena 及 OpenRouter 自身排名数据,例如推荐 GLM-5.2 作为性价比最佳的编码模型。工具集包括 models-list、model-get、model-endpoints、benchmarks 等,支持通过 chat-send 发送测试提示,比较不同模型(如 Claude Opus 4.8、GPT-5.5、DeepSeek V4 Pro)的响应、成本和延迟。API 密钥附带 7 天有效期和 10 美元消费上限,可随时撤销。

    推荐理由:OpenRouter 这个 MCP 服务器让编码 agent 直接从编辑器里选模型、查价格、跑测试,省掉了切浏览器查资料的15分钟,做 AI 开发的值得立刻装上。它把模型选择变成了 agent 自己能完成的工作流,而不只是人工猜测。

  2. 公众号:京东JoyAI62

    JoyAI 上线「欢乐足球季」:上传一张照片即可生成赛场动态视频

    JoyAI APP 上线「欢乐足球季」主题活动,用户上传一张人像照片即可生成沉浸式赛场动态视频,支持肢体动作拟合、环境动态渲染与专业运镜。活动提供近 20 款视频模板,覆盖看台抓拍、进球庆祝、足球手势舞等玩法,并同步上线近 50 款足球主题聊球智能体。上线首周互动量日均增长率超 158%。

    推荐理由:模板覆盖看台、进球、手势舞等场景,无需编辑技能即可产出氛围感短片,对丰富观赛社交内容有直接帮助。

  3. xAI:News(网页)55

    盈透证券(Interactive Brokers)与 Grok 集成:组合分析、情景建模与实时交易指令生成

    盈透证券(Interactive Brokers)近日与 Grok 集成,用户可在几分钟内免费关联现有账户,无需注册新账户。通过自然语言与 Grok 对话,可完成组合收益分析(如股息与利息预测)、行业/地区/经济事件的风险敞口情景建模、市场趋势研究,并直接生成对冲订单等实时交易指令,实现从数据洞察到执行决策的一体化。

    推荐理由:xAI 把 Grok 接进了盈透证券的交易终端,是个实用的生态扩展,对 IB 用户来说从分析到下单可以一条龙处理,但本质上还是个功能集成,算不上行业大事件。

  4. Cursor Blog65

    Notion 使用 Cursor SDK 嵌入编码智能体

    Notion 通过 Cursor SDK 在数周内将编码智能体嵌入产品。用户可在文档中@Cursor、在讨论串中提及或向数据库指派任务,Cursor 即可端到端完成规划、构建、测试、验证并自动创建 PR。集成基于一套 Provider 无关的智能体框架,Notion 的讨论串对应一个 Cursor 智能体,每条消息对应一次智能体运行;结果通过 SSE 流式传输,支持断连恢复。Cursor SDK 提供与生产环境相同的模型、运行时和远程 MCP 支持,让 Notion 无需自建智能体基础设施即可获得完整栈编码能力。用户还可自定义模板、MCP 服务器、技能和子智能体,并设置自动触发规则。

    推荐理由:我对“嵌入代理”的概念有点怀疑,但Notion用两周集成Cursor SDK,说明其抽象做得不错。文章展示了怎么把一个全栈编码代理塞进产品里,做工具的可以看看SDK设计。

  5. X:Perplexity (@perplexity_ai)65

    Perplexity推出Computer for Counsel

    推出 Computer for Counsel。 Computer 现在连接了律师日常使用的研究数据库、文档工具和案件管理系统。可从中提取可引用来源:@midpageAI、@LegalZoom、@Docusign、@netdocuments 等。 所有 Pro 和 Max 订阅用户均可使用。

    推荐理由:Perplexity 发布了面向法律行业的 Computer for Counsel,将研究数据库、文档工具和事务管理系统集成进 AI 搜索,律师可以一试。

  6. X:Tibo (@thsottiaux)65

    OpenAI 首款自研 AI 芯片 Jalapeño 发布

    OpenAI 设计并制造了其首款 AI 芯片:Jalapeño。该芯片由 OpenAI 从零设计,与 Broadcom 合作量产,专为支撑 ChatGPT、Codex、API 及未来智能体产品的大语言模型工作负载而打造。芯片是 AI 经济的基础,自研芯片扩展了 OpenAI 从产品到模型再到基础设施的全栈平台,将助力扩展智能、服务更多人、并扩大 AI 的可及性。主推文:「劲爆。」

    推荐理由:我认为这比新模型更重要,自研芯片会让推理成本进一步下降,那些因太贵而没上的 AI 功能现在可以启动了,尤其是 agent 类产品。

  7. Google DeepMind:Blog(RSS)70

    Gemini 3.5 Flash 引入 computer use 功能

    Google DeepMind 宣布,computer use 现作为内置工具集成于 Gemini 3.5 Flash,开发者可构建跨浏览器、移动端和桌面的智能体,实现视觉感知、推理与操作。此前该功能仅以独立模型形式存在于 Gemini 2.5。3.5 Flash 已支持函数调用及 Search、Maps 等内置工具,新增的 computer use 可提升持续软件测试和跨专业应用知识工作等长周期企业自动化任务的性能。安全方面采用针对性对抗训练,并可选配两项企业防护系统:要求用户确认敏感操作,以及在检测到间接 prompt 注入时自动停止任务。可通过 Gemini API 和 Gemini Enterprise Agent Platform 使用。

    推荐理由:把 computer use 能力塞进轻量级的 Flash 模型,意味着在浏览器里跑视觉 agent 的成本会大幅降低,做企业自动化的团队可以立即试起来,安全措施也给了落地信心。

  8. The Decoder:AI News(RSS)74

    Figma在Config 2026押注人类判断,画布AI能力却来自第三方

    Figma在Config 2026将设计画布扩展至代码、动画、3D深度和着色器效果,并集成去年收购的Weave工作流系统。新功能包括Code Layers(代码与设计并存)、Motion动画、深度层、Shader及Generative Plugins。协作方面,团队可搜索复用AI提示词、保存工作流为技能、共享插件。Figma的AI功能依赖Anthropic、OpenAI和Google等外部模型,推理成本挤压利润率。同时,Anthropic等公司的竞争产品可直接生成界面,构成威胁。

    推荐理由:我认为Figma这波更新很务实,它没有硬扛AI生成界面的对手,而是把代码、动效、3D拉进画布,用人的判断驾驭AI。虽然利润被模型供应商挤压,但共享提示和工作流的设计让团队协作更高效,做设计和产品的值得细看。

  9. Hugging Face:Blog(RSS)61

    FFASR 排行榜发布:真实远场条件下 ASR 评测

    Treble Technologies 与 Hugging Face 联合推出 FFASR(Far-Field ASR)排行榜,这是首个开源社区驱动的真实远场声学条件 ASR 评测基准。传统近场评测无法反映混响、背景噪声和麦克风距离带来的性能下降。FFASR 使用混合波模拟引擎生成声学数据,涵盖 14 种房间(20–470 m³)和三个信噪比级别(远场高 SNR >14 dB、中 SNR 8–12 dB、低 SNR <6 dB),加上近场干燥条件,共四类条件决定主排名。另有实验室实测/模拟验证轨道和移动声源 beta 版。性能指标同时报告词错误率(WER)和实时因子(RTFx,在 NVIDIA L4 GPU 上评估)。未来将支持多说话人场景、麦克风阵列和回声消除。

    推荐理由:远场语音的‘实验室-生产’性能差终于有了量化指标,这个排行榜把 ASR 的真实世界鲁棒性公开化,做语音产品的团队该看看。

6月24日周三
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)61

    OpenAI 与 Broadcom 联合发布 LLM 推理芯片 Jalapeño

    OpenAI 与 Broadcom 发布首款自研推理加速器 Jalapeño,专为当前及未来 LLM 从头设计。早期测试显示,其性能功耗比大幅优于现有 SOTA。工程样片已在实验室以目标频率和功耗运行 GPT‑5.3‑Codex‑Spark 等负载。芯片从设计到流片仅用 9 个月,并利用 OpenAI 模型加速部分流程。OpenAI 计划从 2026 年起与 Microsoft 等合作伙伴部署千兆瓦级数据中心,推出多代计算平台。

    推荐理由:OpenAI 首次亲自设计芯片,和 Broadcom 联手推出专为 LLM 推理优化的 Jalapeño,从设计到流片仅 9 个月。虽然还只是早期测试,但性能功耗比大幅领先,一旦大规模部署,推理成本可能跳水,用 ChatGPT 的每个人都能感知到更快更便宜。

  2. OpenRouter:Announcements(RSS)73

    OpenRouter推出统一图像API

    OpenRouter推出统一图像API,整合Google、OpenAI、Black Forest Labs、Recraft、ByteDance、Sourceful、Microsoft、xAI等30+模型。新API提供标准化请求格式,通过`/api/v1/images/models`端点返回每个模型的分辨率、宽高比、输出数量、输入参考图数量、种子等能力描述;通过`/api/v1/images/models/{id}/endpoints`端点获取具体服务商的定价与参数支持(如Seedream 4.5每张$0.04、FLUX.2 Pro每百万像素$0.03、GPT-5.4 Image 2按token计费)。OpenAI的GPT 5系列图像模型支持SSE流式预览,启用`"stream": true`即可边生成边返回预览。新图像模型将仅添加至专用API,建议现有用户切换。

    推荐理由:OpenRouter 把 30+ 图像模型收进一个 API,参数自动发现和流式预览让频繁切换模型的开发者省去不少适配麻烦,尤其对 Agent 工作流很友好。

  3. 公众号:火山引擎66

    火山引擎推出Agent Ready基础设施,AgentKit与ArkClaw企业版升级

    火山引擎在FORCE大会推出面向企业智能应用的Agent Ready基础设施,构建AI云与Agent三层架构。AgentKit升级提供Identity、Runtime、Sandbox、Evaluation等模块,实现Agent可靠、可控、可衡量。Identity已接入数千家身份体系,Runtime支持长程任务和分钟级12万沙箱并发。ArkClaw企业版集成Agent广场、技能中心与企业知识库,支持IDP/SSO/OAuth及飞书、钉钉等IM入口统一管控。实践案例:海底捞门店经营Agent将小时级工作压缩到分钟级,人工跟进时长缩减70%,巡检满意度提升50%;创维酷开借助ArkClaw终端版打造AIOS,Token消耗节省50%,支撑百万级终端。

    推荐理由:Agent 从聊天机器人到企业生产工具,缺的不是模型能力而是基础设施。火山引擎这套 AgentReady 架构把身份、沙箱、评测串了起来,是企业 AI 落地的关键一步。

  4. HuggingFace Daily Papers(社区热门论文)70

    NatureBench:AI编码智能体能否匹配Nature系列论文已发表SOTA?

    NatureBench是一个跨学科基准测试,包含90个从Nature系列同行评审论文中提取的任务,用于评估AI编码智能体能否超越复现、实现发现。基准基于NatureGym自动化管线,为每个任务提供标准化容器化环境,解决环境碎片化问题。在严格禁用网络搜索的协议下评估10种前沿智能体配置,最强模型仅在17.8%任务上超过已发表SOTA(g>0.1准则)。分析表明,智能体成功主要依赖方法论翻译,失败主因为方法选择错误和计算预算不足。已发布基准、NatureGym管线及公共排行榜。

    推荐理由:这个基准把AI agent丢进Nature论文的复现池里游了一圈,发现最强的配置也只能在17.8%的任务上超越SOTA,而且靠的是方法翻译而非发明——对做科研agent的团队来说,既是冷水也是路线图。

  5. 公众号:豆包(字节)77

    今天,豆包正式推出专业版

    豆包专业版基于豆包2.1系列大模型上线,面向复杂办公与生产力场景。办公任务模式接入可执行Agent任务的豆包2.1模型,支持操作本地电脑、浏览器、调用Skills技能、定时任务,内置Office办公套件,并可生成带后端数据库的在线应用。免费用户可体验豆包2.1 Turbo版办公任务模式,专业版接入豆包2.1 Pro模型。定价:标准套餐68元/月(连续包月),加强套餐200元/月,高级套餐500元/月。大学生认证后标准套餐38元/月,持续6个月。

    推荐理由:豆包专业版不是简单的会员升级,而是把Agent能力装进办公场景,操作本地电脑、生成应用这些功能,让AI从对话工具变成了真正的生产力帮手。

  6. 公众号:豆包(字节)64

    豆包正式推出专业版:接入豆包 2.1 Pro,支持办公任务模式

    豆包专业版正式上线,基于豆包 2.1 系列大模型,提供更高生产力额度,并接入豆包 2.1 Pro 模型。全新办公任务模式支持操作本地电脑、浏览器、调用 Skills 技能和定时任务,内置 Office 套件,可生成分享应用网站。专业版采用三级阶梯定价,标准套餐连续包月 68 元,加强套餐 200 元,高级套餐 500 元。

    推荐理由:从回答问题升级到操作本地电脑,办公任务模式可能减少日常文档、表格和跨应用操作的重复劳动。

  7. X:Runway (@runwayml)72

    Runway推出Seedance 4K等三款新模型

    Seedance 4K。Seedance Mini。Kling 3.0 Turbo。现已推出。 全球最佳模型,汇聚一处。 使用优惠码 30RUNWAY,前三个月可享七折优惠。 通过下方链接开始使用。

    推荐理由:Runway 一次性推出 Seedance 4K 等多个模型,视频生成画质再升级,对 Sora 等的追赶信号明显,做视频的可以直接上手试试。

  8. Anthropic:Newsroom(网页)56

    Anthropic 推出 Claude Tag:在 Slack 中通过 @Claude 协作

    Anthropic 推出 Claude Tag,一种在 Slack 频道中通过 @Claude 委托任务的新协作方式。Claude 可记住频道上下文,支持多用户交互,经授权后可自动学习其他频道和数据源。开启“环境”行为后,能主动更新未解决的线程或任务。支持异步工作,可自主推进项目数小时或数天。即日起面向 Claude Enterprise 和 Team 客户提供 beta 版。管理员可精细控制工具和渠道访问权限、设置 token 消耗限额,并查看所有操作日志。

    推荐理由:Anthropic 这次把 Claude 从对话助手变成了团队里的主动队友,Slack 里的多人协作、上下文学习和异步代理是个新思路。内部 65% 代码由它生成的数据,让这个方向不再只是实验。

6月23日周二
  1. Hacker News 热门(buzzing.cc 中文翻译)70

    无限制OCR:单次长时域解析

    Unlimited OCR 是一个托管在 GitHub 的项目,实现单次长时域解析(One-Shot Long-Horizon Parsing),旨在一次性处理长时间跨度的 OCR 任务。

    推荐理由:百度把能处理超长文档的 OCR 系统开源了,宣称一次推理搞定整份文件,做发票、合同、档案数字化的可以马上跑起来试试。

  2. Hugging Face:Blog(RSS)73

    IBM 开源 CUGA:轻量级智能体框架,提供二十余个单文件示例应用

    IBM 开源了 CUGA(Configurable Generalist Agent),一个处理规划、执行循环、工具调用和状态管理的轻量级智能体框架。开发者只需提供工具列表和提示词即可构建 CugaAgent。内置计划-执行-反思循环,在 AppWorld(2025年7月–2026年2月)和 WebArena(2025年2月–9月)基准上排名第一。支持 Fast / Balanced / Accurate 三种推理模式,代码执行可在本地、Docker 或 E2B 沙箱中运行。可互换工具支持 OpenAPI、MCP 和 LangChain 函数,通过环境变量一键切换 OpenAI、watsonx、Ollama 等提供商。随框架发布二十余个单文件示例应用,涵盖电影推荐、IBM Cloud 架构顾问等场景,每个应用仅需一个 FastAPI 文件。

    推荐理由:CUGA 把 agent 的规划、状态、策略等繁琐工程压缩成配置,开发者只写工具列表和 prompt 就能跑起 agent,配套的二十多个单文件应用是现成的模板库,对自建 agent 的团队来说省去了八成重复工作。

  3. 公众号:千问APP(阿里)60

    国内首个高考志愿AI测评出炉,千问多项表现超过资深咨询师

    友松实验室发布国内首个高考志愿AI能力测评报告,测试千问高考志愿填报Agent四大模块。与53位平均从业4.6年的人类咨询师对照,千问表现更稳定精确:44道事实题全对;模拟10个志愿中6个可录取;100场匿名对比中专家58次倾向千问回答。使用千问辅助后,人类咨询师正确率提升,耗时减少约27%。该Agent基于千问高考志愿大模型和夸克8年高考数据,覆盖约3000所院校、2000多个专业。

    推荐理由:千问高考志愿Agent的测评报告,数据看着漂亮,但全是阿里自家实验室出品,参考意义不大,真填志愿还是得找独立第三方。

  4. Modal 官方工程博客(RSS)67

    Modal 发布 Auto Endpoints:一条命令部署可自主掌控的生产级 LLM 推理服务

    Modal 发布 Auto Endpoints,一条 CLI 命令(如 modal endpoint create --name agent --model zai-org/GLM-5.2-FP8)即可部署 OpenAI API 兼容的生产级 LLM 推理服务。

    推荐理由:原文公开了部署命令、可观测指标和推测解码优化细节,读者可以据此评估自托管推理与传统托管服务的差异。

  5. Runway:News(网页)59

    Aleph 2.0 现已集成到 Figma Weave

    Aleph 2.0 是 Runway 的旗舰视频编辑模型,现已在 Figma Weave 中上线。它是一个基于上下文的视频编辑模型,通过关键帧工作:从视频中提取一帧,重新设计风格并附上时间戳连接回 Aleph 2.0 节点,即可将该编辑传递到主体出现的每一帧,同时保持其他内容不变。支持最长 30 秒、1080p 的片段,可跨多镜头序列应用编辑,无需逐镜头处理。

    推荐理由:Runway 把旗舰视频编辑模型直接接入了 Figma 的创意画布,对设计师和视频团队来说,这意味着帧级编辑不用切换工具,协作流程可能大幅简化。

  6. Claude:Blog(网页)55

    在 AWS、Google Cloud 和 Microsoft Foundry 上使用完整版 Claude Desktop

    通过 AWS、Google Cloud 和 Microsoft Foundry 使用 Claude Desktop 的组织现已获得 Chat、Claude Cowork 和 Claude Code 集成的完整桌面体验。IT 团队可将推理保留在自己的云环境中,对话历史本地存储。支持 IAM Identity Center、Workforce Identity Federation、Microsoft Entra ID 或 Okta 登录;策略模板可导出至 Intune、GPO 或 Jamf;提供离线安装器。Chat、Claude Cowork 和 Claude Code 各有独立策略键,支持精细访问控制。M365 连接器通过 Entra 应用访问邮件和文档,并支持 GCC High/DoD 端点。

    推荐理由:Anthropic 把 Claude Desktop 的完整体验带到了自家云环境之外,对于已经在 AWS 或 Azure 上跑推理的团队,终于可以从同一入口覆盖聊天、协作和编码,不用再切工具了。

  7. Hacker News 热门(buzzing.cc 中文翻译)72

    Show HN:Oak——专为代理设计的 Git 替代方案

    Oak 是开源版本控制系统,专为 AI 智能体(Claude Code、Codex、Cursor)设计。采用 BLAKE3 内容哈希、内容定义分块、diff/merge 及 Blob/Manifest/Commit/Tree 数据模型,可选 SQLite 和 git 后端。以分支-会话为基本工作单元,用分支描述替代逐次提交,通过内容寻址懒加载使智能体数秒内编辑任意仓库。速度远超 git。已发布公开测试版 v0.99.0,支持 macOS(Apple Silicon)、Linux(x86_64)及 Windows,可通过 curl 或 cargo 安装,Apache-2.0 开源。

    推荐理由:专为 AI 代理打造的全新版本控制工具,分支作为会话单元、内容寻址懒加载,设计直接摆脱了 git 的包袱,用 agent 的开发者值得一试。

  8. MarkTechPost(RSS)76

    Sakana AI 发布多智能体编排系统 Sakana Fugu,对外表现为单一模型

    今日 Sakana AI 发布 Sakana Fugu,一个多智能体编排系统,对外表现为单一模型。用户通过 OpenAI 兼容端点发送请求,Fugu 内部决定直接求解或组建专家模型团队协作。提供两个变体:Fugu(平衡性能与低延迟,支持特定 agent opt-out)和 Fugu Ultra(针对困难多步问题优化,固定 agent 池,当前模型 ID 为 fugu-ultra-20260615)。在 11 项基准测试中,Fugu Ultra 在 SWE Bench Pro(73.7%)、TerminalBench 2.1(82.1%)、LiveCodeBench(93.2%)、Humanity’s Last Exam(50.0%)等 10 项上取得最高分,表现与 Anthropic 的 Fable 5 和 Mythos Preview 相当。Fugu 通过 OpenAI 兼容 API 调用,无需更换 SDK,并支持 opt-out 以应对合规和单供应商风险。

    推荐理由:Sakana AI 把多模型调度塞进一个 API,基准分压倒了它协调的单独模型,对降低供应商依赖的团队是个新路标,但自研路由也意味着锁死模型选型。

  9. OpenAI:官网动态(RSS · 排除企业/客户案例)64

    OpenAI 联合 Trail of Bits 发起 Patch the Planet 计划,AI 辅助开源项目漏洞修复

    OpenAI 联合 Trail of Bits 推出 Patch the Planet 计划,利用 GPT‑5.5‑Cyber 和 Codex Security 等模型进行 AI 辅助安全研究,经人工专家审核后协助开源项目修复漏洞。初始参与项目包括 cURL、NATS Server、pyca/cryptography、Sigstore、aiohttp、Go、freenginx、Python 等。Trail of Bits 已在 19 个项目中识别数百个安全漏洞,合并数十个补丁,并开发出模糊测试、历史 CVE 变体分析、差分测试等可复用工作流。例如,通过 Codex 在一天内构建覆盖数十个入口点的模糊测试实验室,而人工通常需数周。参与项目可获得 ChatGPT Pro、Codex Security 访问权限及 API 额度。

    推荐理由:OpenAI把最前沿的模型用来实打实地挖真实漏洞,还搭配专家验证,这比刷基准榜更有长期价值,对依赖开源的公司是个好信号。

  10. xAI:News(网页)69

    Grok Build 推出 /goal 模式,支持长时间自主任务执行

    xAI 在 Grok Build 中引入 `/goal` 新模式。用户只需用一行命令设定目标,agent 便会自动规划方案、分解任务为进度清单并持续执行,直至目标完成且通过验证,期间可额外下达指令。该模式支持监控与引导命令,任务完成时清单全部勾选。即日起可用,用户可通过 `curl -fsSL | bash` 安装 CLI 并登录账号即可使用。

    推荐理由:把Grok Build从单步指令升级成可长期自主执行任务的Agent,对习惯把代码扔给AI就跑开的开发者很友好,但目前只有CLI,生态还没铺开。

6月22日周一
  1. Simon Willison 博客72

    Cloudflare 临时账户 for AI agents

    Cloudflare 推出临时账户功能,无需注册即可通过 `npx wrangler deploy --temporary` 部署 Workers 项目,临时项目存活 60 分钟。该功能虽标称为 AI 智能体设计,但普通用户同样适用。作者使用 GPT-5.5 xhigh 在 Codex Desktop 中构建了测试应用,验证了部署与运行流程,并展示了项目认领页面。

    推荐理由:虽然这次打的旗号是服务 AI 智能体,但临时 Cloudflare 账号对任何想快速部署原型的开发者都是福音,降低了不少环境搭建的摩擦,值得马上试试。

6月20日周六
  1. IT之家(RSS)73

    微信 AI 助手“小微”灰度上线,可通过文字或语音对话操作原生功能

    微信原生 AI 助手“小微”今日扩大灰度测试,支持文字或语音操作微信原生功能(调整设置、发送消息、拨打电话、点外卖、生成图片等),集成文件总结、提醒设置、音乐推荐。用户可一句话生成小程序(仅限个人使用,暂不支持分享),并可通过多轮对话修改风格。该功能由微信技术架构负责人周颢带队推进,计划 2026 年第三季度向更多用户推出。此前微信开放平台已于 6 月 8 日开放 AI 生态接入能力,微信支付同步发布 AI 专属卡。

    推荐理由:微信这次把 AI 助手直接塞进主界面,不止是聊天,而是能操作设置、发消息、点外卖甚至一句话生成小程序。国民应用 + 原生 AI 的整合,可能会让这代人对智能助手的理解彻底刷新一遍。

  2. IT之家(RSS)75

    马斯克 SpaceXAI 为微软 Office 推出 Grok 扩展,支持自然语言操控文档、表格和演示文稿

    6月19日,马斯克旗下SpaceXAI面向微软Word、Excel、PowerPoint推出Grok扩展。安装后Office应用右侧出现侧边栏,支持自然语言指令操控。Word中,Grok可根据草稿和格式自动生成文档,识别语法错误并提出表述建议,还能调用X平台及互联网实时信息补充数据。Excel中,Grok可分析选中区域数据,进行统计、趋势识别并一键生成图表。PowerPoint中,输入主题、页数和风格,Grok自动生成幻灯片框架并填充内容。

    推荐理由:SpaceXAI 把 Grok 带进 Office,不是简单的对话侧边栏,而是能调用 X 实时数据的生产力插件。比起 Copilot 的封闭数据,Grok 的实时联网让报告和数据分析更有血有肉,做市场的同学可以试试。

  3. MarkTechPost(RSS)77

    NVIDIA Research 发布 SpatialClaw:免训练空间推理框架

    NVIDIA Research 发布 SpatialClaw,一个免训练的空间推理框架。它通过将代码作为动作接口,让智能体调用感知工具(Depth Anything 3、SAM 3)并自由组合输出,解决视觉语言模型在 3D 空间判断上的弱点。在 20 项基准测试中平均准确率达 59.9%,比近期智能体 SpaceTools 高 11.2 个百分点,比无工具基线高 6.5 点,比结构化工具调用高 3.2 点。框架无需重新训练,同一提示词和工具集可跨所有基准和骨干网络运行,支持 Qwen3.5/3.6 及 Gemma4 等 26B 至 397B 参数的模型。

    推荐理由:NVIDIA 把空间推理的动作接口从工具调用换成代码,这个思路很巧,20 个基准平均拉升到 59.9%,无训练即插即用,做机器人和视频理解的人该直接跑一下 repo。

6月19日周五
  1. X:Rohan Paul (@rohanpaul_ai)75

    AI 员工 Viktor 登陆 Microsoft Teams,年化收入达 2000 万美元

    AI 员工 Viktor 在 Slack 上实现 2000 万美元年化收入(无销售团队、未大规模推广),现已正式进驻 Microsoft Teams。Viktor 定位为零门槛 AI:用户无需学习、无需提示词,像 @同事 一样提及即可获得完整工作成果,甚至无需主动 @ 也能自动完成。产品面向 Teams 的 3.2 亿用户,助力企业内部运营和管理人员零学习成本使用 AI。即日起免费试用,含 100 美元信用额度,无需绑定信用卡。

    推荐理由:Viktor 带着 $20M ARR 进入 Teams,把 AI 员工的门槛降到零,对于被困在审批流程里的前线员工是个真实解法。

  2. LangChain:Blog(RSS)64

    LangSmith 推出 No Code Agent Builder,无需代码即可构建 AI 智能体

    LangSmith 发布 No Code Agent Builder,允许用户无需编写代码即可创建具备记忆、引导提示词和 MCP 工具的 AI 智能体。该工具面向无技术背景的用户,降低了构建智能体的门槛。

    推荐理由:LangSmith 把 agent 构建拉到零代码,记忆和 MCP 支持让非技术人员也能上手,对 LangChain 生态是聪明的入口策略,但复杂场景的灵活性还得观察。

  3. xAI:News(网页)61

    xAI 发布 Grok for Word 插件

    xAI 将 Grok 引入 Microsoft Word,推出免费 365 插件。用户可将笔记转为结构化文档、重写文本以提升清晰度与简洁性,也能通过插件搜索网页、X 平台或生成图表。插件支持连接 SharePoint 和 Google Drive 等外部来源,还可用于 PowerPoint 和 Excel。

    推荐理由:Grok 正式进入 Office 生态,在 Word 里能直接整理笔记、搜索网页和生成图表,对日常办公用户是个顺手工具,但和微软 Copilot 的边界很模糊。

  4. OpenAI:官网动态(RSS · 排除企业/客户案例)58

    企业版新用量分析与更新的支出控制

    OpenAI 为 ChatGPT Enterprise 推出信用额度用量分析与更新的支出控制功能。全局管理控制台(Global Admin Console)统一展示 ChatGPT 和 Codex 的信用消耗,支持按时间、用户、产品、模型追踪用量趋势。管理员可为整个工作区设置默认限额,按群组配置额度,并为个人设置叠加限制。员工可查看个人用量并申请增加额度(附工作上下文)。这些功能即日起可用。

    推荐理由:仅面向ChatGPT Enterprise管理员的使用分析和预算控制更新,帮助企业追踪团队用量、控制成本,但并非行业级事件,管理者可当即启用。

  5. Claude:Blog(网页)72

    Claude Code 现已支持 artifacts

    从今日起,Claude Code 可将工作进度生成为 artifacts——实时、可分享的交互式网页,涵盖 PR 走查、系统说明、仪表盘、发布清单等。artifacts 基于会话完整上下文(代码库、连接器、对话)自动构建,更新时页面原地刷新,同事即时可见。默认仅作者可见,可分享给组织内成员,由管理员通过组织层级开关和角色权限管控。内部测试中最常见用例为调试:工程师调查事件,Claude Code 分析日志并发布包含时间线、嫌疑提交和错误率图表的 artifact,团队无需再“走过场式汇报”。

    推荐理由:Artifacts 把 Claude Code 里的工作进展变成可分享、自动更新的活页面,等于给开发协作装了个实时投影仪,但仅限企业用户,个人开发者还得再等等。

  6. OpenAI:官网动态(RSS · 排除企业/客户案例)82

    GPT-5.5 Instant提升ChatGPT健康智能

    每周超2.3亿用户通过ChatGPT获取健康信息。GPT-5.5 Instant在健康评估中表现显著提升,最具挑战性评测上达到前沿Thinking模型水平,已面向所有免费用户开放。基于医生编写的HealthBench和HealthBench Professional评估,其回复在准确性、安全性和沟通质量上优于医生手写回复及早期模型,故障模式发生率更低。近两个月生产流量显示,健康类回复事实性问题率下降71%。

    推荐理由:GPT-5.5 Instant把健康智能提升到接近前沿思考模型水平并免费提供,与医生对比的实验和71%的错误率下降让这次更新有切实证据。

  7. Claude:Blog(网页)68

    Claude Enterprise 推出企业托管 MCP 连接器授权管理

    Claude Enterprise 推出企业托管授权功能,管理员可通过身份提供商(率先支持 Okta)为整个组织配置 MCP 连接器。用户首次登录 Claude 时自动获得授权,无需手动操作,实现零接触设置。该功能基于 Model Context Protocol 的 Enterprise-Managed Authorization 扩展构建,支持 Asana、Atlassian、Canva、Figma、Granola、Linear、Supabase 等 MCP 提供商,Slack 即将支持。授权管理集成到现有 IdP 工作流中,可按组限定范围、通过 IdP 快速撤销授权,并支持要求连接器仅通过 IdP 连接以隔离工作与个人使用。

    推荐理由:企业 MCP 连接器不再需要每个用户手动授权,这是 MCP 生态从个人扩展到组织的关键一步,管理员终于可以像管理其他 SaaS 一样管理 Claude 的工具链。