xAI 设计 Grok Bot:为持久化智能体重构交互界面
xAI 发布设计文章,介绍 Grok Bot 如何为超越单次会话的持久化智能体设计界面。产品以 Bot 为主要对象而非会话,Bot 拥有身份、记忆、自己的计算机和工具;头像动效呈现空闲、工作、等待、阻塞、思考、完成等状态;工作区提供状态、预览、接管三级访问。
推荐理由:xAI 官方复盘 Grok Bot 的界面设计决策,读者可以了解持久化智能体产品在组织方式和交互上的取舍思路。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
xAI 发布设计文章,介绍 Grok Bot 如何为超越单次会话的持久化智能体设计界面。产品以 Bot 为主要对象而非会话,Bot 拥有身份、记忆、自己的计算机和工具;头像动效呈现空闲、工作、等待、阻塞、思考、完成等状态;工作区提供状态、预览、接管三级访问。
推荐理由:xAI 官方复盘 Grok Bot 的界面设计决策,读者可以了解持久化智能体产品在组织方式和交互上的取舍思路。
Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi、Hermes 等编码智能体提供本地记忆层,把已有会话记录索引成 Lance 数据集,一条 funes add 命令即可让 Agent 自主召回原始出处(Agent、时间戳、会话、轮次)。
推荐理由:原文给出本地记忆层的检索机制、跨 Agent 复用方式,以及召回比压缩和交接更省成本的基准数字,方法可直接复用。
Claude 官方宣布 Claude Cowork 和 Claude Code 新增后台使用电脑的能力。用户把任务交给 Claude 后,它会像人一样点击、输入和打开应用,用户可同时去做其他事。
推荐理由:官方宣布 Claude 可在后台操作电脑,说明其点击、输入、打开应用的具体使用方式,读者可判断是否纳入自己的工作流。
Cursor 发布 Self-Hosted Machines,让云智能体的工具执行迁移到企业自有网络内的机器,智能体循环、推理和规划仍留在 Cursor 云端,通过 worker 的出站 HTTPS 连接对接,Cursor 不会主动连入企业网络。
推荐理由:官方介绍了让智能体工具执行迁入企业自有基础设施的方案与适用场景, teams 可据此判断何时值得自托管以及如何按需扩容。
Anthropic 发布面向电商、旅游、电信和票务平台的商务智能体蓝图,提供可在数天内上线的 harness、模式和护栏,附购物智能体与商家智能体的完整参考实现及 Claude Code 插件。
推荐理由:原文给出完整可部署的购物与商家智能体实现、接入方式和合作生态,工程团队可据此评估落地铁路线。
Qwen3.8-Flash 现在可以在本地运行了!🔥 这个 125B 的 MoE 模型表现超过了 Claude-Opus-4.6(Max)。 通过 Unsloth GGUF 在 75GB 内存上运行。 Qwen3.8-Flash-Next 让 CPU 内存 / 统一内存配置也能达到接近 VRAM 的速度。 指南:https://unsloth.ai/docs/models/qwen3.8-next GGUF:https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF
推荐理由:原文给出了 MTP 加速的具体倍数、显存门槛和各量化档位内存需求,读者可以据此判断自己的设备能否跑通。
LongCat-2.0 现在在 Cline 中免费开放。 这是一个 1.6T 开放权重 MoE 模型,拥有 1M 上下文,来自 @Meituan_LongCat,得分与 Claude Opus 4.7 和 Gemini 3.1 Pro 相近。 立即试用: npm i -g cline /model 在免费模型下选择 LongCat-2.0
推荐理由:官方宣布 LongCat-2.0 可在 Cline 免费试用,并给出安装命令和模型选择路径,读者可直接接入现有编码工作流。
UU远程于9月2日上线新版本,重点优化终端功能,补齐 TUI 渲染交互与终端会话管理能力。主要更新包括:Mac 免密码登录、移动端输入优化并新增调用系统输入法的独立输入框、可同时创建和管理多个终端会话并支持手机与电脑间跨端同步接管(通过 uuyc-cli lterm 命令)。
推荐理由:作者实测新版本并给出使用路径,读者可据此评估手机端远程跑 Coding Agent 的可行性。
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 agentic video understanding,模型动态扫描视频片段,相比固定帧率处理 token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。
推荐理由:官方说明列出 token、成本与准确率三项数字和开启方式,开发者可据此评估长视频分析是否换用该模式。
Google 发布 Workspace 图像创作与编辑工具 Google Pics,将在未来数周内面向所有 Google AI Pro 和 Ultra 订阅者及多数 Workspace 商业客户推出。
推荐理由:官方发布详解 Pics 的编辑控制与 Workspace 集成节奏,读者可据此判断它如何嵌入现有文档和幻灯片工作流。
Hugging Face WebAI 团队发布 @huggingface/kernels 库及 207 个以独立仓库形式托管在 Hub 上的 WebGPU 内核(Apache-2.0),每个内核带 manifest、正确性测试、基准用例和 WGSL 着色器模板。
推荐理由:原文给出与 ORT WebGPU 的对比数据和开源加载方式,读者可据此评估浏览器本地推理的可行路径。
MiniMax 将 H3 Max 768P、480P 接入开放平台和 MiniMax Design,海外开发者已借此搭建出 Twitch 直播和 24 小时“AI 电视台”。
推荐理由:原文给出 H3 Max 的生成速度、吞吐量提升和接入入口,并梳理了社区围绕它做实时直播的具体玩法。
Claude Console 现已支持创建个人密钥和服务账号密钥,它们以关联账户身份运行并继承相同权限,账户从组织移除后密钥即失效。组织管理员可借此更轻松追踪各账户用量并确保密钥使用合规。这些 API 密钥可限定到特定工作区,也可用于管理端点及账户可访问的任何工作区,工作区 API 密钥仍作为旧版选项保留支持。
推荐理由:个人密钥与服务账号密钥把权限和生命周期绑定到具体账号,组织管理员能按账号追踪用量并做工作区级隔离,比旧工作区密钥的粗粒度授权更易管理。
GLM-5.3-Flash 正式发布 - 以极具竞争力的价格提供领先性能 - 原生多模态,支持 1M token 上下文窗口 - 320B-A18B 参数模型,采用 MIT 许可证发布 - 此前以 Ox Alpha 名义预览,完全运行在中国 AI 芯片上 博客:http://z.ai/blog/glm-5.3-flash 现已在所有官方平台上线: 模型权重:http://huggingface.co/zai-org/GLM-5.3-Flash API:http://docs.z.ai/guides/llm/glm-5.3-flash 编程套餐:http://z.ai/subscribe ZCode:http://zcode.z.ai/en 对话:http://chat.z.ai AutoClaw:http://autoclaw.z.ai
推荐理由:原文给出了各量化档位的内存需求和精度保留数据,读者可据此判断在 128GB 设备上本地运行该模型的可行性。
Anthropic 宣布 Claude in Chrome 现已面向所有付费 Claude 套餐全面开放,Claude 可在浏览器中自主执行操作,无需逐步审批。系统通过安全分类器在每次操作前验证其安全性及是否符合用户请求,并强化了针对提示注入攻击的防御。最新评测显示,在启用探测与安全分类器后,自 Opus 4.8 起的所有模型均未出现攻击成功案例。
推荐理由:Claude in Chrome 从逐步确认改为自动批准,改变的是长流程浏览器任务的干预频率,愿意信任安全分类器的用户可把注意力从操作审核转向结果检查。
Fireworks 上线 DeepSeek V4 Pro 0813,提供 serverless、专属部署及 SFT/DPO/RFT 训练支持,模型具备 1M token 上下文窗口和原生工具调用。
推荐理由:原文用四组基准和逐任务成本数据对比 V4 Pro 与 Fable 5、Kimi K3,并指出 Java 弱项与路由空间,读者可据此选型。
推荐理由:OpenWorker 把漏洞、依赖和云配置检查放进可本地运行的开源 agent,安全团队能在代码不出本机的前提下审计工具链,比闭源方案多一层透明。
Claude 即日起将聊天与 Claude Cowork 的记忆统一,用户在任一场景对话时都能调用此前积累的上下文,减少重复解释。记忆会在聊天过程中实时更新,用户可在 Memory 设置中按主题查看、编辑或删除每条记忆。健康、信仰等敏感话题默认不存储,但可在设置中开启,且敏感识别号、犯罪记录等始终不会被保存。
推荐理由:价值在把跨会话记忆变成可逐条编辑的文件,修改一处旧公司名就能在后续所有对话中生效,降低长期项目协作里反复交代背景的成本。
Apple 推出首款 2nm 芯片 M6,搭载 12 核 CPU、12 核 GPU 及双 16 核神经引擎,统一内存带宽最高 170GB/s,多线程性能较 M5 提升 1.2 倍。M5 Ultra 采用首款四芯片封装架构,最高 36 核 CPU、80 核 GPU,带宽达 1.2TB/s,较 M3 Ultra 提升 50%。两款芯片分别用于新款 Mac mini 与 Mac Studio。
推荐理由:M5 Ultra 的 512GB 统一内存和 1.2TB/s 带宽,让数百亿参数模型可以完全在本地运行,降低了大模型本地部署的硬件门槛。
Apple 发布搭载 M5 Max 与全新 M5 Ultra 的 Mac Studio,AI 性能最高提升 4.3 倍,图形性能提升 1.8 倍,存储速度提升 2 倍。M5 Ultra 版本支持最高 512GB 统一内存与 1.2TB/s 内存带宽,可完全在设备端运行大型 LLM;四台集群可带来最高 3 倍分布式 AI 推理速度提升。新品今日起接受预购,9 月 22 日开售。
推荐理由:M5 Ultra 的 512GB 统一内存与每 GPU 核神经加速器,让本地运行超大规模 LLM 从演示走向可用,云成本与 token 计费不再是部署前置条件。