跳到正文
北京时间

全部动态

今日 91 条
8月11日周二
  1. 公众号:智谱(GLM)71

    ZCode全面升级:Goal、Subagents、Remote Control与闲时任务四大功能上线

    ZCode针对GLM深度优化,今日上线Goal、Subagents、Remote Control与闲时任务四大功能。在Z.ai Code Bench测试中,GLM-5.2搭配ZCode较搭配Claude Code任务整体通过率高2.39%;ZCode缓存命中率超98%,叠加1.5倍限时额度加成后,GLM Coding Plan整体使用量接近常规额度的1.8倍。

    推荐理由:Goal模式将复杂任务从需要开发者逐轮推动变为设定目标后自行迭代,搭配Subagents并行协作,适合跨文件重构和全栈开发的长流程任务。

  2. X:Claude Devs (@ClaudeDevs)69

    Claude Code 自动模式默认开启原理

    我们最近将自动模式设为 Claude Code 的默认选项,这意味着你不再需要批准每一个操作。 但什么决定某个操作是否可以安全运行?看看它是如何工作的:

    推荐理由:视频拆解了 auto mode 的安全判断逻辑,帮用户理解自动执行与仍需人工确认的边界,适合想更高效使用 Claude Code 的开发者校准信任预期。

8月10日周一
  1. OpenRouter:Announcements(RSS)77

    OpenRouter 推出由市场智慧驱动的新版 Auto 路由器

    OpenRouter 基于每周超 55T token 的社区消费数据,推出新版 Auto 路由器(openrouter/auto),其模型选择在多数任务和成本档位上优于旧版。新路由器按约 30 种任务类型匹配近 7 天社区实际消费的模型,支持 cost_tier 参数(low 至 max)并遵循账户隐私设置。在 MMLU Pro 等基准上,新默认档位在多数领域以更低成本达到旧版同等性能。

    推荐理由:基于平台每周55T token的社区支出分布,新路由将模型选择众包化,基准显示默认档成本下降超60%且多数任务性能不减,适合调用量大的应用。

  2. X:通义千问 / Qwen (@Alibaba_Qwen)71

    Qwen-MM-Plugins 让智能体原生支持多模态

    👀 看见只是开始。 借助 Qwen-MM-Plugins,让你的智能体原生支持多模态——读取图片、视频和文档,编辑视频,处理 3D/CAD,以及更多。 从多模态模型 → 多模态智能体。🚀 观看实际效果:https://github.com/QwenLM/Qwen-MM-Plugins

    推荐理由:让智能体直接获得视觉、文档和 3D 感知能力,把原本需要单独集成的工作流变成一组可调用的插件,原型开发速度可能因此加快。

  3. 公众号:千问APP(阿里)73

    千问开放平台上线:租房、寄快递、查理财等十余领域服务可对话办理

    千问开放平台今日上线,面向生态伙伴和开发者开放手机、PC和AI眼镜三类终端的服务接入,首批覆盖物流运输、房产居住、本地生活、理财、汽车等十多个领域。用户可在对话中@相关服务或点击“圆点角标”进入智能体,完成从咨询、推荐到下单的完整流程。平台支持标准化协议接入、一键授权与端到端调测,并提供账号、AI支付、订单接入等基础设施。

    推荐理由:把快递查询、租房比价、天气建议等高频生活服务接入对话窗口,用户从「问信息」到「下单」不再跳出应用,减少了多任务切换和重复输入的摩擦。

  4. Hacker News 热门(buzzing.cc 中文翻译)70

    OpenChamber:一个基于代理的开发环境

    OpenChamber 是一个基于代理的开发环境,可跨桌面、浏览器、手机和 VS Code 使用,支持会话目标、多模型并行运行与融合、变更走查、从 issue 到 PR 的完整流程及定时任务。该工具基于 OpenCode SDK,完全开源且免费,代码和会话内容均保存在本地,远程访问可通过 UI 密码和端到端加密的 Private Relay 保护。

    推荐理由:将多模型并行、日程化任务和跨设备工作区整合到同一界面,减少了切工具的时间,适合需要在多个 AI 代理间协调的开发者。

  5. 公众号:数字生命卡兹克61

    我花了54个小时,做了一个可能更公平的AI大模型排行榜。

    作者耗时54小时开发并免费开放了一个聚合多家可信榜单的AI大模型综合排行榜LatentRank。该榜单采用Bradley-Terry成对比较算法,并加入先验限制小样本结果,以解决不同榜单规模、领先幅度和模型缺失带来的评分偏差。目前榜单前五名中,Opus 5超过Fable 5位居前列。

    推荐理由:聚合榜单的难点在于不同榜的排名含金量不可比,作者用 Bradley-Terry 模型将问题转为成对比较,为评估模型综合能力提供了比简单平均更合理的框架。

8月9日周日
  1. IT之家(RSS)72

    OpenAI 桌面端 ChatGPT 上线语音交互功能,可语音操控电脑执行多步骤任务

    OpenAI 更新 ChatGPT 桌面应用,新增对 ChatGPT Voice 的支持,用户可直接通过语音对话控制 AI 智能体并让其在电脑上执行任务。该功能基于全新语音模型系列 ChatGPT-Live,支持 ChatGPT Work 和 Codex,在 macOS 上还可借助 Appshots 访问屏幕内容。

    推荐理由:桌面端语音不再只是对话,演示中一条指令完成创建线程、提PR和定位Bug,语音开始成为开发者工作流中的可执行指令层。

  2. X:Elon Musk (@elonmusk, xAI)66

    Grok Imagine 图像编辑迎来重大升级

    Grok Imagine 图像编辑功能重大升级 [引用 @XFreeze]:你可以直接悬停在 Grok Imagine 中的任意特定区域,并即时进行编辑

    推荐理由:悬停选中并即时编辑把图层和遮罩等概念替换为手势,降低了图像修改的操作门槛。

8月8日周六
  1. IT之家(RSS)76

    苹果 Mac 简体中文支持文档更新,“Apple 智能”阿里千问扩展现身

    苹果官网 Mac 简体中文使用手册新增《在 Mac 上配合 Apple 智能使用千问》支持文档,明确 Apple 智能可配合阿里巴巴千问模型工作。千问扩展适用于 macOS 26.6 或更高版本,需中国大陆 Apple 账户及机型,支持写作工具与 Siri,用户需登录千问账户使用。

    推荐理由:苹果智能在中国大陆的落地路径终于清晰,支持文档揭示了写作工具和Siri集成千问的具体方式,Mac用户将能在系统级直接使用大模型能力。

  2. X:Greg Brockman (@gdb)71

    ChatGPT 发布 GPT 5.6 Sol 与 Luna 新模型

    ChatGPT 团队本周发布多项更新:付费用户将获得 GPT 5.6 Sol 模型,支持通过滑块调节推理深度;免费用户将获得 GPT 5.6 Luna 并享受无限文本消息。此外还改进了网页编辑器格式保留、Android 相机速度,并支持在语音体验中上传文件提问。

    推荐理由:推理深度滑块把算力分配交给用户,对需要精细控制推理时长与成本的流程更有用,免费无限消息则解除了日常对话量限制。

  3. X:Claude Devs (@ClaudeDevs)73

    Claude Code 会话间可互发消息

    Claude Code 新功能:你的会话现在可以互相发送消息了。 无需在另一个会话中重新解释自己,你现在可以让 Claude 代为传达。它会发送一份摘要(而非你的历史记录或文件),另一个会话会在任务进行中接收该摘要。

    推荐理由:跨会话传递上下文不再是复制粘贴,摘要消息让多个并行任务间保持连贯成为可能,降低了开发者维护长流程的心智负担。

  4. Hacker News 热门(buzzing.cc 中文翻译)77

    Kitesurf:一款在 V8 隔离环境中运行的“代理优先”浏览器

    Cloudflare 推出 Kitesurf,一款专为 AI 智能体设计的浏览器,完全运行在 Workers 上,基于 V8 隔离环境,现已在 Browser Run 中免费开放测试。

    推荐理由:Kitesurf 将浏览器重新设计为无状态、隔离的 Agent 引擎,CPU 和内存占用仅为 Chromium 的 1/3 到 1/7,这对大规模自动化任务的成本结构可能产生实质影响。

  5. X:Claude Devs (@ClaudeDevs)57

    Claude Code 八月起默认自动模式

    自 8 月 14 日起,自动模式将成为 Claude Code 中 Pro、Max 和 Team 用户的默认权限模式。 自动模式使用独立的分类器审查 shell 命令和操作。在测试中,它捕获了 89% 的危险命令。手动审批仅捕获了 14%。

    推荐理由:将默认模式从手动批准改为自动分类器,给出 89% 的危险命令捕获率,意味着降低使用摩擦的同时把安全基线从 14% 拉到了接近九成。

  6. LMSYS:Blog(Chatbot Arena 团队)76

    HPC-Ops × SGLang:腾讯混元开源高性能 Attention、Router GEMM 与 MoE 算子

    腾讯混元开源算子库 HPC-Ops 已集成至 SGLang 主分支,其 Dynamic Attention 与 Fused MoE 在 Hy3 模型上最高降低 TPOT 48.8%。

    推荐理由:HPC-Ops 集成到 SGLang,带来生产验证的负载均衡 Attention 和精度感知 Router GEMM,实测 Hy3 TPOT 降幅最高 48.8%,为 MoE 低延迟服务提供了可直接使用的开源优化。

  7. LangChain:Blog(RSS)62

    LangChain 推出 Managed Deep Agents 公开测试版

    LangChain 的 Managed Deep Agents 进入公开测试版,可将 Deep Agents 部署到托管的 LangSmith 运行时。该服务提供持久化执行、记忆、沙箱、通道、评估(evals)及生产级基础设施。

    推荐理由:托管执行、内存和沙箱等基础能力被封装成生产化服务,让 Agent 从原型到上线不再需要单独搭建这些工程设施。

8月7日周五
  1. X:Suno (@suno)65

    Suno移动端上线Voices功能

    Voices 功能已在 Suno 移动应用 iOS 和 Android 版正式上线!📱✨ 现在你可以直接在手机上录制人声,并将其用于你的歌曲中。只需在创作界面点击“+ Voice”按钮,录制至少一分钟,然后让音乐流淌起来。(Pro 和 Premier 套餐可无限使用,免费套餐可体验有限版本!) 打开应用,录制你的声音,并在评论区告诉我们你的使用体验!

    推荐理由:移动端录制与生成流程打通,创作者用手机采集声音即可快速应用到曲目中,省去了跨工具处理音色的步骤。

  2. X:Runway (@runwayml)75

    Runway 上线 Seedance 2.5,支持 50 个角色参考

    Seedance 2.5 现已登陆 Runway。每次生成最多可引用 50 个角色参考,构建充满角色的完整世界;可创作最长 30 秒、带完整音效与对白的片段,再按你的故事需求随意剪辑与延展。 点击下方链接立即开始。

    推荐理由:支持最多50个角色引用和30秒带对话的片段,从单镜头生成迈向构建完整场景,更适合需要连贯叙事的视频创意。

  3. 通义 QwenAudio:原创语音项目62

    QwenAudio Toolkits 发布公开预览,打造 Agent 驱动的本地音视频创作工作台

    QwenAudio Toolkits 是一款本地优先的桌面工作台,定位为对话式 Agent 驱动的音视频创作 IDE,首个公开预览支持 Apple Silicon、macOS 14.2 及以上版本。

    推荐理由:官方文档给出了能力清单、支持范围和隐私边界,读者可以据此评估这款本地音频 AI 工作台是否适合自己的创作流程。

  4. X:Krea AI (@krea_ai)72

    Krea 推出 Seedance 2.5 视频模型

    推出 Seedance 2.5。 30 秒连续视频、完整多镜头序列,以及最多 50 个参考。 立即试用 👇

    推荐理由:连续30秒生成与多镜头序列支持,将视频创作从单次短片段推向长故事板,对需要连贯叙事的创作者更实用。

  5. 公众号:火山引擎81

    Seedance 2.5 API上线,视频生成开启「电影级长叙事」

    火山引擎正式上线 Seedance 2.5 API,将单次视频生成时长从15秒提升至30秒,并支持最高50个全模态素材参考。模型在指令遵循、长叙事、真人感及声画质感上大幅提升,能稳定保持多角色外形与场景关系,兼容十余种语言。

    推荐理由:原生30秒时长和秒级时间戳控制,把长叙事视频从靠抽卡变为导演级调度;角色与光影的稳定提升让广告、影视等商业场景更接近实际生产标准。

  6. X:Claude (@claudeai)73

    Claude Fable 5 更新生物安全护栏,误报率降 85%

    Anthropic 更新 Claude Fable 5 的生物安全护栏,将生物相关回退减少约 85%,使其能处理更广泛的日常健康与教育问题。Fable 仍会对病毒学、毒理学和分子设计等双重用途请求回退至 Opus 5,暂不适用于专业生物研究与药物开发。

    推荐理由:减少85%误报意味着日常健康与教育类问询的可用性大幅改善,原先因安全过滤被拒的知识现在可以获取。

  7. Anthropic:Newsroom(网页)66

    Anthropic 更新 Claude Fable 5 生物安全防护,误报率大幅降低

    Anthropic 更新了 Claude Fable 5 的生物安全防护机制,将生物相关查询的“回退”次数减少约 85%,用户在日常健康与教育问题上将更少遇到系统切换至较弱模型的情况。此次更新扩大了模型可协助的生物任务范围,但涉及双重用途的病毒学、毒理学和分子设计请求仍会回退至 Opus 5。Anthropic 表示正通过可信访问途径,致力于缩小专业生物研究与药物开发领域的差距。

    推荐理由:误报减少85%意味着生物医学用户在日常咨询中更少遭遇降级,对依赖模型辅助临床或学习的人有实际可用性提升。

  8. 公众号:千问APP(阿里)67

    千问功能上新:推出思考研究、定时任务、办公助理、语音通话等多项新功能,并支持 Qwen3.8-MAX

    千问今日上线多项新功能,并支持最新旗舰模型 Qwen3.8-MAX。其中“思考研究”在原“深度思考”基础上升级,强化复杂推理与工具调用;“定时任务”可预设执行时间自动完成行业简报梳理等周期工作;“办公助理”能连接备忘录、日历等应用并操作电脑浏览器,直接输出可用的 Office 文档。语音通话支持 7x24 小时多场景,智能体广场首批覆盖物流、房产等十多个领域。

    推荐理由:办公助理将大模型从问答扩展到任务执行,多步操作与跨端协同可能改变繁琐的数据汇总与文档生成流程。

  9. Google Developers Blog(RSS)75

    Agent Plugins 1.0.0 发布:谷歌、亚马逊、微软等支持的统一智能体插件规范

    Agent Plugins 1.0.0 是一项由谷歌、亚马逊、微软等支持的中立目录规范,将 Agent Skills 和 MCP 服务器打包为单一可移植单元。通过标准化 plugin.json 清单和固定目录布局,开发者无需为不同 AI 编码智能体和 IDE 维护单独封装。谷歌已作为核心维护者加入,并在 Agents CLI 和 Data Agent Kit 中提供支持。

    推荐理由:此前不同AI编码代理和IDE的插件需要单独适配,Agent Plugins通过统一manifest和目录结构,使单个插件可跨工具复用,降低了多代理环境的分发成本。

8月6日周四
  1. 公众号:千问APP(阿里)64

    千问全网首发公测,全新 Wan3.0 来了!

    阿里千问全网首发公测视频生成模型 Wan3.0,在生成时长、镜头语言、角色真实感及一致性保持等维度全面升级。该模型支持稳定直出 30 秒一镜到底视频,具备导演级镜头与蒙太奇叙事,并强调角色、道具、场景高一致性保持。Wan3.0 主打超高性价比,现已在千问创作(c.qianwen.com)开放体验,千问 app 也将陆续开启。

    推荐理由:30秒一镜到底和导演级镜头控制将视频生成从短片段推向长叙事,配合低试错成本,可能加速短剧和广告的创作节奏。

  2. IT之家(RSS)71

    谷歌地图 Ask Maps 智能体升级:可对话订餐、找酒店并接入 Gemini Personal Intelligence

    谷歌地图宣布 Ask Maps 迎来新一轮升级,新增智能体功能,可替用户执行订餐操作,并综合考虑饮食要求、当前位置和收藏地点等信息;用户还可通过对话指定装修风格、环境氛围等条件查找酒店和当地活动。

    推荐理由:在地图导航中直接完成订餐和订房,把位置感知的便利性延伸到了生活服务的交易环节,可能改变用户对地图工具的功能预期。

8月5日周三
  1. Hacker News 热门(buzzing.cc 中文翻译)80

    Cloudflare OS:面向代理、应用和工作的开放平台

    Cloudflare 开源 Cloudflare OS,一个面向代理、应用和工作的开放平台,为每位员工提供基于公司上下文和技能的代理工作区,支持创建文档、幻灯片、应用及运行确定性工作流。该平台内置安全与治理框架,确保协作不泄露未授权信息。任何组织均可部署并连接内部系统。

    推荐理由:Cloudflare OS 将企业上下文与内部系统接入 Agent 工作区,Gatekeepers 把权限管控从工具延伸到数据观察链和安全共享,更适合合规要求高的组织部署。

  2. Simon Willison 博客79

    LLM 0.32 发布:新增推理轨迹、OpenAI Responses、服务端工具与更智能的日志

    Simon Willison 发布 LLM 0.32,这是该项目自启动以来最重要的新版本。新版本支持显示推理轨迹、服务端工具、OpenAI Responses API,并默认使用 GPT-5.6 Luna 模型。

    推荐理由:推理追踪输出到标准错误,日志改为内容寻址存储,让 LLM 作为管道工具和代理框架都摆脱了早期消息抽象带来的重复与混乱。

  3. X:Replit (@Replit)69

    Replit 环境智能:免提示词自动生成设计

    你无需提示词,也无需设计语言。 环境智能(Ambient Intelligence)会在每个画面旁显示建议卡片,每张卡片都指向你的设计的一个不同方向。点击你喜欢的那张,即可看到它生成一个新的画面。 你再也不必纠结下一步该做什么。 立即在 http://replit.com/design 体验。

    推荐理由:将「想做什么」从键入提示词转为点选建议卡片,对从零构思界面的开发者减少了决策摩擦。

  4. Hacker News 热门(buzzing.cc 中文翻译)73

    Soup v0.72.4:在4 GB显存笔记本GPU上微调8B模型

    Soup 推出 v0.72.4,支持在配备 4 GB 显存的笔记本 GPU 上通过 QLoRA 微调 8B 模型,无需 SSH 或云服务。

    推荐理由:Soup 将 8B 模型微调压低到 4GB 显存笔记本,使得原本受 GPU 预算限制的个人开发者也能直接在本地迭代模型行为。

  5. LMSYS:Blog(Chatbot Arena 团队)72

    SpecForge v0.3.0 发布:统一解耦与共置投机解码栈,新增开放 SpecBundle 草稿模型

    SpecForge v0.3.0 将目标模型推理与草稿模型训练分离,支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并统一在线、离线与解耦工作流。

    推荐理由:将目标模型推理与草稿模型训练分离,让两种工作负载可独立扩缩,改变了投机解码训练中资源配比必须硬编码的旧模式,资源规划可按模型和序列长度灵活调整。

  6. Google Developers Blog(RSS)61

    Google Cloud API Gateway 推出统一模型路由功能,支持 Gemini、Claude 与 OpenAI OSS-GPT

    Google Cloud API Gateway 新增模型路由功能(Public Preview),开发者可在 OpenAPI 3.x 规范中配置虚拟模型名到后端目标的映射,无需硬编码端点或管理开源代理。网关作为无服务器入口层,接受标准 OpenAI 兼容请求,自动将负载转码为目标模型的原生格式并动态路由流量。

    推荐理由:将模型路由规则直接内嵌到 OpenAPI 规范中,减少了多模型调度时的入口适配工作,也无需自行维护代理层。

  7. OpenRouter:Announcements(RSS)73

    OpenRouter 推出 ori CLI:为 Claude Code 等 Harness 提供开箱即用的优化配置

    OpenRouter 发布 ori CLI,用户安装并登录后即可获得针对 Claude Code、Codex、OpenCode、Hermes 等 harness 的优化配置,省去手动设置大量环境变量的麻烦。

    推荐理由:把十个环境变量压缩成一条cli命令,且根据模型自动切换工具搜索等设置,让网关切换不再伴生配置摩擦。

  8. Google Cloud:Databases(RSS)60

    Google Cloud 推出 Database Operations Agents,实现自主数据库管理

    Google Cloud 在 Agentic Data Cloud 发布中推出两款 AI 数据库智能体:Database Onboarding Agent 负责 Day 0 的配置与部署,Database Observability Agent 负责 Day 1/2 的监控、故障排查与维护。

    推荐理由:数据库代理将排错和调优从手动查找变为自然语言交互,DevOps团队可能因此缩短平均恢复时间。

  9. Prime Intellect(网页)72

    Prime Intellect 开源发布自改进编码智能体 Prime Agent

    Prime Intellect 发布开源编码智能体 Prime Agent,围绕递归语言模型(RLM)和 Continual Harness 两个抽象构建,以持久 IPython 内核作为唯一工具,让模型以编程方式调用子智能体并对提示词、技能、记忆和子智能体做增删改查,通过 /refine 从自身轨迹中持续改进 harness。

    推荐理由:原文详述 RLM 与 Continual Harness 两个核心抽象及长上下文、游戏等实测结果,读者可据此评估这种可自我改进的 harness 设计是否值得接入自己的工作流。

8月4日周二
  1. NVIDIA Blog(RSS)62

    NVIDIA 开源 cuFile API,推动 GPU 直连存储

    NVIDIA 在 FMS 大会上宣布开源 cuFile API 及底层存储软件栈,让 GPU 可直接读写存储,访问延迟降至微秒级。其 Vera CPU 在两级压缩与加密流水线中吞吐量比 x86 CPU 最高提升 3.21 倍,并联合 40 多家厂商推出 Storage-Next 计划。

    推荐理由:cuFile 开源让 GPU 直存访问成为可跨平台协作的开放标准,这会改变 AI 基础设施团队评估存储架构的方式,不再只绑定单一厂商的实现。

  2. MarkTechPost(RSS)79

    Reflex 开源 XY:基于 Rust 的超快 Python 绘图库,可保持 1 亿点图表交互流畅

    Reflex AI 发布 Apache-2.0 许可的 Python 交互式 2D 绘图库 XY,通过 Rust 原生核心、二进制缓冲传输和 WebGL2 渲染,在 1 万至 1 亿点范围内保持约 0.08 秒的渲染时间。

    推荐理由:通过Rust核心和二进制输出,XY将千万级点的交互渲染稳定在0.08秒,并让HTML导出体积从259 MiB缩至258 KiB,这对金融、基因组学等需原始数据钻取的大数据场景有直接落地价值。

  3. Hacker News 热门(buzzing.cc 中文翻译)81

    Swiftlet:在 Mac 上运行 80B 版 Qwen(内存 4.3 GB),在 iPhone 上运行 35B 版

    Swiftlet 是一个 Swift + Metal 运行时,可在普通 Apple 设备上运行 Qwen3-Next 和 Qwen3.5/3.6 MoE 混合模型,仅将小型稠密核心驻留内存,按需从存储流式加载路由专家权重。

    推荐理由:用流式专家加载把 80B 模型塞进手机,具体 RAM 和速度数字让开发者能直接判断自己设备的上限,而不是停留在商详口号。