构建长时间运行的智能体,并对智能体执行拥有更多控制。 Agents SDK 中的新功能: • 在受控沙箱中运行智能体 • 检查并自定义开源 harness • 控制记忆的创建时机及其存储位置
推荐理由:OpenAI 把 Agents SDK 带到了 TypeScript,而且直接上了沙箱和开源 harness,做 Node.js 代理的可以扔掉自研的调度层了。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
构建长时间运行的智能体,并对智能体执行拥有更多控制。 Agents SDK 中的新功能: • 在受控沙箱中运行智能体 • 检查并自定义开源 harness • 控制记忆的创建时机及其存储位置
推荐理由:OpenAI 把 Agents SDK 带到了 TypeScript,而且直接上了沙箱和开源 harness,做 Node.js 代理的可以扔掉自研的调度层了。
OpenAI扩展ChatGPT广告服务,推出自助广告管理平台测试版,新增CPC竞价功能和增强的广告效果测量工具。新平台注重隐私保护,确保广告内容与用户对话相互独立,帮助广告主更精准地定位目标受众并优化广告投放效果。
推荐理由:OpenAI 把广告变成了自助服务,CPC 竞价和 Ads Manager 是商业化一大步,对开发者生态影响不小,但对话里塞广告会不会翻车,还不好说。
Perplexity和Computer现已接入优质健康资源,首批包括NEJM和BMJ集团,另有9种医学期刊和临床数据库即将上线。 提出健康问题,即可获得来自医院和研究机构所信赖的相同来源的引用答案。
推荐理由:医疗信息最怕不靠谱,Perplexity 直接接进 NEJM 和 BMJ 这种顶刊,等于把医生的参考资料装进 AI,查健康问题终于不用在营销文里盲人摸象了。
推荐理由:Copilot Cowork 把委托工作从桌面延伸到了手机,加上 skills 和插件,办公自动化终于能随时丢任务随时捡起来,这是微软把 agent 落地的关键一步。
推荐理由:金融行业的 Claude 用户有福了,官方一口气放出了投行 pitch、估值审查、月末结账等现成 agent 模板,装成插件就能跑。
Anthropic发布了十个针对金融服务耗时任务的预置智能体模板,涵盖制作推介书、撰写信贷备忘录、KYC文件筛查及月末关账等。这些模板可作为Claude Cowork和Claude Code的插件,或作为Claude托管智能体的配置指南,帮助团队在数天内部署应用。Claude现通过Microsoft 365插件支持在Excel、PowerPoint等Office应用间无缝工作,并扩展了合作伙伴生态,新增数据连接器和MCP应用,使智能体能直接调用实时金融数据。这些更新与Claude Opus 4.7模型搭配效果最佳,该模型在金融任务上达到先进水平。
推荐理由:Anthropic 一口气放出十个金融模板,从 pitchbook 到月底关账全包,加上 Excel、PPT、Word 的深度集成,做金融的可以少写很多重复性胶水代码,直接套模板干活去了。
Runway公司推出“Characters”实时视频智能体,它能将任意单张参考图像(如真人、卡通或幻想生物照片)实时转化为具有自然对话表现力的视频角色。该技术基于其通用世界模型GWM-1,无需微调即可生成每秒24帧的高清视频,并同步口型、表情和头部运动。其核心突破在于通过自回归逐帧生成、流程优化与并行化,实现了每帧仅37毫秒的模型处理时间,以及从用户停止说话到角色开始响应仅1.75秒的服务器端延迟,从而满足了实时交互对话的严苛要求。
推荐理由:把单张图变成实时对话角色这件事,Runway 做到了 24fps 且 1.75 秒响应。不是预录,是真实时,还带了知识库和工具调用,做虚拟角色产品的可以直接拿来集成。
推荐理由:Grok 的语音克隆带着自然情绪上线 API,不只是复读机,而是带感情的合成。想给应用加个有人味的 AI 语音,开发者可以试试这套新接口。
本次更新包含多项功能优化与错误修复。主要功能上,`/color` 命令支持无参数随机选色,`/mcp` 命令显示已连接服务器的工具数量,`--plugin-dir` 参数新增支持 `.zip` 插件包。用户体验方面,优化了 `/model` 选择器的显示。关键问题修复包括:解决了通过标准输入传输超大文件时导致的崩溃循环、修复了长 URL 在全屏模式下无法逐行点击的问题,以及修正了并行 Shell 工具调用中一个命令失败会错误取消同级调用的问题。此外,还处理了 MCP 服务器重连时工具列表刷屏等多个稳定性问题。
推荐理由:Claude Code 的日常维护版本,修了一堆小 bug 并给了 /color 随机色、插件支持 zip 等细节提升,重度用户建议升,非用户不必关注。
推荐理由:Grok Voice API 终于支持声音克隆,关键是能带自然情感,做语音产品的开发者可以直接接入了,这是 xAI 在语音交互上的一次重要补齐。
告别持续轮询!在构建复杂、长期运行的智能体应用时,使用 Gemini API 中的 Webhooks 来消除 API 流量的浪费,并简化编排逻辑。🙌
推荐理由:长期轮询是agent开发的隐形税,Gemini API这次内置webhooks,把编排逻辑简化了一大截,做复杂agent的开发者今晚就能删掉一堆轮询代码。
Gemini API 引入了事件驱动的 Webhook 功能,这是一种基于推送的通知系统。它旨在消除低效的轮询需求,为长时运行的任务(如文件处理或复杂推理)提供更优的解决方案。当任务完成时,系统会自动将结果推送到用户指定的端点,从而显著降低延迟并减少资源消耗,提升开发效率与响应速度。
推荐理由:Gemini API 终于补上 Webhooks 这块拼图,长任务不用再轮询等待,对做自动化流程和 Agent 的开发者是实打实的效率提升。
推荐理由:无密钥认证直接解决了 API 密钥泄露这个高频痛点,而且支持主流云身份,企业部署门槛降了一大截,做 AI 集成的团队明天就可以试。
推荐理由:Replit把做pitch deck变成聊天式操作,输描述、实时改、一键导出,比传统PPT工具快不少,但真正的故事还是得你自己想清楚。
从构想到原型,借助Gemini中的Nano Banana 2,将您独特的产品愿景变为现实。🪀
推荐理由:Google Gemini塞进一个Nano Banana 2创意工具,把想法转原型只需几句话,产品经理脑暴草案利器,算不上重磅但够实用。
你的 AI 聊天机器人无法交付。 它会回答。它会建议。它生成的代码你还得自己接上线。关掉标签页,一切就没了。 每次运行都消耗 token。每个工作流都随会话一起消亡。 我们打造 KroWork,就是为了终结这个循环。 KroWork 是一款桌面 AI 智能体,它不只是聊天。它执行任务,然后把结果固化成真正属于你的软件。我们称之为 chat-to-software。 实际效果是这样的: 第 1 步:自主执行 描述你的需求。智能体端到端处理:浏览器自动化、代码生成、文件管理、深度研究、文档转换。20+ 内置技能。 不是建议。是行动。 第 2 步:Kro App 生成 Kro 为你构建的任何工作流都可以保存为 Kro App:一个持久化应用,带有服务、窗口、 CronJobs 和内置前端设计。 你的对话变成了可复用的资产。 第 3 步:Kro App 安装 一键即可将其作为原生软件安装到你的 Launchpad 或开始菜单。像 Spotify 一样打开。 像 Excel 一样运行。只不过你是在一次对话中把它构建出来的。 重新运行不消耗 token。无需重建。它属于你。 更重要的是,你可以把 Kro 连接到你的 IM 平台进行远程控制。从移动设备发送指令,让 Kro 在获得你授权的情况下在本地执行。 一切都在你的机器上运行。你的文件、你的数据、你的设备。什么都不外流。不依赖云端。 无需编程背景。打开应用, 描述你的需求,搞定。 会说话的 AI 只是入场券。 能构建、能安装、并把钥匙交给你的 AI。 这才是接下来要发生的事。 说出来,Kro 它,留住它。
推荐理由:KroWork 把 AI 会话固化成本地软件,一键安装,这个思路解决了 Agent 最大的痛点,每次重跑都得重新教它。做个人自动化的可以立即上手试试。
推荐理由:Runway 把 AI 视频从生成拉入实时对话时代,1.75 秒的延迟让视频代理第一次有了「对话感」,做交互设计的同学可以认真看一眼。
推荐理由:OpenClaw 这个版本把 agent 协同和实时控制做得更顺手了,如果你在用多节点 agent,这个升级能省不少调试功夫。
Claude Platform 的 Workload Identity Federation 现已正式可用。该功能允许用户使用来自 AWS IAM、Google Cloud、GitHub Actions 等身份提供商的短期 OIDC 令牌认证 Claude API,替代长期静态 API 密钥。
推荐理由:用 OIDC 短期令牌代替 API 密钥,对企业级部署是刚需级安全改进,做生产环境集成的可以告别密钥轮换脚本了。
点击“批准权限”按钮很困难。 我们展示智能体可以为你做到这一点。 查看我们的对齐博客:https://alignment.openai.com/auto-review
推荐理由:Codex 这个自动审查模式把审批量砍了 200 倍,而且已经成了 OpenAI 内部默认设置。这意味着 AI 编程 Agent 真正开始被信任,做 Agent 工作流的人可以认真研究一下。