跳到正文
北京时间

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 1261–1280 条 · 共 1,387 条
1月21日周三
  1. Cognition 模型 / Devin 博客(网页)66

    Cognition 发布 AI 代码审查工具 Devin Review

    Cognition 发布 Devin Review,一款针对 GitHub PR 的 AI 代码审查工具,称代码审查已成为 AI 编程时代的瓶颈。

    推荐理由:原文给出三项具体能力和免登录试用入口,读者可以直接对照现有 GitHub 审查流程判断是否值得替换。

1月20日周二
  1. PromptArmor:Threat Intelligence67

    PromptArmor 发布 Claude Cowork 安全部署指南,按三档风险分级给出配置方案

    PromptArmor 发布 Claude Cowork 安全部署指南,梳理其威胁模型并给出三档功能与风险权衡的配置方案,从最大化功能的 Tier 1 到基本隔离外部输入的 Tier 3,并逐项说明组织级管理设置。

    推荐理由:安全厂商基于自身威胁模型研究,给出 Claude Cowork 三档部署配置和逐项管理设置,企业安全团队可按风险容忍度直接落地。

  2. Hugging Face:Blog(RSS)73

    Overworld发布实时交互式视频扩散模型Waypoint-1

    Overworld推出实时交互式视频扩散模型Waypoint-1,用户可通过文本、鼠标和键盘实时控制生成可步入的虚拟世界。该模型基于帧因果校正流变换器架构,在1万小时游戏视频及对应控制数据上训练,从一开始就专注于交互体验,支持零延迟的自由操控。其配套的高性能推理库WorldEngine在消费级硬件上可实现流畅运行,例如Waypoint-1-Small在RTX 5090上能以30 FPS(4步去噪)或60 FPS(2步去噪)生成画面。模型采用扩散强制预训练和自我强制后训练来确保生成长序列的稳定性。

    推荐理由:零延迟交互式视频生成,游戏和创意应用开发者的福音。

1月14日周三
  1. PromptArmor:Threat Intelligence72

    PromptArmor 披露 Superhuman AI 间接提示注入导致邮件数据外泄漏洞

    PromptArmor 披露 Superhuman AI 存在间接提示注入漏洞,恶意邮件中的隐藏指令可让 AI 在用户请求总结邮件时,把数十封含财务、法律、医疗信息的敏感邮件内容填入攻击者的 Google Form 预填链接并以 Markdown 图片输出,单次响应外泄超过 40 封邮件的部分内容。

    推荐理由:原文完整披露了利用 Google Forms 预填链接和 Markdown 图片绕过 CSP 的攻击链,可用于理解 Agent 间接提示注入的数据外泄路径。

1月12日周一
  1. Hacker News:AI 热帖

    Agent-of-empires:OpenCode 与 Claude Code 会话管理器

    Agent-of-empires(AoE)是一款支持 Linux 与 macOS 的 AI 编码代理会话管理器,兼容 Claude Code、OpenCode 等 9 种主流 AI 工具。该工具基于 tmux 实现会话持久化,支持在多分支代码库上并行运行多个代理,提供 Docker 沙盒隔离、Git worktrees 管理及实时状态检测,并可通过 Web 仪表板或 Cloudflare 隧道从手机远程访问,解决多代理协作时的状态追踪与工作环境隔离问题。

    推荐理由:同时管理多个AI编码代理,手机远程监控不再乱套

1月10日周六
  1. Nathan Lambert:Interconnects(RSS)

    Claude Code 与众不同

    Claude Code 集成 Opus 4.5 模型实现关键突破,编程智能体跨越重要能力阈值。此次升级标志着编码代理在自主性和工程处理能力上达到新水平,可应对更复杂的开发任务。Opus 4.5 显著提升了代码生成、调试及复杂问题解决的表现,使 AI 辅助编程从基础工具向高效协作伙伴转变,为开发者带来质的不同的使用体验与效率提升。

    推荐理由:编码 Agent 跨越关键门槛,Claude Code 能力跃升将重塑开发者工作流

1月9日周五
  1. PromptArmor:Threat Intelligence73

    PromptArmor 披露 Notion AI 经由间接提示词注入在用户批准前外泄数据

    PromptArmor 披露 Notion AI 存在间接提示词注入漏洞:AI 编辑在用户批准前已被保存,注入的提示词可让 Notion AI 把招聘追踪文档内容拼入外部图片 URL,用户浏览器加载图片时数据即已外泄,无论是否同意。

    推荐理由:原文完整拆解了 Notion AI 在用户批准前保存 AI 编辑导致数据外泄的漏洞链,并给出企业和 Notion 双方可行的缓解配置与修复建议。

  2. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)75

    揭秘AI智能体评估:构建可靠系统的关键

    有效的评估能帮助团队更自信地发布AI智能体,避免陷入仅在生产环境被动发现问题、修复可能引发新问题的循环。智能体因其多轮操作的自主性与灵活性,评估更为复杂。一个完整的评估结构包含任务、评分器、记录、结果、评估框架与评估套件等核心组件。缺乏系统评估将导致团队无法区分真实的质量倒退与随机波动。建立评估体系能帮助团队在智能体规模化过程中持续监控质量、自动测试变更并量化改进效果,其价值在智能体整个生命周期内持续累积。

    推荐理由:Anthropic 把内部踩过的坑全摊开了,从 eval 设计到 grader 选型到 transcript 审读,是目前最完整的 Agent 评估工程指南,做 Agent 产品的团队可以直接当手册用。

1月8日周四
  1. PromptArmor:Threat Intelligence66

    PromptArmor 披露 IBM Bob 编码 Agent 可被提示词注入诱导下载并执行恶意软件

    PromptArmor 披露 IBM 编码 Agent Bob(含 Bob CLI 与 Bob IDE,目前 Closed Beta)存在漏洞:若用户对任一已知可信命令选择 always allow,攻击者可通过间接提示词注入触发下载并执行恶意软件。

    推荐理由:原文完整拆解了 Bob CLI 三道防御被绕过的具体机制与攻击链,读者可据此评估编码 Agent 的命令自动审批风险。

1月1日周四
  1. Dario Amodei:Blog(网页)

    技术的青春期

    Dario Amodei 将当前 AI 发展阶段定义为「技术的青春期」,认为人类即将获得难以想象的力量,但社会和政治系统是否具备驾驭成熟度仍存疑。文章强调需避免「末日论」式恐慌,以务实、基于事实的方式讨论风险,同时承认 AI 发展速度和风险的不确定性。作者主张通过企业自愿行动与精准政府监管相结合,在避免过度干预的前提下应对潜在危险,为可能到来的更强有力行动储备证据和方案。

    推荐理由:Anthropic CEO 长文剖析 AI 文明风险与治理路径,值得深读。

12月30日周二
  1. xAI:News(网页)

    xAI推出Grok Business与Enterprise企业版

    xAI发布Grok Business和Grok Enterprise企业版。Business版定价30美元/座位/月,支持自助开通,提供团队管理、统一账单及Google Drive集成(保留原文件权限),并承诺用户数据永不用于模型训练。Enterprise版面向大型组织,提供Custom SSO、Directory Sync及高级审计控制;可选的Enterprise Vault插件提供独立数据平面与客户自管加密密钥(CMEK),实现应用级加密隔离。平台支持实时使用监控、安全对话共享及Projects功能。

    推荐理由:xAI 推出 Grok 企业版,主打隐私保护与 Agent 能力,月费 30 美元起

12月29日周一
  1. Jim Fan

    硬件方面,Optimus等虽工程精湛,但可靠性不足严重限制软件迭代,且维护成本高昂。基准测试领域仍处混乱,缺乏统一的硬件平台、任务定义和评分标准,cherry-picking现象普遍,可复现性堪忧。VLA(Vision-Language-Action)方法基于VLM存在本质缺陷:VLM为视觉问答优化,参数侧重语言知识而非物理理解,且视觉编码器丢弃低层细节,不利于精细操作。作者认为视频世界模型是更优的预训练目标。

    推荐理由:NVIDIA科学家揭示机器人学三大痛点:硬件拖累迭代、基准混乱、VLA路线存在根本缺陷

12月27日周六
  1. Jim Fan

    2024:AI 是 copilot 2025+:人类是 copilot Copilot 是新的工程技能。离开驾驶座并不容易——我们必须学会用 AI 的方式思考,并适应陌生的工作流。帮助 AI 帮助我们自己。 [引用 @karpathy]:作为程序员,我从未感到如此落后。这个职业正在被剧烈重构,因为程序员贡献的比特越来越稀疏且穿插其间。我感觉如果能恰当地串联起过去大约一年里出现的东西,我可以强大 10 倍,而未能获得这种提升感觉绝对是技能问题。除了下面通常的层之外,还有一个新的可编程抽象层需要掌握,涉及代理、子代理、它们的提示词、上下文、记忆、模式、权限、工具、插件、技能、钩子、MCP、LSP、斜杠命令、工作流、IDE 集成,以及需要建立一个全面的心理模型来理解那些本质上随机的、易错的、不可理解的且不断变化的实体的优势和陷阱,这些实体突然与过去那种传统的工程实践交织在一起。显然某种强大的外星工具被传递开来,只是它没有附带说明书,每个人都必须弄清楚如何握持和操作它,而由此产生的 9 级地震正在震撼这个职业。卷起袖子以免落后。

    引用Andrej Karpathy@karpathy

    作为一名程序员,我从未感到如此落后。这个职业正在被剧烈地重构,程序员所贡献的比特越来越稀疏、零散。我有一种感觉,如果我能把过去大约一年里涌现出来的东西妥善地串联起来,我可能会强大 10 倍,而未能抓住这波提升,感觉分明就是能力问题。有一层新的可编程抽象层需要掌握(除了下面那些惯常的层级之外),涉及智能体、子智能体、它们的提示词、上下文、记忆、模式、权限、工具、插件、技能、钩子、MCP、LSP、斜杠命令、工作流、IDE 集成,并且需要为那些从根本上随机、易错、难以理解且不断变化的实体建立起一个包罗万象的心智模型——这些实体突然与过去那种老派良好的工程实践混杂在一起。显然,某个强大的外星工具被传了一圈,但它没有附带说明书,每个人都得自己摸索怎么拿、怎么操作,而由此引发的 9 级地震正在撼动整个职业。卷起袖子干吧,别掉队。

    推荐理由:顶级研究者警示编程职业正被重构,掌握Agent编排成为工程师新必修课

12月23日周二
  1. Saining Xie

    不想陷入哲学辩论,但这本书确实改变了我对这个话题的看法,让我更加谦逊。人类智能令人印象深刻,但称其为"通用"并不太客观。我的猫会不同意。 在我看来,人类智能更应被视为社会驱动的认知适应,而且我们仍不理解、也远未用当前 AI 复现的智能领域还有巨大 WORLD。 [引用 @demishassabis]:Yann 在这里完全错了,他把通用智能和 universal intelligence 混淆了。 大脑是我们在宇宙中所知最精致、最复杂的现象(迄今为止),而且它们实际上极其通用。 显然,没有人能规避 no free lunch theorem,因此在实际且有限的系统中,总是必须围绕正在学习的目标分布有一定程度的专门化。 但关于通用性的要点在于,理论上,在 Turing Machine 的意义上,这种通用系统的架构能够在给定足够时间和内存(以及数据)的情况下学习任何可计算的东西,而人脑(和 AI foundation models)是近似 Turing Machines。 最后,关于 Yann 对国际象棋棋手的评论,人类竟然能发明国际象棋(以及现代文明的所有其他方面,从科学到 747s!),更不用说像 Magnus 这样的人能下得如此出色,这本身就令人惊叹。他可能不是严格最优的(毕竟他有有限的记忆和有限的决策时间),但考虑到我们的大脑是为狩猎采集而进化的,他以及我们能用大脑做到这些,实在令人难以置信。

    引用Demis Hassabis@demishassabis

    Yann在这里完全说错了,他把通用智能和万能智能混为一谈了。 大脑是我们在宇宙中(迄今为止)所知的最精妙、最复杂的现象,而且它们事实上极其通用。 显然,人们无法绕过“没有免费午餐”定理,因此在一个实际且有限的系统中,总得围绕所学习的目标分布存在某种程度的专门化。 但关于通用性的要点在于,从理论上讲,在图灵机的意义上,这样一个通用系统的架构能够在给定足够时间、内存(和数据)的情况下学习任何可计算的东西,而人脑(以及AI基础模型)都是近似的图灵机。 最后,关于Yann对国际象棋棋手的评论,令人惊叹的是人类竟然能首先发明国际象棋(以及现代文明从科学到747飞机的所有其他方面!),更不用说像Magnus这样的人能把它下得如此出色。他可能并非严格意义上的最优(毕竟他的记忆有限,做决定的时间也有限),但考虑到他和我们的大脑是为狩猎采集而进化出来的,我们能用大脑做到的事情实在令人难以置信。

    推荐理由:顶级科学家对AGI本质的深刻思辨,重新定义通用智能的边界与局限

12月22日周一
  1. xAI:News(网页)

    以 AI 支持 DOW 的使命

    xAI 被美国战争部(DOW)选中,为其 GenAI.Mil 套件提供 Frontier AI 系统。基于 Grok 模型的解决方案将覆盖 DOW 旗下 300 万军事和文职人员,支持 Impact Level 5(IL5)级别的企业 AI 和关键任务用例,可嵌入从五角大楼到战术边缘的日常工作流,并支持机密作战工作负载。DOW 用户还可独家获取 X 平台实时全球洞察。

    推荐理由:xAI获美国国防部大单,Grok将覆盖300万军事人员并提供实时情报支持

12月18日周四
  1. OpenRouter:Announcements(RSS)61

    Response Healing:将 JSON 缺陷减少 80% 以上

    OpenRouter 推出新功能 Response Healing,可在 LLM 生成的畸形 JSON 响应抵达用户应用前自动修复。该功能旨在将 JSON 格式错误减少超过 80%,直接提升 API 响应的结构完整性与可靠性,减少下游应用的处理负担。

    推荐理由:做 Agent 的人最怕 JSON 解析炸掉整个 pipeline,OpenRouter 这个 Response Healing 相当于在网关层加了自动纠错,接入成本几乎为零,值得试试。

12月17日周三
  1. xAI:News(网页)

    xAI 发布 Grok Voice Agent API

    xAI 开放 Grok Voice Agent API,基于自研语音栈(VAD、tokenizer、音频模型),Big Bench Audio 基准排名第一,首音频延迟低于 1 秒(比竞品快近 5 倍),定价 $0.05/分钟。支持数十种语言自动切换、实时搜索 X 和网页、调用自定义工具,已深度集成特斯拉车机。提供 Ara、Eve 等多种自然声线,支持 [whisper] 等听觉标签,兼容 OpenAI Realtime API 规范。

    推荐理由:xAI发布Grok语音Agent API,延迟低于1秒且定价仅为OpenAI一半,已集成至Tesla车载系统

12月16日周二
  1. Hugging Face:Blog(RSS)83

    CUGA 登陆 Hugging Face:普及可配置的通用 AI 智能体

    开源可配置通用智能体 CUGA 现已集成至 Hugging Face Spaces,便于开发者便捷实验。该智能体在复杂任务基准测试中表现卓越,在包含 457 个 API、750 个真实任务的 AppWorld 基准排名第一,在 WebArena 基准也位居前列。其核心提供可配置的推理模式以平衡性能与成本,支持计算机使用与多工具无缝集成,并能与 Langflow 结合进行低代码工作流设计。采用 Apache 2.0 许可的 CUGA 支持多种开源模型,在高性能推理平台(如 Groq)上运行能显著提升效率。

    推荐理由:开源AI代理框架性能领先,集成Hugging Face和Langflow,开发者可快速构建复杂任务。

12月9日周二
  1. Claude:Blog(网页)

    Anthropic调研:2026年企业AI智能体应用趋势

    Anthropic与Material调研500余位技术领导者显示,57%企业已将AI智能体用于多阶段工作流,16%实现跨职能部署。编码是核心场景,90%用于开发辅助,86%用于生产代码,平均节省近六成时间。80%受访者称投资已产生可衡量回报,如Thomson Reuters将法律检索从数小时缩短至分钟级。2026年81%企业计划处理更复杂用例,但面临系统集成、数据质量和变革管理三大挑战。

    推荐理由:Anthropic发布企业AI Agent深度调研,揭示2026年应用趋势与头部企业实战案例