跳到正文
北京时间

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 1221–1240 条 · 共 1,387 条
2月27日周五
  1. Cognition 模型 / Devin 博客(网页)67

    Cognition 如何用 Devin 开发 Devin

    Cognition 发文介绍其从创立起就用 Devin 构建 Devin,上周合并了 659 个 Devin PR,高于 2025 年最好一周的 154 个。文章覆盖全接口使用(web、Slack、Linear、CLI、API)及 Ask Devin 代码问答、Devin Review 自动代码审查、每日设计系统审计、!

    推荐理由:Cognition 以当事方身份披露用 Devin 开发 Devin 的完整工作流,上周合并 659 个 Devin PR,读者可对照自身团队借鉴具体用法。

2月26日周四
2月25日周三
  1. Hacker News:AI 热帖

    LLM Skirmish:AI代理可玩的实时战略游戏基准测试

    LLM Skirmish 是一个让大语言模型通过编写代码进行1v1实时战略游戏对战的基准测试。基于Screeps开源API,每场锦标赛包含五轮,LLM可根据对战日志调整策略以测试上下文学习能力。结果显示,Claude Opus 4.5以85%胜率排名第一,GPT 5.2次之。Gemini 3 Pro表现异常:首轮胜率70%,后四轮骤降至15%,疑似因上下文腐烂。成本方面,Claude Opus 4.5每轮$4.12最贵,GPT 5.2性价比高出1.7倍。

    推荐理由:LLM实时战略游戏对战基准,Claude大幅领先且展现独特上下文学习能力

  2. OpenAI Developers(RSS)73

    OpenAI 发布 gpt-5.3-codex 提示词指南

    OpenAI 发布 Codex 模型提示词指南,API 上的 Codex 调优模型为 gpt-5.3-codex,推荐用 medium 推理力度平衡智能与速度,复杂任务可用 high 或 xhigh。

    推荐理由:官方为 gpt-5.3-codex 给出完整提示词与工具迁移指南,覆盖并行调用、compaction 和 phase 参数等可落地的集成细节。

  3. Jim Fan

    SONIC是一个4200万参数的Transformer模型(规模仅半个GPT-1),通过1亿+动作捕捉帧和50万+并行机器人在NVIDIA Isaac Lab中训练,以密集帧级监督替代手工奖励函数。训练3天后零样本迁移至真实G1机器人,在50种动作序列上达100%成功率。单一策略支持VR遥操作、视频动捕、文本指令、音乐响应及VLA模型控制。项目已完全开源。

    推荐理由:42M小模型实现人形机器人全身控制,零样本迁移真实硬件且完全开源,开发者可复现

  4. Anthropic:Newsroom(网页)

    Anthropic 收购 Vercept 以推进 Claude 的 computer use 能力

    Anthropic 收购 Vercept,后者专注 AI 感知与交互,将停止外部产品并加入 Anthropic。Claude Sonnet 4.6 在 OSWorld 基准测试中准确率已从 2024 年底的 15% 提升至 72.5%,可接近人类水平处理复杂表格和跨标签页网页表单。

    推荐理由:Anthropic 收购 Vercept 团队,Claude 的 Computer Use 能力将获大幅提升。

2月24日周二
  1. AI as Normal Technology(RSS)76

    普林斯顿大学发布AI智能体可靠性科学论文

    普林斯顿大学研究人员将AI智能体可靠性分解为4个维度共12项指标,对14个模型测试发现,近18个月能力快速进步仅带来有限的可靠性提升,一致性得分仅30%-75%。研究团队计划推出“可靠性指数”以推动系统性改进。

    推荐理由:这篇论文把 AI agent 的可靠性拆成一致性、鲁棒性、预测性、安全四个维度,在 14 个模型上实测发现可靠性进步远慢于能力进步,解释了不少人困惑的落地慢问题,做 agent 的团队该认真看看。

  2. HuggingFace Daily Papers(社区热门论文)

    屏幕上的图灵测试:移动GUI代理人性化基准

    研究团队提出"屏幕图灵测试"框架,将人机交互形式化为MinMax优化问题,并发布Agent Humanization Benchmark (AHB)。基于新收集的高保真移动触摸动态数据集,发现普通LMM代理因运动学特征不自然而极易被检测。该基准量化了可模仿性与任务效用的权衡,提出的启发式噪声至数据驱动行为匹配方法,使代理在不牺牲性能的前提下实现高可模仿性,推动GUI代理从"能否完成任务"向"如何像人类一样完成"的范式转变。

    推荐理由:让AI操作手机更像真人,避免被平台识别封禁的实用新研究

  3. Cognition 模型 / Devin 博客(网页)64

    Cognition 发布 Devin 2.2,支持桌面端测试与自动修复

    Cognition 发布 Devin 2.2,智能体现在可用 computer use 在自己的 Linux 桌面上端到端测试网页和桌面应用,并在开 PR 前自查代码、自动修复问题,完成后回传屏幕录制供用户审阅。

    推荐理由:官方公告给出自主测试、自动修复和启动提速等具体能力变化,读者可以据此评估对现有开发流程的影响。

2月19日周四
  1. Modal 官方工程博客(RSS)64

    Ramp 如何基于 Modal 构建后台编码智能体 Inspect

    Ramp 基于 Modal Sandboxes 构建内部后台编码智能体 Ramp Inspect,目前启动了 Ramp 超过一半的已合并 pull request,其中超过 80% 的 Inspect 代码由其自身编写。

    推荐理由:原文给出 Ramp Inspect 的架构细节、启动优化方式和采用数据,读者可借鉴后台编码智能体的落地方案。

  2. Hugging Face:Blog(RSS)70

    IBM与伯克利利用IT-Bench和MAST诊断企业级AI智能体失败原因

    IBM Research与加州大学伯克利分校合作,通过新构建的IT-Bench基准测试和MAST评估框架,系统分析了企业级AI智能体在复杂IT运维任务中的失败原因。研究发现,当前智能体在多步骤规划、长序列操作及工具精确使用方面存在明显不足,导致任务失败率较高。该研究旨在为开发更可靠、适用于实际业务环境的企业级智能体提供关键诊断依据和改进方向。

    推荐理由:企业Agent落地失败的系统性诊断,部署前可参考避坑

2月18日周三
  1. Ethan Mollick:One Useful Thing(RSS)

    Agentic 时代 AI 选择指南

    Agentic 时代 AI 不再只是聊天机器人,而是能自主执行任务的智能体。面对 Claude、GPT、LLaMA 等模型,需根据代理能力、任务类型和生态集成重新评估选择策略。

    推荐理由:AI 大咖 Ethan Mollick 撰写 Agent 时代实用选型指南

  2. Answer.AI 官方研发博客(RSS)66

    Answer.AI 揭示未授权工具调用问题:Claude 等模型可调用未授予的工具且 API 不拦截

    Answer.AI 的 Piotr Czapla 发现 Claude 4.5 在 solveit 对话中幻觉出一个未授予的工具 add_msg 并成功执行,API 未拦截,且在 Gemini 和 Grok 上也复现了类似行为。

    推荐理由:作者以可复现的实验展示 API 层不校验工具名带来的安全缺口,并给出客户端侧的简单修复思路。

2月17日周二
  1. PromptArmor:Threat Intelligence71

    PromptArmor 发布 OpenAI Codex 恶意 config.toml 风险 PSA,OpenAI 判定为按设计工作

    PromptArmor 发布安全公告,指出 OpenAI Codex CLI 在用户信任项目后会自动加载并执行 .codex/config.toml 中的任意代码,且信任对话框只提示 prompt injection 风险,未说明会执行项目级配置命令。

    推荐理由:原文给出了具体的攻击链演示和组织级缓解方案,读者可以据此评估在不可信仓库中使用 Codex 的实际风险。

  2. METR:Notes(网页)63

    METR 用 5305 份 Claude Code transcript 估算 AI 编码时间节省为约 1.5x 至 13x 的软上界

    METR 基于 2026 年 1 月 7 名技术人员的 5305 份 Claude Code transcript,用 LLM judge 估算无 AI 完成同样任务所需时间,得出时间节省倍数约 1.5x 至 13x。作者认为该数值因任务替代、任务选择、员工专业化和 judge 验证有限(仅 34 个人工标注)而高估真实提升,只是软上界;并发 agent 数更高的员工时间节省倍数更高。

    推荐理由:作者用 5305 份 Claude Code transcript 估算时间节省倍数,并说明它为何只是真实生产力提升的软上界,方法细节可直接借鉴。

2月14日周六
  1. 字节 Seed:Research Feed(网页内嵌数据)

    Seed2.0 正式发布

    Seed2.0系列正式发布,推出Pro、Lite、Mini三款通用Agent模型及专用Code模型,针对复杂多模态任务与长链路Agent场景优化。模型在视觉理解、数学推理与长上下文处理方面达SOTA水平,SuperGPQA分数超越GPT-5.2,并在ICPC、IMO、CMO测试中获金牌。支持科学研究级任务,token成本较顶尖模型降低约一个数量级。目前已上线豆包App、TRAE及火山引擎API。

    推荐理由:字节 Seed2.0 正式发布,Agent 与多模态能力全面升级,已接入豆包和 TRAE

2月12日周四
  1. Hugging Face:Blog(RSS)83

    实践中的OpenEnv:在真实环境中评估工具使用智能体

    Meta与Hugging Face联合推出开源评估框架OpenEnv,旨在标准化智能体与真实系统的交互。Turing公司贡献了生产级“Calendar Gym”环境,用于在权限控制、时间推理等现实约束下研究工具使用智能体。该框架采用类似Gymnasium的API,通过标准接口连接真实工具,将评估重点从受控演示转向真实世界可靠性。日历系统因涉及多用户、多步骤工作流等复杂性,成为评估智能体实际能力的强大测试平台。

    推荐理由:提供生产级基准测试,帮助开发者评估和改进 AI 代理在复杂环境中的表现。

  2. MiniMax:Blog(网页)67

    MiniMax 发布 MiniMax M2.5 模型,专为现实世界生产力打造

    MiniMax 最新发布的大语言模型 M2.5,通过在数十万个复杂现实环境中进行强化学习训练,在编码、智能体工具调用、搜索和办公工作等多项任务上达到 SOTA。模型推理效率高,完成 SWE-Bench Verified 评估的速度比前代 M2.1 快 37%,与 Claude Opus 4.6 相当。定价方面,以 100 tokens/秒运行时每小时成本仅 1 美元。M2.5 在超过 10 种编程语言和 20 多万个真实环境中训练,具备从系统设计到测试的全流程能力。

    推荐理由:MiniMax M2.5 把 SWE-bench 拉到 80.2%,成本只有 Claude Opus 4.6 的十分之一,速度还翻倍,对做 agent 的团队来说是个高性价比选择。

2月11日周三
  1. FireRedTeam:原创语音与多模态项目65

    小红书团队开源 FireRed-Image-Edit 图像编辑模型并发布 REDEdit-Bench

    小红书智能创作团队开源 FireRed-Image-Edit 图像编辑模型,权重采用 Apache 2.0 协议,并在 ImgEdit、GEdit 和自建 REDEdit-Bench 上取得开源模型中的最高分,如 ImgEdit_O 4.56。

    推荐理由:小红书团队开源图像编辑模型,README 给出完整基准对比表、训练与部署方案,读者可自行核对开源 SOTA 的成色。

  2. Modal 官方工程博客(RSS)71

    Modal 上线 Z.ai GLM-5 免费端点并提供自部署代码

    Z.ai 发布开源权重模型 GLM-5(MIT 许可,面向长程 Agent 和系统工程),Modal 与其合作上线免费体验端点,4 月底前可用,限单并发请求。FP8 精度下模型约 700 GB,需多 GPU 部署,Modal 用 8 张 B200 单节点配合 SGLang 运行,内部实测每用户 30-75 tokens/秒。

    推荐理由:Modal 官方给出 GLM-5 的部署细节、免费端点限制和前端接入配置,读者可直接照做在自己常用的 Agent 框架里试用。