跳到正文
北京时间

全部动态

今日 65 条
3月24日周二
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)75

    利用对抗网络灵感设计多代理架构,突破长时应用开发瓶颈

    作者受生成对抗网络启发,设计了一个包含规划器、生成器和评估器的三代理架构,以解决Claude在长时应用开发中的两大瓶颈。该架构通过上下文重置机制,有效克服了模型在长任务中的“上下文焦虑”问题;同时,通过分离生成与评估功能,使代理能依据具体标准进行迭代改进,而非盲目自评。这一方法成功使系统能在多小时的自主运行中生成完整的全栈应用程序,突破了此前提示工程和传统工具设计的性能上限。

    推荐理由:Anthropic 工程师把 GAN 的 generator-evaluator 思路搬进长时 Agent 架构,从设计到全栈编码都跑通了,还附了成本和失败模式。做 Agent 产品的人读完能直接抄作业,比看十篇论文管用。

3月23日周一
  1. Anthropic:Research(发表成果 · 网页)71

    利用长时运行智能体工作流革新科学计算

    Anthropic 研究员展示了如何将多日智能体编码工作流应用于科学计算任务。以使用 Claude Opus 实现宇宙学玻尔兹曼求解器的可微分版本为例,该任务通常需耗费研究人员数月甚至数年时间。通过制定清晰的项目指令、利用日志文件作为智能体的持久记忆并设置测试预言,即使是非领域专家也能引导智能体在数小时内完成这类复杂项目。该方法的核心在于设定高层目标后,让智能体团队自主工作,仅需偶尔人工监督,从而显著提升了科学代码开发与移植的效率。

    推荐理由:Anthropic 研究员用 Claude Opus 4.6 花几天从零写出了一个宇宙学 Boltzmann 求解器,原本是博士级团队几个月的活。这不是论文,是一份完整的多日 Agent 工作流实操手册,做科研或长周期编码的人可以直接抄作业。

3月16日周一
  1. 公众号:月之暗面(Kimi)60

    推荐:10万人亲测好用的原版OpenClaw安装器

    Kimi支持的个人开发者开源项目OneClaw下载量突破10万,提供一键安装包,1分钟即可在本地部署原版OpenClaw,无需命令行或环境配置。功能包括纯净卸载、自由切换模型、远程控制,支持连接飞书、企微、钉钉、QQ、Kimi Claw;内置2万+技能的技能商店,可无损迁移记忆和Skills。Kimi提供包月方案和API按需购买。使用地址:oneclaw.cn。

    推荐理由:如果你曾被 OpenClaw 的部署门槛劝退,OneClaw 可以让你两分钟跑起来,适合在备用机尝尝鲜,但别在生产环境乱搞。

3月12日周四
  1. Answer.AI 官方研发博客(RSS)66

    Answer.AI 用 PyPI 数据检验 AI 生产力效应:包创建未见激增,热门 AI 包更新频率翻倍

    Answer.AI 分析 PyPI 数据后发现,ChatGPT 发布后 Python 包创建率没有明显上升,整体更新频率的缓慢增长早在 2019 年就已开始。但热门 AI 相关包更新频率跃升至每年 21-26 次中位数,是热门非 AI 包(约 10 次)的两倍多。

    推荐理由:原文用 PyPI 数据检验 AI 生产力说法,发现效应集中在热门 AI 相关包,给出两个可检验的解释假设。

  2. LlamaIndex:产品、工程与评测67

    LlamaIndex 解析为什么让 AI 读 PDF 这么难

    LlamaIndex 发文解释 AI 智能体读 PDF 难的根本原因:PDF 源自 1982 年的 PostScript,只存绘图指令而非字符,文本编码、表格、图表和阅读顺序都需要启发式推断。

    推荐理由:文章从 PDF 格式底层设计讲清解析困难的根源,并给出文本提取与视觉模型结合的可迁移架构思路。

3月3日周二
  1. LlamaIndex:产品、工程与评测61

    LlamaIndex:不止是 RAG 框架,转向智能体文档处理

    LlamaIndex 官方宣布公司使命收窄为构建智能体文档处理基础设施(OCR、抽取与工作流),不再定位为单纯的 RAG 框架。

    推荐理由:官方复盘了通用 LLM 框架价值下降的原因,并说明转向文档基础设施的动机和产品布局,读者可借此理解框架类公司的转型逻辑。

3月2日周一
  1. Answer.AI 官方研发博客(RSS)63

    Answer.AI 分析:OpenAI 与战争部合同能否冻结自主武器相关法律

    Answer.AI 的 Jeremy Howard 与 Luke Versweyveld 撰文分析 OpenAI 与战争部合同中“all lawful purposes”条款的含义,指出 OpenAI 方面称该条款指“签约时适用的法律”,但合同语言未包含冻结条款。

    推荐理由:文章援引美国合同法判例逐条分析 OpenAI 与国防部合同的用语,说明为何签约时的法律未必能冻结未来的立法变化。

2月27日周五
  1. Cognition 模型 / Devin 博客(网页)67

    Cognition 如何用 Devin 开发 Devin

    Cognition 发文介绍其从创立起就用 Devin 构建 Devin,上周合并了 659 个 Devin PR,高于 2025 年最好一周的 154 个。文章覆盖全接口使用(web、Slack、Linear、CLI、API)及 Ask Devin 代码问答、Devin Review 自动代码审查、每日设计系统审计、!

    推荐理由:Cognition 以当事方身份披露用 Devin 开发 Devin 的完整工作流,上周合并 659 个 Devin PR,读者可对照自身团队借鉴具体用法。

2月25日周三
  1. OpenAI Developers(RSS)73

    OpenAI 发布 gpt-5.3-codex 提示词指南

    OpenAI 发布 Codex 模型提示词指南,API 上的 Codex 调优模型为 gpt-5.3-codex,推荐用 medium 推理力度平衡智能与速度,复杂任务可用 high 或 xhigh。

    推荐理由:官方为 gpt-5.3-codex 给出完整提示词与工具迁移指南,覆盖并行调用、compaction 和 phase 参数等可落地的集成细节。

2月19日周四
  1. Modal 官方工程博客(RSS)64

    Ramp 如何基于 Modal 构建后台编码智能体 Inspect

    Ramp 基于 Modal Sandboxes 构建内部后台编码智能体 Ramp Inspect,目前启动了 Ramp 超过一半的已合并 pull request,其中超过 80% 的 Inspect 代码由其自身编写。

    推荐理由:原文给出 Ramp Inspect 的架构细节、启动优化方式和采用数据,读者可借鉴后台编码智能体的落地方案。

2月18日周三
  1. Answer.AI 官方研发博客(RSS)66

    Answer.AI 揭示未授权工具调用问题:Claude 等模型可调用未授予的工具且 API 不拦截

    Answer.AI 的 Piotr Czapla 发现 Claude 4.5 在 solveit 对话中幻觉出一个未授予的工具 add_msg 并成功执行,API 未拦截,且在 Gemini 和 Grok 上也复现了类似行为。

    推荐理由:作者以可复现的实验展示 API 层不校验工具名带来的安全缺口,并给出客户端侧的简单修复思路。

2月17日周二
  1. PromptArmor:Threat Intelligence71

    PromptArmor 发布 OpenAI Codex 恶意 config.toml 风险 PSA,OpenAI 判定为按设计工作

    PromptArmor 发布安全公告,指出 OpenAI Codex CLI 在用户信任项目后会自动加载并执行 .codex/config.toml 中的任意代码,且信任对话框只提示 prompt injection 风险,未说明会执行项目级配置命令。

    推荐理由:原文给出了具体的攻击链演示和组织级缓解方案,读者可以据此评估在不可信仓库中使用 Codex 的实际风险。

2月11日周三
  1. Steve Yegge:Medium(RSS)75

    AI 吸血鬼

    AI(如 Claude Code)确实能带来 10 倍生产力提升,但创造的价值大部分被公司捕获,员工可能过度劳累却收获甚微。微软内部已自发大量采用 Claude Code。这种效率加速迫使工作节奏不断加快,导致许多早期采用者(包括作者自己)出现严重的“午睡攻击”和日常疲劳。公司作为资本机器难以放缓脚步,形成一种让从业者无论是否使用 AI 都被持续“抽血”的困境。

    推荐理由:Steve Yegge 提出的 'AI 吸血鬼' 概念精准捕捉了 AI 生产力带来的过劳危机,并给出了对抗资本压榨的实用公式,每个在 AI 浪潮中奔命的开发者都该停下看看。

2月10日周二
  1. PromptArmor:Threat Intelligence72

    PromptArmor 揭示消息应用链接预览可致 AI Agent 数据外泄,OpenClaw 默认配置受影响

    PromptArmor 演示了一种通过间接提示词注入让 AI Agent 返回携带敏感数据的恶意 URL,借助 Telegram、Slack 等应用的链接预览功能在用户不点击的情况下实现数据外泄的攻击链。

    推荐理由:原文拆解了链接预览导致无需点击即可数据外泄的攻击链,并给出 OpenClaw Telegram 的具体关闭配置和自测方法。

2月6日周五
  1. PromptArmor:Threat Intelligence69

    PromptArmor 演示通过 MCP 对 OpenAI Agent Builder 的数据外泄攻击

    PromptArmor 实测演示了对 OpenAI Agent Builder 的间接提示词注入攻击:攻击者提交含注入的 Google Form,诱使销售智能体工作流通过 Gmail 将 Salesforce CRM 数据发送给攻击者。

    推荐理由:作者以第一手实测演示了 OpenAI Agent Builder 中经 MCP 的提示词注入数据外泄路径,还展示了 Guardrail 被绕过和多步工作流传递注入的细节。

2月5日周四
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)78

    用并行Claude智能体团队从零构建C编译器

    研究人员采用“智能体团队”方法,让多个Claude实例在无人工干预下并行协作开发代码。为进行压力测试,团队指派16个智能体从零编写一个能编译Linux内核的Rust版C编译器。项目消耗近2000次会话和约2万美元,最终产出10万行代码的编译器,可成功在x86、ARM和RISC-V架构上构建Linux 6.9内核。研究重点在于设计支持长时间自主运行的智能体团队框架,包括如何编写测试以保持智能体不偏离方向,以及如何通过基于文本文件的锁机制协调多智能体并行任务分配。

    推荐理由:Anthropic 研究员用 16 个 Claude 并行写了个能编译 Linux 内核的 C 编译器,2000 次会话花了两万刀。真正值钱的不是编译器本身,而是他总结的 agent 团队协作方法论,做多 agent 系统的人该逐段拆。

2月4日周三
  1. X:Jim Fan (@DrJimFan)72

    从“下一个词预测”到“世界建模”:AI预训练的第二范式

    作者指出,AI预训练正经历从“下一个词预测”到“世界建模”的根本性范式转变。世界模型的核心是预测给定行动后的下一个物理状态序列,本质上是可学习的物理模拟器,并将视觉置于首位。相比之下,当前主流的视觉语言模型本质是语言优先,视觉是次要输入。生物智能中视觉处理占据皮层计算的主导地位,是连接大脑、动作与物理世界的高带宽通道。作者以猿类为例,证明强大的物理智能可独立于高级语言存在。他预测,2026年大型世界模型将为机器人技术和多模态AI奠定真正基础,而YouTube等平台的海量视觉数据将远超文本规模,推动这一新范式发展。

    推荐理由:Jim Fan 把世界模型定义为第二次预训练范式转移,核心论点是视觉优先而非语言优先,这个框架对做机器人和多模态的人是真正的路线判断,不是又一篇水文。

2月3日周二
  1. LlamaIndex:产品、工程与评测62

    LlamaIndex 解析 Agent 的 Skills 与 MCP 工具取舍

    LlamaIndex 撰文比较 Skills 与 MCP 两种让 Agent 调用工具和获取领域知识的方式,并在构建 LlamaAgents Builder 时做了实测。

    推荐理由:作者结合 LlamaAgents Builder 的实测经验,给出 MCP 与技能在执行模型、维护成本和适用场景上的具体取舍依据。

1月27日周二
  1. PromptArmor:Threat Intelligence73

    PromptArmor 披露 Claude Cowork 可被提示注入诱导外泄本地文件

    PromptArmor 发布研究演示,称 Claude Cowork 存在未修复漏洞,可通过隐藏提示注入诱导其用 curl 调用 Anthropic 文件上传 API,把用户本地文件(含财务数据和部分 SSN)上传到攻击者账户,全程无需人工确认。

    推荐理由:原文完整披露了攻击链与利用机制,读者可以了解 Cowork 文件外泄风险的具体成因和触发路径。

1月22日周四
  1. METR:Notes(网页)62

    METR 时间视界论文作者澄清时间视界的局限

    METR 时间视界论文主要作者发文澄清该指标的常见误读,称过去 9 个月 AI 时间视界增长约 6 倍。

    推荐理由:作者作为论文主要作者逐条澄清方法局限,读者可据此更准确地使用和理解时间视界这类指标。

1月21日周三
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)72

    设计抗AI技术评估的实践

    Anthropic性能优化团队负责人Tristan Hume分享了设计抗AI技术评估的经验。自2024年初,团队使用带回家测试评估候选人优化模拟加速器代码的能力,超1000人参与,成功招聘数十名工程师。但随着Claude模型快速迭代,Opus 4已超越多数人类申请者,Opus 4.5甚至匹配顶尖候选人,导致在时间限制下难以区分人类与AI输出。为此,作者三次重设计测试,探索抗AI评估要素,详述原始设计、模型破解方式及非常规对策。最终,团队将原始测试作为公开挑战发布,因无时间限制时人类表现仍优于Claude。

    推荐理由:Anthropic 性能优化负责人亲手写了三版面试题被自家模型逐一击穿的全过程,这种坦诚的工程复盘比任何 AI 能力排行榜都更真实地告诉你,模型到底强到了什么程度。

1月20日周二
  1. PromptArmor:Threat Intelligence67

    PromptArmor 发布 Claude Cowork 安全部署指南,按三档风险分级给出配置方案

    PromptArmor 发布 Claude Cowork 安全部署指南,梳理其威胁模型并给出三档功能与风险权衡的配置方案,从最大化功能的 Tier 1 到基本隔离外部输入的 Tier 3,并逐项说明组织级管理设置。

    推荐理由:安全厂商基于自身威胁模型研究,给出 Claude Cowork 三档部署配置和逐项管理设置,企业安全团队可按风险容忍度直接落地。

1月9日周五
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)75

    揭秘AI智能体评估:构建可靠系统的关键

    有效的评估能帮助团队更自信地发布AI智能体,避免陷入仅在生产环境被动发现问题、修复可能引发新问题的循环。智能体因其多轮操作的自主性与灵活性,评估更为复杂。一个完整的评估结构包含任务、评分器、记录、结果、评估框架与评估套件等核心组件。缺乏系统评估将导致团队无法区分真实的质量倒退与随机波动。建立评估体系能帮助团队在智能体规模化过程中持续监控质量、自动测试变更并量化改进效果,其价值在智能体整个生命周期内持续累积。

    推荐理由:Anthropic 把内部踩过的坑全摊开了,从 eval 设计到 grader 选型到 transcript 审读,是目前最完整的 Agent 评估工程指南,做 Agent 产品的团队可以直接当手册用。

1月8日周四
  1. PromptArmor:Threat Intelligence66

    PromptArmor 披露 IBM Bob 编码 Agent 可被提示词注入诱导下载并执行恶意软件

    PromptArmor 披露 IBM 编码 Agent Bob(含 Bob CLI 与 Bob IDE,目前 Closed Beta)存在漏洞:若用户对任一已知可信命令选择 always allow,攻击者可通过间接提示词注入触发下载并执行恶意软件。

    推荐理由:原文完整拆解了 Bob CLI 三道防御被绕过的具体机制与攻击链,读者可据此评估编码 Agent 的命令自动审批风险。

12月24日周三
  1. OpenRouter:Announcements(RSS)55

    可蒸馏模型与合成数据管道:使用 NeMo Data Designer

    介绍如何利用 NeMo Data Designer 构建许可安全的合成数据工作流,用于模型特化(model specialization)。该管道支持生成可蒸馏模型所需的高质量合成数据,确保数据来源合规,适用于下游微调与领域适配场景。

    推荐理由:虽然发布快半年了,但教程讲的是如何用 NeMo Data Designer 构建 license-safe 的合成数据管道,对正在搞模型蒸馏和微调的开发者依然有参考价值,细节够实操。

12月5日周五
  1. ARC Prize:官方博客69

    ARC Prize 2025 结果公布:NVARC 摘得桂冠,Grand Prize 仍无人认领

    ARC Prize 发布 2025 年结果与分析,NVARC 以约 24% 的 ARC-AGI-2 私有集得分($0.20/task)夺得 Kaggle 竞赛冠军,Grand Prize 连续第二年无人认领。

    推荐理由:官方复盘给出 2025 年获奖方案、成本数字与 refinement loop 框架,读者可借此理解当前 AI 推理的真实边界。

11月26日周三
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)75

    为长时运行智能体设计有效约束方案

    为解决AI智能体在跨越多上下文窗口执行长期任务时的“记忆丢失”与进展不一致问题,Anthropic为Claude Agent SDK开发了一套双重方案。该方案包含一个初始化智能体,负责在首次运行时建立基础环境并生成功能清单;以及一个编码智能体,负责在后续会话中进行增量开发并提交清晰可合并的代码。通过结构化的进度日志和Git历史等机制,引导智能体避免“试图一次性完成所有功能”或“过早宣布完成”的失败模式,从而实现跨会话的持续有效协作。

    推荐理由:Anthropic 把 Claude Agent SDK 跑长任务踩过的坑全摊开了,初始化 agent + 增量进度文件这套方案不复杂但极实用,做 Agent 产品的团队可以直接抄作业。

11月14日周五
  1. Cognition 模型 / Devin 博客(网页)69

    Cognition 发布 Devin 2025 年度绩效复盘,总结 18 个月智能体落地经验

    Cognition 发布 Devin 2025 年度绩效复盘。Devin 上线 18 个月来已在数千家公司服役,累计合并数十万个 PR,客户包括 Goldman Sachs、Santander 和 Nubank。

    推荐理由:Devin 官方复盘 18 个月真实部署的强弱项,给出大量客户场景和量化数据,可帮助读者评估智能体在工程团队中的实际落地方式。

11月4日周二
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)74

    通过代码执行提升MCP智能体效率

    随着AI智能体通过模型上下文协议(MCP)连接的工具数量激增,传统预先加载所有工具定义并通过上下文传递中间结果的方法,导致处理速度变慢、成本增加。问题核心在于工具定义占用大量上下文空间,且中间结果(如完整会议记录)在多次工具调用间重复传递,额外消耗数万令牌。文章提出解决方案:将MCP服务器呈现为代码API,使智能体能按需加载工具,并在执行环境中处理数据,仅将精简结果传回模型,从而显著减少令牌消耗、提升效率并降低成本。

    推荐理由:Anthropic 官方把 MCP 从「能连」推进到「连多了怎么办」,用代码执行替代直接工具调用,token 省 98.7% 这个数字不是吹的。做 Agent 工程的人如果还在暴力塞 tool definition,这篇是必读的架构升级指南。

10月23日周四
  1. X:Dan Hendrycks (@hendrycks)78

    Dan Hendrycks 分享 LLM 价值观调查:多数模型存在种族与性别偏见,Grok 4 Fast 相对平等

    CAIS 负责人 Dan Hendrycks 引用第三方博客对主流大模型进行“效用工程”测试,发现 GPT-4o、Claude Sonnet 4.5 等模型在评估不同群体生命价值时存在显著偏差:多数模型认为白人价值低于其他族裔,男性价值低于女性,且极度贬低 ICE 特工。测试显示模型分为四个道德集群,其中仅 Grok 4 Fast 表现出近似平等的价值观,Hendrycks 呼吁 xAI 解释其实现方式。

    推荐理由:由 AI 安全领域权威人士转发并背书的高关注度研究,揭示了当前头部模型在价值观对齐上的具体缺陷与差异,为理解模型偏见提供了量化视角。

10月13日周一
  1. Answer.AI 官方研发博客(RSS)60

    Kerem Turgutlu 用 SolveIt 将 Karpathy 的 tokenizer 视频教程做成书章

    Answer.AI 的 Kerem Turgutlu 撰文讲解如何用 SolveIt 把 Andrej Karpathy 超两小时的 tokenizers 视频教程转成带可运行代码、超链接和图片的书章。

    推荐理由:作者完整复盘两阶段对话工作流,把超两小时视频转成可运行代码的书章,方法可直接迁移到任意长视频转写场景。

9月29日周一
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)78

    为AI智能体实施有效的上下文工程

    随着AI应用从单次提示转向构建长期运行的智能体,焦点正从“提示工程”演进为“上下文工程”。后者旨在为大型语言模型优化有限的上下文窗口内的全部信息,包括指令、工具、外部数据和对话历史。其核心挑战在于模型存在“注意力预算”限制和“上下文腐化”现象——随着上下文增长,模型回忆信息的准确性会下降。因此,上下文工程要求精心编排高价值信息,以有限的资源最大化产出期望结果,这已成为构建高性能、可操控智能体的关键。

    推荐理由:Anthropic 亲自下场定义 context engineering 这个新范式,把 prompt engineering 之后的工程方法论讲透了。做 Agent 的人如果还在死磕 prompt,这篇会让你重新审视整个技术栈。

9月25日周四
9月17日周三
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)73

    近期三次基础设施故障的事后分析

    八月初至九月中旬,Anthropic的三次基础设施漏洞间歇性导致Claude响应质量下降。8月5日,上下文窗口路由错误致使部分Sonnet 4请求被误导向百万token服务器,8月31日高峰时影响16%请求。8月25日,TPU服务器错误配置引发输出损坏,可能在英文回复中生成泰文或中文字符,影响Opus和Sonnet模型。同日部署的代码还触发了编译器漏洞,主要影响Haiku 3.5。所有问题均非需求或负载所致,纯属基础设施漏洞。公司通过回滚部署和修复逻辑于9月18日前全部解决。

    推荐理由:Anthropic 主动公开三个基础设施 bug 的完整复盘,这种坦诚在大厂里极少见。做 AI 产品的人都该读一下,它把「模型质量下降」从玄学拉回了工程现实,尤其是 XLA 编译器那层的坑,踩过才知道多深。

9月11日周四
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)73

    为智能体编写高效工具——与智能体协作

    文章探讨如何为基于大语言模型的智能体设计高效工具。核心方法是通过与智能体(如Claude Code)协作,采用快速原型构建和全面评估的迭代流程来优化工具性能。关键设计原则包括:选择适当的工具实现范围,使用命名空间明确功能边界,从工具向智能体返回有意义的上下文,优化响应以提高token效率,以及对工具描述进行提示词工程。工具本质上是确定性系统与非确定性智能体之间的新契约,设计应优先考虑智能体的使用体验,而非传统开发者导向的API思路,以扩大智能体解决实际任务的能力。

    推荐理由:Anthropic 把自家内部反复打磨的 agent 工具开发方法论完整公开了,从评估流程到 prompt 工程细节全是实操干货,做 MCP server 或 agent 工具链的人可以直接抄作业。

9月10日周三
  1. Thinking Machines Lab:官方博客(RSS)60

    破解LLM推理中的非确定性

    LLM推理的再现性是科学进步的基础,但即使在温度设为0的贪心采样下,ChatGPT等API以及vLLM、SGLang等自托管推理引擎仍无法保证确定性结果。常见的“并发+浮点非结合性”假设并不完整——GPU上重复执行相同矩阵乘法结果完全一致。真正原因在于:部分GPU内核是非确定性的,但LLM前向传播使用的内核均为确定性;推理服务器前向传播本身是确定性的,用户感知的非确定性源于浮点运算非结合性在不同聚合顺序下导致的细微数值差异。文章揭示了这一误解,并探讨如何实现真正可重现的LLM推理输出。

    推荐理由:Horace He 把 LLM 推理非确定性的锅从并发浮点转向 batch-size,并给出了可落地的 batch-invariant 内核实现,做推理部署和 RL 的工程师都该看看。

8月15日周五
  1. 蚂蚁 inclusionAI:GitHub 新仓库58

    inclusionAI/UI-Venus

    UI-Venus 是一款本地 UI 智能体,仅以屏幕截图作为输入,即可执行精确的图形用户界面元素定位与高效导航。该代理无需依赖系统底层代码或辅助功能接口,直接通过视觉信息理解界面结构,实现自动化操作。其核心能力在于对任意应用或网页中的按钮、菜单、文本框等元素进行准确识别与交互,提升了跨平台任务执行的通用性与可靠性。

    推荐理由:蚂蚁这个纯截图驱动的 UI Agent 在当时算是早期探索,代码开源可直接用,做 GUI 自动化的值得看看底层怎么实现元素定位和导航。

8月7日周四
  1. OpenAI Developers(RSS)64

    如何用 LM Studio 在本地运行 gpt-oss

    OpenAI 发布 Cookbook 教程,讲解如何在本地硬件上用 LM Studio 运行 gpt-oss。LM Studio 是一款在本地硬件运行大语言模型的桌面应用,教程将引导用户完成本地运行 gpt-oss 的步骤。

    推荐理由:OpenAI 官方 Cookbook 给出在本地硬件用 LM Studio 运行 gpt-oss 的完整步骤,可作为离线部署的操作参考。

8月5日周二
  1. OpenAI Developers(RSS)79

    如何用 Ollama 在本地运行 gpt-oss

    OpenAI 开发者发布教程,讲解如何用 Ollama 在本地硬件上部署 gpt-oss-20b 或 gpt-oss-120b 并选择合适的推理设置。

    推荐理由:来自 OpenAI 开发者官方的实操指南,读者可按步骤在自己硬件上用 Ollama 跑通 gpt-oss 两个规格模型。

  2. OpenAI Developers(RSS)60

    OpenAI Cookbook 教程:用 Hugging Face Transformers 微调 gpt-oss

    OpenAI 开发者 Cookbook 发布教程,讲解如何结合 gpt-oss 与 Hugging Face Transformers 进行微调。文章由 Edward Beeching、Quentin Gallouédec 和 Lewis Tunstall 撰写,并从大型推理模型(如 OpenAI o3)通过生成思维链提升准确性的背景切入。

    推荐理由:官方 Cookbook 教程给出用 Hugging Face Transformers 微调 gpt-oss 的具体路径,适合需要本地定制推理模型的开发者参考。