跳到正文
北京时间

教程实践

拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。

417条精选相关主题AI 编码Agent 智能体产品更新

最新精选

第 321–340 条 · 共 417 条
5月8日周五
  1. GitHub Blog72

    提升 GitHub Agentic Workflows 的 Token 使用效率

    GitHub 发现运行于每个拉取请求的智能体工作流会累积高昂的 API 成本。团队通过监测自身生产工作流,定位了效率低下的环节,并构建了专门的智能体进行优化。这一举措旨在显著降低由大语言模型调用产生的 Token 消耗与相关费用,直接提升了工作流的经济性与运行效率。

    推荐理由:GitHub 把自己生产环境的 agentic workflow 扒了一遍,从 token 消耗里找浪费,再让 agent 自动修。不是 paper,是真踩过的坑,做 Copilot 集成的团队可以抄作业。

  2. GitHub Blog79

    Agent pull requests 无处不在:如何审查它们

    这份指南提供了审查由AI代理生成的pull requests的实用方法,重点包括审查时应关注的代码变更点、问题常见隐藏位置(如逻辑错误或安全漏洞),以及如何在代码合并前捕捉技术债务。它通过具体步骤帮助开发者系统评估自动化提交,确保代码质量,避免缺陷流入生产环境。指南强调主动审查策略,以应对AI代理在软件开发中日益普及的趋势。

    推荐理由:AI代理生成的PR越来越多,审查它们不再是可选项。这篇官方指南从发现隐患到控制技术债务,给出了马上能用的检查清单,每个用Copilot的开发者都该看。

5月7日周四
  1. GitHub Blog56

    Validating agentic behavior when “correct” isn’t deterministic

    GitHub 探讨如何为 Copilot 编码智能体构建“信任层”。文章提出,在“正确”答案非确定性的场景下,可通过领域分析来验证智能体的自主行为,避免使用脆弱的脚本或黑盒判断。该方法旨在提升 AI 编码助手的可靠性与透明度,确保其行为符合预期标准。

    推荐理由:做coding agent最头疼的就是如何验证产出质量,GitHub这篇把他们的内部方法论开源了,用dominance分析替代脆弱的脚本,对正在折腾AI编程工具的团队是实打实的参考,值得逐帧学习。

  2. Hugging Face:Blog(RSS)65

    vLLM V0 到 V1:在线强化学习中优先确保后端行为正确性

    为确保 vLLM 从 0.8.5 到 0.18.1 的重大重写后,在线强化学习训练结果与 V0 参考运行一致,团队优先修复后端行为而非调整 RL 目标。关键修复包括:将日志概率模式设为 `processed_logprobs` 以匹配采样器分布;禁用 V1 特有的前缀缓存和异步调度等运行时默认值;调整权重更新路径以匹配 V0 的缓存保留行为;并确保 rollout 后端使用 fp32 精度的 `lm_head` 进行最终投影。这些措施消除了策略比率均值偏差,使 V1 在 KL 散度、熵等指标上与 V0 达成一致。

    推荐理由:vLLM V1迁移时踩的四个坑全在这里,从logprob语义到fp32投影头,修完才调RL目标,做在线RL的团队可以直接抄这份配置清单。

5月6日周三
  1. Claude:Blog(网页)71

    金融服务行业Claude部署指南发布

    Anthropic发布金融服务行业Claude部署指南,详细介绍了Claude系列产品在金融研究、交易、承销、理赔及月末结算等场景的应用方案。指南包含产品矩阵、10个预置金融智能体模板(如招股书生成器、KYC筛查器等),并分享了AIG、澳大利亚联邦银行等机构的实践案例。同时,提供基础、试点、扩展三阶段实施路线图,旨在协助企业决策者与工程师规划AI落地路径,提升运营效率。

    推荐理由:Claude 官方首次系统性给出金融行业的部署指南,从产品矩阵到预建代理模板再到三阶段路线图,做金融 AI 落地的可以直接拿过来对齐。

5月5日周二
  1. Runway:News(网页)55

    60倍速冷启动:将同级GPU视为权重服务器

    Runway平台团队开发的NCCLBack系统,通过P2P权重传输将模型冷启动时间从数分钟缩短至数秒。其核心创新在于让新启动的GPU推理节点直接从集群内已加载权重的同级GPU获取模型参数,而非从云存储重复下载。该系统利用GPU互连(如InfiniBand、NVLink)高达200-400 Gbps的带宽,相比传统存储下载的2-10 Gbps实现了数量级提升。通过Redis协调与NCCL广播原语,NCCLBack确保了数据传输的效率和正确性,使得大规模集群部署新模型时,冷启动时间不随节点数量线性增长,基本保持恒定。

    推荐理由:Runway 工程师把 GPU 冷启动从分钟压到秒级,原理是让已加载权重的 GPU 直接「喂」给新同伴,而不是各自从存储下载。做大规模推理部署的团队值得细读。

  2. OpenAI Developers(RSS)69

    OpenAI 发布 Realtime Prompting Guide:实时语音智能体提示指南

    OpenAI 发布 Realtime Prompting Guide,指导如何为实时语音智能体编写提示词,涵盖 Realtime 2 推理、前置指令(preambles)、工具调用和精确实体捕获(exact entity capture)等关键功能。该指南旨在帮助开发者更有效地构建和优化基于语音的 AI 交互体验。

    推荐理由:OpenAI官方出的实时语音代理提示指南,把preamble设计和工具调用讲透了,做语音应用的开发者可以直接照着调。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)58

    OpenAI 如何大规模交付低延迟语音 AI

    OpenAI 重建了其 WebRTC 技术栈,以支持实时语音 AI 服务。新系统实现了低延迟、全球规模扩展和无缝的对话轮转。此次重构旨在为 ChatGPT 的语音模式等产品提供更流畅、更自然的实时语音交互体验,解决了大规模部署时面临的延迟与稳定性挑战。

    推荐理由:OpenAI 把语音 AI 的低延迟秘诀摊开了,做实时语音产品的可以看看他们的 WebRTC 优化思路,虽然不太能直接抄,但方向值得参考。

  4. François Chollet73

    我撰写《Deep Learning with Python》旨在成为理解深度学习工作原理及最佳应用方式的权威指南。数以万计的人通过这本书开启了职业生涯。已售出12万册,更有数百万人下载阅读。 现在可以免费在线阅读:https://deeplearningwithpython.io/

    推荐理由:Chollet 的《Deep Learning with Python》是无数人入行深度学习的启蒙书,现在免费在线阅读,新手不用再纠结买不买,直接看就完事了。

  5. Simon Willison 博客75

    Redis 数组类型交互式体验平台上线

    Redis创始人Salvatore Sanfilippo提交了为Redis新增数组数据类型的PR,引入了包括ARCOUNT、ARDEL、ARGREP等在内的18个新命令。其中最引人注目的是ARGREP命令,它利用新集成的TRE正则表达式库,可直接在服务器端对数组值进行正则搜索。目前该功能已在一个分支中实现,开发者Simon Willison借助Claude Code构建了一个交互式在线沙盒,通过运行在浏览器中的WASM版Redis子集,供用户体验这些新命令。Salvatore还撰文详细介绍了在AI辅助下开发此功能的历程。

    推荐理由:Redis 加数组类型可能改变很多缓存设计,Simon 这个 WASM playground 是把 PR 变成可试产品的最快路径,后端同学可以直接上手体会 ARGREP 的快乐。

5月2日周六
  1. 凡人小北77

    吴恩达(Andrew Ng)推出新课程《人人皆可的 AI 提示技巧》,旨在帮助不同水平的用户成为 AI 高级使用者。课程教授适用于 ChatGPT、Gemini、Claude 等工具的通用提示技巧,核心内容包括:利用深度研究模式生成复杂问题的详尽报告;为 AI 提供远超常人认知的丰富文档与图像上下文;在重要决策时让 AI 进行长时间深度思考;以及使用 AI 生成图像、分析数据、构建简单游戏和网站。课程还将剖析大模型的工作原理,帮助学员判断何时可信赖 AI 的答案。

    引用Andrew Ng@AndrewYNg

    2026年我们给AI写提示词的方式,与2022年ChatGPT刚问世时已大不相同。 我正在教授一门新课程《人人适用的AI提示词》(AI Prompting for Everyone),帮助你成为AI高效用户——无论你目前的水平如何。 课程涵盖适用于ChatGPT、Gemini、Claude及其他AI工具的技能。如何运用深度研究模式,针对复杂问题生成研究充分的报告。如何为AI提供恰当的上下文,包括大多数人不知道可以提供的更多文档和图片。何时该让AI花几分钟深入思考重要决策,比如买什么车、学什么专业、接受哪份工作。以及如何用AI生成图像、分析数据,并搭建简单的小游戏和网站。 我还会讲解这些模型底层运作的直觉,让你知道何时该信任一个答案、何时不该。 课程中,你会看到飞鼠、一个创造力测试、我的一些老家庭照片,还有烟花。 欢迎加入:http://deeplearning.ai/courses/ai-prompting-for-everyone

    推荐理由:吴恩达亲自下场教提示工程,从深度研究到让AI替你决策,覆盖了你没想到的那些用法,免费课程值得花两小时走一遍。

  2. Claude:Blog(网页)64

    零基础项目经理借助Claude Code,六周内独立开发并上线压力管理应用

    毫无编程经验的项目经理Kostiantyn Vlasenko,借助Claude Code在72小时内独立开发出压力管理应用Respiro,并于六周后成功上线苹果应用商店。该应用能通过手机实时检测用户压力信号,并即时引导呼吸练习。其架构由15个以上并行运作的专用子智能体构成,涵盖设计、开发、审查等模块。Claude协助完成了从技术选型、代码重构到苹果账号注册、服务集成乃至界面调试等一系列复杂操作,甚至支持了后续的市场推广工作。

    推荐理由:一个零编程经验的项目经理,用 Claude Code 六周做完压力管理 App 并上架。关键不在技术,而在「管人经验拿来管 AI agent」的思路,对非技术背景的创业者太有参考价值。

5月1日周五
  1. ChatGPT63

    一条针对GPT Image 2的特定图像生成提示词正在社交媒体上病毒式传播。该提示词的核心要求是:以最笨拙、潦草且极其糟糕的方式重绘所附图像,背景为白色,使其看起来像是用鼠标在MS Paint中绘制。生成效果需与原图似是而非,带有低质量像素感和令人困惑的别扭感,以突出其荒诞的“差劲”。推文引用者指出,这条提示词正引发疯狂传播。

    引用CHOI@arrakis_ai

    这个 GPT Image 2 提示词现在正疯狂刷屏。 “把附上的图片以最笨拙、最潦草、最可悲的方式重画一遍。用白色背景,让它看起来像是用鼠标在 MS Paint 里画的。它应该隐约相似但又不完全是,有点对得上但又以一种令人困惑、尴尬的方式偏掉,带着那种低质量的逐像素质感,真正强调出它有多荒唐地糟糕。其实,算了,随便吧,你想怎么画就怎么画。”

    推荐理由:这 prompt 把 GPT Image 2 从「精美」逼成了「小学生涂鸦」,是近期最有网感的玩法,做内容的可以直接抄。

  2. Claude:Blog(网页)64

    构建企业级AI智能体:领先企业的转型指南

    2025年数据显示,美国员工工作AI使用率已从2023年的20%升至40%。真正获得持续竞争优势的企业正将智能体AI深度嵌入工作流程,并将机构知识编码成可累积的系统。本指南以欧莱雅、Lyft和乐天为例,提出企业AI转型三大支柱:跨越“智能体思维鸿沟”、基于实际工作流程培训员工、在压缩信息密集型流程时保留人工判断,以及构建能创造收入的新产品能力。Claude Cowork平台为此提供了无需定制开发的团队级解决方案,并包含六个月的落地框架。

    推荐理由:从 L'Oréal、Lyft 这些案例看,企业怎么把 AI 智能体扎进业务流程,比泛泛而谈的 AI 转型文章实在得多。

  3. Claude:Blog(网页)64

    Claude Code 构建经验:提示缓存的优化实践

    Claude Code 团队分享了大规模优化提示缓存的核心策略。提示缓存基于前缀匹配工作,能显著降低延迟与成本,高命中率还能支持更宽松的订阅速率限制。关键实践包括:将静态系统提示和工具定义置于提示词前端以最大化共享前缀;通过消息而非修改提示词来传递更新信息,避免缓存失效;在会话中不切换模型、不增删工具,以维持缓存前缀稳定。此外,针对工具过多或“计划模式”等场景,可通过发送轻量存根或设计专用工具来规避缓存失效,从而在复杂功能中持续利用缓存优势。

    推荐理由:Claude Code团队把提示缓存的坑和优化方法全盘托出,从提示顺序、工具加载到压缩技巧,每一个经验都是钱和延迟换来的,做agent的同行可以直接拿去做架构参考。

  4. GitHub Blog59

    GitHub Copilot CLI 入门指南:交互模式与非交互模式

    GitHub Copilot CLI 提供了交互与非交互两种主要使用模式。交互模式允许用户通过对话式指令逐步构建和调整命令,适合探索性任务。非交互模式则支持直接输入完整指令快速执行,适用于自动化脚本或已知命令。理解这两种模式的区别能帮助开发者更高效地利用该工具,提升命令行工作效率。

    推荐理由:如果你总在 Copilot CLI 的交互和非交互模式之间犯迷糊,这篇官方教程算是清晰的速查手册,初学者花五分钟就能搞清楚。

4月30日周四
  1. Cursor Blog55

    持续优化智能体工具链:上下文演进与效果评估

    Cursor团队以构建软件产品的方式迭代优化其智能体工具链,核心围绕上下文窗口的演进。早期模型能力有限,工具链依赖大量静态上下文和防护机制;随着模型能力提升,团队已转向提供更多动态上下文获取方式并移除限制。评估改进效果采用线上线下结合:通过CursorBench等基准测试进行标准化质量评估,同时进行线上A/B测试,使用“代码保留率”和用户反馈语义分析衡量真实场景表现。团队持续监控并修复工具调用错误,以应对日益复杂的工具链状态。

    推荐理由:Cursor 这篇 agent harness 复盘是今年聊 agent 基础设施最好的文章之一,从上下文管理到多 agent 调度,全是实战迭代的血泪经验,做 agent 的团队该逐字读。

  2. OpenAI Developers63

    你完全可以构建网络应用

    引用dominik kundel@dkundel

    http://x.com/i/article/2049579443216338944

    推荐理由:OpenAI开发者官方转发了这篇‘直接构建web应用’的文章,说明这可能是他们认可的实践路径,对想用AI快速搭应用的开发者算是个值得收藏的参考。

4月29日周三
  1. Claude:Blog(网页)58

    智能体时代的产品开发:Claude Managed Agents 如何解放产品经理

    Claude产品经理Jess Yan分享了处于测试版的Claude Managed Agents如何改变其工作流程。这套可组合的API能大规模构建和部署云端智能体,使她能在短时间内将想法转化为可运行的原型。她的日常工作由此分流:使用Claude进行开放式探索,然后利用Claude Code基于Managed Agents编写定制智能体来自动化特定任务,如采用分析和舆情监控。这些智能体接管了以往难以规模化的操作性工作,让她能将更多时间投入到与团队和用户的创造性合作中。

    推荐理由:Anthropic PM公开用Claude Managed Agents搭建数据分析、舆情监控和演示生成agent的真实流程,对于想要用agent重构产品开发节奏的团队有实际参考价值,但不算爆炸性更新。

  2. Greg Brockman73

    一个很棒的Codex教程: 这些是7种知识工作能力... 在超级应用Codex内部 00:00 介绍 02:19 能力1 - 完整文件访问 07:41 能力2 - 持久记忆 10:46 能力3 - 插件 13:52 能力4 - 技能 19:22 能力5 - GPT图像访问 21:03 能力6 - 浏览器与计算机使用 23:58 能力7 - 自动化 25:31 额外功能 - 编年史 27:21 总结

    引用Riley Brown@rileybrown

    28 分钟学会 95% 的 Codex 这 7 项知识工作能力…… 就在 Codex 这个超级应用里 00:00 简介 02:19 能力 1 - 完整文件访问 07:41 能力 2 - 持久记忆 10:46 能力 3 - 插件 13:52 能力 4 - 技能 19:22 能力 5 - GPT 图像访问 21:03 能力 6 - 浏览器与计算机使用 23:58 能力 7 - 自动化 25:31 附加功能 - Chronicle 27:21 总结

    推荐理由:Greg Brockman 亲自推荐,Riley Brown 这个 28 分钟速览把 Codex 的 7 大能力拆得干净利落,想做复杂自动化的开发者看完就能直接上手。