跳到正文
北京时间

教程实践

拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。

417条精选相关主题AI 编码Agent 智能体产品更新

最新精选

第 361–380 条 · 共 417 条
3月25日周三
3月24日周二
  1. Google Developers Blog(RSS)71

    跳跃即玩:利用Gemini与MediaPipe进行开发

    该工作流通过Gemini Canvas,借助高级提示词快速原型化MediaPipe Pose Landmarker等体感游戏机制。开发者可在Google AI Studio中优化原型,采用低延迟的“轻量”模型和稳定的追踪点(如肩部关节点)以确保游戏响应灵敏。最后,流程利用Gemini Code Assist将实验性代码重构为模块化、可用于生产的应用程序,使其能够支持多种多模态输入,从而显著简化了体感控制游戏的开发过程。

    推荐理由:开发者可快速上手AI游戏开发,优化性能并部署生产应用。

  2. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)75

    利用对抗网络灵感设计多代理架构,突破长时应用开发瓶颈

    作者受生成对抗网络启发,设计了一个包含规划器、生成器和评估器的三代理架构,以解决Claude在长时应用开发中的两大瓶颈。该架构通过上下文重置机制,有效克服了模型在长任务中的“上下文焦虑”问题;同时,通过分离生成与评估功能,使代理能依据具体标准进行迭代改进,而非盲目自评。这一方法成功使系统能在多小时的自主运行中生成完整的全栈应用程序,突破了此前提示工程和传统工具设计的性能上限。

    推荐理由:Anthropic 工程师把 GAN 的 generator-evaluator 思路搬进长时 Agent 架构,从设计到全栈编码都跑通了,还附了成本和失败模式。做 Agent 产品的人读完能直接抄作业,比看十篇论文管用。

3月23日周一
  1. Google Developers Blog(RSS)71

    使用 LlamaParse 与 Gemini 3.1 构建智能金融助手

    结合 LlamaParse 与 Gemini 3.1 模型,可从复杂的非结构化文档中提取高质量数据。该方案采用事件驱动架构,利用 Gemini 3.1 Pro 对密集的金融表格进行智能解析,并使用 Gemini 3.1 Flash 进行高性价比的摘要生成。开发者通过此教程可构建个人财务助手,将杂乱的经纪账户对账单转化为结构清晰、易于理解的分析报告。

    推荐理由:开发者可快速上手构建财务AI助手,将杂乱数据转化为结构化见解。

  2. Anthropic:Research(发表成果 · 网页)71

    利用长时运行智能体工作流革新科学计算

    Anthropic 研究员展示了如何将多日智能体编码工作流应用于科学计算任务。以使用 Claude Opus 实现宇宙学玻尔兹曼求解器的可微分版本为例,该任务通常需耗费研究人员数月甚至数年时间。通过制定清晰的项目指令、利用日志文件作为智能体的持久记忆并设置测试预言,即使是非领域专家也能引导智能体在数小时内完成这类复杂项目。该方法的核心在于设定高层目标后,让智能体团队自主工作,仅需偶尔人工监督,从而显著提升了科学代码开发与移植的效率。

    推荐理由:Anthropic 研究员用 Claude Opus 4.6 花几天从零写出了一个宇宙学 Boltzmann 求解器,原本是博士级团队几个月的活。这不是论文,是一份完整的多日 Agent 工作流实操手册,做科研或长周期编码的人可以直接抄作业。

3月22日周日
  1. Greg Brockman

    只要投入必要的思考与意图,GPT-5.4 就能产出相当出色的前端代码。OpenAI 开发者博客提供了详细的最佳实践指南。

    引用Sherwin Wu@sherwinwu

    如果你投入所需的思考和用心,你实际上能从 GPT-5.4 得到相当出色的前端!在这里查看一些最佳实践: https://developers.openai.com/blog/designing-delightful-frontends-with-gpt-5-4

    推荐理由:OpenAI官方发布GPT-5.4前端开发最佳实践,Greg Brockman背书推荐

3月21日周六
  1. Hugging Face:Blog(RSS)70

    一日之内构建领域特定嵌入模型

    英伟达在Hugging Face平台发布技术博客,分享了一种在24小时内快速构建高质量领域特定嵌入模型的方法。该方法通过结合高效微调技术与领域数据,显著提升了模型在专业任务中的语义理解与检索性能,为企业和开发者提供了低成本、高效率的定制化嵌入解决方案。

    推荐理由:一天内搞定领域专属 Embedding 微调,RAG 检索效果可显著提升

3月18日周三
  1. Google Developers Blog(RSS)81

    开发者AI代理协议指南

    一套包含MCP、A2A等六种协议的新工具集正式发布,旨在通过标准化AI代理的数据访问与通信方式,消除定制集成代码的需求。以“厨房管理员”代理为例,这些协议能实时核查库存、通过UCP进行批发交易,并借助AP2完成安全支付授权。开发者使用Agent开发套件(ADK)还可实现A2UI与AG-UI,为用户提供交互式仪表板与无缝流式界面。

    推荐理由:开发者能快速掌握AI代理通信标准,提升集成效率。

3月12日周四
  1. LlamaIndex:产品、工程与评测67

    LlamaIndex 解析为什么让 AI 读 PDF 这么难

    LlamaIndex 发文解释 AI 智能体读 PDF 难的根本原因:PDF 源自 1982 年的 PostScript,只存绘图指令而非字符,文本编码、表格、图表和阅读顺序都需要启发式推断。

    推荐理由:文章从 PDF 格式底层设计讲清解析困难的根源,并给出文本提取与视觉模型结合的可迁移架构思路。

3月5日周四
  1. Hugging Face:Blog(RSS)73

    将机器人AI引入嵌入式平台:数据集记录、VLA微调与设备端优化

    NXP在Hugging Face发布技术博客,详细介绍了将视觉语言动作模型应用于嵌入式机器人系统的完整流程。核心工作包括构建真实世界的机器人交互数据集,对VLA模型进行针对性微调,以及实施一系列设备端优化以实现高效部署。该方案旨在解决大型模型在资源受限的嵌入式硬件上运行的挑战,推动机器人AI在边缘端的实际应用。

    推荐理由:嵌入式AI开发者可掌握从数据集记录到设备端优化的全流程实践。

3月4日周三
  1. Hugging Face:Blog(RSS)70

    PRX 第三部分 —— 24小时内训练一个文本到图像模型!

    Photoroom团队在Hugging Face上发布博客,宣布成功在24小时内完成一个文本到图像模型的训练。这一突破将此类模型的典型训练周期从数周大幅缩短至仅一天。实现的关键在于采用了名为PRX的高效训练方法,该方法优化了计算资源分配与数据处理流程。此举显著降低了模型训练的时间与成本门槛,为快速迭代和部署高质量的图像生成AI模型提供了新的可能性。

    推荐理由:Photoroom 分享 24h 内训练文生图模型的实战路径,想快速复现的团队可直接参考

2月27日周五
  1. Cognition 模型 / Devin 博客(网页)67

    Cognition 如何用 Devin 开发 Devin

    Cognition 发文介绍其从创立起就用 Devin 构建 Devin,上周合并了 659 个 Devin PR,高于 2025 年最好一周的 154 个。文章覆盖全接口使用(web、Slack、Linear、CLI、API)及 Ask Devin 代码问答、Devin Review 自动代码审查、每日设计系统审计、!

    推荐理由:Cognition 以当事方身份披露用 Devin 开发 Devin 的完整工作流,上周合并 659 个 Devin PR,读者可对照自身团队借鉴具体用法。

2月25日周三
  1. OpenAI Developers(RSS)73

    OpenAI 发布 gpt-5.3-codex 提示词指南

    OpenAI 发布 Codex 模型提示词指南,API 上的 Codex 调优模型为 gpt-5.3-codex,推荐用 medium 推理力度平衡智能与速度,复杂任务可用 high 或 xhigh。

    推荐理由:官方为 gpt-5.3-codex 给出完整提示词与工具迁移指南,覆盖并行调用、compaction 和 phase 参数等可落地的集成细节。

2月19日周四
  1. Modal 官方工程博客(RSS)64

    Ramp 如何基于 Modal 构建后台编码智能体 Inspect

    Ramp 基于 Modal Sandboxes 构建内部后台编码智能体 Ramp Inspect,目前启动了 Ramp 超过一半的已合并 pull request,其中超过 80% 的 Inspect 代码由其自身编写。

    推荐理由:原文给出 Ramp Inspect 的架构细节、启动优化方式和采用数据,读者可借鉴后台编码智能体的落地方案。

2月18日周三
  1. Ethan Mollick:One Useful Thing(RSS)

    Agentic 时代 AI 选择指南

    Agentic 时代 AI 不再只是聊天机器人,而是能自主执行任务的智能体。面对 Claude、GPT、LLaMA 等模型,需根据代理能力、任务类型和生态集成重新评估选择策略。

    推荐理由:AI 大咖 Ethan Mollick 撰写 Agent 时代实用选型指南

2月3日周二
1月27日周二
  1. Hugging Face:Blog(RSS)83

    解锁GPT-OSS的智能体强化学习训练:一项实践回顾

    LinkedIn团队探索了将GPT-OSS模型作为智能体应用核心进行强化学习的可行性。实验发现,由于GPT-OSS采用的混合专家架构在两次前向传播中可能产生路由差异,导致在同策略PPO训练中出现重要性采样比率偏离、KL散度爆炸及奖励不增长的问题。团队通过一个关键修复——在同策略条件下强制将旧对数概率设置为新计算值(并分离梯度),确保了重要性采样比率为1,从而恢复了PPO同策略训练的完整性。该修复方案适用于GPT-OSS-20B及GPT-OSS-120B模型。

    推荐理由:为MoE模型RL训练提供实用调试方案,提升代理AI开发效率。

1月9日周五
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)75

    揭秘AI智能体评估:构建可靠系统的关键

    有效的评估能帮助团队更自信地发布AI智能体,避免陷入仅在生产环境被动发现问题、修复可能引发新问题的循环。智能体因其多轮操作的自主性与灵活性,评估更为复杂。一个完整的评估结构包含任务、评分器、记录、结果、评估框架与评估套件等核心组件。缺乏系统评估将导致团队无法区分真实的质量倒退与随机波动。建立评估体系能帮助团队在智能体规模化过程中持续监控质量、自动测试变更并量化改进效果,其价值在智能体整个生命周期内持续累积。

    推荐理由:Anthropic 把内部踩过的坑全摊开了,从 eval 设计到 grader 选型到 transcript 审读,是目前最完整的 Agent 评估工程指南,做 Agent 产品的团队可以直接当手册用。

12月24日周三
  1. OpenRouter:Announcements(RSS)55

    可蒸馏模型与合成数据管道:使用 NeMo Data Designer

    介绍如何利用 NeMo Data Designer 构建许可安全的合成数据工作流,用于模型特化(model specialization)。该管道支持生成可蒸馏模型所需的高质量合成数据,确保数据来源合规,适用于下游微调与领域适配场景。

    推荐理由:虽然发布快半年了,但教程讲的是如何用 NeMo Data Designer 构建 license-safe 的合成数据管道,对正在搞模型蒸馏和微调的开发者依然有参考价值,细节够实操。