跳到正文
北京时间

教程实践

拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。

417条精选相关主题AI 编码Agent 智能体产品更新

最新精选

第 381–400 条 · 共 417 条
12月4日周四
  1. Hugging Face:Blog(RSS)76

    利用Claude微调开源大语言模型的新途径

    Anthropic的研究人员探索了一种新方法:使用其强大的闭源AI助手Claude来生成高质量的指令遵循数据,并用这些数据对较小的开源模型(如LLaMA系列)进行监督微调。这项实验旨在展示如何利用尖端闭源模型的能力来指导和改进可公开访问的开源模型性能,从而推动AI技术的进步与民主化。

    推荐理由:用闭源模型蒸馏能力给开源模型,一条低成本微调的新路径值得关注

11月26日周三
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)75

    为长时运行智能体设计有效约束方案

    为解决AI智能体在跨越多上下文窗口执行长期任务时的“记忆丢失”与进展不一致问题,Anthropic为Claude Agent SDK开发了一套双重方案。该方案包含一个初始化智能体,负责在首次运行时建立基础环境并生成功能清单;以及一个编码智能体,负责在后续会话中进行增量开发并提交清晰可合并的代码。通过结构化的进度日志和Git历史等机制,引导智能体避免“试图一次性完成所有功能”或“过早宣布完成”的失败模式,从而实现跨会话的持续有效协作。

    推荐理由:Anthropic 把 Claude Agent SDK 跑长任务踩过的坑全摊开了,初始化 agent + 增量进度文件这套方案不复杂但极实用,做 Agent 产品的团队可以直接抄作业。

11月25日周二
  1. Hugging Face:Blog(RSS)76

    从第一性原理看连续批处理

    连续批处理是优化大型语言模型推理吞吐量的核心技术,通过并行处理多个对话并在生成完成后动态交换任务,以最大化硬件利用率。从注意力机制和KV缓存的基础原理出发,文章推导了如何通过优化批处理提升性能。注意力层具有二次复杂度,但连续批处理允许查询、键和值张量容纳不同长度的令牌序列,从而同时处理预填充和解码阶段。该技术能显著降低生成每个令牌的计算成本,适用于高负载服务场景,提升响应速度。

    推荐理由:深入理解LLM推理优化原理,助力高效模型部署。

  2. Hugging Face:Blog(RSS)83

    构建深度研究智能体:实现顶尖水平的经验

    Tavily团队因模型迭代重建了深度研究系统,核心是从工作流转向智能体架构,并聚焦上下文工程。通过Tavily Advanced Search进行上下文管理的网络检索,高效获取高相关度内容,避免信息过载。智能体设计模仿人类研究模式:收集信息、提炼要点、决策下一步,仅在生成最终交付物时引用原始资料,大幅减少令牌消耗,实现线性增长而非传统二次方增长。团队遵循简化编排逻辑、关注模型与工具优化方向、强化上下文工程等原则,以构建能随模型进化而持续改进的智能体系统。

    推荐理由:分享构建高效 AI 代理的实战技巧,优化上下文工程以提升性能。

11月17日周一
  1. Hugging Face:Blog(RSS)73

    使用Hugging Face轻松构建和共享ROCm内核

    Hugging Face的kernels库简化了高性能深度学习内核的构建与共享,支持CUDA、ROCm等多种后端。本文以ROCm兼容内核为例,展示如何利用kernel-builder工具构建、测试并共享内核。以RadeonFlow的GEMM内核为具体案例,该内核是针对AMD Instinct MI300X GPU优化的FP8块状矩阵乘法实现,采用e4m3fnuz浮点格式和每块缩放因子以保持低精度计算准确性,并在2025年AMD开发者挑战赛中获最高奖。指南涵盖项目设置、构建配置及通过kernels社区分享的完整步骤。

    推荐理由:AMD GPU开发者可快速上手构建高性能AI内核,提升部署效率。

11月12日周三
  1. Ethan Mollick:One Useful Thing(RSS)

    给AI一场工作面试

    AI建议愈发关键,亟需建立系统化评估机制。通过工作面试般的严格测试,全面检验AI的实际能力与可靠性,确保其建议值得信赖。

    推荐理由:Ethan Mollick 分享通过'工作面试'法系统评估 AI 能力的实用框架

  2. Claude:Blog(网页)

    通过 Skills 改进前端设计

    LLM 生成界面常因"分布收敛"而陷入 Inter 字体配紫色渐变的同质化设计。Anthropic 建议通过 Skills 功能解决:将排版、动画、配色等设计规范存入独立 Markdown 文件,Claude 可在构建页面时动态加载,无需永久占用系统提示词。这种按需加载机制既保持上下文窗口精简以维持模型性能,又能让 AI 生成摆脱默认审美、更具品牌辨识度的定制化界面。

    推荐理由:Claude官方分享通过Skills解决AI生成界面同质化问题的实践技巧,附字体与主题优化Prompt示例。

11月4日周二
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)74

    通过代码执行提升MCP智能体效率

    随着AI智能体通过模型上下文协议(MCP)连接的工具数量激增,传统预先加载所有工具定义并通过上下文传递中间结果的方法,导致处理速度变慢、成本增加。问题核心在于工具定义占用大量上下文空间,且中间结果(如完整会议记录)在多次工具调用间重复传递,额外消耗数万令牌。文章提出解决方案:将MCP服务器呈现为代码API,使智能体能按需加载工具,并在执行环境中处理数据,仅将精简结果传回模型,从而显著减少令牌消耗、提升效率并降低成本。

    推荐理由:Anthropic 官方把 MCP 从「能连」推进到「连多了怎么办」,用代码执行替代直接工具调用,token 省 98.7% 这个数字不是吹的。做 Agent 工程的人如果还在暴力塞 tool definition,这篇是必读的架构升级指南。

11月3日周一
  1. LMSYS:Blog(Chatbot Arena 团队)

    在 NVIDIA DGX Spark 上优化 GPT-OSS:实现本地大模型部署

    与 NVIDIA 合作,在 DGX Spark 上通过 SGLang 成功支持 GPT-OSS 20B 与 120B 模型,实现 20B 版本约 70 tokens/s、120B 版本约 50 tokens/s 的生成速度,达到目前最优水平。用户可通过 Docker 部署 SGLang 服务,接入 Open WebUI 实现本地聊天,或借助 LMRouter 转换请求格式以完全本地化运行 Claude Code。该方案使在 DGX Spark 上部署多百亿参数本地编码智能体成为现实。

    推荐理由:DGX Spark本地跑通Claude Code完全离线,隐私敏感开发者的新选择

10月30日周四
  1. Claude:Blog(网页)

    金融服务领域构建 AI 代理指南

    Claude 发布金融服务 AI 代理构建指南,分享 NBIM、Brex 等机构实践。NBIM 员工每周节省数百小时,McKinsey 研究显示欺诈检测生产力可提升 200% 至 2000%。AI 代理能自主整合多源数据、执行跨系统操作,在合规框架下处理客户服务与风险分析,将传统分析工具升级为可独立完成交易的自主系统。

    推荐理由:Anthropic官方分享金融AI智能体落地实践,含NBIM、Brex等真实案例与效率数据。

10月13日周一
  1. Answer.AI 官方研发博客(RSS)60

    Kerem Turgutlu 用 SolveIt 将 Karpathy 的 tokenizer 视频教程做成书章

    Answer.AI 的 Kerem Turgutlu 撰文讲解如何用 SolveIt 把 Andrej Karpathy 超两小时的 tokenizers 视频教程转成带可运行代码、超链接和图片的书章。

    推荐理由:作者完整复盘两阶段对话工作流,把超两小时视频转成可运行代码的书章,方法可直接迁移到任意长视频转写场景。

10月1日周三
9月29日周一
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)78

    为AI智能体实施有效的上下文工程

    随着AI应用从单次提示转向构建长期运行的智能体,焦点正从“提示工程”演进为“上下文工程”。后者旨在为大型语言模型优化有限的上下文窗口内的全部信息,包括指令、工具、外部数据和对话历史。其核心挑战在于模型存在“注意力预算”限制和“上下文腐化”现象——随着上下文增长,模型回忆信息的准确性会下降。因此,上下文工程要求精心编排高价值信息,以有限的资源最大化产出期望结果,这已成为构建高性能、可操控智能体的关键。

    推荐理由:Anthropic 亲自下场定义 context engineering 这个新范式,把 prompt engineering 之后的工程方法论讲透了。做 Agent 的人如果还在死磕 prompt,这篇会让你重新审视整个技术栈。

9月11日周四
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)73

    为智能体编写高效工具——与智能体协作

    文章探讨如何为基于大语言模型的智能体设计高效工具。核心方法是通过与智能体(如Claude Code)协作,采用快速原型构建和全面评估的迭代流程来优化工具性能。关键设计原则包括:选择适当的工具实现范围,使用命名空间明确功能边界,从工具向智能体返回有意义的上下文,优化响应以提高token效率,以及对工具描述进行提示词工程。工具本质上是确定性系统与非确定性智能体之间的新契约,设计应优先考虑智能体的使用体验,而非传统开发者导向的API思路,以扩大智能体解决实际任务的能力。

    推荐理由:Anthropic 把自家内部反复打磨的 agent 工具开发方法论完整公开了,从评估流程到 prompt 工程细节全是实操干货,做 MCP server 或 agent 工具链的人可以直接抄作业。

9月10日周三
  1. Thinking Machines Lab:官方博客(RSS)60

    破解LLM推理中的非确定性

    LLM推理的再现性是科学进步的基础,但即使在温度设为0的贪心采样下,ChatGPT等API以及vLLM、SGLang等自托管推理引擎仍无法保证确定性结果。常见的“并发+浮点非结合性”假设并不完整——GPU上重复执行相同矩阵乘法结果完全一致。真正原因在于:部分GPU内核是非确定性的,但LLM前向传播使用的内核均为确定性;推理服务器前向传播本身是确定性的,用户感知的非确定性源于浮点运算非结合性在不同聚合顺序下导致的细微数值差异。文章揭示了这一误解,并探讨如何实现真正可重现的LLM推理输出。

    推荐理由:Horace He 把 LLM 推理非确定性的锅从并发浮点转向 batch-size,并给出了可落地的 batch-invariant 内核实现,做推理部署和 RL 的工程师都该看看。

8月7日周四
  1. OpenAI Developers(RSS)64

    如何用 LM Studio 在本地运行 gpt-oss

    OpenAI 发布 Cookbook 教程,讲解如何在本地硬件上用 LM Studio 运行 gpt-oss。LM Studio 是一款在本地硬件运行大语言模型的桌面应用,教程将引导用户完成本地运行 gpt-oss 的步骤。

    推荐理由:OpenAI 官方 Cookbook 给出在本地硬件用 LM Studio 运行 gpt-oss 的完整步骤,可作为离线部署的操作参考。

8月5日周二
  1. OpenAI Developers(RSS)79

    如何用 Ollama 在本地运行 gpt-oss

    OpenAI 开发者发布教程,讲解如何用 Ollama 在本地硬件上部署 gpt-oss-20b 或 gpt-oss-120b 并选择合适的推理设置。

    推荐理由:来自 OpenAI 开发者官方的实操指南,读者可按步骤在自己硬件上用 Ollama 跑通 gpt-oss 两个规格模型。

  2. OpenAI Developers(RSS)60

    OpenAI Cookbook 教程:用 Hugging Face Transformers 微调 gpt-oss

    OpenAI 开发者 Cookbook 发布教程,讲解如何结合 gpt-oss 与 Hugging Face Transformers 进行微调。文章由 Edward Beeching、Quentin Gallouédec 和 Lewis Tunstall 撰写,并从大型推理模型(如 OpenAI o3)通过生成思维链提升准确性的背景切入。

    推荐理由:官方 Cookbook 教程给出用 Hugging Face Transformers 微调 gpt-oss 的具体路径,适合需要本地定制推理模型的开发者参考。

7月23日周三
  1. Modal 官方工程博客(RSS)69

    Modal 实测:用开源 ASR 模型将批量语音转写提速 100 倍、成本降 100 倍

    Modal 工程团队在平台上部署 NVIDIA parakeet-tdt-0.6b-v2 与 canary-1b-flash 开源 ASR 模型,对约一周(7×24 小时)ESB 基准音频做批量转写,结果比所测专有 API 快 112 倍或便宜 200 倍,且错误率略低,实现了一分钟内以 1 美元转写一周音频。

    推荐理由:原文给出可复现的批量转录优化方法与端到端实测数据,读者可以据此在自己的语音转写服务中权衡成本与吞吐。

7月14日周一
  1. OpenRouter:Announcements(RSS)56

    OpenRouter 模型现可在 Cursor 中使用:试试月之暗面 Kimi K2

    OpenRouter 宣布其灵活模型路由支持在 Cursor 中运行月之暗面的 Kimi K2。用户可直接在 Cursor 中调用 OpenRouter 路由的模型,无需额外配置。

    推荐理由:一篇将 OpenRouter 模型接入 Cursor 的实操指南,虽然已过时三百多天,但对想免配置用 Kimi K2 的 Cursor 用户仍有参考价值。