跳到正文
北京时间

教程实践

拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。

417条精选相关主题AI 编码Agent 智能体产品更新

最新精选

第 261–280 条 · 共 417 条
5月29日周五
  1. 公众号:通义实验室(千问)64

    通义实验室发布教程:在 Android 手机部署 MCP 感知服务器

    通义实验室发布教程,演示如何在 Android 手机上部署 MCP 感知服务器,使手机具备本地视觉与听觉分析能力。核心基于端侧 MNN 推理引擎和 Qwen3-VL 2B 模型(约 1.3GB),摄像头与麦克风采集的音视频在本地实时转化为结构化 JSON,再通过 MCP Tool 供 Claude Code 等云端 Agent 远程调用。整个过程不上传原始数据,仅传输语义提取结果。项目已开源,实测可识别红绿灯状态等场景。

    推荐理由:如果你做Agent总觉得AI对物理世界是瞎子,这篇教程就是解药。把Qwen3-VL塞进手机当本地眼睛,不传原始视频只给结构化文字,隐私友好又能被Claude直接调用。

  2. LMSYS:Blog(Chatbot Arena 团队)61

    LMSYS与Intel合作通过异构CPU+GPU EPD架构提升视觉语言模型服务性能

    LMSYS团队(Intel与SGLang)通过Dynamo和SGLang框架,为视觉语言模型(VLM)启用了异构编码-预填充-解耦(EPD)架构。该方案将视觉编码任务从GPU卸载至CPU(如Intel Xeon 6747P),与GPU协同工作。在Qwen3-VL-8B-Instruct模型的测试中,采用4 CPU + 1 GPU作为编码器、4 GPU作为预填充解码器(能力比R=12)的配置,在ISL/OSL 128/256、1080p 8张图像的负载下,实现了P99 TTFT和请求吞吐量约1.2倍至1.3倍的提升,并将P99 TPOT降低了约1.3倍至30倍。

    推荐理由:做VLM服务部署的可以认真看一下,用CPU头节点做异构EPD分离,几乎零成本换来了TTFT和TPOT的显著提升,有完整脚本和benchmark,能直接上手试。

5月28日周四
  1. Google Developers Blog(RSS)64

    社区如何利用Tunix和TPU训练Gemma学会“思考”

    Google在Kaggle举办的Tunix黑客马拉松,挑战开发者利用TPU和有限算力,将小型基础模型转变为通用推理引擎。获胜团队通过多阶段后训练流程实现了这一目标,该流程结合了监督微调(SFT)与GRPO、SimPO等先进对齐技术。比赛结果表明,社区能够借助开源资源成功训练出高能力的结构化推理模型。

    推荐理由:Google 官方比赛总结,证明用 Kaggle TPU 和开源工具就能把 Gemma 训练出不错推理能力,对想自己微调模型的小团队是个实用参考。

  2. MarkTechPost(RSS)70

    pgvector驱动的语义、混合、稀疏与量化向量搜索系统构建编码指南

    本教程在Google Colab中构建一个完整的pgvector实验环境,展示PostgreSQL如何作为向量数据库服务于现代AI应用。内容涵盖安装PostgreSQL、编译pgvector扩展、通过Psycopg建立连接,并注册向量类型以实现与Python的平滑集成。最后使用SentenceTransformers创建并存储嵌入向量。

    推荐理由:这份教程把 pgvector 的稀疏向量、量化搜索等高级功能打包成 Colab 代码,用 PostgreSQL 做向量数据库的团队可以直接复制粘贴跑起来。

  3. Claude:Blog(网页)77

    使用大语言模型保障源代码安全

    本文分享了使用 Claude Opus 构建威胁模型、发现代码漏洞并进行验证、分类和修复的最佳实践。其核心流程是一个六步循环:威胁建模、沙箱隔离、漏洞发现、验证、分类和修复。作者指出,漏洞发现现在易于并行化,瓶颈已转移到后续的验证与处理阶段。以他们对开源软件的扫描为例,截至2026年5月22日已披露1,596个漏洞,其中97个已修补。指南建议结合代码库文档和专家访谈来构建准确的威胁模型,以降低误报,提升发现的可利用性。

    推荐理由:Anthropic把这套用Claude扫代码漏洞的方法全公开了,1596个已披露漏洞,验证成了最大瓶颈,安全工程师的饭碗可能要重新定义。

  4. Claude:Blog(网页)67

    AI智能体的零信任安全框架

    Anthropic 发布了针对企业部署自主 AI 智能体的安全框架,指出前沿大语言模型正将漏洞利用周期从数月压缩至数小时。部署智能体面临双重风险:基础设施易受 AI 加速攻击,且智能体自身具备自主决策与执行能力。文章提出一个三层零信任架构(基础、高级、优化级)及八阶段实施流程,并概述了提示注入、工具投毒、记忆投毒等特有威胁。

    推荐理由:当漏洞利用从数月压缩到数小时,安全架构必须同步进化。这篇框架把零信任落地到Agent场景,八阶段路线图和三级成熟度模型比泛泛的安全声明具体得多,企业安全团队值得细读。

  5. Hugging Face:Blog(RSS)72

    Reachy Mini 实现完全本地化语音交互

    Reachy Mini 机器人现可通过 `speech-to-speech` 库实现完全本地化的语音交互,无需依赖云端。该方案采用级联流水线架构,对外提供 Realtime API 兼容的 WebSocket 接口。默认组件包括 Silero VAD 用于语音活动检测、Parakeet-TDT 作为语音转文本模型、通义千问(Qwen3-TTS)作为文本转语音模型。大语言模型推荐使用 llama.cpp 运行 Gemma 4。所有数据均在本地处理,保障了隐私且无 API 费用。

    推荐理由:小众硬件的本地语音实战,但HF这套开源管线证明端到端对话已完全可用,所有组件都可自由替换,想做本地化语音助手的人可以照抄。

  6. Greg Brockman66

    OpenAI Codex 新增了“Meeting Recorder”技能。该技能可使用 GPT Realtime Whisper 端点实时转录会议并显示文本。用户可在转录过程中随时向 Codex 提问。会议结束后,会提供完整的转录内容及格式化版本。此功能基于实时 API,费用为 $0.017/分钟。相关代码与说明可在 GitHub 链接中查看。

    引用Simon Smith@_simonsmith

    你现在可以使用 Codex 实时转录会议,并在会议进行过程中向 Codex 提问! 我更新了我的新 Codex Meeting Recorder 技能,使其使用 GPT Realtime Whisper。告诉 Codex 使用该技能,它就会开始转录并在预览窗格中显示。你可以在转录生成过程中就转录内容提问。会议结束后,告诉 Codex 结束,你就会得到完整的转录文本和一个格式化版本(格式化版本还需要改进;已在我的待办清单上)。 请注意,由于这使用的是 GPT Realtime Whisper 端点,它比在会议结束时再转录更贵,每分钟 $0.017(所以一场 30 分钟的会议大约 $0.51)。我正在考虑未来添加一个本地实时选项,比如使用 Nemotron Speech Streaming。 GitHub 链接在帖子串中,还有一些说明。

    推荐理由:Greg 转发的这个 Codex 技能把实时会议转录和问答直接塞进了编辑器,0.5 美元一场会,做会议纪要的可以立刻用起来。

5月27日周三
  1. Hugging Face:Blog(RSS)61

    TRL 新增 Delta Weight Sync:通过 Hub Bucket 传输权重变化,每步从 1.2 GB 降至 20–35 MB

    异步强化学习中,训练器每步需将完整模型权重(如1T参数checkpoint约1 TB)传输给推理引擎。TRL新增PR利用相邻RL优化步骤间约99%的bf16权重比特相同的特点,仅将变化的权重编码为稀疏safetensors文件,上传至Hugging Face Bucket并通知vLLM获取。在Qwen3-0.6B上,每步传输从1.2 GB降至20–35 MB。实验还展示了完全分离的训练场景:训练器、vLLM和Wordle环境分别位于不同机器和Hugging Face Space中,权重通过单个Hub bucket流动,无需共享集群、RDMA或VPN。

    推荐理由:异步RL训练中权重同步的瓶颈被HuggingFace用稀疏增量方案解决了,带宽直接省了两个数量级,还给了可运行的TRL分支,做RL训练的可以直接上手试。

  2. OpenAI:官网动态(RSS · 排除企业/客户案例)56

    使用 Codex 构建自改进税务智能体

    OpenAI、Thrive 与 Crete 合作,使用 Codex 构建了一个自改进的税务智能体。该智能体能够自动处理报税流程,提升工作准确性并加速整体工作流。

    推荐理由:OpenAI 联合 Thrive 把 Codex 塞进税务流程,做出了能自我纠错的申报 agent,金融自动化的同学可以看看他们的错误反馈循环怎么设计的。

  3. 公众号:数字生命卡兹克65

    从0到1速通OpenAI Codex:安装、设置与实操教程

    近日OpenAI的AI智能体Codex热度飙升。教程涵盖完整使用流程:从官网下载安装,支持从Claude Code和Cowork一键导入配置;界面分对话区和项目区,权限可选默认、自动审查或完全访问;模型推荐GPT-5.5,推理等级用高或超高,速度可选快速(1.5倍速度、2倍token消耗)或标准;建议开启引导模式、记忆功能,并设置全局AGENTS.md规则(卡帕西模板);通过Skills和插件管理扩展能力;演示了开发网页(使用计划模式、批注功能圈选修改)和开发用药提醒App(需安装Xcode编译到手机)。

    推荐理由:如果你还在观望要不要入坑Codex,这篇保姆级教程把安装、设置、开发网页到打包APP全流程踩了一遍,那个@Computer Use帮你装Xcode的操作一看就懂,想动手的现在就能跟做。

  4. Google AI75

    Google 发布了其多模态模型 Gemini Omni 的视频生成功能使用指南。该模型可通过 Gemini 应用、Google Flow 等平台体验。指南包含五项提示词技巧:利用模型已有的现实世界知识进行简洁描述;精确控制文本在视频中的渲染与排版;使用专业镜头指令(如推拉摇移)像电影摄影师一样调度画面;通过迭代编辑高效修改视频;以及在生成中直接调整角色的动作节奏或情绪。其核心在于通过精准的提示词引导模型生成复杂且可控的视频内容。

    推荐理由:Google 官方放出的视频提示技巧,没有废话全是可复制的 prompt,想玩 Gemini Omni 的创作者可以直接抄作业。

5月26日周二
  1. Elon Musk67

    xAI发布了面向非技术背景的SuperGrok和X Premium+用户的Grok Build入门视频教程。教程提供了分步指南,核心内容包括:通过一条命令快速安装Grok Build;利用其创建真实的网站;使用内置的Grok Imagine工具自动生成图像与视频;以及在不同文件夹中同时运行多个项目。整个过程无需任何编程经验,并且Grok可以协助执行命令。

    引用Dan@Daniel_Farinax

    初学者视频:如何安装和使用 Grok Build(专为非技术背景的 SuperGrok 和 X Premium+ 用户制作) 朋友们问了我太多问题,所以我做了这个简单的分步指南。 你将清楚地看到如何: • 用一条命令在几秒内安装 Grok Build • 创建真正的网站 • 使用 Grok Imagine 自动生成图片和视频 • 在不同文件夹中同时运行多个项目 Grok 甚至会替你运行命令。无需任何编程经验。 观看完整演示 👇

    推荐理由:Elon 亲自转发的教程把 Grok Build 门槛压到了零编码,直接面向普通用户,是目前最友好的官方入门信号。

  2. Hugging Face:Blog(RSS)58

    Harness、Scaffold 与 AI 智能体术语辨析

    本文旨在厘清 AI 智能体领域中易混淆的关键术语。文章指出,模型(如 Claude、GPT)本身是无记忆、无循环的大语言模型。其行为由“Scaffolding”(行为定义层,如系统提示、工具描述)塑造,而“Harness”(执行层)负责调用模型、处理工具调用与控制循环,是智能体运行的核心。两者结合,模型才能成为智能体。文章以 Claude Code、Codex 为例,说明同一模型搭配不同 Harness 会产生迥异体验,并提出了 Agent = Model + Harness 的常见理解框架。术语尚未统一,本文旨在提供一个实用的心智模型。

    推荐理由:Agent圈术语混乱的文章很多,但HF这篇把harness、scaffold、context engineering的关系讲得最透,做agent开发的读完至少能少吵一半的架。

5月25日周一
  1. Greg Brockman86

    这是一个结构化的提示词,用于指导 Codex 自动分析其历史记录以识别并固化重复工作流。该框架要求 Codex 回顾会话、Memories 等数据,找出重复、耗时且有明确复用价值的任务。筛选标准包括至少出现两次、输入稳定、可提升效率等。最终,Codex 应以“技能”、子智能体或自动化工具等最小实用形式创建或扩展现有资产,避免冗余。流程包括生成候选清单、执行创建,并汇报结果与待验证项。

    引用Vaibhav (VB) Srivastav@reach_vb

    更新:根据反馈,我想出了一个更好的提示词版本 让 Codex 查看你的会话、Memories 和 Chronicle,识别模式,复用已有的内容,只创建最小可用的 skill、subagent 或自动化。 "回顾我最近 30 天的工作,如果可用历史更短则回顾全部可用历史,找出值得打包的重复性手动工作流。 按以下顺序使用可用证据: - 最近的 Codex 会话和任务摘要。 - Codex Memories 和 rollout 摘要,以发现跨会话重复出现的模式。 - Chronicle(如果已启用),以发现 Codex 之外的重复性工作。仅将 Chronicle 用于发现;尽可能在相关源系统中确认重要细节。 - 现有的 skills、自定义 agents 和自动化,以便复用或扩展已有的内容,而不是重复创建。 广泛寻找那些重复、耗时、易出错、上下文繁重或能从一致流程中受益的工作。包括编码、研究、写作、规划、沟通、运营、分析和个人事务方面的工作流。 仅当候选对象满足以下条件时才采取行动: - 至少出现过两次,或明显可能重复出现且重复成本高昂; - 具有稳定的输入、可重复的流程,以及明确的输出或停止条件; - 能实质性提升速度、质量、一致性或可靠性; - 尚未被充分覆盖。 选择最小的合适形式: - Skill:可复用的工作流或操作手册。 - 自定义 subagent:适合委派的有界专家角色或调查任务。 - 自动化:定时或周期性的检查、报告、提醒或监控。 - 跳过:过于一次性、模糊、敏感或证据不足而无法打包的工作。 首先产出一份简洁的候选清单,包含: - 重复的工作流 - 支持性证据和日期 - 频率/置信度 - 推荐形式:skill、subagent、自动化、扩展现有内容或跳过 - 为什么值得或不值得创建 然后只创建高置信度且缺失的项目。保持它们范围狭窄、实用、感知来源且易于验证。不要创建推测性、重叠或过于宽泛的资产。 最后总结: - 你创建或扩展了什么 - 你刻意跳过了什么 - 在打包之前还需要更多证据的内容

    推荐理由:GDB 这个 prompt 把 Codex 从写代码的帮手变成了你的私人效率教练,让它自己找出你过去一个月里哪些重复工作该自动化,深度 Codex 用户直接抄作业就行。

5月24日周日
  1. Boris Cherny78

    人们常问我,用好Claude Code的最大技巧是什么。 如今我的头号技巧是:使用自动模式。 自动模式意味着不再有权限提示。它是实现“多Claude并行”的关键构件:启动一个会话,然后在其运行时,并行处理另一个会话。

    引用ClaudeDevs@ClaudeDevs

    自动模式的两项更新: · 现已在 Pro 套餐中可用 · 除 Opus 4.7 外,现也已支持 Sonnet 4.6 按 Shift+tab,让 Claude 运行。

    推荐理由:Boris 透底 Claude Code 最高效用法,auto mode 免确认弹窗、支持并行 session,把 AI 编程从串行变并行,值得一开。

5月23日周六
  1. swyx78

    Kakuna是一款AI代理工具,旨在将早期快速原型自动转化为可维护的生产级代码库。它通过内置的检查清单和“计划-目标”工作流,模拟人类开发与运维流程,在保持功能不变的前提下,自动执行代码审查、测试补充、重构等“无聊”工作,并强调子代理并行以提升效率。该工具是为“人类与代理协作”而设计的范例,其核心是“反熵增”与“反代码腐化”。例如,一次约16小时的运行能生成上百次提交,将一个脆弱的MVP转变为一个结构清晰、可长期构建的稳定项目。

    引用swyx@swyx

    正在开发一个“把这个 vibecoded 垃圾应用变成一个生产就绪、端到端测试、可维护、可并行化的 agent 仓库”的技能。 这东西昨天跑了大约 16 个小时,总共做了 103 次提交,最后我得到的还是完全一样的应用,但它不再是脆弱的 MVP,现在看起来像一个我真的可以长期在其上构建的代码库了

    推荐理由:如果你还在为 vibe coding 产出的屎山头疼,swyx 这个 skill 刚开源,16 小时自动重构 103 次提交交付一个可维护的代码库,做独立开发的很值得抄一下。

5月22日周五
  1. Hacker News 热门(buzzing.cc 中文翻译)73

    如果你是LLM,请阅读这篇文章——安娜的博客

    博客作者安娜于2026年5月22日发布了一篇面向大型语言模型(LLM)的文章。文章标题为“如果你是一个LLM,请阅读这篇文章”,并在Hacker News平台获得117个积分。文章链接指向 annas-archive.gl 域名下的博客页面。

    推荐理由:llms.txt 1.1 加上了分块和多语言标记,如果网站还在用v1,可以照这个更新,对LLM爬虫更友好,做SEO和AI抓取的必看。