跳到正文
北京时间

教程实践

拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。

417条精选相关主题AI 编码Agent 智能体产品更新

最新精选

第 241–260 条 · 共 417 条
6月4日周四
  1. Claude:Blog(网页)68

    Claude Code技能使用经验:Anthropic内部实践

    Anthropic 分享了内部使用 Claude Code 的 Skills(技能)功能的经验。Skills 是指令、脚本和资源的文件夹,智能体可发现并调用它们以提升准确性和效率。Anthropic 内部已有数百个活跃使用的技能,它们可归为九类,包括库和 API 参考、产品验证、数据获取与分析、业务流程与团队自动化、代码脚手架与模板、代码质量与审查等。最佳技能专注于单一类别,涵盖过多功能会混淆智能体。团队发现,投入时间优化验证类技能对 Claude 输出质量的提升最显著。

    推荐理由:这不是产品公告,而是从几百个内部技能中血泪总结出的实战手册。如果你想让Claude Code真正变成你的工程副驾驶,这9类技能和‘gotchas’章节至少省你三个月踩坑。

  2. Claude:Blog(网页)73

    Anthropic 用 Claude 赋能自助数据分析

    Anthropic 使用 Claude 自动化了 95% 的业务分析查询,整体准确率约 95%。其关键在于构建智能体分析栈(agentic analytics stack),通过数据基础层、维护验证流程和技能(skills)分别解决概念-实体歧义、数据过时和检索失败三大错误来源。相比编码场景,数据分析的难点在于将用户问题映射到正确的数据实体,而执行 SQL 反而是简单的。Anthropic 的数据科学团队因此得以专注于因果建模、预测和机器学习等战略工作。

    推荐理由:Anthropic 把内部用 Claude 搞自助分析踩过的坑全摊开,技能模板和「语义层优先」的强制流程是实打实的干货,做数据 agent 的团队可以直接抄作业。

6月3日周三
  1. Hugging Face:Blog(RSS)55

    DharmaOCR 利用 DPO 将文本退化率降低 59.4%

    4月发布的DharmaOCR(结构化OCR模型)在巴西葡萄牙语文档提取任务中,使用直接偏好优化(DPO)作为监督微调(SFT)后的第二训练阶段。SFT无法直接惩罚文本退化(重复循环),而DPO以模型自身失败输出(退化循环)作为负样本进行偏好训练,使所有测试模型族的文本退化率平均降低59.4%,最高达87.6%(如Nanonets-OCR2-3B从1.61%降至0.20%)。传统DPO多用于聊天对齐,该工作将其扩展至客观的OCR任务,证明DPO可针对性修复特定失败模式。

    推荐理由:DPO 不只能对齐,这篇直接用模型自身的垃圾输出当反例,把 OCR 的重复错误平均降了 59%。思路不复杂,但告诉做结构化生成的工程师:训练数据里最该保留的就是模型犯的错。

  2. 公众号:数字生命卡兹克63

    提前触发窗口让 Codex/Claude Code 额度翻倍的小技巧

    Codex 和 Claude Code 的额度限制基于 5 小时滚动窗口:从发送第一条消息开始计时,窗口结束后不会自动重置,需等下次发消息才开启新窗口。提前数小时发送一条短消息,可使重置时间落在工作时段内,从而在核心工作时间获得两个完整窗口。设置方法:Codex 在左侧“自动化”中建每日定时任务;Claude Code 可通过客户端 Routines 或 CLI 版 crontab 配置。注意 5 小时窗口之上还有周额度上限,需合理规划。

    推荐理由:一个很小的窗口重置技巧,但能让你在核心工作时段多拿一倍额度,做 Agent 开发的直接抄自动化设置就好。

  3. SiliconFlow67

    @karpathy 的 llm-wiki 在几周内获得了 5,000+ 颗星。 其理念是:停止在每个会话中重新发现知识。让一个大语言模型构建并维护一个维基,每次使用时它都会变得更智能。 以下是如何使用 @opencode + @justsisyphus OMO + SiliconFlow 构建你自己的版本 🧵

    推荐理由:把 karpathy 的 llm-wiki 创意拆成了可复制的 recipe,跟着教程用 SiliconFlow + opencode + OMO 就能搭一个自进化的知识库,相当实用。

  4. 公众号:火山引擎64

    Vibe Creating:让创作回归「表达」本身

    火山引擎 Seedance 2.0 提出 AI 视频创作新范式 Vibe Creating,核心是让创作者放下技术负担,用故事表达代替复杂 Prompt 参数。该范式强调用富有画面感的语言描述场景、情绪和叙事,模型自行理解意图并完成景别、光影、节奏的诠释,避免过度规定镜头调度。适用于文学作品可视化、影视预演等场景,并配套发布《Vibe Creating 实践手册》及可执行的 Prompt Skill,从创意到高质量提示词一步到位。

    推荐理由:火山引擎把 Seedance 2.0 的用法提炼成「Vibe Creating」方法论,核心是教人用故事感代替镜头术语,虽然不涉及模型升级,但附带可直接套用的手册和 Skill,做 AI 短视频的可以当成 Prompt 指南。

  5. 公众号:数字生命卡兹克66

    Claude Code团队工程总监分享5条AI原生工作原则

    Claude Code团队工程总监Fiona Fung提出,AI时代软件工程瓶颈从“写代码太贵”转移至验证、评审与安全。团队采用JIT规划,先做原型再补文档;遇到重复工作追问“能否自动化”,形成肌肉记忆。代码评审中Claude承担60-70%风格检查与漏洞捕捉,人类聚焦法律、安全与产品判断。角色边界模糊,PM写代码、工程师用Claude起草文案,招聘看重品味与判断力而非代码产出速度。

    推荐理由:瓶颈从写代码转移到验证,这判断太准了。更实际的是自动化那些重复三次以上的事,这套逻辑正在Claude Code团队验证,值得每个带团队的人照抄。

  6. vLLM 官方博客(RSS)61

    vLLM 与 DeepLearning.AI 推出免费课程《Fast & Efficient LLM Inference with vLLM》

    vLLM 与 Red Hat、Andrew Ng 的 DeepLearning.AI 联合推出免费课程《Fast & Efficient LLM Inference with vLLM》,约 1.5 小时,含 9 节视频和 3 个 JupyterLab 动手实验。

    推荐理由:课程覆盖压缩、部署、基准测试全流程,用可视化讲清 KV cache 和量化原理,并配三个可动手的实验。

6月2日周二
  1. Together AI 研究与产品博客(RSS)64

    Together AI 解析如何高效 Serving MiniMax M3,实现 1M 上下文与多模态推理优化

    Together AI 宣布成为 MiniMax M3 的首选云合作伙伴,并将在 M3 以开放权重发布后为开发者提供托管端点。

    推荐理由:作为 MiniMax M3 的首选云合作方,作者拆解了自家推理团队的稀疏注意力内核、分页注意力集成与网关级多模态预处理等优化手法,含可借鉴的工程细节。

6月1日周一
  1. OpenRouter75

    视频教程:如何构建一个每周预算上限为1000美元的智能体,包含模型拒绝列表与自定义数据保留 使用了新的、可堆叠的护栏架构: [引用 @OpenRouter]:OpenRouter 上的护栏是市场上最强大的:为您的 AI 流量提供集中式安全与治理 预算限制、ZDR、模型与提供商限制、提示词注入防御以及 DLP / 敏感信息检测,分层为您控制的规则!🧵

    引用OpenRouter@OpenRouter

    OpenRouter 上的 Guardrails 是市场上最强大的:为你的 AI 流量提供集中式安全与治理 预算限制、ZDR、模型与提供商限制、提示注入防御,以及 DLP / 敏感信息检测,分层融入你掌控的规则中!🧵

    推荐理由:如果你在跑 agent 并担心成本爆炸,OpenRouter 这个教程手把手教你设预算上限和注入防御,抄完就能上线,别再裸奔了。

  2. Hacker News 热门(buzzing.cc 中文翻译)70

    我花200英镑把一台数据中心级GPU装进了我的游戏电脑

    一名用户以200英镑的价格购入了一块数据中心级GPU,并将其成功安装到自己的游戏电脑中。文章记述了这一非标准硬件改装过程、遇到的技术挑战以及最终实现本地运行大语言模型的体验。

    推荐理由:一个200英镑的二手 V100 加适配器,就让游戏电脑用上了 32GB 显存,跑 Qwen3.6-27B 达到 32 tok/s,噪音问题也解决了。对于想低成本本地跑大模型的人,这篇 DIY 手记很实用。

5月31日周日
  1. StepFun80

    阶跃星辰发布了Step 3.7 Flash,这是一款198B参数的视觉模型,旨在DGX Spark等桌面设备上运行。用户实测表明,128GB统一内存是运行门槛,模型占用约104GB。部署无需官方专用llama.cpp分支,主线版本即可。在上下文长度上存在权衡:启用视觉功能时,基于q8 KV cache的64K为上限;若要使用最高256K上下文,则需禁用视觉并切换至q4 KV cache,此时模型与缓存共占约114GB内存。该模型是推理模型,思考过程可能消耗大量max_tokens,需注意设置。

    引用Sudo su@sudoingX

    我现在正在一台 dgx spark 上运行 stepfun 新的 step 3.7 flash。 198b 的视觉模型,跑在一台就摆在桌上的机器上。以下是如何帮你省下大约 3 小时抓耳挠腮的加载时间,因为我已经替你抓过了。 官方 README 告诉你需要 stepfun 自己的 llama.cpp fork。你不需要,主线 ggml-org 就能跑得好好的,视觉功能什么的都行,64k。别花一个小时去构建一个 fork,结果发现不用它模型也能加载。 下面这个才是真正会吃掉你一整晚的:模型占了你约 121gb 统一内存池中的 104gb,而 spark 没有 swap。请求的上下文太大,它不会干净地崩溃,而是会静默地颠簸,内核把模型页换出、再从磁盘反复读回,循环往复,而你只能盯着“loading”发呆。 判断的信号是 read_bytes。如果它涨过 104gb 的模型大小还继续涨,同时进程内存钉在 99% 且日志毫无进展,那就是卡死了。杀掉它,它不会自己恢复。 在 q8 kv cache 上加载视觉投影器时,64k 就是 128gb 机器上的上限,超过它就会在 clip loader 里颠簸,模型加上 KV 加上视觉缓冲区全都在争抢你剩下的那约 17gb。 想要完整的 256k 上下文?去掉视觉,换成 q4 kv cache,这样就能装下,121gb 里用 114gb。这就是他们 README 没有明说的取舍:大上下文是真的,只不过得用 q4 cache,而且仅限文本。 而且它是个推理模型。问它点东西,如果你得到空白回复,不是你把它弄坏了,是你把 max_tokens 设得太低,它把整个预算都花在思考上了。答案就在 reasoning_content 里。给它留点空间。 这就是那 3 小时。确切可用的参数和权重在回复里。

    推荐理由:把 198B 的视觉模型塞进一台桌面盒子,还跑通了,这本身就是个小里程碑。更关键的是,这篇实战直接帮你绕开了三个大坑,省下的三小时够你喝杯咖啡慢慢试了。

  2. Simon Willison 博客73

    在浏览器中通过 Pyodide 和 Service Worker 运行 Python ASGI 应用

    作者展示了如何在浏览器中通过 Pyodide 和 Service Worker 运行 Python ASGI 应用。此前的 Datasette Lite 使用 Web Workers,但无法执行 `<script>` 标签中的 JavaScript。新方案由 Claude Opus 4.8 协助完成开发,解决了这一问题。作者已展示了基础的 ASGI FastCGI 演示和运行 Datasette 1.0a31 的演示,并计划后续将此方法应用于升级 Datasette Lite。

    推荐理由:Simon Willison 用 Service Worker 让 Python ASGI 在浏览器里真正跑了起来,这个技巧补上了 Datasette Lite 长期缺的 JS 执行能力,搞 Pyodide 的值得看看。

5月30日周六
  1. Google Blog:AI(RSS)55

    参与我们的 I/O 2026 测验:该测验由 Google AI Studio 氛围编程生成

    Google 使用其开发工具 Google AI Studio,通过氛围编程(vibe coding)方式,创建了一个关于 Google I/O 2026 主要公告的在线测验。

    推荐理由:Google 用 AI Studio 自己 vibe code 了个 I/O 测验,是想展示普通人也玩得转,但 quiz 本身信息量不大,想体验 vibe coding 的可以顺手玩玩。

5月29日周五
  1. Hugging Face:Blog(RSS)71

    PyTorch 性能分析系列(一):torch.profiler 入门指南

    本文是 PyTorch profiling 系列的开篇,从最简单的矩阵乘法加偏置操作出发,逐步讲解如何使用 `torch.profiler` 进行性能分析。涵盖 profiler 设置、导出统计表格与 Chrome trace、解读 CPU 和 GPU 活动的时序关系,以及 `torch.compile` 对底层 CUDA kernel 调用链的影响。实验基于 NVIDIA A100-SXM4-80GB GPU 运行,面向基本掌握 PyTorch 但缺乏 profiling 经验的读者。

    推荐理由:PyTorch profiling 的陡峭学习曲线劝退了很多人,这篇用从零开始的方式把 trace 拆解得明明白白,想做性能优化的同学该收藏。

  2. Hacker News 热门(buzzing.cc 中文翻译)73

    Claude Code——文档中未提及的所有可配置选项

    该篇文章标题涉及“Claude Code”的可配置选项,但提供的正文内容仅包含一张图片和一个外部链接,未给出任何关于模型版本、参数、性能、价格或功能的具体信息。根据规则,无法在摘要中提及原文不存在的细节。

    推荐理由:如果你在用 Claude Code,这份从源码里扒出的隐藏配置清单能让你摆脱默认模式,好多选项官方文档压根没提。