跳到正文
北京时间
原文
Hacker News 热门(buzzing.cc 中文翻译)· calmrocks·· 2026-08-28精选AI 评分75

AI 工程师笔记本:在 Colab 上免费、无需框架即可使用 RAG/智能体/评估工具

AI 工程师笔记本——在 Colab 上免费、无需框架即可使用 RAG/智能体/评估工具

AI 导读

一套可运行的 Colab 笔记本,面向 AI 工程师与 FDE 技能栈,用原始 API 而非框架构建基于基础模型的系统,覆盖提示词、RAG、评估、智能体、微调与服务化。全部在免费 Groq API 上运行,无需信用卡;LoRA 微调和自托管服务提供概念讲解及可选的 Colab-GPU 附录。包含三个端到端案例研究,且全程兼容 OpenAI API,模式可直接迁移。

推荐理由

裸 API 写一遍 agent 循环和 RAG,比直接套 LangChain 更能理解框架在封装什么,对于 AI 工程师面试中讲清系统设计和取舍有直接帮助。

正文 · AI 翻译

AI 工程师笔记本

以面试中真正会考你的方式来学习应用型 LLM 技术栈:不依赖框架、使用免费 API,从提示词一路学到部署、微调,以及红队评测基准。

面向 AI 工程师 / 前沿部署工程师(FDE)技能体系的可运行 Colab 笔记本。你将使用原始 API(而非框架)在基础模型之上构建可运行的系统(模型 API、RAG、评测、智能体、适配、部署)。

它有何不同

  • 刻意不依赖框架。你先从原始 API 调用开始编写智能体循环、RAG 和评测,从而在使用 LangChain/LlamaIndex 之前真正理解它们做了什么(并能判断何时不该用)。模式是持久的,封装层则不断更迭。
  • 评测是主线。“先度量再调优”的理念在早期就被植入,并在每个章节中反复出现。正是这一习惯区分了交付系统的工程师与只做出演示的人。
  • 端到端免费运行。所有内容都在免费 Groq API上运行(无需信用卡)。Groq 无法承载的两个主题——LoRA 微调(06)和自托管部署(09)——采用概念优先的方式,并附有可选的、带隔离的 Colab-GPU 附录,这些附录已在真实的 Colab T4 上验证通过。
  • 真实案例研究,而非玩具演示。 三个端到端 案例研究 展示了技能在真实约束下的组合运用:一个 在生产环境中调试 的客服助手、一场流水线 vs 智能体的成本对决,以及一个红队鲁棒性基准测试。
  • 全程兼容 OpenAI,因此每个模式都能直接迁移到 OpenAI,并且(稍作修改后)也能用于 Anthropic。只需更换基础 URL,技能即可沿用。

作为 《计划:转型为前沿部署工程师 / AI 工程师》 的配套实操手册而构建。该计划解释了学什么以及为什么学;这些 notebook 则是你实际动手运行的地方。

适用人群

正在向后端或全栈工程师转型为 AI 工程师、FDE、应用 AI 或解决方案工程师(AI)岗位的从业者。头衔不同,工作内容大体相同。你能够交付生产级代码;你想在此基础上掌握应用模型层。

学习顺序

从上到下依次学习。每个 notebook 都是独立的(自行安装依赖、从 Colab secrets 读取 API 密钥),并以练习收尾。

00 — 环境设置

Notebook 你将学到什么
环境与成本卫生
Open In Colab
通过 Colab secrets 管理 API 密钥、支出上限、模型选择

01 — 模型 API

Notebook 你将学到什么
提示词基础
Open In Colab
清晰的指令、少样本示例、输出格式规范、逐步推理:这是成本最低的杠杆,每一项都展示了指标的变化
结构化输出
Open In Colab
从模型中获取可靠的 JSON 输出,以及它在哪些地方会失效
工具调用
Open In Colab
端到端的函数/工具调用,包括错误路径
流式输出
Open In Colab
流式响应以及 UI 对它们的需求
上下文与缓存
Open In Colab
上下文窗口预算、提示词缓存、批量与实时定价

02 — 评估 I:衡量输出

Notebook 你将学到什么
衡量输出
Open In Colab
在第一节任务上建立黄金集与指标;在构建任何需要调优的东西之前,养成"先衡量再调优"的习惯。评估是主干;它会在之后每一节中反复出现

03 — RAG

Notebook 你将学到什么
什么是 RAG?
Open In Colab
检索 → 增强 → 生成的循环、为什么 RAG 优于普通 LLM、以及为什么 RAG 不等于嵌入向量,附一个 15 行的可运行演示
嵌入向量与检索
Open In Colab
嵌入向量的选择、向量搜索、相似度陷阱。先把检索跑通再说
混合检索与重排序
Open In Colab
关键词 + 向量混合检索、重排序器,以及各自在什么情况下才值得付出成本
分块(Chunking)
Open In Colab
在真实且杂乱无章的语料上实践分块策略,等你能够用检索效果来评判它们之后,再回头重新审视
RAG 为什么会失败
Open In Colab
诊断错误答案:瓶颈通常出在检索质量,而不是生成环节

04 —— 评估(二):真正的差异化优势

笔记本 你将学到什么
黄金测试集
Open In Colab
为第 03 节中的 RAG 系统构建黄金测试集
LLM 作为裁判
Open In Colab
评判提示词、与人类的一致性,以及评判模型自身的失败模式
回归评测
Open In Colab
把评测当作持续集成:当你修改提示词或模型时,捕捉质量回退

05 — 智能体

笔记本 你将学到什么
从零开始搭建智能体循环
Open In Colab
一个可运行的智能体循环,只用原始 API 调用,不依赖任何框架
工具设计
Open In Colab
设计模型真正能用得好的工具
护栏与预算
Open In Colab
停止条件、成本/延迟预算,以及流水线何时优于智能体
MCP 与工具生态
Open In Colab
概念:Model Context Protocol 标准化了什么、它如何映射到原始工具循环,以及何时该使用它
技能与渐进式披露
Open In Colab
概念:将可复用的专业知识打包,供智能体按需加载。SKILL.md模式、上下文预算的收益,以及 Tools/MCP/Skills 如何构成一个完整叙事
Harness 工程
Open In Colab
综合:围绕调用的脚手架():上下文组装与压缩、工具结果整形,以及验证循环。为本章节此前逐块讲授的内容给出统一定义

06 — 适配模型

Notebook 你将学到什么
微调 vs RAG vs 提示词
Open In Colab
何时该改变模型的权重、何时该改变其输入;LoRA/QLoRA 是什么、成本如何;你在会议室里会遇到的那场争论,外加一个可选的、在免费 GPU 上进行的真实 LoRA 微调实验

07 — 安全

Notebook 你将学到什么
提示词注入与信任边界
Open In Colab
直接与间接提示词注入、输出处理、PII、过度自主权。OWASP LLM Top 10 风险,先现场演示失败,再展示如何防御

08 — 运维

笔记本 你将学到什么
可观测性与 LLMOps
Open In Colab
追踪每一次调用、安全的提示词日志记录、成本/延迟/错误指标、漂移检测,以及“观测→评估”的反馈闭环
可靠性与降级方案
Open In Colab
带退避的重试、超时、备用模型、输出验证、熔断器、优雅降级
实验追踪与模型注册
Open In Colab
端到端使用 MLflow:从第 04 节的评估框架中记录运行/参数/指标,注册并版本化管理模型,按阶段提升——这套工具能把“我跑了一次评估”变成可追踪、可复现的工作流

09 — 服务与推理性能

在免费的 Groq API 无法运行该主题的情况下(这些框架需要 GPU),笔记本采用概念优先的方式讲解,并将可选的 Colab-GPU 附录单独隔离出来,这与第 06 节 LoRA 附录的模式相同。

笔记本 你将学到什么
服务框架
Open In Colab
AI 工程师实际会在哪些服务技术栈之间做选择(vLLM、TGI、Triton、TensorRT-LLM):各自优化了什么、如何映射到你一直在调用的原始 API,以及何时该选用哪一个
推理性能
Open In Colab
吞吐量与延迟背后的关键杠杆:连续批处理、KV cache、量化,以及吞吐量与延迟之间的权衡,并附上用于估算部署规模的粗略计算

10 — ML 系统设计与性能

笔记本 你将学到什么
设计推理服务
Open In Colab
概念:机器学习系统设计面试,端到端走一遍:在真实的 LLM 服务提示词场景下,进行 QPS/VRAM/延迟/成本估算、副本扩缩容、队列、缓存以及 SLA 权衡。

11 — 客户工艺(FDE 的差异化优势)

笔记本 你将学到什么
范围界定与发现
Open In Colab
把模糊的客户需求转化为有明确范围、可评估的系统:发现式提问、一页纸的范围界定文档、演示纪律:大多数工程师无法拿出证据的客户场景面试轮次。

12 — 案例研究与毕业设计

在这里,各项技能汇聚成项目。首先是案例研究(一个端到端走完、可运行的现实场景),然后是毕业设计:你自己构建并部署的代码仓库。(章节概览。)

笔记本 你将学到什么
案例研究 A — 客户支持助手
Open In Colab
一个从范围界定 → 构建 → 上线 → 生产环境调试的完整场景:一个模糊的需求变成已部署、经过评估的 RAG+智能体助手,随后出现一个真实的质量回退(语料库迁移后索引过期),由你来诊断并修复。这是一条贯穿第 02–11 节的从构建到调试的完整主线。
案例研究 B —— 合同抽取:流水线 vs 智能体
Open In Colab
面试官最爱的判断力考题:把同一个抽取任务分别实现为智能体和流水线两种方案,然后用准确率 + token 成本证明:当步骤已知时,流水线胜出。
案例研究 C —— 红队鲁棒性基准测试
Open In Colab
一种不同类型的系统:一个用于评估模型而非服务模型的测试框架——攻击者→目标→裁判(PAIR)循环,用于衡量攻击成功率,综合运用了智能体循环、LLM 裁判、安全性和评估。

毕业项目:项目简报——一个可以写进简历的真实部署项目,包含真实代码仓库、服务组件和评估报告。案例研究是为了学习;毕业项目是为了求职。

写作约定

  • 使用原始模型 API,不用框架。模式是持久的,封装层则不断更迭。
  • RAG 与评测部分共用同一语料库(data/),因此评测衡量的正是你实际构建的检索能力。
  • 自包含的 Notebook。第一个单元格负责安装,第二个单元格调用 from aien import setup; client, MODEL = setup() 从 Colab 密钥(或本地环境变量)加载你的 API 密钥。Notebook 之间不存在隐藏状态。aien 是本仓库中一个极简的共享配置包(集中管理凭据加载逻辑),由第一个单元格自动安装。
  • 每个 Notebook 末尾都配有练习。请先完成练习再继续往下学。

环境配置

  1. 前往 console.groq.com 免费获取 API 密钥,无需信用卡。
  2. 在 Colab 中:点击左侧边栏的密钥图标 → 添加 GROQ_API_KEY 作为密钥,并开启 Notebook 访问权限。
  3. 通过徽章打开任意 Notebook,然后从上到下依次运行即可。

如果选择在本地运行:pip install -r requirements.txt && pip install -e .(第二个命令会安装 aien 配置辅助包),export GROQ_API_KEY=...,然后用 Jupyter 打开。

来源:Hacker News 热门(buzzing.cc 中文翻译) · github.com

相关事件