AI 工程师笔记本:在 Colab 上免费、无需框架即可使用 RAG/智能体/评估工具
AI 工程师笔记本——在 Colab 上免费、无需框架即可使用 RAG/智能体/评估工具
一套可运行的 Colab 笔记本,面向 AI 工程师与 FDE 技能栈,用原始 API 而非框架构建基于基础模型的系统,覆盖提示词、RAG、评估、智能体、微调与服务化。全部在免费 Groq API 上运行,无需信用卡;LoRA 微调和自托管服务提供概念讲解及可选的 Colab-GPU 附录。包含三个端到端案例研究,且全程兼容 OpenAI API,模式可直接迁移。
裸 API 写一遍 agent 循环和 RAG,比直接套 LangChain 更能理解框架在封装什么,对于 AI 工程师面试中讲清系统设计和取舍有直接帮助。
AI 工程师笔记本
以面试中真正会考你的方式来学习应用型 LLM 技术栈:不依赖框架、使用免费 API,从提示词一路学到部署、微调,以及红队评测基准。
面向 AI 工程师 / 前沿部署工程师(FDE)技能体系的可运行 Colab 笔记本。你将使用原始 API(而非框架)在基础模型之上构建可运行的系统(模型 API、RAG、评测、智能体、适配、部署)。
它有何不同
- 刻意不依赖框架。你先从原始 API 调用开始编写智能体循环、RAG 和评测,从而在使用 LangChain/LlamaIndex 之前真正理解它们做了什么(并能判断何时不该用)。模式是持久的,封装层则不断更迭。
- 评测是主线。“先度量再调优”的理念在早期就被植入,并在每个章节中反复出现。正是这一习惯区分了交付系统的工程师与只做出演示的人。
- 端到端免费运行。所有内容都在免费 Groq API上运行(无需信用卡)。Groq 无法承载的两个主题——LoRA 微调(06)和自托管部署(09)——采用概念优先的方式,并附有可选的、带隔离的 Colab-GPU 附录,这些附录已在真实的 Colab T4 上验证通过。
- 真实案例研究,而非玩具演示。 三个端到端 案例研究 展示了技能在真实约束下的组合运用:一个 在生产环境中调试 的客服助手、一场流水线 vs 智能体的成本对决,以及一个红队鲁棒性基准测试。
- 全程兼容 OpenAI,因此每个模式都能直接迁移到 OpenAI,并且(稍作修改后)也能用于 Anthropic。只需更换基础 URL,技能即可沿用。
作为 《计划:转型为前沿部署工程师 / AI 工程师》 的配套实操手册而构建。该计划解释了学什么以及为什么学;这些 notebook 则是你实际动手运行的地方。
适用人群
正在向后端或全栈工程师转型为 AI 工程师、FDE、应用 AI 或解决方案工程师(AI)岗位的从业者。头衔不同,工作内容大体相同。你能够交付生产级代码;你想在此基础上掌握应用模型层。
学习顺序
从上到下依次学习。每个 notebook 都是独立的(自行安装依赖、从 Colab secrets 读取 API 密钥),并以练习收尾。
00 — 环境设置
| Notebook | 你将学到什么 |
|---|---|
| 环境与成本卫生 | 通过 Colab secrets 管理 API 密钥、支出上限、模型选择 |
01 — 模型 API
| Notebook | 你将学到什么 |
|---|---|
| 提示词基础 | 清晰的指令、少样本示例、输出格式规范、逐步推理:这是成本最低的杠杆,每一项都展示了指标的变化 |
| 结构化输出 | 从模型中获取可靠的 JSON 输出,以及它在哪些地方会失效 |
| 工具调用 | 端到端的函数/工具调用,包括错误路径 |
| 流式输出 | 流式响应以及 UI 对它们的需求 |
| 上下文与缓存 | 上下文窗口预算、提示词缓存、批量与实时定价 |
02 — 评估 I:衡量输出
| Notebook | 你将学到什么 |
|---|---|
| 衡量输出 | 在第一节任务上建立黄金集与指标;在构建任何需要调优的东西之前,养成"先衡量再调优"的习惯。评估是主干;它会在之后每一节中反复出现 |
03 — RAG
| Notebook | 你将学到什么 |
|---|---|
| 什么是 RAG? | 检索 → 增强 → 生成的循环、为什么 RAG 优于普通 LLM、以及为什么 RAG 不等于嵌入向量,附一个 15 行的可运行演示 |
| 嵌入向量与检索 | 嵌入向量的选择、向量搜索、相似度陷阱。先把检索跑通再说 |
| 混合检索与重排序 | 关键词 + 向量混合检索、重排序器,以及各自在什么情况下才值得付出成本 |
| 分块(Chunking) | 在真实且杂乱无章的语料上实践分块策略,等你能够用检索效果来评判它们之后,再回头重新审视 |
| RAG 为什么会失败 | 诊断错误答案:瓶颈通常出在检索质量,而不是生成环节 |
04 —— 评估(二):真正的差异化优势
| 笔记本 | 你将学到什么 |
|---|---|
| 黄金测试集 | 为第 03 节中的 RAG 系统构建黄金测试集 |
| LLM 作为裁判 | 评判提示词、与人类的一致性,以及评判模型自身的失败模式 |
| 回归评测 | 把评测当作持续集成:当你修改提示词或模型时,捕捉质量回退 |
05 — 智能体
| 笔记本 | 你将学到什么 |
|---|---|
| 从零开始搭建智能体循环 | 一个可运行的智能体循环,只用原始 API 调用,不依赖任何框架 |
| 工具设计 | 设计模型真正能用得好的工具 |
| 护栏与预算 | 停止条件、成本/延迟预算,以及流水线何时优于智能体 |
| MCP 与工具生态 | 概念:Model Context Protocol 标准化了什么、它如何映射到原始工具循环,以及何时该使用它 |
| 技能与渐进式披露 | 概念:将可复用的专业知识打包,供智能体按需加载。SKILL.md模式、上下文预算的收益,以及 Tools/MCP/Skills 如何构成一个完整叙事 |
| Harness 工程 | 综合:围绕调用的脚手架():上下文组装与压缩、工具结果整形,以及验证循环。为本章节此前逐块讲授的内容给出统一定义 |
06 — 适配模型
| Notebook | 你将学到什么 |
|---|---|
| 微调 vs RAG vs 提示词 | 何时该改变模型的权重、何时该改变其输入;LoRA/QLoRA 是什么、成本如何;你在会议室里会遇到的那场争论,外加一个可选的、在免费 GPU 上进行的真实 LoRA 微调实验 |
07 — 安全
| Notebook | 你将学到什么 |
|---|---|
| 提示词注入与信任边界 | 直接与间接提示词注入、输出处理、PII、过度自主权。OWASP LLM Top 10 风险,先现场演示失败,再展示如何防御 |
08 — 运维
| 笔记本 | 你将学到什么 |
|---|---|
| 可观测性与 LLMOps | 追踪每一次调用、安全的提示词日志记录、成本/延迟/错误指标、漂移检测,以及“观测→评估”的反馈闭环 |
| 可靠性与降级方案 | 带退避的重试、超时、备用模型、输出验证、熔断器、优雅降级 |
| 实验追踪与模型注册 | 端到端使用 MLflow:从第 04 节的评估框架中记录运行/参数/指标,注册并版本化管理模型,按阶段提升——这套工具能把“我跑了一次评估”变成可追踪、可复现的工作流 |
09 — 服务与推理性能
在免费的 Groq API 无法运行该主题的情况下(这些框架需要 GPU),笔记本采用概念优先的方式讲解,并将可选的 Colab-GPU 附录单独隔离出来,这与第 06 节 LoRA 附录的模式相同。
| 笔记本 | 你将学到什么 |
|---|---|
| 服务框架 | AI 工程师实际会在哪些服务技术栈之间做选择(vLLM、TGI、Triton、TensorRT-LLM):各自优化了什么、如何映射到你一直在调用的原始 API,以及何时该选用哪一个 |
| 推理性能 | 吞吐量与延迟背后的关键杠杆:连续批处理、KV cache、量化,以及吞吐量与延迟之间的权衡,并附上用于估算部署规模的粗略计算 |
10 — ML 系统设计与性能
| 笔记本 | 你将学到什么 |
|---|---|
| 设计推理服务 | 概念:机器学习系统设计面试,端到端走一遍:在真实的 LLM 服务提示词场景下,进行 QPS/VRAM/延迟/成本估算、副本扩缩容、队列、缓存以及 SLA 权衡。 |
11 — 客户工艺(FDE 的差异化优势)
| 笔记本 | 你将学到什么 |
|---|---|
| 范围界定与发现 | 把模糊的客户需求转化为有明确范围、可评估的系统:发现式提问、一页纸的范围界定文档、演示纪律:大多数工程师无法拿出证据的客户场景面试轮次。 |
12 — 案例研究与毕业设计
在这里,各项技能汇聚成项目。首先是案例研究(一个端到端走完、可运行的现实场景),然后是毕业设计:你自己构建并部署的代码仓库。(章节概览。)
| 笔记本 | 你将学到什么 |
|---|---|
| 案例研究 A — 客户支持助手 | 一个从范围界定 → 构建 → 上线 → 生产环境调试的完整场景:一个模糊的需求变成已部署、经过评估的 RAG+智能体助手,随后出现一个真实的质量回退(语料库迁移后索引过期),由你来诊断并修复。这是一条贯穿第 02–11 节的从构建到调试的完整主线。 |
| 案例研究 B —— 合同抽取:流水线 vs 智能体 | 面试官最爱的判断力考题:把同一个抽取任务分别实现为智能体和流水线两种方案,然后用准确率 + token 成本证明:当步骤已知时,流水线胜出。 |
| 案例研究 C —— 红队鲁棒性基准测试 | 一种不同类型的系统:一个用于评估模型而非服务模型的测试框架——攻击者→目标→裁判(PAIR)循环,用于衡量攻击成功率,综合运用了智能体循环、LLM 裁判、安全性和评估。 |
毕业项目:项目简报——一个可以写进简历的真实部署项目,包含真实代码仓库、服务组件和评估报告。案例研究是为了学习;毕业项目是为了求职。
写作约定
- 使用原始模型 API,不用框架。模式是持久的,封装层则不断更迭。
- RAG 与评测部分共用同一语料库(
data/),因此评测衡量的正是你实际构建的检索能力。 - 自包含的 Notebook。第一个单元格负责安装,第二个单元格调用
from aien import setup; client, MODEL = setup()从 Colab 密钥(或本地环境变量)加载你的 API 密钥。Notebook 之间不存在隐藏状态。aien是本仓库中一个极简的共享配置包(集中管理凭据加载逻辑),由第一个单元格自动安装。 - 每个 Notebook 末尾都配有练习。请先完成练习再继续往下学。
环境配置
- 前往 console.groq.com 免费获取 API 密钥,无需信用卡。
- 在 Colab 中:点击左侧边栏的密钥图标 → 添加
GROQ_API_KEY作为密钥,并开启 Notebook 访问权限。 - 通过徽章打开任意 Notebook,然后从上到下依次运行即可。
如果选择在本地运行:pip install -r requirements.txt && pip install -e .(第二个命令会安装 aien 配置辅助包),export GROQ_API_KEY=...,然后用 Jupyter 打开。
来源:Hacker News 热门(buzzing.cc 中文翻译) · github.com