《深入理解 AI Agent》怎么学:10 章开源教材与 88 个实验指南

bojieli/ai-agent-book 开源了《深入理解 AI Agent:设计原理与工程实践》的全书正文、PDF、EPUB 和 88 个配套实验。本文整理章节结构、阅读路线、实验复现与使用注意点。

bojieli/ai-agent-book 是李博杰编写的开源教材《深入理解 AI Agent:设计原理与工程实践》主仓库。项目公开了全书正文、PDF、EPUB、配图和按章组织的代码实验,用 10 章内容把 Agent 基础、上下文、记忆、工具、Coding Agent、评估、训练、自我进化、多模态和多 Agent 协作串联起来。

全书采用一个容易理解的公式:

1
Agent = LLM + 上下文 + 工具

这本书适合已经会调用大模型,但希望理解 Agent 工程体系的人。它不是只介绍几个框架,而是把模型之外的 Harness、上下文管理、工具调用、评估和实践代码放到同一条学习路线中。

快速结论

  • 全书中文正文、PDF 和 EPUB 可以免费阅读,仓库采用 Apache License 2.0。
  • 内容共 10 章,配套 88 个项目,其中 70 多个可以独立运行。
  • 正文以中文为主,同时提供台灣正體、英文、泰米尔语和越南语社区翻译。
  • 社区译本可能落后于中文原版,关注最新内容时应优先查看 book/
  • 部分实验需要 API Key、GPU、外部数据集、浏览器环境或机器人硬件,不能假设全部实验都能在普通笔记本上直接运行。

在哪里阅读和下载

项目主页:

https://github.com/bojieli/ai-agent-book

仓库 README 提供中文 PDF 和 EPUB 的最新构建链接,也可以直接在 GitHub 阅读 Markdown 源文。中文正文主要位于:

1
2
3
4
5
6
book/introduction.md
book/chapter1.md
book/chapter2.md
...
book/chapter10.md
book/afterword.md

多语言目录包括:

1
2
3
4
book-zhtw/
book-en/
book-ta/
book-vi/

如果只是阅读,直接下载 Release 中的固定版本更稳;如果想跟踪最新修订,可以阅读 main 分支生成的 PDF、EPUB 或 book/ 源文。固定版本便于引用和做笔记,main 分支则可能持续增加勘误和新内容。

10 章分别讲什么

章节 主题 学习重点
第 1 章 Agent 基础知识 Agent 的定义、模型能力与 Harness 工程
第 2 章 上下文工程 KV Cache、提示工程、Agent Skills、上下文压缩
第 3 章 用户记忆和知识库 跨会话记忆、RAG、结构化索引与知识图谱
第 4 章 工具 MCP、感知/执行/协作工具、异步 Agent 与工具发现
第 5 章 Coding Agent 与代码生成 生产级 Coding Agent 的组件和工作流程
第 6 章 Agent 评估 环境、指标、统计显著性和评估驱动选型
第 7 章 模型后训练 预训练、SFT、RL、工具调用内化和样本效率
第 8 章 Agent 自我进化 经验学习、Prompt 蒸馏与工具创造
第 9 章 多模态与实时交互 语音、Computer Use、GUI 和机器人
第 10 章 多 Agent 协作 任务分工、上下文共享与隔离、群体行为

如果对 Agent、MCP、RAG 和 Token 还不熟悉,可以先阅读站内的 AI Agent、MCP、RAG 与 Token 名词解释。如果重点是 Coding Agent 的多 Agent 协作,可结合 Claude Code Subagents 与 Agent Teams 对比 理解实际工具中的调度差异。

推荐的三条学习路线

路线一:产品与应用开发者

建议顺序:

1
第 1 章 -> 第 2 章 -> 第 3 章 -> 第 4 章 -> 第 6 章

先理解 Agent 结构,再学习上下文、记忆、工具和评估。完成后,应该能够判断一个 Agent 产品的问题来自模型、上下文、工具接口,还是缺少可重复的评估。

路线二:AI 编程工具开发者

建议顺序:

1
第 1 章 -> 第 2 章 -> 第 4 章 -> 第 5 章 -> 第 6 章 -> 第 10 章

重点关注 Coding Agent、工具执行、安全边界、上下文压缩、代码评估和多 Agent 分工。学习时不要只看最终 Demo,应记录 Agent 如何选择文件、调用工具、处理失败和验证结果。

路线三:模型训练与研究方向

建议顺序:

1
第 1 章 -> 第 6 章 -> 第 7 章 -> 第 8 章 -> 第 9 章 -> 第 10 章

先建立评估意识,再进入 SFT、RL、自我进化、多模态和多 Agent。这样可以避免先训练模型、后补指标,导致实验结论无法比较。

88 个实验应该怎么跑

仓库按章节提供代码目录:

1
2
3
4
chapter1/
chapter2/
...
chapter10/

不同实验的状态和依赖并不相同。开始前建议:

  1. 先阅读对应章节正文;
  2. 打开章节目录内的 README;
  3. 确认实验标记是可运行、复现还是设计练习;
  4. 检查 Python、Node.js、GPU、API Key 和数据集要求;
  5. 使用独立虚拟环境安装依赖;
  6. 先跑最小示例,再改模型、数据或工具;
  7. 保存输入、输出、依赖版本和验收结果。

可以先克隆仓库:

1
2
git clone https://github.com/bojieli/ai-agent-book.git
cd ai-agent-book

不要在仓库根目录直接假设存在一个统一的安装命令。88 个项目涉及的框架和依赖不同,应进入具体章节和实验目录,严格按照对应 README 操作。

哪些实验需要额外资源

API Key

部分实验需要访问大模型 API。README 列出了 Kimi、智谱 GLM、SiliconFlow、火山引擎和 OpenRouter 等选择。使用前要确认:

  • 账户所在地区是否支持;
  • 模型名称和接口是否仍然有效;
  • 免费额度、速率限制和计费方式;
  • API Key 不要提交到 Git;
  • 示例输出是否依赖特定模型能力。

不要把 API Key 直接写进 Python 文件。优先使用环境变量或实验 README 指定的 .env 方式,并确认 .env 已被 Git 忽略。

外部仓库和数据集

第 6、7、9、10 章有一部分评测、训练、浏览器和机器人项目不直接包含在主仓库,需要另外克隆。README 当前列出的示例包括:

  • android_world、GAIA、OSWorld、SWE-bench、tau2-bench、terminal-bench;
  • MiniMind、verl、SFTvsRL、Tinker Cookbook 等训练项目;
  • browser-use 和 Anthropic claude-quickstarts
  • TalkAct 和 Stanford Generative Agents。

如果实验 README 指定 commit,应按要求切换版本。直接使用外部仓库最新 main 分支,可能因为 API、依赖或目录结构变化而无法复现书中的结果。

GPU 和真实硬件

训练、大模型推理、VLA、机器人和 Sim2Real 实验可能需要较大显存或实际设备。普通电脑可以先完成概念、API、上下文、记忆、MCP 和轻量评估实验;不要为了完成全部章节,一开始就采购昂贵硬件。

如何把阅读变成真正的工程能力

每章可以采用同一套学习闭环:

  1. 用一句话写出本章要解决的问题;
  2. 画出输入、上下文、模型、工具和输出的数据流;
  3. 跑通一个最小实验;
  4. 主动制造一次失败,例如工具超时、上下文超长或返回格式错误;
  5. 增加日志、重试、权限限制或验收条件;
  6. 用固定测试集比较修改前后的结果;
  7. 把可复用规则整理成项目文档或 Skill。

例如学习第 4 章 MCP 时,不应止于“工具调用成功”,还要检查参数校验、超时、错误恢复和权限范围。学习第 6 章评估时,不应只看一次漂亮输出,而要记录样本、指标和重复实验结果。

PDF、EPUB 与网页源码怎么选

形式 适合场景 注意点
PDF 连续阅读、打印、固定页码引用 main 分支构建会更新,正式引用建议用 Release
EPUB 手机、平板、电纸书阅读 不同阅读器对代码块和表格支持不同
GitHub Markdown 查看最新内容、搜索、跟踪改动 阅读连贯性不如电子书
本地源码 做批注、修改、运行配套实验 需要自行管理 Git 版本和依赖

如果需要自己构建 PDF,官方说明要求 pandoc、xelatex、ElegantBook 文档类和相关字体,然后执行:

1
cd book && bash build_pdf.sh

这条命令更适合 Linux、macOS 或已有 Bash/LaTeX 环境的用户。Windows 用户可以使用 WSL,但应先确认字体与 TeX 依赖,否则可能在中文字体或 LaTeX 包阶段失败。

常见误区

以为 88 个实验都能一键运行

不同实验覆盖 API、RAG、训练、浏览器、GUI、语音和机器人,依赖跨度很大。正确做法是按章节 README 分别配置,而不是寻找一个根目录全量安装命令。

只下载 PDF,不看代码版本

PDF 适合阅读,但实验失败时应回到对应章节目录,检查 README、依赖文件、指定 commit 和 Issues。书中概念与代码演进速度不同,固定版本比盲目追最新更容易复现。

直接运行所有外部项目

外部仓库可能体积很大,也可能需要数据集、GPU、容器或特定许可证。只克隆当前学习章节需要的项目,先阅读各自许可证和硬件要求。

把 Agent 等同于一个大模型

全书反复强调 Agent 还包括上下文与工具。实际系统中,提示、记忆、权限、执行环境、状态持久化和评估往往决定能否稳定工作。更大的模型不能自动解决所有工程问题。

适合哪些读者

适合:

  • 想系统理解 AI Agent,而不是只会调用框架的人;
  • 正在开发 Coding Agent、知识助手或自动化工作流的工程师;
  • 想补齐上下文、记忆、MCP、评估和后训练知识的开发者;
  • 需要课程、读书会或团队培训材料的人;
  • 愿意动手复现实验并记录失败过程的学习者。

如果只是寻找某个框架的快速安装命令,这本书可能显得较长。可以先按主题阅读一章,再决定是否完成整条路线。

总结

bojieli/ai-agent-book 把 AI Agent 从概念、上下文和工具,一直讲到评估、训练、多模态与多 Agent 协作,并提供了大量配套实验。它更适合作为一套持续数周的学习计划,而不是一天读完的项目介绍。

建议从自己的目标出发选择章节,先完成一个最小实验,再逐步增加模型、工具、记忆和评估。只要能把“读懂一章”转化为“跑通、制造失败、修复并验收一个实验”,这套开源教材就能真正进入工程实践。

项目地址:bojieli/ai-agent-book