bojieli/ai-agent-book 是李博杰编写的开源教材《深入理解 AI Agent:设计原理与工程实践》主仓库。项目公开了全书正文、PDF、EPUB、配图和按章组织的代码实验,用 10 章内容把 Agent 基础、上下文、记忆、工具、Coding Agent、评估、训练、自我进化、多模态和多 Agent 协作串联起来。
全书采用一个容易理解的公式:
|
|
这本书适合已经会调用大模型,但希望理解 Agent 工程体系的人。它不是只介绍几个框架,而是把模型之外的 Harness、上下文管理、工具调用、评估和实践代码放到同一条学习路线中。
快速结论
- 全书中文正文、PDF 和 EPUB 可以免费阅读,仓库采用 Apache License 2.0。
- 内容共 10 章,配套 88 个项目,其中 70 多个可以独立运行。
- 正文以中文为主,同时提供台灣正體、英文、泰米尔语和越南语社区翻译。
- 社区译本可能落后于中文原版,关注最新内容时应优先查看
book/。 - 部分实验需要 API Key、GPU、外部数据集、浏览器环境或机器人硬件,不能假设全部实验都能在普通笔记本上直接运行。
在哪里阅读和下载
项目主页:
https://github.com/bojieli/ai-agent-book
仓库 README 提供中文 PDF 和 EPUB 的最新构建链接,也可以直接在 GitHub 阅读 Markdown 源文。中文正文主要位于:
|
|
多语言目录包括:
|
|
如果只是阅读,直接下载 Release 中的固定版本更稳;如果想跟踪最新修订,可以阅读 main 分支生成的 PDF、EPUB 或 book/ 源文。固定版本便于引用和做笔记,main 分支则可能持续增加勘误和新内容。
10 章分别讲什么
| 章节 | 主题 | 学习重点 |
|---|---|---|
| 第 1 章 | Agent 基础知识 | Agent 的定义、模型能力与 Harness 工程 |
| 第 2 章 | 上下文工程 | KV Cache、提示工程、Agent Skills、上下文压缩 |
| 第 3 章 | 用户记忆和知识库 | 跨会话记忆、RAG、结构化索引与知识图谱 |
| 第 4 章 | 工具 | MCP、感知/执行/协作工具、异步 Agent 与工具发现 |
| 第 5 章 | Coding Agent 与代码生成 | 生产级 Coding Agent 的组件和工作流程 |
| 第 6 章 | Agent 评估 | 环境、指标、统计显著性和评估驱动选型 |
| 第 7 章 | 模型后训练 | 预训练、SFT、RL、工具调用内化和样本效率 |
| 第 8 章 | Agent 自我进化 | 经验学习、Prompt 蒸馏与工具创造 |
| 第 9 章 | 多模态与实时交互 | 语音、Computer Use、GUI 和机器人 |
| 第 10 章 | 多 Agent 协作 | 任务分工、上下文共享与隔离、群体行为 |
如果对 Agent、MCP、RAG 和 Token 还不熟悉,可以先阅读站内的 AI Agent、MCP、RAG 与 Token 名词解释。如果重点是 Coding Agent 的多 Agent 协作,可结合 Claude Code Subagents 与 Agent Teams 对比 理解实际工具中的调度差异。
推荐的三条学习路线
路线一:产品与应用开发者
建议顺序:
|
|
先理解 Agent 结构,再学习上下文、记忆、工具和评估。完成后,应该能够判断一个 Agent 产品的问题来自模型、上下文、工具接口,还是缺少可重复的评估。
路线二:AI 编程工具开发者
建议顺序:
|
|
重点关注 Coding Agent、工具执行、安全边界、上下文压缩、代码评估和多 Agent 分工。学习时不要只看最终 Demo,应记录 Agent 如何选择文件、调用工具、处理失败和验证结果。
路线三:模型训练与研究方向
建议顺序:
|
|
先建立评估意识,再进入 SFT、RL、自我进化、多模态和多 Agent。这样可以避免先训练模型、后补指标,导致实验结论无法比较。
88 个实验应该怎么跑
仓库按章节提供代码目录:
|
|
不同实验的状态和依赖并不相同。开始前建议:
- 先阅读对应章节正文;
- 打开章节目录内的 README;
- 确认实验标记是可运行、复现还是设计练习;
- 检查 Python、Node.js、GPU、API Key 和数据集要求;
- 使用独立虚拟环境安装依赖;
- 先跑最小示例,再改模型、数据或工具;
- 保存输入、输出、依赖版本和验收结果。
可以先克隆仓库:
|
|
不要在仓库根目录直接假设存在一个统一的安装命令。88 个项目涉及的框架和依赖不同,应进入具体章节和实验目录,严格按照对应 README 操作。
哪些实验需要额外资源
API Key
部分实验需要访问大模型 API。README 列出了 Kimi、智谱 GLM、SiliconFlow、火山引擎和 OpenRouter 等选择。使用前要确认:
- 账户所在地区是否支持;
- 模型名称和接口是否仍然有效;
- 免费额度、速率限制和计费方式;
- API Key 不要提交到 Git;
- 示例输出是否依赖特定模型能力。
不要把 API Key 直接写进 Python 文件。优先使用环境变量或实验 README 指定的 .env 方式,并确认 .env 已被 Git 忽略。
外部仓库和数据集
第 6、7、9、10 章有一部分评测、训练、浏览器和机器人项目不直接包含在主仓库,需要另外克隆。README 当前列出的示例包括:
android_world、GAIA、OSWorld、SWE-bench、tau2-bench、terminal-bench;- MiniMind、verl、SFTvsRL、Tinker Cookbook 等训练项目;
browser-use和 Anthropicclaude-quickstarts;- TalkAct 和 Stanford Generative Agents。
如果实验 README 指定 commit,应按要求切换版本。直接使用外部仓库最新 main 分支,可能因为 API、依赖或目录结构变化而无法复现书中的结果。
GPU 和真实硬件
训练、大模型推理、VLA、机器人和 Sim2Real 实验可能需要较大显存或实际设备。普通电脑可以先完成概念、API、上下文、记忆、MCP 和轻量评估实验;不要为了完成全部章节,一开始就采购昂贵硬件。
如何把阅读变成真正的工程能力
每章可以采用同一套学习闭环:
- 用一句话写出本章要解决的问题;
- 画出输入、上下文、模型、工具和输出的数据流;
- 跑通一个最小实验;
- 主动制造一次失败,例如工具超时、上下文超长或返回格式错误;
- 增加日志、重试、权限限制或验收条件;
- 用固定测试集比较修改前后的结果;
- 把可复用规则整理成项目文档或 Skill。
例如学习第 4 章 MCP 时,不应止于“工具调用成功”,还要检查参数校验、超时、错误恢复和权限范围。学习第 6 章评估时,不应只看一次漂亮输出,而要记录样本、指标和重复实验结果。
PDF、EPUB 与网页源码怎么选
| 形式 | 适合场景 | 注意点 |
|---|---|---|
| 连续阅读、打印、固定页码引用 | main 分支构建会更新,正式引用建议用 Release | |
| EPUB | 手机、平板、电纸书阅读 | 不同阅读器对代码块和表格支持不同 |
| GitHub Markdown | 查看最新内容、搜索、跟踪改动 | 阅读连贯性不如电子书 |
| 本地源码 | 做批注、修改、运行配套实验 | 需要自行管理 Git 版本和依赖 |
如果需要自己构建 PDF,官方说明要求 pandoc、xelatex、ElegantBook 文档类和相关字体,然后执行:
|
|
这条命令更适合 Linux、macOS 或已有 Bash/LaTeX 环境的用户。Windows 用户可以使用 WSL,但应先确认字体与 TeX 依赖,否则可能在中文字体或 LaTeX 包阶段失败。
常见误区
以为 88 个实验都能一键运行
不同实验覆盖 API、RAG、训练、浏览器、GUI、语音和机器人,依赖跨度很大。正确做法是按章节 README 分别配置,而不是寻找一个根目录全量安装命令。
只下载 PDF,不看代码版本
PDF 适合阅读,但实验失败时应回到对应章节目录,检查 README、依赖文件、指定 commit 和 Issues。书中概念与代码演进速度不同,固定版本比盲目追最新更容易复现。
直接运行所有外部项目
外部仓库可能体积很大,也可能需要数据集、GPU、容器或特定许可证。只克隆当前学习章节需要的项目,先阅读各自许可证和硬件要求。
把 Agent 等同于一个大模型
全书反复强调 Agent 还包括上下文与工具。实际系统中,提示、记忆、权限、执行环境、状态持久化和评估往往决定能否稳定工作。更大的模型不能自动解决所有工程问题。
适合哪些读者
适合:
- 想系统理解 AI Agent,而不是只会调用框架的人;
- 正在开发 Coding Agent、知识助手或自动化工作流的工程师;
- 想补齐上下文、记忆、MCP、评估和后训练知识的开发者;
- 需要课程、读书会或团队培训材料的人;
- 愿意动手复现实验并记录失败过程的学习者。
如果只是寻找某个框架的快速安装命令,这本书可能显得较长。可以先按主题阅读一章,再决定是否完成整条路线。
总结
bojieli/ai-agent-book 把 AI Agent 从概念、上下文和工具,一直讲到评估、训练、多模态与多 Agent 协作,并提供了大量配套实验。它更适合作为一套持续数周的学习计划,而不是一天读完的项目介绍。
建议从自己的目标出发选择章节,先完成一个最小实验,再逐步增加模型、工具、记忆和评估。只要能把“读懂一章”转化为“跑通、制造失败、修复并验收一个实验”,这套开源教材就能真正进入工程实践。