《深入理解 AI Agent》怎麼學:10 章開源教材與 88 個實驗指南

bojieli/ai-agent-book 開源了《深入理解 AI Agent:設計原理與工程實踐》的全書正文、PDF、EPUB 和 88 個配套實驗。本文整理章節結構、閱讀路線、實驗復現與使用注意點。

bojieli/ai-agent-book 是李博傑編寫的開源教材《深入理解 AI Agent:設計原理與工程實踐》主倉庫。專案公開了全書正文、PDF、EPUB、配圖和按章組織的程式碼實驗,用 10 章內容把 Agent 基礎、上下文、記憶、工具、Coding Agent、評估、訓練、自我進化、多模態和多 Agent 協作串聯起來。

全書採用一個容易理解的公式:

1
Agent = LLM + 上下文 + 工具

這本書適合已經會呼叫大模型,但希望理解 Agent 工程體系的人。它不是隻介紹幾個框架,而是把模型之外的 Harness、上下文管理、工具呼叫、評估和實踐程式碼放到同一條學習路線中。

快速結論

  • 全書中文正文、PDF 和 EPUB 可以免費閱讀,倉庫採用 Apache License 2.0。
  • 內容共 10 章,配套 88 個專案,其中 70 多個可以獨立執行。
  • 正文以中文為主,同時提供臺灣正體、英文、泰米爾語和越南語社群翻譯。
  • 社群譯本可能落後於中文原版,關注最新內容時應優先檢視 book/
  • 部分實驗需要 API Key、GPU、外部資料集、瀏覽器環境或機器人硬體,不能假設全部實驗都能在普通筆記本上直接執行。

在哪裡閱讀和下載

專案主頁:

https://github.com/bojieli/ai-agent-book

倉庫 README 提供中文 PDF 和 EPUB 的最新構建連結,也可以直接在 GitHub 閱讀 Markdown 源文。中文正文主要位於:

1
2
3
4
5
6
book/introduction.md
book/chapter1.md
book/chapter2.md
...
book/chapter10.md
book/afterword.md

多語言目錄包括:

1
2
3
4
book-zhtw/
book-en/
book-ta/
book-vi/

如果只是閱讀,直接下載 Release 中的固定版本更穩;如果想跟蹤最新修訂,可以閱讀 main 分支生成的 PDF、EPUB 或 book/ 源文。固定版本便於引用和做筆記,main 分支則可能持續增加勘誤和新內容。

10 章分別講什麼

章節 主題 學習重點
第 1 章 Agent 基礎知識 Agent 的定義、模型能力與 Harness 工程
第 2 章 上下文工程 KV Cache、提示工程、Agent Skills、上下文壓縮
第 3 章 使用者記憶和知識庫 跨會話記憶、RAG、結構化索引與知識圖譜
第 4 章 工具 MCP、感知/執行/協作工具、非同步 Agent 與工具發現
第 5 章 Coding Agent 與程式碼生成 生產級 Coding Agent 的元件和工作流程
第 6 章 Agent 評估 環境、指標、統計顯著性和評估驅動選型
第 7 章 模型後訓練 預訓練、SFT、RL、工具呼叫內化和樣本效率
第 8 章 Agent 自我進化 經驗學習、Prompt 蒸餾與工具創造
第 9 章 多模態與實時互動 語音、Computer Use、GUI 和機器人
第 10 章 多 Agent 協作 任務分工、上下文共享與隔離、群體行為

如果對 Agent、MCP、RAG 和 Token 還不熟悉,可以先閱讀站內的 AI Agent、MCP、RAG 與 Token 名詞解釋。如果重點是 Coding Agent 的多 Agent 協作,可結合 Claude Code Subagents 與 Agent Teams 對比 理解實際工具中的排程差異。

推薦的三條學習路線

路線一:產品與應用開發者

建議順序:

1
第 1 章 -> 第 2 章 -> 第 3 章 -> 第 4 章 -> 第 6 章

先理解 Agent 結構,再學習上下文、記憶、工具和評估。完成後,應該能夠判斷一個 Agent 產品的問題來自模型、上下文、工具介面,還是缺少可重複的評估。

路線二:AI 程式設計工具開發者

建議順序:

1
第 1 章 -> 第 2 章 -> 第 4 章 -> 第 5 章 -> 第 6 章 -> 第 10 章

重點關注 Coding Agent、工具執行、安全邊界、上下文壓縮、程式碼評估和多 Agent 分工。學習時不要只看最終 Demo,應記錄 Agent 如何選擇檔案、呼叫工具、處理失敗和驗證結果。

路線三:模型訓練與研究方向

建議順序:

1
第 1 章 -> 第 6 章 -> 第 7 章 -> 第 8 章 -> 第 9 章 -> 第 10 章

先建立評估意識,再進入 SFT、RL、自我進化、多模態和多 Agent。這樣可以避免先訓練模型、後補指標,導致實驗結論無法比較。

88 個實驗應該怎麼跑

倉庫按章節提供程式碼目錄:

1
2
3
4
chapter1/
chapter2/
...
chapter10/

不同實驗的狀態和依賴並不相同。開始前建議:

  1. 先閱讀對應章節正文;
  2. 開啟章節目錄內的 README;
  3. 確認實驗標記是可執行、復現還是設計練習;
  4. 檢查 Python、Node.js、GPU、API Key 和資料集要求;
  5. 使用獨立虛擬環境安裝依賴;
  6. 先跑最小示例,再改模型、資料或工具;
  7. 儲存輸入、輸出、依賴版本和驗收結果。

可以先克隆倉庫:

1
2
git clone https://github.com/bojieli/ai-agent-book.git
cd ai-agent-book

不要在倉庫根目錄直接假設存在一個統一的安裝命令。88 個專案涉及的框架和依賴不同,應進入具體章節和實驗目錄,嚴格按照對應 README 操作。

哪些實驗需要額外資源

API Key

部分實驗需要訪問大模型 API。README 列出了 Kimi、智譜 GLM、SiliconFlow、火山引擎和 OpenRouter 等選擇。使用前要確認:

  • 賬戶所在地區是否支援;
  • 模型名稱和介面是否仍然有效;
  • 免費額度、速率限制和計費方式;
  • API Key 不要提交到 Git;
  • 示例輸出是否依賴特定模型能力。

不要把 API Key 直接寫進 Python 檔案。優先使用環境變數或實驗 README 指定的 .env 方式,並確認 .env 已被 Git 忽略。

外部倉庫和資料集

第 6、7、9、10 章有一部分評測、訓練、瀏覽器和機器人專案不直接包含在主倉庫,需要另外克隆。README 當前列出的示例包括:

  • android_world、GAIA、OSWorld、SWE-bench、tau2-bench、terminal-bench;
  • MiniMind、verl、SFTvsRL、Tinker Cookbook 等訓練專案;
  • browser-use 和 Anthropic claude-quickstarts
  • TalkAct 和 Stanford Generative Agents。

如果實驗 README 指定 commit,應按要求切換版本。直接使用外部倉庫最新 main 分支,可能因為 API、依賴或目錄結構變化而無法復現書中的結果。

GPU 和真實硬體

訓練、大模型推理、VLA、機器人和 Sim2Real 實驗可能需要較大視訊記憶體或實際裝置。普通電腦可以先完成概念、API、上下文、記憶、MCP 和輕量評估實驗;不要為了完成全部章節,一開始就採購昂貴硬體。

如何把閱讀變成真正的工程能力

每章可以採用同一套學習閉環:

  1. 用一句話寫出本章要解決的問題;
  2. 畫出輸入、上下文、模型、工具和輸出的資料流;
  3. 跑通一個最小實驗;
  4. 主動製造一次失敗,例如工具超時、上下文超長或返回格式錯誤;
  5. 增加日誌、重試、許可權限制或驗收條件;
  6. 用固定測試集比較修改前後的結果;
  7. 把可複用規則整理成專案文件或 Skill。

例如學習第 4 章 MCP 時,不應止於“工具呼叫成功”,還要檢查引數校驗、超時、錯誤恢復和許可權範圍。學習第 6 章評估時,不應只看一次漂亮輸出,而要記錄樣本、指標和重複實驗結果。

PDF、EPUB 與網頁原始碼怎麼選

形式 適合場景 注意點
PDF 連續閱讀、列印、固定頁碼引用 main 分支構建會更新,正式引用建議用 Release
EPUB 手機、平板、電紙書閱讀 不同閱讀器對程式碼塊和表格支援不同
GitHub Markdown 檢視最新內容、搜尋、跟蹤改動 閱讀連貫性不如電子書
本地原始碼 做批註、修改、執行配套實驗 需要自行管理 Git 版本和依賴

如果需要自己構建 PDF,官方說明要求 pandoc、xelatex、ElegantBook 文件類和相關字型,然後執行:

1
cd book && bash build_pdf.sh

這條命令更適合 Linux、macOS 或已有 Bash/LaTeX 環境的使用者。Windows 使用者可以使用 WSL,但應先確認字型與 TeX 依賴,否則可能在中文字型或 LaTeX 包階段失敗。

常見誤區

以為 88 個實驗都能一鍵執行

不同實驗覆蓋 API、RAG、訓練、瀏覽器、GUI、語音和機器人,依賴跨度很大。正確做法是按章節 README 分別配置,而不是尋找一個根目錄全量安裝命令。

只下載 PDF,不看程式碼版本

PDF 適合閱讀,但實驗失敗時應回到對應章節目錄,檢查 README、依賴檔案、指定 commit 和 Issues。書中概念與程式碼演進速度不同,固定版本比盲目追最新更容易復現。

直接執行所有外部專案

外部倉庫可能體積很大,也可能需要資料集、GPU、容器或特定許可證。只克隆當前學習章節需要的專案,先閱讀各自許可證和硬體要求。

把 Agent 等同於一個大模型

全書反覆強調 Agent 還包括上下文與工具。實際系統中,提示、記憶、許可權、執行環境、狀態持久化和評估往往決定能否穩定工作。更大的模型不能自動解決所有工程問題。

適合哪些讀者

適合:

  • 想系統理解 AI Agent,而不是隻會呼叫框架的人;
  • 正在開發 Coding Agent、知識助手或自動化工作流的工程師;
  • 想補齊上下文、記憶、MCP、評估和後訓練知識的開發者;
  • 需要課程、讀書會或團隊培訓材料的人;
  • 願意動手復現實驗並記錄失敗過程的學習者。

如果只是尋找某個框架的快速安裝命令,這本書可能顯得較長。可以先按主題閱讀一章,再決定是否完成整條路線。

總結

bojieli/ai-agent-book 把 AI Agent 從概念、上下文和工具,一直講到評估、訓練、多模態與多 Agent 協作,並提供了大量配套實驗。它更適合作為一套持續數週的學習計劃,而不是一天讀完的專案介紹。

建議從自己的目標出發選擇章節,先完成一個最小實驗,再逐步增加模型、工具、記憶和評估。只要能把“讀懂一章”轉化為“跑通、製造失敗、修復並驗收一個實驗”,這套開源教材就能真正進入工程實踐。

專案地址:bojieli/ai-agent-book