「AIエージェントを深く理解する」学習方法:オープンソース教科書10章と実験ガイド88冊

bojieli/ai-agent-book は、「AI エージェントの深い理解: 設計原則とエンジニアリングの実践」の全文、PDF、EPUB、および 88 のサポート実験をオープンソース化しました。この記事では、章構成、読書ルート、実験再現、使用上の注意点を整理します。

bojieli/ai-agent-book は、Li Bojie 著のオープンソース教科書「AI エージェントの詳細理解: 設計原則とエンジニアリングの実践」のメイン リポジトリです。このプロジェクトでは、書籍の全文、PDF、EPUB、イラスト、章ごとに整理されたコード実験が公開されています。 10 章を使用して、エージェントの基礎、コンテキスト、メモリ、ツール、コーディング エージェント、評価、トレーニング、自己進化、マルチモダリティ、およびマルチエージェントのコラボレーションを結び付けます。

この本全体では、次のようなわかりやすい公式が使用されています。

1
Agent = LLM + 上下文 + 工具

この本は、すでに大規模なモデルを呼び出すことができるが、エージェント エンジニアリング システムを理解したい人に適しています。単にいくつかのフレームワークを導入するのではなく、ハーネス、コンテキスト管理、ツールの呼び出し、評価、モデルを超えた実用的なコードを同じ学習パスに組み込んでいます。

簡単な結論

  • 書籍全体の中国語テキスト、PDF、EPUB が無料で閲覧でき、倉庫は Apache License 2.0 を使用しています。
  • 合計 10 章と 88 プロジェクトがあり、そのうち 70 以上は独立して実行できます。
  • 本文は主に中国語で、台湾の繁体字、英語、タミル語、ベトナム語のコミュニティ翻訳が利用可能です。
  • コミュニティ翻訳は、元の中国語版より遅れる可能性があります。最新のコンテンツに興味がある場合は、まず book/ をチェックしてください。
  • 一部の実験では、API キー、GPU、外部データ セット、ブラウザ環境、またはロボット ハードウェアが必要です。すべての実験が通常のラップトップで直接実行できるとは限りません。

読んでダウンロードできる場所

プロジェクトのホームページ:

https://github.com/bojieli/ai-agent-book

ウェアハウスの README には、中国語の PDF および EPUB の最新のビルド リンクが提供されており、GitHub で Markdown のソース テキストを直接読むこともできます。中国語のテキストは主に次の場所にあります。

1
2
3
4
5
6
book/introduction.md
book/chapter1.md
book/chapter2.md
...
book/chapter10.md
book/afterword.md

多言語カタログには次のものが含まれます。

1
2
3
4
book-zhtw/
book-en/
book-ta/
book-vi/

読むだけの場合は、リリースで修正バージョンを直接ダウンロードする方が安定しています。最新のリビジョンを追跡したい場合は、メイン ブランチによって生成された PDF、EPUB、または book/ ソース テキストを読むことができます。修正バージョンは参照したりメモを取るのが簡単で、メイン ブランチは引き続き正誤表や新しいコンテンツを追加する可能性があります。

第 10 章では何について話していますか?

トピック 学習ポイント
第 1 章 エージェントの基本 エージェント定義、モデル機能およびハーネス エンジニアリング
第 2 章 コンテキストエンジニアリング KV キャッシュ、ヒント エンジニアリング、エージェント スキル、コンテキスト圧縮
第 3 章 ユーザーの記憶と知識ベース クロスセッション メモリ、RAG、構造化インデックス、ナレッジ グラフ
第 4 章 ツール MCP、認識/実行/コラボレーション ツール、非同期エージェントおよびツール検出
第5章 コーディング エージェントとコード生成 実稼働グレードのコーディング エージェントのコンポーネントとワークフロー
第6章 エージェントの評価 環境、指標、統計的有意性、および評価主導の選択
第 7 章 モデル後のトレーニング 事前トレーニング、SFT、RL、ツール呼び出しの内部化とサンプル効率
第8章 エージェントの自己進化 体験学習、迅速な蒸留とツールの作成
第9章 マルチモーダルかつリアルタイムのインタラクション 音声、コンピュータの使用、GUI、およびロボット
第10章 マルチエージェントのコラボレーション タスクの分割、コンテキストの共有と分離、グループの行動

エージェント、MCP、RAG、およびトークンに詳しくない場合は、まずサイトの [AI エージェント、MCP、RAG およびトークンの用語集] (/ja/2026/04/23/ai-terms-agent-mcp-rag-token-explained/) を読んでください。コーディング エージェントのマルチエージェント コラボレーションに焦点を当てている場合は、クロード コード サブエージェントとエージェント チームの比較 を組み合わせて、実際のツールでのスケジュールの違いを理解できます。

3 つの推奨学習ルート

ルート 1: 製品およびアプリケーションの開発者

推奨される順序:

1
第 1 章 -> 第 2 章 -> 第 3 章 -> 第 4 章 -> 第 6 章

まずエージェントの構造を理解してから、コンテキスト、メモリ、ツール、評価について学びます。完了すると、エージェント製品の問題の原因がモデル、コンテキスト、ツール インターフェイス、または反復可能な評価の欠如にあるのかを判断できるようになります。

ルート 2: AI プログラミング ツール開発者

推奨される順序:

1
第 1 章 -> 第 2 章 -> 第 4 章 -> 第 5 章 -> 第 6 章 -> 第 10 章

コーディング エージェント、ツールの実行、セキュリティ境界、コンテキスト圧縮、コード評価、マルチ エージェントの分業に焦点を当てます。学習するときは、最終的なデモだけを見るのはやめてください。エージェントがどのようにファイルを選択し、ツールを呼び出し、障害を処理し、結果を検証するかを記録する必要があります。

ルート 3: モデルのトレーニングと研究の方向性

推奨される順序:

1
第 1 章 -> 第 6 章 -> 第 7 章 -> 第 8 章 -> 第 9 章 -> 第 10 章

まず評価意識を確立し、次に SFT、RL、自己進化、マルチモダリティ、マルチエージェントに入ります。これにより、最初にモデルをトレーニングしてから指標を補足することを回避でき、結果として比類のない実験結果が得られます。

88 件の実験はどのように実行すべきでしょうか?

ウェアハウスには、章ごとにコード ディレクトリが用意されています。

1
2
3
4
chapter1/
chapter2/
...
chapter10/

異なる実験のステータスと依存関係は同じではありません。始める前の提案:

  1. まず、対応する章の本文を読みます。
  2. 章ディレクトリにある README を開きます。
  3. 実験マークが実行可能か、再現可能か、または設計演習であるかを確認します。
  4. Python、Node.js、GPU、API キー、およびデータセットの要件を確認します。
  5. 独立した仮想環境を使用して依存関係をインストールします。
  6. 最初に最小のサンプルを実行してから、モデル、データ、またはツールを変更します。
  7. 入力、出力、依存バージョン、および承認結果を保存します。

最初にリポジトリのクローンを作成できます。

1
2
git clone https://github.com/bojieli/ai-agent-book.git
cd ai-agent-book

リポジトリのルート ディレクトリに直接統合インストール コマンドがあると想定しないでください。 88 のプロジェクトには、さまざまなフレームワークと依存関係が含まれています。特定の章や実験ディレクトリに入り、対応する README の操作に厳密に従ってください。

追加のリソースが必要な実験はどれですか

APIキー

一部の実験では、大規模なモデル API へのアクセスが必要です。 README には、Kimi、GLM、SiliconFlow、Volcano Engine、OpenRouter などのオプションがリストされています。ご使用前に以下をご確認ください。

  • アカウントが存在する地域がサポートされているかどうか。
  • モデル名とインターフェースがまだ有効かどうか。
  • 無料の割り当て、レート制限、および請求方法。
  • API キーを Git に送信しないでください。
  • サンプル出力が特定のモデルの機能に依存しているかどうか。

API キーを Python ファイルに直接書き込まないでください。環境変数または実験版 README で指定されている .env メソッドの使用を優先し、.env が Git によって無視されていることを確認します。

外部ウェアハウスとデータセット

第 6 章、第 7 章、第 9 章、および第 10 章の一部の評価、トレーニング、ブラウザおよびロボット プロジェクトはメイン リポジトリに直接含まれていないため、個別にクローンを作成する必要があります。現在 README に記載されている例は次のとおりです。

  • android_world、GAIA、OSWorld、SWE ベンチ、tau2 ベンチ、ターミナル ベンチ。
  • MiniMind、verl、SFTvsRL、Tinker Cookbook、およびその他のトレーニング プログラム;
  • browser-use と人類 claude-quickstarts;
  • TalkAct とスタンフォード ジェネレーティブ エージェント。

実験の README に commit が指定されている場合は、必要に応じてバージョンを切り替える必要があります。外部リポジトリの最新のメイン ブランチを直接使用すると、API、依存関係、またはディレクトリ構造の変更により、書籍内の結果を再現できない場合があります。

GPU と実際のハードウェア

トレーニング、大規模モデル推論、VLA、ロボット工学、Sim2Real の実験には、より大きなグラフィックス メモリや実際のデバイスが必要になる場合があります。通常のコンピュータは、最初に概念、API、コンテキスト、メモリ、MCP、および軽量の評価実験を完了できます。すべての章を完了するために最初から高価なハードウェアを購入しないでください。

読書を本当のエンジニアリングスキルに変える方法

各章では同じ学習ループのセットを使用できます。

  1. この章で解決する問題を 1 文で書きます。
  2. 入力、コンテキスト、モデル、ツール、出力のデータ フローを描画します。
  3. 最小限の実験を完了します。
  4. ツールのタイムアウト、コンテキストが長すぎる、またはフォーマット エラーが返されるなど、積極的に失敗を引き起こします。
  5. ログ、再試行、許可制限、または受け入れ条件を追加します。
  6. 固定テスト セットを使用して、変更前後の結果を比較します。
  7. 再利用可能なルールをプロジェクト文書またはスキルに整理します。

たとえば、第 4 章 MCP を学習する場合は、「ツール呼び出しが成功した」だけで終わるのではなく、パラメーターの検証、タイムアウト、エラー回復、権限の範囲も確認する必要があります。第 6 章の評価を検討するときは、美しい出力を一度見るだけでなく、サンプル、メトリクス、繰り返しの実験結果を記録してください。

PDF、EPUB、Web ページのソース コードから選択する方法

フォーム シーンに合わせて メモ
PDF 連続読み取り、印刷、固定ページ番号引用 メイン ブランチの構造が更新されるため、正式な引用には Release を使用することをお勧めします。
EPUB 携帯電話、タブレット、紙の電子書籍で読む リーダーが異なれば、コード ブロックとテーブルのサポートも異なります。
GitHub マークダウン 最新のコンテンツの表示、検索、変更の追跡 読書は電子書籍ほど一貫性がありません。
ローカルソースコード 注釈を付け、変更し、サポート実験を実行する Git のバージョンと依存関係を自分で管理する必要がある

PDF を自分で構築する必要がある場合、公式の手順では、pandoc、xelatex、ElegantBook ドキュメント クラスおよび関連フォントが必要であり、次のコマンドを実行します。

1
cd book && bash build_pdf.sh

このコマンドは、Linux、macOS、または既存の Bash/LaTeX 環境のユーザーにより適しています。 Windows ユーザーは WSL を使用できますが、最初にフォントと TeX の依存関係を確認する必要があります。そうしないと、中国語フォントまたは LaTeX パッケージの段階で失敗する可能性があります。

よくある誤解

88 の実験すべてをワンクリックで実行できると思っていました

さまざまな実験では、API、RAG、トレーニング、ブラウザ、GUI、音声、ロボットを広範囲の依存関係とともにカバーしています。正しいアプローチは、ルート ディレクトリのフル インストール コマンドを探すのではなく、README で各章を個別に設定することです。

PDF のみをダウンロードし、コードのバージョンは確認しないでください。

PDF は読むのに適していますが、実験が失敗した場合は、対応する章のディレクトリに戻り、README、依存ファイル、指定されたコミットおよび問題を確認する必要があります。この本に記載されている概念とコードはさまざまな速度で進化しており、盲目的に最新のものを追いかけるよりも修正されたバージョンを再現する方が簡単です。

すべての外部プロジェクトを直接実行する

外部リポジトリは大規模になる可能性があり、データセット、GPU、コンテナ、または特定のライセンスが必要になる場合があります。最初にそれぞれのライセンスとハードウェア要件を読み、現在の学習章に必要なプロジェクトのみを複製します。

エージェントを大規模なモデルとみなす

本書全体を通じて、エージェントにはコンテキストとツールも含まれることが繰り返し強調されています。実際のシステムでは、プロンプト、メモリ、権限、実行環境、状態の永続性、評価によって安定して動作するかどうかが決まることが多いです。大規模なモデルでは、すべてのエンジニアリング上の問題を自動的に解決することはできません。

どの読者に適していますか?

以下に適しています:

  • フレームワークを呼び出すことしかできない人ではなく、システムが AI エージェントを理解できるようにしたい。
  • コーディング エージェント、ナレッジ アシスタント、または自動化されたワークフローを開発しているエンジニア。
  • コンテキスト、メモリ、MCP、評価、トレーニング後の知識を完璧にしたい開発者。
  • コース、ブッククラブ、またはチームのトレーニング資料が必要な人々。
  • 実験を再現し、失敗の過程を記録する意欲のある学習者。

フレームワークの簡単なインストール コマンドを探しているだけの場合、この本は長く感じるかもしれません。最初にトピックごとに章を読んでから、ルート全体を完了するかどうかを決定できます。

概要

bojieli/ai-agent-book では、概念、コンテキスト、ツールから評価、トレーニング、マルチモダリティ、マルチエージェントのコラボレーションまで AI エージェントについて説明し、多数のサポート実験を提供します。 1 日で読めるプロジェクトの紹介としてではなく、数週間にわたる学習計画として適しています。

自分の目標に基づいて章を選択し、最初に最小限の実験を完了してから、徐々にモデル、ツール、メモリ、評価を追加することをお勧めします。 「章を理解する」ことを「最後まで実行し、失敗し、修復し、実験を受け入れる」に変えることができる限り、この一連のオープンソース教科書は真にエンジニアリングの実践に入ることができます。

プロジェクトアドレス: bojieli/ai-agent-book