Cómo aprender "Comprensión profunda del agente AI": 10 capítulos de libros de texto de código abierto y 88 guías de experimentos

bojieli/ai-agent-book ha abierto el texto completo, PDF, EPUB y 88 experimentos de apoyo de "Comprensión profunda del agente de IA: principios de diseño y práctica de ingeniería". Este artículo organiza la estructura de los capítulos, la ruta de lectura, la reproducción experimental y las notas de uso.

bojieli/ai-agent-book es el depósito principal del libro de texto de código abierto “Comprensión profunda del agente de IA: principios de diseño y práctica de ingeniería” escrito por Li Bojie. El proyecto divulga el texto completo del libro, PDF, EPUB, ilustraciones y experimentos de código organizados por capítulos. Utiliza 10 capítulos para conectar la base del Agente, el contexto, la memoria, las herramientas, el Agente de codificación, la evaluación, la capacitación, la autoevolución, la multimodalidad y la colaboración entre múltiples Agentes.

Todo el libro utiliza una fórmula fácil de entender:

1
Agent = LLM + 上下文 + 工具

Este libro es adecuado para personas que ya pueden llamar a modelos grandes pero que desean comprender el sistema de ingeniería del agente. En lugar de simplemente introducir algunos marcos, coloca el arnés, la gestión del contexto, la invocación de herramientas, la evaluación y el código práctico más allá del modelo en la misma ruta de aprendizaje.

Conclusión rápida

  • El texto chino, PDF y EPUB de todo el libro se pueden leer de forma gratuita y el almacén utiliza la licencia Apache 2.0.
  • Hay 10 capítulos en total y 88 proyectos, más de 70 de los cuales se pueden ejecutar de forma independiente.
  • El texto principal está principalmente en chino, con traducciones comunitarias tradicionales taiwanesas, inglés, tamil y vietnamita disponibles.
  • La traducción comunitaria puede quedar retrasada con respecto a la versión original en chino. Si está interesado en el contenido más reciente, primero debe consultar book/.
  • Algunos experimentos requieren claves API, GPU, conjuntos de datos externos, entornos de navegador o hardware de robot. No se puede suponer que todos los experimentos puedan realizarse directamente en un ordenador portátil normal.

Dónde leer y descargar

Página de inicio del proyecto:

https://github.com/bojieli/ai-agent-book

El archivo README del almacén proporciona los enlaces de compilación más recientes para PDF y EPUB chinos, y también puede leer el texto fuente de Markdown directamente en GitHub. El texto chino se encuentra principalmente en:

1
2
3
4
5
6
book/introduction.md
book/chapter1.md
book/chapter2.md
...
book/chapter10.md
book/afterword.md

El catálogo multilingüe incluye:

1
2
3
4
book-zhtw/
book-en/
book-ta/
book-vi/

Si recién estás leyendo, es más estable descargar directamente la versión corregida en Release; Si desea realizar un seguimiento de la última revisión, puede leer el texto fuente PDF, EPUB o book/ generado por la rama principal. La versión fija es fácil de consultar y tomar notas, y la rama principal puede continuar agregando erratas y contenido nuevo.

¿De qué habla el Capítulo 10?

Capítulo Tema Puntos de aprendizaje
Capítulo 1 Conceptos básicos del agente Definición de agente, capacidades de modelo e ingeniería de arneses
Capítulo 2 Ingeniería de Contexto Caché KV, ingeniería de sugerencias, habilidades de agente, compresión de contexto
Capítulo 3 Memoria de usuario y base de conocimientos Memoria de sesiones cruzadas, RAG, indexación estructurada y gráficos de conocimiento
Capítulo 4 Herramientas MCP, herramientas de concientización/ejecución/colaboración, agentes asincrónicos y descubrimiento de herramientas
Capítulo 5 Agentes de codificación y generación de código Componentes y flujos de trabajo de agentes de codificación de grado de producción
Capítulo 6 Evaluación del agente Entorno, métricas, importancia estadística y selección basada en evaluaciones
Capítulo 7 Entrenamiento post-modelo Preformación, SFT, RL, internalización de llamadas de herramientas y eficiencia de muestras
Capítulo 8 Autoevolución del agente Experimente el aprendizaje, la destilación rápida y la creación de herramientas
Capítulo 9 Interacción multimodal y en tiempo real Voz, uso de computadoras, GUI y robots
Capítulo 10 Colaboración entre múltiples agentes División de tareas, intercambio de contexto y aislamiento, comportamiento grupal

Si no está familiarizado con Agent, MCP, RAG y Token, primero puede leer el [Glosario AI Agent, MCP, RAG y Token] (/es/2026/04/23/ai-terms-agent-mcp-rag-token-explained/) en el sitio. Si la atención se centra en la colaboración de múltiples agentes de codificación, puede combinar [Comparación de subagentes de Claude Code y equipos de agentes] (/es/2026/04/22/claude-code-subagents-vs-agent-teams/) para comprender las diferencias de programación en las herramientas reales.

Tres rutas de aprendizaje recomendadas

Ruta 1: Desarrollador de productos y aplicaciones

Orden sugerido:

1
第 1 章 -> 第 2 章 -> 第 3 章 -> 第 4 章 -> 第 6 章

Primero, comprenda la estructura del Agente y luego aprenda sobre el contexto, la memoria, las herramientas y la evaluación. Una vez completado, debería poder determinar si los problemas con un producto del Agente se deben al modelo, el contexto, la interfaz de la herramienta o la falta de una evaluación repetible.

Ruta 2: desarrollador de herramientas de programación de IA

Orden sugerido:

1
第 1 章 -> 第 2 章 -> 第 4 章 -> 第 5 章 -> 第 6 章 -> 第 10 章

Centrarse en el agente de codificación, la ejecución de herramientas, los límites de seguridad, la compresión de contexto, la evaluación de código y la división del trabajo entre múltiples agentes. Cuando aprenda, no se limite a mirar la demostración final. Debe registrar cómo el Agente selecciona archivos, llama a herramientas, maneja fallas y verifica resultados.

Ruta 3: Modelo de formación y dirección de la investigación

Orden sugerido:

1
第 1 章 -> 第 6 章 -> 第 7 章 -> 第 8 章 -> 第 9 章 -> 第 10 章

Primero establezca la conciencia de la evaluación y luego ingrese a SFT, RL, autoevolución, multimodalidad y multiagente. Esto puede evitar entrenar el modelo primero y luego complementar los indicadores, lo que da como resultado conclusiones experimentales incomparables.

¿Cómo se deben ejecutar 88 experimentos?

El almacén proporciona directorios de códigos por capítulos:

1
2
3
4
chapter1/
chapter2/
...
chapter10/

El estado y las dependencias de diferentes experimentos no son los mismos. Sugerencias antes de comenzar:

  1. Leer primero el texto del capítulo correspondiente;
  2. Abra el archivo README en el directorio del capítulo;
  3. Confirmar si la marca del experimento es ejecutable, reproducible o un ejercicio de diseño;
  4. Verifique los requisitos de Python, Node.js, GPU, clave API y conjunto de datos;
  5. Utilice un entorno virtual independiente para instalar dependencias;
  6. Ejecute primero el ejemplo más pequeño y luego cambie el modelo, los datos o las herramientas;
  7. Guarde entradas, salidas, versiones dependientes y resultados de aceptación.

Puedes clonar el repositorio primero:

1
2
git clone https://github.com/bojieli/ai-agent-book.git
cd ai-agent-book

No asuma que hay un comando de instalación unificado directamente en el directorio raíz del repositorio. Los 88 proyectos involucran diferentes marcos y dependencias. Debe ingresar a los capítulos específicos y directorios experimentales y seguir estrictamente las operaciones README correspondientes.

¿Qué experimentos requieren recursos adicionales?

Clave API

Algunos experimentos requieren acceso a la API del modelo grande. El archivo README enumera opciones como Kimi, GLM, SiliconFlow, Volcano Engine y OpenRouter. Antes de usar, confirme:

  • Si se admite la región donde se encuentra la cuenta;
  • Si el nombre del modelo y la interfaz siguen siendo válidos;
  • Cuota gratuita, límite de tarifa y método de facturación;
  • No envíe la clave API a Git;
  • Si el resultado de la muestra se basa en capacidades específicas del modelo.

No escriba la clave API directamente en el archivo Python. Priorice el uso de variables de entorno o el método .env especificado en el archivo README experimental y confirme que Git ha ignorado .env.

Almacenes y conjuntos de datos externos

Algunos proyectos de evaluación, capacitación, navegador y robot de los Capítulos 6, 7, 9 y 10 no se incluyen directamente en el repositorio principal y deben clonarse por separado. Los ejemplos que figuran actualmente en el archivo README incluyen:

  • android_world, GAIA, OSWorld, SWE-bench, tau2-bench, terminal-bench;
  • MiniMind, verl, SFTvsRL, Tinker Cookbook y otros programas de formación;
  • browser-use y Antrópico claude-quickstarts;
  • TalkAct y Agentes Generativos de Stanford.

Si el experimento README especifica confirmación, la versión debe cambiarse según sea necesario. Es posible que el uso directo de la última rama principal del repositorio externo no pueda reproducir los resultados del libro debido a cambios en la API, las dependencias o la estructura del directorio.

GPU y hardware real

El entrenamiento, la inferencia de modelos grandes, VLA, la robótica y los experimentos Sim2Real pueden requerir mayor memoria gráfica o dispositivos reales. Las computadoras comunes pueden primero completar conceptos, API, contextos, memorias, MCP y experimentos de evaluación livianos; No compre hardware costoso desde el principio para completar todos los capítulos.

Cómo convertir la lectura en verdaderas habilidades de ingeniería

Cada capítulo puede utilizar el mismo conjunto de bucles de aprendizaje:

  1. Escriba en una oración el problema a resolver en este capítulo;
  2. Dibujar el flujo de datos de entrada, contexto, modelo, herramienta y salida;
  3. Complete un experimento mínimo;
  4. Causar activamente una falla, como tiempo de espera de la herramienta, contexto demasiado largo o error de formato de devolución;
  5. Agregar registros, reintentos, restricciones de permisos o condiciones de aceptación;
  6. Utilice el conjunto de pruebas fijo para comparar los resultados antes y después de la modificación;
  7. Organice reglas reutilizables en documentos o habilidades del proyecto.

Por ejemplo, al estudiar el Capítulo 4 de MCP, no debe detenerse en “la llamada a la herramienta fue exitosa”, sino también verificar la validación de parámetros, los tiempos de espera, la recuperación de errores y el alcance de los permisos. Al estudiar el Capítulo 6 Evaluación, no se limite a mirar el hermoso resultado una vez, sino que registre muestras, métricas y resultados de experimentos repetidos.

Cómo elegir entre PDF, EPUB y código fuente de página web

Formulario Adecuado para la escena Notas
PDF Lectura continua, impresión, citación de número de página fijo Se actualizará la construcción de la sucursal principal y se recomienda utilizar Liberación para citaciones formales
EPUB Lectura en teléfonos móviles, tabletas y libros electrónicos en papel Diferentes lectores tienen diferente soporte para tablas y bloques de código
Rebaja de GitHub Ver el contenido más reciente, buscar y realizar un seguimiento de los cambios La lectura no es tan consistente como los libros electrónicos
Código fuente local Anotar, modificar y ejecutar experimentos de soporte Necesita administrar las versiones y dependencias de Git usted mismo

Si necesita crear el PDF usted mismo, las instrucciones oficiales requieren clases de documentos pandoc, xelatex, ElegantBook y fuentes relacionadas, y luego ejecutar:

1
cd book && bash build_pdf.sh

Este comando es más adecuado para usuarios de Linux, macOS o entornos Bash/LaTeX existentes. Los usuarios de Windows pueden usar WSL, pero primero deben confirmar las dependencias de fuente y TeX; de lo contrario, puede fallar en la etapa de fuente china o paquete LaTeX.

Malentendidos comunes

Pensé que los 88 experimentos se podrían ejecutar con un solo clic

Los diferentes experimentos cubren API, RAG, capacitación, navegador, GUI, voz y robots, con una amplia gama de dependencias. El enfoque correcto es configurar cada capítulo por separado en el archivo README en lugar de buscar un comando de instalación completo en el directorio raíz.

Descargue solo el PDF, no mire la versión del código

El PDF es adecuado para leer, pero si el experimento falla, debe regresar al directorio del capítulo correspondiente, verificar el archivo README, los archivos dependientes, las confirmaciones especificadas y los problemas. Los conceptos y códigos del libro evolucionan a diferentes velocidades, y una versión fija es más fácil de reproducir que perseguir ciegamente la última versión.

Ejecute todos los proyectos externos directamente

Los repositorios externos pueden ser grandes y requerir conjuntos de datos, GPU, contenedores o licencias específicas. Clone solo los proyectos que necesita para el capítulo de estudio actual, leyendo primero las licencias respectivas y los requisitos de hardware.

Equate Agent como modelo grande

A lo largo del libro se enfatiza repetidamente que Agent también incluye contexto y herramientas. En los sistemas reales, las indicaciones, la memoria, los permisos, el entorno de ejecución, la persistencia del estado y la evaluación a menudo determinan si puede funcionar de manera estable. Los modelos más grandes no pueden resolver automáticamente todos los problemas de ingeniería.

¿Para qué lectores es adecuado?

Adecuado para:

  • Quiero que el sistema entienda al Agente AI, en lugar de alguien que solo puede llamar al marco;
  • Ingenieros que desarrollan agentes de codificación, asistentes de conocimiento o flujos de trabajo automatizados;
  • Desarrolladores que quieran completar sus conocimientos sobre contexto, memoria, MCP, evaluación y post-formación;
  • Personas que necesitan materiales para cursos, clubes de lectura o formación de equipos;
  • Estudiantes que estén dispuestos a reproducir experimentos y registrar el proceso de falla.

Si sólo está buscando comandos de instalación rápida para un marco, este libro puede parecer largo. Puedes leer primero un capítulo por tema y luego decidir si completas la ruta completa.

Resumen

bojieli/ai-agent-book explica AI Agent desde conceptos, contextos y herramientas hasta evaluación, capacitación, colaboración multimodal y entre múltiples agentes, y proporciona una gran cantidad de experimentos de apoyo. Es más adecuado como plan de estudio de varias semanas de duración que como introducción a un proyecto que se puede leer en un día.

Se recomienda elegir capítulos según sus propios objetivos, completar primero un experimento mínimo y luego agregar gradualmente modelos, herramientas, memoria y evaluación. Siempre que “comprender un capítulo” se pueda transformar en “recorrer, fallar, reparar y aceptar un experimento”, este conjunto de libros de texto de código abierto realmente puede ingresar a la práctica de la ingeniería.

Dirección del proyecto: bojieli/ai-agent-book