bojieli/ai-agent-book es el depósito principal del libro de texto de código abierto “Comprensión profunda del agente de IA: principios de diseño y práctica de ingeniería” escrito por Li Bojie. El proyecto divulga el texto completo del libro, PDF, EPUB, ilustraciones y experimentos de código organizados por capítulos. Utiliza 10 capítulos para conectar la base del Agente, el contexto, la memoria, las herramientas, el Agente de codificación, la evaluación, la capacitación, la autoevolución, la multimodalidad y la colaboración entre múltiples Agentes.
Todo el libro utiliza una fórmula fácil de entender:
|
|
Este libro es adecuado para personas que ya pueden llamar a modelos grandes pero que desean comprender el sistema de ingeniería del agente. En lugar de simplemente introducir algunos marcos, coloca el arnés, la gestión del contexto, la invocación de herramientas, la evaluación y el código práctico más allá del modelo en la misma ruta de aprendizaje.
Conclusión rápida
- El texto chino, PDF y EPUB de todo el libro se pueden leer de forma gratuita y el almacén utiliza la licencia Apache 2.0.
- Hay 10 capítulos en total y 88 proyectos, más de 70 de los cuales se pueden ejecutar de forma independiente.
- El texto principal está principalmente en chino, con traducciones comunitarias tradicionales taiwanesas, inglés, tamil y vietnamita disponibles.
- La traducción comunitaria puede quedar retrasada con respecto a la versión original en chino. Si está interesado en el contenido más reciente, primero debe consultar
book/. - Algunos experimentos requieren claves API, GPU, conjuntos de datos externos, entornos de navegador o hardware de robot. No se puede suponer que todos los experimentos puedan realizarse directamente en un ordenador portátil normal.
Dónde leer y descargar
Página de inicio del proyecto:
https://github.com/bojieli/ai-agent-book
El archivo README del almacén proporciona los enlaces de compilación más recientes para PDF y EPUB chinos, y también puede leer el texto fuente de Markdown directamente en GitHub. El texto chino se encuentra principalmente en:
|
|
El catálogo multilingüe incluye:
|
|
Si recién estás leyendo, es más estable descargar directamente la versión corregida en Release; Si desea realizar un seguimiento de la última revisión, puede leer el texto fuente PDF, EPUB o book/ generado por la rama principal. La versión fija es fácil de consultar y tomar notas, y la rama principal puede continuar agregando erratas y contenido nuevo.
¿De qué habla el Capítulo 10?
| Capítulo | Tema | Puntos de aprendizaje |
|---|---|---|
| Capítulo 1 | Conceptos básicos del agente | Definición de agente, capacidades de modelo e ingeniería de arneses |
| Capítulo 2 | Ingeniería de Contexto | Caché KV, ingeniería de sugerencias, habilidades de agente, compresión de contexto |
| Capítulo 3 | Memoria de usuario y base de conocimientos | Memoria de sesiones cruzadas, RAG, indexación estructurada y gráficos de conocimiento |
| Capítulo 4 | Herramientas | MCP, herramientas de concientización/ejecución/colaboración, agentes asincrónicos y descubrimiento de herramientas |
| Capítulo 5 | Agentes de codificación y generación de código | Componentes y flujos de trabajo de agentes de codificación de grado de producción |
| Capítulo 6 | Evaluación del agente | Entorno, métricas, importancia estadística y selección basada en evaluaciones |
| Capítulo 7 | Entrenamiento post-modelo | Preformación, SFT, RL, internalización de llamadas de herramientas y eficiencia de muestras |
| Capítulo 8 | Autoevolución del agente | Experimente el aprendizaje, la destilación rápida y la creación de herramientas |
| Capítulo 9 | Interacción multimodal y en tiempo real | Voz, uso de computadoras, GUI y robots |
| Capítulo 10 | Colaboración entre múltiples agentes | División de tareas, intercambio de contexto y aislamiento, comportamiento grupal |
Si no está familiarizado con Agent, MCP, RAG y Token, primero puede leer el [Glosario AI Agent, MCP, RAG y Token] (/es/2026/04/23/ai-terms-agent-mcp-rag-token-explained/) en el sitio. Si la atención se centra en la colaboración de múltiples agentes de codificación, puede combinar [Comparación de subagentes de Claude Code y equipos de agentes] (/es/2026/04/22/claude-code-subagents-vs-agent-teams/) para comprender las diferencias de programación en las herramientas reales.
Tres rutas de aprendizaje recomendadas
Ruta 1: Desarrollador de productos y aplicaciones
Orden sugerido:
|
|
Primero, comprenda la estructura del Agente y luego aprenda sobre el contexto, la memoria, las herramientas y la evaluación. Una vez completado, debería poder determinar si los problemas con un producto del Agente se deben al modelo, el contexto, la interfaz de la herramienta o la falta de una evaluación repetible.
Ruta 2: desarrollador de herramientas de programación de IA
Orden sugerido:
|
|
Centrarse en el agente de codificación, la ejecución de herramientas, los límites de seguridad, la compresión de contexto, la evaluación de código y la división del trabajo entre múltiples agentes. Cuando aprenda, no se limite a mirar la demostración final. Debe registrar cómo el Agente selecciona archivos, llama a herramientas, maneja fallas y verifica resultados.
Ruta 3: Modelo de formación y dirección de la investigación
Orden sugerido:
|
|
Primero establezca la conciencia de la evaluación y luego ingrese a SFT, RL, autoevolución, multimodalidad y multiagente. Esto puede evitar entrenar el modelo primero y luego complementar los indicadores, lo que da como resultado conclusiones experimentales incomparables.
¿Cómo se deben ejecutar 88 experimentos?
El almacén proporciona directorios de códigos por capítulos:
|
|
El estado y las dependencias de diferentes experimentos no son los mismos. Sugerencias antes de comenzar:
- Leer primero el texto del capítulo correspondiente;
- Abra el archivo README en el directorio del capítulo;
- Confirmar si la marca del experimento es ejecutable, reproducible o un ejercicio de diseño;
- Verifique los requisitos de Python, Node.js, GPU, clave API y conjunto de datos;
- Utilice un entorno virtual independiente para instalar dependencias;
- Ejecute primero el ejemplo más pequeño y luego cambie el modelo, los datos o las herramientas;
- Guarde entradas, salidas, versiones dependientes y resultados de aceptación.
Puedes clonar el repositorio primero:
|
|
No asuma que hay un comando de instalación unificado directamente en el directorio raíz del repositorio. Los 88 proyectos involucran diferentes marcos y dependencias. Debe ingresar a los capítulos específicos y directorios experimentales y seguir estrictamente las operaciones README correspondientes.
¿Qué experimentos requieren recursos adicionales?
Clave API
Algunos experimentos requieren acceso a la API del modelo grande. El archivo README enumera opciones como Kimi, GLM, SiliconFlow, Volcano Engine y OpenRouter. Antes de usar, confirme:
- Si se admite la región donde se encuentra la cuenta;
- Si el nombre del modelo y la interfaz siguen siendo válidos;
- Cuota gratuita, límite de tarifa y método de facturación;
- No envíe la clave API a Git;
- Si el resultado de la muestra se basa en capacidades específicas del modelo.
No escriba la clave API directamente en el archivo Python. Priorice el uso de variables de entorno o el método .env especificado en el archivo README experimental y confirme que Git ha ignorado .env.
Almacenes y conjuntos de datos externos
Algunos proyectos de evaluación, capacitación, navegador y robot de los Capítulos 6, 7, 9 y 10 no se incluyen directamente en el repositorio principal y deben clonarse por separado. Los ejemplos que figuran actualmente en el archivo README incluyen:
android_world, GAIA, OSWorld, SWE-bench, tau2-bench, terminal-bench;- MiniMind, verl, SFTvsRL, Tinker Cookbook y otros programas de formación;
browser-usey Antrópicoclaude-quickstarts;- TalkAct y Agentes Generativos de Stanford.
Si el experimento README especifica confirmación, la versión debe cambiarse según sea necesario. Es posible que el uso directo de la última rama principal del repositorio externo no pueda reproducir los resultados del libro debido a cambios en la API, las dependencias o la estructura del directorio.
GPU y hardware real
El entrenamiento, la inferencia de modelos grandes, VLA, la robótica y los experimentos Sim2Real pueden requerir mayor memoria gráfica o dispositivos reales. Las computadoras comunes pueden primero completar conceptos, API, contextos, memorias, MCP y experimentos de evaluación livianos; No compre hardware costoso desde el principio para completar todos los capítulos.
Cómo convertir la lectura en verdaderas habilidades de ingeniería
Cada capítulo puede utilizar el mismo conjunto de bucles de aprendizaje:
- Escriba en una oración el problema a resolver en este capítulo;
- Dibujar el flujo de datos de entrada, contexto, modelo, herramienta y salida;
- Complete un experimento mínimo;
- Causar activamente una falla, como tiempo de espera de la herramienta, contexto demasiado largo o error de formato de devolución;
- Agregar registros, reintentos, restricciones de permisos o condiciones de aceptación;
- Utilice el conjunto de pruebas fijo para comparar los resultados antes y después de la modificación;
- Organice reglas reutilizables en documentos o habilidades del proyecto.
Por ejemplo, al estudiar el Capítulo 4 de MCP, no debe detenerse en “la llamada a la herramienta fue exitosa”, sino también verificar la validación de parámetros, los tiempos de espera, la recuperación de errores y el alcance de los permisos. Al estudiar el Capítulo 6 Evaluación, no se limite a mirar el hermoso resultado una vez, sino que registre muestras, métricas y resultados de experimentos repetidos.
Cómo elegir entre PDF, EPUB y código fuente de página web
| Formulario | Adecuado para la escena | Notas |
|---|---|---|
| Lectura continua, impresión, citación de número de página fijo | Se actualizará la construcción de la sucursal principal y se recomienda utilizar Liberación para citaciones formales | |
| EPUB | Lectura en teléfonos móviles, tabletas y libros electrónicos en papel | Diferentes lectores tienen diferente soporte para tablas y bloques de código |
| Rebaja de GitHub | Ver el contenido más reciente, buscar y realizar un seguimiento de los cambios | La lectura no es tan consistente como los libros electrónicos |
| Código fuente local | Anotar, modificar y ejecutar experimentos de soporte | Necesita administrar las versiones y dependencias de Git usted mismo |
Si necesita crear el PDF usted mismo, las instrucciones oficiales requieren clases de documentos pandoc, xelatex, ElegantBook y fuentes relacionadas, y luego ejecutar:
|
|
Este comando es más adecuado para usuarios de Linux, macOS o entornos Bash/LaTeX existentes. Los usuarios de Windows pueden usar WSL, pero primero deben confirmar las dependencias de fuente y TeX; de lo contrario, puede fallar en la etapa de fuente china o paquete LaTeX.
Malentendidos comunes
Pensé que los 88 experimentos se podrían ejecutar con un solo clic
Los diferentes experimentos cubren API, RAG, capacitación, navegador, GUI, voz y robots, con una amplia gama de dependencias. El enfoque correcto es configurar cada capítulo por separado en el archivo README en lugar de buscar un comando de instalación completo en el directorio raíz.
Descargue solo el PDF, no mire la versión del código
El PDF es adecuado para leer, pero si el experimento falla, debe regresar al directorio del capítulo correspondiente, verificar el archivo README, los archivos dependientes, las confirmaciones especificadas y los problemas. Los conceptos y códigos del libro evolucionan a diferentes velocidades, y una versión fija es más fácil de reproducir que perseguir ciegamente la última versión.
Ejecute todos los proyectos externos directamente
Los repositorios externos pueden ser grandes y requerir conjuntos de datos, GPU, contenedores o licencias específicas. Clone solo los proyectos que necesita para el capítulo de estudio actual, leyendo primero las licencias respectivas y los requisitos de hardware.
Equate Agent como modelo grande
A lo largo del libro se enfatiza repetidamente que Agent también incluye contexto y herramientas. En los sistemas reales, las indicaciones, la memoria, los permisos, el entorno de ejecución, la persistencia del estado y la evaluación a menudo determinan si puede funcionar de manera estable. Los modelos más grandes no pueden resolver automáticamente todos los problemas de ingeniería.
¿Para qué lectores es adecuado?
Adecuado para:
- Quiero que el sistema entienda al Agente AI, en lugar de alguien que solo puede llamar al marco;
- Ingenieros que desarrollan agentes de codificación, asistentes de conocimiento o flujos de trabajo automatizados;
- Desarrolladores que quieran completar sus conocimientos sobre contexto, memoria, MCP, evaluación y post-formación;
- Personas que necesitan materiales para cursos, clubes de lectura o formación de equipos;
- Estudiantes que estén dispuestos a reproducir experimentos y registrar el proceso de falla.
Si sólo está buscando comandos de instalación rápida para un marco, este libro puede parecer largo. Puedes leer primero un capítulo por tema y luego decidir si completas la ruta completa.
Resumen
bojieli/ai-agent-book explica AI Agent desde conceptos, contextos y herramientas hasta evaluación, capacitación, colaboración multimodal y entre múltiples agentes, y proporciona una gran cantidad de experimentos de apoyo. Es más adecuado como plan de estudio de varias semanas de duración que como introducción a un proyecto que se puede leer en un día.
Se recomienda elegir capítulos según sus propios objetivos, completar primero un experimento mínimo y luego agregar gradualmente modelos, herramientas, memoria y evaluación. Siempre que “comprender un capítulo” se pueda transformar en “recorrer, fallar, reparar y aceptar un experimento”, este conjunto de libros de texto de código abierto realmente puede ingresar a la práctica de la ingeniería.
Dirección del proyecto: bojieli/ai-agent-book