Bonsai es un conjunto de modelos nativos de bajo bit. El repositorio de demostración oficial proporciona tamaños de 1.7B, 4B, 8B y 27B, e integra chat, visión, potencia de inferencia, llamadas a herramientas de estilo OpenAI y MCP.
Dirección del proyecto:
https://github.com/PrismML-Eng/Bonsai-demo
“1 bit” no significa que cuando se ejecuta el modelo, sea tan simple como dividir el número de parámetros por ocho. Los pesos se pueden comprimir muy pequeños, pero la inferencia aún requiere memoria adicional como KV Cache, tiempo de ejecución, contexto y codificación de imágenes. Al seleccionar un modelo, observe la memoria disponible de toda la máquina, no solo el tamaño del archivo de descarga.
Elija primero el modelo de 1 bit o de tres valores
La demostración oficial ofrece dos familias de modelos:
| Familia | Características | Escenas adecuadas |
|---|---|---|
| Bonsái de 1 bit | Tamaño de peso más pequeño, alrededor de 1.125 bits/peso | Priorizar los experimentos de capacidad y dispositivos móviles |
| Bonsái Ternario | Empaquetado en aproximadamente 2 bits, mayor calidad, opción predeterminada para demostraciones | Chat diario de escritorio, imágenes y llamadas de herramientas |
Se recomienda seleccionar el Ternario-Bonsái predeterminado por primera vez. No lo utilice de forma predeterminada para obtener mejores resultados sólo porque “1 bit” sea más llamativo.
Preparación antes de la instalación de Windows
Se recomienda preparar:
- Windows 11 de 64 bits;
- Git;
- PowerShell;
- Memoria y espacio en disco suficientes;
- Red con acceso a Hugging Face;
- Se requiere Hugging Face Token para el modelo 27B.
El estado de disponibilidad de scripts y modelos puede variar entre versiones. Debe verificar el archivo README del almacén antes de ejecutarlo y no escribir permanentemente la dirección del modelo en el tutorial anterior.
Clonar proyecto
|
|
Primero verifique el espacio disponible:
|
|
Los modelos, cachés y archivos binarios pueden ocupar desde varios GB hasta decenas de GB. No comience la descarga directamente cuando no haya suficiente espacio en el disco del sistema.
Seleccionar tamaño del modelo
Por defecto se utiliza 27B:
|
|
Para computadoras normales, se recomienda comenzar con 4B u 8B:
|
|
Seleccione una familia de modelos de tres valores:
|
|
Si quieres probar 1 bit:
|
|
Las variables de entorno solo son válidas para la sesión actual de PowerShell y deben restablecerse después de cerrar la ventana.
Configurar el token de Hugging Face
Si el repositorio de modelos seleccionado requiere autorización:
|
|
No escriba tokens reales en artículos, scripts, repositorios de Git o capturas de pantalla de terminales. Puedes borrarlo después de su uso:
|
|
Si aparece 401 o 403, primero confirme que ha aceptado el permiso del modelo en la página Hugging Face y luego verifique si el Token tiene permiso de lectura.
Ejecute el script de instalación
Proceso oficial de Windows:
|
|
-Scope Process solo afecta al proceso actual de PowerShell. Restaurar la política original después de cerrar el terminal es más confiable que reducir permanentemente la política de ejecución del sistema.
El script instala dependencias basadas en variables de entorno, descarga el modelo y prepara los archivos binarios necesarios para su ejecución. No elimine repetidamente todo el directorio cuando se interrumpa la descarga. Primero verifique si el soporte de caché y script continúa descargándose.
Prueba de línea de comando
Una vez completada la instalación, puede enviar directamente la palabra de aviso:
|
|
Si solo desea confirmar que el modelo se puede cargar, utilice primero una palabra de sugerencia breve y un contexto breve. Los contextos prolongados aumentarán significativamente la caché KV y pueden provocar que los modelos que se lanzaron originalmente se queden sin memoria repentinamente.
Inicie la interfaz de chat web
La demostración oficial puede iniciar el servidor llama local y proporcionar interfaces de chat, visuales y de llamada de herramientas de forma predeterminada. Los scripts de Windows actuales en el almacén se pueden ajustar con la versión, puede verificar primero:
|
|
Después del inicio, normalmente acceda a:
|
|
Si no se puede acceder al puerto, verifique si el proceso aún se está ejecutando, si el mensaje del firewall está denegado y si 8080 está ocupado por otros programas.
Cómo utilizar la capacidad visual
La demostración de Bonsai admite el envío de fotos, capturas de pantalla y archivos PDF. Preste atención a lo siguiente cuando lo utilice en la práctica:
- Las imágenes ocuparán memoria adicional;
- Las capturas de pantalla de alta resolución no necesariamente conducen a un reconocimiento de texto más preciso;
- Si el PDF tiene muchas páginas, se debe dividir primero o enviar sólo las páginas relevantes;
- Aunque los documentos privados se infieren localmente, se debe confirmar la interfaz, los registros y las ubicaciones de almacenamiento de archivos temporales.
Primero puede probarlo con una simple captura de pantalla: pídale al modelo que enumere los botones de la página, explique el mensaje de error y luego verifique si ha fabricado contenido invisible.
Llamadas a herramientas y MCP
La demostración es compatible con el estilo OpenAI tool_calls y puede conectarse al servidor MCP en la interfaz de demostración. El modelo realiza llamadas a herramientas, pero es el programa anfitrión el que realmente ejecuta las herramientas.
Antes de acceder al archivo, terminal o navegador MCP, primero debe confirmar:
- ¿Qué herramientas expondrá el servidor?
- Si limitarlo al directorio de trabajo especificado;
- Si los comandos peligrosos requieren confirmación manual;
- Si la salida de la herramienta se escribe en el registro de chat;
- ¿Se llamará repetidamente al modelo cuando falle?
El pequeño tamaño del modelo de bits bajos no significa que el juicio de llamada de la herramienta deba ser confiable. Se deben conservar las aprobaciones y los privilegios mínimos cuando se trata de eliminar archivos, ejecutar shells, enviar mensajes o modificar sistemas externos.
¿Qué tamaño de modelo puede ejecutar la computadora?
Lo siguiente sólo puede utilizarse como un punto de partida conservador. Los requisitos reales se verán afectados por el formato del modelo, la longitud del contexto, el backend en ejecución y la entrada visual:
| Memoria disponible | Puntos de partida recomendados |
|---|---|
| 8GB | 1.7B, contexto corto, cerrar otros grandes programas |
| 16GB | 4B, prueba primero el chat de texto |
| 32GB | 8B, agregando progresivamente contexto y aportes visuales |
| 64 GB y más | Considere 27B y el sistema de reserva y el espacio de caché KV |
Incluso si pudieran caber 27B de peso en la memoria, la velocidad probablemente estaría limitada por el ancho de banda de la memoria y el conjunto de instrucciones de la CPU. Poder cargar no significa que la experiencia interactiva sea fluida.
Preguntas frecuentes
PowerShell prohíbe la ejecución de scripts
Liberar sólo para el proceso actual:
|
|
No modifique directamente la política de ejecución permanente de toda la computadora.
Informes de descarga de modelos 401 o 403
Compruebe si el modelo requiere permiso, si BONSAI_TOKEN existe y si el token tiene permiso de lectura:
|
|
Memoria insuficiente al cargar
Cambiar a un modelo más pequeño:
|
|
También acorte el contexto, desactive la información visual y otros programas que acaparan la memoria. No confíe en el archivo de paginación de Windows para “ejecutar a fondo” un modelo que excede considerablemente la memoria física. La velocidad suele ser muy pobre.
La velocidad de generación es muy lenta.
Confirme el backend real, el conjunto de instrucciones de la CPU y la configuración de subprocesos utilizados. La primera ejecución también puede incluir la carga del modelo, el almacenamiento en caché o el tiempo de preparación del kernel, y la latencia de la primera ronda debe verse por separado de las velocidades de generación posteriores.
MCP puede conectarse pero la llamada a la herramienta es inestable
Primera prueba con una herramienta con un solo parámetro, parámetros simples y de solo lectura. Si a menudo se completan parámetros incorrectos para modelos pequeños, se debe reducir la cantidad de herramientas, agregar descripciones claras o reemplazar las familias y tamaños de modelos por otros de mayor calidad.
Cómo elegir entre Bonsai y Ollama
Ollama es una herramienta de gestión y ejecución de modelos, y Bonsai es un modelo y su entorno de presentación. Los dos no son productos de la misma capa.
- Si desea administrar de manera uniforme múltiples modelos comunes y proporcionar API rápidamente: dé prioridad a Ollama;
- Quiere estudiar pesos triples o de 1 bit, probar imágenes y cadenas de herramientas oficiales: use Bonsai Demo;
- Si desea poner Bonsai en una aplicación existente: primero confirme si su tiempo de ejecución puede cargar el formato actual directamente;
- Simplemente mirar “archivos de modelos más pequeños” no es suficiente para decidir la solución; también compare la calidad, la velocidad, el contexto y la confiabilidad de las llamadas de herramientas.
Se recomienda utilizar primero 4B Ternary-Bonsai para completar el ciclo cerrado de texto, visual y una herramienta MCP de solo lectura, y luego decidir si descargar 27B o cambiar a la familia de 1 bit.