Ejecutar Bonsai en Windows: modelos de 1 bit, visión y herramientas MCP

Ejecuta modelos Bonsai de 1 bit y ternarios en Windows, elige el tamaño, usa visión y herramientas MCP, y comprende los compromisos de memoria, velocidad y calidad.

Bonsai es un conjunto de modelos nativos de bajo bit. El repositorio de demostración oficial proporciona tamaños de 1.7B, 4B, 8B y 27B, e integra chat, visión, potencia de inferencia, llamadas a herramientas de estilo OpenAI y MCP.

Dirección del proyecto:

https://github.com/PrismML-Eng/Bonsai-demo

“1 bit” no significa que cuando se ejecuta el modelo, sea tan simple como dividir el número de parámetros por ocho. Los pesos se pueden comprimir muy pequeños, pero la inferencia aún requiere memoria adicional como KV Cache, tiempo de ejecución, contexto y codificación de imágenes. Al seleccionar un modelo, observe la memoria disponible de toda la máquina, no solo el tamaño del archivo de descarga.

Elija primero el modelo de 1 bit o de tres valores

La demostración oficial ofrece dos familias de modelos:

Familia Características Escenas adecuadas
Bonsái de 1 bit Tamaño de peso más pequeño, alrededor de 1.125 bits/peso Priorizar los experimentos de capacidad y dispositivos móviles
Bonsái Ternario Empaquetado en aproximadamente 2 bits, mayor calidad, opción predeterminada para demostraciones Chat diario de escritorio, imágenes y llamadas de herramientas

Se recomienda seleccionar el Ternario-Bonsái predeterminado por primera vez. No lo utilice de forma predeterminada para obtener mejores resultados sólo porque “1 bit” sea más llamativo.

Preparación antes de la instalación de Windows

Se recomienda preparar:

  • Windows 11 de 64 bits;
  • Git;
  • PowerShell;
  • Memoria y espacio en disco suficientes;
  • Red con acceso a Hugging Face;
  • Se requiere Hugging Face Token para el modelo 27B.

El estado de disponibilidad de scripts y modelos puede variar entre versiones. Debe verificar el archivo README del almacén antes de ejecutarlo y no escribir permanentemente la dirección del modelo en el tutorial anterior.

Clonar proyecto

1
2
git clone https://github.com/PrismML-Eng/Bonsai-demo.git
cd Bonsai-demo

Primero verifique el espacio disponible:

1
Get-PSDrive -PSProvider FileSystem

Los modelos, cachés y archivos binarios pueden ocupar desde varios GB hasta decenas de GB. No comience la descarga directamente cuando no haya suficiente espacio en el disco del sistema.

Seleccionar tamaño del modelo

Por defecto se utiliza 27B:

1
$env:BONSAI_MODEL = "27B"

Para computadoras normales, se recomienda comenzar con 4B u 8B:

1
$env:BONSAI_MODEL = "4B"

Seleccione una familia de modelos de tres valores:

1
$env:BONSAI_FAMILY = "ternary"

Si quieres probar 1 bit:

1
$env:BONSAI_FAMILY = "1bit"

Las variables de entorno solo son válidas para la sesión actual de PowerShell y deben restablecerse después de cerrar la ventana.

Configurar el token de Hugging Face

Si el repositorio de modelos seleccionado requiere autorización:

1
$env:BONSAI_TOKEN = "hf_your_token_here"

No escriba tokens reales en artículos, scripts, repositorios de Git o capturas de pantalla de terminales. Puedes borrarlo después de su uso:

1
Remove-Item Env:BONSAI_TOKEN

Si aparece 401 o 403, primero confirme que ha aceptado el permiso del modelo en la página Hugging Face y luego verifique si el Token tiene permiso de lectura.

Ejecute el script de instalación

Proceso oficial de Windows:

1
2
Set-ExecutionPolicy -Scope Process -ExecutionPolicy Bypass
.\setup.ps1

-Scope Process solo afecta al proceso actual de PowerShell. Restaurar la política original después de cerrar el terminal es más confiable que reducir permanentemente la política de ejecución del sistema.

El script instala dependencias basadas en variables de entorno, descarga el modelo y prepara los archivos binarios necesarios para su ejecución. No elimine repetidamente todo el directorio cuando se interrumpa la descarga. Primero verifique si el soporte de caché y script continúa descargándose.

Prueba de línea de comando

Una vez completada la instalación, puede enviar directamente la palabra de aviso:

1
.\scripts\run_llama.ps1 -p "请用三句话解释什么是低比特大模型"

Si solo desea confirmar que el modelo se puede cargar, utilice primero una palabra de sugerencia breve y un contexto breve. Los contextos prolongados aumentarán significativamente la caché KV y pueden provocar que los modelos que se lanzaron originalmente se queden sin memoria repentinamente.

Inicie la interfaz de chat web

La demostración oficial puede iniciar el servidor llama local y proporcionar interfaces de chat, visuales y de llamada de herramientas de forma predeterminada. Los scripts de Windows actuales en el almacén se pueden ajustar con la versión, puede verificar primero:

1
Get-ChildItem .\scripts\*server*

Después del inicio, normalmente acceda a:

1
http://localhost:8080

Si no se puede acceder al puerto, verifique si el proceso aún se está ejecutando, si el mensaje del firewall está denegado y si 8080 está ocupado por otros programas.

Cómo utilizar la capacidad visual

La demostración de Bonsai admite el envío de fotos, capturas de pantalla y archivos PDF. Preste atención a lo siguiente cuando lo utilice en la práctica:

  • Las imágenes ocuparán memoria adicional;
  • Las capturas de pantalla de alta resolución no necesariamente conducen a un reconocimiento de texto más preciso;
  • Si el PDF tiene muchas páginas, se debe dividir primero o enviar sólo las páginas relevantes;
  • Aunque los documentos privados se infieren localmente, se debe confirmar la interfaz, los registros y las ubicaciones de almacenamiento de archivos temporales.

Primero puede probarlo con una simple captura de pantalla: pídale al modelo que enumere los botones de la página, explique el mensaje de error y luego verifique si ha fabricado contenido invisible.

Llamadas a herramientas y MCP

La demostración es compatible con el estilo OpenAI tool_calls y puede conectarse al servidor MCP en la interfaz de demostración. El modelo realiza llamadas a herramientas, pero es el programa anfitrión el que realmente ejecuta las herramientas.

Antes de acceder al archivo, terminal o navegador MCP, primero debe confirmar:

  1. ¿Qué herramientas expondrá el servidor?
  2. Si limitarlo al directorio de trabajo especificado;
  3. Si los comandos peligrosos requieren confirmación manual;
  4. Si la salida de la herramienta se escribe en el registro de chat;
  5. ¿Se llamará repetidamente al modelo cuando falle?

El pequeño tamaño del modelo de bits bajos no significa que el juicio de llamada de la herramienta deba ser confiable. Se deben conservar las aprobaciones y los privilegios mínimos cuando se trata de eliminar archivos, ejecutar shells, enviar mensajes o modificar sistemas externos.

¿Qué tamaño de modelo puede ejecutar la computadora?

Lo siguiente sólo puede utilizarse como un punto de partida conservador. Los requisitos reales se verán afectados por el formato del modelo, la longitud del contexto, el backend en ejecución y la entrada visual:

Memoria disponible Puntos de partida recomendados
8GB 1.7B, contexto corto, cerrar otros grandes programas
16GB 4B, prueba primero el chat de texto
32GB 8B, agregando progresivamente contexto y aportes visuales
64 GB y más Considere 27B y el sistema de reserva y el espacio de caché KV

Incluso si pudieran caber 27B de peso en la memoria, la velocidad probablemente estaría limitada por el ancho de banda de la memoria y el conjunto de instrucciones de la CPU. Poder cargar no significa que la experiencia interactiva sea fluida.

Preguntas frecuentes

PowerShell prohíbe la ejecución de scripts

Liberar sólo para el proceso actual:

1
Set-ExecutionPolicy -Scope Process -ExecutionPolicy Bypass

No modifique directamente la política de ejecución permanente de toda la computadora.

Informes de descarga de modelos 401 o 403

Compruebe si el modelo requiere permiso, si BONSAI_TOKEN existe y si el token tiene permiso de lectura:

1
Test-Path Env:BONSAI_TOKEN

Memoria insuficiente al cargar

Cambiar a un modelo más pequeño:

1
2
$env:BONSAI_MODEL = "4B"
.\setup.ps1

También acorte el contexto, desactive la información visual y otros programas que acaparan la memoria. No confíe en el archivo de paginación de Windows para “ejecutar a fondo” un modelo que excede considerablemente la memoria física. La velocidad suele ser muy pobre.

La velocidad de generación es muy lenta.

Confirme el backend real, el conjunto de instrucciones de la CPU y la configuración de subprocesos utilizados. La primera ejecución también puede incluir la carga del modelo, el almacenamiento en caché o el tiempo de preparación del kernel, y la latencia de la primera ronda debe verse por separado de las velocidades de generación posteriores.

MCP puede conectarse pero la llamada a la herramienta es inestable

Primera prueba con una herramienta con un solo parámetro, parámetros simples y de solo lectura. Si a menudo se completan parámetros incorrectos para modelos pequeños, se debe reducir la cantidad de herramientas, agregar descripciones claras o reemplazar las familias y tamaños de modelos por otros de mayor calidad.

Cómo elegir entre Bonsai y Ollama

Ollama es una herramienta de gestión y ejecución de modelos, y Bonsai es un modelo y su entorno de presentación. Los dos no son productos de la misma capa.

  • Si desea administrar de manera uniforme múltiples modelos comunes y proporcionar API rápidamente: dé prioridad a Ollama;
  • Quiere estudiar pesos triples o de 1 bit, probar imágenes y cadenas de herramientas oficiales: use Bonsai Demo;
  • Si desea poner Bonsai en una aplicación existente: primero confirme si su tiempo de ejecución puede cargar el formato actual directamente;
  • Simplemente mirar “archivos de modelos más pequeños” no es suficiente para decidir la solución; también compare la calidad, la velocidad, el contexto y la confiabilidad de las llamadas de herramientas.

Se recomienda utilizar primero 4B Ternary-Bonsai para completar el ciclo cerrado de texto, visual y una herramienta MCP de solo lectura, y luego decidir si descargar 27B o cambiar a la familia de 1 bit.