Kimi K3 frente a Claude y GPT-5.6: pesos abiertos, benchmarks y licencia

Descarga y despliega los pesos abiertos de Kimi K3 y revisa sus 2,8 billones de parámetros, 1,42 TiB, MXFP4, requisitos de hardware, licencia y resultados comparativos.

Kimi K3 ha lanzado oficialmente los pesos completos del modelo. Moonshot AI lo llama el primer modelo a nivel de parámetros de 3 billones del mundo con pesos abiertos: 2,8 billones de parámetros totales, cada token activa aproximadamente 104 mil millones de parámetros y admite de forma nativa entrada visual y 1 millón de contextos de tokens. Los pesos se pueden descargar de forma gratuita desde Hugging Face, pero “descarga gratuita” no significa “puede ejecutarse en una computadora normal a bajo costo”. El repositorio de modelos oficial contiene actualmente 96 fragmentos de peso de Safetensors, con un total aproximado de 1,42 TiB. Se requieren recursos a nivel de servidor para la descarga, verificación, carga e inferencia. Este artículo explica la información de lanzamiento, los comandos de descarga, la evaluación del hardware, la entrada de implementación, la licencia y la comparación de rendimiento por separado para evitar simplemente mirar las clasificaciones o la frase “el más fuerte del mundo”.

Responda primero las tres preguntas más comunes

De hecho, se han hecho públicos todos los pesos de Kimi K3, no solo la API o el informe técnico. La entrada oficial es moonshotai/Kimi-K3 y el repositorio de GitHub también enumera claramente tres rutas de implementación: vLLM, SGLang y TokenSpeed. El archivo del modelo se puede descargar gratis, pero el tamaño total del repositorio supera 1 TiB y el hardware no se puede estimar de la misma manera que los modelos 7B, 32B o cuantitativos ordinarios de consumo. Los puntos de referencia oficiales muestran que cumple o supera la serie Claude, GPT-5.6 en algunas pruebas de programación, agentes y trabajo de conocimientos, pero no todas son las primeras. Por lo tanto, una afirmación más precisa es “elección a nivel insignia en el modelo de peso abierto” en lugar de declarar el más fuerte fuera de la misión y las condiciones de prueba.

¿Qué contenido está abierto esta vez?

README, la licencia Kimi K3 y los informes técnicos están disponibles en el repositorio oficial de GitHub. La página del modelo Hugging Face proporciona configuración, tokenizador, código de modelado personalizado y pesos completos de Safetensors. El peso no es un archivo de marcador de posición que deba aplicarse para verlo. Se puede descargar al servidor local o a través de la CLI después de iniciar sesión en Hugging Face. El funcionario también reveló la estructura del modelo, el formato cuantitativo, los principales resultados de la evaluación y el motor de razonamiento recomendado.

Pero este no es un paquete completo de datos de entrenamiento. “Pesos abiertos” significa que los parámetros del modelo se pueden obtener e implementar, lo que no significa que el corpus de capacitación, todos los canales de capacitación y cada entorno de evaluación se hayan hecho públicos. Al juzgar el grado de apertura, debe observar el peso, el código, la licencia, los datos de entrenamiento y los experimentos de replicación por separado, en lugar de simplemente mirar el código abierto en el título del proyecto.

Cómo funcionan 2,8 billones de parámetros

Kimi K3 utiliza una arquitectura de mezcla de expertos, con un total de 896 expertos, 16 de los cuales se seleccionan para cada token y se utilizan dos expertos compartidos. Los parámetros totales son 2,8T y los parámetros de activación son aproximadamente 104B. Esto significa que una sola inferencia no activa todos los parámetros como un modelo denso de 2,8T, pero todos los pesos expertos aún deben almacenarse, organizarse y transferirse entre dispositivos.

El modelo tiene un total de 93 capas, de las cuales la capa de atención consta de 69 capas de KDA y 24 capas de Gated MLA. El codificador visual es MoonViT-V2, ~401 millones de parámetros. El límite de contexto es de 1.048.576 tokens, pero alcanzar el límite de protocolo no significa que cualquier implementación pueda proporcionar económicamente 1 millón de contextos. La caché de KV, el número de concurrencia, la imagen de entrada y la longitud de salida seguirán consumiendo memoria de vídeo.

MXFP4 no se puede equiparar directamente con la “versión cuantificada de memoria pequeña”

Kimi K3 inicia el entrenamiento consciente de la cuantificación desde la etapa de ajuste fino supervisado. Los pesos oficiales usan MXFP4 y la activación usa MXFP8. Esto está más cerca del diseño nativo del modelo que comprimir los pesos BF16 en 4 bits posteriormente. Sin embargo, poder guardar archivos MXFP4 no significa que cualquier GPU pueda ejecutar eficientemente los operadores correspondientes. La versión del motor de inferencia, la arquitectura de la GPU, las bibliotecas de comunicaciones y la compatibilidad con el kernel aún determinan el lanzamiento y la velocidad real.

No utilice simplemente “2,8T × 0,5 bytes” para estimar el disco final. El repositorio también contiene módulos de visión, información de escala, índices, tokenizadores y otras configuraciones; el sistema de archivos también reserva espacio para descargar archivos temporales, caché y registros. La lista de documentación actual de Hugging Face debe usarse como guía antes de la implementación, en lugar de citar estimaciones previas al lanzamiento.

¿Qué tamaño real tiene el peso total?

En el momento de consultar este artículo, el repositorio de modelos oficial contiene 96 fragmentos .safetensors. Resumiendo los campos size de estos archivos a través de la API Hugging Face, el total es 1.560.936.091.448 bytes, aproximadamente 1,42 TiB. Esta es solo la suma de los pesos de Safetensors, excluyendo la ocupación temporal en descargas, imágenes de contenedores, entornos Python y registros de ejecución.

Para la implementación real, se recomienda preparar al menos 2 TiB de almacenamiento local de alta velocidad disponible. Si la herramienta de descarga conserva dos copias de la caché y los datos de local-dir, los requisitos de espacio pueden aumentar aún más. Los discos duros mecánicos son adecuados para archivar, pero no para modelos muy grandes con frecuentes arranques en frío; para discos de red compartidos, primero se debe probar el rendimiento y el rendimiento de los metadatos.

Haga una verificación previa de capacidad antes de descargar

Linux puede ver la partición de destino:

1
2
df -h /data
df -i /data

Windows PowerShell puede verificar el disco de datos:

1
Get-Volume | Select-Object DriveLetter, FileSystem, SizeRemaining, Size

Además de la capacidad, asegúrese de que el sistema de archivos admita archivos grandes, que no haya restricciones en las cuotas de directorio y que la cuenta de descarga tenga permisos de escritura en el directorio de destino. En el servidor en la nube, primero calcule los costos del disco de datos, la instantánea y el tráfico saliente; La descarga gratuita de pesas no significa que el disco en la nube sea gratuito.

Instalar Hugging Face CLI

Instale la versión actual de huggingface_hub en un entorno Python independiente:

1
2
3
4
python3 -m venv .venv
source .venv/bin/activate
python -m pip install --upgrade pip huggingface_hub
hf --help

Uso de Windows PowerShell:

1
2
3
4
python -m venv .venv
.\.venv\Scripts\Activate.ps1
python -m pip install --upgrade pip huggingface_hub
hf --help

Si el acceso al repositorio requiere iniciar sesión, cree un token de solo lectura en Hugging Face:

1
2
hf auth login
hf auth whoami

No coloque tokens en historiales de comandos, Dockerfiles ni scripts de implementación pública.

Primero use la ejecución en seco para ver la lista de archivos

La nueva versión de CLI permite verificar el plan antes de descargarlo:

1
hf download moonshotai/Kimi-K3 --dry-run

Si la CLI actual no reconoce --dry-run, actualice primero huggingface_hub y luego verifique:

1
hf download --help

No instale varios entornos superpuestos al mismo tiempo solo porque los comandos de ejemplo son diferentes de la versión anterior huggingface-cli. Registre hf --version y la revisión del modelo al comienzo de la descarga para que se pueda reproducir el mismo peso más adelante.

Descarga el repositorio completo

El directorio de destino debe estar en un SSD local o en un sistema de archivos paralelo de alto rendimiento con capacidad suficiente:

1
2
3
mkdir -p /data/models/Kimi-K3
hf download moonshotai/Kimi-K3 \
  --local-dir /data/models/Kimi-K3

No elimine el caché repetidamente durante el proceso de descarga. El descargador de Hugging Face puede reutilizar archivos completos; después de que se interrumpa la red, ejecute el mismo comando para restaurarla. Guarde el registro antes de reiniciar el servidor y confirme que el directorio de destino no sea un disco temporal del sistema.

Revisión fija para evitar que los archivos sean inconsistentes en todo el clúster

El repositorio de modelos puede continuar actualizando el archivo README, la configuración, el código o los índices de peso. Los entornos de producción deben bloquear el SHA de confirmación verificado:

1
2
3
hf download moonshotai/Kimi-K3 \
  --revision COMMIT_SHA \
  --local-dir /data/models/Kimi-K3-COMMIT_SHA

Para implementaciones de múltiples nodos, no permita que cada máquina descargue main en momentos diferentes. Primero determine la revisión, luego sincronice con todos los nodos y finalmente compare la lista de archivos y el hash. Mantenga el directorio anterior durante las actualizaciones continuas y luego limpie los pesos antiguos después de confirmar que se puede cargar la nueva versión.

No cuentes solo los archivos después de descargar

Verifique el índice, el tamaño total y los archivos pequeños inusuales:

1
2
3
find /data/models/Kimi-K3 -type f | wc -l
du -sh /data/models/Kimi-K3
find /data/models/Kimi-K3 -name '*.safetensors' -size -1M -print

Confirme que existan config.json, archivos Tokenizer, índices de peso y código personalizado. Si un fragmento ocupa solo unos KB, puede tratarse de un puntero de Git LFS/Xet o de un archivo temporal incompleto. No inicie repetidamente el servicio de inferencia en un directorio incompleto y permita que los registros de errores ahoguen los problemas reales de descarga.

¿Puede una computadora normal ejecutar Kimi K3?

Los pesos completos no son adecuados para computadoras de escritorio normales, portátiles para juegos o GPU de consumo único. El peso por sí solo es de aproximadamente 1,42 TiB y el servicio real también requiere tiempo de ejecución, activación, almacenamiento en búfer de comunicación y caché KV. Incluso si apenas se ahorran todos los pesos mediante la descarga de la CPU, el ancho de banda de la memoria y el intercambio de discos harán que la velocidad de interacción no sea práctica.

No entiendo que “activar 104B por token” significa que solo es necesario cargar parámetros 104B. El enrutamiento del MoE seleccionará diferentes expertos entre diferentes tokens, y el conjunto completo de expertos aún debe ser accesible. Los usuarios individuales que quieran experimentar el modelo primero deben elegir la API oficial de Kimi, los proveedores de inferencia certificados o el Código Kimi en lugar de comprar hardware primero.

La configuración del servidor debe invertirse desde la receta del motor

El funcionario no proporciona una tabla de configuración mínima para una sola máquina que se aplique a todas las GPU. Tiene sentido seleccionar primero la receta oficial Kimi K3 de vLLM, SGLang o TokenSpeed y luego verificar los modelos de GPU compatibles, el número de nodos, las interconexiones y la precisión. Las implementaciones MoE muy grandes a menudo requieren múltiples GPU o incluso múltiples nodos y dependen de interconexiones de tipo NVLink, NVSwitch o InfiniBand de alta velocidad.

La cantidad total de VRAM es solo el primer nivel. Un ancho de banda insuficiente entre nodos puede provocar que la comunicación paralela experta se convierta en un cuello de botella; Las versiones no coincidentes del controlador, CUDA, NCCL y el motor de inferencia pueden fallar antes de cargar. Al preparar la máquina, también debe registrar la arquitectura de la GPU, la VRAM de una sola tarjeta, la topología, la memoria del sistema y el rendimiento del disco local.

Consulte la receta dedicada

antes de usar vLLM El repositorio oficial recomienda vLLM y enlaces a la receta de implementación de Kimi K3. Primero cree un entorno de aislamiento y registre la versión:

1
2
3
4
5
python3 -m venv /opt/kimi-k3-venv
source /opt/kimi-k3-venv/bin/activate
python -m pip install --upgrade pip
python -m pip install vllm
python -m pip show vllm torch

La entrada general dada por la página de Hugging Face es:

1
vllm serve /data/models/Kimi-K3

Para un modelo del tamaño del Kimi K3, este comando es solo una forma de interfaz, no un compromiso de implementación de una sola tarjeta. El paralelismo tensorial, el paralelismo experto, la dirección de múltiples nodos, el puerto y los parámetros de memoria deben utilizar la configuración correspondiente al hardware en la receta actual. No adivine la topología paralela basándose en parámetros de otros modelos MoE.

SGLang es también la ruta oficial recomendada

La entrada de inicio básica es la siguiente:

1
2
3
4
python3 -m sglang.launch_server \
  --model-path /data/models/Kimi-K3 \
  --host 127.0.0.1 \
  --port 30000

Primero vincule 127.0.0.1 para verificación local. No abra directamente el servicio de modelo no autenticado a la red pública. El clúster completo también necesita configurar el modo paralelo, el descubrimiento de nodos y los parámetros de comunicación de acuerdo con el libro de cocina oficial de SGLang. Si el registro muestra que MXFP4 no es compatible, se desconoce la arquitectura o falta el código personalizado, primero verifique la versión del motor y el estado de soporte de Kimi K3.

Realice la primera solicitud utilizando la interfaz compatible con OpenAI

Envíe una breve solicitud de texto después de que el servicio esté en buen estado:

1
2
3
4
5
6
7
8
curl http://127.0.0.1:30000/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "/data/models/Kimi-K3",
    "messages": [{"role": "user", "content": "用一句话解释 MoE。"}],
    "max_tokens": 128,
    "reasoning_effort": "low"
  }'

El modelo siempre permite pensar y devuelve contenido de inferencia a través de reasoning_content. Utilice contexto breve y baja concurrencia para la primera prueba, confirme el texto, los campos de inferencia, los motivos finales y las estadísticas de tokens, y luego aumente gradualmente la carga. No envíe 1 millón de tokens como entrada tan pronto como comience, ya que esto combinará problemas de carga del modelo con presión de caché KV.

Múltiples rondas de diálogo deben conservar la historia del pensamiento

Kimi K3 utiliza el modo de historial de pensamiento preservado. Al continuar con varias rondas de conversaciones o llamadas de herramientas, debe devolver el mensaje anterior del asistente a messages tal como está, incluidos reasoning_content y tool_calls. Guardar solo el content final puede destruir la capacidad del modelo para transferir la inferencia y el estado de la herramienta.

La base de datos de la aplicación también debe poder almacenar estos campos. Si le preocupan los costos de privacidad o almacenamiento, los tiempos de retención deben determinarse durante la fase de diseño del producto en lugar de eliminar al azar partes del historial antes de solicitarlo. El texto de inferencia se puede ocultar cuando se muestra externamente, pero la estructura histórica enviada al modelo aún debe cumplir con el protocolo oficial.

“Rendimiento comparable al de Claude y GPT-5.6” Cómo entender

Forma oficial No es que el Kimi K3 gane en todos los aspectos. Por ejemplo, en Terminal-Bench 2.1, Kimi K3 es 88,3, GPT-5.6 Sol es 88,8; DeepSWE es 67,5 y 73,0 respectivamente. Pero en FrontierSWE, Kimi K3 tiene 81,2, que es más alto que el GPT-5.6 Sol 71,3 de la tabla; en SWE-Marathon, Kimi K3 tiene 42,0 y GPT-5.6 Sol tiene 39,0. En la tabla oficial de BrowseComp, Kimi K3 es 91,2, GPT-5.6 Sol es 90,4 y Claude Opus 4.8 es 84,3.

Los datos respaldan “algunas tareas de programación y agentes que alcanzan niveles emblemáticos de código cerrado”. No admiten “ningún escenario que supere ampliamente todos los modelos de código cerrado”. La selección del modelo también prueba la calidad, la latencia, el rendimiento, el marco de herramientas, el comportamiento de rechazo, la estabilidad de la producción y el costo real de China.

El punto de referencia lateral no puede ignorar las diferencias del arnés

Oficialmente, los diferentes modelos no siempre utilizan el mismo marco de Agente. Kimi K3 se puede combinar con Kimi Code o Claude Code, GPT-5.6 Sol generalmente se combina con Codex y otros modelos también pueden usar su propio arnés óptimo. Las distintas herramientas, los prompts, las estrategias de compactación de contexto y el nivel máximo de razonamiento influyen en los resultados.

Algunas puntuaciones provienen de pruebas de fabricantes de modelos, otras se refieren a listas de terceros y otras son puntos de referencia internos. Mientras lee la tabla, continúe mirando las notas a pie de página, el número de ejecuciones, el hardware y los subconjuntos de tareas. Para una selección empresarial, conviene realizar pruebas ciegas con el código, la documentación y las herramientas propias; no se debe dimensionar un clúster a partir de una sola columna de puntuaciones.

La licencia Kimi K3 no es una simple copia de la licencia permisiva estándar

La licencia permite el uso, copia, modificación, publicación, distribución, sublicencia, venta, implementación y ajuste, sujeto a condiciones comerciales adicionales. Si la empresa y sus filiales operan el modelo como servicio y los ingresos totales superan los 20 millones de dólares durante 12 meses consecutivos, se requiere un acuerdo independiente con Moonshot AI para utilizar el software o las versiones derivadas con fines comerciales.

Si un producto o servicio comercial tiene más de 100 millones de usuarios activos mensuales, o unos ingresos mensuales de más de 20 millones de dólares estadounidenses, “Kimi K3” debe aparecer de forma destacada en la interfaz. La licencia establece excepciones para uso interno, productos oficiales y socios de razonamiento certificados. Al prepararse para el uso comercial, la redistribución o la prestación de servicios modelo, el departamento legal debe leer la licencia completa y no puede simplemente escribir “uso comercial gratuito”.

Límite de seguridad después de descargar el peso

El ejemplo de Hugging Face usa trust_remote_code=True, lo que significa que se permite ejecutar código Python personalizado en el repositorio al cargar el modelo. En los servidores de producción, las revisiones deben bloquearse y el código revisarse antes de ejecutarse en un contenedor sin privilegios o en una cuenta dedicada. No permita que la cuenta de servicio modelo lea claves privadas SSH, credenciales de nube o copias de seguridad de bases de datos de producción.

La autenticación, TLS, el límite del cuerpo de la solicitud y el límite de velocidad deben configurarse antes del puerto API. Establezca límites de tamaño para imágenes, vídeos y contextos muy largos para evitar que una sola solicitud llene la caché o el disco de KV. Realice una desensibilización al guardar palabras clave y registros de inferencia, y aclare el período de retención de los datos del usuario.

Problemas comunes de descarga

No space left on device Puede que no signifique necesariamente que el disco de destino esté realmente lleno, o puede ser que el caché esté escrito en un disco del sistema más pequeño de forma predeterminada. Verifique HF_HOME, el montaje del contenedor y la ubicación real del directorio temporal. Cuando la velocidad de descarga vuelva repentinamente a cero, primero verifique la escritura en el disco y la verificación de archivos, y no finalice el proceso inmediatamente.

Cuando aparezca 401 o 403, verifique los permisos del token, la cuenta de inicio de sesión y los términos de acceso al repositorio. Cuando falte una suma de comprobación o un fragmento, vuelva a ejecutar el comando de descarga de la misma revisión y deje que la herramienta complete el archivo. Cuando varios nodos no pueden encontrar un modelo, compare la ruta de montaje y los permisos; el mismo nombre de directorio no significa que cada nodo vea la misma pieza de almacenamiento.

Fallos comunes de inicio

unknown model type generalmente significa que la versión de Transformers o del motor de inferencia aún no contiene soporte para Kimi K3. unsupported quantization apunta a una discrepancia en el núcleo MXFP4, la arquitectura de GPU o la construcción del motor. El tiempo de espera de NCCL está relacionado principalmente con la red de nodos, la selección de la tarjeta de red, el firewall o la topología paralela y no debe enmascararse aumentando el tiempo de espera infinitamente.

Si el sistema lo elimina a mitad de la carga, verifique los límites de la memoria del host y del grupo c fuera de la memoria de la GPU. Cuando se puede cargar pero la velocidad es anormalmente lenta, registre cada utilización de la tarjeta, el tráfico entre tarjetas, el retraso del primer token y la velocidad de decodificación. Sólo una parte de la GPU está inactiva, lo que normalmente indica que la configuración paralela o la distribución experta no funciona como se esperaba.

¿Cuándo debería utilizar API

directamente? Para desarrollo personal, verificación funcional, aplicaciones de baja concurrencia y equipos sin clústeres de GPU, se prefiere Kimi API o servicio de inferencia certificado. La API no requiere la descarga de pesos de 1,42 TiB y no incurre en costos de actualización del motor, recuperación de fallas ni costos de comunicación del clúster. Para llamadas a la API de Kimi K3, entradas visuales y ejemplos de uso de herramientas existentes, consulte: [Inicio rápido de la API de Kimi K3] (/es/2026/07/18/kimi-k3-api-python-streaming-vision-tools-quickstart/).

La implementación local es más adecuada para organizaciones que deben controlar pesos, aislar datos, modificar la pila de inferencia o tener clústeres de GPU de alta gama disponibles. Incluso entonces, se recomienda establecer primero una línea de base de calidad a través de la API antes de medir el rendimiento, la latencia y el costo total de propiedad del alojamiento propio. “Descargado correctamente” es sólo el comienzo de la implementación, no que el servicio haya alcanzado los estándares de producción.

Registre una lista reproducible antes de conectarse

  • El repositorio de modelos confirma SHA y versión de licencia.
  • El número, el tamaño total y el estado de verificación de 96 fragmentos ponderados.
  • Motor de inferencia, versiones PyTorch, CUDA, driver y NCCL.
  • Modelo de GPU, topología de nodo, VRAM y memoria de host.
  • Longitud del contexto, simultaneidad, esfuerzo de pensamiento y resultado máximo.
  • Latencia del primer token, velocidad de salida, tasa de error y recursos máximos.
  • Resultados de comparación con API, Claude y GPT-5.6 en nuestro propio conjunto de tareas.
  • Autenticación API, enmascaramiento de registros, limitación actual y políticas de retención de datos.

Después de completar estos registros, puede determinar de dónde provienen los cambios de rendimiento cuando actualice los pesos o los motores más adelante.

Entrada oficial

La importancia del Kimi K3 no es sólo el lanzamiento de un modelo de alta puntuación, sino también que el peso completo del buque insignia ya puede estudiarse, revisarse y desplegarse. Pero el peso de 1,42 TiB, la comunicación en clúster y la licencia personalizada también determinan que no sea un modelo local de un solo clic para ordenadores normales. Es una opción más segura verificar primero el efecto de la tarea a través de la API oficial, luego descargarla de acuerdo con la revisión fija y planificar el clúster de acuerdo con la receta especial vLLM o Kimi K3 de SGLang.