Qwen3.8 ya está disponible, pero lo que está actualmente en línea es el modelo Qwen3.8-Max-Preview con el ID de modelo qwen3.8-max-preview. Al 22 de julio de 2026, la documentación oficial de Qwen todavía lo etiquetan como un modelo de vista previa, y la versión oficial y la versión con pesos abiertos aún no se han lanzado.
Esta distinción es importante: Qwen3.8 ahora se puede experimentar y llamar a través de la plataforma Qwen AI, pero no se puede asumir que los pesos completos del modelo, los informes técnicos, los detalles arquitectónicos y los puntos de referencia formales se hayan hecho públicos.
Documentación oficial:
- Plataforma de IA Qwen: Token Plan Edición personal
- Plataforma de IA Qwen: Modo de pensamiento
- Plataforma de IA de Qwen: API de chat OpenAI
Conclusión rápida
| Pregunta | Respuesta actual |
|---|---|
| ¿Se ha lanzado la versión oficial de Qwen3.8? | No, actualmente solo está disponible Max Preview |
| ¿Se puede utilizar ahora? | Sí, a través de portales oficiales como Token Plan |
| Identificación del modelo | qwen3.8-max-preview |
| Ya sea para admitir API | Compatible con OpenAI, Anthropic y otras interfaces compatibles |
| Si hay pesos abiertos disponibles | Todavía no; Qwen ha anunciado que publicará la versión oficial y los pesos abiertos |
| Escala de parámetros | La vista previa oficial es de 2,4T de parámetros totales |
| Si se admite la entrada visual | La anotación oficial de la tabla del modelo Token Plan respalda la comprensión visual |
| ¿Es adecuado para producción? | Sirve para evaluar; no conviene sustituir un modelo estable sin pruebas de regresión |
Si sólo quieres ser el primero en probar programación, razonamiento complejo, multi-Agent o tareas de oficina, puedes empezar ahora; Si el objetivo es la implementación local, la cuantización, el ajuste o la producción estable a largo plazo, aún debe esperar los pesos oficiales y la información técnica completa.
¿Qué publicó exactamente Qwen3.8?
El producto actualmente confirmado es Qwen3.8-Max-Preview. La plataforma Qwen AI establece claramente:
- Es una versión preliminar y las capacidades se actualizarán continuamente durante el período de vista previa.
- Una vez finalizada la vista previa, el modelo actual puede estar fuera de línea o ser reemplazado por la versión oficial.
- Actualmente, el acceso se proporciona principalmente a través de Token Plan.
- El modelo apoya el razonamiento, la generación de texto y la comprensión visual.
- Aviso oficial: Se lanzará la versión oficial de Qwen3.8 y se publicarán los pesos.
Por lo tanto, “Qwen3.8 está en línea” y “Qwen3.8 está disponible oficialmente con pesos abiertos” son dos cosas diferentes. Lo primero ya sucedió y lo segundo aún está esperando su implementación oficial.
¿Qué significa el parámetro 2.4T?
La vista previa oficial de Qwen3.8 mencionó parámetros de 2,4T, que son aproximadamente 2,4 billones de parámetros en total. Pero hasta que se publique el informe técnico completo, el costo real de la inferencia no se puede juzgar basándose únicamente en esta cifra.
Para modelos expertos mixtos, al menos también necesitas saber:
- Cuántos parámetros se activan para cada Token;
- Número de expertos y métodos de enrutamiento;
- Ventana de contexto y estructura de atención;
- Requisitos de memoria de vídeo, ancho de banda y comunicación durante la inferencia;
- Ya sea para proporcionar versiones Dense o MoE con pesos abiertos a diferentes escalas;
- Qué licencia se aplicará a los pesos.
Los parámetros totales determinan parte del límite superior de la capacidad del modelo, y los parámetros de activación y la arquitectura de inferencia afectan más directamente la velocidad y el costo de cada solicitud. Antes de que estos datos se hagan públicos, no es apropiado entender 2.4T simplemente como “el costo de inferencia debe ser varias veces mayor que el de la generación anterior”.
¿Qué conviene probar con Qwen3.8-Max-Preview?
Desde el posicionamiento oficial de la plataforma, Qwen3.8-Max-Preview está orientado a tareas complejas de razonamiento y programación. Es más adecuado priorizar las pruebas en los siguientes escenarios:
Tareas de programación de procesos largos
No pruebes sólo una pregunta de algoritmo. Puedes darle al modelo un pequeño repositorio real y pedirle que lo complete:
- Leer la estructura del proyecto;
- Localizar un problema entre archivos;
- Dar un plan de modificación;
- Modificar el código;
- Ejecutar pruebas;
- Continuar reparando según los errores;
- Resumir los cambios y riesgos residuales.
Este tipo de prueba puede observar mejor la estabilidad del modelo en contextos prolongados, llamadas a herramientas y corrección de errores de varios pasos.
Implementación de interfaces a partir de diseños
Prepare la misma captura de pantalla del diseño y los criterios de aceptación para comparar los resultados de Qwen3.8 con los modelos más utilizados actualmente:
- Si la estructura de la página está completa;
- Si el diseño responsivo está disponible;
- Si el diseño ha sido modificado sin autorización;
- Si se generará una gran cantidad de componentes duplicados;
- Se requieren varias rondas de correcciones después de la primera generación;
- ¿El código final pasará la compilación con lint?
Sólo mirar si la captura de pantalla “se ve bien” puede generar fácilmente un sesgo subjetivo. Es mejor registrar la tasa de éxito de la construcción, las rondas de modificación y el tiempo de adquisición manual al mismo tiempo.
Análisis de datos y flujo de trabajo de Office
Puede seleccionar un conjunto de datos anonimizado y exigir que el modelo complete la limpieza de datos, la descripción de la excepción, el resumen estadístico y la generación de informes. Concéntrese en comprobar si las cifras se remontan a los datos originales, en lugar de simplemente si el lenguaje de los informes fluye sin problemas.
Colaboración entre varios Agent
Si la plataforma o el cliente admite varios Agent, diferentes roles pueden ser responsables del análisis, la ejecución y la revisión. El objetivo de la prueba no es la cantidad de roles, sino si se pierden restricciones, se repiten ejecuciones o los archivos se sobrescriben entre sí cuando se entregan las tareas.
Cómo llamar al modelo mediante la API
Actualmente, Qwen3.8-Max-Preview es solo Token Plan. Después de la compra o activación, debe obtener la clave API específica del paquete y la URL base desde la consola. No se puede asumir directamente que es la misma que la dirección de pago por uso ordinaria.
A continuación se toma como ejemplo la interfaz compatible con OpenAI. Reemplace la dirección con la URL base Token Plan que se muestra en la consola:
|
|
Python puede usar el SDK OpenAI:
|
|
Cómo usar preserve_thinking en conversaciones de varios turnos
El documento API oficial tiene una explicación especial para qwen3.8-max-preview: preserve_thinking por defecto es true. Durante múltiples rondas de diálogo, el reasoning_content en el mensaje histórico debe devolverse por completo.
Si el cliente solo guarda el content normal e ignora el campo de inferencia, puede ocurrir lo siguiente:
- La calidad de las respuestas posteriores disminuye;
- Las tareas de herramientas de varios pasos pierden estados intermedios;
- El formato de la solicitud no cumple con las expectativas del modelo;
- El cliente parece compatible, pero en realidad no puede continuar la sesión de forma estable.
Antes de acceder, debe confirmar si el SDK, la puerta de enlace proxy y el cliente de chat conservan campos desconocidos. No empalme reasoning_content directamente en content. La documentación oficial claramente no respalda este método de procesamiento.
Cómo elegir reasoning_effort
Qwen3.8-Max-Preview admite tres niveles de fuerza de inferencia: low, high y xhigh. El valor predeterminado es xhigh.
| Nivel | Tareas adecuadas | Recomendación |
|---|---|---|
low |
Clasificación, extracción, reescritura simple | Priorizar el control de demoras y consumos |
high |
Programación, análisis, planificación de herramientas | Como punto de partida para las tareas más complejas |
xhigh |
Razonamiento de largo alcance, tareas complejas Agent | Pruebe primero el costo y la estabilidad a pequeña escala |
No todas las solicitudes requieren el nivel más alto. Si las tareas por lotes utilizan xhigh de forma predeterminada, es posible que se consuma una gran cantidad de presupuesto en problemas simples. Un enfoque más prudente es encaminar modelos y niveles de razonamiento según la complejidad de la tarea.
Herramientas integradas
Las herramientas Harness disponibles para Qwen3.8-Max-Preview en la plataforma Qwen AI incluyen:
- búsqueda en Internet;
- intérprete de código;
- extracción de páginas web;
- búsqueda por imagen;
- búsqueda de imágenes mediante texto.
Estas herramientas las proporciona la plataforma y no significan que los pesos del modelo estén integrados en el navegador o en el entorno de ejecución de código. Al migrar a otros proveedores de servicios o implementar localmente en el futuro, debe preparar las herramientas correspondientes, el control de permisos y preparar de nuevo un entorno sandbox.
Cuando se trata de ejecución de código y acceso a páginas web, también existen restricciones separadas:
- Rango de lectura y escritura del sistema de archivos;
- Lista blanca de acceso a la red;
- Tiempo de ejecución único;
- Número de procesos secundarios;
- Exposición de claves y variables de entorno;
- Descargar el tamaño del archivo;
- Comandos Shell y Git de alto riesgo.
Mayores capacidades del modelo no eliminan automáticamente el riesgo de ejecución de herramientas.
Lo que todavía no se puede afirmar
El problema más común en la etapa de vista previa es escribir información promocional con anticipación para confirmar los hechos. Lo siguiente aún debe esperar información oficial:
Licencia de los pesos abiertos
Qwen ha anunciado que se publicarán los pesos, pero aún no se han anunciado en su totalidad la licencia específica, el alcance comercial, los requisitos de redistribución y las restricciones de uso.
Requisitos para la ejecución local
Incluso si el modelo de parámetros totales de 2.4T usa MoE, eso no significa que las estaciones de trabajo comunes puedan ejecutarlo. Ya sea que variantes más pequeñas, pesos cuantizados y el soporte del marco de inferencia se publiquen simultáneamente, debe esperar la tarjeta modelo.
Resultados de benchmarks públicos
El desempeño de las tareas internas se puede utilizar para comprender el posicionamiento del producto, pero no puede reemplazar los conjuntos de datos públicos, las evaluaciones de terceros y las pruebas de regresión empresarial reales.
ID de modelo estable
Es posible que las vistas previas se actualicen continuamente, llamando al mismo ID de modelo hoy que la próxima semana, y es posible que las capacidades reales hayan cambiado. Las evaluaciones para producción deben guardar fechas, solicitar parámetros, muestras de entrada y resultados completos.
Un método de evaluación reutilizable
Prepare de 20 a 50 tareas enmascaradas de negocios reales mientras deja que se ejecute el modelo de producción actual con Qwen3.8-Max-Preview. Registra lo siguiente para cada tarea:
| Indicadores | Grabar contenido |
|---|---|
| Tasa de éxito | Si se cumplen condiciones de aceptación claras |
| Tasa de aprobación por primera vez | Si se puede completar sin indicaciones adicionales |
| Llamada de herramienta | Si los parámetros son correctos y si se debe volver a llamar |
| Latencia | Primer Token y tiempo completo de respuesta |
| Consumo | Entrada, inferencia, salida Token o Credits |
| Estabilidad | Diferencias al ejecutar la misma tarea varias veces |
| Costos laborales | Tiempo necesario para corregir los resultados |
| Seguridad | Acceso no autorizado a archivos, redes o claves |
No elija simplemente preguntas abiertas en las que el modelo sea bueno y no sustituya un resultado exitoso por pruebas repetidas. Para el modelo Agent, la tasa de finalización y la capacidad de recuperación suelen ser más importantes que la percepción de una respuesta de una sola ronda.
Preguntas frecuentes
¿Qwen3.8 ya está disponible con pesos abiertos?
No. Actualmente está disponible qwen3.8-max-preview, y la versión oficial y los pesos abiertos todavía se encuentran en el estado “próximamente lanzado”.
¿Se puede ejecutar en Ollama o llama.cpp?
Actualmente no existe un peso abierto oficial Qwen3.8 y no se puede descargar ni ejecutar directamente como el modelo Qwen más pequeño con pesos abiertos. Los modelos de terceros con el mismo nombre tampoco pueden considerarse pesos oficiales.
¿Una clave API estándar de DashScope puede llamar al modelo directamente?
La documentación oficial actualmente etiqueta este modelo como solo disponible como Token Plan. Se debe utilizar la clave API exclusiva y la URL base proporcionada por la consola Token Plan, y prevalecerán los permisos reales de la consola.
¿La versión preliminar es adecuada para producción?
No se recomienda el reemplazo directo. Las capacidades y los comportamientos de la interfaz se pueden ajustar durante el período de vista previa, y primero se deben realizar verificaciones de regresión de muestra fija, evaluación de costos, degradación anormal y cumplimiento de datos.
¿Cuándo se lanzará la versión oficial?
Qwen solo ha anunciado información sobre próximos lanzamientos y pesos abiertos, sin proporcionar fechas precisas verificables. Si encuentra rumores sobre una fecha de lanzamiento específica, debe esperar la confirmación de la página de modelo oficial, la tarjeta de modelo o el repositorio de códigos de Qwen.
Resumen
El interés por Qwen3.8 está justificado, pero la declaración precisa debería ser: ** Qwen3.8-Max-Preview ha estado en línea, la versión oficial aún no se ha lanzado y los pesos abiertos siguen pendientes.**
Lo que más vale la pena hacer ahora no es sacar conclusiones sobre la escala de parámetros, sino utilizar tareas reales para verificar su programación, razonamiento, comprensión visual y capacidades de llamada de herramientas, preservando al mismo tiempo las condiciones de prueba completas. Una vez que estén disponibles la ficha oficial del modelo, los pesos, las licencias y los puntos de referencia públicos, podemos juzgar si la implementación local y la migración de la producción son rentables.