Evalúa primero GPT-6 Astra para tareas complejas y largas que exijan varias operaciones consecutivas con herramientas. Empieza por Terra para el trabajo habitual, compara Sol cuando la dificultad sea mayor y el presupuesto limitado, y prueba Luna para procesar grandes volúmenes con reglas claras.
Son puntos de partida basados en el posicionamiento oficial, no una clasificación de rendimiento válida para cualquier tarea. La decisión final debe comparar precisión, tiempo y coste total al completar el mismo trabajo.
La información se verificó el 10 de septiembre de 2026 con el catálogo oficial de modelos de OpenAI, la documentación de la API y el anuncio de GPT-6 Astra. La distribución de tareas y el plan de evaluación son sugerencias prácticas; las demostraciones oficiales no se presentan como pruebas realizadas por este sitio.
El posicionamiento de los cuatro modelos
Este artículo se centra en modelos de propósito general para texto, código y llamadas a herramientas. La generación de imágenes, la voz en tiempo real y la transcripción tienen modelos especializados que no conviene incluir en la misma clasificación de capacidades generales.
| Modelo | Posicionamiento oficial | Primeras tareas sugeridas | Pregunta principal al elegir |
|---|---|---|---|
| GPT-6 Astra | Los trabajos más difíciles de principio a fin | Tareas largas entre herramientas, depuración compleja, investigación y entrega de documentos | ¿Reduce de forma importante los fallos y las correcciones manuales? |
| GPT-5.6 Sol | Modelo insignia para trabajo profesional complejo | Programación difícil, análisis con varias restricciones, procesos consolidados | ¿Cumple los requisitos con menos coste que Astra? |
| GPT-5.6 Terra | Equilibrio entre inteligencia y coste | Programación habitual, procesamiento de contenido, asistentes de complejidad media | ¿Cubre la mayoría de las solicitudes habituales? |
| GPT-5.6 Luna | Trabajo de gran volumen sensible al coste | Clasificación, extracción de campos, resúmenes breves, conversión de formato | ¿Las reglas son claras y los resultados fáciles de validar? |
OpenAI recomienda actualmente empezar por Astra en caso de duda, elegir Terra para equilibrar capacidad y coste, y Luna para grandes volúmenes. Las asignaciones concretas de la tabla son sugerencias derivadas de esos enfoques. Fuente: catálogo de modelos
Los desarrolladores pueden usar primero Astra para determinar la calidad alcanzable en una tarea y comparar después modelos más baratos con las mismas entradas. En una aplicación estable, resulta más útil conservar el modelo actual como referencia.
La relación de Sol, Terra y Luna con los nombres anteriores
Las categorías anteriores ayudan a entender la familia GPT-5.6:
- Sol corresponde aproximadamente al nivel principal que antes no llevaba el sufijo mini ni nano.
- Terra corresponde aproximadamente al antiguo nivel mini.
- Luna corresponde aproximadamente al antiguo nivel nano.
Es una analogía de posicionamiento, no una afirmación de que el comportamiento, los precios, los límites o la calidad sean idénticos a los de modelos anteriores.
Además, gpt-5.6 es un alias de Sol. Escribir gpt-5.6-sol en la configuración deja más claro qué nivel se ha elegido. Fuentes: Sol, Terra, Luna
Qué destaca de GPT-6 Astra frente a Sol
El anuncio de Astra pone el acento en el uso del ordenador, las tareas largas y el trabajo complejo con software. Conviene comprobar si puede terminar una secuencia de pasos y modificar el plan cuando aparece información nueva a mitad del trabajo.
La siguiente tabla recoge algunas comparaciones del anuncio. Son evaluaciones publicadas por OpenAI, no pruebas ejecutadas para este artículo.
| Evaluación | Astra | Sol | Diferencia |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | +20.6 puntos porcentuales |
| Tareas internas de migración de bases de datos | 63.9% | 42.7% | +21.2 puntos porcentuales |
| DeepSWE v1.1 | 74.1% | 72.7% | +1.4 puntos porcentuales |
| GPQA Diamond | 96.0% | 94.6% | +1.4 puntos porcentuales |
| MRCR v2, 512K–1M | 96.3% | 73.8% | +22.5 puntos porcentuales |
Las mejoras varían mucho según la tarea y no justifican afirmar que toda su capacidad de programación se haya duplicado. El anuncio indica que las puntuaciones son los máximos obtenidos entre los distintos niveles de razonamiento y que el entorno puede diferir del ChatGPT de producción. Fuente: anuncio de Astra y notas de evaluación
Evalúa las tareas largas a lo largo de todo el proceso
Por ejemplo, corregir un fallo de importación puede exigir leer registros, localizar el código de análisis, modificar la implementación, ejecutar comprobaciones y explicar qué datos se vieron afectados.
Comparar solo el informe final de la corrección no permite saber si el modelo encontró los archivos adecuados, conservó el comportamiento anterior u omitió la entrada que realmente fallaba.
Conserva el historial completo de ejecución al comparar Astra y Sol y registra especialmente:
- Si identificó el origen correcto del problema.
- Si ajustó el método después de un fallo.
- Si completó las validaciones necesarias.
- Si informó con precisión del trabajo pendiente.
Las nuevas funciones de API requieren soporte de la aplicación
La documentación de Astra incluye llamadas asíncronas a herramientas, instrucciones adicionales durante el trabajo y cambios del esfuerzo de razonamiento durante la conversación que conservan el prefijo almacenado en caché.
Las llamadas asíncronas permiten que el modelo atienda trabajo independiente antes de que una herramienta responda, pero la aplicación sigue gestionando su ejecución y las llamadas pendientes. Las instrucciones durante el trabajo utilizan el flujo WebSocket de Responses API y también necesitan soporte del cliente. Fuente: guía de Astra
Una aplicación que envía una única solicitud de texto y espera la respuesta no adquiere automáticamente un sistema completo de tareas asíncronas al cambiar a Astra.
Precios actuales de API: la diferencia entre los cuatro niveles
Estos son los precios Standard para contexto corto en el momento de la comprobación, en dólares estadounidenses por millón de tokens. Las lecturas y escrituras de caché se separan para no calcular toda la entrada con una sola tarifa.
| Modelo | Entrada sin caché | Lectura de caché | Escritura de caché | Salida |
|---|---|---|---|---|
| GPT-6 Astra | $10.00 | $1.00 | $12.50 | $50.00 |
| GPT-5.6 Sol | $4.00 | $0.40 | $5.00 | $20.00 |
| GPT-5.6 Terra | $2.00 | $0.20 | $2.50 | $12.00 |
| GPT-5.6 Luna | $0.20 | $0.02 | $0.25 | $1.20 |
Sol tiene actualmente una tarifa promocional que, según OpenAI, estará disponible al menos hasta el 21 de noviembre de 2026. No conviene considerarla una constante en un presupuesto a largo plazo. Fuente: precios de API
Con el mismo número de tokens de entrada sin caché y de salida, ambas tarifas de Astra son 2.5 veces las de Sol. Las de Terra, tanto de entrada como de salida, son 10 veces las de Luna.
Estas proporciones solo describen precios unitarios. Los modelos pueden consumir distintas cantidades de razonamiento e interacciones con herramientas, por lo que hay que medir por separado la factura real de cada tarea.
Ejemplo de coste por solicitud con el mismo uso de tokens
Supongamos una solicitud con 20,000 tokens de entrada sin caché y 4,000 tokens de salida facturables, sin caché, cargos por herramientas, suplementos regionales ni recargo por contexto largo.
El coste es la suma de los tokens de entrada divididos entre 1,000,000 y multiplicados por su tarifa, y los tokens de salida divididos entre 1,000,000 y multiplicados por la suya. Se conserva el ejemplo original:
|
|
| Modelo | Coste de entrada | Coste de salida | Total |
|---|---|---|---|
| Astra | $0.2000 | $0.2000 | $0.4000 |
| Sol | $0.0800 | $0.0800 | $0.1600 |
| Terra | $0.0400 | $0.0480 | $0.0880 |
| Luna | $0.0040 | $0.0048 | $0.0088 |
Es un cálculo a partir de la tabla de precios, no el coste medido de completar una tarea real. En particular, 4,000 tokens de salida facturables no equivalen a una respuesta visible de longitud fija.
Con ese mismo consumo durante 1,000 solicitudes, los costes serían 400, 160, 88 y 8.8 dólares respectivamente. Que resulte barato también depende de cuántos resultados superen la validación.
Cómo decidir si compensa el sobreprecio de Astra
Supongamos que una clase de tarea cuesta 0.16 dólares por intento con Sol y 0.40 con Astra.
En este ejemplo hipotético, si Sol necesita una media de tres intentos completos para entregar el resultado, el coste del modelo alcanza 0.48 dólares. Astra podría resultar más barato en esa tarea si la termina en un intento.
Los reintentos reales suelen tener entradas y salidas diferentes, así que el ejemplo no es un umbral fijo de rentabilidad. Ilustra que deben contarse fallos, reintentos y correcciones manuales para comparar el coste de entrega.
La conversión de formato de un texto puede necesitar pocas correcciones. En fallos complejos de código, el tiempo de investigación humana puede importar más que el coste de tokens. No hace falta aplicar la misma regla a ambos trabajos.
Un contexto de un millón de tokens no siempre tiene tarifa de contexto corto
Las páginas oficiales de los cuatro modelos indican estas capacidades:
| Parámetro | Astra | Sol / Terra / Luna |
|---|---|---|
| Ventana de contexto | 1,050,000 tokens | 1,050,000 tokens |
| Entrada máxima | 922,000 tokens | 922,000 tokens |
| Salida máxima | 128,000 tokens | 128,000 tokens |
| Fecha de corte de conocimientos | 2026-04-30 | 2026-02-16 |
| Modalidades de entrada | Texto, imagen | Texto, imagen |
| Modalidades de salida | Texto | Texto |
Fuentes: especificaciones de Astra, Sol, Terra, Luna.
Son especificaciones de los modelos de API, no compromisos sobre los límites de adjuntos o conversaciones de todos los planes e interfaces de ChatGPT.
La misma capacidad tampoco garantiza la misma comprensión de documentos largos. Cuánto material cabe y si el modelo identifica correctamente restricciones, excepciones y contradicciones son cuestiones que deben evaluarse por separado.
Qué cambia por encima de 272K tokens de entrada
Según las especificaciones oficiales, cuando la entrada supera los 272K tokens, la solicitud completa utiliza tarifas de contexto largo: el doble para entrada y 1.5 veces para salida respecto al contexto corto.
El recargo no se aplica solo a la parte que supera el umbral. La caché también debe calcularse con la tarifa de contexto largo correspondiente. Fuentes: especificaciones del modelo, tabla completa de precios
Empieza el diseño con tres preguntas:
- ¿Es necesario incluir toda la colección de documentos en una solicitud?
- ¿Se pueden recuperar primero las secciones pertinentes y conservar sus fuentes?
- ¿Hay relaciones entre secciones que se perderían al dividirlas?
Elige entrada completa, recuperación o procesamiento por fragmentos según los requisitos. Reducir la entrada a costa de perder pruebas puede aumentar las correcciones posteriores.
Entrada de imágenes y generación de imágenes son cosas distintas
Los cuatro modelos generales pueden recibir imágenes y devolver texto, por ejemplo para leer capturas, analizar gráficos o explicar la distribución de una página.
Las especificaciones también enumeran soporte para la herramienta de generación de imágenes. Eso significa que pueden llamar a esa herramienta, no que las modalidades nativas de salida sean texto e imágenes.
Al contratar edición de imágenes o voz en tiempo real, consulta las especificaciones y tarifas de los modelos especializados en lugar de aplicar el ejemplo de coste de texto de este artículo.
Elige por separado el esfuerzo de razonamiento y Fast mode
El esfuerzo de razonamiento afecta al cálculo dedicado al problema; Fast mode es un nivel del servicio de procesamiento de solicitudes. No deben confundirse con un único ajuste de velocidad.
| Modelo | Valores de reasoning.effort indicados en la documentación de API |
|---|---|
| Astra | low, medium, high, xhigh, max |
| Sol | none, low, medium, high, xhigh, max |
| Terra | none, low, medium, high, xhigh, max |
| Luna | none, low, medium, high, xhigh, max |
Las páginas de los tres modelos GPT-5.6 indican medium como valor predeterminado. Astra no admite none, por lo que hay que comprobar este ajuste al cambiar una configuración anterior. Fuentes: guía de Astra, especificaciones de Sol, Terra, Luna
Establece una comparación con ajustes de razonamiento explícitos y cambia una sola variable cada vez. Si cambias a la vez modelo, esfuerzo y nivel de procesamiento, será difícil explicar las diferencias de tiempo o coste.
Cuándo conviene Fast mode
La tabla actual de Fast indica el doble de las tarifas Standard correspondientes para los cuatro modelos. Fast no está disponible actualmente para Astra con residencia de datos en la UE, y su modo Fast no ofrece un SLA de latencia. Fuentes: precios, guía de Astra
Incluye Fast en las pruebas cuando una persona espere un resultado importante. Para tareas en segundo plano, tiene más sentido empezar comparando el procesamiento normal con opciones de procesamiento por lotes adecuadas.
No supongas que todo el proceso se acelerará por un factor fijo. La carga de páginas, las descargas y las respuestas de servicios externos también pueden consumir mucho tiempo.
Elegir según el trabajo real
Las siguientes asignaciones son sugerencias para una primera prueba. Ajústalas cuando los resultados de tus propias muestras indiquen otra cosa.
Redacción, traducción y organización de información
Puedes empezar con Terra para borradores de estructura clara, resúmenes y traducción general, y revisar muestras para detectar errores terminológicos, omisiones y problemas de estilo.
Compara Sol y Astra con la misma tarea cuando las fuentes se contradigan, sea necesario contrastarlas o un artículo largo contenga muchas restricciones.
Luna merece una primera prueba en procesos masivos con reglas establecidas, como extraer títulos, asignar etiquetas y normalizar campos.
Distingue una redacción fluida de pruebas correctas. La naturalidad del lenguaje no sustituye la verificación de fuentes.
Programación, depuración y cambios en repositorios
Evalúa primero Terra para pequeños cambios de funciones, scripts habituales y explicaciones de pruebas.
Para cambios entre archivos, dependencias complejas o fallos difíciles de reproducir, compara el resultado completo entregado por Sol y Astra.
Además de los resultados de las pruebas, revisa si los cambios cumplen la petición, si incluyen modificaciones ajenas y si el modelo afirma haber ejecutado comprobaciones que no realizó.
Si el proceso con Sol ya es estable, prueba Astra con un conjunto de problemas históricamente difíciles antes de ampliar su uso.
Navegador y uso del ordenador
Estas tareas suelen combinar reconocimiento visual, evaluación del estado y acciones consecutivas, por lo que Astra puede ser uno de los primeros candidatos.
Usa la misma página inicial y los mismos permisos en cada evaluación, y registra el estado final real: si se guardó el archivo, se actualizó la tabla y se puede volver a abrir el resultado.
Que el modelo diga que la operación tuvo éxito no basta para darla por terminada. El entorno de herramientas, los permisos de la aplicación y los cambios de página también influyen.
Clasificación, extracción y tareas masivas en segundo plano
Proporciona a Luna campos explícitos, unos pocos ejemplos representativos y reglas para valores nulos y entradas anómalas.
Enviar a Terra o Sol los elementos que no superen la validación de formato o de negocio es una posible estrategia experimental de distribución.
El paso a un modelo superior debe activarse por errores comprobables, como campos ausentes, rangos de valores incompatibles o pruebas insuficientes. No dependas solo de la confianza que declare el propio modelo.
Una tabla práctica para evaluar modelos
Una primera muestra de 20–50 tareas reales se acerca más a las necesidades del trabajo que repetir una sola pregunta capciosa. Ese tamaño sirve para una selección inicial, no para demostrar que los errores poco frecuentes han desaparecido.
Incluye solicitudes habituales, fallos históricos y algunos casos límite, y define de antemano los criterios de aceptación.
| Elemento | Qué registrar | Para qué sirve |
|---|---|---|
| ID de tarea | Entrada fija y resultado esperado | Permite repetir la comparación |
| Modelo y esfuerzo | ID completo del modelo y effort | Evita confundir diferencias de configuración con rendimiento |
| Entorno de herramientas | Herramientas disponibles, permisos, estado inicial | Controla las condiciones externas |
| Acierto al primer intento | Si cumplió directamente los requisitos | Mide la necesidad de correcciones |
| Tiempo total | Desde el inicio hasta un resultado entregable | Incluye herramientas y espera de reintentos |
| Uso de tokens | Entrada, salida, lecturas y escrituras de caché | Explica diferencias de coste |
| Coste real | Suma según las tarifas aplicables | Compara la tarea completa |
| Intervención humana | Número y tiempo empleado | Revela costes de uso ocultos |
| Tipo de fallo | Hechos, formato, herramientas, omisiones, etc. | Ayuda a elegir entre cambiar de modelo o de proceso |
Cómo validar cada tipo de tarea
- Extracción de campos: compara con etiquetas humanas y cuenta por separado campos ausentes e incorrectos.
- Traducción: comprueba negaciones, cifras, unidades, nombres propios y párrafos omitidos.
- Cambios de código: revisa las diferencias reales y ejecuta validaciones relacionadas con ellas.
- Investigación: abre las citas y verifica que las fuentes respalden las conclusiones correspondientes.
- Uso del ordenador: vuelve a leer el estado final de la aplicación o del archivo de destino.
Mantén revisiones humanas por muestreo aunque un modelo ayude con esas comprobaciones. El modelo que genera una respuesta y el que la evalúa pueden compartir puntos ciegos.
Cómo interpretar los resultados
Si Luna supera la mayoría de las tareas habituales y los errores se concentran en unas pocas categorías complejas, considera distribuir por tipo de tarea.
Si Terra y Sol ofrecen una calidad similar, pero Sol termina antes el trabajo con herramientas, compara tiempo y coste totales, no solo el precio de entrada.
Si Astra solo destaca en unas pocas tareas difíciles de alto valor, reservarlo para ellas también es una decisión razonable.
Si los cuatro fallan en el mismo punto, revisa primero los datos de entrada, las respuestas de las herramientas y los criterios de aceptación. Un modelo superior no necesariamente suple datos ausentes.
Comprobaciones de API al pasar de GPT-5.6 a Astra
Este es un cuerpo mínimo de solicitud de Responses API, sin autenticación ni código de cliente. Ilustra el nombre del modelo y el campo de razonamiento; no es un registro de una llamada ejecutada por este sitio. La instrucción original en chino pide comparar las restricciones, los costes y los asuntos pendientes de las propuestas adjuntas.
|
|
Las aplicaciones que usaban GPT-5.6 también deben revisar estos puntos de compatibilidad:
- Si el esfuerzo anterior era
noneominimal, empieza la comparación conlow, admitido por Astra. - Elimina
temperature,top_pytop_logprobs, que Astra no admite. - Usa Responses API para llamar a herramientas; que Astra admita Chat Completions no implica que admita allí llamadas a herramientas.
- En Chat Completions, busca y elimina
logprobs; en Responses, comprueba siincludecontienemessage.output_text.logprobs. - Usa Standard en solicitudes con residencia de datos en la UE y revisa si quedan ajustes Fast o Priority.
La guía oficial de migración enumera expresamente estos puntos. Las aplicaciones complejas deben revisar también su caché, estado de conversación y ejecución de herramientas. Fuente: migración a Astra
Conserva una opción de configuración para el modelo anterior durante la migración y ejecuta primero las mismas muestras de aceptación. Recibir texto demuestra que la llamada básica funciona, no que la calidad de negocio sea suficiente.
Las diferencias entre ChatGPT, Codex y la API
El nombre identifica el modelo; ChatGPT, Codex y la API son formas distintas de acceder a él. Las herramientas, la gestión de contexto, los permisos y la facturación de cada una influyen en la experiencia.
El anuncio de Astra describe un despliegue gradual en los planes de pago correspondientes de ChatGPT, la API y otros canales. En los espacios empresariales está desactivado de forma predeterminada al lanzamiento y debe habilitarlo un administrador. Consulta el selector de modelos o los permisos de tu organización para saber si tu cuenta ya tiene acceso. Fuente: anuncio de Astra
Por tanto, la tabla de API no se puede convertir directamente en un número de mensajes de un plan de ChatGPT. Tampoco cabe suponer que cada ajuste de la interfaz de Codex corresponda exactamente a un parámetro de API.
Al publicar comparaciones, indicar el canal de acceso, las herramientas y el esfuerzo de razonamiento facilita la reproducción más que mencionar solo el modelo.
Preguntas frecuentes
¿Sigue teniendo sentido usar Sol tras el lanzamiento de Astra?
Sí, merece seguir comparándolo. Sol tiene actualmente precios unitarios más bajos y algunas aplicaciones ya se han validado con él. Cambiar depende de si Astra reduce errores, tiempo de entrega o coste de las correcciones en tus tareas.
¿El bajo precio de Luna significa que solo sirve para conversaciones sencillas?
No. OpenAI lo orienta a grandes volúmenes sensibles al coste, y también admite razonamiento y herramientas. Es mejor evaluar si las restricciones están claras y si la salida supera la validación de forma consistente.
¿Por qué los precios difieren tanto si el contexto tiene el mismo tamaño?
La ventana de contexto es una especificación de capacidad. La elección también depende de la calidad del razonamiento, el uso de herramientas y el coste; el mismo tamaño no demuestra la misma capacidad global.
¿Debería usar max de forma predeterminada en todas las solicitudes?
Evalúalo primero. Una extracción sencilla de campos y una depuración compleja requieren distinto esfuerzo de cálculo. Comprueba si aumentarlo produce una mejora verificable.
¿Hay que descartar por completo GPT-5.5 y GPT-5.4?
Pueden seguir siendo referencias para aplicaciones existentes. Este artículo se centra en los cuatro modelos generales principales actuales; compara los procesos antiguos estables con las mismas muestras antes de migrar.
¿Cómo tomar la decisión final?
Fija la calidad mínima y compara después el coste de las tareas que superan la aceptación. Permite usar modelos distintos según la tarea y repite el muestreo cuando cambien precios, comportamiento o datos de negocio.
Referencias oficiales
- Anuncio de GPT-6 Astra: contexto del lanzamiento, evaluaciones y despliegue.
- Catálogo de modelos de OpenAI: posicionamiento actual y categorías especializadas.
- Especificaciones de GPT-6 Astra: contexto, modalidades y herramientas.
- Especificaciones de GPT-5.6 Sol: alias, parámetros y promoción.
- Especificaciones de GPT-5.6 Terra: nivel equilibrado.
- Especificaciones de GPT-5.6 Luna: nivel de gran volumen.
- Precios de API: Standard, caché, contexto largo y niveles de procesamiento.
- Guía de uso y migración de Astra: nuevas funciones, restricciones de parámetros y comprobaciones de migración.