Cómo elegir un modelo de OpenAI: GPT-6 Astra frente a GPT-5.6 Sol, Terra y Luna

Compara GPT-6 Astra con GPT-5.6 Sol, Terra y Luna por enfoque, precios actuales de API, contexto y razonamiento, con ejemplos de coste y un método práctico de evaluación.

Evalúa primero GPT-6 Astra para tareas complejas y largas que exijan varias operaciones consecutivas con herramientas. Empieza por Terra para el trabajo habitual, compara Sol cuando la dificultad sea mayor y el presupuesto limitado, y prueba Luna para procesar grandes volúmenes con reglas claras.

Son puntos de partida basados en el posicionamiento oficial, no una clasificación de rendimiento válida para cualquier tarea. La decisión final debe comparar precisión, tiempo y coste total al completar el mismo trabajo.

La información se verificó el 10 de septiembre de 2026 con el catálogo oficial de modelos de OpenAI, la documentación de la API y el anuncio de GPT-6 Astra. La distribución de tareas y el plan de evaluación son sugerencias prácticas; las demostraciones oficiales no se presentan como pruebas realizadas por este sitio.

El posicionamiento de los cuatro modelos

Este artículo se centra en modelos de propósito general para texto, código y llamadas a herramientas. La generación de imágenes, la voz en tiempo real y la transcripción tienen modelos especializados que no conviene incluir en la misma clasificación de capacidades generales.

Modelo Posicionamiento oficial Primeras tareas sugeridas Pregunta principal al elegir
GPT-6 Astra Los trabajos más difíciles de principio a fin Tareas largas entre herramientas, depuración compleja, investigación y entrega de documentos ¿Reduce de forma importante los fallos y las correcciones manuales?
GPT-5.6 Sol Modelo insignia para trabajo profesional complejo Programación difícil, análisis con varias restricciones, procesos consolidados ¿Cumple los requisitos con menos coste que Astra?
GPT-5.6 Terra Equilibrio entre inteligencia y coste Programación habitual, procesamiento de contenido, asistentes de complejidad media ¿Cubre la mayoría de las solicitudes habituales?
GPT-5.6 Luna Trabajo de gran volumen sensible al coste Clasificación, extracción de campos, resúmenes breves, conversión de formato ¿Las reglas son claras y los resultados fáciles de validar?

OpenAI recomienda actualmente empezar por Astra en caso de duda, elegir Terra para equilibrar capacidad y coste, y Luna para grandes volúmenes. Las asignaciones concretas de la tabla son sugerencias derivadas de esos enfoques. Fuente: catálogo de modelos

Los desarrolladores pueden usar primero Astra para determinar la calidad alcanzable en una tarea y comparar después modelos más baratos con las mismas entradas. En una aplicación estable, resulta más útil conservar el modelo actual como referencia.

La relación de Sol, Terra y Luna con los nombres anteriores

Las categorías anteriores ayudan a entender la familia GPT-5.6:

  • Sol corresponde aproximadamente al nivel principal que antes no llevaba el sufijo mini ni nano.
  • Terra corresponde aproximadamente al antiguo nivel mini.
  • Luna corresponde aproximadamente al antiguo nivel nano.

Es una analogía de posicionamiento, no una afirmación de que el comportamiento, los precios, los límites o la calidad sean idénticos a los de modelos anteriores.

Además, gpt-5.6 es un alias de Sol. Escribir gpt-5.6-sol en la configuración deja más claro qué nivel se ha elegido. Fuentes: Sol, Terra, Luna

Qué destaca de GPT-6 Astra frente a Sol

El anuncio de Astra pone el acento en el uso del ordenador, las tareas largas y el trabajo complejo con software. Conviene comprobar si puede terminar una secuencia de pasos y modificar el plan cuando aparece información nueva a mitad del trabajo.

La siguiente tabla recoge algunas comparaciones del anuncio. Son evaluaciones publicadas por OpenAI, no pruebas ejecutadas para este artículo.

Evaluación Astra Sol Diferencia
Terminal-Bench 4.0 57.9% 37.3% +20.6 puntos porcentuales
Tareas internas de migración de bases de datos 63.9% 42.7% +21.2 puntos porcentuales
DeepSWE v1.1 74.1% 72.7% +1.4 puntos porcentuales
GPQA Diamond 96.0% 94.6% +1.4 puntos porcentuales
MRCR v2, 512K–1M 96.3% 73.8% +22.5 puntos porcentuales

Las mejoras varían mucho según la tarea y no justifican afirmar que toda su capacidad de programación se haya duplicado. El anuncio indica que las puntuaciones son los máximos obtenidos entre los distintos niveles de razonamiento y que el entorno puede diferir del ChatGPT de producción. Fuente: anuncio de Astra y notas de evaluación

Evalúa las tareas largas a lo largo de todo el proceso

Por ejemplo, corregir un fallo de importación puede exigir leer registros, localizar el código de análisis, modificar la implementación, ejecutar comprobaciones y explicar qué datos se vieron afectados.

Comparar solo el informe final de la corrección no permite saber si el modelo encontró los archivos adecuados, conservó el comportamiento anterior u omitió la entrada que realmente fallaba.

Conserva el historial completo de ejecución al comparar Astra y Sol y registra especialmente:

  • Si identificó el origen correcto del problema.
  • Si ajustó el método después de un fallo.
  • Si completó las validaciones necesarias.
  • Si informó con precisión del trabajo pendiente.

Las nuevas funciones de API requieren soporte de la aplicación

La documentación de Astra incluye llamadas asíncronas a herramientas, instrucciones adicionales durante el trabajo y cambios del esfuerzo de razonamiento durante la conversación que conservan el prefijo almacenado en caché.

Las llamadas asíncronas permiten que el modelo atienda trabajo independiente antes de que una herramienta responda, pero la aplicación sigue gestionando su ejecución y las llamadas pendientes. Las instrucciones durante el trabajo utilizan el flujo WebSocket de Responses API y también necesitan soporte del cliente. Fuente: guía de Astra

Una aplicación que envía una única solicitud de texto y espera la respuesta no adquiere automáticamente un sistema completo de tareas asíncronas al cambiar a Astra.

Precios actuales de API: la diferencia entre los cuatro niveles

Estos son los precios Standard para contexto corto en el momento de la comprobación, en dólares estadounidenses por millón de tokens. Las lecturas y escrituras de caché se separan para no calcular toda la entrada con una sola tarifa.

Modelo Entrada sin caché Lectura de caché Escritura de caché Salida
GPT-6 Astra $10.00 $1.00 $12.50 $50.00
GPT-5.6 Sol $4.00 $0.40 $5.00 $20.00
GPT-5.6 Terra $2.00 $0.20 $2.50 $12.00
GPT-5.6 Luna $0.20 $0.02 $0.25 $1.20

Sol tiene actualmente una tarifa promocional que, según OpenAI, estará disponible al menos hasta el 21 de noviembre de 2026. No conviene considerarla una constante en un presupuesto a largo plazo. Fuente: precios de API

Con el mismo número de tokens de entrada sin caché y de salida, ambas tarifas de Astra son 2.5 veces las de Sol. Las de Terra, tanto de entrada como de salida, son 10 veces las de Luna.

Estas proporciones solo describen precios unitarios. Los modelos pueden consumir distintas cantidades de razonamiento e interacciones con herramientas, por lo que hay que medir por separado la factura real de cada tarea.

Ejemplo de coste por solicitud con el mismo uso de tokens

Supongamos una solicitud con 20,000 tokens de entrada sin caché y 4,000 tokens de salida facturables, sin caché, cargos por herramientas, suplementos regionales ni recargo por contexto largo.

El coste es la suma de los tokens de entrada divididos entre 1,000,000 y multiplicados por su tarifa, y los tokens de salida divididos entre 1,000,000 y multiplicados por la suya. Se conserva el ejemplo original:

1
2
单次费用 = 输入 token / 1,000,000 × 输入单价
         + 输出 token / 1,000,000 × 输出单价
Modelo Coste de entrada Coste de salida Total
Astra $0.2000 $0.2000 $0.4000
Sol $0.0800 $0.0800 $0.1600
Terra $0.0400 $0.0480 $0.0880
Luna $0.0040 $0.0048 $0.0088

Es un cálculo a partir de la tabla de precios, no el coste medido de completar una tarea real. En particular, 4,000 tokens de salida facturables no equivalen a una respuesta visible de longitud fija.

Con ese mismo consumo durante 1,000 solicitudes, los costes serían 400, 160, 88 y 8.8 dólares respectivamente. Que resulte barato también depende de cuántos resultados superen la validación.

Cómo decidir si compensa el sobreprecio de Astra

Supongamos que una clase de tarea cuesta 0.16 dólares por intento con Sol y 0.40 con Astra.

En este ejemplo hipotético, si Sol necesita una media de tres intentos completos para entregar el resultado, el coste del modelo alcanza 0.48 dólares. Astra podría resultar más barato en esa tarea si la termina en un intento.

Los reintentos reales suelen tener entradas y salidas diferentes, así que el ejemplo no es un umbral fijo de rentabilidad. Ilustra que deben contarse fallos, reintentos y correcciones manuales para comparar el coste de entrega.

La conversión de formato de un texto puede necesitar pocas correcciones. En fallos complejos de código, el tiempo de investigación humana puede importar más que el coste de tokens. No hace falta aplicar la misma regla a ambos trabajos.

Un contexto de un millón de tokens no siempre tiene tarifa de contexto corto

Las páginas oficiales de los cuatro modelos indican estas capacidades:

Parámetro Astra Sol / Terra / Luna
Ventana de contexto 1,050,000 tokens 1,050,000 tokens
Entrada máxima 922,000 tokens 922,000 tokens
Salida máxima 128,000 tokens 128,000 tokens
Fecha de corte de conocimientos 2026-04-30 2026-02-16
Modalidades de entrada Texto, imagen Texto, imagen
Modalidades de salida Texto Texto

Fuentes: especificaciones de Astra, Sol, Terra, Luna.

Son especificaciones de los modelos de API, no compromisos sobre los límites de adjuntos o conversaciones de todos los planes e interfaces de ChatGPT.

La misma capacidad tampoco garantiza la misma comprensión de documentos largos. Cuánto material cabe y si el modelo identifica correctamente restricciones, excepciones y contradicciones son cuestiones que deben evaluarse por separado.

Qué cambia por encima de 272K tokens de entrada

Según las especificaciones oficiales, cuando la entrada supera los 272K tokens, la solicitud completa utiliza tarifas de contexto largo: el doble para entrada y 1.5 veces para salida respecto al contexto corto.

El recargo no se aplica solo a la parte que supera el umbral. La caché también debe calcularse con la tarifa de contexto largo correspondiente. Fuentes: especificaciones del modelo, tabla completa de precios

Empieza el diseño con tres preguntas:

  1. ¿Es necesario incluir toda la colección de documentos en una solicitud?
  2. ¿Se pueden recuperar primero las secciones pertinentes y conservar sus fuentes?
  3. ¿Hay relaciones entre secciones que se perderían al dividirlas?

Elige entrada completa, recuperación o procesamiento por fragmentos según los requisitos. Reducir la entrada a costa de perder pruebas puede aumentar las correcciones posteriores.

Entrada de imágenes y generación de imágenes son cosas distintas

Los cuatro modelos generales pueden recibir imágenes y devolver texto, por ejemplo para leer capturas, analizar gráficos o explicar la distribución de una página.

Las especificaciones también enumeran soporte para la herramienta de generación de imágenes. Eso significa que pueden llamar a esa herramienta, no que las modalidades nativas de salida sean texto e imágenes.

Al contratar edición de imágenes o voz en tiempo real, consulta las especificaciones y tarifas de los modelos especializados en lugar de aplicar el ejemplo de coste de texto de este artículo.

Elige por separado el esfuerzo de razonamiento y Fast mode

El esfuerzo de razonamiento afecta al cálculo dedicado al problema; Fast mode es un nivel del servicio de procesamiento de solicitudes. No deben confundirse con un único ajuste de velocidad.

Modelo Valores de reasoning.effort indicados en la documentación de API
Astra low, medium, high, xhigh, max
Sol none, low, medium, high, xhigh, max
Terra none, low, medium, high, xhigh, max
Luna none, low, medium, high, xhigh, max

Las páginas de los tres modelos GPT-5.6 indican medium como valor predeterminado. Astra no admite none, por lo que hay que comprobar este ajuste al cambiar una configuración anterior. Fuentes: guía de Astra, especificaciones de Sol, Terra, Luna

Establece una comparación con ajustes de razonamiento explícitos y cambia una sola variable cada vez. Si cambias a la vez modelo, esfuerzo y nivel de procesamiento, será difícil explicar las diferencias de tiempo o coste.

Cuándo conviene Fast mode

La tabla actual de Fast indica el doble de las tarifas Standard correspondientes para los cuatro modelos. Fast no está disponible actualmente para Astra con residencia de datos en la UE, y su modo Fast no ofrece un SLA de latencia. Fuentes: precios, guía de Astra

Incluye Fast en las pruebas cuando una persona espere un resultado importante. Para tareas en segundo plano, tiene más sentido empezar comparando el procesamiento normal con opciones de procesamiento por lotes adecuadas.

No supongas que todo el proceso se acelerará por un factor fijo. La carga de páginas, las descargas y las respuestas de servicios externos también pueden consumir mucho tiempo.

Elegir según el trabajo real

Las siguientes asignaciones son sugerencias para una primera prueba. Ajústalas cuando los resultados de tus propias muestras indiquen otra cosa.

Redacción, traducción y organización de información

Puedes empezar con Terra para borradores de estructura clara, resúmenes y traducción general, y revisar muestras para detectar errores terminológicos, omisiones y problemas de estilo.

Compara Sol y Astra con la misma tarea cuando las fuentes se contradigan, sea necesario contrastarlas o un artículo largo contenga muchas restricciones.

Luna merece una primera prueba en procesos masivos con reglas establecidas, como extraer títulos, asignar etiquetas y normalizar campos.

Distingue una redacción fluida de pruebas correctas. La naturalidad del lenguaje no sustituye la verificación de fuentes.

Programación, depuración y cambios en repositorios

Evalúa primero Terra para pequeños cambios de funciones, scripts habituales y explicaciones de pruebas.

Para cambios entre archivos, dependencias complejas o fallos difíciles de reproducir, compara el resultado completo entregado por Sol y Astra.

Además de los resultados de las pruebas, revisa si los cambios cumplen la petición, si incluyen modificaciones ajenas y si el modelo afirma haber ejecutado comprobaciones que no realizó.

Si el proceso con Sol ya es estable, prueba Astra con un conjunto de problemas históricamente difíciles antes de ampliar su uso.

Estas tareas suelen combinar reconocimiento visual, evaluación del estado y acciones consecutivas, por lo que Astra puede ser uno de los primeros candidatos.

Usa la misma página inicial y los mismos permisos en cada evaluación, y registra el estado final real: si se guardó el archivo, se actualizó la tabla y se puede volver a abrir el resultado.

Que el modelo diga que la operación tuvo éxito no basta para darla por terminada. El entorno de herramientas, los permisos de la aplicación y los cambios de página también influyen.

Clasificación, extracción y tareas masivas en segundo plano

Proporciona a Luna campos explícitos, unos pocos ejemplos representativos y reglas para valores nulos y entradas anómalas.

Enviar a Terra o Sol los elementos que no superen la validación de formato o de negocio es una posible estrategia experimental de distribución.

El paso a un modelo superior debe activarse por errores comprobables, como campos ausentes, rangos de valores incompatibles o pruebas insuficientes. No dependas solo de la confianza que declare el propio modelo.

Una tabla práctica para evaluar modelos

Una primera muestra de 20–50 tareas reales se acerca más a las necesidades del trabajo que repetir una sola pregunta capciosa. Ese tamaño sirve para una selección inicial, no para demostrar que los errores poco frecuentes han desaparecido.

Incluye solicitudes habituales, fallos históricos y algunos casos límite, y define de antemano los criterios de aceptación.

Elemento Qué registrar Para qué sirve
ID de tarea Entrada fija y resultado esperado Permite repetir la comparación
Modelo y esfuerzo ID completo del modelo y effort Evita confundir diferencias de configuración con rendimiento
Entorno de herramientas Herramientas disponibles, permisos, estado inicial Controla las condiciones externas
Acierto al primer intento Si cumplió directamente los requisitos Mide la necesidad de correcciones
Tiempo total Desde el inicio hasta un resultado entregable Incluye herramientas y espera de reintentos
Uso de tokens Entrada, salida, lecturas y escrituras de caché Explica diferencias de coste
Coste real Suma según las tarifas aplicables Compara la tarea completa
Intervención humana Número y tiempo empleado Revela costes de uso ocultos
Tipo de fallo Hechos, formato, herramientas, omisiones, etc. Ayuda a elegir entre cambiar de modelo o de proceso

Cómo validar cada tipo de tarea

  • Extracción de campos: compara con etiquetas humanas y cuenta por separado campos ausentes e incorrectos.
  • Traducción: comprueba negaciones, cifras, unidades, nombres propios y párrafos omitidos.
  • Cambios de código: revisa las diferencias reales y ejecuta validaciones relacionadas con ellas.
  • Investigación: abre las citas y verifica que las fuentes respalden las conclusiones correspondientes.
  • Uso del ordenador: vuelve a leer el estado final de la aplicación o del archivo de destino.

Mantén revisiones humanas por muestreo aunque un modelo ayude con esas comprobaciones. El modelo que genera una respuesta y el que la evalúa pueden compartir puntos ciegos.

Cómo interpretar los resultados

Si Luna supera la mayoría de las tareas habituales y los errores se concentran en unas pocas categorías complejas, considera distribuir por tipo de tarea.

Si Terra y Sol ofrecen una calidad similar, pero Sol termina antes el trabajo con herramientas, compara tiempo y coste totales, no solo el precio de entrada.

Si Astra solo destaca en unas pocas tareas difíciles de alto valor, reservarlo para ellas también es una decisión razonable.

Si los cuatro fallan en el mismo punto, revisa primero los datos de entrada, las respuestas de las herramientas y los criterios de aceptación. Un modelo superior no necesariamente suple datos ausentes.

Comprobaciones de API al pasar de GPT-5.6 a Astra

Este es un cuerpo mínimo de solicitud de Responses API, sin autenticación ni código de cliente. Ilustra el nombre del modelo y el campo de razonamiento; no es un registro de una llamada ejecutada por este sitio. La instrucción original en chino pide comparar las restricciones, los costes y los asuntos pendientes de las propuestas adjuntas.

1
2
3
4
5
6
7
{
  "model": "gpt-6-astra",
  "reasoning": {
    "effort": "medium"
  },
  "input": "请比较所附方案的约束、成本和未解决问题。"
}

Las aplicaciones que usaban GPT-5.6 también deben revisar estos puntos de compatibilidad:

  1. Si el esfuerzo anterior era none o minimal, empieza la comparación con low, admitido por Astra.
  2. Elimina temperature, top_p y top_logprobs, que Astra no admite.
  3. Usa Responses API para llamar a herramientas; que Astra admita Chat Completions no implica que admita allí llamadas a herramientas.
  4. En Chat Completions, busca y elimina logprobs; en Responses, comprueba si include contiene message.output_text.logprobs.
  5. Usa Standard en solicitudes con residencia de datos en la UE y revisa si quedan ajustes Fast o Priority.

La guía oficial de migración enumera expresamente estos puntos. Las aplicaciones complejas deben revisar también su caché, estado de conversación y ejecución de herramientas. Fuente: migración a Astra

Conserva una opción de configuración para el modelo anterior durante la migración y ejecuta primero las mismas muestras de aceptación. Recibir texto demuestra que la llamada básica funciona, no que la calidad de negocio sea suficiente.

Las diferencias entre ChatGPT, Codex y la API

El nombre identifica el modelo; ChatGPT, Codex y la API son formas distintas de acceder a él. Las herramientas, la gestión de contexto, los permisos y la facturación de cada una influyen en la experiencia.

El anuncio de Astra describe un despliegue gradual en los planes de pago correspondientes de ChatGPT, la API y otros canales. En los espacios empresariales está desactivado de forma predeterminada al lanzamiento y debe habilitarlo un administrador. Consulta el selector de modelos o los permisos de tu organización para saber si tu cuenta ya tiene acceso. Fuente: anuncio de Astra

Por tanto, la tabla de API no se puede convertir directamente en un número de mensajes de un plan de ChatGPT. Tampoco cabe suponer que cada ajuste de la interfaz de Codex corresponda exactamente a un parámetro de API.

Al publicar comparaciones, indicar el canal de acceso, las herramientas y el esfuerzo de razonamiento facilita la reproducción más que mencionar solo el modelo.

Preguntas frecuentes

¿Sigue teniendo sentido usar Sol tras el lanzamiento de Astra?

Sí, merece seguir comparándolo. Sol tiene actualmente precios unitarios más bajos y algunas aplicaciones ya se han validado con él. Cambiar depende de si Astra reduce errores, tiempo de entrega o coste de las correcciones en tus tareas.

¿El bajo precio de Luna significa que solo sirve para conversaciones sencillas?

No. OpenAI lo orienta a grandes volúmenes sensibles al coste, y también admite razonamiento y herramientas. Es mejor evaluar si las restricciones están claras y si la salida supera la validación de forma consistente.

¿Por qué los precios difieren tanto si el contexto tiene el mismo tamaño?

La ventana de contexto es una especificación de capacidad. La elección también depende de la calidad del razonamiento, el uso de herramientas y el coste; el mismo tamaño no demuestra la misma capacidad global.

¿Debería usar max de forma predeterminada en todas las solicitudes?

Evalúalo primero. Una extracción sencilla de campos y una depuración compleja requieren distinto esfuerzo de cálculo. Comprueba si aumentarlo produce una mejora verificable.

¿Hay que descartar por completo GPT-5.5 y GPT-5.4?

Pueden seguir siendo referencias para aplicaciones existentes. Este artículo se centra en los cuatro modelos generales principales actuales; compara los procesos antiguos estables con las mismas muestras antes de migrar.

¿Cómo tomar la decisión final?

Fija la calidad mínima y compara después el coste de las tareas que superan la aceptación. Permite usar modelos distintos según la tarea y repite el muestreo cuando cambien precios, comportamiento o datos de negocio.

Referencias oficiales