La línea actual de modelos Claude de Anthropic ya no se resume en “Haiku es rápido, Sonnet es equilibrado y Opus es el más fuerte”. En julio de 2026, los modelos principales incluyen Claude Fable 5, Claude Opus 4.8, Claude Sonnet 5, Claude Haiku 4.5 y Claude Mythos 5 con disponibilidad limitada.
Si quieres una regla rápida: usa Sonnet 5 primero para desarrollo diario y la mayoría de tareas de Agent; Opus 4.8 para Agents empresariales complejos y programación difícil; Fable 5 cuando necesites la máxima capacidad; Haiku 4.5 para baja latencia y costes sensibles; Mythos 5 no es una opción general, solo para clientes aprobados.
Modelos principales actuales
| Modelo | API ID / alias | Posición | Contexto | Salida máxima | Latencia | Precio estándar |
|---|---|---|---|---|---|---|
| Claude Fable 5 | claude-fable-5 |
Máxima capacidad entre los modelos ampliamente publicados de Anthropic, adecuado para Agents largos | 1M tokens | 128k tokens | Más lento | Entrada $10 / MTok, salida $50 / MTok |
| Claude Opus 4.8 | claude-opus-4-8 |
Programación Agent compleja, workflows empresariales, uso de navegador/computadora | 1M tokens | 128k tokens | Media | Entrada $5 / MTok, salida $25 / MTok |
| Claude Sonnet 5 | claude-sonnet-5 |
Mejor equilibrio entre velocidad, capacidad y precio; buen modelo por defecto | 1M tokens | 128k tokens | Rápido | Hasta 2026-08-31: entrada $2 / MTok, salida $10 / MTok; luego $3 / $15 |
| Claude Haiku 4.5 | claude-haiku-4-5 |
Más rápido y barato, para tareas ligeras de alto volumen | 200k tokens | 64k tokens | Más rápido | Entrada $1 / MTok, salida $5 / MTok |
| Claude Mythos 5 | claude-mythos-5 |
Mismas especificaciones y precio que Fable 5, pero limitado | 1M tokens | 128k tokens | Más lento | Entrada $10 / MTok, salida $50 / MTok |
MTok significa million tokens, es decir, un millón de tokens. Los precios también pueden depender de prompt caching, batch, residencia de datos, plataforma cloud y región. La tabla muestra solo los precios base más comunes.
Fable 5: máxima capacidad, pero no el valor por defecto
Claude Fable 5 es el modelo de mayor capacidad entre los que Anthropic publica ampliamente. Su posición oficial es next-generation intelligence for long-running agents.
Encaja con:
- Workflows de Agent largos, de varios pasos y con autonomía.
- Investigación compleja, migración de código y planificación entre sistemas.
- Tareas empresariales que requieren máximo razonamiento y contexto amplio.
- Tareas de alto valor menos sensibles a coste y latencia.
Pero Fable 5 no siempre debe ser el modelo por defecto. Es el más caro y más lento. Salvo que la tarea necesite realmente el techo más alto, suele ser más estable empezar con Sonnet 5 u Opus 4.8.
Además, Fable 5 usa adaptive thinking y está always on. Decide automáticamente cuándo razonar y cuánto. Esto ayuda en tareas complejas, pero hace que coste y tiempo de respuesta dependan más de la tarea.
Opus 4.8: opción sólida para programación compleja y Agents empresariales
Claude Opus 4.8 está entre Fable 5 y Sonnet 5. Anthropic sugiere empezar con Opus 4.8 cuando no sepas qué modelo usar para programación Agent compleja y trabajo empresarial.
Sus ventajas:
- Contexto de 1M tokens.
- Salida máxima de 128k tokens.
- Buen rendimiento en programación compleja, browser Agents, computer use y workflows empresariales.
- Cuesta la mitad que Fable 5.
- Soporta adaptive thinking.
Opus 4.8 encaja como “modelo por defecto para tareas difíciles”. Refactors a nivel de repositorio, PR complejos, análisis de datos empresariales, Agents con varias herramientas y razonamiento sobre documentos largos pueden empezar aquí.
Si la tarea es extremadamente difícil, sube de Opus 4.8 a Fable 5. Si el volumen es grande y el coste pesa, baja a Sonnet 5.
Puntos clave de esta actualización
Claude Opus 4.8 ya está disponible y mantiene el mismo precio. Anthropic también destacó varios cambios relacionados:
- Opus 4.8 sigue mejorando frente a la generación anterior en evaluaciones de código, capacidades de agente, razonamiento y trabajo de conocimiento.
- Los usuarios de
claude.aipueden controlar cuánto effort dedica Claude a una tarea. - Claude Code añade dynamic workflows para manejar problemas de mayor escala.
- El fast mode de Opus 4.8 puede trabajar a unas 2,5 veces la velocidad y cuesta tres veces menos que el fast mode del modelo anterior.
Vistos en conjunto, estos cambios muestran que Anthropic no solo está haciendo una pequeña mejora de puntuación del modelo. Está ajustando el producto alrededor de la idea de “ejecutar tareas complejas durante mucho tiempo”. Un modelo más potente es solo una parte; el control de tareas, la descomposición del flujo de trabajo y la estructura de costes son igual de importantes.
Por qué los usuarios de Claude Code deberían prestarle más atención
Para un agent de programación como Claude Code, el mayor riesgo no es no saber escribir una función concreta, sino perderse dentro de un repositorio real. Necesita leer archivos, entender dependencias, ejecutar pruebas, revisar errores, ajustar el plan y mantener los cambios dentro de un alcance razonable.
Los puntos fuertes de Opus 4.8 encajan justo con estos problemas:
- Es más adecuado para agentic tasks, es decir, tareas en las que el modelo debe planificar de forma continua, llamar herramientas, observar resultados y ajustar la estrategia.
- Da más importancia al judgement, por lo que puede detenerse y confirmar cuando hay incertidumbre, en lugar de seguir escribiendo algo equivocado con demasiada confianza.
- Dynamic workflows hace que Claude Code sea más adecuado para problemas grandes y de varios pasos.
Si estas capacidades se mantienen estables en proyectos reales, la forma de usar Claude Code se acercará más a “darle un objetivo claro y dejar que avance”, no solo pedirle que complete un fragmento de código.
Qué significa el control de effort
Anthropic añadió esta vez control de effort a claude.ai, y el significado es directo: el usuario puede ajustar cuánta energía dedica el modelo a una tarea.
Esto es muy práctico en el uso diario. Las preguntas simples no necesitan razonamiento profundo, mientras que las tareas complejas sí merecen que el modelo piense un poco más. Antes, muchos usuarios solo podían expresar “ten más cuidado” o “responde rápido” mediante el prompt. Ahora ese tipo de control empieza a entrar en la capa de producto.
Para desarrolladores, también es una señal: los futuros productos de agent no solo expondrán “qué modelo elegir”, sino más estrategias de ejecución, como velocidad, coste, profundidad de razonamiento, agresividad al llamar herramientas y preferencia de riesgo.
El cambio de coste en fast mode es clave
Anthropic menciona que el fast mode de Opus 4.8 puede alcanzar unas 2,5 veces la velocidad, con un coste mucho menor que el fast mode del modelo anterior.
Este punto puede quedar tapado por las noticias sobre capacidades del modelo, pero es muy importante para los flujos de trabajo reales. Muchas tareas de agent no se ejecutan una sola vez, sino de forma repetida:
- Generar un primer borrador
- Ejecutar pruebas
- Corregir fallos
- Volver a ejecutar pruebas
- Seguir modificando según el review
Si fast mode es lo bastante barato, los equipos estarán más dispuestos a integrarlo en procesos frecuentes, en lugar de reservar el modelo superior solo para tareas críticas ocasionales. Cuando bajan la velocidad y el coste, los agents tienen más facilidad para pasar de “efecto demo” a “herramienta diaria”.
Relación con Opus 4.7
Opus 4.8 se parece más a una versión mejorada orientada a la usabilidad. Hereda el posicionamiento de Opus 4.7, pero empuja aún más hacia la programación, las tareas de agentes y el trabajo profesional.
Por la forma en que Anthropic lo describe, Opus 4.8 no solo responde mejor: colabora mejor. Dentro de una tarea, debería tener más claro cuándo necesita información, cuándo un plan no es sólido y cuándo conviene ganar confianza antes de hacer cambios grandes.
Este tipo de capacidades es difícil de juzgar con un único benchmark. La verdadera validación está en cómo se comporta en repositorios grandes, reglas de negocio complejas, tareas de contexto largo y correcciones en varias rondas.
Impacto en la competencia de programación con AI
En 2026, la competencia entre modelos ya se ha desplazado claramente de la “capacidad de chat” a “si puede hacer trabajo”. OpenAI, Anthropic, Google y xAI están uniendo cada vez más los modelos con las cadenas de herramientas: el modelo razona, las herramientas ejecutan y la capa de producto mantiene la tarea dentro de un rango controlable.
El lanzamiento de Claude Opus 4.8 continúa esa tendencia. Su foco no es presumir de una capacidad aislada, sino reforzar tres enlaces:
- El modelo en sí es más adecuado para código y tareas de agentes.
- Claude Code puede descomponer flujos de trabajo más grandes.
- La capa de producto empieza a ofrecer controles de ejecución como effort y fast mode.
Para desarrolladores, el significado práctico es que al elegir un modelo no basta con mirar “cuál es el más inteligente”. También hay que ver si encaja con la herramienta usada, si puede llamar herramientas de forma estable, si el coste de tareas largas es aceptable y si es fácil corregirlo cuando falla.
Sonnet 5: el mejor valor por defecto diario
Claude Sonnet 5 es hoy el candidato por defecto más interesante. Su posición es best combination of speed and intelligence.
Encaja con:
- Programación diaria y revisión de código.
- Documentación, asistencia de investigación y trabajo de conocimiento.
- Agents de complejidad media.
- Automatización interna empresarial.
- Aplicaciones API que necesitan controlar costes sin perder demasiada calidad.
El mayor cambio de Sonnet 5 es que muchas capacidades de Agent que antes parecían más cercanas a Opus llegan ahora al precio de Sonnet. También soporta contexto de 1M tokens y salida máxima de 128k tokens, con menor latencia que Opus.
Hasta el 31 de agosto de 2026 tiene precio inicial: entrada $2 / MTok y salida $10 / MTok. Desde el 1 de septiembre de 2026 vuelve al precio estándar: entrada $3 / MTok y salida $15 / MTok. Incluso al precio estándar, sigue siendo bastante más barato que Opus 4.8.
Para la mayoría de equipos, empezaría con Sonnet 5: cubrir 70% a 80% de las tareas con él y escalar lo realmente difícil a Opus 4.8 o Fable 5.
Disponibilidad y precios
Claude Sonnet 5 está disponible en todos los planes de Claude:
- Los usuarios Free y Pro usan Sonnet 5 por defecto.
- Los usuarios Max, Team y Enterprise pueden usar Sonnet 5.
- Claude Code y Claude Platform ya lo admiten.
- Los desarrolladores pueden usar el nombre de modelo
claude-sonnet-5en Claude API.
El precio de API tiene una fase inicial más baja antes de pasar al precio estándar:
| Período | Precio de entrada | Precio de salida |
|---|---|---|
| Antes del 31 de agosto de 2026 | 2 dólares / millón de tokens | 10 dólares / millón de tokens |
| Precio estándar posterior | 3 dólares / millón de tokens | 15 dólares / millón de tokens |
Anthropic también señala que Sonnet 5 usa un tokenizer actualizado. La misma entrada puede convertirse en más tokens con el nuevo tokenizer, aproximadamente entre 1,0 y 1,35 veces según el tipo de contenido. Uno de los objetivos del precio inicial es suavizar el coste de migrar desde Sonnet 4.6.
Mejora principal: Sonnet se parece más a una capa de ejecución
La palabra clave de Sonnet 5 es Agent. Anthropic destaca que puede planificar, usar herramientas como navegador y terminal, y continuar tareas más largas.
Para desarrolladores y empresas, esto tiene varias implicaciones:
- Las tareas de programación no se quedan en completar fragmentos; encajan mejor con cambios de varios pasos, depuración y validación.
- El uso de herramientas es más estable, útil para navegador, terminal, aplicaciones empresariales y flujos internos.
- Con effort medio, Sonnet 5 ofrece mejor relación coste-capacidad; con effort más alto, algunas tareas se acercan a Opus 4.8.
- Para usuarios de Claude Code, se parece más a un modelo de ejecución diario que a un modelo caro reservado para pocas tareas difíciles.
Anthropic cita comentarios de socios tempranos en bases de código complejas, proyectos brownfield, procesos de seguros, investigación legal y análisis de datos. La idea común es que Sonnet 5 puede seguir una tarea de forma más completa, en vez de detenerse a mitad o limitarse a aconsejar.
Evaluación de seguridad: más seguro, pero no sin riesgo
La evaluación de seguridad de Anthropic tiene dos lados.
Por un lado, Sonnet 5 es más estable que Sonnet 4.6. Mejora en seguridad de Agent, rechazo de solicitudes maliciosas, resistencia a prompt injection, reducción de alucinaciones y menor complacencia. Las auditorías automáticas de Anthropic también muestran una tasa menor de comportamientos indeseados que Sonnet 4.6.
Por otro lado, no es más estable que modelos más fuertes como Opus 4.8 o Mythos Preview. En evaluaciones de la misma categoría, Sonnet 5 todavía muestra una tasa de comportamiento indeseado superior a esos dos modelos.
En ciberseguridad, Anthropic dice que no entrenó Sonnet 5 intencionadamente con tareas de ciberseguridad. Puede hacer algunas tareas comunes y benignas, pero en evaluaciones de capacidades potencialmente peligrosas queda claramente por debajo de Opus 4.8 y Mythos 5. En la evaluación de exploits de Firefox mencionada por Anthropic, Sonnet 5 no logró generar un exploit completo y usable, aunque tuvo más éxitos parciales que Sonnet 4.6.
Por eso, Sonnet 5 activa protecciones de ciberseguridad por defecto. Estas protecciones detectan y bloquean en tiempo real usos peligrosos de ciberseguridad. Su intensidad es similar a Claude Opus 4.7 y Opus 4.8, pero menor que las protecciones más estrictas de Fable 5.
Qué revisar al migrar
Si ya usas Claude API o Claude Code, Sonnet 5 puede verse como un candidato directo para actualizar desde Sonnet 4.6. Aun así, conviene revisar tres puntos.
Primero, el nombre del modelo debe cambiar a:
|
|
Segundo, el coste no se calcula solo con el precio unitario. El precio estándar de Sonnet 5 es mayor que el precio inicial, y el cambio de tokenizer puede hacer que algunas entradas consuman más tokens. Para contextos largos, análisis de logs y escaneo de repositorios, conviene recalcular con solicitudes reales.
Tercero, el ajuste de effort afecta la relación coste-capacidad. Sonnet 5 puede cubrir un rango más amplio de coste y capacidad con distintos niveles de effort. Programación diaria, documentación y tareas ligeras de Agent no siempre necesitan el effort máximo; es más razonable subirlo cuando la tarea exige planificación larga y colaboración con varias herramientas.
Relación con Opus 4.8
Sonnet 5 no reemplaza a Opus 4.8. Es más preciso decir que una parte de la capacidad de Agent que antes se sentía más cercana a Opus baja ahora al nivel Sonnet.
Si una tarea necesita el techo más alto, especialmente investigación compleja, razonamiento profundo, cadenas largas de Agent y programación difícil, Opus 4.8 sigue teniendo sitio. Si la tarea prioriza volumen diario, precio y ejecución estable, Sonnet 5 encaja mejor como modelo por defecto.
Ese es el punto más interesante del lanzamiento. Sonnet ya no es solo el modelo medio “rápido y barato”; empieza a asumir mucho trabajo real de ejecución. Para empresas y desarrolladores, la selección de modelo puede pasar de “Opus por defecto y bajar si es caro” a “Sonnet 5 por defecto y subir a Opus cuando haga falta”.
Guía práctica de migración: probar por niveles de tarea
Si tu equipo ya usa Sonnet 4.6, no conviene cambiar todas las llamadas a Sonnet 5 el primer día. Una forma más estable es dividir las tareas por dificultad y riesgo: preguntas ligeras, resúmenes, explicación de código, cambios de un archivo, refactors multiarchivo, Agents largos y automatización con herramientas. Prepara muestras para cada grupo.
En la primera ronda, mira tasa de finalización y retrabajo, no solo si la respuesta parece más inteligente. En Claude Code, por ejemplo, compara si omite menos pruebas, entiende mejor la estructura del repositorio y pregunta cuando no está seguro.
En la segunda ronda, mide coste. El tokenizer de Sonnet 5 puede producir más tokens con la misma entrada, así que usa logs reales y no solo el precio publicado. Contextos largos, análisis documental y tareas sobre repositorios son especialmente sensibles a este cambio.
Solo en la tercera ronda decide el modelo por defecto. Mi sugerencia: poner Sonnet 5 como candidato para tareas diarias de Agent y programación, dejar Opus/Fable para reintentos o tareas de alto valor, y reservar Haiku para procesos ligeros por lotes. Así la migración es más suave y se ve mejor dónde está la mejora real.
Métricas a observar
Al probar Sonnet 5, registra cuatro métricas: finalización en el primer intento, tiempo de edición humana, tasa de fallo en llamadas a herramientas y coste por tarea. Los benchmarks pueden engañar porque las tareas reales mezclan código, documentos, entornos, permisos y memoria de contexto.
Si Sonnet 5 es más estable que el modelo anterior en un tipo de tarea, migra primero ese tipo. Si solo responde más largo pero edita con más riesgo, conviene mantener aprobación humana o usar prompts más conservadores.
Original: Introducing Claude Sonnet 5
Haiku 4.5: alto volumen, baja latencia, bajo coste
Claude Haiku 4.5 es el modelo más rápido de la línea principal Claude. Anthropic lo posiciona como fastest model with near-frontier intelligence.
Encaja con:
- Clasificación, extracción, resumen y conversión de formato.
- Procesamiento por lotes de texto corto.
- Soporte, tickets, moderación y escenarios de alto volumen.
- Productos interactivos muy sensibles a la latencia.
- Tareas ligeras que no necesitan contexto de 1M.
Sus límites también son claros: contexto de 200k tokens y salida máxima de 64k tokens, por debajo del 1M / 128k de Fable, Opus y Sonnet. No debería ser la primera opción para repositorios largos, análisis complejo de varios documentos o Agents largos.
Pero si la tarea es “mucha, simple y rápida”, Haiku 4.5 tiene una relación coste-rendimiento directa: entrada $1 / MTok y salida $5 / MTok.
Mythos 5: no es una opción normal
Claude Mythos 5 comparte especificaciones y precio con Fable 5, pero no está disponible de forma general. La documentación de Anthropic lo marca como limited availability, solo para clientes aprobados en Project Glasswing.
En otras palabras, si haces selección normal de modelos API, normalmente no necesitas incluir Mythos 5. Salvo que ya estés aprobado o consigas acceso mediante Anthropic, AWS o Google Cloud, no es un reemplazo directo de Fable 5.
Migrando de Claude Opus 4.8 a Opus 5
No se limite a reemplazar la cadena del modelo y ponerlo todo en línea inmediatamente. Un proceso de migración más sólido es el siguiente.
Paso 1: fijar un conjunto de pruebas basado en casos reales
Seleccione de 30 a 100 tareas enmascaradas del registro de producción, que abarquen:
- Casos de éxito normales;
- Casos que alguna vez requirieron ser juzgados de nuevo;
- Casos de fallo de llamada de herramienta;
- Tareas de contexto largo y alto rendimiento;
- Tareas legítimas que puedan activar clasificadores de seguridad.
El conjunto de pruebas debe conservar los resultados esperados o los estándares de puntuación manual; de lo contrario, solo podemos comparar estilos de escritura pero no tasas de éxito de las tareas.
Paso 2: Modificar solo el ID del modelo
Primero, mantenga sin cambios la palabra de aviso, la definición de la herramienta, la longitud máxima de salida y el tiempo de espera, y cambie el modelo a:
|
|
Esto separa los cambios de modelo de otros cambios de configuración. Si la palabra clave y el esquema de la herramienta se reescriben al mismo tiempo, será difícil localizar la causa cuando se produzca la regresión.
Paso 3: comparar cuatro grupos de métricas
Al menos compara:
- Tasa de éxito de la misión final;
- Entrada, salida y token total;
- Retardo de extremo a extremo P50, P95;
- Costo real por misión exitosa.
Las tareas del agente también deben registrar por separado la cantidad de llamadas a herramientas, la cantidad de ciclos no válidos y la tasa de adquisición manual.
Paso 4: recalibrar los prompts
Opus 5 es más proactivo y es posible que la gran cantidad de instrucciones repetidas de “continue verificando” y “verifique usted mismo” en las antiguas palabras clave ya no sean necesarias. Los requisitos de redundancia se pueden eliminar gradualmente, pero se deben preservar los límites comerciales, por ejemplo:
- Ningún despliegue sin aprobación;
- Los datos de producción no deben eliminarse;
- Exportar evidencia antes de la modificación;
- No se permite la entrada de claves e información personal al registro;
- Las operaciones de alto riesgo deben esperar la confirmación manual.
Una mayor iniciativa no significa un mayor alcance de autoridad.
Paso 5: desplegar gradualmente y conservar una ruta de reversión
Primero corte una pequeña cantidad de tráfico a Opus 5 y luego amplíelo gradualmente. Las condiciones de respaldo pueden incluir:
- La tasa de error supera el umbral;
- La latencia de P95 empeoró significativamente;
- El coste de una sola tarea supera el presupuesto;
- Se producen bucles repetidos en las llamadas a herramientas;
- La tasa de retroceso del clasificador de seguridad aumentó de manera anormal.
La estrategia de reversión en sí también debe probarse y no se puede esperar a que se active la solicitud de producción antes de confirmar si los formatos de registro y respuesta son compatibles.
Dos actualizaciones API Beta
Anthropic también presentó dos capacidades API beta que funcionan con Opus 5.
Cambiar las herramientas durante una conversación
Las aplicaciones pueden cambiar las herramientas disponibles en medio de una conversación sin invalidar el caché de mensajes. Esto es útil para agentes de larga duración: el sistema puede cargar bases de datos, navegadores o herramientas de implementación por fase de tarea, sin tener que meter todas las definiciones de herramientas en el contexto desde el principio.
Los beneficios potenciales incluyen:
- Reducir la interferencia de herramientas irrelevantes en la selección de modelos;
- Mantener caché de avisos para reducir el costo del contexto repetido;
- Herramientas abiertas dinámicamente según los permisos y el estado de las tareas;
- Reducir la ventana de exposición para herramientas de alto riesgo.
Fallback automático del modelo tras activarse el clasificador
La API puede cambiar automáticamente a otro modelo después de que un clasificador de seguridad marca la solicitud. La configuración predeterminada selecciona el mejor modelo alternativo disponible actualmente y también se pueden configurar estrategias alternativas en función de las necesidades comerciales.
Al acceder a esta función, el “modelo de respuesta real” debe incorporarse a la observabilidad. De lo contrario, la aplicación ve que la solicitud se realizó correctamente pero no tiene idea de por qué existen diferencias en el estilo de salida, la latencia o las capacidades para el mismo conjunto de pruebas.
¿Cómo afectarán los mecanismos de seguridad a los desarrolladores?
Anthropic dijo que Opus 5 tuvo una puntuación general de mala conducta de 2,3 en auditorías de alineación automatizadas, la más baja entre los modelos recientes. Al mismo tiempo, los funcionarios creen que no está avanzando en la vanguardia de las capacidades de doble uso de alto riesgo, quedando por detrás de Mythos 5 en ciberseguridad biológica y ofensiva.
Los límites de los escenarios de ciberseguridad son particularmente dignos de mención:
- Se puede permitir el descubrimiento de vulnerabilidades en el código fuente;
- Es posible que se bloqueen el escaneo de vulnerabilidades binarias, las pruebas de penetración y la generación de exploits;
- Las capacidades de descubrimiento de vulnerabilidades de Opus 5 han mejorado, pero el desarrollo de explotación de vulnerabilidades todavía está muy por detrás de Mythos 5;
- Se espera que el nuevo clasificador requiera aproximadamente un 85% menos de intervención que Fable 5.
En Claude.ai, Claude Code y Cowork, las solicitudes marcadas vuelven a Opus 4.8 de forma predeterminada. Los usuarios de API también pueden habilitar el respaldo. Los usuarios del programa Claude Verified Participants pueden acceder a capacidades con menos restricciones.
Lo más importante para el equipo de desarrollo promedio no es intentar eludir los clasificadores, sino distinguir las tareas defensivas legítimas y proporcionar indicaciones claras al usuario y rutas de procesamiento manual para solicitudes bloqueadas o revertidas.
¿Cómo elegir Claude Pro, Max, Claude Code y API?
| Cómo utilizar | Para quién es | Dónde se encuentra el Opus 5 |
|---|---|---|
| Claude Pro | Investigación, redacción y desarrollo diario personal | Oficialmente llamado el modelo más fuerte en Pro |
| Claude Max | Usuario profesional de alta frecuencia | Opus 5 ya es el modelo por defecto |
| Código Claude | Codificación en terminal y tareas de agente | Se puede utilizar directamente en flujos de trabajo de programación; el modo rápido está disponible mediante créditos de uso |
| Claude API | Integración de productos, procesamiento por lotes y agentes de construcción propia | Con claude-opus-5, usted mismo puede controlar el tráfico, el presupuesto y el respaldo |
Si solo está evaluando la calidad de la salida, primero puede crear un caso de prueba en la aplicación Claude; Si desea medir tokens, llamadas a herramientas, tasas de error y costos, debe utilizar una API o un marco de evaluación de ingeniería existente.
Lista de verificación previa al lanzamiento
- [] El ID del modelo se cambió a
claude-opus-5y otros entornos no se cambiaron por error; - [] La clave API se proporciona a través de variables de entorno o servicios de gestión de claves;
- [] Cree un conjunto de pruebas de regresión utilizando tareas de producción reales e insensibles;
- [] Registrar tokens de entrada y salida, retrasos, llamadas de herramientas y tasas de éxito;
- [] Comparar costos por “por tarea exitosa” en lugar de solo precio unitario;
- [] Modo rápido tiene presupuesto y seguimiento independientes;
- el esfuerzo comienza con configuraciones bajas o medias y aumenta según las condiciones de falla;
- [] Las herramientas de alto riesgo todavía están controladas mediante permisos y confirmación manual;
- [] La reversión automática del modelo es visible en el registro;
- [] Preservar la ruta alternativa de Opus 4.8 durante el lanzamiento en escala de grises.
Opus 5: API, Fast Mode y migración
Posicionamiento de Claude Opus 5
Anthropic describe el Opus 5 como un modelo más “reflexivo y proactivo” en las notas de la versión. La iniciativa aquí no se trata de realizar acciones peligrosas sin permiso, sino de poder completar los pasos necesarios, crear herramientas de prueba y comprobar sus propios resultados ante una tarea abierta.
Varios casos oficiales ilustran este cambio:
- Completar el proceso de visión por computadora en FreeCAD en lugar de simplemente generar un fragmento de código aislado;
- Localizar la causa raíz de un problema del administrador de paquetes en lugar de simplemente informar un error superficial;
- Cree fuentes de datos del mercado comercial y cree sus propias herramientas de prueba para verificar el comportamiento.
Estas tareas tienen una cosa en común: los objetivos fijados por el usuario suelen estar incompletos y el modelo debe mantener el estado entre varios pasos y determinar cuándo se necesita la validación. Para Claude Code, los agentes internos de I+D y la automatización de escritorio, esto es más valioso que una única puntuación de preguntas y respuestas.
¿Cómo se compara con Opus 4.8, Fable 5, Mythos 5?
Según el posicionamiento oficial de Anthropic, se puede entender de la siguiente manera:
| Modelos | Mejor posicionamiento | Información clave en comparaciones oficiales |
|---|---|---|
| Claude Opus 4.8 | Cargas de trabajo de Opus existentes que ya se están ejecutando de manera estable | Opus 5 mantiene el mismo precio unitario base y mejora múltiples capacidades |
| Claude Opus 5 | Agente general, programación, investigación científica y operación de herramientas altamente difíciles | Cerca de la inteligencia de vanguardia de Fable 5 a aproximadamente la mitad de precio |
| Claude Fábula 5 | Misiones que persiguen el límite de capacidad más alto | Todavía mantengo una pequeña ventaja en CursorBench 3.2, pero los costos de la misión son más altos |
| Claude Mitos 5 | Más capacidades de seguridad de red de vanguardia | Los funcionarios han dejado claro que Opus 5 va por detrás de Mythos 5 en términos de seguridad de red |
Este cuadro no sustituye sus propias pruebas. En particular, conclusiones como “cercano” y “líder” se basan en puntos de referencia, niveles de esfuerzo y entornos de herramientas específicos, y no pueden equipararse directamente con los efectos en todos los escenarios comerciales.
¿Qué mejoras de rendimiento se han anunciado oficialmente?
Anthropic publica resultados que cubren tareas de agentes, programación, operaciones informáticas, investigaciones científicas y resultados visuales.
1. Agentes y tareas laborales reales
En Frontier-Bench v0.1, Opus 5 supera a Opus 4.8 en más del doble y cuesta menos por tarea. Anthropic también dijo que Opus 5 logró nuevos mejores resultados en Frontier-Bench y GDPval-AA.
Estos puntos de referencia se centran más en completar toda la tarea que en responder una pregunta estática, por lo que tienen cierto valor de referencia para las aplicaciones de los agentes. Pero los entornos de producción también deberían registrar el número de reintentos después de un fallo, porque un modelo más caro que reduce dos reintentos a la vez puede resultar más barato.
2. Programación y uso de herramientas
En la configuración de mayor esfuerzo de CursorBench 3.2, Opus 5 estuvo solo un 0,5% por debajo del mejor resultado de Fable 5, a aproximadamente la mitad del costo por tarea.
Los funcionarios también enfatizaron la capacidad del modelo para manejar cadenas de herramientas complejas. Al migrar un flujo de trabajo de Claude Code, se recomienda centrarse en probar los siguientes tipos de tareas:
- Seguimiento de errores en varios archivos;
- Localizar la causa raíz después de leer el registro y realizar pruebas adicionales;
- Realizar compilación, prueba y verificación de formato después de modificar el código;
- Identificar limitaciones cuando los requisitos están incompletos en lugar de comprometer su implementación prematuramente;
- Procesos de operación que requieren la invocación continua de múltiples herramientas MCP.
3. Operación y automatización de computadoras
En OSWorld 2.0, el Opus 5 superó a otros modelos a un costo similar; Los funcionarios dicen que superó el mejor resultado del Fable 5 a un poco más de un tercio del costo.
En Zapier AutomationBench, Opus 5 obtiene una puntuación aproximadamente 1,5 veces mayor que el siguiente mejor modelo por el mismo coste de tarea. Incluso con el nivel de esfuerzo más bajo, logró la mayoría de las tareas.
Esto significa que los niveles de esfuerzo bajos no son necesariamente solo para una simple charla. Para tareas de automatización bien estructuradas, puede convertirse en una opción práctica para controlar los tokens y la latencia.
4. Investigación científica y tareas visuales.
Anthropic dice que el Opus 5 supera al Opus 4.8 en todas las pruebas de ciencias biológicas. Entre ellos, la evaluación interna de química orgánica aumentó en 10,2 puntos porcentuales y la evaluación de variación de proteínas aumentó en 7,7 puntos porcentuales.
Además, se han mejorado las páginas web, presentaciones de diapositivas y otros elementos visuales generados por el modelo. Sin embargo, estas siguen siendo reseñas y ejemplos proporcionados por el editor. Cuando se trata de conclusiones de investigaciones científicas, información médica o diseño experimental, se debe conservar la revisión manual y la verificación de la fuente, y las puntuaciones de referencia más altas no pueden considerarse una garantía de exactitud fáctica.
Precio de la API de Claude Opus 5
Los precios base de API para Opus 5 son los siguientes:
| Proyecto | Precio |
|---|---|
| Introducir ficha | 5$/1 millón de tokens |
| Ficha de salida | $25 / 1 millón de tokens |
| Modo rápido | 2x tasa base |
Arriba están los precios base que figuran en las notas de la versión. Tenga en cuenta que los canales de almacenamiento en caché, procesamiento por lotes o plataforma en la nube pueden adoptar diferentes reglas de facturación, y el presupuesto oficial aún debe basarse en las instrucciones de facturación del canal de llamadas en ese momento.
¿Cuanto cuesta aproximadamente una solicitud?
Supongamos que una tarea larga utiliza de forma acumulativa:
- Ingrese 1 millón de tokens;
- Generar 200.000 tokens.
La tarifa base para el modelo predeterminado es:
|
|
Si el mismo uso de token se calcula al doble de la tasa del modo rápido, será de aproximadamente $20.
Las tareas reales de los agentes no se pueden estimar con una sola llamada. Una métrica más útil es el “costo por tarea exitosa”:
|
|
Si un modelo económico lo vuelve a intentar con frecuencia y requiere una adquisición manual, el costo final puede ser mayor que el del Opus 5; por el contrario, utilizar Opus 5 para tareas sencillas puede no producir suficientes beneficios.
Cómo llamar a Claude Opus 5 mediante la API
Ejemplo con curl
Primero coloque la clave API en la variable de entorno y luego llame a la API de mensajes. No escriba claves reales en scripts ni se comprometa con repositorios de Git.
|
|
En Windows PowerShell, primero puede configurar las variables de entorno de la sesión actual:
|
|
Luego utilice el SDK de Anthropic o cree la solicitud de acuerdo con la documentación oficial actual. Las variables de entorno solo tienen efecto para la sesión actual de PowerShell y son más adecuadas para pruebas temporales.
Ejemplo de SDK de Python
Instalar SDK:
|
|
Cree un script de llamada mínimo:
|
|
Los entornos de producción deberían registrar al menos adicionalmente:
- El ID del modelo solicitado;
- Tokens de entrada y salida;
- Tiempo total empleado y retraso del primer token;
- Número de llamadas a herramientas y motivos de falla;
- Si se produce una reversión del modelo;
- Si la tarea final se realiza manualmente.
Simplemente registrar un HTTP 200 no es una medida suficiente del éxito de la tarea de proxy.
¿Cuándo conviene utilizar Fast Mode?
El modo rápido de Opus 5 es aproximadamente 2,5 veces más rápido que el modo predeterminado y cuesta 2 veces la tarifa base. Este modo está disponible con Claude Platform y también está disponible con Claude Code mediante créditos de uso.
Los escenarios adecuados para probar primero el modo rápido incluyen:
- Sesiones interactivas de Claude Code donde los desarrolladores esperan;
- Análisis de accidentes en línea que requiere una iteración rápida;
- Demostraciones, programación de pares y manipulación de herramientas en tiempo real;
- Procesos en los que el impacto del retraso en el valor del negocio es mayor que el coste de un solo token.
Los escenarios que no son adecuados para habilitarse de forma predeterminada incluyen:
- Procesamiento por lotes nocturno;
- Revisiones de código sin conexión que se pueden poner en cola para ejecutarse;
- Clasificación de datos a gran escala y de baja prioridad;
- Un ciclo de agentes en el que aún no se han establecido límites a las tarifas ni seguimiento.
Se recomienda establecer etiquetas de presupuesto independientes para el modo rápido y comparar la latencia P50, P95 y el costo por tarea exitosa. Activarlo para todas las solicitudes solo porque ve “2,5 veces más rápido” generalmente no conduce a una estructura de costos óptima.
¿Cómo utilizar la configuración de esfuerzo?
Opus 5 proporciona diferentes configuraciones de esfuerzo para elegir entre nivel de inteligencia, uso de token, latencia y costo. Los datos publicados por Anthropic muestran que un esfuerzo bajo sigue siendo competitivo en puntos de referencia parcialmente automatizados, mientras que el esfuerzo más alto es más adecuado para acercarse al límite superior de las capacidades del modelo.
Se puede utilizar una estrategia en capas:
| Tareas | Puntos de partida sugeridos | Condiciones de actualización |
|---|---|---|
| Conversión de formato, extracción de reglas fijas | Bajo esfuerzo | La tasa de errores u omisiones de formato excede el estándar |
| Codificación convencional, solución de problemas de almacén único | Esfuerzo medio | No se puede localizar después de varias llamadas a herramientas |
| Fallos entre sistemas, diseño de arquitectura | Alto esfuerzo | El valor de la tarea es suficiente para cubrir tokens adicionales |
| Investigación de vanguardia o evaluación de agentes difícil | Esfuerzo máximo | Verificación del límite superior de capacidad requerido |
Los nombres de parámetros específicos y los rangos disponibles pueden actualizarse con el SDK o la plataforma, y los campos de solicitud no deben adivinarse según la versión. Al acceder, consulte la documentación oficial de la versión de API utilizada.
Cómo elegir: segmentar por complejidad de tarea
Puedes usar este orden:
-
Probar Sonnet 5 por defecto
Adecuado para la mayoría de programación, documentación, Agents y automatización empresarial. -
Subir a Opus 4.8 cuando la tarea sea claramente compleja
Repositorios largos, varias herramientas, varios pasos y necesidad de ejecución estable con razonamiento fuerte. -
Probar Fable 5 cuando se necesite la máxima capacidad
Tareas de alto valor, largas, con alto coste de fallo y menos sensibilidad al precio. -
Usar Haiku 4.5 para tareas ligeras de alto volumen
Clasificación, extracción, resumen, soporte, procesamiento por lotes e interacción de baja latencia. -
Considerar Mythos 5 solo si tienes acceso
No es una opción por defecto para desarrolladores comunes.
Dos detalles de migración y coste
Primero, los modelos Claude más nuevos usan un tokenizer nuevo. La documentación de Anthropic indica que Opus 4.7 y posteriores, Fable 5, Mythos 5, Mythos Preview y Sonnet 5 pueden producir alrededor de 30% más tokens para el mismo texto. No estimes costes solo con el precio por millón de tokens.
Segundo, tener contexto de 1M no significa que debas llenarlo siempre. Fable 5, Opus 4.8 y Sonnet 5 soportan 1M tokens, pero llamadas a herramientas, caché, salida y Agents multivuelta suman coste. En despliegue real conviene:
- Usar prompt caching para system prompts comunes y contexto largo.
- Dividir documentos largos primero y usar modelos fuertes para síntesis.
- Enviar pasos simples a Haiku o Sonnet y escalar decisiones clave a Opus / Fable.
- Probar con muestras reales, no solo con benchmarks oficiales.
Conclusión simple
La línea Claude actual queda bastante clara:
- Fable 5: máxima capacidad para las tareas más difíciles y valiosas.
- Opus 4.8: opción fuerte para Agent coding complejo y tareas empresariales.
- Sonnet 5: mejor valor por defecto diario, equilibrando capacidad, velocidad y precio.
- Haiku 4.5: más rápido y barato para tareas ligeras a gran escala.
- Mythos 5: disponibilidad limitada, no una opción normal.
Si eliges modelos Claude para un producto o workflow interno, la estrategia práctica no es perseguir el modelo más alto. Divide tareas: Haiku para lotes ligeros, Sonnet 5 como capa de ejecución por defecto, Opus 4.8 para Agents complejos y programación difícil, y Fable 5 para el pequeño conjunto de tareas más difíciles, caras y valiosas.
Recomendación de routing
Al elegir modelos Claude, conviene no tener un único modelo por defecto. Es más útil diseñar reglas de routing: lotes ligeros a Haiku, programación diaria y trabajo de conocimiento a Sonnet, tareas complejas de repositorio y Agents de varios pasos a Opus, y tareas de máximo valor o dificultad a Fable.
La regla puede empezar simple. Resumen, clasificación y extracción de campos prefieren Haiku. PR review, generación de documentación y cambios normales de código prefieren Sonnet. Refactors entre módulos, postmortems y planificación compleja prefieren Opus. Si Opus falla repetidamente o la tarea tiene mucho valor, usar Fable.
Cada capa también necesita condiciones de salida. Salida incierta, fallos de herramientas, tests que fallan repetidamente, contexto por encima del umbral o tareas con permisos/datos de producción deberían activar confirmación humana, no automatización continua.
Método para evaluar costes
La tabla de precios solo sirve como aproximación. El coste real depende de longitud de contexto, tasa de acierto de caché, reintentos, longitud de salida y tiempo de retrabajo humano. Un modelo más caro que termina a la primera puede ser más barato que varios reintentos con uno barato.
Para cada tipo de tarea, registra tres datos: coste medio en tokens, tiempo medio de revisión humana y proporción de fallos que requieren escalar modelo. Tras dos semanas suele quedar claro qué tareas van en Sonnet y cuáles merecen Opus o Fable.
Referencias: