Anthropic lanza Claude Opus 5 el 24 de julio de 2026. No se trata simplemente de aumentar un poco la puntuación de referencia, sino de intentar lograr un equilibrio más práctico entre capacidades de vanguardia, costos de tareas y capacidades de trabajo autónomo: los funcionarios dicen que sus capacidades están cerca de Claude Fable 5, pero el precio es solo la mitad de este último; En comparación con Opus 4.8, el precio unitario base API permanece sin cambios.
Para los desarrolladores, el cambio más inmediato es que ahora están disponibles nuevos identificadores de modelo:
|
|
Este artículo no solo enumera los datos de la versión, sino que también responde preguntas más prácticas: si vale la pena actualizar desde Opus 4.8, cuánto cuesta una solicitud API típica, para qué escenarios es adecuado el modo rápido y cómo afectará el mecanismo de respaldo después de que se active el clasificador de seguridad a los sistemas de producción.
Respuesta rápida: ¿Vale la pena actualizar Claude Opus 5?
Si sus tareas incluyen programación de enlaces largos, operaciones entre herramientas, localización de fallas complejas, análisis de investigaciones científicas o requieren resultados de verificación activa del modelo, Opus 5 merece ser priorizado para una ronda de pruebas de regresión. Su ventaja no está solo en la calidad de la respuesta una vez, sino en la capacidad de formular pasos, llamar a herramientas, encontrar errores y continuar corrigiéndolos.
Si su aplicación es principalmente clasificación de texto corto, extracción de formato fijo o solicitudes de alta concurrencia sensibles a los costos, no debe cambiar simplemente por el “nuevo modelo”. Primero utilice el tráfico real existente para establecer un conjunto de pruebas, compare la tasa de éxito, el token de salida, el consumo de tiempo de un extremo a otro y el costo de cada tarea exitosa, y luego decida si migrar.
Puedes recordar cuatro conclusiones primero:
- El ID del modelo API es
claude-opus-5. - El precio básico es de 5 dólares estadounidenses por millón de tokens de entrada y 25 dólares estadounidenses por millón de tokens de salida, igual que el Opus 4.8.
- El modo rápido es aproximadamente 2,5 veces más rápido que el modo predeterminado, pero cuesta 2 veces la tarifa base.
- Opus 5 está disponible en el cliente web Claude, Claude Code, Cowork y API, pero la ubicación predeterminada es diferente en los diferentes planes de suscripción.
Posicionamiento de Claude Opus 5
Anthropic describe el Opus 5 como un modelo más “reflexivo y proactivo” en las notas de la versión. La iniciativa aquí no se trata de realizar acciones peligrosas sin permiso, sino de poder completar los pasos necesarios, crear herramientas de prueba y comprobar sus propios resultados ante una tarea abierta.
Varios casos oficiales ilustran este cambio:
- Completar el proceso de visión por computadora en FreeCAD en lugar de simplemente generar un fragmento de código aislado;
- Localizar la causa raíz de un problema del administrador de paquetes en lugar de simplemente informar un error superficial;
- Cree fuentes de datos del mercado comercial y cree sus propias herramientas de prueba para verificar el comportamiento.
Estas tareas tienen una cosa en común: los objetivos fijados por el usuario suelen estar incompletos y el modelo debe mantener el estado entre varios pasos y determinar cuándo se necesita la validación. Para Claude Code, los agentes internos de I+D y la automatización de escritorio, esto es más valioso que una única puntuación de preguntas y respuestas.
¿Cómo se compara con Opus 4.8, Fable 5, Mythos 5?
Según el posicionamiento oficial de Anthropic, se puede entender de la siguiente manera:
| Modelos | Mejor posicionamiento | Información clave en comparaciones oficiales |
|---|---|---|
| Claude Opus 4.8 | Cargas de trabajo de Opus existentes que ya se están ejecutando de manera estable | Opus 5 mantiene el mismo precio unitario base y mejora múltiples capacidades |
| Claude Opus 5 | Agente general, programación, investigación científica y operación de herramientas altamente difíciles | Cerca de la inteligencia de vanguardia de Fable 5 a aproximadamente la mitad de precio |
| Claude Fábula 5 | Misiones que persiguen el límite de capacidad más alto | Todavía mantengo una pequeña ventaja en CursorBench 3.2, pero los costos de la misión son más altos |
| Claude Mitos 5 | Más capacidades de seguridad de red de vanguardia | Los funcionarios han dejado claro que Opus 5 va por detrás de Mythos 5 en términos de seguridad de red |
Este cuadro no sustituye sus propias pruebas. En particular, conclusiones como “cercano” y “líder” se basan en puntos de referencia, niveles de esfuerzo y entornos de herramientas específicos, y no pueden equipararse directamente con los efectos en todos los escenarios comerciales.
¿Qué mejoras de rendimiento se han anunciado oficialmente?
Anthropic publica resultados que cubren tareas de agentes, programación, operaciones informáticas, investigaciones científicas y resultados visuales.
1. Agentes y tareas laborales reales
En Frontier-Bench v0.1, Opus 5 supera a Opus 4.8 en más del doble y cuesta menos por tarea. Anthropic también dijo que Opus 5 logró nuevos mejores resultados en Frontier-Bench y GDPval-AA.
Estos puntos de referencia se centran más en completar toda la tarea que en responder una pregunta estática, por lo que tienen cierto valor de referencia para las aplicaciones de los agentes. Pero los entornos de producción también deberían registrar el número de reintentos después de un fallo, porque un modelo más caro que reduce dos reintentos a la vez puede resultar más barato.
2. Programación y uso de herramientas
En la configuración de mayor esfuerzo de CursorBench 3.2, Opus 5 estuvo solo un 0,5% por debajo del mejor resultado de Fable 5, a aproximadamente la mitad del costo por tarea.
Los funcionarios también enfatizaron la capacidad del modelo para manejar cadenas de herramientas complejas. Al migrar un flujo de trabajo de Claude Code, se recomienda centrarse en probar los siguientes tipos de tareas:
- Seguimiento de errores en varios archivos;
- Localizar la causa raíz después de leer el registro y realizar pruebas adicionales;
- Realizar compilación, prueba y verificación de formato después de modificar el código;
- Identificar limitaciones cuando los requisitos están incompletos en lugar de comprometer su implementación prematuramente;
- Procesos de operación que requieren la invocación continua de múltiples herramientas MCP.
3. Operación y automatización de computadoras
En OSWorld 2.0, el Opus 5 superó a otros modelos a un costo similar; Los funcionarios dicen que superó el mejor resultado del Fable 5 a un poco más de un tercio del costo.
En Zapier AutomationBench, Opus 5 obtiene una puntuación aproximadamente 1,5 veces mayor que el siguiente mejor modelo por el mismo coste de tarea. Incluso con el nivel de esfuerzo más bajo, logró la mayoría de las tareas.
Esto significa que los niveles de esfuerzo bajos no son necesariamente solo para una simple charla. Para tareas de automatización bien estructuradas, puede convertirse en una opción práctica para controlar los tokens y la latencia.
4. Investigación científica y tareas visuales.
Anthropic dice que el Opus 5 supera al Opus 4.8 en todas las pruebas de ciencias biológicas. Entre ellos, la evaluación interna de química orgánica aumentó en 10,2 puntos porcentuales y la evaluación de variación de proteínas aumentó en 7,7 puntos porcentuales.
Además, se han mejorado las páginas web, presentaciones de diapositivas y otros elementos visuales generados por el modelo. Sin embargo, estas siguen siendo reseñas y ejemplos proporcionados por el editor. Cuando se trata de conclusiones de investigaciones científicas, información médica o diseño experimental, se debe conservar la revisión manual y la verificación de la fuente, y las puntuaciones de referencia más altas no pueden considerarse una garantía de exactitud fáctica.
Precio de la API de Claude Opus 5
Los precios base de API para Opus 5 son los siguientes:
| Proyecto | Precio |
|---|---|
| Introducir ficha | 5$/1 millón de tokens |
| Ficha de salida | $25 / 1 millón de tokens |
| Modo rápido | 2x tasa base |
Arriba están los precios base que figuran en las notas de la versión. Tenga en cuenta que los canales de almacenamiento en caché, procesamiento por lotes o plataforma en la nube pueden adoptar diferentes reglas de facturación, y el presupuesto oficial aún debe basarse en las instrucciones de facturación del canal de llamadas en ese momento.
¿Cuanto cuesta aproximadamente una solicitud?
Supongamos que una tarea larga utiliza de forma acumulativa:
- Ingrese 1 millón de tokens;
- Generar 200.000 tokens.
La tarifa base para el modelo predeterminado es:
|
|
Si el mismo uso de token se calcula al doble de la tasa del modo rápido, será de aproximadamente $20.
Las tareas reales de los agentes no se pueden estimar con una sola llamada. Una métrica más útil es el “costo por tarea exitosa”:
|
|
Si un modelo económico lo vuelve a intentar con frecuencia y requiere una adquisición manual, el costo final puede ser mayor que el del Opus 5; por el contrario, utilizar Opus 5 para tareas sencillas puede no producir suficientes beneficios.
Cómo llamar a Claude Opus 5 mediante la API
Ejemplo con curl
Primero coloque la clave API en la variable de entorno y luego llame a la API de mensajes. No escriba claves reales en scripts ni se comprometa con repositorios de Git.
|
|
En Windows PowerShell, primero puede configurar las variables de entorno de la sesión actual:
|
|
Luego utilice el SDK de Anthropic o cree la solicitud de acuerdo con la documentación oficial actual. Las variables de entorno solo tienen efecto para la sesión actual de PowerShell y son más adecuadas para pruebas temporales.
Ejemplo de SDK de Python
Instalar SDK:
|
|
Cree un script de llamada mínimo:
|
|
Los entornos de producción deberían registrar al menos adicionalmente:
- El ID del modelo solicitado;
- Tokens de entrada y salida;
- Tiempo total empleado y retraso del primer token;
- Número de llamadas a herramientas y motivos de falla;
- Si se produce una reversión del modelo;
- Si la tarea final se realiza manualmente.
Simplemente registrar un HTTP 200 no es una medida suficiente del éxito de la tarea de proxy.
¿Cuándo conviene utilizar Fast Mode?
El modo rápido de Opus 5 es aproximadamente 2,5 veces más rápido que el modo predeterminado y cuesta 2 veces la tarifa base. Este modo está disponible con Claude Platform y también está disponible con Claude Code mediante créditos de uso.
Los escenarios adecuados para probar primero el modo rápido incluyen:
- Sesiones interactivas de Claude Code donde los desarrolladores esperan;
- Análisis de accidentes en línea que requiere una iteración rápida;
- Demostraciones, programación de pares y manipulación de herramientas en tiempo real;
- Procesos en los que el impacto del retraso en el valor del negocio es mayor que el coste de un solo token.
Los escenarios que no son adecuados para habilitarse de forma predeterminada incluyen:
- Procesamiento por lotes nocturno;
- Revisiones de código sin conexión que se pueden poner en cola para ejecutarse;
- Clasificación de datos a gran escala y de baja prioridad;
- Un ciclo de agentes en el que aún no se han establecido límites a las tarifas ni seguimiento.
Se recomienda establecer etiquetas de presupuesto independientes para el modo rápido y comparar la latencia P50, P95 y el costo por tarea exitosa. Activarlo para todas las solicitudes solo porque ve “2,5 veces más rápido” generalmente no conduce a una estructura de costos óptima.
¿Cómo utilizar la configuración de esfuerzo?
Opus 5 proporciona diferentes configuraciones de esfuerzo para elegir entre nivel de inteligencia, uso de token, latencia y costo. Los datos publicados por Anthropic muestran que un esfuerzo bajo sigue siendo competitivo en puntos de referencia parcialmente automatizados, mientras que el esfuerzo más alto es más adecuado para acercarse al límite superior de las capacidades del modelo.
Se puede utilizar una estrategia en capas:
| Tareas | Puntos de partida sugeridos | Condiciones de actualización |
|---|---|---|
| Conversión de formato, extracción de reglas fijas | Bajo esfuerzo | La tasa de errores u omisiones de formato excede el estándar |
| Codificación convencional, solución de problemas de almacén único | Esfuerzo medio | No se puede localizar después de varias llamadas a herramientas |
| Fallos entre sistemas, diseño de arquitectura | Alto esfuerzo | El valor de la tarea es suficiente para cubrir tokens adicionales |
| Investigación de vanguardia o evaluación de agentes difícil | Esfuerzo máximo | Verificación del límite superior de capacidad requerido |
Los nombres de parámetros específicos y los rangos disponibles pueden actualizarse con el SDK o la plataforma, y los campos de solicitud no deben adivinarse según la versión. Al acceder, consulte la documentación oficial de la versión de API utilizada.
Migrando de Claude Opus 4.8 a Opus 5
No se limite a reemplazar la cadena del modelo y ponerlo todo en línea inmediatamente. Un proceso de migración más sólido es el siguiente.
Paso 1: fijar un conjunto de pruebas basado en casos reales
Seleccione de 30 a 100 tareas enmascaradas del registro de producción, que abarquen:
- Casos de éxito normales;
- Casos que alguna vez requirieron ser juzgados de nuevo;
- Casos de fallo de llamada de herramienta;
- Tareas de contexto largo y alto rendimiento;
- Tareas legítimas que puedan activar clasificadores de seguridad.
El conjunto de pruebas debe conservar los resultados esperados o los estándares de puntuación manual; de lo contrario, solo podemos comparar estilos de escritura pero no tasas de éxito de las tareas.
Paso 2: Modificar solo el ID del modelo
Primero, mantenga sin cambios la palabra de aviso, la definición de la herramienta, la longitud máxima de salida y el tiempo de espera, y cambie el modelo a:
|
|
Esto separa los cambios de modelo de otros cambios de configuración. Si la palabra clave y el esquema de la herramienta se reescriben al mismo tiempo, será difícil localizar la causa cuando se produzca la regresión.
Paso 3: comparar cuatro grupos de métricas
Al menos compara:
- Tasa de éxito de la misión final;
- Entrada, salida y token total;
- Retardo de extremo a extremo P50, P95;
- Costo real por misión exitosa.
Las tareas del agente también deben registrar por separado la cantidad de llamadas a herramientas, la cantidad de ciclos no válidos y la tasa de adquisición manual.
Paso 4: recalibrar los prompts
Opus 5 es más proactivo y es posible que la gran cantidad de instrucciones repetidas de “continue verificando” y “verifique usted mismo” en las antiguas palabras clave ya no sean necesarias. Los requisitos de redundancia se pueden eliminar gradualmente, pero se deben preservar los límites comerciales, por ejemplo:
- Ningún despliegue sin aprobación;
- Los datos de producción no deben eliminarse;
- Exportar evidencia antes de la modificación;
- No se permite la entrada de claves e información personal al registro;
- Las operaciones de alto riesgo deben esperar la confirmación manual.
Una mayor iniciativa no significa un mayor alcance de autoridad.
Paso 5: desplegar gradualmente y conservar una ruta de reversión
Primero corte una pequeña cantidad de tráfico a Opus 5 y luego amplíelo gradualmente. Las condiciones de respaldo pueden incluir:
- La tasa de error supera el umbral;
- La latencia de P95 empeoró significativamente;
- El coste de una sola tarea supera el presupuesto;
- Se producen bucles repetidos en las llamadas a herramientas;
- La tasa de retroceso del clasificador de seguridad aumentó de manera anormal.
La estrategia de reversión en sí también debe probarse y no se puede esperar a que se active la solicitud de producción antes de confirmar si los formatos de registro y respuesta son compatibles.
Dos actualizaciones API Beta
Anthropic también presentó dos capacidades API beta que funcionan con Opus 5.
Cambiar las herramientas durante una conversación
Las aplicaciones pueden cambiar las herramientas disponibles en medio de una conversación sin invalidar el caché de mensajes. Esto es útil para agentes de larga duración: el sistema puede cargar bases de datos, navegadores o herramientas de implementación por fase de tarea, sin tener que meter todas las definiciones de herramientas en el contexto desde el principio.
Los beneficios potenciales incluyen:
- Reducir la interferencia de herramientas irrelevantes en la selección de modelos;
- Mantener caché de avisos para reducir el costo del contexto repetido;
- Herramientas abiertas dinámicamente según los permisos y el estado de las tareas;
- Reducir la ventana de exposición para herramientas de alto riesgo.
Fallback automático del modelo tras activarse el clasificador
La API puede cambiar automáticamente a otro modelo después de que un clasificador de seguridad marca la solicitud. La configuración predeterminada selecciona el mejor modelo alternativo disponible actualmente y también se pueden configurar estrategias alternativas en función de las necesidades comerciales.
Al acceder a esta función, el “modelo de respuesta real” debe incorporarse a la observabilidad. De lo contrario, la aplicación ve que la solicitud se realizó correctamente pero no tiene idea de por qué existen diferencias en el estilo de salida, la latencia o las capacidades para el mismo conjunto de pruebas.
¿Cómo afectarán los mecanismos de seguridad a los desarrolladores?
Anthropic dijo que Opus 5 tuvo una puntuación general de mala conducta de 2,3 en auditorías de alineación automatizadas, la más baja entre los modelos recientes. Al mismo tiempo, los funcionarios creen que no está avanzando en la vanguardia de las capacidades de doble uso de alto riesgo, quedando por detrás de Mythos 5 en ciberseguridad biológica y ofensiva.
Los límites de los escenarios de ciberseguridad son particularmente dignos de mención:
- Se puede permitir el descubrimiento de vulnerabilidades en el código fuente;
- Es posible que se bloqueen el escaneo de vulnerabilidades binarias, las pruebas de penetración y la generación de exploits;
- Las capacidades de descubrimiento de vulnerabilidades de Opus 5 han mejorado, pero el desarrollo de explotación de vulnerabilidades todavía está muy por detrás de Mythos 5;
- Se espera que el nuevo clasificador requiera aproximadamente un 85% menos de intervención que Fable 5.
En Claude.ai, Claude Code y Cowork, las solicitudes marcadas vuelven a Opus 4.8 de forma predeterminada. Los usuarios de API también pueden habilitar el respaldo. Los usuarios del programa Claude Verified Participants pueden acceder a capacidades con menos restricciones.
Lo más importante para el equipo de desarrollo promedio no es intentar eludir los clasificadores, sino distinguir las tareas defensivas legítimas y proporcionar indicaciones claras al usuario y rutas de procesamiento manual para solicitudes bloqueadas o revertidas.
¿Cómo elegir Claude Pro, Max, Claude Code y API?
| Cómo utilizar | Para quién es | Dónde se encuentra el Opus 5 |
|---|---|---|
| Claude Pro | Investigación, redacción y desarrollo diario personal | Oficialmente llamado el modelo más fuerte en Pro |
| Claude Max | Usuario profesional de alta frecuencia | Opus 5 ya es el modelo por defecto |
| Código Claude | Codificación en terminal y tareas de agente | Se puede utilizar directamente en flujos de trabajo de programación; el modo rápido está disponible mediante créditos de uso |
| Claude API | Integración de productos, procesamiento por lotes y agentes de construcción propia | Con claude-opus-5, usted mismo puede controlar el tráfico, el presupuesto y el respaldo |
Si solo está evaluando la calidad de la salida, primero puede crear un caso de prueba en la aplicación Claude; Si desea medir tokens, llamadas a herramientas, tasas de error y costos, debe utilizar una API o un marco de evaluación de ingeniería existente.
Lista de verificación previa al lanzamiento
- [] El ID del modelo se cambió a
claude-opus-5y otros entornos no se cambiaron por error; - [] La clave API se proporciona a través de variables de entorno o servicios de gestión de claves;
- [] Cree un conjunto de pruebas de regresión utilizando tareas de producción reales e insensibles;
- [] Registrar tokens de entrada y salida, retrasos, llamadas de herramientas y tasas de éxito;
- [] Comparar costos por “por tarea exitosa” en lugar de solo precio unitario;
- [] Modo rápido tiene presupuesto y seguimiento independientes;
- el esfuerzo comienza con configuraciones bajas o medias y aumenta según las condiciones de falla;
- [] Las herramientas de alto riesgo todavía están controladas mediante permisos y confirmación manual;
- [] La reversión automática del modelo es visible en el registro;
- [] Preservar la ruta alternativa de Opus 4.8 durante el lanzamiento en escala de grises.
Preguntas frecuentes
¿Cuál es el nombre del modelo API para Claude Opus 5?
La identificación oficial del modelo es claude-opus-5.
¿Es el Opus 5 más caro que el Opus 4.8?
El precio unitario de la API básica no ha aumentado y sigue siendo de 5 dólares estadounidenses por millón de tokens de entrada y 25 dólares estadounidenses por millón de tokens de salida. Sin embargo, la facturación real también depende de la duración de la salida, los reintentos, el almacenamiento en caché, los bucles de herramientas y si el modo rápido está habilitado.
¿El modo rápido mejorará la calidad del modelo?
El énfasis oficial está en mejorar la velocidad, no en una mayor inteligencia. Es aproximadamente 2,5 veces más rápido que el modo predeterminado y cuesta el doble de la tarifa base. Si vale la pena usarlo debe medirse por el valor comercial que aporta la latencia de interacción.
¿Se pueden reutilizar directamente los prompts de Opus 4.8?
A menudo se puede utilizar como punto de partida para la migración, pero no se deben omitir las pruebas de regresión. Opus 5 es más proactivo y las palabras clave antiguas pueden contener pasos redundantes; También es necesario revalidar las llamadas a herramientas, los límites de seguridad y los comportamientos alternativos.
¿Opus 5 es adecuado para trabajos de ciberseguridad?
Puede admitir el descubrimiento de vulnerabilidades de código fuente legítimo y el análisis defensivo, pero el clasificador oficial limita las solicitudes de alto riesgo, como el escaneo binario, las pruebas de penetración y la generación de exploits. Los equipos relevantes deben diseñar flujos de trabajo basados en el alcance de la autorización y anticipar que algunas solicitudes pueden bloquearse o revertirse.
Resumen
El valor central de Claude Opus 5 es proporcionar capacidades más sólidas de ejecución de agentes, programación, operación de computadoras e investigación científica al mismo precio básico que Opus 4.8. La brecha entre este y Fable 5 ya es pequeña en algunas revisiones de programación, pero el costo de la tarea es menor; Al mismo tiempo, Anthropic limita las capacidades de seguridad de la red de alto riesgo mediante clasificadores y respaldo automático.
Para los usuarios existentes, la acción más razonable no es cambiar por completo de inmediato, sino completar una migración controlada utilizando tareas reales: arreglar el conjunto de prueba, cambiar solo la ID del modelo, comparar la tasa de éxito, la demora y el costo de cada tarea exitosa y luego ajustar gradualmente el esfuerzo, el modo rápido y las palabras clave. Sólo así podremos juzgar si Opus 5 aporta puntuaciones de referencia más altas o mejoras de productividad cuantificables.