Cómo funcionan los límites de Claude: ventana de 5 horas, límite semanal y consumo de tokens

Una explicación del sistema de uso de Claude: la ventana móvil de 5 horas, los límites semanales, el consumo por tokens y archivos adjuntos, y formas prácticas de evitar alcanzar el límite.

El límite de uso de Claude no se calcula simplemente según la cantidad de mensajes que todavía puedes enviar hoy. Se parece más a un sistema de consumo dinámico: a corto plazo existe una ventana móvil de 5 horas, a largo plazo se aplica un límite semanal y cada solicitud consume una cantidad diferente según el modelo, el contexto, los archivos adjuntos y la longitud de la respuesta.

Por eso muchos usuarios encuentran confuso el sistema. Es posible enviar solo unos pocos mensajes y recibir de repente un aviso de límite agotado. También puede ocurrir que dos personas con el mismo plan Pro o Max tengan experiencias muy distintas. La razón principal no suele ser la cantidad de mensajes, sino el coste de cómputo asociado a cada uno.

Primero, la ventana móvil de 5 horas

Uno de los límites de corto plazo más habituales de Claude es la ventana de 5 horas. No se reinicia a medianoche según el día natural, sino que avanza dinámicamente de acuerdo con el uso reciente.

En términos sencillos:

  • Envías solicitudes de forma continua durante un periodo de 5 horas;
  • Cuando el consumo acumulado dentro de ese periodo alcanza el máximo, aparece un aviso de restricción;
  • El uso disponible se recupera gradualmente cuando las solicitudes más antiguas salen de la ventana;
  • La cantidad real disponible varía según el plan, el modelo y la carga del servicio.

Este tipo de límite afecta especialmente al uso frecuente y continuado, por ejemplo, cuando se pide a Claude Code que modifique código sin pausa, se suben archivos repetidamente para analizarlos o se depura durante mucho tiempo dentro de una misma conversación.

Como estimación general, el plan gratuito ofrece poco uso, Pro puede procesar decenas de mensajes normales cada 5 horas y Max proporciona varias veces la capacidad de Pro según el nivel contratado. Las cifras reales no son fijas. El uso restante y la hora de reinicio que muestra Claude son referencias más fiables.

El límite semanal restringe el uso intensivo continuado

Además de la ventana de 5 horas, Claude puede aplicar un límite de uso semanal. Su objetivo principal es controlar el uso intensivo y sostenido, no una sesión ocasional con mucha actividad.

La diferencia puede entenderse así:

  • Si solo alcanzas el límite de 5 horas, normalmente podrás continuar cuando se recupere la ventana;
  • Si alcanzas el límite semanal, quizá debas esperar más tiempo hasta que se renueve el uso de la semana;
  • Si alcanzas ambos límites, la restricción semanal puede seguir activa incluso después de recuperarse la ventana de corto plazo.

Por tanto, los avisos de Claude no siempre representan el mismo tipo de restricción. Muchas solicitudes exigentes en poco tiempo pueden llenar únicamente la ventana de 5 horas. En cambio, usar Claude Code de forma intensiva durante varios días, analizar documentos largos o ejecutar tareas automatizadas aumenta la probabilidad de alcanzar el límite semanal.

Lo que se descuenta es el coste de cómputo, no solo los mensajes

Un mensaje no tiene un coste fijo. Para calcular el consumo, Claude tiene en cuenta la entrada, el contexto acumulado, los archivos adjuntos, las llamadas a herramientas y la longitud de la salida. Cuanto más compleja sea una solicitud, más rápido consumirá el límite disponible.

Existen cuatro fuentes de consumo especialmente comunes.

La primera es la longitud de la entrada. Cuanto más largo sea el texto enviado, más tokens deben procesarse. Una especificación de miles de palabras, un registro extenso o un archivo de código completo consumen mucho más que una pregunta breve.

La segunda es la acumulación de contexto. A medida que una conversación crece, Claude necesita consultar más historial en cada respuesta. En una conversación larga, incluso una instrucción tan breve como “continúa” puede obligar al modelo a volver a leer una gran cantidad de contexto.

La tercera son los archivos adjuntos y las imágenes. Los PDF, las capturas de pantalla, las hojas de cálculo y los archivos comprimidos de código aumentan considerablemente el coste de procesamiento. Analizar una sola vez un PDF de decenas de páginas puede equivaler a muchos mensajes de texto normales.

La cuarta es la longitud de la salida y la capacidad del modelo. Pedir a Claude que escriba un informe largo, genere código completo o revise repetidamente su propio trabajo aumenta el consumo. Los modelos más capaces y las tareas de razonamiento más complejas también suelen agotar el límite con mayor rapidez.

Por qué Claude Code alcanza el límite más rápido

Claude Code suele dar la impresión de consumir más que el chat normal por una razón sencilla: no procesa una sola pregunta y respuesta, sino una tarea de desarrollo completa.

Una solicitud de Claude Code puede incluir:

  • La descripción de la tarea actual;
  • El contenido de los archivos relacionados;
  • La estructura del repositorio;
  • La salida de comandos;
  • Los registros de pruebas;
  • El historial de varias rondas de cambios;
  • Los parches y explicaciones generados por el modelo.

Si la tarea continúa durante mucho tiempo, Claude Code sigue acumulando contexto. Puede parecer que solo has enviado diez instrucciones, aunque por detrás ya se haya procesado una gran cantidad de código, registros y resultados de herramientas.

Por eso, al usar Claude Code, la gestión del límite depende menos de escribir unas pocas palabras menos y más de controlar el alcance de cada tarea. Conviene trabajar con un único objetivo claro cada vez, iniciar una tarea nueva al terminar y evitar añadir requisitos indefinidamente al mismo contexto.

Cómo reducir la probabilidad de alcanzar el límite

La estrategia más eficaz consiste en reducir el contexto innecesario y evitar procesar repetidamente archivos adjuntos grandes.

Primero, crea un Chat nuevo cuando termines una tarea. Después de resolver un problema en una conversación, no la reutilices para iniciar otro trabajo distinto. Una conversación nueva elimina el contexto anterior y reduce el coste de las solicitudes posteriores.

Segundo, divide las tareas grandes. En lugar de pedir “refactoriza todo el proyecto y añade todas las pruebas que faltan”, separa el trabajo por módulo, archivo o función y entrega a Claude un objetivo verificable cada vez.

Tercero, evita adjuntar archivos innecesarios. Proporciona solo las páginas, registros, capturas o fragmentos de código directamente relacionados con el problema. Antes de subir un PDF de 50 páginas, considera si Claude necesita realmente leerlo completo.

Cuarto, resume antes de continuar. Si una conversación ya es muy larga, pide a Claude que condense las conclusiones, las tareas pendientes y el contexto esencial. Después, copia ese resumen en una conversación nueva. Esto consume menos que arrastrar todo el historial.

Quinto, evita las horas punta cuando sea posible. Anthropic ha ajustado anteriormente el ritmo de consumo durante periodos de alta carga. Programar las tareas intensivas fuera de esas horas puede reducir la probabilidad de alcanzar rápidamente el límite de la ventana.

Sexto, conoce las diferencias entre planes. Pro es apropiado para un uso cotidiano frecuente, mientras que Max se adapta mejor a sesiones prolongadas de investigación, desarrollo y automatización. Si ejecutas a menudo tareas largas en Claude Code, Max suele ofrecer una experiencia más estable.

No interpretes el límite como una cantidad fija de mensajes

El límite de Claude se parece más a una cantidad de cómputo disponible que a un contador fijo de mensajes. Las siguientes situaciones pueden hacer que lo alcances antes:

  • Continuar trabajando dentro de una conversación antigua y muy larga;
  • Subir PDF grandes, archivos de código o varias imágenes;
  • Pedir a Claude que genere un informe extenso o un proyecto completo;
  • Ejecutar muchas rondas de modificaciones y pruebas con Claude Code;
  • Iniciar varias tareas intensivas en poco tiempo;
  • Usar un modelo más capaz para resolver razonamientos complejos.

Por el contrario, las preguntas breves, las correcciones ligeras y los resúmenes sencillos pueden consumir el límite mucho más despacio, aunque envíes una mayor cantidad de mensajes.

Límites de velocidad y niveles de la API de Claude

Lo más importante de esta actualización

Si solo usas la API de Claude para scripts ocasionales o herramientas pequeñas, quizá no notes el cambio de inmediato. Pero si ejecutas Claude Code, AI Agents, resúmenes por lotes, preguntas RAG o colas backend, esta actualización merece atención.

El cambio se puede resumir en tres puntos:

  1. Los límites generales de la API de Claude subieron.
  2. Los límites de Sonnet y Haiku se alinean con Opus dentro de cada usage tier.
  3. Los usage tiers se simplifican a Start, Build y Scale.

¿Qué significa en la práctica? Antes, algunos desarrolladores tenían que revisar límites distintos al cambiar entre Opus, Sonnet y Haiku. Ahora la estructura de tiers y los límites por modelo son más fáciles de entender, algo útil para apps multimodelo, productos con Agents y plataformas internas.

Pero esto no significa que puedas abrir concurrencia sin control. La API de Claude sigue limitada por número de solicitudes, input tokens, output tokens y velocidad de crecimiento del tráfico.

Por qué importa a los desarrolladores

En muchas integraciones con Claude API, el problema real no es si el modelo puede responder. Es encontrarse de pronto con 429 después de pasar a producción.

Escenarios típicos:

  1. Un script local envía cientos de archivos a Claude para resumirlos.
  2. Una app con Agents ejecuta muchas llamadas a herramientas y solicitudes de contexto largo al mismo tiempo.
  3. Un sistema RAG mete resultados de búsqueda, historial de conversación y system prompts en un solo prompt.
  4. Una cola backend consume trabajos demasiado rápido y agota la capacidad de tokens en minutos.
  5. Las solicitudes fallidas activan reintentos automáticos y empeoran la congestión.

La subida de límites ayudará a que algunas cargas corran mejor. Pero si tu app puede amplificar solicitudes, todavía tienes que tratar los rate limits con seriedad. Más límite es una buena noticia, pero el throttling, las colas y la estrategia de reintentos siguen siendo necesarios.

Cómo entender Start, Build y Scale

Los nuevos usage tiers quedan en tres niveles:

Nivel Para qué encaja mejor
Start Desarrolladores individuales, scripts pequeños, prototipos iniciales
Build Apps con tráfico estable, herramientas internas de equipo
Scale Producción, Agents de alta concurrencia, tareas por lotes e integraciones empresariales

No copies números concretos desde un artículo. Claude Console y la documentación oficial deben ser la fuente de verdad. Los límites de Anthropic pueden cambiar según cuenta, organización, workspace, modelo y política de producto.

En términos simples: si solo escribes scripts de vez en cuando, lo importante es no subir demasiado la concurrencia. Si estás construyendo un producto real, trata Claude como un servicio externo que necesita planificación de capacidad, no como una llamada de función normal.

RPM, ITPM y OTPM siguen siendo clave

Los rate limits de la API de Claude no son solo “solicitudes por minuto”. La documentación usa con frecuencia tres métricas:

Métrica Significado Dónde suele fallar
RPM requests per minute, solicitudes por minuto Muchas solicitudes pequeñas, alta concurrencia, demasiados reintentos automáticos
ITPM input tokens per minute, input tokens por minuto Prompts largos, contexto grande, demasiados resultados RAG
OTPM output tokens per minute, output tokens por minuto max_tokens demasiado alto, generación masiva de textos largos o código

Muchos errores 429 no ocurren por exceso de solicitudes, sino por exceso de tokens. Por ejemplo, puedes enviar solo 10 solicitudes por minuto, pero si cada una lleva cientos de miles de input tokens, puedes chocar primero con ITPM. Al revés, si el prompt es corto pero el modelo genera informes largos en lote, puedes chocar primero con OTPM.

Por eso, al depurar no mires solo el número de llamadas API. Como mínimo, registra el nombre del modelo, workspace, input tokens, output tokens, estado de respuesta y número de reintentos.

Agents y tareas por lotes ganan más margen

La subida de límites también ayuda a solicitudes normales tipo chat, pero los beneficiarios más claros son Agents y tareas por lotes.

Una sola “solicitud de usuario” en una app con Agent puede esconder una cadena de llamadas a Claude API:

  1. Leer archivos.
  2. Resumir contexto.
  3. Llamar herramientas.
  4. Revisar resultados de herramientas.
  5. Planificar el siguiente paso.
  6. Producir la respuesta final.

Si varios usuarios lo usan al mismo tiempo, o si el backend también ejecuta trabajos por lotes, el consumo de tokens sube rápido. Con límites más altos, estas cargas tienen más margen y cambiar de modelo debería ser más fluido. Aun así, en producción conviene separar carriles: solicitudes online por una ruta de baja latencia, lotes por cola y tareas largas con límites de concurrencia propios.

No culpes solo al modelo por un 429

Cuando aparece 429, no conviene cambiar de modelo de inmediato ni subir los reintentos al máximo. Un orden de diagnóstico más útil es:

  1. Leer el mensaje de error y confirmar si es rate limit, quota u otra restricción.
  2. Revisar cabeceras de respuesta como limit, remaining y reset.
  3. Calcular los RPM, ITPM y OTPM recientes.
  4. Ver si frontend, backend, cola y SDK están reintentando al mismo tiempo.
  5. Ver si tareas backend y solicitudes de usuario comparten la misma organización o workspace.
  6. Revisar si un aumento reciente de tráfico activó acceleration limits.

La documentación de Anthropic también menciona acceleration limits cuando el tráfico sube de forma repentina. Es decir, aunque el volumen promedio parezca razonable, una subida brusca puede activar límites.

Al lanzar una función nueva, lo más seguro es abrir tráfico gradualmente. Por ejemplo, actívala primero para el 5% de usuarios y mira 429, latencia, consumo de tokens y curva de costos antes de mandar todo el tráfico a Claude API.

Rate Limits API encaja en monitorización

Anthropic también ofrece Rate Limits API para consultar la configuración de límites de organizaciones y workspaces. Es útil para monitorización interna, paneles de administración y scripts de operaciones.

Puede servir para:

  1. Confirmar límites del workspace antes de desplegar.
  2. Mostrar capacidad disponible a distintas líneas de negocio.
  3. Explicar por qué staging funciona pero producción recibe 429.
  4. Ajustar concurrencia de colas según los límites actuales.
  5. Crear alertas de capacidad antes de que los usuarios reporten errores.

Pero no debe sustituir el throttling de la aplicación. Tu servicio sigue necesitando colas, límites de concurrencia, exponential backoff y un máximo de reintentos.

Qué cambiar ahora en tu código

Si ya usas Claude API, empieza por algunas revisiones prácticas:

  1. Abre Claude Console y confirma si tu tier ya es Start, Build o Scale.
  2. Revisa los rate limits actuales de los modelos que usas de verdad. No dependas de capturas antiguas ni de memoria.
  3. Haz configurables la concurrencia, las solicitudes por minuto y los maximum output tokens.
  4. Pon las tareas por lotes detrás de una cola, en vez de golpear la API con un for directo.
  5. Usa exponential backoff para 429, con un máximo de reintentos.
  6. Registra input tokens, output tokens, nombre del modelo, workspace y latencia de solicitud.
  7. Si reutilizas contexto largo, evalúa prompt caching, pero no lo trates como si no contara para ningún límite.

Esta actualización es claramente positiva: la API de Claude tiene más capacidad y los usage tiers son más fáciles de entender. Para los desarrolladores, la acción correcta no es “enviar más fuerte sin pensar”. Es usar ese margen extra para ordenar la cadena de llamadas, la monitorización y la estrategia de reintentos. Así los límites más altos se convierten en estabilidad, no en una forma más rápida de llegar al siguiente cuello de botella.

Aumentos de límites de Claude y capacidad de cómputo

Cómo cambian los límites de Claude Code y API

Anthropic anunció tres cambios, todos efectivos desde el día del anuncio.

Primero, los límites de uso de cinco horas de Claude Code se duplican para los planes Pro, Max, Team y Enterprise basados en asientos.

Esto importa directamente a usuarios intensivos de Claude Code. Antes, la lectura continua de código, edición y ejecución de tareas podía chocar rápidamente con el límite de cinco horas. Duplicar el límite permite más trabajo de desarrollo sostenido dentro de la misma ventana de trabajo.

Segundo, las cuentas Pro y Max ya no verán límites reducidos de Claude Code durante horas pico.

Esto es más importante que el número en sí. La parte más frustrante de muchas herramientas de IA no es la cuota normal, sino las ralentizaciones repentinas o límites inestables durante periodos de alta demanda. Eliminar reducciones en horas pico muestra que Anthropic quiere que los usuarios de pago tengan una experiencia más predecible incluso cuando la demanda es alta.

Tercero, Anthropic aumenta de forma considerable los límites de tasa de API para modelos Claude Opus. El artículo original presenta los números detallados en una tabla de imagen; el punto central es que la capacidad API de Opus sube de forma significativa.

Para desarrolladores, Opus es el modelo más caro, pesado y capaz. Límites API más altos para Opus sugieren que Anthropic quiere que más empresas y desarrolladores lo pongan en flujos reales de negocio, no solo que usen Claude en una interfaz de chat.

Por qué los límites de uso son realmente un tema de cómputo

Los “límites” de productos de IA no son solo texto de membresía. Se corresponden con costos reales.

Cada vez que Claude Code lee un repositorio, genera un patch o ejecuta una tarea larga, consume recursos de inferencia. Los usuarios de API que ponen Opus en soporte, análisis financiero, revisión de código, procesamiento documental o flujos agentic crean demanda sostenida. Para la plataforma, relajar límites significa tener cómputo más fiable detrás.

La lógica del anuncio es clara: primero explicar que los usuarios reciben límites más altos, luego explicar por qué esos límites pueden subir ahora. La nueva capacidad de SpaceX, junto con alianzas existentes con Amazon, Google, Microsoft, NVIDIA y Fluidstack, soporta un uso más pesado.

Esto también explica por qué los productos de IA enfatizan cada vez más la segmentación. Usuarios Free, Pro, Max, Team y Enterprise consumen cómputo de forma distinta y pagan distinto. Las empresas de modelos tienen que reajustar cuotas, prioridad, acceso a modelos y costos de infraestructura.

Expansión internacional y cumplimiento

Anthropic también dice que los clientes empresariales, especialmente en sectores regulados como finanzas, salud y gobierno, necesitan cada vez más infraestructura regional para cumplimiento y residencia de datos.

Eso significa que las empresas de modelos no pueden construir toda la infraestructura en Estados Unidos. La IA empresarial debe manejar cumplimiento regional, residencia de datos, seguridad de cadena de suministro, costos de energía y relaciones con comunidades locales. Anthropic dice que su colaboración con Amazon ya incluye inferencia adicional en Asia y Europa.

También dice que será intencional al añadir capacidad en países democráticos cuyos marcos legales y regulatorios soporten inversión a gran escala y cadenas de suministro seguras, mientras explora formas de extender su compromiso de precio eléctrico de centros de datos de EE. UU. a otras jurisdicciones.

Esto muestra que la infraestructura de IA no es solo un tema técnico. Cada vez es más un asunto de energía, manufactura y economía geopolítica.

Impacto práctico para usuarios de Claude Code

Para desarrolladores, el cambio más importante es que se duplicó el límite de cinco horas de Claude Code. Afecta escenarios como:

  • Lectura de repositorios grandes.
  • Refactorización de varios archivos.
  • Investigación de bugs y corrección de pruebas.
  • Migraciones de código y actualización de dependencias.
  • Tareas largas de programación con agentes.
  • Uso simultáneo de Claude Code en planes Team o Enterprise.

Un problema común de Claude Code era llegar al límite mientras la tarea seguía en curso. Con límites más altos, es más fácil que un agente complete una tarea completa en lugar de detenerse a mitad de camino.

Para usuarios Pro y Max, eliminar las reducciones en horas pico también es importante. Significa que la experiencia puede ser más estable durante periodos de alta demanda, con menos interrupciones por ajustes temporales.

Qué significa para usuarios de API

El anuncio también dice que los rate limits de API para Claude Opus aumentaron considerablemente. Para equipos que usan Opus en tareas difíciles, normalmente eso implica:

  • Mayor concurrencia.
  • Menos errores 429 por límite de tasa.
  • Mejor soporte para cargas por lotes.
  • Mejor encaje para contexto largo, razonamiento complejo y flujos con agentes.

Los límites concretos siguen variando por cuenta, organización, modelo y plan. Antes de desplegar en producción, conviene revisar Anthropic Console, la documentación de rate limits y los registros de errores.

Empresas y despliegue regional importan más

Anthropic también señala que sectores regulados como finanzas, salud y gobierno necesitan cada vez más infraestructura regional para cumplir requisitos de cumplimiento y residencia de datos. Por eso, parte de la expansión de capacidad se ubicará fuera de Estados Unidos, especialmente para inferencia en Asia y Europa.

Esto importa para clientes empresariales. Cuando las aplicaciones de modelos grandes entran en procesos críticos, la pregunta no es solo si el modelo funciona bien. También incluye:

  • Si los datos permanecen en la región requerida.
  • Si se cumplen requisitos regulatorios del sector.
  • Si hay capacidad estable en horas pico.
  • Si se soporta concurrencia a nivel de equipo y organización.
  • Si existen controles de auditoría, permisos y seguridad.

Desde esa perspectiva, la expansión de cómputo no es solo una noticia de rendimiento. También puede influir en compras y decisiones de despliegue empresarial.

Una estrategia práctica de uso

Para controlar el consumo cotidiano, puedes aplicar estas pautas:

  • Utiliza el chat normal para preguntas generales y tareas ligeras de redacción;
  • Define un solo objetivo por tarea de programación;
  • Inicia una conversación nueva al finalizar cada tarea;
  • Recorta los archivos grandes y sube únicamente las partes relevantes;
  • Resume las conversaciones largas antes de trasladarlas a un Chat nuevo;
  • Si alcanzas el límite con frecuencia, comprueba si el aviso corresponde a la ventana de 5 horas o al límite semanal;
  • Para trabajar de forma continuada con Claude Code, considera un plan superior o uso adicional.

Lo que realmente determina el consumo de Claude no es cuántas veces pulsas Enviar, sino cuánto contenido debe procesar el modelo en cada ocasión. Al comprenderlo, el objetivo no debe ser simplemente hacer menos preguntas, sino formular solicitudes más breves, claras y libres de historial innecesario.

Fuentes: Claude pricing, The Verge: Anthropic launches a $200 per month tier for power users, TechRadar: Claude is limiting usage more aggressively during peak hours, ITPro: Anthropic Claude Code usage limits increase