|

Claude Opus 5 en Google Cloud y Azure: todos los datos

En pocas palabras: Anthropic lanzó Claude Opus 5, su modelo más avanzado, disponible ya en Google Cloud Agent Platform y Microsoft Foundry sobre Azure. Ofrece hasta 1 millón de tokens de contexto, ventana de salida de 128K tokens y soporte garantizado hasta enero de 2027.

Anthropic metió su modelo más potente en las dos nubes enterprise más grandes del mercado. Claude Opus 5 ya está disponible en Google Cloud Agent Platform y en Microsoft Foundry, con un horizonte de uso garantizado hasta por lo menos enero de 2027. Las cuotas arrancan en 10 millones de tokens por minuto para input en multi-región y el contexto llega al millón de tokens.

Claude Opus 5 es el modelo Opus más avanzado de Anthropic, diseñado para alimentar agentes de larga duración con mejoras concretas en codificación y trabajo profesional. Es la pieza tope de gama del lineup de Anthropic y ahora corre sobre infraestructura de Google Cloud y Microsoft Azure, lo que significa que podés integrarlo a tus flujos enterprise sin sacar los datos de tu nube.

Resumen

  • Claude Opus 5 ya opera en Google Cloud Agent Platform y Microsoft Foundry con acceso desde Model Garden y el catálogo de modelos de Azure.
  • Ventana de entrada de 1 millón de tokens y salida de 128.000 tokens, según la documentación oficial de Google Cloud.
  • Cuotas multi-región de 10M TPM input y 1M TPM output; el endpoint global duplica esos números.
  • Fecha de retiro no antes del 24 de enero de 2027, así que tenés pista larga para proyectos en producción.
  • En Azure hay dos versiones: una sobre infraestructura de Anthropic y otra nativa de Azure (GA).

¿Qué es Claude Opus 5 y qué lo hace especial?

Claude Opus 5 es el modelo de lenguaje más capaz que tiene Anthropic en su familia Opus. La empresa lo construyó para agentes que corren durante períodos largos — hablamos de flujos de trabajo que pueden estirarse por horas o días sin perder el hilo— y le metió mejoras sustanciales en dos áreas donde la competencia viene fuerte: generación de código y tareas profesionales complejas (análisis financiero, revisión legal, investigación científica).

Lo que lo diferencia de versiones anteriores es el salto en la ventana de contexto y la capacidad de mantener coherencia en sesiones extensas. Con un millón de tokens de entrada, podés tirarle documentación entera de un proyecto, logs de sistema, transcripciones de reuniones y el historial completo de un sprint, y todavía te queda margen. (Sí, en serio: un millón de tokens.)

Ahora bien, la pregunta del millón es si este salto se traduce en mejor rendimiento real o si es más de lo mismo con un número más grande. Por lo que muestran los benchmarks internos de Anthropic — y ojo, acá siempre conviene tomar los números del fabricante con pinzas hasta que haya evaluaciones independientes—, el modelo mejora de forma perceptible en tareas de razonamiento multi-paso y en generación de código donde tenés que mantener consistencia entre archivos. Lo interesante es que el foco no está puesto en ganarle a GPT-4o en un benchmark único, sino en ser la pieza que no se cae a los 45 minutos de interacción.

¿Dónde está disponible Claude Opus 5?

Claude Opus 5 está disponible en dos plataformas cloud principales: Google Cloud Agent Platform y Microsoft Foundry (Azure). No es un lanzamiento exclusivo de una nube — Anthropic jugó a dos puntas y metió el modelo en ambos ecosistemas al mismo tiempo. Relacionado: en nuestra comparativa de Microsoft y GitHub.

En Google Cloud, el modelo aparece en Model Garden, dentro de la sección de partner models de Gemini Enterprise Agent Platform. Lo encontrás bajo el publisher Anthropic, listado como claude-opus-5. La consola de Google Cloud te deja acceder directamente desde Model Garden, aunque vas a necesitar los permisos adecuados y una cuenta de facturación activa.

En Microsoft Foundry, la cosa viene con un matiz importante: hay dos versiones de hosting. La Versión 1 corre sobre infraestructura de Anthropic, fuera de Azure. La Versión 2 es end-to-end en Azure y está en disponibilidad general (GA). No todos los modelos de Anthropic están disponibles en ambas versiones, y el ciclo de vida — preview, GA— puede variar entre una y otra, según la documentación de Microsoft Foundry. Si tu organización tiene requerimientos estrictos de residencia de datos, la versión 2 es la que te interesa.

¿Cuáles son los límites de tokens y cuotas de Claude Opus 5?

Los números oficiales que publicó Google Cloud en la documentación de Gemini Enterprise Agent Platform son claros: 1.000.000 de tokens de entrada y 128.000 tokens de salida. La ventana de contexto también es de 1.000.000 de tokens.

Las cuotas se dividen en dos niveles:

Tipo de endpointInput TPM (uncached y cache write)Output TPMContexto
Multi-región10.000.0001.000.0001.000.000
Global endpoint20.000.0002.000.0001.000.000
Claude Opus 5 en Google Cloud diagrama explicativo

Ojo con un detalle: las cuotas de Claude Opus 5 usan lo que Google Cloud llama Shared Model Lineage Quota con Provisioned Throughput. Esto significa que el consumo de tokens se comparte entre modelos de la misma familia y que podés reservar capacidad provisionada si necesitás throughput garantizado. Si tu caso de uso requiere latencia predecible, vas a querer provisionar en vez de depender solo de la cuota compartida.

El modelo incluye tanto cuota fija como Provisioned Throughput.

¿Cómo desplegar Claude Opus 5 en Google Cloud Agent Platform?

El despliegue en Google Cloud Agent Platform sigue el mismo patrón que cualquier modelo de partner en Model Garden. Si ya usaste Claude 3.5 Sonnet o cualquier otro modelo de Anthropic en GCP, el proceso te va a resultar familiar.

Los pasos son más o menos así: entrás a Model Garden desde la consola de Google Cloud, filtrás por el publisher Anthropic, seleccionás Claude Opus 5 y elegís el tipo de acceso — cuota fija compartida o Provisioned Throughput. Si vas por provisioned, preparate para configurar la capacidad que necesitás y aceptar el costo asociado. Necesitás una cuenta de Google Cloud con facturación activa y los permisos de IAM adecuados para Agent Platform.

El modelo está en etapa de lanzamiento GA (General Availability) desde el día uno, así que no hay período de preview ni letra chica sobre limitaciones de disponibilidad. Eso sí, como todo modelo grande en infraestructura cloud, la latencia va a depender de la región que elijas y de si estás pegándole al endpoint multi-región o al global.

¿Cómo usar Claude Opus 5 en Microsoft Foundry?

En Microsoft Foundry, Claude Opus 5 se despliega desde el catálogo de modelos. El proceso está documentado en la guía de Microsoft sobre modelos Claude, pero el dato clave es que tenés que decidir entre las dos versiones de hosting antes de empezar.

La versión 1 (infraestructura de Anthropic) es la opción más directa si ya venías usando Claude por API y solo querés gestionarlo desde el panel de Azure. La versión 2 (Azure-native) es la que va en serio para workloads de producción: corre sobre infraestructura de Azure, está en GA, y te da las garantías de residencia de datos y compliance que esperás de una nube enterprise. El costo y la latencia van a variar entre versiones, así que hacé números antes de mandar todo a producción. Esto se conecta con lo que analizamos en en la guía de Azure para desarrolladores.

¿Cómo verificar los tokens restantes en Claude Opus 5?

Google Cloud te da visibilidad sobre el consumo de tokens desde la consola de Agent Platform, donde podés monitorear las cuotas de TPM (tokens por minuto) en tiempo real. Las métricas incluyen input TPM — tanto para tráfico uncached como para cache writes— y output TPM, discriminadas por endpoint.

Si estás usando Provisioned Throughput, la consola te muestra el porcentaje de utilización sobre la capacidad reservada. Para monitoreo programático, Anthropic expone APIs que te permiten consultar el estado de consumo de tokens, y Google Cloud integra estas métricas con Cloud Monitoring. Un caso típico: configurás una alerta para cuando llegás al 80% de tu cuota de output TPM y evitás que un agente se quede mudo a las 3 AM. (Quien haya estado de guardia un domingo a la madrugada sabe exactamente de qué hablo.)

¿Cuál es la fecha de retiro de Claude Opus 5?

Según la documentación oficial de Google Cloud, Claude Opus 5 no se retira antes del 24 de enero de 2027. Esto te da un horizonte de uso de por lo menos 18 meses desde su lanzamiento. Anthropic podría extender esa fecha, como ya hizo con modelos anteriores de la familia Opus, pero el piso está fijado y es contractual.

Para equipos que están planificando migraciones o construyendo productos sobre el modelo, esta fecha es un dato de arquitectura. Significa que podés comprometerte a un ciclo de desarrollo de un año sin miedo a que te corten el acceso a mitad de camino. Dicho esto, siempre conviene tener un plan B: si tu producto depende de un solo modelo y ese modelo tiene fecha de retiro anunciada, ya deberías estar evaluando la migración.

Comparativa: Claude Opus 5 en Google Cloud vs Microsoft Azure

CaracterísticaGoogle Cloud Agent PlatformMicrosoft Foundry (Azure)
Input tokens1.000.0001.000.000
Output tokens128.000128.000
Cuota input (máx)20M TPM (global)Depende de la versión de hosting
Cuota output (máx)2M TPM (global)Depende de la versión de hosting
HostingInfraestructura Google CloudVersión 1: Anthropic / Versión 2: Azure nativa
EtapaGAGA (versión 2) / Preview posible (versión 1)
RetiroNo antes del 24/01/2027No especificado (misma familia)

Ejemplos concretos de uso

Ponele que tenés un equipo de desarrollo con 15 microservicios y una base de código que creció durante tres años sin mucha documentación. Le tirás a Claude Opus 5 el repositorio entero — todos los archivos, el historial de PRs, las decisiones de arquitectura que están en Notion— y le pedís que te genere un plan de refactorización para reducir la deuda técnica. Con 1 millón de tokens de contexto, el modelo puede procesar todo eso de una sentada sin perder referencias entre módulos. Probá hacer eso con un modelo de 128K de contexto y vas a ver cómo se desorienta en el tercer archivo.

Otro caso: un agente de soporte legal que analiza contratos. Cargás 800 páginas de jurisprudencia, el contrato bajo revisión, las políticas internas de compliance y el historial de negociaciones con ese cliente. El agente corre durante horas, revisando cláusula por cláusula, y te marca inconsistencias que un junior pasaría por alto. La salida de 128K tokens alcanza para que te devuelva un informe detallado con referencias cruzadas.

Qué significa para empresas y equipos en Latinoamérica

La disponibilidad en Google Cloud y Azure cambia el cálculo para empresas que operan en la región. Hasta hace poco, usar modelos de frontera como Opus implicaba pasar por la API de Anthropic y aceptar que los datos viajaran a infraestructura fuera de tu control. Ahora podés mantener todo dentro de tu tenant de GCP o Azure, con las garantías de compliance que ya tenés auditadas. Ya lo cubrimos antes en como explicamos sobre Azure VMSS.

Para startups y equipos de desarrollo que trabajan con cloud latinoamericana, la latencia también mejora. Si ya estás corriendo workloads en Google Cloud con regiones en São Paulo o Santiago, o en Azure con presencia en Brasil, pegarle al endpoint multi-región te da mejor tiempo de respuesta que ir a la API pública de Anthropic. No es magia — la física de la fibra óptica sigue mandando—, pero acorta el camino.

El tema del costo sigue siendo el elefante en la habitación. Provisioned Throughput no es barato, y el modelo Opus siempre fue el más caro de la familia. Si recién arrancás, probablemente te convenga explorar opciones de hosting más accesibles — un VPS en donweb.com para tus workloads de desarrollo, por ejemplo— y dejar el Provisioned Throughput para cuando tengas el caso de uso validado y el presupuesto aprobado.

Errores comunes al usar Claude Opus 5

Asumir que 1M de contexto es gratis en latencia

El modelo acepta hasta un millón de tokens de entrada, pero llenar la ventana te cuesta caro en tiempo de procesamiento. Cada token extra suma latencia, y si estás mandando requests con 800K tokens porque “total, el límite lo permite”, el tiempo de respuesta se va a las nubes (pun intended). La práctica recomendada es mandar solo el contexto relevante, bien curado, y no tratar la ventana como un volcado de datos sin filtrar.

No distinguir entre cuota compartida y Provisioned Throughput

La cuota compartida es exactamente eso: compartida. Si otro tenant está haciendo un uso intensivo en tu misma región, tu throughput puede degradarse. Provisioned Throughput te garantiza capacidad, pero lo pagás. Si tu aplicación no tolera variabilidad en la latencia, provisioná. Si estás haciendo experimentación o prototipado, la cuota compartida zafa.

Olvidar la fecha de retiro en la planificación

Enero de 2027 parece lejano, pero en tiempo de desarrollo de producto es un parpadeo. Si estás construyendo una integración profunda con Claude Opus 5, documentá la dependencia y poné un recordatorio en el calendario del equipo para octubre de 2026. Para ese momento ya deberías estar probando el sucesor o teniendo un plan de migración armado.

Ignorar la diferencia entre versiones de hosting en Azure

Elegir la versión 1 (infraestructura Anthropic) por comodidad y después descubrir que no cumple con los requisitos de residencia de datos de tu cliente enterprise es un error que te puede costar una auditoría fallida. Revisá los términos de cada versión antes de decidir.

Preguntas Frecuentes

¿Qué es Claude Opus 5?

Claude Opus 5 es el modelo de lenguaje más avanzado de la familia Opus de Anthropic, diseñado para agentes de larga duración con mejoras en codificación y trabajo profesional. Ofrece una ventana de contexto de 1 millón de tokens de entrada y 128.000 tokens de salida, y está disponible en Google Cloud Agent Platform y Microsoft Foundry. En el ataque a 73 repos de Microsoft profundizamos sobre esto.

¿Dónde puedo usar Claude Opus 5?

Claude Opus 5 está disponible en Google Cloud Agent Platform, accesible desde Model Garden, y en Microsoft Foundry sobre Azure. En Azure hay dos versiones: una alojada en infraestructura de Anthropic y otra nativa de Azure en disponibilidad general (GA).

¿Cuántos tokens tiene Claude Opus 5?

Claude Opus 5 acepta hasta 1.000.000 de tokens de entrada y genera hasta 128.000 tokens de salida. La ventana de contexto total es de 1.000.000 de tokens. Las cuotas de throughput varían según el endpoint: 10M TPM input en multi-región y 20M TPM input en el endpoint global.

¿Cómo desplegar Claude Opus 5 en Google Cloud?

Entrás a Model Garden en la consola de Google Cloud, buscás Claude Opus 5 bajo el publisher Anthropic y seleccionás entre cuota fija compartida o Provisioned Throughput. Necesitás una cuenta de Google Cloud con facturación activa y permisos IAM para Agent Platform. El modelo está en GA desde su lanzamiento.

¿Cuándo se retira Claude Opus 5?

La fecha de retiro de Claude Opus 5 no es anterior al 24 de enero de 2027, según la documentación oficial de Google Cloud. Anthropic puede extender ese plazo, pero el piso está garantizado.

Conclusión

Claude Opus 5 aterriza en Google Cloud y Azure con números sólidos y una propuesta clara: ser el modelo de referencia para agentes que no se caen a los 10 minutos de conversación. La ventana de 1 millón de tokens, las cuotas generosas de throughput y la fecha de retiro a casi dos años vista lo convierten en una opción seria para equipos que quieren construir sobre infraestructura enterprise sin depender de APIs externas.

Lo que falta — y esto es lo que va a definir si el modelo se gana un lugar en producción masiva— son benchmarks independientes que validen las mejoras que Anthropic promete en codificación y razonamiento multi-paso. La historia de los modelos de lenguaje está llena de saltos generacionales que en el paper se veían bárbaro y en producción mostraban grietas a las dos semanas.

Si estás evaluando Claude Opus 5 para un proyecto, arrancá con la cuota compartida en Google Cloud, validá que el rendimiento se sostenga en sesiones largas con tu caso de uso real y recién ahí considerá Provisioned Throughput. La ventana de retiro te da margen para experimentar sin apuro, pero no para dormirte.

Fuentes

Te puede interesar...