Hace poco publiqué cómo distribuyo el trabajo entre GPT-5.6 Sol, Terra y Luna: uno planifica, otro ejecuta y otro resuelve tareas repetitivas. Opus 5 plantea una alternativa distinta: sostener trabajos largos, usar herramientas y verificar sus resultados dentro de una misma sesión.
Todavía no lo he usado lo suficiente para publicar un veredicto. Este artículo reúne lo confirmado del lanzamiento, lo contrasta con pruebas independientes y explica dónde podría tener sentido dentro de un flujo de desarrollo real.
Anthropic presentó Claude Opus 5 el 24 de julio de 2026, apenas dos meses después de Opus 4.8. Lo describe como un modelo para coding agentic, tareas largas y trabajo profesional complejo.
Eso coincide con una necesidad concreta de mi flujo actual. Separar planificación, ejecución y trabajo repetitivo ayuda a controlar costos, pero introduce handoffs: un modelo diseña el plan, otro recibe el contexto y ejecuta, y después hay que revisar que ambos hayan interpretado la misma intención.
Opus 5 me interesa porque podría reducir ese costo de coordinación en tareas grandes. No para reemplazar automáticamente a Sol, Terra y Luna, sino como una opción para trabajos donde mantener la continuidad puede ser más valioso que separar cada rol.
La comparación que me interesa
Hoy distribuyo el trabajo aproximadamente así:
| Tipo de trabajo | Flujo actual | Papel potencial de Opus 5 |
|---|---|---|
| Arquitectura y revisión | Sol | Mantendría un modelo especializado |
| Implementación acotada | Terra | Opus 5 puede ser excesivo |
| Trabajo repetitivo | Luna | Opus 5 probablemente sería excesivo |
| Feature larga y multiarchivo | Sol planifica → Terra ejecuta | El espacio más interesante para Opus 5 |
No veo el lanzamiento como una competencia directa donde un modelo deba reemplazar a los otros tres.
El flujo con Sol, Terra y Luna optimiza especialización y costo. Opus 5 apuesta por continuidad y autonomía: recibir más contexto, trabajar durante más tiempo y completar una entrega con menos handoffs.
Si lo pruebo, será cuando aparezca una feature suficientemente grande para justificar ese enfoque. Por ahora, esta comparación sirve para entender qué cambia y dónde podría aportar valor.
Qué trae Claude Opus 5
Las especificaciones oficiales son:
| Característica | Claude Opus 5 |
|---|---|
| ID en la API | claude-opus-5 |
| Contexto | 1 millón de tokens |
| Salida máxima | 128 mil tokens |
| Thinking | Adaptativo y activo por defecto |
| Effort | low, medium, high, xhigh, max |
| Precio de entrada | USD 5 por millón de tokens |
| Precio de salida | USD 25 por millón de tokens |
| Fast mode | Aproximadamente 2.5× más rápido, USD 10 / 50 |
| Batch API | 50% de descuento: USD 2.50 / 12.50 |
| Cache hit | USD 0.50 por millón de tokens |
El contexto de un millón de tokens es tanto el valor predeterminado como el máximo. No existe una variante menor. El modelo también activa el razonamiento adaptativo sin necesidad de declarar thinking en cada request.
La novedad más importante es effort
Opus 5 responde mejor que versiones anteriores al aumentar el cómputo de inferencia. Anthropic convirtió effort en el control principal para decidir cuánto trabajo debe invertir el modelo:
low → tareas simples, menor costo y latencia
medium → trabajo diario donde la calidad se mantiene
high → valor predeterminado
xhigh → coding y agentes exigentes
max → tareas donde importa alcanzar el máximo resultadoEsto no equivale a un selector de longitud de respuesta. effort controla cuánto razona el modelo, no cuánto texto visible escribe. La documentación de Anthropic advierte que Opus 5 tiende a producir respuestas y documentos más largos que Opus 4.8, por lo que la concisión debe pedirse de forma explícita.
Una llamada básica desde TypeScript puede verse así:
import Anthropic from '@anthropic-ai/sdk';
const client = new Anthropic();
const response = await client.messages.create({
model: 'claude-opus-5',
max_tokens: 8_192,
output_config: {
effort: 'high',
},
messages: [
{
role: 'user',
content: 'Revisa este cambio, encuentra la causa raíz y propone una corrección.',
},
],
});
console.log(response.content);Para xhigh o max, Anthropic recomienda aumentar max_tokens y utilizar streaming. El límite de salida incluye tanto el razonamiento como la respuesta visible.
Thinking está activo por defecto
Este cambio puede afectar integraciones existentes.
En Opus 4.8, una petición sin configuración de thinking se ejecutaba sin razonamiento extendido. En Opus 5, la misma petición activa thinking de forma adaptativa.
Además:
- Thinking solo puede desactivarse con effort
higho inferior. - Intentar desactivarlo con
xhighomaxdevuelve HTTP 400. - Con thinking desactivado, el modelo puede ocasionalmente escribir llamadas a herramientas como texto o filtrar tags internos.
La recomendación práctica es mantener thinking activado y bajar effort cuando quieras reducir tokens o latencia.
Rendimiento oficial: fuerte en agentes, coding y trabajo profesional
Anthropic presenta a Opus 5 como su nuevo estado del arte en Frontier-Bench y GDPval-AA. El resumen oficial reporta:
| Evaluación | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|
| Frontier-Bench v0.1 | 43.3% | 33.7% | 21.1% | 34.4% |
| GDPval-AA v2 | 1861 | 1747 | 1593 | 1736 |
| ARC-AGI-3 | 30.2% | — | 1.5% | 7.8% |
| OSWorld 2.0 | 70.6% | 66.1% | 55.7% | 62.6% |
| AutomationBench | 26.0% | 17.4% | 17.0% | 18.1% |
Tabla publicada por Anthropic. Los resultados deben interpretarse como benchmarks del proveedor, no como garantía para cualquier workload.
En Frontier-Bench, que mide coding agentic en terminal, Opus 5 más que duplica el resultado máximo de Opus 4.8 y supera a Fable 5 a menor costo por intento.
Frontier-Bench v0.1 publicado por Anthropic. Cada punto corresponde a un nivel de effort.
El dato más interesante no es únicamente el máximo. La curva muestra que el nivel de esfuerzo cambia mucho la relación entre costo y resultado. No existe una configuración universalmente correcta.
Los primeros resultados independientes son buenos, pero no uniformes
Artificial Analysis evaluó el modelo antes del lanzamiento. En su Intelligence Index, Opus 5 con effort máximo obtiene 61 puntos, prácticamente empatado con Fable 5 en 60 y por encima de GPT-5.6 Sol en 59.
También reporta:
- Primer lugar en GDPval-AA v2 con 1861 Elo.
- Liderazgo conjunto en su Coding Agent Index.
- Costo promedio de USD 2.03 por tarea en el Intelligence Index.
- Un costo por tarea 26% menor que Fable 5 en esa evaluación.
- Menor conocimiento factual que Fable 5.
- Una tasa de alucinación de 50% en AA-Omniscience, 14 puntos más que Opus 4.8.
Resultados de Artificial Analysis. Las flechas identifican configuraciones de Claude Opus 5 en diferentes niveles de effort.
Esto refuerza una lectura más útil que “es el mejor modelo”: Opus 5 parece especialmente competitivo cuando puede actuar, usar herramientas y completar entregables. No necesariamente domina en recuerdo factual puro.
Como constructor convence más que como revisor único
CodeRabbit publicó una evaluación independiente centrada en code review. Su conclusión es más matizada.
Con effort xhigh, Opus 5 produjo comentarios accionables con mayor precisión que su baseline de producción:
Precisión accionable
Baseline 35.2%
Opus 5 39.3%Pero detectó menos problemas conocidos:
Problemas detectados
Baseline 61.1%
Opus 5 55.2%También generó cuatro veces más nitpicks y su precisión total cayó cuando esos comentarios entraron en el flujo.
Evaluación de CodeRabbit: Opus 5 x-high frente a su baseline de producción.
Su lectura final es clara: Opus 5 funciona mejor como constructor para tareas ambiguas, de diseño y de larga duración que como único revisor encargado de detectar todos los errores.
Para code review podría ocupar una ruta de alta precisión, acompañado por otro modelo o proceso orientado a cobertura.
Cambios prácticos al escribir prompts
Migrar prompts de Opus 4.8 sin revisarlos puede desperdiciar tokens.
1. Elimina instrucciones redundantes de verificación
Opus 5 verifica su propio trabajo sin necesidad de pedirlo. Frases como:
Double-check every result.
Use another agent to verify your answer.
Include a final verification step.pueden provocar sobreverificación.
2. Controla la longitud explícitamente
Bajar effort no garantiza una respuesta visible más corta.
Una instrucción útil es:
Mantén las respuestas enfocadas y breves.
Explica a alto nivel salvo que se solicite profundidad.3. Limita el uso de subagentes
Opus 5 delega con mayor facilidad. Eso ayuda en tracks realmente independientes, pero multiplica costo y contexto en tareas pequeñas.
Define cuándo puede delegar y establece un límite.
4. Entrega la especificación completa
Para features grandes, refactors y trabajo multiarchivo, Anthropic recomienda explicar el objetivo completo y dejar que el modelo ejecute. Opus 5 está orientado a terminar la tarea, no a dejar stubs o placeholders.
Novedades de plataforma que acompañan al modelo
El lanzamiento también incluye cambios útiles para agentes:
Herramientas modificables durante una conversación
En beta, una aplicación puede añadir o quitar tools entre turnos sin invalidar el prompt cache.
Esto permite que un agente empiece con herramientas mínimas y reciba capacidades adicionales según avance la tarea.
Fallback automático
La API puede redirigir automáticamente una petición bloqueada por los clasificadores de seguridad hacia otro modelo.
En lugar de devolver una negativa o error, intenta obtener una respuesta funcional con un modelo compatible.
Cache para prompts más cortos
El mínimo cacheable baja de 1024 a 512 tokens. Sistemas con prompts medianos pueden aprovechar caching sin cambiar su arquitectura.
Fast mode
Opus 5 puede ejecutarse aproximadamente 2.5 veces más rápido por el doble del precio base. Está disponible en la Claude API, no en Bedrock, Vertex AI ni Microsoft Foundry.
Seguridad y retención de datos
Anthropic aclara que Opus 5 no amplía la frontera en capacidades de doble uso riesgosas.
El modelo:
- Puede buscar vulnerabilidades en código fuente.
- Bloquea escaneo de binarios orientado a encontrar vulnerabilidades.
- Bloquea pentesting y generación de exploits fuera de programas verificados.
- Permanece por detrás de Mythos 5 en explotación ofensiva y investigación biológica autónoma.
Según Anthropic, sus clasificadores de ciberseguridad deberían intervenir alrededor de 85% menos que en Fable 5.
Opus 5 tampoco tiene el requisito de retención de datos de 30 días aplicado a Fable 5 y Mythos 5 para acceso general.
Dónde podría encajar en mi flujo
Por lo anunciado y por las primeras evaluaciones independientes, los casos que más me llaman la atención son:
- Implementación de features multiarchivo.
- Refactors que necesitan planificación y verificación.
- Agentes con herramientas y sesiones largas.
- Investigación técnica con producción de entregables.
- Spreadsheets, slides y documentos complejos.
- Revisión de código como segunda capa orientada a precisión.
No asumiría que es automáticamente la mejor opción para:
- Tareas pequeñas donde Sonnet o un modelo rápido resuelven con menor costo.
- Recuperación factual donde Fable 5 conserva ventaja.
- Code review como única barrera de seguridad.
- Pentesting o investigación ofensiva.
- Flujos que no toleren respuestas extensas sin ajustar prompts.
No tengo preparado un benchmark formal ni una batería de pruebas. Lo usaría cuando aparezca una tarea suficientemente grande para justificarlo y compararía el resultado con el flujo que ya conozco.
Una configuración razonable para empezar
Una configuración inicial podría ser:
{
"model": "claude-opus-5",
"max_tokens": 8192,
"output_config": {
"effort": "medium"
}
}Usaría medium para trabajo diario, subiría a high o xhigh para features grandes y reservaría max para tareas donde exista una evaluación que justifique el costo.
El punto de partida oficial es high, pero no hay razón para pagar ese nivel en todos los requests si tus evaluaciones internas muestran que medium mantiene la calidad.
Conclusión
Claude Opus 5 no reemplaza automáticamente a Sol, Terra y Luna por ser el lanzamiento más reciente.
Hace poco publiqué ese flujo precisamente porque separar responsabilidades ayuda a elegir el costo y la capacidad adecuados para cada tarea. Opus 5 introduce una propuesta distinta: concentrar más planificación y ejecución dentro de una sola sesión larga.
Los benchmarks oficiales son fuertes y las primeras evaluaciones independientes confirman que hay una mejora real. También muestran límites: mayor consumo, respuestas más largas, menor cobertura en algunas tareas de revisión y conocimiento factual por debajo de Fable 5.
Por ahora no tengo un veredicto. Tengo un candidato para un tipo concreto de trabajo:
Features grandes donde mantener la continuidad puede valer más que dividir el trabajo entre varios modelos.
La pregunta no es cuál modelo gana. Es cuándo la continuidad de Opus 5 vale más que la especialización de Sol, Terra y Luna.
Fuentes
- Introducing Claude Opus 5 — Anthropic
- What's new in Claude Opus 5 — Claude Platform
- Claude Opus pricing — Anthropic
- Prompting Claude Opus 5 — Anthropic
- Claude Opus 5 System Card
- Artificial Analysis: Opus 5
- CodeRabbit: Opus 5 model review
- Anthropic launches Opus 5 — TechCrunch
- Anthropic announces Claude Opus 5 — CNBC