← Volver al blogClaude Opus 5: qué cambia realmente para desarrolladores y agentes
claudeanthropicai-agentscodingllm

Claude Opus 5: qué cambia realmente para desarrolladores y agentes

Claude Opus 5 combina un millón de tokens de contexto, cinco niveles de esfuerzo y más autonomía. Analizo qué cambia y dónde podría encajar frente a un flujo con Sol, Terra y Luna.

Hace poco publiqué cómo distribuyo el trabajo entre GPT-5.6 Sol, Terra y Luna: uno planifica, otro ejecuta y otro resuelve tareas repetitivas. Opus 5 plantea una alternativa distinta: sostener trabajos largos, usar herramientas y verificar sus resultados dentro de una misma sesión.

Todavía no lo he usado lo suficiente para publicar un veredicto. Este artículo reúne lo confirmado del lanzamiento, lo contrasta con pruebas independientes y explica dónde podría tener sentido dentro de un flujo de desarrollo real.


Anthropic presentó Claude Opus 5 el 24 de julio de 2026, apenas dos meses después de Opus 4.8. Lo describe como un modelo para coding agentic, tareas largas y trabajo profesional complejo.

Eso coincide con una necesidad concreta de mi flujo actual. Separar planificación, ejecución y trabajo repetitivo ayuda a controlar costos, pero introduce handoffs: un modelo diseña el plan, otro recibe el contexto y ejecuta, y después hay que revisar que ambos hayan interpretado la misma intención.

Opus 5 me interesa porque podría reducir ese costo de coordinación en tareas grandes. No para reemplazar automáticamente a Sol, Terra y Luna, sino como una opción para trabajos donde mantener la continuidad puede ser más valioso que separar cada rol.

La comparación que me interesa

Hoy distribuyo el trabajo aproximadamente así:

Tipo de trabajo Flujo actual Papel potencial de Opus 5
Arquitectura y revisión Sol Mantendría un modelo especializado
Implementación acotada Terra Opus 5 puede ser excesivo
Trabajo repetitivo Luna Opus 5 probablemente sería excesivo
Feature larga y multiarchivo Sol planifica → Terra ejecuta El espacio más interesante para Opus 5

No veo el lanzamiento como una competencia directa donde un modelo deba reemplazar a los otros tres.

El flujo con Sol, Terra y Luna optimiza especialización y costo. Opus 5 apuesta por continuidad y autonomía: recibir más contexto, trabajar durante más tiempo y completar una entrega con menos handoffs.

Si lo pruebo, será cuando aparezca una feature suficientemente grande para justificar ese enfoque. Por ahora, esta comparación sirve para entender qué cambia y dónde podría aportar valor.

Qué trae Claude Opus 5

Las especificaciones oficiales son:

Característica Claude Opus 5
ID en la API claude-opus-5
Contexto 1 millón de tokens
Salida máxima 128 mil tokens
Thinking Adaptativo y activo por defecto
Effort low, medium, high, xhigh, max
Precio de entrada USD 5 por millón de tokens
Precio de salida USD 25 por millón de tokens
Fast mode Aproximadamente 2.5× más rápido, USD 10 / 50
Batch API 50% de descuento: USD 2.50 / 12.50
Cache hit USD 0.50 por millón de tokens

El contexto de un millón de tokens es tanto el valor predeterminado como el máximo. No existe una variante menor. El modelo también activa el razonamiento adaptativo sin necesidad de declarar thinking en cada request.

La novedad más importante es effort

Opus 5 responde mejor que versiones anteriores al aumentar el cómputo de inferencia. Anthropic convirtió effort en el control principal para decidir cuánto trabajo debe invertir el modelo:

low      → tareas simples, menor costo y latencia
medium   → trabajo diario donde la calidad se mantiene
high     → valor predeterminado
xhigh    → coding y agentes exigentes
max      → tareas donde importa alcanzar el máximo resultado

Esto no equivale a un selector de longitud de respuesta. effort controla cuánto razona el modelo, no cuánto texto visible escribe. La documentación de Anthropic advierte que Opus 5 tiende a producir respuestas y documentos más largos que Opus 4.8, por lo que la concisión debe pedirse de forma explícita.

Una llamada básica desde TypeScript puede verse así:

import Anthropic from '@anthropic-ai/sdk';

const client = new Anthropic();

const response = await client.messages.create({
  model: 'claude-opus-5',
  max_tokens: 8_192,
  output_config: {
    effort: 'high',
  },
  messages: [
    {
      role: 'user',
      content: 'Revisa este cambio, encuentra la causa raíz y propone una corrección.',
    },
  ],
});

console.log(response.content);

Para xhigh o max, Anthropic recomienda aumentar max_tokens y utilizar streaming. El límite de salida incluye tanto el razonamiento como la respuesta visible.

Thinking está activo por defecto

Este cambio puede afectar integraciones existentes.

En Opus 4.8, una petición sin configuración de thinking se ejecutaba sin razonamiento extendido. En Opus 5, la misma petición activa thinking de forma adaptativa.

Además:

  • Thinking solo puede desactivarse con effort high o inferior.
  • Intentar desactivarlo con xhigh o max devuelve HTTP 400.
  • Con thinking desactivado, el modelo puede ocasionalmente escribir llamadas a herramientas como texto o filtrar tags internos.

La recomendación práctica es mantener thinking activado y bajar effort cuando quieras reducir tokens o latencia.

Rendimiento oficial: fuerte en agentes, coding y trabajo profesional

Anthropic presenta a Opus 5 como su nuevo estado del arte en Frontier-Bench y GDPval-AA. El resumen oficial reporta:

Evaluación Opus 5 Fable 5 Opus 4.8 GPT-5.6 Sol
Frontier-Bench v0.1 43.3% 33.7% 21.1% 34.4%
GDPval-AA v2 1861 1747 1593 1736
ARC-AGI-3 30.2% 1.5% 7.8%
OSWorld 2.0 70.6% 66.1% 55.7% 62.6%
AutomationBench 26.0% 17.4% 17.0% 18.1%

anthropic-benchmark-summary-official

Tabla publicada por Anthropic. Los resultados deben interpretarse como benchmarks del proveedor, no como garantía para cualquier workload.

En Frontier-Bench, que mide coding agentic en terminal, Opus 5 más que duplica el resultado máximo de Opus 4.8 y supera a Fable 5 a menor costo por intento.

anthropic-frontier-bench-official

Frontier-Bench v0.1 publicado por Anthropic. Cada punto corresponde a un nivel de effort.

El dato más interesante no es únicamente el máximo. La curva muestra que el nivel de esfuerzo cambia mucho la relación entre costo y resultado. No existe una configuración universalmente correcta.

Los primeros resultados independientes son buenos, pero no uniformes

Artificial Analysis evaluó el modelo antes del lanzamiento. En su Intelligence Index, Opus 5 con effort máximo obtiene 61 puntos, prácticamente empatado con Fable 5 en 60 y por encima de GPT-5.6 Sol en 59.

También reporta:

  • Primer lugar en GDPval-AA v2 con 1861 Elo.
  • Liderazgo conjunto en su Coding Agent Index.
  • Costo promedio de USD 2.03 por tarea en el Intelligence Index.
  • Un costo por tarea 26% menor que Fable 5 en esa evaluación.
  • Menor conocimiento factual que Fable 5.
  • Una tasa de alucinación de 50% en AA-Omniscience, 14 puntos más que Opus 4.8.

artificial-analysis-index

Resultados de Artificial Analysis. Las flechas identifican configuraciones de Claude Opus 5 en diferentes niveles de effort.

Esto refuerza una lectura más útil que “es el mejor modelo”: Opus 5 parece especialmente competitivo cuando puede actuar, usar herramientas y completar entregables. No necesariamente domina en recuerdo factual puro.

Como constructor convence más que como revisor único

CodeRabbit publicó una evaluación independiente centrada en code review. Su conclusión es más matizada.

Con effort xhigh, Opus 5 produjo comentarios accionables con mayor precisión que su baseline de producción:

Precisión accionable
Baseline    35.2%
Opus 5      39.3%

Pero detectó menos problemas conocidos:

Problemas detectados
Baseline    61.1%
Opus 5      55.2%

También generó cuatro veces más nitpicks y su precisión total cayó cuando esos comentarios entraron en el flujo.

coderabbit-review-tradeoff

Evaluación de CodeRabbit: Opus 5 x-high frente a su baseline de producción.

Su lectura final es clara: Opus 5 funciona mejor como constructor para tareas ambiguas, de diseño y de larga duración que como único revisor encargado de detectar todos los errores.

Para code review podría ocupar una ruta de alta precisión, acompañado por otro modelo o proceso orientado a cobertura.

Cambios prácticos al escribir prompts

Migrar prompts de Opus 4.8 sin revisarlos puede desperdiciar tokens.

1. Elimina instrucciones redundantes de verificación

Opus 5 verifica su propio trabajo sin necesidad de pedirlo. Frases como:

Double-check every result.
Use another agent to verify your answer.
Include a final verification step.

pueden provocar sobreverificación.

2. Controla la longitud explícitamente

Bajar effort no garantiza una respuesta visible más corta.

Una instrucción útil es:

Mantén las respuestas enfocadas y breves.
Explica a alto nivel salvo que se solicite profundidad.

3. Limita el uso de subagentes

Opus 5 delega con mayor facilidad. Eso ayuda en tracks realmente independientes, pero multiplica costo y contexto en tareas pequeñas.

Define cuándo puede delegar y establece un límite.

4. Entrega la especificación completa

Para features grandes, refactors y trabajo multiarchivo, Anthropic recomienda explicar el objetivo completo y dejar que el modelo ejecute. Opus 5 está orientado a terminar la tarea, no a dejar stubs o placeholders.

Novedades de plataforma que acompañan al modelo

El lanzamiento también incluye cambios útiles para agentes:

Herramientas modificables durante una conversación

En beta, una aplicación puede añadir o quitar tools entre turnos sin invalidar el prompt cache.

Esto permite que un agente empiece con herramientas mínimas y reciba capacidades adicionales según avance la tarea.

Fallback automático

La API puede redirigir automáticamente una petición bloqueada por los clasificadores de seguridad hacia otro modelo.

En lugar de devolver una negativa o error, intenta obtener una respuesta funcional con un modelo compatible.

Cache para prompts más cortos

El mínimo cacheable baja de 1024 a 512 tokens. Sistemas con prompts medianos pueden aprovechar caching sin cambiar su arquitectura.

Fast mode

Opus 5 puede ejecutarse aproximadamente 2.5 veces más rápido por el doble del precio base. Está disponible en la Claude API, no en Bedrock, Vertex AI ni Microsoft Foundry.

Seguridad y retención de datos

Anthropic aclara que Opus 5 no amplía la frontera en capacidades de doble uso riesgosas.

El modelo:

  • Puede buscar vulnerabilidades en código fuente.
  • Bloquea escaneo de binarios orientado a encontrar vulnerabilidades.
  • Bloquea pentesting y generación de exploits fuera de programas verificados.
  • Permanece por detrás de Mythos 5 en explotación ofensiva y investigación biológica autónoma.

Según Anthropic, sus clasificadores de ciberseguridad deberían intervenir alrededor de 85% menos que en Fable 5.

Opus 5 tampoco tiene el requisito de retención de datos de 30 días aplicado a Fable 5 y Mythos 5 para acceso general.

Dónde podría encajar en mi flujo

Por lo anunciado y por las primeras evaluaciones independientes, los casos que más me llaman la atención son:

  • Implementación de features multiarchivo.
  • Refactors que necesitan planificación y verificación.
  • Agentes con herramientas y sesiones largas.
  • Investigación técnica con producción de entregables.
  • Spreadsheets, slides y documentos complejos.
  • Revisión de código como segunda capa orientada a precisión.

No asumiría que es automáticamente la mejor opción para:

  • Tareas pequeñas donde Sonnet o un modelo rápido resuelven con menor costo.
  • Recuperación factual donde Fable 5 conserva ventaja.
  • Code review como única barrera de seguridad.
  • Pentesting o investigación ofensiva.
  • Flujos que no toleren respuestas extensas sin ajustar prompts.

No tengo preparado un benchmark formal ni una batería de pruebas. Lo usaría cuando aparezca una tarea suficientemente grande para justificarlo y compararía el resultado con el flujo que ya conozco.

Una configuración razonable para empezar

Una configuración inicial podría ser:

{
  "model": "claude-opus-5",
  "max_tokens": 8192,
  "output_config": {
    "effort": "medium"
  }
}

Usaría medium para trabajo diario, subiría a high o xhigh para features grandes y reservaría max para tareas donde exista una evaluación que justifique el costo.

El punto de partida oficial es high, pero no hay razón para pagar ese nivel en todos los requests si tus evaluaciones internas muestran que medium mantiene la calidad.

Conclusión

Claude Opus 5 no reemplaza automáticamente a Sol, Terra y Luna por ser el lanzamiento más reciente.

Hace poco publiqué ese flujo precisamente porque separar responsabilidades ayuda a elegir el costo y la capacidad adecuados para cada tarea. Opus 5 introduce una propuesta distinta: concentrar más planificación y ejecución dentro de una sola sesión larga.

Los benchmarks oficiales son fuertes y las primeras evaluaciones independientes confirman que hay una mejora real. También muestran límites: mayor consumo, respuestas más largas, menor cobertura en algunas tareas de revisión y conocimiento factual por debajo de Fable 5.

Por ahora no tengo un veredicto. Tengo un candidato para un tipo concreto de trabajo:

Features grandes donde mantener la continuidad puede valer más que dividir el trabajo entre varios modelos.

La pregunta no es cuál modelo gana. Es cuándo la continuidad de Opus 5 vale más que la especialización de Sol, Terra y Luna.

Fuentes

Comentarios

Cargando comentarios…