Una mirada honesta y temprana de un dev — algunas pruebas personales rápidas después del lanzamiento público, antes de que nadie le haya puesto kilómetros de verdad.
Hay una sensación particular cuando sale un nuevo modelo de punta. No es del todo entusiasmo ni del todo escepticismo: son esas ganas de abrir el editor y comprobar por vos mismo si los benchmarks significan algo para el trabajo real y aburrido que hacés todos los días.
GPT-5.6 me dio esas ganas, así que me pasé la semana usándolo de verdad en vez de solo leer sobre él.
Tres modelos, una idea limpia
OpenAI lanzó GPT-5.6 como una familia de tres modelos con un esquema de nombres sacado de un libro de astronomía: Sol (el buque insignia), Terra (el todoterreno equilibrado del día a día), y Luna (rápido y barato). Idea limpia: el número es la generación, el nombre es el nivel.
Lo tengo hace unos días — lo suficiente para correrlo contra mi stack de proyectos personales, no lo suficiente como para pretender que le exigí hasta el último rincón. Así que te lo digo de entrada: esto es una impresión de primera semana, no un veredicto. Si alguien ya te está diciendo que GPT-5.6 "lo cambió todo", te está vendiendo algo.
Lo que de verdad me llamó la atención
Esto es a lo que vuelvo una y otra vez, y no son las capturas de los benchmarks.
Terra es el que importa para gente como yo. Sol se lleva todos los titulares — 91.9% en Terminal-Bench 2.1, los puntajes más altos en evals de ciberseguridad, todo el circo de buque insignia. Pero Sol cuesta $5/$30 por millón de tokens. Para un dev solo que lanza proyectos personales y corre un stack independiente, esa cuenta se pone fea rápido.
Terra es la historia silenciosa: más o menos el rendimiento de GPT-5.5 a la mitad del precio ($2.50/$15). Eso no es una posta de la hoja de specs — es la diferencia entre que yo corra un agente todo un fin de semana de experimento, o que mire el medidor y cierre la pestaña. Mitad de precio con la misma calidad es el tipo de cosa que realmente cambia lo que voy a intentar, no solo lo que voy a benchmarquear.
Y Luna a $1/$6 es el primer modelo lo bastante barato como para que dejara de pensar en el costo para las cosas chicas — resúmenes, borradores, el pegamento de automatización que nunca justificó un modelo premium antes.
Lo de Ultra sí es genuinamente nuevo
Bueno, una función en la que no puedo dejar de pensar. Sol tiene un nuevo modo "Ultra" que no solo piensa más — genera subagentes que trabajan en paralelo y después junta los resultados. OpenAI básicamente horneó el loop de orquestación de agentes dentro del modelo mismo.
Ya pasé suficiente tiempo armando mis propios setups multi-agente a mano como para saber lo delicado que es hacerlo. Ver que se vuelve un modo nativo es uno de esos momentos en los que sentís que el piso se mueve un poco. Lo corrí contra una refactorización chica del código de este mismo sitio y dividió el trabajo en tres hilos paralelos sin que yo tuviera que orquestar nada — todavía no lo probé en algo más grande, pero conceptualmente es lo que más curiosidad me da seguir rompiendo.
Cómo lo probé en concreto
Nada sofisticado: apunté Terra a tickets reales de mi propio backlog — un par de features chicas, una refactorización, algo de pegamento aburrido — y comparé cómo se sintió contra lo que usaba antes. Corrí Luna en las cosas descartables que suelo pagar de más: mensajes de commit, resúmenes rápidos, borradores de copy. Y toqueteé Sol Ultra en una tarea deliberadamente enredada solo para ver el comportamiento de los subagentes en acción.
Nada de esto es un benchmark científico. Es solo yo, mi backlog real, y una semana prestando atención a qué se sintió distinto.
Mi configuración práctica de Codex para gastar menos tokens
Esta es la configuración base que estoy probando en ~/.codex/config.toml:
model = "gpt-5.6-sol"
model_reasoning_effort = "medium"
model_verbosity = "low"
personality = "pragmatic"No es un botón mágico de "modo barato". Es un punto de partida sensato: la guía de modelos de Codex describe Sol con razonamiento medium como el equilibrio predeterminado, low acorta la respuesta final y pragmatic es una personalidad soportada por el esquema oficial de configuración. Mantengo Sol en el hilo principal porque la planificación, los trade-offs y la validación final son donde el modelo más fuerte justifica su costo. Para una tarea muy acotada, primero bajo el nivel de razonamiento antes de cambiar cualquier otra cosa.
Si manejás subagentes, mi patrón para cuidar el consumo es Sol como arquitecto y Terra como workers:
- Sol lee los requisitos, define el plan, reparte tareas acotadas, reconcilia resultados y hace la revisión final.
- Terra se encarga de exploración, lecturas grandes, implementaciones directas y verificaciones específicas.
- Luna encaja en transformaciones repetitivas, extracción, clasificación, resúmenes cortos y cualquier trabajo con una definición de terminado muy clara.
Esto es una estrategia de enrutamiento, no una garantía de que siempre vaya a salir más barato. La guía oficial de subagentes advierte que cada subagente hace su propio trabajo de modelo y herramientas, así que el paralelismo puede gastar más tokens que un solo agente. Solo divido trabajo que sea realmente independiente, mantengo agents.max_depth en su valor predeterminado de 1, limito la concurrencia y pido a los workers conclusiones resumidas en vez de logs completos.
Otras cosas que me han servido:
- Usá el menor esfuerzo de razonamiento que todavía resuelva bien la tarea. Medium es un buen default; low alcanza para muchas tareas bien delimitadas, mientras que Max y Ultra son herramientas costosas para los pocos problemas que las justifican.
- Mantené
AGENTS.mdcorto y local. Codex incluye esas instrucciones dentro del contexto.project_doc_max_bytespermite limitar cuánto lee, pero unas instrucciones breves y específicas son más seguras que truncar a ciegas un archivo enorme. - Dale al agente un objetivo acotado. Indicá archivos, restricciones, criterios de aceptación y la verificación mínima relevante. Menos exploración significa menos rotación de contexto.
- No pegues logs gigantes en el hilo principal. Dejá que un worker los analice y devuelva solo las líneas importantes junto con una conclusión corta.
- Si usás la API, diseñá pensando en cache. Poné las instrucciones y herramientas estables al principio, los datos variables al final, reutilizá un
prompt_cache_keyy medícached_tokensjunto concache_write_tokens. GPT-5.6 cobra las escrituras de cache, así que las lecturas repetidas tienen que justificar ese costo. - Medí en vez de adivinar. El endpoint oficial para contar tokens acepta los mismos mensajes, herramientas, imágenes y archivos de una petición Responses, así que podés estimar el input real antes de gastarlo.
- Compactá los agentes de larga duración. La compactación de Responses API conserva el estado útil usando un contexto más pequeño. En pasos predecibles con muchas herramientas, Programmatic Tool Calling puede filtrar resultados grandes en código y devolver al modelo solo la salida estructurada necesaria.
La regla útil es simple: pagá el razonamiento caro en los puntos de decisión y mandá la ejecución acotada al modelo más barato que pueda terminarla de forma confiable.
Dónde quedo después de una semana
No voy a pretender que ya le puse a GPT-5.6 por todos sus recorridos. No lo hice. Lo que sí hice es armar un plan:
- Terra se va a volver mi default para trabajo real de proyectos — la relación precio-calidad es demasiado buena como para ignorarla.
- Luna se hace cargo de todas las tareas descartables que antes pagaba de más.
- Sol Ultra es mi madriguera de conejo del fin de semana — quiero ver si los subagentes nativos de verdad superan mis setups armados a mano en algo más grande.
OpenAI está lanzando más o menos cada siete semanas ahora, así que probablemente escriba otra de estas antes de darme cuenta. Más apenas rompa algo — ahí es cuando suele empezar la reseña de verdad.
Fuentes y referencias
- OpenAI: anuncio de GPT-5.6
- Codex: selección de modelos y nivel de razonamiento
- Referencia de configuración de Codex
- Configuración avanzada de Codex
- Subagentes y selección de modelos en Codex
- Guía de prompt caching de OpenAI
- Guía para contar tokens de OpenAI
- Guía de compactación de OpenAI
Escrito la semana de julio de 2026, justo después del lanzamiento público de GPT-5.6. Todo acá es una impresión de los primeros días de mis propias pruebas — voy a actualizar a medida que le meta más kilómetros.