OpenAI publicó GPT-6 Astra el 3 de septiembre y lo posicionó alrededor de uso de computadora, ingeniería de software, matemática y ciberseguridad. El detalle está en el system card y en el resumen de seguridad, donde la propia empresa dice que es su primer modelo en alcanzar el nivel Critical de capacidad en ciberseguridad dentro de su Preparedness Framework. El hilo de Hacker News pasó los 1900 puntos y los 1800 comentarios en menos de un día.

Por qué importa

La discusión pública se fue a los benchmarks, y ahí es donde menos señal hay. Las dos cosas que de verdad cambian tu trabajo están en la letra chica.

La primera es económica. El resumen de Latent Space lo describe como 2,5 veces más caro por token pero bastante más barato por tarea. Eso no es un ajuste de precios: es un cambio de unidad de medida. Si seguís presupuestando por millón de tokens, este modelo te va a parecer un despropósito. Si presupuestás por tarea terminada, puede salirte más barato que lo que ya tenés corriendo.

La segunda es de control. El mismo material de lanzamiento reporta mejor alineación junto con menor monitoreabilidad de la cadena de razonamiento. Es un tradeoff incómodo y poco habitual de ver escrito por el propio proveedor: el modelo se porta mejor, y a la vez leerle el razonamiento intermedio sirve menos para saber qué está haciendo. Sumado al nivel Critical en ciberseguridad, la conclusión es que la capacidad sube más rápido que nuestra capacidad de inspeccionarla.

Qué cambia en la práctica

Si trabajás todos los días con agentes, tres cosas se te mueven de lugar.

El costo deja de medirse donde lo venías midiendo. Necesitás instrumentar costo por tarea resuelta, no por llamada. Concretamente: un identificador de tarea que atraviese todos los turnos, tokens acumulados por tarea, y una definición binaria de éxito (tests en verde, PR que compila, ticket cerrado). Sin eso no podés comparar Astra contra tu modelo actual, y cualquier decisión que tomes va a ser por precio de lista.

La auditoría se mueve del razonamiento a los efectos. Si tu guardarraíl era leer el chain-of-thought para detectar desvíos, ese mecanismo pierde valor. Lo que queda es verificar lo observable: el diff que produce, los comandos que ejecuta, los archivos que toca, las llamadas de red que hace. Es menos elegante y más aburrido, pero no depende de que el modelo te cuente la verdad sobre sí mismo.

Los permisos pasan a ser diseño de arquitectura. Un modelo con capacidad ofensiva declarada como Critical corriendo con credenciales amplias en tu máquina no es una decisión de producto: es una decisión de seguridad, y conviene tomarla explícitamente.

DimensiónCómo lo veníamos haciendoLo que pide Astra
CostoPrecio por tokenCosto por tarea completada
AuditoríaLeer el razonamiento intermedioVerificar efectos observables
PermisosPrompt y contextoSandbox y credenciales acotadas
AdopciónProbar el día unoEsperar evals propios y acceso estable

Cuándo NO usarlo

Esta es la parte que no aparece en los hilos de celebración.

  • Cargas cortas y deterministas. Clasificación, extracción de campos, reescrituras breves. Ahí no hay tarea larga donde amortizar: pagás el token más caro y no recuperás nada del lado de la eficiencia por tarea.
  • Contextos con exigencia de trazabilidad. Si tenés que demostrarle a un auditor por qué el sistema hizo lo que hizo, una monitoreabilidad más baja del razonamiento es un problema regulatorio, no un detalle técnico. Hoy conviene quedarse donde la evidencia sea más legible.
  • Si necesitás disponibilidad predecible esta semana. El rollout fue escalonado y accidentado: demoras, acceso desparejo entre usuarios pagos y accesos tempranos, y compensaciones a los planes afectados. Prometerle a un cliente una fecha atada a este modelo hoy es asumir un riesgo que no controlás.
  • Si tu decisión se apoya solo en los benchmarks. Hay disputa activa: agregadores independientes y varios investigadores sostienen que las ganancias son grandes pero desparejas una vez que se consideran el costo y evaluaciones no elegidas a dedo. Los hilos sobre ARC-AGI-3 y sobre el Coding Agent Index siguen abiertos, y no hay todavía un veredicto independiente asentado.
  • Si no tenés sandbox. Sin aislamiento real, el nivel de capacidad declarado juega en tu contra, no a favor.

Qué haría hoy

No migraría nada por defecto. Armaría un experimento chico y honesto: diez o quince tareas reales de mi backlog, las mismas para el modelo que uso hoy y para Astra, midiendo costo total por tarea resuelta y cantidad de intervenciones humanas. Si el número por tarea baja de verdad, la migración se justifica sola y no hace falta discutir el precio por token con nadie.

En paralelo movería los asserts del razonamiento al resultado, porque ese cambio me sirve con cualquier modelo. Y esperaría dos semanas de evaluaciones independientes antes de poner esto en un flujo de producción con permisos amplios. La cobertura de Simon Willison es un buen lugar para seguir el hilo mientras tanto.

El lanzamiento es importante. La urgencia por adoptarlo el mismo día, mucho menos.