Vercel sumó Hy4 Preview, el modelo de Tencent, a su AI Gateway. Es un Mixture-of-Experts open source de 770B parámetros totales con 49B activos por token y una ventana de contexto de 1M, apuntado a tareas de código de horizonte largo, análisis de documentos y razonamiento científico. El anuncio está en el changelog de Vercel, el modelo se liberó desde Tencent y Simon Willison ya lo cubrió.
Por qué importa
La noticia técnica es el modelo. La noticia estructural es otra: cambiar de proveedor de inferencia se convirtió en editar un string. Para usar Hy4 alcanza con poner tencent/hy4-preview en el campo model del AI SDK, y para engancharlo a un agente de código corrés vercel ai-gateway coding-agents setup y lo elegís desde Claude Code, Codex, OpenCode, Cursor o Pi.
Eso convierte al modelo en un parámetro de configuración, no en una decisión de arquitectura. Y ahí está la señal que a mí me interesa: si el costo de cambiar de modelo tiende a cero, el diferencial de tu producto deja de ser qué modelo usás. Pasa a ser cuán bien medís cuál te sirve. El equipo que sabe evaluar gana; el que elige por benchmark de anuncio, pierde plata sin enterarse.
Hay un segundo dato que no es marketing: Vercel dice que refleja el precio del proveedor sin markup y sin fee de plataforma sobre inferencia, incluso con Bring Your Own Key. Si eso se sostiene, el gateway compite por routing, observabilidad y failover, no por margen sobre tokens. Es un modelo de negocio más sano para quien integra.
Qué cambia en la práctica
Lo concreto para alguien que ya tiene una app con LLMs en producción:
- La capa de modelo se vuelve configuración, no código. Si todavía tenés el nombre del modelo hardcodeado en tres archivos distintos, este es el momento de sacarlo a una variable de entorno con un default explícito.
- Los MoE cambian la cuenta mental de costo. 770B totales con 49B activos por token significa que la calidad la aporta el tamaño total y el costo de inferencia lo aporta la fracción activa. No compares modelos por parámetros totales: comparás peras con manzanas.
- 1M de contexto habilita flujos que antes eran RAG obligatorio. Meter un repo entero o un corpus de documentos en la ventana deja de ser fantasía. Ojo: habilitar no es recomendar, y vuelvo sobre esto abajo.
- Necesitás un set de evaluación propio antes de tocar nada. Sin eso, cambiar de modelo es apostar.
La forma mínima de dejar esto listo es esta, y no lleva más de veinte minutos:
// config/models.ts
export const MODEL = process.env.LLM_MODEL ?? 'tencent/hy4-preview'
// Un solo lugar donde vive el nombre del modelo.
// Cambiar de proveedor = cambiar una env var, no un deploy de codigo.
Y después, lo que de verdad importa: un archivo de casos reales de tu dominio, con la salida esperada, corrido contra los dos o tres modelos candidatos. Veinte casos tuyos valen más que cualquier tabla comparativa publicada.
Cuándo NO usarlo
Acá va lo honesto, porque el anuncio no lo dice.
Es un preview. La palabra está en el nombre. Un preview puede cambiar de comportamiento, de tokenizer, de disponibilidad o de precio sin aviso útil. No lo pongas en la ruta crítica de un producto que factura, salvo que tengas failover configurado y probado hacia otro modelo.
No hay benchmarks en el material que tengo. El changelog describe capacidades y áreas objetivo, no resultados medidos. Cualquiera que hoy te diga que Hy4 rinde mejor o peor que su alternativa favorita está extrapolando. Yo no lo voy a hacer.
1M de contexto no es 1M de atención útil. Es la trampa más cara de esta generación de modelos. Que entren un millón de tokens no garantiza que el modelo razone igual de bien sobre el token 900.000 que sobre el 5.000. Antes de tirar tu pipeline de RAG a la basura, medí recuperación en posiciones intermedias con tus propios documentos. Y acordate del costo: llenar la ventana en cada request es una factura recurrente que un buen retrieval te evita.
Un gateway agrega un salto de red. Ganás routing, failover, reportes y presupuesto por API key. Pagás con latencia adicional y una dependencia más en tu diagrama. Si tu caso es una sola llamada a un solo proveedor con volumen bajo, la abstracción no se paga.
Open source no significa que puedas correrlo. Un MoE de 770B no entra en tu notebook ni en la instancia barata de tu cloud. Que los pesos sean abiertos es valioso a nivel ecosistema y auditoría, pero en lo operativo seguís consumiendo la API de alguien. No confundas licencia con soberanía de infraestructura.
Residencia de datos. Si trabajás con información regulada, sumar un proveedor nuevo es una conversación legal antes que técnica. Vercel menciona soporte de Zero Data Retention, pero eso se verifica leyendo los términos, no un changelog.
Qué haría hoy
Lo agregaría como candidato en mi harness de evaluación esta misma semana, sobre casos de contexto largo que hoy me duelen: análisis de documentos extensos y refactors que tocan muchos archivos. Mediría precisión, latencia y costo real por tarea completada, no por token.
A producción no va todavía. Un preview sin benchmarks públicos es un experimento con buena pinta, y los experimentos van detrás de un flag, con un modelo estable como fallback. Si en dos semanas los números de mi harness lo justifican, lo promuevo. Si no, ya gané algo igual: el harness queda hecho para el próximo anuncio, que va a llegar antes de lo que pensás.