Vercel anunció que Gemini 3.8 Flash ya está disponible en AI Gateway, con 50% de descuento hasta el 31 de diciembre. El modelo tiene una ventana de contexto de 1M de tokens, acepta texto, imagen, PDF y video, devuelve texto, soporta tool calling y búsqueda web, y llega hasta 65.536 tokens de salida. El mismo día, Google presentó el modelo y su variante Cyber en el blog de DeepMind y en el blog de Google.
Por qué importa
El dato que más me interesa no está en la ficha técnica. Como marca Hipertextual, no pasaron ni tres semanas desde Gemini 3.7 Flash. Ese es el titular real: el ciclo de reemplazo de un modelo de gama media ya se mide en semanas, no en trimestres.
Si tu aplicación tiene un string con el nombre del modelo hardcodeado en algún lado, ese string es ahora una dependencia volátil. No en el sentido de que se rompa, sino en el sentido de que envejece más rápido de lo que dura un sprint. La consecuencia práctica es que la decisión de arquitectura dejó de ser "qué modelo elijo" y pasó a ser "cuánto me cuesta cambiar de modelo". Un gateway es exactamente eso: una capa de indirección para que ese costo tienda a cero.
El segundo detalle que vale leer con atención: Vercel aclara que AI Gateway refleja el precio del proveedor sin markup y no cobra fee de plataforma sobre la inferencia, incluso en requests con clave propia (BYOK). Eso convierte al gateway en una capa de enrutamiento y no en un intermediario que se lleva un porcentaje. Es la diferencia entre una abstracción que te conviene y un peaje.
Qué cambia en la práctica
Para usar el modelo, según el changelog, alcanza con apuntar el identificador:
model: 'google/gemini-3.8-flash'Y para conectarlo a un agente de código —Claude Code, OpenCode, Cursor, Pi y otros— el flujo documentado es la guía de coding agents y el comando de setup del gateway:
vercel ai-gateway coding-agents setupLo relevante es que el anuncio dice que 3.8 Flash mejora sobre los Flash anteriores en ingeniería de software, trabajo agéntico y razonamiento multi-paso a la misma velocidad y el mismo costo que la versión previa. Si eso se sostiene con tu carga real, es una de las pocas mejoras que no obligan a renegociar presupuesto: cambiás el identificador, medís, y decidís.
Ahora, "medís" no es una formalidad. Esta es la tabla que armaría antes de mover nada a producción:
| Dimensión | Anuncio | Qué medir |
|---|---|---|
| Contexto | Ventana de 1M tokens | Recuperación real a mitad de ventana con tus propios documentos |
| Salida | Máximo 65.536 tokens | Si tus generaciones largas entran sin truncarse |
| Razonamiento | Thinking activo por defecto | Tokens de pensamiento por request sobre tráfico real |
| Costo | Igual al modelo anterior, 50% off hasta el 31/12 | Costo por tarea terminada, no por token |
| Agentes | Mejor en software y multi-paso | Tareas cerradas sin intervención humana en tu repo |
| Entradas | Texto, imagen, PDF y video | Si tu pipeline ya normaliza esos formatos o los tenés que construir |
El renglón del costo es el que más gente ignora. Un modelo que piensa por defecto y que, según Google, gasta más tokens cuando le subís el nivel de esfuerzo, no tiene un costo fijo por request: tiene una distribución. Comparar precios por millón de tokens entre un modelo con thinking y uno sin thinking es comparar cosas distintas.
Cuándo NO usarlo
Hay tres situaciones donde yo esperaría.
- Si necesitás latencia predecible en el percentil 99. Thinking activado por defecto significa que el modelo decide cuánto razonar. Para un endpoint sincrónico con SLA, esa varianza es un problema de producto, no de infraestructura. Autocompletado, validaciones inline y cualquier cosa detrás de un spinner corto no son el caso de uso.
- Si tu evidencia son los benchmarks del proveedor. Las pruebas que se mencionan —DeepSWE v1.1, Vals Finance Agent V2, el benchmark legal de Harvey— vienen de la comunicación de Google. No tengo números independientes en el material y no los voy a inventar. Un benchmark publicado por quien vende el modelo es una hipótesis, no un resultado.
- Si el descuento es tu razón principal para migrar. El 50% vence el 31 de diciembre. Cualquier caso de negocio que solo cierre con ese descuento aplicado tiene fecha de vencimiento incorporada. Corré los números al precio de lista antes de mover tráfico.
Agrego una advertencia honesta sobre lo que no sé: el material no incluye precios concretos por token, ni las condiciones de acceso a la variante Cyber, ni cifras de latencia. Si alguien te presenta esas cifras como parte de este anuncio, pediles la fuente.
Qué haría hoy
Lo pondría detrás del gateway como candidato, no como default. Concretamente: un set de veinte a treinta tareas reales de tu producto, corridas contra el modelo que ya usás y contra google/gemini-3.8-flash, midiendo costo por tarea completada y tasa de intervención humana. Dos días de trabajo, resultado defendible.
Y si de todo esto te llevás una sola cosa, que sea esta: la ventaja competitiva no es haber elegido el mejor modelo de septiembre. Es tener la infraestructura para cambiarlo en octubre sin tocar el dominio.