Retiro de Gemini 2.5 en Vertex AI: lo que se rompe y cómo prepararse (con nuestro inventario real)

Gemini 2.5 se retira de Vertex AI el 20 de octubre de 2026. Fechas oficiales, nuestro inventario real de llamadas y el checklist para migrar sin sorpresas.

Carlos Betancur Gálvez

Por Carlos Betancur Gálvez

Consultor en IA, marketing digital y marketing médico · btodigital

El 20 de octubre de 2026 es la fecha de retiro de Gemini 2.5 Pro, Flash y Flash-Lite en Vertex AI, según la documentación oficial de Google Cloud que consulté el 4 de octubre. Cuando revisé los proyectos que operamos en btodigital encontré siete con llamadas activas a esos modelos, tres que quedarán bloqueados y código que todavía apunta a modelos que ya no existen.

Este artículo es para ti si eres CTO, diriges una agencia o tu empresa tiene en producción algo que llama a Gemini desde Google Cloud: un agente de WhatsApp, un generador de informes, un clasificador de correos. Te llevas las fechas verificadas, nuestro inventario real (con cifras, sin nombres de clientes) y un checklist para ejecutar esta semana.

¿Qué fechas son oficiales y cuáles no?

Aquí hay una trampa, y yo caí en ella.

El 15 de septiembre Google Cloud nos envió un correo con este calendario: el 20 de octubre quedarían bloqueados los proyectos que no hubieran llamado a esos modelos entre el 22 de julio y el 20 de octubre; los proyectos activos seguirían funcionando; el 28 de enero de 2027 se apagaría Flash-Lite y el 31 de marzo de 2027, Flash y Pro. Con ese calendario armé el inventario y así quedó en mis notas.

La página pública de versiones y ciclo de vida de modelos, actualizada el 2 de octubre de 2026, dice otra cosa: una sola fecha de retiro, el 20 de octubre de 2026, para los tres modelos. No menciona enero ni marzo. Y en abril, las notas de versión habían anunciado el 16 de octubre. La fecha ya se movió una vez.

Mi posición: planea con el 20 de octubre. La documentación es lo que Google publica para todos, y aclara que los plazos pueden extenderse, pero nunca adelantarse. El margen del correo puede existir; yo no le apostaría la operación de un cliente.

ModeloRetiro en Vertex AI (documentación oficial)Reemplazo que sugiere GoogleEn la API de Gemini (AI Studio)
gemini-2.5-pro20-oct-2026gemini-3.8-flash o gemini-3.5-flashSin fecha de apagado; solo para quien ya lo usaba
gemini-2.5-flash20-oct-2026gemini-3.8-flash, 3.5-flash-lite o 3.1-flash-liteSin fecha de apagado; solo para quien ya lo usaba
gemini-2.5-flash-lite20-oct-2026gemini-3.8-flash, 3.1-flash-lite o Gemma 4Sin fecha de apagado; solo para quien ya lo usaba
gemini-2.5-flash-image15-mar-2027gemini-3.1-flash-lite-imageApagado el 2-oct-2026
gemini-2.0-flashRetirado el 1-jun-2026gemini-3.1-flash-liteApagado el 1-jun-2026

Fuentes: página «Model versions and lifecycle» de Google Cloud (actualizada el 2-oct-2026) y página «Gemini deprecations» de la API de Gemini (actualizada el 1-oct-2026). Ambas consultadas el 4 de octubre de 2026. Vertex AI aparece ahora en esa documentación como Gemini Enterprise Agent Platform: es el mismo servicio con otro nombre.

Fíjate en la última columna: el mismo modelo tiene dos calendarios según cómo lo llames. Por Vertex AI, Gemini 2.5 Flash se retira el 20 de octubre; por la API de Gemini con clave de AI Studio no tiene fecha de apagado, aunque el acceso quedó restringido a quienes ya lo usaban. Con el modelo de imágenes pasa al revés. Si usas las dos vías, necesitas dos inventarios.

¿Qué encontramos en nuestro propio inventario?

Lo medí el 3 de octubre de 2026 con Cloud Monitoring: invocaciones de cada modelo por proyecto desde el 22 de julio, la ventana con la que Google decide si un proyecto está activo.

Proyecto (anónimo)ModeloLlamadas medidasQué implica
Un producto SaaS de agentes de WhatsApp2.5 Flash~40.000 desde el 22-julMigrar primero: atiende clientes en vivo
Un medio digital de noticias2.5 Flash~15.000 desde el 22-julUsa thinkingBudget: 0, que cambia en Gemini 3
El tablero comercial y el bot de una clínica2.5 Flash~10.000 desde el 22-julTiene código que llama a 2.5 Pro, sin uso desde julio
Un directorio médico2.5 Flash~3.500 desde el 22-julMigración sencilla
El entorno de pruebas de un cliente2.5 Flash-Lite~30.000 al mesEra el más urgente en el calendario del correo
Un cotizador industrial2.5 FlashActivo (no lo cuantifiqué)Migrar con pruebas de regresión
Un proyecto de pruebas internas2.5 Flash20Decidir si sigue vivo
Tres proyectos sin llamadas desde el 31-jul2.5 Flash0Quedan bloqueados el 20 de octubre

Tres cosas me sorprendieron.

Un entorno de pruebas con más tráfico que varias producciones. Treinta mil llamadas al mes en un ambiente que nadie mira como crítico.

Código que llama a un modelo que el proyecto ya no podrá usar. Gemini 2.5 Pro tuvo una sola llamada en todo el periodo (el 25 de agosto, en el producto de WhatsApp). En otros dos proyectos, cero llamadas desde el 22 de julio. Pero en uno de ellos hay una función que lo invoca por su nombre. Esa función va a fallar el día en que alguien la necesite.

Código muerto que apunta a modelos apagados. En el motor de búsqueda de un proyecto encontré referencias a gemini-2.5-pro-preview-05-06 y a gemini-2.0-flash-001. Los dos ya están fuera de servicio. Nadie lo había notado porque ese camino casi nunca se ejecuta.

¿Qué se rompe exactamente al cambiar de modelo?

Cambiar el nombre del modelo es una línea de código. Lo que se rompe está alrededor, según la guía oficial de migración de Google:

  • El control del razonamiento cambia de forma. En Gemini 3 el parámetro numérico thinking_budget queda desaconsejado y se reemplaza por thinking_level, que acepta niveles (minimal, low, medium, high). No hay un cero exacto. Dos de nuestros proyectos tienen el razonamiento apagado a propósito con thinkingBudget: 0; al migrar hay que medir cuánto piensa el nivel más bajo.
  • El nivel por defecto no es el mínimo. En Gemini 3.5 Flash el esfuerzo de razonamiento por defecto es medio. Si no lo configuras, pagas razonamiento que quizá tu tarea no necesita.
  • Temperatura, top_p y top_k quedan desaconsejados en toda la familia 3.x. Si tu sistema dependía de temperatura 0 para respuestas estables, Google recomienda lograrlo con instrucciones de sistema explícitas.
  • Las firmas de pensamiento ahora son obligatorias en conversaciones de varios turnos: si faltan, el modelo devuelve un error en lugar de una advertencia. El tablero de la clínica ya reenvía las partes completas de la respuesta, así que ahí no hay riesgo.
  • Las llamadas a funciones exigen coincidencia estricta. Cada respuesta de función debe incluir el id de la llamada que responde. Si no, el modelo tiende a devolver respuestas vacías sin dar error.
  • El conteo de tokens puede subir. Google advierte que ahora cuenta completos los esquemas de respuesta y las llamadas a funciones, que antes se contaban de menos. Tu factura puede crecer sin que cambie tu código.

Lo del razonamiento no es un detalle. En uno de nuestros productos medí 1.955 tokens de pensamiento contra 505 de respuesta útil por llamada. Ese pensamiento se cobra como salida y no aparece en la respuesta.

Lo que aprendimos

El razonamiento puede comerse el límite de salida. Si una llamada tiene el razonamiento activo y un límite de tokens de salida ajustado, el modelo lo gasta pensando antes de escribir la respuesta. Llega un JSON vacío o cortado a la mitad, el código no puede leerlo y cae en un mensaje o documento de respaldo. No queda ningún error en los registros: el resultado parece una respuesta normal, solo que equivocada. La lección para esta migración: revisa todas las llamadas, no solo la principal. En cada una, confirma cómo queda el razonamiento y si el límite de salida alcanza.

Las referencias a modelos apagados solo aparecen si las buscas. Al hacer el inventario vi que gemini-2.0-flash, apagado el 1 de junio, seguía referenciado en cinco proyectos, y que gemini-2.5-flash-image, apagado el 2 de octubre en AI Studio, aparecía en cuatro. Lo descubrimos a mano, no con un sistema que lo vigilara.

Mis propias notas tenían la fecha equivocada. Anoté el calendario del correo y lo traté como oficial. Si no hubiera ido a la documentación antes de escribir este artículo, le habría dicho a más de un cliente que tenía hasta marzo.

¿Cómo prepararte esta semana?

  1. Inventario de llamadas por proyecto. En Cloud Monitoring, consulta la métrica de invocaciones de modelos agrupada por modelo y por proyecto, desde el 22 de julio.
  2. Inventario en el código. Busca la cadena gemini- en el código, las variables de entorno, la configuración guardada en base de datos y los scripts sueltos. Incluye el código que crees muerto.
  3. Separa Vertex AI de la API de Gemini. Marca cada llamada según la vía que usa: cuenta de Google Cloud o clave de AI Studio. Tienen calendarios distintos.
  4. Elige el reemplazo por tarea, no por proyecto. Una clasificación corta y una conversación con un cliente no necesitan el mismo modelo, aunque vivan en el mismo servicio.
  5. Traduce los parámetros. thinking_budget pasa a thinking_level; quita temperatura, top_p y top_k; verifica firmas de pensamiento e id en las respuestas de función.
  6. Pruebas de regresión con casos reales. Arma un lote de 30 a 50 entradas reales y anonimizadas por tarea, con la salida que hoy consideras correcta. Compara: JSON válido, límites de longitud, tildes, respuestas vacías, motivo de finalización y tiempo de respuesta.
  7. Mide el pensamiento antes de pasar a producción. Lee usageMetadata.thoughtsTokenCount en llamadas de prueba con el modelo viejo y el nuevo. En tareas de formato, empieza por el nivel más bajo.
  8. Monitoreo de costo durante 72 horas. En la consola de facturación, agrupa por SKU y por proyecto, y revisa el gasto diario después del cambio. El conteo de tokens puede subir aunque no cambies nada más.
  9. El nombre del modelo en configuración, no en el código. Revertir debe ser cambiar una variable.
  10. Decide qué hacer con los proyectos inactivos. Si nadie los usa, apágalos. Si alguien los va a necesitar, migra directo a Gemini 3.

El orden en que lo haría: primero lo que atiende personas en vivo, como los agentes de WhatsApp; después lo que tiene volumen alto aunque parezca secundario, como ese entorno de pruebas; luego el código que invoca modelos sin uso reciente; y al final los proyectos inactivos, que son una decisión de negocio más que técnica.

Si tu agente de WhatsApp corre sobre Gemini, en esta guía sobre agentes de IA para WhatsApp explico cómo funcionan y qué conviene decidir antes de ponerlos frente a tus clientes. Y si quieres ver con qué otras herramientas trabajo a diario, están en las herramientas de IA que uso todos los días.

Preguntas frecuentes

¿Cuándo se retira Gemini 2.5 Flash en Vertex AI? Según la documentación oficial de Google Cloud, consultada el 4 de octubre de 2026, el 20 de octubre de 2026. La misma fecha aplica a Gemini 2.5 Pro y 2.5 Flash-Lite. Algunos clientes recibieron un correo que menciona apagados en enero y marzo de 2027 para proyectos activos, pero esa extensión no aparece en la página pública.

¿Mi proyecto deja de funcionar el 20 de octubre? Si no llamó a Gemini 2.5 entre el 22 de julio y el 20 de octubre, según el aviso de Google queda bloqueado. Si estaba activo, el correo indica que sigue funcionando por un tiempo, pero yo planearía como si la fecha fuera el 20 de octubre, que es lo que dice la documentación.

¿Afecta igual si uso la API de Gemini con clave de AI Studio? No. En la API de Gemini, la versión 2.5 Flash no tiene fecha de apagado anunciada, aunque el acceso quedó limitado a quienes ya la usaban. Son calendarios distintos para el mismo modelo, por eso conviene inventariar por separado.

¿A qué modelo debo migrar? Google sugiere gemini-3.8-flash o gemini-3.5-flash para reemplazar 2.5 Pro y 2.5 Flash, y gemini-3.1-flash-lite para Flash-Lite. Mi recomendación es decidir por tarea y con pruebas sobre tus propios casos reales, no por la tabla.

¿Qué pasa con thinkingBudget: 0 en Gemini 3? El parámetro numérico queda desaconsejado y se reemplaza por niveles de razonamiento. No existe un cero exacto, así que hay que medir cuántos tokens de pensamiento consume el nivel más bajo en tu tarea antes de pasar a producción.

¿Cuánto tiempo toma migrar? Depende de cuántas llamadas tengas y de qué tan dispersas estén. Lo lento no es cambiar el modelo, sino armar las pruebas de regresión con casos reales: empieza por ahí.

Si prefieres hacer el inventario y la migración con nosotros, así trabajo como consultor de inteligencia artificial.

Compartir
Lecturas relacionadas