Gemini 3.5 Flash a 0.75 por millón: precios, casos de uso y cuándo no usarlo
Gemini 3.5 Flash cuesta 0.75 / 4.50 por millón de tokens tras el recorte. Dónde brilla, dónde decepciona y cómo lo encadeno con modelos grandes.
Escribí esto a comienzos de junio, recién salido Gemini 3.5 Flash, y se me quedó sin publicar. Lo actualicé con los precios y modelos que están vigentes hoy: Flash bajó a 0.75 / 4.50, Google sacó después Gemini 3.6 Flash y Flash-Lite, y las referencias de modelo grande ahora son Claude Opus 5 y Sonnet 5. El razonamiento de fondo, qué mandas al modelo barato y qué al grande, no cambió ni un poco.
El 19 de mayo Google soltó Gemini 3.5 Flash en GA. Lo más interesante no fue el modelo en sí, fue la jugada estratégica: Google necesitaba un modelo lo bastante barato como para mover volumen masivo dentro de sus propios productos, la app Gemini y AI Mode de Search. Cuando el modelo barato es el que aguanta el tráfico de todos, la economía del producto se decide ahí, no en el modelo estrella.
Yo lo llevo probando un par de semanas en mis propios flujos y la conclusión es clara: es rápido, barato y bueno para tareas concretas. Pero no es Claude Opus 5 ni Claude Sonnet 5. Si lo usas para todo, te vas a decepcionar y vas a culpar al modelo por algo que es culpa de cómo lo aplicas. Si lo usas donde brilla, te ahorra mucha plata.
Qué es Gemini 3.5 Flash y por qué se lanzó primero
Flash es el modelo barato y rápido de la familia Gemini. Está pensado para procesar volumen, no para razonar profundo. Google lo lanzó antes que Pro porque su prioridad real era poder empujar IA dentro de Search por defecto, y para eso necesitan un modelo que aguante miles de millones de queries al día sin quebrar la economía del producto.
Es el mismo patrón que Anthropic con Haiku y OpenAI con sus modelos chicos. Cada familia tiene un modelo rápido para tareas masivas y uno potente para tareas profundas. Lo importante es saber cuándo usar cuál. La mayoría usa el más potente todo el tiempo, y eso es exactamente lo que no debes hacer si te importa la factura o la velocidad.
Y el catálogo se mueve rápido. El 21 de julio Google puso en GA Gemini 3.6 Flash (1.50 de entrada y 7.50 de salida, con 17% menos tokens de salida, mejor en programación y en contexto largo) y Gemini 3.5 Flash-Lite a 0.30 / 2.50, que es el que apunta a Search. O sea que 3.5 Flash ya no es el Flash más nuevo de Google: quedó como el caballo de batalla barato, y de paso se ganó el recorte de precio del que te hablo abajo.
Los precios: 0.75 / 4.50 por millón de tokens
El precio oficial hoy es 0.75 dólares por millón de tokens de entrada y 4.50 por millón de salida, después de que Google le bajara cerca del 50% acompañando el lanzamiento de 3.6 Flash. Comparado con Claude Haiku 4.5 o GPT-5.6 Luna, está en la misma liga: muy barato. Y la presión va en una sola dirección, porque OpenAI recortó Luna un 80% el 30 de julio, de 1.00 / 6.00 a 0.20 / 1.20.
Para que tengas referencia, un correo de cliente promedio son unos 300 tokens. Mil correos procesados con Flash te cuestan centavos, no dólares. Y lo interesante no es el precio en sí, es lo que te permite hacer: a 0.75 por millón puedes correr clasificaciones masivas, etiquetado automático, resúmenes ligeros y procesar todo tu inbox sin pensar dos veces en el costo. Eso cambia los flujos posibles. Antes eras avaro con cada llamada al modelo. Ahora puedes ser generoso.
Los 5 casos donde Flash es la mejor opción
Después de dos semanas de uso intenso, estos son los casos donde Flash me dio mejor relación calidad-precio que cualquier modelo grande. Ninguno requiere razonamiento profundo, solo ejecución rápida y consistente. Si tu tarea cae en alguno de estos, no pagues por algo más grande.
- Clasificación masiva: etiquetar miles de correos, mensajes o tickets por categoría y prioridad.
- Resúmenes ligeros: generar resúmenes de un párrafo de artículos, documentos o transcripciones cortas.
- Chatbots de soporte primer nivel: respuestas a preguntas frecuentes con un contexto claro.
- Etiquetado de contenido: categorizar publicaciones de redes, productos de catálogo o imágenes con metadatos.
- Extracciones simples: sacar nombres, fechas, montos o emails de documentos sin formato.
Los 3 casos donde Flash te va a decepcionar
No te voy a vender que es magia. Flash tiene techos claros y los choca rápido cuando le pides cosas que requieren pensar. Si te pones a probarlo en estos casos, vas a regresar a Opus 5 o a GPT-5 con razón. Y vas a quedarte con la sensación de que Gemini no sirve, cuando en realidad estabas usando el modelo equivocado.
El primer caso donde falla es razonamiento de varios pasos. Si la tarea requiere encadenar lógica, evaluar opciones y descartar, Flash se pierde a la mitad o te da una respuesta plausible pero incorrecta. El segundo es código complejo, especialmente cuando hay que entender una base existente. El tercero es decisiones estratégicas, donde el modelo necesita atreverse a contradecirte. Flash es muy complaciente.
- Razonamiento multi-paso con ambigüedad real.
- Programación de mediana o alta complejidad.
- Decisiones estratégicas donde necesitas contradicción inteligente.
Cómo lo combino con modelos más grandes
El truco que más me ahorra plata es encadenar Flash con un modelo grande. Flash hace el trabajo sucio de volumen (filtrar, clasificar, extraer) y solo lo importante llega a Claude Opus 5 (5 / 25 por millón) o a Claude Sonnet 5 (2 / 10), según qué tan pesada sea la decisión. Ese patrón solo lo aprendes cuando ves la factura del mes y te das cuenta de que el 70% del gasto era procesar cosas que un modelo barato hace igual.
Un ejemplo real de mi flujo: tengo cien correos por procesar de un cliente nuevo. Flash clasifica los cien en urgente, info, ignorable y necesita decisión. Solo los 12 que dijeron necesita decisión van a Opus 5 con contexto extendido. El costo total del proceso es una fracción de lo que sería mandar todo al modelo grande. Y el resultado final es indistinguible.
Lo que cambió en mi factura este mes
Implementé este pipeline de dos niveles, Flash abajo y Claude arriba, en tres flujos de automatización que tengo corriendo. El resultado: mi gasto de API bajó un 62% manteniendo la misma calidad de output final. La diferencia se va al equipo, no a la factura de Google y Anthropic. Esa es la jugada que vale la pena planear.
Un aviso para que no pierdas la tarde: si estabas pensando en armar el escalón de arriba con Gemini 3.5 Pro, hoy no puedes. Pro sigue sin disponibilidad general, solo hay un preview limitado en Vertex AI. Por eso mi cadena termina en Claude y no en Gemini. El patrón es el mismo; lo que cambia es qué modelo grande tienes disponible de verdad para producción.
Mi opinión después de dos semanas
Flash no reemplaza nada. Suma. Si ya tienes un modelo grande funcionando, Flash te abre la puerta a procesar volumen que antes no procesabas porque era caro. Esa es la jugada inteligente. Si lo usas como reemplazo del modelo grande, te decepcionas con razón.
Si estás empezando y no tienes flujos a gran volumen, no es prioridad. Empieza con un modelo decente para tu trabajo principal y luego, cuando tengas el caso de uso de volumen, le agregas Flash al pipeline. No al revés. La complejidad antes del problema es lo que mata proyectos de IA en pymes.
A 0.75 por millón ya no hay excusa para no automatizar lo repetitivo. Lo importante es no caer en la trampa de pedirle todo a Flash porque es barato. Eso te sale más caro a la larga, en errores y en tiempo de revisión.
Wilmer Hurtado
Consultor de Marketing & IA · Miami, FL
Más de 30 años de experiencia en Marketing, de los cuales 23 años en el mercado de los Estados Unidos. Ayudo a emprendedores, profesionales y empresas a crecer usando marketing digital e inteligencia artificial. Growth Hacker, Paid Media specialist y Productor Multimedia.
Próximo Taller
Taller de 6 horas de Claude Cowork
Taller en vivo de 6 horas (2 sesiones × 3h en Zoom). Aprende a usar Claude Cowork para producir contenido, reportes, contenido y automatizaciones reales. Sin saber programar.
Ver detalles del taller →