Google Gemini (cuya generación de imágenes utiliza Imagen 4) es, a agosto de 2025, una de las IA de generación de imágenes que más atención está recibiendo. Gracias a la combinación del modelo de generación de texto Gemini 2.5 (Pro / Flash) con el motor de generación de imágenes Imagen 4, es posible generar imágenes de alta calidad mediante una conversación natural.
En este artículo explicamos de forma integral, desde los conceptos básicos hasta el funcionamiento, el uso, los casos prácticos y los puntos de atención, contenido que los usuarios principiantes e intermedios pueden aplicar de inmediato en su trabajo.
Noticia:Lanzamiento del modelo con nombre en clave «nano banana», «Gemini 2.5 Flash Image Preview» – Una nueva evolución de la IA de generación de imágenes(27/8/2025)
¿Qué es la generación de imágenes de Gemini? Conceptos básicos
Descripción general de Google Gemini y el papel de Imagen 4
Google Gemini (cuya generación de imágenes utiliza Imagen 4) es un sistema de IA multimodal desarrollado por Google. Gemini 2.5 (Pro o Flash), encargado de la generación de texto, y Imagen 4, el motor dedicado a la generación de imágenes, trabajan de forma conjunta para generar imágenes de alta calidad a través de una conversación natural.
A fecha de agosto de 2025, Imagen 4 ha mejorado notablemente respecto a la anterior Imagen 3, especialmente en la calidad de generación de texto, logrando un avance considerable en la representación de caracteres dentro de las imágenes. Admite una resolución 2K de hasta 2048×2048 píxeles y ha logrado una velocidad hasta 10 veces mayor que la versión anterior.
Diferencias y ventajas frente a servicios de otras empresas
La mayor característica de la generación de imágenes de Gemini es su naturaleza conversacional e iterativa. Mientras que DALL-E 3 de ChatGPT o Midjourney generan la imagen con una sola instrucción, Gemini permite ajustar la imagen de forma progresiva a través de la conversación.
Como se menciona también en el siguiente artículo, Gemini permite generar imágenes muy naturales.
Comparación con los principales competidores:
| Servicio | Fortaleza | Escenario de aplicación |
|---|---|---|
| Gemini + Imagen 4 | Ajuste conversacional, compatibilidad con japonés, eficiencia de costos | Producción iterativa, uso empresarial |
| Midjourney | Calidad artística | Producción artística de alta calidad |
| ChatGPT (4o) | Precisión en el ámbito angloparlante | Integración con texto |
Límites y características del uso gratuito
El atractivo de la generación de imágenes de Gemini es que incluso los usuarios gratuitos pueden crear imágenes de alta calidad. La versión gratuita tiene un límite de usos diarios, aunque no se especifica un valor máximo concreto. Se considera un rango suficiente para el uso diario habitual, y si se alcanza el límite, basta con esperar un poco para volver a usarlo.
Cómo generar imágenes con Gemini
Uso básico
Inicia sesión con tu cuenta de Google
Accede a gemini.google.com desde tu navegador e inicia sesión con tu cuenta de Google.
Introduce el prompt

En la pantalla de chat que aparece tras iniciar sesión, escribe en el campo de texto la instrucción concreta para generar la imagen, en japonés.
Generación de la imagen
Haz clic en el botón de enviar. La IA generará una imagen original en cuestión de segundos o decenas de segundos.
Guardar la imagen

Haz clic en el botón «Descargar» que aparece debajo de la imagen generada para guardarla. En el caso de los smartphones, también puedes mantener pulsada la imagen para guardarla.
Consejos para crear prompts
Para generar imágenes eficaces, es importante describir con detalle. Por ejemplo:
Prompt
Una noche de festival de verano, una mujer japonesa con un colorido yukata mira hacia arriba unos grandes fuegos artificiales que se extienden por el cielo nocturno. Su cabello está recogido con esmero y el yukata tiene un estampado floral. Al fondo se alinean la orilla de un río y farolillos, mientras el cielo nocturno brilla con fuegos artificiales de colores. Estilo fotorrealista de alta resolución, con una descripción vívida y realista y una atmósfera cálida.
Prompt negativo
borroso, baja resolución, expresión facial poco natural, extremidades sobrantes, rostro deformado, yukata transparente, texto o marcas de agua, resplandor excesivo de luz
Lo interesante es que, según cómo se elabore el prompt, se pueden obtener desde imágenes simples hasta composiciones complejas.
Crear el prompt con ChatGPT
Para crear un prompt largo como el anterior, accede a ChatGPT y pídele que redacte el prompt como se muestra a continuación.
Ejemplo: «Crea un prompt en japonés para generar una imagen de “una mujer japonesa mirando fuegos artificiales”».
