Un prompt de imagen para Gemini es la descripción, en frases completas, de la imagen que quieres: qué aparece, dónde está, con qué luz, desde qué ángulo y para qué la vas a usar. Nano Banana es el nombre que Google da a la generación de imágenes de Gemini, y sus modelos entienden mejor una escena contada que una lista de palabras sueltas separadas por comas.
Puedes escribir en español. La documentación de Google incluye el español (código es-MX) en la lista de idiomas con mejor rendimiento, junto con el inglés y otros trece, a 1 de octubre de 2026. No publica ninguna comparación de calidad entre idiomas, así que no hay motivo documentado para traducir tus prompts al inglés.
Si solo vas a copiar una cosa, que sea esta estructura. Sirve para casi cualquier imagen nueva:
hljs textCrea una imagen de [sujeto, con sus detalles] en [lugar y momento]. [Cómo es la luz]. [Encuadre y ángulo de cámara]. [Estilo: fotografía, ilustración, acuarela…]. La imagen es para [uso: ficha de producto, portada, cartel…].
Las plantillas siguientes adaptan al español la estructura de las que Google publica en inglés, una o más por cada una de sus catorce estrategias: siete para generar y siete para editar. Sustituye lo que va entre corchetes y borra lo que no necesites.
Plantillas para generar imágenes desde cero
1. Escena fotorrealista
Cuanto más concreta sea la escena, más control tienes sobre el resultado. Nombra el tipo de plano y el objetivo como lo haría un fotógrafo.
hljs textCrea una fotografía realista, [tipo de plano], de [sujeto con detalles] en [entorno]. [Descripción de la luz]. Tomada desde [ángulo de cámara] con [tipo de objetivo].
Ejemplo:
hljs textCrea una fotografía realista, plano medio, de un ceramista de unos sesenta años que modela un cuenco en su torno, en un taller pequeño con estanterías llenas de piezas sin esmaltar. Luz natural de tarde que entra por una ventana lateral y marca la textura del barro. Tomada a la altura de las manos con un objetivo de 50 mm y poca profundidad de campo.
2. Ilustración o sticker
Di el estilo, el sujeto y los rasgos visuales (líneas, sombreado, paleta). Pedir el fondo de forma explícita evita sorpresas al recortar.
hljs textCrea [un sticker / una ilustración] de estilo [estilo] de [sujeto, con accesorios o gesto] [haciendo algo]. El diseño tiene [contornos, sombreado, textura] y [paleta de colores]. El fondo es [color].
Ejemplo:
hljs textCrea un sticker de estilo kawaii de un gato naranja con una bufanda verde que sostiene una taza de chocolate caliente. El diseño tiene contornos gruesos y limpios, sombreado plano y una paleta cálida. El fondo es blanco.
3. Texto dentro de la imagen
Escribe el texto exacto entre comillas, describe la tipografía con palabras («sans serif gruesa», «manuscrita fina») y explica el diseño general. Google recomienda Nano Banana Pro para piezas profesionales con texto.
hljs textCrea [tipo de pieza: logotipo, cartel, etiqueta] para [marca o concepto] con el texto "[texto exacto]" en [estilo de tipografía]. El diseño es [descripción del estilo], con [combinación de colores].
Ejemplo:
hljs textCrea un logotipo moderno y minimalista para una panadería de barrio llamada "Miga y Corteza". El texto va en una tipografía sans serif gruesa y limpia. El diseño es sencillo, en negro sobre blanco, dentro de un círculo, con una espiga de trigo integrada en la letra M.
Según las limitaciones que publica Google, Gemini rinde mejor si primero generas el texto y después pides la imagen con ese texto. En la práctica: pide el eslogan o los titulares en un mensaje, corrígelos, y en el siguiente mensaje pide la pieza con el texto ya cerrado.
4. Foto de producto para tienda o anuncio
Es la plantilla más útil si vendes en línea. Describe el producto, la superficie, el esquema de luz y qué detalle debe quedar nítido.
hljs textCrea una fotografía de producto en alta resolución, con luz de estudio, de [producto con material y color] sobre [superficie o fondo]. La iluminación es [esquema de luz] para [efecto que buscas]. El ángulo de cámara es [ángulo] para mostrar [característica]. Ultrarrealista, con el foco nítido en [detalle clave]. Formato [cuadrado / vertical / horizontal].
Ejemplo:
hljs textCrea una fotografía de producto en alta resolución, con luz de estudio, de una botella de aceite de oliva de vidrio verde oscuro con etiqueta de papel crema, sobre una tabla de madera de olivo. La iluminación es de tres puntos con ventanas de luz suave para conseguir reflejos difusos y sombras tenues. El ángulo de cámara es ligeramente elevado, a 45 grados, para mostrar la forma de la botella y la etiqueta. Ultrarrealista, con el foco nítido en la etiqueta. Formato cuadrado.
Variante para catálogo, cuando necesitas el producto aislado:
hljs textCrea una fotografía de producto de [producto] centrado sobre un fondo blanco liso, con una sombra suave bajo la base. Luz uniforme y sin reflejos duros. Vista [frontal / de tres cuartos]. El producto ocupa la mayor parte del encuadre.
5. Composición minimalista con espacio en blanco
Pensada para fondos de web, diapositivas o carteles sobre los que luego vas a escribir. Di en qué esquina va el sujeto y deja claro que el resto queda vacío.
hljs textCrea una composición minimalista con [un único sujeto] situado en [la esquina inferior derecha / la parte superior izquierda…] del encuadre. El fondo es una superficie amplia y vacía de color [color], con mucho espacio libre para texto. Luz suave y sutil. Formato [relación de aspecto].
6. Viñetas y storyboard
Sirve para cómics cortos y guiones gráficos. Google indica que estos prompts funcionan mejor con Nano Banana Pro y Nano Banana 2.
hljs textCrea un cómic de [número] viñetas en estilo [estilo y técnica]. El personaje es [descripción o «el de la imagen adjunta»]. Viñeta 1: [qué pasa]. Viñeta 2: [qué pasa]. Viñeta 3: [qué pasa].
Ejemplo:
hljs textCrea un cómic de 3 viñetas en estilo de línea clara con colores planos. El personaje es un perro salchicha con un pañuelo rojo. Viñeta 1: mira una pelota bajo el sofá. Viñeta 2: estira la pata y no llega. Viñeta 3: aparece cubierto de pelusas con la pelota en la boca.
7. Imágenes con datos actuales
Google llama a esta estrategia Grounding with Google Search: el modelo consulta la Búsqueda de Google y dibuja con información reciente, como el tiempo, un resultado deportivo o una noticia. Google solo publica un prompt de ejemplo para este caso; la plantilla es una adaptación.
hljs textCrea un gráfico sencillo y elegante con [dato actual: la previsión del tiempo de los próximos cinco días en Valencia]. Usa [estilo visual] e incluye [qué cifras o textos deben aparecer].
En la API la búsqueda no se activa sola: hay que añadir la herramienta google_search a la petición. Con Nano Banana 2, la búsqueda no utiliza imágenes reales de personas encontradas en la web.
Plantillas para editar una foto o una imagen de referencia
En todas estas plantillas adjuntas una o varias imágenes junto al texto. Asegúrate de tener derechos sobre lo que subes; el uso está sujeto a la política de uso prohibido de Google.
8. Añadir o quitar elementos
El modelo ajusta el cambio al estilo, la luz y la perspectiva del original, pero conviene decirle cómo debe integrarse.
hljs textEn la imagen adjunta de [sujeto], [añade / quita / modifica] [elemento]. El cambio debe [cómo se integra: misma luz, misma perspectiva, sombra coherente].
Ejemplo:
hljs textEn la imagen adjunta de mi gato, añade un pequeño gorro de lana azul en su cabeza. El gorro debe parecer bien apoyado y recibir la misma luz suave que el resto de la foto.
9. Cambiar solo una parte
Es lo que Google denomina inpainting con máscara semántica: en lugar de pintar una máscara, dices con palabras qué zona cambia y pides que el resto se quede como está.
hljs textEn la imagen adjunta, cambia solo [elemento concreto] por [nuevo elemento o descripción]. Mantén todo lo demás exactamente igual: estilo, iluminación y composición.
Ejemplo:
hljs textEn la imagen adjunta de un salón, cambia solo el sofá azul por un sofá chéster de cuero marrón envejecido. Mantén igual el resto de la habitación, incluidos los cojines del sofá y la iluminación.
10. Transferencia de estilo
Pide que se conserve la composición y describe los rasgos del estilo, no solo su nombre.
hljs textTransforma la fotografía adjunta de [sujeto] al estilo de [corriente o técnica artística]. Conserva la composición original, pero represéntala con [rasgos del estilo: pincelada, paleta, textura].
Ejemplo:
hljs textTransforma la fotografía adjunta de una calle del casco antiguo al estilo de una acuarela de cuaderno de viaje. Conserva la composición original de fachadas y farolas, pero represéntala con manchas de color sueltas, contornos a tinta fina y papel visible en las zonas de luz.
11. Combinar varias imágenes
Numera las imágenes y di qué tomas de cada una. Es la forma más rápida de colocar un producto en un ambiente.
hljs textCrea una imagen nueva combinando los elementos de las imágenes adjuntas. Toma [elemento de la imagen 1] y colócalo [en / sobre / junto a] [elemento de la imagen 2]. La imagen final debe ser [descripción de la escena final].
Ejemplo:
hljs textCrea una imagen nueva combinando los elementos de las imágenes adjuntas. Toma la lámpara de pie de la primera imagen y colócala junto al sillón de la segunda imagen. La imagen final debe ser una foto realista del salón, con la lámpara encendida y las sombras ajustadas a la luz de la ventana.
12. Conservar un detalle sin tocarlo
Para que un logotipo, una etiqueta o un rostro no cambien durante la edición, descríbelos con detalle en el propio prompt además de adjuntarlos.
hljs textCon las imágenes adjuntas, coloca [elemento de la imagen 2] sobre [elemento de la imagen 1]. Los rasgos de [elemento de la imagen 1] deben quedar completamente iguales. El elemento añadido debe [cómo se integra].
Ejemplo:
hljs textCon las imágenes adjuntas, coloca el logotipo de la segunda imagen sobre la bolsa de tela de color crudo de la primera. La forma, las asas y las arrugas de la bolsa deben quedar completamente iguales. El logotipo debe parecer serigrafiado sobre la tela y seguir sus pliegues.
13. Del boceto a la imagen acabada
Sube un dibujo a mano y di qué conservar y qué materiales añadir.
hljs textConvierte este boceto a [lápiz / rotulador] de [sujeto] en [descripción del acabado final]. Conserva [rasgos del boceto] y añade [materiales, colores, detalles nuevos].
Ejemplo:
hljs textConvierte este boceto a lápiz de una silla de comedor en una foto de catálogo sobre fondo gris claro. Conserva las patas inclinadas y el respaldo curvo del boceto y añade madera de roble claro y un asiento tapizado en lino beige.
14. El mismo personaje desde varios ángulos
Google propone pedir las vistas una a una y volver a incluir las imágenes ya generadas en los prompts siguientes para mantener la coherencia. Para posturas complejas, añade una imagen de referencia de la postura.
hljs textRetrato de estudio de [personaje de la imagen adjunta] sobre fondo [color], [mirando al frente / de perfil mirando a la derecha / de tres cuartos / de espaldas].
Ejemplo, con la mascota ilustrada de una marca:
hljs textRetrato de estudio de la mascota de la imagen adjunta sobre fondo blanco, de perfil mirando a la derecha. Mismos colores, mismas proporciones y mismo pañuelo que en la imagen adjunta.
Si prefieres partir de prompts con el resultado a la vista, la biblioteca de prompts de YingTu muestra junto a cada uno la imagen real que produjo y el precio por imagen.
Seis hábitos que recomienda Google al escribir el prompt
- Sé muy concreto. En vez de «una armadura de fantasía», describe el metal, los grabados y la forma de las hombreras. Cada detalle que no escribes lo decide el modelo.
- Explica el contexto y el propósito. «Crea un logotipo para una marca de cosmética minimalista de gama alta» da mejor resultado que «crea un logotipo», porque el uso condiciona el estilo.
- Itera con cambios pequeños. No esperes la imagen perfecta a la primera. Sigue la conversación con frases como «está bien, pero haz la luz un poco más cálida» o «mantén todo igual y cambia el fondo a gris claro».
- Divide las escenas complejas en pasos. «Primero crea un fondo de bosque con niebla al amanecer. Después añade en primer plano un altar de piedra cubierto de musgo. Por último, coloca encima una espada que brilla».
- Describe en positivo lo que quieres ver. En lugar de «sin coches», escribe «una calle vacía y desierta, sin señales de tráfico». Describir la escena deseada funciona mejor que enumerar lo que sobra.
- Controla la cámara. Usa vocabulario de fotografía y cine: plano gran angular, plano macro, contrapicado, vista cenital.
A estos seis se suma un aviso de la documentación de Google Cloud: empieza con «Crea una imagen de…» o «Genera una imagen de…», porque de lo contrario un modelo multimodal puede contestar con texto en lugar de con una imagen.
Lo que el prompt no puede fijar
Hay cuatro cosas que no dependen de lo bien que escribas. Las fijan los parámetros de la petición o el modelo que elijas.
| Qué quieres controlar | Qué ocurre si solo lo escribes en el prompt | Qué lo fija de verdad (API de Gemini, a 1 de octubre de 2026) |
|---|---|---|
| Tamaño de salida | Escribir «4K» o «alta resolución» no cambia los píxeles: la salida es 1K por defecto | image_size dentro de response_format, con K mayúscula: 1K, 2K, 4K. En minúscula (1k) la petición se rechaza |
| Relación de aspecto | Por defecto la imagen copia el tamaño de la imagen de entrada; si no hay ninguna, sale 1:1 | aspect_ratio dentro de response_format, por ejemplo 16:9 o 9:16 |
| Número exacto de imágenes | El modelo no siempre devuelve la cantidad que pides | Ningún parámetro lo garantiza; lo fiable es pedir una imagen por petición y repetir |
| Cuántas imágenes de referencia respeta | Cada modelo mantiene con fidelidad un número limitado de objetos y personajes, pidas lo que pidas | El modelo elegido (tabla siguiente) |
Los tamaños disponibles también dependen del modelo. Nano Banana 2 Lite solo genera 1K. Nano Banana 2 ofrece 512 px, 1K, 2K y 4K; en 16:9 eso equivale a 1376 × 768 px en 1K, 2752 × 1536 px en 2K y 5504 × 3072 px en 4K. Nano Banana 2 admite catorce relaciones de aspecto, entre ellas 1:1, 4:5, 3:4, 2:3, 9:16, 16:9 y 21:9.
Las plantillas de Google incluyen la relación de aspecto dentro del texto («Formato cuadrado», «16:9»), y por eso aparece también en las plantillas de arriba. Si trabajas con la API, el parámetro es la vía segura.
Los modelos Gemini 3 de imagen admiten hasta 14 imágenes de referencia en una petición, repartidas así:
| Modelo | Objetos con alta fidelidad | Personajes con coherencia | Referencias de estilo |
|---|---|---|---|
| Nano Banana 2 Lite | Hasta 14 | No disponible | No disponible |
| Nano Banana 2 | Hasta 10 | Hasta 4 | No disponible |
| Nano Banana Pro | Hasta 6 | Hasta 5 | Hasta 3 |
Google añade que Nano Banana 2 Lite no está optimizado para varias imágenes de referencia ni para ediciones encadenadas en varios turnos. Y un quinto punto que tampoco se decide en el prompt: todas las imágenes generadas llevan la marca de agua SynthID.
Qué cambiar primero cuando la imagen sale mal
| Qué ves | Qué cambiar primero |
|---|---|
| Gemini contesta con texto y no genera nada | Empieza el prompt con «Crea una imagen de…». En la API, pide response_format de tipo image |
| Aparece justo lo que pediste que no apareciera | Quita el «sin X» y describe la escena tal como debe verse |
| El texto sale con erratas | Cierra primero el texto en un mensaje aparte, ponlo entre comillas, reduce su longitud y prueba con Nano Banana Pro |
| Al editar cambia toda la foto | Usa «cambia solo [elemento]» y «mantén todo lo demás exactamente igual» |
| El logotipo o el rostro quedan distintos | Describe ese detalle con precisión en el prompt y vuelve a adjuntar la imagen original |
| El personaje cambia entre imágenes | Incluye las imágenes ya generadas en el siguiente prompt y sigue en la misma conversación |
| Sale cuadrada y la querías horizontal | Fija aspect_ratio; sin él, el formato es 1:1 o el de la imagen de entrada |
| No es 4K | Fija image_size en 4K con un modelo que lo admita; el texto del prompt no lo decide |
| La composición es plana o genérica | Añade tipo de plano, ángulo y objetivo, y explica para qué es la imagen |
Cambia una sola cosa por intento. Google señala la conversación en varios turnos como la forma recomendada de iterar sobre una imagen, y así sabes qué ajuste produjo la mejora.
Cómo enviar estos prompts por la API
El ejemplo sigue la forma que Google documenta para la Interactions API en Python. El prompt va en input y el formato de salida va aparte, en response_format:
hljs pythonfrom google import genai
import base64
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.1-flash-image",
input=(
"Crea una fotografía de producto en alta resolución, con luz de estudio, "
"de una botella de aceite de oliva de vidrio verde oscuro sobre una tabla "
"de madera de olivo. Foco nítido en la etiqueta."
),
response_format={"type": "image", "aspect_ratio": "16:9", "image_size": "2K"},
)
with open("botella.png", "wb") as f:
f.write(base64.b64decode(interaction.output_image.data))
Para editar, input pasa a ser una lista con el texto y la imagen en base64:
hljs pythonwith open("salon.png", "rb") as f:
image_bytes = f.read()
edicion = client.interactions.create(
model="gemini-3.1-flash-image",
input=[
{"type": "text", "text": "En la imagen adjunta, cambia solo el sofá azul por "
"un sofá chéster de cuero marrón. Mantén todo lo demás igual."},
{"type": "image", "data": base64.b64encode(image_bytes).decode("utf-8"),
"mime_type": "image/png"},
],
response_format={"type": "image", "image_size": "2K"},
)
Para seguir retocando el resultado, envía el siguiente cambio con previous_interaction_id=edicion.id en lugar de volver a subir la imagen.
Los identificadores de modelo son gemini-3.1-flash-image (Nano Banana 2, el que Google recomienda como opción por defecto), gemini-3-pro-image (Nano Banana Pro) y gemini-3.1-flash-lite-image (Nano Banana 2 Lite). La página de precios de Google marca el modelo anterior, gemini-2.5-flash-image, como obsoleto con fecha de cierre el 2 de octubre de 2026: el código que todavía use ese identificador tiene que cambiar a uno de los tres actuales. Google aconseja pasar a Nano Banana 2 Lite.
Si generas muchas imágenes seguidas y recibes un 429, el límite es del proyecto, no del prompt: lo explica Gemini API 429 RESOURCE_EXHAUSTED: qué límite has superado.
Cuánto cuesta cada imagen en la API
Ninguno de los modelos de imagen tiene nivel gratuito en la API de Gemini. Los precios siguientes son los equivalentes por imagen de la página de precios de Google, a 1 de octubre de 2026, en dólares estadounidenses:
| Modelo y tamaño | Estándar, por imagen | Batch, por imagen |
|---|---|---|
| Nano Banana 2 Lite, 1K | 0,0336 $ | 0,0168 $ |
| Nano Banana 2, 512 px | 0,045 $ | 0,022 $ |
| Nano Banana 2, 1K | 0,067 $ | 0,034 $ |
| Nano Banana 2, 2K | 0,101 $ | 0,050 $ |
| Nano Banana 2, 4K | 0,151 $ | 0,076 $ |
| Nano Banana Pro, 1K o 2K | 0,134 $ | 0,067 $ |
| Nano Banana Pro, 4K | 0,24 $ | 0,12 $ |
Batch cuesta aproximadamente la mitad a cambio de esperar: los resultados llegan en un plazo de hasta 24 horas. Un ejemplo de cálculo: 200 fotos de catálogo en 2K con Nano Banana 2 son 200 × 0,101 $ = 20,20 $ en modo estándar y 200 × 0,050 $ = 10,00 $ en Batch.
Qué entra y qué no en la parte gratuita de la API está en Gemini API gratis: qué límites tiene y qué hacer al agotarlos. Para usar Nano Banana desde la app de Gemini, sin API, consulta Qué es Nano Banana: versiones, cómo usarlo y si es gratis.
Si no quieres crear un proyecto de API para probar las plantillas, en YingTu puedes ejecutarlas desde el navegador pegando tu propia clave de LaoZhang API y pagando por imagen: 0,055 $ con Nano Banana 2 en YingTu y 0,09 $ con Nano Banana Pro en YingTu, a 26 de septiembre de 2026, con hasta 5 imágenes de referencia de un máximo de 20 MB cada una. Las peticiones pasan por la API de LaoZhang, no por la app de Gemini de Google.
Preguntas frecuentes
¿Puedo escribir los prompts de Gemini en español o tienen que ir en inglés?
Puedes escribirlos en español. Google incluye el español (es-MX) entre los quince idiomas con mejor rendimiento para la generación de imágenes, a 1 de octubre de 2026, y no publica datos que indiquen que el inglés dé mejores resultados.
¿Por qué la imagen no sale en 4K aunque lo escriba en el prompt?
Porque el tamaño no se lee del texto. La salida es 1K por defecto y solo cambia con el parámetro image_size (2K o 4K, con K mayúscula) en un modelo que lo admita: Nano Banana 2 y Nano Banana Pro llegan a 4K; Nano Banana 2 Lite se queda en 1K.
¿Cómo consigo que el texto de la imagen salga bien escrito?
Genera primero el texto y pide después la imagen con ese texto ya definido, que es el orden que recomienda Google. Ponlo entre comillas, describe la tipografía y, para piezas profesionales, usa Nano Banana Pro.
¿Cómo mantengo el mismo personaje en varias imágenes?
Adjunta en cada nuevo prompt las imágenes que ya has generado de ese personaje y pide un solo cambio de ángulo o de escena cada vez. Nano Banana 2 mantiene la coherencia de hasta 4 personajes y Nano Banana Pro de hasta 5.
¿Cuántas imágenes de referencia puedo dar a Gemini?
Hasta 14 en una petición con los modelos Gemini 3 de imagen. El reparto cambia según el modelo: Nano Banana 2 admite hasta 10 objetos y 4 personajes; Nano Banana Pro, hasta 6 objetos, 5 personajes y 3 referencias de estilo; Nano Banana 2 Lite, hasta 14 objetos.
¿Qué prompt uso para fotos de producto profesionales?
Usa la plantilla 4: producto con material y color, superficie, esquema de luz de estudio, ángulo de cámara y el detalle que debe quedar nítido. Si ya tienes la foto del producto, la plantilla 11 lo coloca en un ambiente y la 12 mantiene intacta la etiqueta o el logotipo.



