El prompt perfecto para crear imágenes con Gemini: la fórmula que realmente funciona

por | Jul 24, 2026 | Tips & Consejos | 0 Comentarios

Crear una imagen impactante con inteligencia artificial no depende solamente de escribir “haceme una foto increíble en 8K”.

La verdadera diferencia aparece cuando dejamos de hablarle a Gemini como si estuviéramos buscando una imagen en Google y comenzamos a darle indicaciones como lo haría un director de fotografía.

Qué debe aparecer, qué está haciendo, dónde se encuentra, cómo está iluminado, desde qué ángulo se observa y para qué vamos a utilizar la imagen.

Esa es la base del denominado “prompt perfecto”. Aunque conviene comenzar con una aclaración: no existe una frase mágica que garantice resultados extraordinarios en todos los casos.

Lo que sí existe es una estructura que reduce la interpretación aleatoria y nos acerca mucho más a la imagen que imaginamos.

Qué modelo de Gemini genera las imágenes

Actualmente, Gemini utiliza la familia Nano Banana para crear y editar imágenes.

Google diferencia tres alternativas principales:

  • Nano Banana 2 Lite: prioriza velocidad y tareas sencillas.
  • Nano Banana 2: ofrece un equilibrio entre velocidad, calidad, conocimiento y precisión.
  • Nano Banana Pro: está pensado para trabajos profesionales, instrucciones complejas, infografías y textos dentro de las imágenes.

Gemini también permite cargar varias fotografías como referencia, editar partes concretas de una imagen y mantener con mayor consistencia la apariencia de una persona o personaje.

En la aplicación, las cuentas sin plan pago pueden descargar imágenes en 1K, mientras que determinados planes permiten hacerlo en 2K. Mediante la API, algunos modelos ofrecen resoluciones de hasta 4K. Cómo crear y editar imágenes en Gemini

La fórmula del prompt perfecto

Un buen prompt puede organizarse mediante esta estructura:

1. Tipo de imagen y objetivo

Antes de describir la escena, hay que explicar qué queremos crear y para qué la vamos a utilizar.

No es lo mismo pedir una fotografía de un producto que una miniatura para YouTube, una publicación vertical para Instagram o la portada de una página web.

Ejemplo:

Crea una fotografía publicitaria horizontal para una miniatura de YouTube sobre inteligencia artificial.

La intención ayuda a Gemini a comprender la jerarquía, la composición y el espacio que deberá reservar para cada elemento.

2. Sujeto principal

A continuación debemos identificar claramente al protagonista.

Podemos especificar:

  • Persona, animal, producto u objeto.
  • Apariencia y vestimenta.
  • Materiales y texturas.
  • Posición dentro de la imagen.
  • Expresión facial.
  • Elementos que debe sostener.

Ejemplo:

Un creador de contenido argentino de aproximadamente 50 años, ubicado en primer plano, mirando sorprendido una imagen generada por inteligencia artificial.

Si estamos utilizando una fotografía personal, conviene agregar:

Utiliza la fotografía adjunta como referencia de identidad. Conserva exactamente sus rasgos faciales, edad aparente, cabello y proporciones naturales.

Esto resulta mucho más útil que escribir simplemente “que se parezca a mí”.

3. Acción

El sujeto no solamente debe existir: Gemini necesita saber qué está haciendo.

Podemos indicar que mira hacia la cámara, sostiene un celular, camina, señala un texto, utiliza una herramienta o interactúa con otro personaje.

Ejemplo:

Sostiene un celular con una mano y señala con la otra una espectacular imagen que parece salir de la pantalla.

4. Entorno

Después debemos construir el lugar donde ocurre la acción.

Es importante definir:

  • Interior o exterior.
  • Momento del día.
  • Objetos del fondo.
  • Clima o atmósfera.
  • Nivel de detalle.
  • Distancia entre el protagonista y el escenario.

Ejemplo:

Estudio tecnológico moderno, con pantallas mostrando imágenes creadas por IA y un fondo azul oscuro con destellos violetas.

5. Composición y cámara

Los términos fotográficos pueden ayudar a controlar cómo se organiza la escena.

Algunos de los más útiles son:

  • Primer plano.
  • Plano medio.
  • Gran angular.
  • Vista aérea.
  • Ángulo bajo.
  • Fotografía macro.
  • Profundidad de campo reducida.
  • Fondo desenfocado.
  • Efecto bokeh.
  • Composición simétrica.
  • Regla de los tercios.

Google recomienda específicamente utilizar lenguaje fotográfico y cinematográfico para controlar la composición. Guía oficial de prompts para imágenes con Gemini

Ejemplo:

Plano medio, cámara a la altura de los ojos, lente de 35 milímetros y profundidad de campo reducida.

No hace falta acumular diez tipos de lentes o efectos contradictorios. Cuanto más coherente sea la indicación, más natural será la imagen.

6. Iluminación y color

La iluminación puede cambiar completamente la sensación que transmite una imagen.

Podemos pedir:

  • Iluminación cinematográfica.
  • Luz suave de estudio.
  • Luz natural del atardecer.
  • Contraluz.
  • Luz volumétrica.
  • Sombras suaves.
  • Alto contraste.
  • Iluminación lateral.
  • Paleta cálida o fría.

Ejemplo:

Iluminación cinematográfica azul y violeta, reflejos suaves sobre el rostro y una luz de contorno que separe al protagonista del fondo.

En una fotografía de producto, también conviene describir cómo debe reflejarse la luz sobre el material.

7. Estilo visual

Gemini necesita saber si buscamos realismo, ilustración o una estética determinada.

Podemos indicar:

  • Fotografía publicitaria hiperrealista.
  • Ilustración 3D.
  • Acuarela.
  • Estilo cómic.
  • Diseño minimalista.
  • Arte cinematográfico.
  • Render de producto.
  • Animación de plastilina.
  • Estética retrofuturista.

La guía de Google aconseja describir no solamente el estilo, sino también sus características visuales: líneas gruesas, sombreado suave, colores vibrantes, fondo limpio o materiales específicos.

8. Texto exacto

Si la imagen necesita palabras, hay que escribirlas entre comillas y explicar dónde deben aparecer.

Ejemplo:

Incluir únicamente el texto “EL PROMPT PERFECTO” en letras mayúsculas, grandes, blancas y amarillas, con borde negro grueso, ubicado en el sector izquierdo.

También es conveniente aclarar:

No agregar ninguna otra palabra, letra, número, marca de agua o logotipo.

Gemini mejoró considerablemente la generación de texto. Google recomienda definir el contenido exacto, el estilo de la tipografía y el diseño general. Para trabajos profesionales con mucho texto, sugiere utilizar Nano Banana Pro.

El prompt maestro para copiar y completar

Esta plantilla puede utilizarse para casi cualquier imagen:

Crea una [TIPO DE IMAGEN] destinada a [OBJETIVO O PLATAFORMA].

El sujeto principal es [DESCRIPCIÓN PRECISA DEL SUJETO], ubicado en [POSICIÓN], realizando [ACCIÓN] y mostrando [EXPRESIÓN].

La escena ocurre en [ENTORNO], durante [MOMENTO DEL DÍA], con [ELEMENTOS IMPORTANTES DEL FONDO].

Utiliza una composición [TIPO DE COMPOSICIÓN], tomada en [TIPO DE PLANO Y ÁNGULO], simulando una lente [TIPO DE LENTE] y con [PROFUNDIDAD DE CAMPO].

La iluminación debe ser [TIPO DE LUZ], con una paleta de colores [COLORES] y una atmósfera [EMOCIÓN O SENSACIÓN].

Estilo visual: [FOTORREALISTA, PUBLICITARIO, ILUSTRACIÓN, 3D, ETCÉTERA], con [TEXTURAS Y NIVEL DE DETALLE].

Incluir únicamente el texto “[TEXTO EXACTO]”, en [TIPOGRAFÍA, COLOR Y POSICIÓN].

Resultado final limpio, equilibrado, con el protagonista perfectamente enfocado, proporciones naturales y espacio visual suficiente.

Formato [16:9, 9:16, 1:1, ETCÉTERA] y resolución [1K, 2K O 4K SEGÚN DISPONIBILIDAD].

Ejemplo para crear una fotografía de producto

Crea una fotografía publicitaria hiperrealista para una publicación de Mercado Libre. El sujeto principal es una cafetera espresso negra, completamente centrada y fotografiada en tres cuartos, sobre una mesada de madera clara. La escena ocurre en una cocina moderna y luminosa, ligeramente desenfocada. Plano cercano, cámara a la altura del producto y lente de 50 milímetros. Iluminación suave de estudio combinada con luz natural lateral, sombras delicadas y reflejos controlados sobre el metal. Estética premium, comercial y limpia, con materiales y texturas realistas. Fondo ordenado, producto completo, bordes definidos y proporciones correctas. Sin personas, sin textos, sin marcas de agua y sin accesorios que oculten el producto. Formato cuadrado 1:1.

Ejemplo para una miniatura viral con una foto personal

Crea una miniatura viral horizontal para YouTube sobre cómo generar imágenes con Gemini. Utiliza la fotografía adjunta de Charly Fornas como referencia principal de identidad. Conserva exactamente sus rasgos faciales, edad aparente, cabello y proporciones naturales. Ubicarlo en primer plano sobre el lado derecho, mirando sorprendido un celular del que emerge una espectacular imagen creada por inteligencia artificial. Fondo tecnológico azul y violeta con la interfaz visual de Gemini, destellos luminosos y varias imágenes flotantes. Plano medio, lente de 35 milímetros e iluminación cinematográfica de alto contraste. Incluir únicamente el texto “EL PROMPT PERFECTO” en mayúsculas, amarillo y blanco, con borde negro grueso, sobre el lado izquierdo. Agregar un pequeño sello rojo con el texto “COPIALO”. Composición limpia con solamente tres focos principales: rostro, titular y celular. Sin palabras adicionales, sin deformar el rostro y sin modificar la identidad de la persona. Formato 16:9.

¿Sirve escribir “8K”, “HDR” o “Unreal Engine 5”?

Estos términos pueden comunicar una intención estética, pero no funcionan como interruptores secretos que obligan al sistema a utilizar “algoritmos más avanzados”.

Escribir “8K” tampoco convierte automáticamente el archivo en una imagen de esa resolución. Google informa que los modelos actuales generan tamaños determinados de 1K, 2K o hasta 4K, según el modelo y la forma de acceso.

Por eso, resulta más efectivo describir el detalle que queremos observar:

  • Textura visible en la piel.
  • Fibras definidas en la tela.
  • Bordes nítidos.
  • Reflejos realistas.
  • Sombras naturales.
  • Detalles pequeños perfectamente reconocibles.

“Unreal Engine 5” puede ser útil si realmente buscamos la estética de un render tridimensional o de un videojuego. Agregarlo a una fotografía familiar no necesariamente mejorará el resultado y hasta podría volverla más artificial.

Qué ocurre con los prompts negativos

En algunos generadores existe un campo específico para prompts negativos. En Gemini, la documentación recomienda utilizar principalmente indicaciones negativas semánticas.

Esto significa describir de forma positiva la escena buscada.

En lugar de escribir:

Sin autos.

Conviene pedir:

Una calle completamente vacía y desierta, sin señales de tránsito vehicular.

También podemos agregar restricciones concretas cuando sean verdaderamente importantes:

La imagen debe contener una sola persona, dos manos visibles, fondo limpio, texto perfectamente escrito y ningún elemento superpuesto sobre el rostro.

Una lista interminable de palabras como “borroso, malo, feo, deforme, incorrecto” puede introducir conceptos no deseados dentro del contexto. Es preferible explicar con claridad cuál es el resultado correcto.

El verdadero secreto: corregir sin comenzar nuevamente

El primer resultado no tiene por qué ser definitivo.

Gemini permite continuar conversando y solicitar cambios específicos:

  • “Conservá todo igual, pero hacé la iluminación más cálida”.
  • “No cambies el rostro; reemplazá solamente el fondo”.
  • “Mantené la composición y aumentá el tamaño del titular”.
  • “Eliminá el objeto de la esquina inferior”.
  • “Generá una segunda versión con expresión de sorpresa”.

Google recomienda iterar mediante modificaciones pequeñas y precisas. Si cambiamos completamente el prompt en cada intento, también podemos perder las partes que ya habían quedado bien.

Mi opinión: no hay que escribir más, hay que dirigir mejor

Un prompt largo no siempre es un buen prompt.

Podemos escribir veinte líneas repletas de términos técnicos y obtener una imagen incoherente si las instrucciones se contradicen. En cambio, una descripción ordenada, visual y con una intención clara puede producir un resultado mucho mejor.

Para mí, el verdadero prompt perfecto es el que permite imaginar la escena antes de generarla.

Si sabemos quién aparece, qué hace, dónde está, cómo se ilumina, desde dónde lo mira la cámara y qué debe sentir la persona que vea la imagen, ya hicimos gran parte del trabajo.

La inteligencia artificial puede fabricar los píxeles, pero todavía somos nosotros quienes debemos tener la idea y tomar las decisiones.

En definitiva, no se trata de encontrar palabras mágicas. Se trata de aprender a mirar y pensar como un director creativo.

Written By Charly Fornas

undefined

Publicaciones Relacionadas

0 comentarios

Enviar un comentario