11 de setiembre de 2026
Dos imágenes pueden tener exactamente la misma resolución —por ejemplo, 1024×1024— y verse muy distintas. Por ejemplo en un proyecto en el que necesites generar imágenes humanas reales pueden haber diferencias muy notables en cuanto a identidad facial, textura de piel, manos, caída de la ropa e iluminación. La resolución dice cuántos píxeles tiene una imagen. No dice si esos píxeles están bien resueltos.
Probamos dos modelos generativos —Nano Banana y GPT Image generando fotos de modelos humanas a partir de una misma referencia, pensadas para una experiencia de tienda online. La conclusión fue directa: la calidad final depende del modelo y del nivel de calidad solicitado, no del tamaño del archivo.
Resolución, calidad y fidelidad no son lo mismo
Conviene separar tres conceptos antes de decidir qué modelo usar:
- Resolución: el tamaño de salida del archivo, como 1024×1024.
- Calidad de renderizado: la capacidad del modelo para resolver detalles, materiales, iluminación, anatomía y composición.
- Fidelidad de referencia: la capacidad de conservar rasgos reconocibles al cambiar vestuario, pose o entorno.
Un archivo de 1024 píxeles puede verse perfecto en una tarjeta de producto o una galería. Pero si tiene manos deformadas, una cara que cambia entre tomas o joyería incoherente, aumentar la resolución no corrige nada — solo hace más notorio el defecto.
El encuadre también cambia la dificultad. Una imagen de cuerpo entero obliga al modelo a resolver rostro, manos, piernas, zapatos y entorno a la vez. Un retrato de hombros a cintura concentra el detalle en menos elementos, así que sale mejor con menos esfuerzo.
Nano Banana: consistencia de identidad y edición por lenguaje natural
Gemini 2.5 Flash Image, conocido como Nano Banana, no destaca solo por generar imágenes desde cero. Google lo posiciona como un modelo state-of-the-art tanto para generación como para edición, y sus tres capacidades documentadas son las que de verdad importan para producción:
- Consistencia de identidad entre ediciones. El modelo preserva detalles finos y la semántica general de una escena a través de múltiples ciclos de revisión — es decir, si le pides diez variantes de una misma persona o producto, tiende a mantener los rasgos reconocibles en vez de reinventarlos en cada intento.
- Edición por lenguaje natural, sin herramientas profesionales. Retocar, cambiar el fondo, agregar o quitar elementos: todo con una instrucción de texto, sin pasar por un editor de imágenes tradicional.
- Fusión de múltiples imágenes de referencia. Puede combinar varias fotos en una sola composición coherente, útil para marketing o material publicitario que necesita mezclar elementos de distintas fuentes.

Referencia de calidad: cuatro variantes generadas con Nano Banana a partir de una misma imagen base, cambiando escenario y vestuario.
Para una tienda online, esto se traduce en poder pedir ajustes puntuales —“cambia el color de la chaqueta”, “pon el mismo producto en un fondo de estudio”— sin regenerar la imagen completa ni perder la identidad visual ya aprobada. Entre sus limitaciones documentadas están las caras pequeñas dentro de una escena amplia y el texto incrustado en la imagen, que todavía no resuelve con precisión.
GPT Image 1: útil para explorar, no para la imagen final
GPT Image 1 dio resultados funcionales para exploración visual, con un acabado más bajo cuando la imagen necesitaba resistir una mirada cercana.

A la izquierda, la modelo real usada como referencia. A la derecha, el render de GPT Image 1: conserva el parecido general, pero el acabado de piel y prendas es menos preciso al ampliar.
El problema no fue solo de acabado: la fidelidad facial fue baja. Los rasgos del render —forma de la cara, cejas, nariz— se alejan notablemente de la referencia, más allá del parecido general que da el tono de piel y el color de cabello.
A eso se suman señales de menor definición: piel demasiado uniforme, bordes de la ropa poco precisos, transición artificial entre cabello y fondo. Nada de esto descarta al modelo para bocetos, moodboards o pruebas de dirección artística — el problema aparece cuando se necesita que la misma persona sea reconocible entre imágenes, o cuando el resultado se amplía y se coloca junto a una foto real en la página de un producto.
GPT Image 2: el nivel de calidad sí cambia el resultado
Con GPT Image 2, la diferencia entre los niveles low, medium y high fue mucho más visible que en otros modelos.

El salto de calidad entre low y high en GPT Image 2 se nota directamente en bordes de ropa, manos y accesorios.
- Low: suficiente para validar pose, encuadre y combinación de colores mientras todavía se están descartando alternativas. El riesgo son pequeñas inconsistencias en bordes, manos o accesorios.
- Medium: el punto de equilibrio. Los materiales ganan volumen, los contornos se limpian y la integración entre modelo y entorno se ve más natural — el nivel que suele bastar para la mayoría de las piezas web.
- High: el nivel que da margen para inspección cercana, recorte y ampliación. Aquí vale la pena revisar textura de tejidos, manos, joyería y profundidad con cuidado.
Según la documentación oficial de GPT Image 2, el precio varía según dimensiones y nivel de calidad. En nuestras pruebas de septiembre de 2026, para una imagen cuadrada de aproximadamente 1K: low costó unos US$0.006, medium US$0.053 y high US$0.211. Son referencias de trabajo, no precios fijos — conviene revisarlos siempre en la documentación antes de calcular un presupuesto.
Tabla de referencia: modelo, costo y para qué sirve cada uno
| Modelo | Calidad de referencia | Costo orientativo por imagen | Uso recomendado |
|---|---|---|---|
| GPT Image 1 | Estándar | Variable, modelo anterior | Bocetos y exploración visual |
| GPT Image 2 | 1024×1024 · low | US$0.006 | Iteraciones rápidas |
| GPT Image 2 | 1024×1024 · medium | US$0.053 | Imagen web cuidada |
| GPT Image 2 | 1024×1024 · high | US$0.211 | Imagen principal, ampliación |
| Gemini 2.5 Flash Image (Nano Banana) | 1K estándar | ~US$0.04 observado | Continuidad visual entre escenas |
| Nano Banana 2 / Gemini 3.1 Flash Image | 1K | US$0.03–0.045 | Volumen y generación rápida |
| Gemini 3 Pro Image (Nano Banana Pro) | 1K–2K | US$0.134 | Detalle y acabado premium |
Google sigue ampliando esta familia de modelos con distintos balances entre velocidad, costo y detalle — ver el anuncio de Nano Banana 2 y la guía de generación de imágenes de Gemini.
Siete cosas que revisar antes de aprobar una imagen generada
Evaluar una generación no es solo mirar si la cara quedó bien. Conviene revisar:
- Identidad facial — que la persona siga siendo reconocible entre variaciones.
- Manos y anatomía — dedos, articulaciones, proporciones.
- Cabello — bordes y transición con el fondo.
- Ropa — costuras, textura, caída.
- Accesorios — joyería, bolsos, zapatos.
- Iluminación — coherencia entre sujeto, ropa y entorno.
- Consistencia entre escenas — que la misma persona no cambie de facciones o proporciones de una foto a otra.
El último punto es el que más falla cuando varias imágenes del mismo producto o modelo aparecen juntas en una página — que es exactamente el caso de una ficha de producto o una galería de tienda. Ya lo vimos con la personalización con IA en e-commerce: la experiencia se rompe cuando el detalle no sostiene la promesa visual.

Una sola referencia puede producir varios looks completos manteniendo el mismo rostro y complexión — la base de un catálogo con identidad consistente.
Un flujo de producción que evita pagar de más

Las cinco etapas, en orden: primero se explora barato, y la calidad alta se reserva para lo que ya pasó el filtro de selección.
El orden que mejor funcionó en la práctica:
- Generación exploratoria — varias propuestas económicas (
lowo un modelo Flash) para validar composición, pose y vestuario. - Selección — quedarse solo con las imágenes que realmente funcionan.
- Render final — regenerar únicamente las seleccionadas con calidad superior.
- Revisión — pasar el checklist de las siete áreas de arriba.
- Optimización web — exportar al tamaño necesario y comprimir, para no cargar la página con archivos más pesados de lo necesario.
Este orden evita los dos errores más comunes: pagar calidad alta por imágenes que terminan descartadas, y usar una salida económica en la imagen que representa la identidad visual de la marca.
Calculando correctamente costos en un pipeline de producción automatizado
Todas las cifras anteriores corresponden al costo de salida: lo que cuesta generar la imagen final. Pero en nuestro pipeline no partimos de cero — le pasamos al modelo una imagen de referencia (la foto de la modelo real) para que la use como base, y eso agrega tokens de entrada por procesar y analizar esa referencia antes de generar.
Ese costo de entrada se suma al de salida en cada imagen que produce el pipeline, y conviene tenerlo presente al presupuestar un proyecto que depende de referencias reales en vez de generar desde un prompt vacío:

En este caso puntual, el token de entrada de la imagen de referencia agregó US$0.02 al costo base de US$0.03 — un 67% más por imagen.
En un caso real de nuestro pipeline, una imagen que costaba US$0.03 solo de renderizado pasó a US$0.05 al sumar el procesamiento de la imagen de referencia — un incremento de más del 60% sobre el costo publicado de salida:
| Modelo | Costo solo de renderizado (salida) | Costo con tokens de entrada (imagen de referencia) |
|---|---|---|
| GPT Image 2 · low | US$0.006 | US$0.006 + procesamiento de la referencia |
| GPT Image 2 · medium | US$0.053 | US$0.053 + procesamiento de la referencia |
| GPT Image 2 · high | US$0.211 | US$0.211 + procesamiento de la referencia |
| Gemini 2.5 Flash Image (Nano Banana) | US$0.03 observado | US$0.05 observado (US$0.03 + US$0.02 de entrada) |
Los tokens de entrada varían según el tamaño y la resolución de la imagen de referencia que se envía, así que no hay un monto fijo — pero en un flujo con muchas variantes por producto o por modelo, ese costo adicional se acumula rápido. Vale la pena medirlo en el panel de facturación del proveedor antes de escalar el pipeline, no solo revisar el precio publicado por imagen generada.
La pregunta correcta no es “cuál es el más barato”
No es cuál modelo genera más resolución, ni cuál cuesta menos por imagen. La pregunta útil es: ¿qué combinación de modelo, calidad y costo produce el resultado que necesito para esta pieza concreta?
Para iterar, low o un modelo Flash alcanzan. Para contenido web final, medium suele dar la mejor relación costo-calidad. Para una imagen protagonista —un hero, una portada, una pieza que va a ampliarse— high da el margen que hace falta. Y cuando el proyecto necesita mantener a la misma persona reconocible en varias escenas, la consistencia de referencia pesa más que el precio por imagen, algo en lo que Nano Banana se destacó frente a los otros dos modelos.
Si estás evaluando incorporar imágenes generadas con IA en tu tienda, puedes revisar primero cómo está hoy tu catálogo con nuestra auditoría gratuita.






