AI Image Generation13 min

GPT Image 2 en 4K: tamaños válidos, API y verificación real

Genera imágenes 4K con GPT Image 2 sin confundir resolución, relación de aspecto y escalado: reglas de size, Image API, Responses API y validación del archivo.

Yingtu AI Editorial
Yingtu AI Editorial
YingTu Editorial
25 abr 2026
13 min
Flujo de GPT Image 2 en 4K desde un tamaño válido hasta la verificación del archivo entregado
yingtu.ai

Contenido

No se detectaron encabezados

GPT Image 2 puede recibir una solicitud de 3840x2160 en horizontal o 2160x3840 en vertical. Esos son los dos tamaños 4K más claros que documenta OpenAI, pero hay una condición importante: las resoluciones por encima de 2560x1440 se consideran experimentales. Una petición válida no convierte automáticamente el archivo en un recurso listo para producción.

El procedimiento fiable tiene cuatro pasos: validar size, elegir la API adecuada, decodificar el base64 y comprobar los píxeles del original y de la copia que se entrega al usuario. Escribir «4K» en el prompt, seleccionar quality: "high" o recibir un HTTP 200 no sustituye ninguno de esos pasos.

Además, 4096x4096 no es un tamaño válido para este modelo: supera tanto el límite de 3840 px por lado como el máximo total de 8.294.400 píxeles. Y que ChatGPT permita crear imágenes en un plan gratuito no significa que la API de gpt-image-2 sea gratis. Son contratos diferentes.

Si necesitas…Ruta inicialCriterio de aceptación
Un archivo 4K directo desde un promptImage API con size: "3840x2160"el PNG decodificado mide exactamente 3840x2160
Una imagen dentro de un agente o conversaciónResponses API con la herramienta de imagense extrae el resultado de la herramienta, se guarda y se mide
Elegir composición antes de gastar en 4Kgenerar un máster 2K y escalar solo el elegidoel escalado no altera texto, bordes ni proporciones
Publicar mediante CMS o CDNconservar y medir original y derivadala URL pública no entrega una variante menor sin avisar

Antes de generar: tamaño, resolución, proporción y escalado no son sinónimos

En una integración es útil reservar cada término para una propiedad concreta:

  • Tamaño: el par exacto ancho x alto enviado en size, por ejemplo 3840x2160.
  • Resolución: los píxeles reales del archivo decodificado. Se comprueba después de guardar, no se deduce del prompt.
  • Relación de aspecto: la forma del lienzo. 3840x2160 es 16:9, pero «16:9» por sí solo no fija una resolución.
  • Generación 4K directa: en esta guía significa que la llamada solicita 4K y el archivo devuelto conserva esos píxeles. No es una afirmación sobre el proceso interno de síntesis del modelo.
  • Escalado: un proceso posterior que crea más píxeles a partir de una imagen ya generada. Puede producir un archivo 4K, pero esos píxeles no proceden de una solicitud 4K directa.

Esta separación evita una cadena de errores frecuente: pedir «formato 16:9 y calidad 4K» en texto, omitir size, descargar una imagen menor y ampliarla sin registrar el paso. El resultado puede servir visualmente, pero no debe describirse como generación 4K directa.

Las cuatro reglas que debe cumplir cualquier size

La guía oficial de generación de imágenes aplica cuatro condiciones simultáneas a los tamaños flexibles de gpt-image-2:

  1. el lado mayor no puede superar 3840 px;
  2. ancho y alto deben ser múltiplos de 16 px;
  3. la relación entre lado mayor y menor no puede superar 3:1;
  4. el total debe estar entre 655.360 y 8.294.400 píxeles, ambos incluidos.

El nombre comercial de un formato no concede una excepción. Full HD, UHD, DCI 4K o una medida habitual de imprenta pueden incumplir una de las cuatro reglas.

TamañoResultadoMotivo
3840x2160válido, experimentalcumple las cuatro reglas y alcanza exactamente 8.294.400 píxeles
2160x3840válido, experimentalmisma cantidad de píxeles en vertical
2048x2048válidocuadrado dentro del rango
3840x1280válidorelación exacta 3:1 y ambos lados son múltiplos de 16
3840x1200no válidola relación es 3,2:1
1920x1080no válido como custom size1080 no es múltiplo de 16
4096x2160no válidoel lado mayor supera 3840
4096x4096no válidosupera el límite por lado y el total de píxeles

Conviene rechazar el tamaño antes de llamar a la API y devolver todos los motivos, no solo un booleano:

hljs js
function validarTamano(width, height) {
  const ladoMayor = Math.max(width, height);
  const ladoMenor = Math.min(width, height);
  const pixeles = width * height;
  const errores = [];

  if (ladoMayor > 3840) errores.push("el lado mayor supera 3840 px");
  if (width % 16 !== 0 || height % 16 !== 0) {
    errores.push("ambos lados deben ser múltiplos de 16");
  }
  if (ladoMayor / ladoMenor > 3) errores.push("la proporción supera 3:1");
  if (pixeles < 655_360 || pixeles > 8_294_400) {
    errores.push("el total de píxeles está fuera del rango permitido");
  }

  return { valido: errores.length === 0, errores };
}

quality resuelve otra decisión. Sus valores son low, medium, high y auto, que es el predeterminado. Cambiarlo modifica el esfuerzo de renderizado; no corrige un size inválido ni garantiza tipografía perfecta, identidad estable o una composición publicable.

Image API: la ruta corta para generar, guardar y medir

La Image API es la opción más directa cuando una petición debe producir o editar una imagen. Aquí sí se selecciona model: "gpt-image-2" explícitamente. El snapshot actual indicado en la ficha oficial del modelo es gpt-image-2-2026-04-21.

El siguiente ejemplo no se detiene al recibir la respuesta. Decodifica b64_json, escribe el PNG y usa sharp para verificar ancho, alto y formato:

hljs js
import OpenAI from "openai";
import { writeFile } from "node:fs/promises";
import sharp from "sharp";

const openai = new OpenAI();
const objetivo = { width: 3840, height: 2160 };
const ruta = "hero-gpt-image-2-4k.png";

const result = await openai.images.generate({
  model: "gpt-image-2",
  prompt:
    "Fotografía editorial de producto, fondo opaco azul oscuro, " +
    "espacio limpio a la izquierda para titular añadido en maquetación.",
  size: `${objetivo.width}x${objetivo.height}`,
  quality: "high",
  output_format: "png",
});

const base64 = result.data[0]?.b64_json;
if (!base64) throw new Error("La respuesta no contiene b64_json");

await writeFile(ruta, Buffer.from(base64, "base64"));

const meta = await sharp(ruta).metadata();
if (
  meta.width !== objetivo.width ||
  meta.height !== objetivo.height ||
  meta.format !== "png"
) {
  throw new Error(
    `Archivo no aceptado: ${meta.width}x${meta.height}, formato ${meta.format}`
  );
}

console.log(`Aceptado: ${meta.width}x${meta.height} ${meta.format}`);

El PNG es el formato predeterminado. También se admiten JPEG y WebP; en esos dos casos output_compression acepta valores de 0 a 100. La compresión puede reducir peso y latencia de entrega, pero exige revisar texto pequeño, líneas finas, degradados y artefactos, además de las dimensiones.

Para un sistema reproducible, registra al menos modelo o snapshot, size solicitado, quality, formato, ruta guardada, dimensiones reales, tamaño en bytes, identificador de petición y destino público. No hace falta conservar el prompt completo en un log accesible si contiene datos sensibles; un hash puede aportar trazabilidad sin exponerlo.

Responses API: cuando la imagen es una herramienta, no el modelo principal

La Responses API encaja en un flujo conversacional o de varias etapas: un modelo principal interpreta el encargo, decide usar la herramienta de generación de imágenes y continúa con otras acciones. En esta ruta, model identifica al modelo principal compatible, mientras que la herramienta gestiona su propia selección de GPT Image.

Por eso este patrón es correcto:

hljs js
import OpenAI from "openai";
import { writeFile } from "node:fs/promises";

const openai = new OpenAI();

const response = await openai.responses.create({
  model: "gpt-5.6",
  input:
    "Crea una imagen horizontal para la cabecera de una guía técnica. " +
    "No incluyas texto dentro de la imagen.",
  tools: [
    {
      type: "image_generation",
      action: "generate",
      size: "3840x2160",
      quality: "high",
    },
  ],
});

const llamada = response.output.find(
  (item) => item.type === "image_generation_call"
);
if (!llamada?.result) throw new Error("No se recibió una imagen");

await writeFile(
  "cabecera-responses-4k.png",
  Buffer.from(llamada.result, "base64")
);

Después debe aplicarse la misma inspección de metadatos del ejemplo anterior. En cambio, no se debe añadir model: "gpt-image-2" dentro del objeto de la herramienta como si fuera un parámetro universal. Tampoco se debe usar gpt-image-2 como modelo principal de Responses por analogía con Image API.

Responses aporta contexto, iteración y coordinación con otras herramientas, pero también añade consumo del modelo principal a los costes de imagen. Si solo hace falta un archivo desde un prompt, esa capa extra suele aportar poco.

Cómo decidir entre 4K directo y un máster 2K escalado

Un size 4K válido sigue siendo experimental. No significa que la opción siempre falle; significa que la integración debe tener una salida controlada si no supera la aceptación.

El 4K directo tiene sentido cuando el número de píxeles forma parte del contrato: un hero que diseño entregará sin ampliar, una vista previa grande o una composición cuyo recorte se ha definido sobre un lienzo de 3840x2160. La ventaja es una ruta clara. El inconveniente es repetir en alta resolución mientras todavía se ajustan composición o texto.

El máster 2K más escalado es razonable cuando primero hay que elegir entre variantes. Por ejemplo:

  1. generar cuatro composiciones a 2048x1152 con quality: "low" o "medium";
  2. revisar encuadre, manos, producto y espacio para copy;
  3. regenerar la mejor en 3840x2160, si responde de forma estable;
  4. si no supera la aceptación, escalar el máster elegido con una herramienta aparte;
  5. registrar que los píxeles finales proceden de escalado.

Un escalador puede aumentar dimensiones, pero no recupera automáticamente letras correctas, bordes físicos coherentes o identidad. Si el máster contiene un error semántico, ampliar solo produce un error más grande.

La aceptación termina en la URL pública, no en el HTTP 200

El archivo devuelto por la API es solo el primer punto de control. Un CMS puede recomprimirlo, un CDN puede generar una derivada y el navegador puede escoger una variante menor mediante srcset.

Usa una aceptación por capas:

  1. Petición: size pasa las cuatro reglas y queda registrado.
  2. Respuesta: existe el campo base64 esperado y se puede decodificar.
  3. Original guardado: la biblioteca de imagen lee el archivo, su formato coincide y mide exactamente lo solicitado.
  4. Entrega: se descarga la URL del CMS o CDN y se miden sus píxeles por separado.
  5. Render: se confirma qué recurso carga realmente el navegador en el viewport objetivo.
  6. Decisión: solo se etiqueta como 4K el objeto cuya dimensión se ha comprobado.

Si el original mide 3840x2160 pero la URL pública devuelve 1920x1080, la generación no es el problema. Revisa reglas del optimizador, parámetros de transformación, calidad automática, srcset, caché y límites de subida. Si el original ya es menor, vuelve a la petición, la disponibilidad del modelo y el guardado.

Precio, acceso y la frontera con ChatGPT

OpenAI no publica una única tarifa fija y universal para «una imagen 4K». El coste de API combina tokens de texto de entrada, tokens de imagen de entrada en ediciones, tokens de imagen de salida y, si se usa Responses, el consumo adicional del modelo principal.

A fecha de esta actualización, las tarifas oficiales de API para gpt-image-2 son, por millón de tokens: 8 USD para entrada de imagen, 2 USD para entrada de imagen en caché, 30 USD para salida de imagen, 5 USD para entrada de texto y 1,25 USD para texto en caché. Batch tiene tarifas inferiores. Como las dimensiones y la calidad cambian los tokens de salida, el cálculo debe hacerse con la calculadora vigente y las condiciones reales de la petición; la guía específica de coste por imagen cubre ese cálculo con más detalle.

El acceso también depende de la organización y del proyecto:

  • el nivel gratuito de uso de la API no admite gpt-image-2;
  • OpenAI puede exigir verificación de la organización;
  • los límites publicados de Tier 1 a Tier 5 son 5, 20, 50, 150 y 250 imágenes por minuto, junto con límites de tokens propios del modelo;
  • la página de límites de la cuenta es la autoridad final para una clave y un proyecto concretos.

Si aparece un 429 o un error de acceso, conviene separar límite, tier, verificación y modelo disponible antes de cambiar el prompt. La guía de límites de GPT Image 2 desarrolla ese diagnóstico.

ChatGPT Images 2.0 es un producto de consumo distinto. La generación de imágenes está disponible en los planes de ChatGPT, incluido el plan Gratis con límites variables, pero eso no concede llamadas gratuitas a la API, dimensiones exactas mediante size, IPM de API ni facturación por tokens. Para comparar esas vías sin mezclar contratos, consulta GPT Image 2 gratis en ChatGPT y en la API.

Fallos que conviene resolver en este orden

invalid size

Ejecuta el validador local y muestra todas las reglas incumplidas. No intentes arreglar con el prompt un lado de 4096 px o una dimensión que no es múltiplo de 16.

La llamada funciona, pero el archivo no es 4K

Comprueba primero el base64 decodificado. Si el original no coincide, conserva metadatos e identificador de petición y no lo etiquetes como 4K. Si coincide, mide cada transformación posterior.

La imagen tiene 4K, pero el texto o los detalles fallan

Es un problema visual, no de resolución. Simplifica copy, añade espacio para texto colocado durante la maquetación, fija invariantes de composición y compara medium con high. Más píxeles no garantizan mejor ortografía.

El fondo transparente falla

gpt-image-2 no admite actualmente background: "transparent" en esta ruta. Genera con fondo opaco o automático y planifica eliminación de fondo o máscara en un paso posterior. La posibilidad de crear transparencias en una superficie de ChatGPT no amplía el contrato de la API.

Preguntas frecuentes

¿GPT Image 2 genera 4K de forma nativa?

Puede recibir 3840x2160 o 2160x3840 y devolver un archivo con esos píxeles. OpenAI clasifica estas resoluciones como experimentales. Aquí «4K directo» describe la petición y el archivo medido, no revela cómo sintetiza internamente el modelo.

¿Se puede pedir 4096x4096?

No como size válido de gpt-image-2. Cada lado debe ser como máximo 3840 px y el total no puede superar 8.294.400 píxeles.

¿Basta con poner «4K» en el prompt?

No. El prompt define el contenido visual; size define los píxeles solicitados. Después hay que decodificar y medir el archivo.

¿quality: "high" aumenta la resolución?

No. quality controla el esfuerzo de renderizado. La resolución solicitada pertenece a size, y la resolución real pertenece al archivo guardado.

¿Image API o Responses API?

Image API para una generación o edición directa. Responses API cuando una imagen forma parte de una conversación, un agente o un flujo con varias herramientas. Responses añade también el consumo del modelo principal.

¿La API devuelve una URL?

Para GPT Image, la Image API devuelve datos de imagen codificados en base64. Hay que decodificarlos y guardarlos. Una URL pública solo aparece después si el sistema sube ese archivo a almacenamiento, CMS o CDN.

¿ChatGPT Gratis incluye la API de GPT Image 2?

No. La cuota de generación de imágenes de ChatGPT pertenece al producto de consumo. La API tiene credenciales, acceso, límites y facturación independientes; su Free usage tier no admite gpt-image-2.

Etiquetas

Compartir este artículo

XTelegram