Precios de GPT-5.4 Mini: Costos de entrada, caché y salida
Precios de GPT-5.4 Mini explicados: costos de tokens de entrada, entrada en caché y salida, y por qué los modelos pequeños reducen las facturas de API de alto volumen.
Hola, soy Dora. Llevo unas semanas enrutando una carga de trabajo de clasificación de alto volumen a través de OpenAI. La pregunta que seguía llegando desde finanzas era la misma que hacen los desarrolladores cada vez que sale un modelo “mini”: ¿los números realmente cuadran, o la tarifa más barata por token se consume por algún otro factor?
Este artículo es para cualquiera que esté haciendo el mismo cálculo sobre los precios de GPT-5.4 Mini ahora mismo — desarrolladores conscientes de los costos, líderes de ingeniería con visión financiera. Voy a desglosar las tarifas de entrada, entrada en caché y salida, analizar dónde funcionan los números unitarios, y señalar dónde Mini silenciosamente cuesta más de lo que sugiere el titular. Todas las tarifas provienen de la página oficial de precios de la API de OpenAI, verificadas a la fecha de publicación — estas cambian, así que comprueba antes de cotizar.
Este no es el artículo de integración. El enrutamiento y el contrato de API están en una pieza separada. Este trata sobre el dinero.
Desglose de costos de GPT-5.4 Mini
Tarifas de entrada vs. salida
GPT-5.4 Mini tiene un precio de $0.75 por millón de tokens de entrada y $4.50 por millón de tokens de salida. El multiplicador 6x de salida es el dato que la mayoría de la gente interioriza demasiado tarde. La entrada es barata. La salida es lo que quema el presupuesto.
Para contexto, la posición de Mini dentro de la familia GPT-5.4 a la fecha de publicación:
| Modelo | Entrada ($/M) | Entrada en caché ($/M) | Salida ($/M) |
|---|---|---|---|
| GPT-5.5 | $5.00 | $0.50 | $30.00 |
| GPT-5.4 | $2.50 | $0.25 | $15.00 |
| GPT-5.4 Mini | $0.75 | $0.08 | $4.50 |
Mini es aproximadamente 3.3x más barato que GPT-5.4 y 6.7x más barato que GPT-5.5. Esa proporción es toda la historia cuando decides si una carga de trabajo pertenece a Mini.
Las tarifas estándar se aplican a ventanas de contexto por debajo de ~270K tokens de entrada. Por encima de ese límite, OpenAI aplica precios 2x de entrada y 1.5x de salida a toda la sesión — incluso bajo los niveles Batch y Flex. La sorpresa más cara de la plataforma.
Descuento por entrada en caché
La entrada en caché en GPT-5.4 Mini es de $0.075 por millón de tokens — una reducción del 90% sobre la tarifa de entrada estándar, siguiendo el patrón de las familias GPT-5.4 y GPT-5.5. La caché es automática: sin bandera de API, sin cambio de código. Si tu solicitud reutiliza un prefijo que OpenAI ya ha calculado, esos tokens se facturan a la tarifa en caché.
Las reglas que importan:
- El prefijo debe ser estable byte a byte. Una marca de tiempo en tu prompt de sistema destruye la caché.
- El prefijo debe ser suficientemente largo (mínimo alrededor de 1,024 tokens).
- La caché expira después de varios minutos de inactividad.
- El precio de salida no cambia.
Para aplicaciones RAG con prompts de sistema estables y largos, las tasas de acierto de caché superiores al 70% son realistas. Para cargas de trabajo de un solo turno sin preámbulo compartido, la caché apenas ayuda. Los ahorros son reales pero condicionales, razón por la cual nunca los cito como un porcentaje fijo a finanzas.
Por qué los modelos pequeños ganan en alto volumen
Matemática de costo por tarea vs. frontera
La unidad correcta no es el costo por token. Es el costo por tarea exitosa. Una carga de trabajo representativa — clasificar 1M tickets de soporte cortos, 800 tokens de entrada y 200 de salida cada uno, sin caché:
| Modelo | Costo de entrada | Costo de salida | Total |
|---|---|---|---|
| GPT-5.5 | $4,000 | $6,000 | $10,000 |
| GPT-5.4 | $2,000 | $3,000 | $5,000 |
| GPT-5.4 Mini | $600 | $900 | $1,500 |
Basado en los precios estándar de OpenAI a junio de 2026. Solo cálculo de ejemplo — los precios reales pueden variar según región, tasa de acierto de caché, descuentos por volumen u otros factores. Siempre verifica la página oficial de precios de OpenAI antes de cotizar.
Mini llega al 15% de la factura de GPT-5.5. La pregunta es si la precisión de Mini en tu tarea es lo suficientemente cercana como para que los ahorros sean reales y no diferidos a retrabajos, escalaciones o revisión humana.
Mantengo un conjunto de evaluación en cada carga de trabajo que muevo a Mini. Si la calidad cae por debajo del umbral, la hoja de cálculo deja de importar.
Descuentos Batch y Flex
Dos palancas adicionales:
- Batch API: descuento fijo del 50% en entrada y salida, procesamiento asíncrono en 24 horas. En Mini: $0.375 de entrada y $2.25 de salida por millón. La mayoría de los lotes se completan en 1–6 horas.
- Flex pricing: también 50% de descuento, con latencia variable en lugar de cola asíncrona. Útil para herramientas internas no orientadas al usuario.
Verifica la facturación exacta en un lote de prueba pequeño antes de comprometer una carga de trabajo grande — los documentos de precios para desarrolladores de OpenAI son la fuente de verdad.
Factores de costo ocultos
Proliferación de tokens de salida
El modo de falla que veo con más frecuencia, y no tiene nada que ver con el modelo.
Los tokens de salida cuestan 6x los tokens de entrada en Mini. Si no limitas la longitud de salida, un modelo que ocasionalmente devuelve 2,000 tokens cuando 200 serían suficientes está inflando silenciosamente tu factura en un orden de magnitud. Las soluciones son aburridas:
- Configura
max_tokensen cada llamada. - Usa salidas estructuradas o modos JSON estrictos donde el esquema limite la respuesta.
- Para clasificación, devuelve una etiqueta. No una explicación. Una etiqueta.
Detecté una carga de trabajo donde Mini promediaba 480 tokens de salida porque el prompt de sistema pedía “una breve justificación.” Breve, aparentemente, significa lo que el modelo quiera. Después de eliminar el campo de justificación y agregar max_tokens, la salida cayó a 12 tokens. La factura cayó en consecuencia.
La proliferación de salida consume cualquier ahorro que te da la tarifa más barata por token. Primera cosa a auditar.
El caché requiere prefijos estables
Un “prompt de sistema consistente” en términos de revisión de código no es lo mismo que “estable byte a byte.” Si tu prompt de sistema incluye la fecha actual, un campo de personalización específico del usuario al principio, un bloque de documento recuperado que varía por solicitud, o cualquier variante A/B — el caché queda destruido para ese prefijo.
La caché solo se aplica al prefijo compartido más largo desde el inicio de la entrada. La solución es estructural: fija el contenido estable al principio, pon las variables al final.
Esto suena obvio. Aun así he visto sistemas en producción donde se asumía que el caché estaba activo y no lo estaba. Verifica tu tasa de acierto de caché. No lo asumas.
Quién debería usar Mini por costo
Casos ideales vs. casos donde rinde menos
Mini funciona bien para clasificación de alto volumen, etiquetado, decisiones de enrutamiento, resumen de entrada estructurada, extracción de primer paso donde un modelo frontera revisa casos extremos, y chat acotado. Cualquier cosa donde puedas limitar agresivamente la longitud de salida.
Mini rinde menos en razonamiento de múltiples pasos a lo largo de cadenas largas, en salidas donde la calidad determina la confianza del usuario (redacción legal, análisis orientado al cliente), en tareas donde los casos extremos son comunes y caros de perder, y donde la brecha de evaluación entre Mini y GPT-5.4 en tu tarea es medible.
La prueba honesta es tu propio conjunto de evaluación con tus propios datos. Si la precisión de Mini está dentro de una banda aceptable de GPT-5.4, los ahorros son reales. Si no, estás pagando un descuento en retrabajo, tickets de soporte y fricción del usuario — que nunca aparece en la factura de la API pero absolutamente aparece en algún lugar.
Audito cada pocas semanas las cargas de trabajo que han estado en Mini por un tiempo. La deriva es real. Los desgloses de comparación de precios de la API de OpenAI mantienen una vista actualizada si necesitas reevaluar el enrutamiento.
Preguntas frecuentes
¿Cuánto cuesta realmente GPT-5.4 Mini comparado con GPT-5.5?
Aproximadamente una séptima parte por token. GPT-5.4 Mini es $0.75 de entrada y $4.50 de salida por millón de tokens; GPT-5.5 es $5.00 de entrada y $30.00 de salida. A volumen equivalente sin caché, Mini cuesta aproximadamente el 15% de GPT-5.5. Si eso se traduce en ahorros reales depende de si Mini maneja tu tarea sin regresión de calidad. Consulta la página del modelo GPT-5.5 de OpenAI para la tabla de precios entre modelos.
¿Se aplican los precios de entrada en caché a GPT-5.4 Mini?
Sí. La entrada en caché en GPT-5.4 Mini es $0.075 por millón de tokens, un descuento del 90% sobre la tarifa estándar de $0.75. Automático cuando tu prompt reutiliza un prefijo estable que OpenAI ya ha calculado. La caché expira después de varios minutos de inactividad y requiere que el prefijo sea suficientemente largo (alrededor de 1,024 tokens). El precio de salida no se ve afectado.
¿Hay descuento por lote para GPT-5.4 Mini?
Sí. La Batch API ofrece un descuento fijo del 50% tanto en entrada como en salida para el endpoint de la API de gpt 5.4 mini, con procesamiento en 24 horas. Las tarifas efectivas por lote son $0.375 de entrada y $2.25 de salida por millón de tokens. El precio Flex ofrece un descuento similar del 50% con latencia variable en lugar de cola asíncrona.
¿Cómo estimo el costo real de una carga de trabajo de alto volumen en Mini?
Tres números: tokens de entrada por solicitud, tokens de salida por solicitud, conteo de solicitudes por mes. Multiplica por la tarifa correspondiente. Para mayor precisión, muestrea 100 solicitudes reales, mide los conteos reales de tokens y verifica tu tasa de acierto de caché. Las calculadoras te dan un techo. Los datos muestreados te dan la realidad.
¿Cuándo es GPT-5.4 Mini demasiado débil para la tarea aunque sea más barato?
Cuando tu conjunto de evaluación muestra una regresión de calidad medible comparado con GPT-5.4 o GPT-5.5 en los resultados que importan. Desencadenantes comunes: razonamiento de múltiples pasos, seguimiento de instrucciones en prompts largos, casos extremos donde una respuesta incorrecta es cara, salidas que deben leerse como escritura pulida. Los ahorros no son reales si empujan el trabajo hacia revisión manual o errores orientados al usuario. Ejecuta la evaluación primero.
Conclusión
Los precios de GPT-5.4 Mini son sencillos en papel: $0.75 de entrada, $0.075 de entrada en caché, $4.50 de salida, por millón de tokens. Donde los números se vuelven interesantes es en las tasas de acierto de caché, la disciplina de tokens de salida, el enrutamiento por lotes, y si el modelo es realmente lo suficientemente bueno para la tarea.
Las tarifas más baratas por token son necesarias pero no suficientes. La proliferación de salida, el caché roto y las regresiones de calidad pueden cada uno independientemente borrar los ahorros. Los números solo funcionan si haces los cálculos con tu propia carga de trabajo.
Este mes estoy ejecutando una migración más — un pipeline de resumen actualmente en GPT-5.4 que creo se sostendrá en Mini con límites de salida más estrictos. La proyección de costos dice 70% de ahorro. Veremos qué dice la evaluación. Continúo la próxima semana.
Artículos anteriores:
- GPT-5.4 Mini API: Precios, Enrutamiento y Cargas de Trabajo en Producción
- Precio de MiniMax M3: Costo de API de Contexto Largo, Caché y Economía de Tokens
- API de MiniMax M3: Ventana de Contexto, Rutas de Acceso y Compensaciones en Producción
- De Agentes de Codificación IA a Plataformas de Inferencia
- Precios de Claude Mythos 5: Costo de API, Contexto y Economía en Producción
