API de GPT-5.4 Mini: Precios, Contexto y Uso en Producción
API de GPT-5.4 Mini para desarrolladores: precios, ventana de contexto, soporte de herramientas y las cargas de trabajo de alto volumen que se adaptan a una configuración de enrutamiento.
La API de GPT-5.4 Mini está disponible desde el 17 de marzo. He estado enrutando tráfico real a través de ella durante aproximadamente tres meses, junto con otros tres modelos. Este artículo es la nota de trabajo sobre dónde encaja realmente.
Soy Dora. Una aclaración antes de cualquier otra cosa, porque sigo viendo a personas confundidas al respecto: GPT-5.4 ya no es la frontera de OpenAI. GPT-5.5 lo es. Cubrimos el lanzamiento de la 5.5 en un artículo separado, y los artículos sobre la filtración previa al lanzamiento de la 5.4 de marzo están, por definición, desactualizados. Lo que escribo aquí es más concreto — mini y nano como nivel de enrutamiento de bajo costo, que es el papel que están adoptando.
Si estás construyendo enrutamiento de modelos para cargas de trabajo de IA en producción, esa distinción importa más que la hoja de especificaciones.
Dónde encaja GPT-5.4 Mini
Lanzado el 17 de marzo de 2026 como variante rápida y de bajo costo
OpenAI lanzó GPT-5.4 mini y nano el 17 de marzo como versiones más pequeñas del lanzamiento de GPT-5.4 de un par de semanas antes. El enfoque del anuncio es honesto sobre lo que son: versiones destiladas, más baratas y rápidas para trabajo de alto volumen. Más de 2× más rápido que GPT-5 mini, según los números de OpenAI. (Sus números, sus condiciones. No he ejecutado el benchmark controlado, pero en la latencia de carga de trabajo real, “más rápido” coincide con lo que veo.)
La pregunta más importante para los desarrolladores no es “¿es mini bueno?” — es “bueno ¿para qué?”. Esa es la parte que el anuncio minimiza y que la pregunta de enrutamiento hace obvia.
Acceso a la API (mini también en el nivel gratuito de ChatGPT)
Tres lugares para usar el modelo gpt 5.4 mini: la API de OpenAI directamente, dentro de ChatGPT (incluyendo el nivel gratuito — sí, el nivel gratuito), y a través de agregadores que enrutan al endpoint de OpenAI. GitHub Copilot también lo incorporó el primer día — su registro de cambios llegó el 17 de marzo junto con el anuncio de OpenAI.
Nano es solo para API. No hay superficie en ChatGPT para él. Vale la pena saberlo si tienes la tentación de dirigir a los usuarios directamente a nano — no puedes, solo a la integración de API que construyas alrededor de él.
Precios y Contexto
Tarifas de entrada/salida e entrada en caché
Números a la fecha de publicación, de la página oficial de modelos de OpenAI. Estos cambian, así que verifica antes de comprometerte:
- GPT-5.4 mini: $0.75 por 1M de entrada, $4.50 por 1M de salida, $0.075 entrada en caché
- GPT-5.4 nano: $0.20 por 1M de entrada, $1.25 por 1M de salida
La tarifa de entrada en caché es la que realmente tendría en cuenta para planificar. $0.075 es un descuento de 10× en la entrada, y para cualquier carga de trabajo con un prompt de sistema estable o contexto repetido (casi todo agente, la mayoría de interfaces de chat, cualquier cosa con forma de RAG), el caché termina haciendo el trabajo pesado en costo. El precio titular de gpt 5.4 mini es el peor caso, no el caso típico.
Una nota al pie: los endpoints de procesamiento regional (residencia de datos) tienen un incremento del 10%. No es enorme, pero vale la pena modelarlo si estás enrutando a través de la UE u otras superficies regionales.
Ventana de contexto
Los documentos de OpenAI indican 400K tokens de contexto, 128K de salida máxima para mini. He visto páginas de agregadores citar números diferentes (uno tenía 1.1M, que no coincide con la fuente). Ante la duda, la página oficial del modelo gana — y el número oficial es 400K.
Probé a 350K (una transcripción de agente completa más salidas de herramientas). Funcionó bien. No lo llevé al límite — a este precio prefiero enrutar los casos de contexto genuinamente largo a un modelo de frontera que someter a prueba de estrés el techo de mini.
Cargas de Trabajo de Producción más Adecuadas
Tareas de alto volumen y sensibles a la latencia
Aquí es donde mini se gana su lugar en la tabla de enrutamiento. El patrón que se ha mantenido en los proyectos en los que lo he usado:
- Clasificación, extracción, reformateo ligero — cualquier cosa donde necesitas una respuesta estructurada rápida y el razonamiento es de uno o dos pasos. Mini lo maneja a una fracción del costo de frontera.
- Sesiones de chat largas con turnos simples — cuando el 80% de los turnos no necesitan razonamiento intensivo, pagar tarifas completas de GPT-5.5 en todos ellos simplemente está mal.
- Subtareas de alto paralelismo — generar 50 variantes de algo, puntuar 200 documentos recuperados, etc. La diferencia de costo unitario se compone rápidamente.
Donde lo he visto fallar: cualquier cosa que necesite planificación profunda de múltiples pasos, o donde el modelo tiene que decidir qué hacer en lugar de ejecutar un paso bien especificado. (Tuve un flujo de trabajo donde mini era el planificador. Tres días. Lo cambié. No seas yo.)
Uso de herramientas y subtareas de agentes
Vale la pena señalar porque es la parte que me sorprendió. Según el anuncio, en OSWorld-Verified — un benchmark de uso de computadora — mini se acerca al GPT-5.4 completo y supera sustancialmente a GPT-5 mini. En uso real lo describiría así: confiable al ejecutar llamadas a herramientas una vez que existe un plan, menos confiable al decidir qué herramienta usar en un punto ambiguo.
Así que el patrón que funciona:
- El modelo de frontera (GPT-5.5 u otro) planifica y decide.
- Mini ejecuta los pasos — llama a las herramientas, analiza los resultados, devuelve al planificador.
OpenAI llama a esto “subagentes en Codex.” La forma general es más antigua que ese término — es simplemente la división estándar de planificador pesado / ejecutor barato. Mini es excepcionalmente bueno en el rol de ejecutor.
Enrutando Mini en una Configuración Multi-Modelo
Cuándo escalar a un modelo de frontera
El enrutamiento es todo el juego con mini. Úsalo en todas partes a ciegas y sentirás fallos de razonamiento en turnos difíciles. No lo uses en absoluto y quemarás dinero en turnos fáciles. Las reglas de escalada que uso, aproximadamente en orden de importancia:
-
Escalar en preguntas con forma de plan. Cualquier cosa que requiera elegir una estrategia, descomponer un objetivo ambiguo o sopesar compensaciones. Mini está bien cuando sabe qué hacer. Tiene dificultades cuando tiene que averiguar qué hacer.
-
Escalar en entradas >272K tokens. No porque mini no pueda manejar 400K — puede — sino porque una vez que tus prompts son tan grandes, la carga de trabajo generalmente implica razonamiento entre documentos que se beneficia de un modelo de frontera. (GPT-5.5 también cobra 2× en entradas por encima de 272K, por lo que el panorama de costos también cambia allí.)
-
Escalar en llamadas únicas de alta importancia. Si la respuesta importa y no hay revisión humana posterior, paga el extra. El delta de costo en una llamada es irrelevante; el costo de equivocarse no lo es.
-
No escalar solo porque la pregunta “parece difícil.” Así es como mini termina siendo subutilizado. Muchas preguntas que “parecen difíciles” están en realidad bien especificadas y mini las maneja. Prueba antes de asumir.
Una configuración práctica: tener un clasificador barato (el propio mini, o nano) que decida la ruta. No es perfecto, pero es mejor que enrutar todo a frontera o enrutar todo a mini.
Límites y Compensaciones
Algunos reales que he encontrado, listados por lo que son:
- Nano es significativamente más débil que mini. La brecha de precios sugiere que están en la misma conversación. No lo están. Nano funciona para tareas muy específicas (clasificación barata, enrutamiento de subpasos). Para cualquier cosa que necesite incluso un razonamiento modesto, mini gana por un margen más amplio que lo que sugiere la relación de precios. No recurras a nano solo por costo.
- Ventana de contexto vs usabilidad del contexto. 400K es el techo. El modelo sigue siendo mejor para mantener coherencia en los primeros 100K que en los últimos 100K — igual que casi todos los modelos de contexto grande. Planifica tu prompt en consecuencia.
- El mini en la API de OpenAI también es el mini en ChatGPT gratuito. Esto importa menos para los desarrolladores y más para el posicionamiento del producto — si estás construyendo algo que los usuarios podrían hacer en ChatGPT de forma gratuita, la diferenciación tiene que venir de tu aplicación, no del acceso al modelo.
- GPT-5.4 ya no es frontera. Lo mencioné arriba pero vale la pena repetirlo en la sección de límites. No presentes un producto como “impulsado por GPT-5.4” como si fuera de vanguardia — cualquiera que esté prestando atención sabe que no lo es. La presentación honesta es la lógica de enrutamiento, no el nombre del modelo.
También señalaría algo aburrido: el comportamiento de la API cambia. Fija las instantáneas de modelos si te importa la reproducibilidad. Los alias de enrutamiento automático (gpt-5.4-mini) se moverán silenciosamente a instantáneas más nuevas con el tiempo.
Preguntas Frecuentes
¿GPT-5.4 Mini solo está disponible a través de la API o también en ChatGPT?
Ambos. La API de GPT-5.4 Mini es la superficie para desarrolladores. El mismo modelo también funciona en ChatGPT, incluyendo el nivel gratuito. Nano es solo para API.
¿Cuál es el tamaño real de la ventana de contexto para GPT-5.4 Mini?
400K tokens de entrada, 128K de salida máxima, según los documentos oficiales de OpenAI. Algunas páginas de agregadores listan otros números — cuando hay conflicto, la página del modelo de OpenAI gana.
¿GPT-5.4 Mini admite uso de herramientas y entradas multimodales?
Sí. Entradas de texto e imagen, más llamadas a funciones, búsqueda web, búsqueda de archivos, uso de computadora y habilidades a través de la API de Responses. Solo salida de texto. Fuerte en la ejecución de herramientas; menos fuerte en decidir qué herramienta usar bajo ambigüedad.
¿Cuándo debería enrutar una tarea a GPT-5.5 en lugar de usar Mini?
Cuando la tarea requiere planificación en lugar de ejecución, cuando la entrada supera ~272K tokens, cuando la calidad de la respuesta en una sola llamada importa más que el delta de costo, o cuando estás viendo fallos de razonamiento que puedes atribuir a la capacidad del modelo en lugar de la forma del prompt. Para todo lo demás, mini.
¿Cómo decido entre GPT-5.4 Mini y otros modelos en una configuración de enrutamiento?
Ejecuta una pequeña muestra de retención de tráfico de producción real a través de cada modelo candidato. Mide costo, latencia y una métrica de calidad específica de la tarea que realmente te importe — no un benchmark genérico. Luego enruta en consecuencia. La decisión es empírica y por carga de trabajo; ninguna regla general sobrevive el contacto con tus datos.
Conclusión
Lo interesante de la API de GPT-5.4 Mini no es su potencia. Es que es el modelo adecuado para colocar en el rol de ejecutor de una configuración de enrutamiento — la capa barata y rápida que hace la mayor parte del trabajo mientras un modelo de frontera maneja la pequeña fracción de turnos donde la capacidad importa más.
Si tu stack sigue siendo de un solo modelo — un modelo lo maneja todo — estás pagando de más en turnos fáciles o rindiendo por debajo de lo esperado en los difíciles. O ambos. Lo que mini hace bien no es ser el modelo más inteligente de la sala. Es ser el modelo más barato que es suficientemente inteligente para la mayor parte de la sala.
Lo que realmente haría antes de agregarlo a una capa de enrutamiento:
Ejecuta una semana de tráfico real a través de él en las cargas de trabajo que le darías. Mide costo, latencia y calidad en cualquier métrica de la que dependa realmente tu producto. Fija la instantánea. Construye la regla de escalada antes de lanzar, no después.
Tres meses son suficientes para decir que mini se mantiene en producción. No son suficientes para decir nada sobre la estabilidad de precios a largo plazo — eso depende de OpenAI.
A verificar contra los documentos el día que realmente construyas.
Más por venir.
Artículos anteriores:
