API GPT-5.4 Mini : Tarifs, Contexte et Utilisation en Production

API GPT-5.4 Mini pour les développeurs : tarifs, fenêtre de contexte, support des outils et les charges de travail à fort volume dans une configuration de routage.

By Dora 11 min read

L’API GPT-5.4 Mini est disponible depuis le 17 mars. J’achemine du trafic réel à travers elle depuis environ trois mois, en parallèle de trois autres modèles. Cet article est la note de travail sur où elle s’intègre réellement.

Dora ici. Une clarification avant toute chose, parce que je vois constamment des gens confus à ce sujet : GPT-5.4 n’est plus le modèle frontier d’OpenAI. GPT-5.5 l’est. Nous avons couvert le lancement du 5.5 dans un article séparé, et les articles sur la fuite pré-lancement du 5.4 de mars sont par définition obsolètes. Ce que j’écris ici est plus ciblé — mini et nano comme niveau de routage à faible coût, qui est le rôle dans lequel ils s’installent.

Si vous construisez du routage de modèles pour des charges de travail IA en production, cette distinction compte plus que la fiche technique.

Où s’intègre GPT-5.4 Mini

Sorti le 17 mars 2026 comme variante rapide / à faible coût

OpenAI a lancé GPT-5.4 mini et nano le 17 mars comme versions plus petites du lancement GPT-5.4 quelques semaines plus tôt. Le cadrage dans l’annonce est honnête sur ce qu’ils sont : des versions distillées, moins chères et plus rapides pour les travaux à fort volume. Plus de 2× plus rapide que GPT-5 mini, selon les chiffres d’OpenAI. (Leurs chiffres, leurs conditions. Je n’ai pas réalisé le benchmark contrôlé — mais en latence de charge de travail réelle, « plus rapide » correspond à ce que j’observe.)

La grande question pour les développeurs n’est pas « mini est-il bon » — c’est « bon pour quoi ». C’est la partie que l’annonce minimise et que la question du routage rend évidente.

Accès API (mini aussi sur le niveau gratuit de ChatGPT)

Trois endroits pour utiliser le modèle gpt 5.4 mini : l’API OpenAI directement, dans ChatGPT (y compris le niveau gratuit — oui, le niveau gratuit), et via des agrégateurs qui routent vers le point de terminaison d’OpenAI. GitHub Copilot l’a également adopté le premier jour — leur changelog est paru le 17 mars en parallèle de l’annonce OpenAI.

Nano est uniquement API. Pas de surface ChatGPT pour lui. Bon à savoir si vous êtes tenté de diriger les utilisateurs directement vers nano — vous ne pouvez pas, seulement vers l’intégration API que vous construisez autour de lui.

Tarification & Contexte

Tarifs d’entrée/sortie & entrée en cache

Chiffres à la date de publication, depuis la page officielle des modèles OpenAI. Ces chiffres évoluent, vérifiez avant de vous engager :

  • GPT-5.4 mini : $0,75 par 1M d’entrée, $4,50 par 1M de sortie, $0,075 entrée en cache
  • GPT-5.4 nano : $0,20 par 1M d’entrée, $1,25 par 1M de sortie

Le tarif d’entrée en cache est celui autour duquel je planifierais réellement. $0,075 représente une réduction de 10× sur l’entrée, et pour toute charge de travail avec un prompt système stable ou un contexte répété (presque chaque agent, la plupart des interfaces de chat, tout ce qui a la forme RAG), la mise en cache finit par faire le gros du travail sur les coûts. Le tarif gpt 5.4 mini en titre est le pire cas, pas le cas typique.

Une note de bas de page : les points de terminaison de traitement régional (résidence des données) comportent une majoration de 10 %. Pas énorme, mais vaut la peine d’être modélisé si vous routez via l’UE ou d’autres surfaces régionales.

Fenêtre de contexte

La documentation d’OpenAI indique 400K tokens de contexte, 128K de sortie maximale pour mini. J’ai vu des pages d’agrégateurs citer des chiffres différents (l’un avait 1,1M, ce qui ne correspond pas à la source). En cas de doute, la page officielle du modèle l’emporte — et le chiffre officiel est 400K.

J’ai testé à 350K (une transcription d’agent bien remplie plus des sorties d’outils). Ça a fonctionné correctement. Je n’ai pas poussé jusqu’à la limite — à ce niveau de prix, je préfère router les cas vraiment à long contexte vers un modèle frontier plutôt que de stress-tester le plafond de mini.

Charges de Travail de Production les Mieux Adaptées

Tâches à fort volume et sensibles à la latence

C’est là que mini mérite sa place dans la table de routage. Le schéma qui a tenu sur les projets où je l’ai utilisé :

  • Classification, extraction, reformatage léger — tout ce qui nécessite une réponse structurée rapide et dont le raisonnement comporte une ou deux étapes. Mini le gère à une fraction du coût frontier.
  • Longues sessions de chat avec des tours simples — quand 80 % des tours ne nécessitent pas de raisonnement lourd, payer les tarifs GPT-5.5 pour tous est simplement inutile.
  • Sous-tâches à fort éventail — générer 50 variantes de quelque chose, évaluer 200 documents récupérés, etc. La différence de coût unitaire se cumule rapidement.

Là où je l’ai vu échouer : tout ce qui nécessite une planification multi-étapes approfondie, ou lorsque le modèle doit décider quoi faire plutôt qu’exécuter une étape bien spécifiée. (J’avais un workflow où mini était le planificateur. Trois jours. J’ai changé. Ne faites pas comme moi.)

Utilisation d’outils et sous-tâches d’agents

Vaut la peine d’être signalé car c’est la partie qui m’a surpris. Selon l’annonce, sur OSWorld-Verified — un benchmark d’utilisation informatique — mini approche le GPT-5.4 complet et surpasse substantiellement GPT-5 mini. En utilisation réelle, je le décrirais ainsi : fiable pour exécuter les appels d’outils une fois qu’un plan existe, moins fiable pour décider quel outil utiliser dans une situation ambiguë.

Donc le schéma qui fonctionne :

  1. Le modèle frontier (GPT-5.5 ou un autre) planifie et décide.
  2. Mini exécute les étapes — appelle les outils, analyse les résultats, restitue au planificateur.

OpenAI appelle cela « sous-agents dans Codex ». La forme générale est plus ancienne que ce terme — c’est simplement la division standard planificateur lourd / exécuteur bon marché. Mini est inhabituellement bon dans le siège d’exécuteur.

Routage de Mini dans une Configuration Multi-Modèles

Quand escalader vers un modèle frontier

Le routage est tout le jeu avec mini. Utilisez-le partout aveuglément et vous ressentirez des échecs de raisonnement sur les tours difficiles. Ne l’utilisez pas du tout et vous brûlerez de l’argent sur les tours faciles. Les règles d’escalade que j’utilise, approximativement par ordre d’importance :

  1. Escalader sur les questions de type planification. Tout ce qui nécessite de choisir une stratégie, de décomposer un objectif ambigu ou de peser des compromis. Mini va bien quand il sait quoi faire. Il peine quand il doit déterminer quoi faire.

  2. Escalader sur les entrées >272K tokens. Pas parce que mini ne peut pas prendre 400K — il peut — mais parce qu’une fois que vos prompts sont aussi grands, la charge de travail implique généralement un raisonnement inter-documents qui bénéficie d’un modèle frontier. (GPT-5.5 facture également 2× l’entrée au-dessus de 272K, donc le tableau des coûts change aussi là.)

  3. Escalader sur les appels uniques à enjeux élevés. Si la réponse compte et qu’il n’y a pas de révision humaine en aval, payez le supplément. Le delta de coût sur un appel est non pertinent ; le coût d’avoir tort ne l’est pas.

  4. Ne pas escalader simplement parce que la question « semble difficile ». C’est ainsi que mini finit sous-utilisé. Beaucoup de questions qui « semblent difficiles » sont en réalité bien spécifiées et mini les gère. Testez avant de supposer.

Une configuration pratique : avoir un classificateur bon marché (mini lui-même, ou nano) qui décide du routage. Ce n’est pas parfait, mais c’est mieux que de tout router vers le frontier ou tout router vers mini.

Limites & Compromis

Quelques vrais que j’ai rencontrés, listés pour ce qu’ils sont :

  • Nano est significativement plus faible que mini. L’écart de tarification suggère qu’ils sont dans la même conversation. Ils ne le sont pas. Nano fonctionne pour des tâches très étroites (classification bon marché, routage de sous-étapes). Pour tout ce qui nécessite même un raisonnement modeste, mini l’emporte par une marge plus grande que le ratio de prix ne le suggère. Ne choisissez pas nano uniquement pour le coût.
  • Fenêtre de contexte vs utilisabilité du contexte. 400K est le plafond. Le modèle reste toujours plus cohérent sur les premiers 100K que sur les derniers 100K — comme presque tous les modèles à grand contexte. Planifiez votre prompt en conséquence.
  • Le mini dans l’API OpenAI est aussi le mini dans ChatGPT gratuit. Cela compte moins pour les développeurs et davantage pour le positionnement produit — si vous construisez quelque chose que les utilisateurs pourraient faire gratuitement dans ChatGPT, la différenciation doit venir de votre application, pas de l’accès au modèle.
  • GPT-5.4 n’est plus frontier. Je l’ai noté en haut mais ça vaut la peine de le répéter dans la section des limites. Ne présentez pas un produit autour de « propulsé par GPT-5.4 » comme s’il était à la pointe — quiconque fait attention sait que ce n’est pas le cas. La présentation honnête est la logique de routage, pas le nom du modèle.

Je signalerais aussi la chose ennuyeuse : le comportement de l’API évolue. Épinglez des instantanés de modèles si vous vous souciez de la reproductibilité. Les alias de routage automatique (gpt-5.4-mini) se déplaceront silencieusement vers des instantanés plus récents au fil du temps.

FAQ

GPT-5.4 Mini est-il uniquement disponible via l’API ou aussi dans ChatGPT ?

Les deux. L’API GPT-5.4 Mini est la surface développeur. Le même modèle fonctionne également dans ChatGPT, y compris le niveau gratuit. Nano est uniquement API.

Quelle est la taille réelle de la fenêtre de contexte pour GPT-5.4 Mini ?

400K tokens d’entrée, 128K de sortie maximale, selon la documentation officielle d’OpenAI. Certaines pages d’agrégateurs listent d’autres chiffres — en cas de conflit, la page du modèle d’OpenAI l’emporte.

GPT-5.4 Mini prend-il en charge l’utilisation d’outils et les entrées multimodales ?

Oui. Entrées texte et image, plus appel de fonctions, recherche web, recherche de fichiers, utilisation informatique et compétences via l’API Responses. Sortie texte uniquement. Solide sur l’exécution d’outils ; moins solide pour décider quel outil utiliser dans une situation ambiguë.

Quand devrais-je router une tâche vers GPT-5.5 plutôt que d’utiliser Mini ?

Quand la tâche nécessite de la planification plutôt que de l’exécution, quand l’entrée dépasse ~272K tokens, quand la qualité de la réponse sur un seul appel compte plus que le delta de coût, ou quand vous observez des échecs de raisonnement que vous pouvez attribuer à la capacité du modèle plutôt qu’à la forme du prompt. Pour tout le reste, mini.

Comment décider entre GPT-5.4 Mini et d’autres modèles dans une configuration de routage ?

Exécutez un petit échantillon de trafic de production réel à travers chaque modèle candidat. Mesurez le coût, la latence et une métrique de qualité spécifique à la tâche qui vous importe réellement — pas un benchmark générique. Puis routez en conséquence. La décision est empirique et par charge de travail ; aucune règle générale ne résiste au contact avec vos données.

Conclusion

Ce qui est intéressant dans l’API GPT-5.4 Mini, ce n’est pas sa puissance. C’est que c’est le bon modèle à placer dans le siège d’exécuteur d’une configuration de routage — la couche bon marché et rapide qui fait la majeure partie du travail pendant qu’un modèle frontier gère la petite fraction de tours où la capacité compte le plus.

Si votre stack est encore mono-modèle — un seul modèle gère tout — vous surpayez soit sur les tours faciles soit sous-performez sur les tours difficiles. Ou les deux. Ce en quoi mini est bon, ce n’est pas d’être le modèle le plus intelligent dans la salle. C’est d’être le modèle le moins cher qui est suffisamment intelligent pour la majeure partie de la salle.

Ce que je ferais réellement avant de l’ajouter à une couche de routage :

Faites tourner une semaine de trafic réel à travers lui sur les charges de travail que vous lui confieriez. Mesurez le coût, la latence et la qualité sur quelle que soit la métrique dont dépend réellement votre produit. Épinglez l’instantané. Construisez la règle d’escalade avant de déployer, pas après.

Trois mois suffisent pour dire que mini tient en production. Pas suffisamment pour dire quoi que ce soit sur la stabilité des prix à long terme — c’est la responsabilité d’OpenAI.

À vérifier par rapport à la documentation le jour où vous construisez réellement.

La suite arrive.

Articles précédents :