Prix de GPT-5.4 Mini : coûts d'entrée, mis en cache et de sortie
Tarification de GPT-5.4 Mini expliquée : coûts des tokens d'entrée, d'entrée mise en cache et de sortie, et pourquoi les petits modèles réduisent les factures API à fort volume.
Bonjour, c’est Dora. Je fais transiter une charge de travail de classification à volume élevé via OpenAI depuis quelques semaines. La question que je recevais constamment de la finance était celle que posent les développeurs chaque fois qu’un modèle « mini » sort : est-ce que le calcul fonctionne vraiment, ou le tarif moins cher par token est-il absorbé par autre chose ?
Cet article s’adresse à quiconque effectue le même calcul sur la tarification GPT-5.4 Mini en ce moment — développeurs soucieux des coûts, responsables techniques proches de la finance. Je vais détailler les tarifs d’entrée, d’entrée mise en cache et de sortie, expliquer où l’économie unitaire fonctionne, et signaler où Mini coûte discrètement plus cher que le titre ne le suggère. Tous les tarifs proviennent de la page officielle de tarification API d’OpenAI, vérifiée à la date de publication — ces tarifs changent, donc vérifiez avant de citer.
Ce n’est pas le guide d’intégration. Le routage et le contrat API font l’objet d’un article séparé. Celui-ci parle d’argent.
Détail des coûts GPT-5.4 Mini
Tarifs d’entrée vs sortie
GPT-5.4 Mini est facturé 0,75 $ par million de tokens en entrée et 4,50 $ par million de tokens en sortie. Le multiplicateur de 6x sur la sortie est ce que la plupart des gens comprennent trop tard. L’entrée est bon marché. La sortie, c’est ce qui brûle le budget.
Pour situer Mini dans la famille GPT-5.4 à la date de publication :
| Modèle | Entrée ($/M) | Entrée mise en cache ($/M) | Sortie ($/M) |
|---|---|---|---|
| GPT-5.5 | 5,00 $ | 0,50 $ | 30,00 $ |
| GPT-5.4 | 2,50 $ | 0,25 $ | 15,00 $ |
| GPT-5.4 Mini | 0,75 $ | 0,08 $ | 4,50 $ |
Mini est environ 3,3x moins cher que GPT-5.4 et 6,7x moins cher que GPT-5.5. Ce ratio est l’essentiel lorsque vous décidez si une charge de travail appartient à Mini.
Les tarifs standard s’appliquent aux fenêtres de contexte inférieures à ~270K tokens en entrée. Au-delà, OpenAI applique un tarif d’entrée 2x et de sortie 1,5x à la session complète — y compris sous les niveaux Batch et Flex. La surprise la plus coûteuse de la plateforme.
Remise sur l’entrée mise en cache
L’entrée mise en cache sur GPT-5.4 Mini est de 0,075 $ par million de tokens — une réduction de 90 % par rapport au tarif d’entrée standard, correspondant au schéma des familles GPT-5.4 et GPT-5.5. Le cache est automatique : pas de flag API, pas de changement de code. Si votre requête réutilise un préfixe qu’OpenAI a déjà calculé, ces tokens sont facturés au tarif mis en cache.
Les règles importantes :
- Le préfixe doit être stable octet par octet. Un horodatage dans votre prompt système tue le cache.
- Le préfixe doit être suffisamment long (minimum environ 1 024 tokens).
- Le cache expire après quelques minutes d’inactivité.
- Le tarif de sortie ne change pas.
Pour les applications RAG avec de grands prompts système stables, des taux de succès de cache supérieurs à 70 % sont réalistes. Pour les charges de travail à un seul tour sans préambule partagé, le cache aide à peine. Les économies sont réelles mais conditionnelles, c’est pourquoi je ne les cite jamais comme un pourcentage fixe à la finance.
Pourquoi les petits modèles gagnent sur les volumes élevés
Calcul coût par tâche vs modèles frontier
La bonne unité n’est pas le coût par token. C’est le coût par tâche réussie. Une charge de travail représentative — classification d’un million de tickets de support courts, 800 tokens en entrée et 200 en sortie chacun, sans mise en cache :
| Modèle | Coût entrée | Coût sortie | Total |
|---|---|---|---|
| GPT-5.5 | 4 000 $ | 6 000 $ | 10 000 $ |
| GPT-5.4 | 2 000 $ | 3 000 $ | 5 000 $ |
| GPT-5.4 Mini | 600 $ | 900 $ | 1 500 $ |
Basé sur la tarification standard d’OpenAI en juin 2026. Calcul à titre d’exemple uniquement — les prix réels peuvent varier selon la région, le taux de succès du cache, les remises sur volume ou d’autres facteurs. Vérifiez toujours la page officielle de tarification OpenAI avant de citer.
Mini s’en tire à 15 % de la facture de GPT-5.5. La question est de savoir si la précision de Mini sur votre tâche est suffisamment proche pour que les économies soient réelles et non reportées en retravail, escalades ou révision humaine.
Je maintiens un ensemble d’évaluation sur chaque charge de travail que je migre vers Mini. Si la qualité tombe en dessous du seuil, la feuille de calcul cesse d’avoir de l’importance.
Remises Batch & Flex
Deux leviers supplémentaires :
- API Batch : remise plate de 50 % sur l’entrée et la sortie, traitement asynchrone dans les 24 heures. Sur Mini : 0,375 $ en entrée et 2,25 $ en sortie par million. La plupart des lots se terminent en 1 à 6 heures.
- Tarification Flex : également 50 % de réduction, avec une latence variable plutôt qu’une mise en file d’attente asynchrone. Utile pour les outils internes non destinés aux utilisateurs.
Vérifiez la facturation exacte sur un petit lot de test avant de vous engager sur une grande charge de travail — la documentation de tarification pour développeurs OpenAI est la source de vérité.
Facteurs de coût cachés
Débordement des tokens de sortie
Le mode d’échec que je vois le plus souvent, et il n’a rien à voir avec le modèle.
Les tokens de sortie coûtent 6x les tokens d’entrée sur Mini. Si vous ne contraignez pas la longueur de sortie, un modèle qui retourne occasionnellement 2 000 tokens quand 200 suffiraient gonfle silencieusement votre facture d’un ordre de grandeur. Les correctifs sont ennuyeux :
- Définissez
max_tokenssur chaque appel. - Utilisez des sorties structurées ou des modes JSON stricts où le schéma délimite la réponse.
- Pour la classification, retournez un label. Pas une explication. Un label.
J’ai détecté une charge de travail où Mini produisait en moyenne 480 tokens de sortie parce que le prompt système demandait « une brève justification ». Bref signifiait apparemment ce que le modèle voulait. Après avoir supprimé le champ de justification et ajouté max_tokens, la sortie est tombée à 12 tokens. La facture a suivi.
Le débordement de sortie annule toutes les économies que le tarif moins cher par token vous procure. Premier élément à auditer.
La mise en cache exige des préfixes stables
Un « prompt système cohérent » en termes de révision de code n’est pas la même chose que « stable octet par octet ». Si votre prompt système inclut la date actuelle, un champ de personnalisation utilisateur en haut, un bloc de document récupéré qui varie par requête, ou une variante A/B — la mise en cache est annulée pour ce préfixe.
Le cache s’applique uniquement au préfixe partagé le plus long depuis le début de l’entrée. La correction est structurelle : épinglez le contenu stable au début, placez les variables à la fin.
Cela semble évident. J’ai quand même vu des systèmes en production où la mise en cache était supposée active et ne l’était pas. Vérifiez votre taux de succès du cache. Ne supposez rien.
Qui devrait utiliser Mini pour les coûts
Cas idéaux vs cas où il sous-performe
Mini fonctionne bien pour la classification à volume élevé, le balisage, les décisions de routage, la résumation d’entrées structurées, l’extraction en première passe où un modèle frontier examine les cas limites, et le chat délimité. Tout ce où vous pouvez contraindre agressivement la longueur de sortie.
Mini sous-performe sur le raisonnement multi-étapes sur de longues chaînes, sur les sorties où la qualité détermine la confiance des utilisateurs (rédaction juridique, analyse destinée aux clients), sur les tâches où les cas limites sont fréquents et coûteux à manquer, et là où l’écart d’évaluation entre Mini et GPT-5.4 sur votre tâche est mesurable.
Le test honnête est votre propre ensemble d’évaluation sur vos propres données. Si la précision de Mini est dans une bande acceptable de GPT-5.4, les économies sont réelles. Sinon, vous payez pour une remise en retravail, tickets de support et friction utilisateur — ce qui n’apparaît jamais sur la facture API mais apparaît absolument quelque part.
J’audite toutes les quelques semaines les charges de travail qui sont sur Mini depuis un moment. La dérive est réelle. Les comparaisons de tarification API OpenAI maintiennent une vue actualisée si vous devez réévaluer le routage.
FAQ
Combien coûte réellement GPT-5.4 Mini par rapport à GPT-5.5 ?
Environ un septième par token. GPT-5.4 Mini est à 0,75 $ en entrée et 4,50 $ en sortie par million de tokens ; GPT-5.5 est à 5,00 $ en entrée et 30,00 $ en sortie. À volume équivalent sans mise en cache, Mini coûte environ 15 % de GPT-5.5. Que cela se traduise par des économies réelles dépend de si Mini gère votre tâche sans régression de qualité. Voir la page du modèle GPT-5.5 d’OpenAI pour le tableau de tarification inter-modèles.
La tarification des entrées mises en cache s’applique-t-elle à GPT-5.4 Mini ?
Oui. L’entrée mise en cache sur GPT-5.4 Mini est de 0,075 $ par million de tokens, soit une remise de 90 % sur le tarif standard de 0,75 $. Automatique lorsque votre prompt réutilise un préfixe stable qu’OpenAI a déjà calculé. Le cache expire après quelques minutes d’inactivité et nécessite que le préfixe soit suffisamment long (environ 1 024 tokens). Le tarif de sortie n’est pas affecté.
Y a-t-il une remise batch pour GPT-5.4 Mini ?
Oui. L’API Batch offre une remise plate de 50 % sur l’entrée et la sortie pour l’endpoint api gpt 5.4 mini, avec un traitement dans les 24 heures. Les tarifs batch effectifs sont de 0,375 $ en entrée et 2,25 $ en sortie par million de tokens. La tarification Flex offre une remise similaire de 50 % avec une latence variable plutôt qu’une mise en file d’attente asynchrone.
Comment estimer le coût réel d’une charge de travail à volume élevé sur Mini ?
Trois chiffres : tokens en entrée par requête, tokens en sortie par requête, nombre de requêtes par mois. Multipliez par le tarif correspondant. Pour plus de précision, échantillonnez 100 vraies requêtes, mesurez les comptes de tokens réels et vérifiez votre taux de succès du cache. Les calculateurs vous donnent un plafond. Les données échantillonnées vous donnent la réalité.
Quand GPT-5.4 Mini est-il trop faible pour la tâche même s’il est moins cher ?
Lorsque votre ensemble d’évaluation montre une régression de qualité mesurable par rapport à GPT-5.4 ou GPT-5.5 sur les sorties qui comptent. Déclencheurs courants : raisonnement multi-étapes, suivi d’instructions sur de longs prompts, cas limites où une mauvaise réponse est coûteuse, sorties qui doivent être lues comme une écriture soignée. Les économies ne sont pas réelles si elles poussent le travail vers la révision manuelle ou des erreurs visibles par les utilisateurs. Exécutez l’évaluation en premier.
Conclusion
La tarification GPT-5.4 Mini est simple sur le papier : 0,75 $ en entrée, 0,075 $ en entrée mise en cache, 4,50 $ en sortie, par million de tokens. Là où les chiffres deviennent intéressants, c’est dans les taux de succès du cache, la discipline des tokens de sortie, le routage batch, et si le modèle est réellement assez bon pour la tâche.
Des tarifs moins chers par token sont nécessaires mais pas suffisants. Le débordement de sortie, une mise en cache défaillante et des régressions de qualité peuvent chacun indépendamment effacer les économies. Le calcul ne fonctionne que si vous faites le calcul sur votre propre charge de travail.
Je mène une migration de plus ce mois-ci — un pipeline de résumation actuellement sur GPT-5.4 que je pense supportera Mini avec des limites de sortie plus strictes. La projection de coût indique 70 % d’économies. Nous verrons ce que dit l’évaluation. Suite la semaine prochaine.
Articles précédents :
- GPT-5.4 Mini API : Tarification, Routage & Charges de Travail en Production
- Prix MiniMax M3 : Coût API Long Contexte, Mise en Cache & Économie des Tokens
- API MiniMax M3 : Fenêtre de Contexte, Chemins d’Accès & Compromis en Production
- Des Agents de Codage IA aux Plateformes d’Inférence
- Tarification Claude Mythos 5 : Coût API, Contexte & Économie en Production
