GPT-5.4 Mini API: Preise, Kontext & Produktionseinsatz

GPT-5.4 Mini API für Entwickler: Preise, Kontextfenster, Tool-Unterstützung und hochvolumige Workloads in einer Routing-Konfiguration.

By Dora 10 min read

Die GPT-5.4 Mini ​API ist seit dem 17. März verfügbar. Ich leite seit etwa drei Monaten echten Traffic darüber, zusammen mit drei anderen Modellen. Dieser Artikel ist meine Arbeitsnotiz darüber, wo es tatsächlich seinen Platz findet.

Hier ist Dora. Eine Klarstellung vorab, weil ich immer wieder sehe, wie Menschen das verwechseln: GPT-5.4 ist nicht mehr OpenAIs Frontier-Modell. GPT-5.5 ist es. Wir haben den 5.5-Launch in einem separaten Artikel behandelt, und die Artikel über den GPT-5.4-Vorabdurchsickerer vom März sind per Definition veraltet. Was ich hier schreibe, ist enger gefasst – ​Mini und Nano als kostengünstiger Routing-Tier​ – das ist die Rolle, in die sie sich einpendeln.

Wenn Sie Model-Routing für produktive KI-Workloads aufbauen, ist diese Unterscheidung wichtiger als das Datenblatt.

Wo GPT-5.4 Mini seinen Platz findet

Am 17. März 2026 als schnelle / kostengünstige Variante veröffentlicht

OpenAI hat GPT-5.4 Mini und Nano am 17. März als kleinere Geschwister des GPT-5.4-Releases ein paar Wochen zuvor auf den Markt gebracht. Die Formulierung in der Ankündigung ist ehrlich darüber, was sie sind: destillierte, günstigere, schnellere Versionen für Hochvolumen-Arbeit. Mehr als 2× schneller als GPT-5 Mini, laut OpenAIs Zahlen. (Ihre Zahlen, ihre Bedingungen. Ich habe den kontrollierten Benchmark nicht selbst durchgeführt – aber bei der tatsächlichen Workload-Latenz passt „schneller” zu dem, was ich sehe.)

Die größere Frage für Entwickler ist nicht „ist Mini gut” – sondern „gut ​wofür​”. Das ist der Teil, den die Ankündigung herunterspielt und den die Routing-Frage offensichtlich macht.

API-Zugang (Mini auch im kostenlosen ChatGPT-Tier)

Drei Möglichkeiten, das ​gpt 5.4 Mini-Modell​ zu nutzen: die OpenAI-API direkt, innerhalb von ChatGPT (einschließlich des kostenlosen Tiers – ja, des kostenlosen Tiers) und über Aggregatoren, die an OpenAIs Endpunkt weiterleiten. GitHub Copilot hat es ebenfalls am ersten Tag aufgegriffen – ihr Changelog erschien am 17. März zusammen mit der OpenAI-Ankündigung.

Nano ist nur über die API verfügbar. Keine ChatGPT-Oberfläche dafür. Gut zu wissen, wenn Sie versucht sind, Nutzer direkt auf Nano zu verweisen – das geht nicht, nur über die API-Integration, die Sie selbst drumherum bauen.

Preise & Kontext

Eingabe-/Ausgaberaten & zwischengespeicherte Eingabe

Zahlen zum Veröffentlichungsdatum, von OpenAIs offiziellem Modell-Seite. Diese ändern sich, also prüfen Sie sie, bevor Sie sich festlegen:

  • GPT-5.4 Mini​: $0,75 pro 1M Eingabe, $4,50 pro 1M Ausgabe, $0,075 zwischengespeicherte Eingabe
  • GPT-5.4 Nano​: $0,20 pro 1M Eingabe, $1,25 pro 1M Ausgabe

Die zwischengespeicherte Eingaberate ist die, um die ich tatsächlich planen würde. ​**$0,075 ist ein 10-facher Rabatt auf die Eingabe**​, und für jeden Workload mit einem stabilen System-Prompt oder wiederholtem Kontext (fast jeder Agent, die meisten Chat-Oberflächen, alles mit RAG-Form) erledigt das Caching die Hauptarbeit bei den Kosten. Der Schlagzeilen-Preis für gpt 5.4 Mini ist der Worst Case, nicht der typische Fall.

Eine Randnotiz: Regionale Verarbeitungs-Endpunkte (Datenresidenz) haben einen Aufschlag von 10 %. Nicht riesig, aber es lohnt sich, dies zu modellieren, wenn Sie über EU- oder andere regionale Oberflächen routen.

Kontextfenster

OpenAIs Dokumentation listet 400.000 Token Kontext, 128.000 maximale Ausgabe für Mini auf. Ich habe bei Aggregator-Seiten unterschiedliche Zahlen gesehen (eine hatte 1,1 Mio., was nicht mit der Quelle übereinstimmt). Im Zweifel gilt die offizielle Modellseite – und die offizielle Zahl ist 400.000.

Ich habe bei 350.000 getestet (ein vollgepacktes Agenten-Transkript plus Tool-Ausgaben). Hat gut funktioniert. Ich habe es nicht bis ans Limit getrieben – bei diesem Preisniveau würde ich die wirklich langen Kontextfälle lieber zu einem Frontier-Modell hochstufen, als Minis Decke zu strapazieren.

Bestgeeignete Produktions-Workloads

Hochvolumen, latenzsensible Aufgaben

Hier verdient Mini seinen Platz in der Routing-Tabelle. Das Muster, das sich über die Projekte, auf die ich es angesetzt habe, bewährt hat:

  • Klassifizierung, Extraktion, leichte Neuformatierung – alles, wo Sie eine strukturierte Antwort schnell benötigen und das Reasoning ein oder zwei Schritte umfasst. Mini erledigt das zu einem Bruchteil der Frontier-Kosten.
  • Lange Chat-Sitzungen mit einfachen Turns – wenn 80 % der Turns kein schweres Reasoning benötigen, ist es schlicht falsch, für alle von ihnen volle GPT-5.5-Preise zu zahlen.
  • Hochfächernde Teilaufgaben – 50 Varianten von etwas generieren, 200 abgerufene Dokumente bewerten usw. Der Unterschied in den Stückkosten summiert sich schnell.

Wo ich es scheitern gesehen habe: alles, was tiefe mehrstufige Planung erfordert, oder wo das Modell entscheiden muss, was zu tun ist, anstatt einen klar definierten Schritt auszuführen. (Ich hatte einen Workflow, bei dem Mini der Planer war. Drei Tage. Ich habe gewechselt. Macht es mir nicht nach.)

Tool-Nutzung & Agenten-Teilaufgaben

Es lohnt sich, das zu erwähnen, weil es der Teil ist, der mich überrascht hat. Laut der Ankündigung nähert sich Mini auf OSWorld-Verified – einem Computer-Use-Benchmark – dem vollständigen GPT-5.4 und übertrifft GPT-5 Mini deutlich. In der tatsächlichen Nutzung würde ich es so beschreiben: zuverlässig beim ​Ausführen​ von Tool-Aufrufen, sobald ein Plan vorhanden ist, weniger zuverlässig beim ​Entscheiden​**, welches Tool an einer mehrdeutigen Stelle zu greifen ist.**

Das Muster, das funktioniert:

  1. Frontier-Modell (GPT-5.5 oder ein anderes) plant und entscheidet.
  2. Mini führt die Schritte aus – ruft die Tools auf, parst die Ergebnisse, gibt zurück an den Planner.

OpenAI nennt das „Subagenten in Codex”. Die allgemeine Form ist älter als dieser Begriff – es ist einfach die klassische Heavy-Planner / Cheap-Executor-Aufteilung. Mini ist ungewöhnlich gut auf dem Executor-Platz.

Mini in einem Multi-Modell-Setup routen

Wann auf ein Frontier-Modell hochstufen

Routing ist das ganze Spiel mit Mini. Überall blind einsetzen und Sie werden bei schwierigen Turns Reasoning-Fehler bemerken. Gar nicht einsetzen und Sie verbrennen Geld bei einfachen Turns. Die Eskalationsregeln, die ich verwende, grob in Reihenfolge der Wichtigkeit:

  1. Bei planförmigen Fragen eskalieren. Alles, was das Wählen einer Strategie, das Zerlegen eines mehrdeutigen Ziels oder das Abwägen von Kompromissen erfordert. Mini ist gut, wenn es weiß, was zu tun ist. Es kämpft, wenn es herausfinden muss, was zu tun ist.

  2. Bei Eingaben >272.000 Token eskalieren. Nicht weil Mini keine 400.000 verarbeiten kann – das kann es – aber sobald Ihre Prompts so groß sind, umfasst der Workload üblicherweise dokumentenübergreifendes Reasoning, das von einem Frontier-Modell profitiert. (GPT-5.5 berechnet auch 2× Eingabe über 272.000, daher ändert sich das Kostenbild dort auch.)

  3. Bei hochriskanten einzelnen Aufrufen eskalieren. Wenn die Antwort wichtig ist und keine menschliche Überprüfung nachgelagert ist, zahlen Sie den Aufpreis. Das Kostendelta bei einem Aufruf ist irrelevant; die Kosten, falsch zu liegen, sind es nicht.

  4. Nicht einfach eskalieren, weil die Frage sich „schwer anfühlt”. So wird Mini zu wenig genutzt. Viele „fühlt sich schwer an”-Fragen sind tatsächlich gut spezifiziert, und Mini erledigt sie. Testen Sie, bevor Sie annehmen.

Ein praktisches Setup: einen günstigen Klassifizierer (Mini selbst oder Nano) die Route entscheiden lassen. Es ist nicht perfekt, aber besser als alles zum Frontier oder alles zu Mini zu routen.

Grenzen & Kompromisse

Ein paar echte Punkte, die ich erlebt habe, aufgelistet wie sie sind:

  • Nano ist spürbar schwächer als Mini. Die Preislücke deutet darauf hin, dass sie im gleichen Gespräch sind. Das sind sie nicht. Nano funktioniert für sehr enge Aufgaben (günstige Klassifizierung, Teilschritt-Routing). Für alles, was auch nur bescheidenes Reasoning erfordert, gewinnt Mini mit einem breiteren Abstand, als das Preisverhältnis vermuten lässt. Greifen Sie nicht allein aus Kostengründen zu Nano.
  • Kontextfenster vs. Kontext ​​​Nutzbarkeit​**.** 400.000 ist die Decke. Das Modell bleibt bei den ersten 100.000 immer noch kohärenter als bei den letzten 100.000 – wie bei fast jedem Großkontext-Modell. Planen Sie Ihren Prompt entsprechend.
  • Das Mini in ​der OpenAI-API​ ist auch das Mini in ChatGPT Free. Das ist weniger relevant für Entwickler und mehr für die Produktpositionierung – wenn Sie etwas bauen, das Nutzer einfach kostenlos in ChatGPT tun könnten, muss die Differenzierung von Ihrer Anwendung kommen, nicht vom Zugang zum Modell.
  • GPT-5.4 ist nicht mehr Frontier. Ich habe das oben erwähnt, aber es lohnt sich, es im Abschnitt zu Grenzen zu wiederholen. Vermarkten Sie ein Produkt nicht mit „powered by GPT-5.4” als wäre es Cutting-Edge – jeder, der aufpasst, weiß, dass es das nicht ist. Die ehrliche Positionierung ist die Routing-Logik, nicht der Modellname.

Ich würde auch auf das Langweilige hinweisen: API-Verhalten ändert sich. Pinnen Sie Modell-Snapshots, wenn Ihnen Reproduzierbarkeit wichtig ist. Die Auto-Routing-Aliase (gpt-5.4-mini) werden stillschweigend zu neueren Snapshots wechseln.

FAQ

Ist GPT-5.4 Mini nur über die API verfügbar oder auch in ChatGPT?

Beides. Die GPT-5.4 Mini API ist die Entwickleroberfläche. Dasselbe Modell läuft auch in ChatGPT, einschließlich des kostenlosen Tiers. Nano ist nur über die API verfügbar.

Wie groß ist das tatsächliche Kontextfenster für GPT-5.4 Mini?

400.000 Eingabe-Token, 128.000 maximale Ausgabe, gemäß OpenAIs offizieller Dokumentation. Einige Aggregator-Seiten listen andere Zahlen auf – wenn sie im Widerspruch stehen, gilt OpenAIs Modellseite.

Unterstützt GPT-5.4 Mini Tool-Nutzung und multimodale Eingaben?

Ja. Text- und Bildeingaben, plus Funktionsaufruf, Websuche, Dateisuche, Computer-Use und Skills über die Responses API. Nur Text-Ausgabe. Stark bei der Tool-Ausführung; weniger stark bei der Entscheidung, welches Tool unter Mehrdeutigkeit zu greifen ist.

Wann sollte ich eine Aufgabe zu GPT-5.5 hochstufen, statt Mini zu verwenden?

Wenn die Aufgabe Planung statt Ausführung erfordert, wenn die Eingabe ​~272.000 Token​ überschreitet, wenn die Qualität der Antwort bei einem einzelnen Aufruf wichtiger ist als das Kostendelta, oder wenn Sie Reasoning-Fehler sehen, die Sie auf die Modellfähigkeit zurückführen können statt auf die Prompt-Form. Für alles andere: Mini.

Wie entscheide ich zwischen GPT-5.4 Mini und anderen Modellen in einem Routing-Setup?

Führen Sie einen kleinen Holdout von echtem Produktions-Traffic durch jeden Kandidaten-Modell. Messen Sie Kosten, Latenz und eine aufgabenspezifische Qualitätsmetrik, um die Sie sich wirklich kümmern – keinen generischen Benchmark. Dann routen Sie entsprechend. Die Entscheidung ist empirisch und workload-spezifisch; keine allgemeine Regel überlebt den Kontakt mit Ihren Daten.

Fazit

Das Interessante an der GPT-5.4 Mini API ist nicht ihre Stärke. Es ist, dass sie das richtige Modell ist, um es auf den Executor-Platz eines Routing-Setups zu setzen – die günstige, schnelle Schicht, die den Großteil der Arbeit übernimmt, während ein Frontier-Modell den kleinen Bruchteil von Turns übernimmt, bei denen Fähigkeit am meisten zählt.

Wenn Ihr Stack noch auf einem einzelnen Modell basiert – ein Modell erledigt alles – zahlen Sie entweder zu viel bei einfachen Turns oder leisten zu wenig bei schwierigen. Oder beides. Was Mini gut kann, ist nicht das klügste Modell im Raum zu sein. Es ist das günstigste Modell zu sein, das für den Großteil des Raums klug genug ist.

Was ich tatsächlich tun würde, bevor ich es zu einer Routing-Schicht hinzufüge:

Führen Sie eine Woche echten Traffic durch es auf den Workloads, die Sie ihm geben würden. Messen Sie Kosten, Latenz und Qualität auf der Metrik, von der Ihr Produkt tatsächlich abhängt. Pinnen Sie den Snapshot. Bauen Sie die Eskalationsregel, bevor Sie es ausliefern, nicht danach.

Drei Monate reichen aus, um zu sagen, dass Mini in der Produktion standhält. Nicht genug, um etwas über langfristige Preisstabilität zu sagen – das liegt an OpenAI.

Am Tag, an dem Sie tatsächlich bauen, gegen die Dokumentation zu verifizieren.

Mehr folgt.

Vorherige Artikel: