API GPT-5.4 Mini: цены, контекст и использование в продакшене
API GPT-5.4 Mini для разработчиков: цены, контекстное окно, поддержка инструментов и высоконагруженные задачи в маршрутизационных схемах.
API GPT-5.4 Mini доступен с 17 марта. Я направляю через него реальный трафик уже около трёх месяцев, параллельно с тремя другими моделями. Эта статья — рабочие заметки о том, где он реально применим.
Меня зовут Дора. Сначала важное уточнение, потому что я постоянно вижу путаницу: GPT-5.4 больше не является передовым рубежом OpenAI. Им является GPT-5.5. Запуск 5.5 мы разбирали в отдельном материале, а статьи про «утечки» по 5.4 из марта по определению устарели. То, о чём я пишу здесь, уже, — mini и nano как бюджетный уровень маршрутизации, — именно та роль, которую они занимают.
Если вы строите маршрутизацию моделей для производственных AI-нагрузок, это разграничение важнее, чем спецификации.
Где применяется GPT-5.4 Mini
Выпущен 17 марта 2026 года как быстрый и экономичный вариант
OpenAI выпустил GPT-5.4 mini и nano 17 марта как младших братьев релиза GPT-5.4 двумя неделями ранее. Описание в анонсе честно отражает их суть: дистиллированные, дешевле, быстрее — для высокообъёмных задач. По данным OpenAI, более чем в 2× быстрее GPT-5 mini. (Их данные, их условия. Я не проводила контролируемый бенчмарк — но по реальной задержке в рабочих нагрузках «быстрее» соответствует тому, что я наблюдаю.)
Главный вопрос для разработчиков — не «хорош ли mini», а «хорош для чего». Именно это в анонсе недооценивают, и именно это делает вопрос маршрутизации принципиальным.
Доступ через API (mini также на бесплатном уровне ChatGPT)
Модель gpt 5.4 mini доступна в трёх местах: напрямую через OpenAI API, внутри ChatGPT (включая бесплатный уровень — да, бесплатный), и через агрегаторы, маршрутизирующие к эндпоинту OpenAI. GitHub Copilot подключил её в первый же день — их changelog вышел 17 марта вместе с анонсом OpenAI.
Nano — только через API. Никакого интерфейса в ChatGPT. Стоит знать, если вы хотите направлять пользователей непосредственно к nano — нельзя, только через API-интеграцию, которую вы строите сами.
Цены и контекст
Тарифы на ввод/вывод и кешированный ввод
Цифры актуальны на дату публикации, источник — официальная страница моделей OpenAI. Они меняются, поэтому проверяйте перед тем, как принимать решение:
- GPT-5.4 mini: $0.75 за 1M токенов ввода, $4.50 за 1M токенов вывода, $0.075 за кешированный ввод
- GPT-5.4 nano: $0.20 за 1M токенов ввода, $1.25 за 1M токенов вывода
Тариф на кешированный ввод — тот, на который я реально ориентируюсь в планировании. $0.075 — это скидка 10× на ввод, и для любой нагрузки со стабильным системным промптом или повторяющимся контекстом (почти любой агент, большинство чат-интерфейсов, всё RAG-подобное) кеширование берёт на себя основную работу по сокращению затрат. Заявленная цена gpt 5.4 mini — это худший сценарий, а не типичный.
Одна сноска: эндпоинты с региональной обработкой (data residency) дают надбавку 10%. Немного, но стоит учесть при моделировании, если вы маршрутизируете через ЕС или другие региональные поверхности.
Контекстное окно
В документации OpenAI указано 400K токенов контекста и 128K максимального вывода для mini. На страницах агрегаторов я видела другие числа (у одного было 1.1M — не совпадает с источником). Если есть сомнения, официальная страница модели — приоритет. А официальное число — 400K.
Я тестировала при 350K (насыщенный агентский транскрипт плюс выводы инструментов). Работало нормально. До предела не доводила — при таком ценовом уровне я предпочту направить действительно длинноконтекстные случаи к фронтирной модели, а не тестировать потолок mini.
Производственные нагрузки, для которых mini подходит лучше всего
Высокообъёмные задачи с требованиями к задержке
Здесь mini занимает своё место в таблице маршрутизации. Паттерн, который устойчиво работал во всех проектах, где я его применяла:
- Классификация, извлечение, лёгкое переформатирование — всё, где нужен структурированный ответ быстро, а рассуждение занимает один-два шага. Mini справляется за долю стоимости фронтирной модели.
- Длинные чат-сессии с простыми репликами — когда 80% реплик не требуют глубоких рассуждений, платить по полному тарифу GPT-5.5 за все из них просто неправильно.
- Высокораспараллеленные подзадачи — сгенерировать 50 вариантов чего-либо, оценить 200 извлечённых документов и т. д. Разница в стоимости единицы быстро накапливается.
Где я видела сбои: всё, что требует глубокого многошагового планирования, или где модели нужно решить, что делать, а не выполнить хорошо сформулированный шаг. (Был у меня воркфлоу, где mini был планировщиком. Три дня. Переключила. Не повторяйте мой путь.)
Использование инструментов и подзадачи агентов
Стоит отметить отдельно — это то, что меня удивило. По данным анонса, на OSWorld-Verified (бенчмарк компьютерного управления) mini приближается к полному GPT-5.4 и существенно опережает GPT-5 mini. На практике я бы описала это так: надёжно выполняет вызовы инструментов при наличии готового плана, менее надёжно решает, какой инструмент взять в неоднозначной ситуации.
Паттерн, который работает:
- Фронтирная модель (GPT-5.5 или другая) планирует и принимает решения.
- Mini выполняет шаги — вызывает инструменты, разбирает результаты, передаёт обратно планировщику.
OpenAI называет это «субагентами в Codex». Общая схема старше этого термина — это просто стандартное разделение «тяжёлый планировщик / дешёвый исполнитель». Mini необычно хорошо справляется с ролью исполнителя.
Маршрутизация mini в мультимодельной конфигурации
Когда переключаться на фронтирную модель
Маршрутизация — это вся суть работы с mini. Используйте его везде бездумно — и вы почувствуете провалы рассуждений на сложных запросах. Не используйте совсем — и будете сжигать деньги на простых. Правила эскалации, которые я использую, примерно в порядке важности:
-
Эскалация на планово-ориентированных вопросах. Всё, что требует выбора стратегии, декомпозиции неоднозначной цели или взвешивания компромиссов. Mini справляется, когда знает, что делать. Затрудняется, когда нужно самому разобраться.
-
Эскалация при входе >272K токенов. Не потому что mini не может взять 400K — может. Но как только промпты становятся настолько большими, нагрузка обычно предполагает кросс-документные рассуждения, которые выиграют от фронтирной модели. (GPT-5.5 также тарифицирует ввод ×2 свыше 272K, так что и картина стоимости там меняется.)
-
Эскалация при высокозначимых единичных вызовах. Если ответ имеет значение и ниже по потоку нет человеческой проверки — заплатите сверху. Разница в стоимости одного вызова несущественна; стоимость ошибки — нет.
-
Не эскалируйте только потому, что вопрос «кажется сложным». Именно из-за этого mini оказывается недоиспользованным. Многие «кажется сложные» вопросы на самом деле хорошо сформулированы, и mini их обрабатывает. Тестируйте, прежде чем предполагать.
Практическая схема: пустите дешёвый классификатор (сам mini или nano) на принятие решения о маршруте. Не идеально, но лучше, чем отправлять всё к фронтирной модели или всё к mini.
Ограничения и компромиссы
Несколько реальных, с которыми я столкнулась, — перечислю как есть:
- Nano заметно слабее mini. Ценовой разрыв намекает, что они в одной категории. Нет. Nano работает для очень узких задач (дешёвая классификация, маршрутизация подшагов). Для всего, что требует даже умеренных рассуждений, mini выигрывает с более широким отрывом, чем предполагает ценовое соотношение. Не тянитесь к nano только из-за стоимости.
- Контекстное окно vs используемость контекста. 400K — это потолок. Модель всё ещё лучше сохраняет когерентность на первых 100K, чем на последних — как почти у любой крупноконтекстной модели. Планируйте промпт соответственно.
- Mini в OpenAI API — это тот же mini в бесплатном ChatGPT. Это меньше важно для разработчиков и больше — для позиционирования продукта. Если вы строите то, что пользователи могут просто сделать в ChatGPT бесплатно, дифференциация должна исходить из вашего приложения, а не из доступа к модели.
- GPT-5.4 больше не является фронтирной моделью. Я упомянула это в начале, но стоит повторить в разделе ограничений. Не позиционируйте продукт как «работает на GPT-5.4» в смысле передовых технологий — любой, кто следит за рынком, знает, что это не так. Честное позиционирование — в логике маршрутизации, а не в названии модели.
Отмечу и очевидное: поведение API меняется. Фиксируйте снэпшоты моделей, если вам важна воспроизводимость. Псевдонимы с автоматической маршрутизацией (gpt-5.4-mini) со временем незаметно переключатся на более новые снэпшоты.
Часто задаваемые вопросы
Доступен ли GPT-5.4 Mini только через API или также в ChatGPT?
И там, и там. API GPT-5.4 Mini — это разработческий интерфейс. Та же модель работает и в ChatGPT, включая бесплатный уровень. Nano — только через API.
Каков реальный размер контекстного окна GPT-5.4 Mini?
400K токенов ввода, 128K максимального вывода — согласно официальной документации OpenAI. На некоторых страницах агрегаторов указаны другие числа — при конфликте данных побеждает страница моделей OpenAI.
Поддерживает ли GPT-5.4 Mini использование инструментов и мультимодальный ввод?
Да. Ввод текстом и изображениями, плюс вызов функций, веб-поиск, поиск по файлам, компьютерное управление и навыки через Responses API. Только текстовый вывод. Силён в выполнении вызовов инструментов; менее силён в выборе нужного инструмента в условиях неопределённости.
Когда следует направить задачу к GPT-5.5 вместо Mini?
Когда задача требует планирования, а не выполнения; когда ввод превышает ~272K токенов; когда качество ответа на единичный вызов важнее разницы в стоимости; или когда вы видите ошибки рассуждений, которые можно отнести к возможностям модели, а не к форме промпта. Для всего остального — mini.
Как выбрать между GPT-5.4 Mini и другими моделями при настройке маршрутизации?
Прогоните небольшую выборку реального производственного трафика через каждую модель-кандидат. Измерьте стоимость, задержку и специфичную для задачи метрику качества, которая реально важна — не общий бенчмарк. Затем маршрутизируйте соответственно. Решение эмпирическое и зависит от нагрузки; никакое общее правило не выдерживает столкновения с вашими данными.
Заключение
Интересное в API GPT-5.4 Mini — не его мощность. А то, что это правильная модель для роли исполнителя в схеме маршрутизации — дешёвый, быстрый уровень, который выполняет основную часть работы, пока фронтирная модель обрабатывает небольшую долю запросов, где важны возможности.
Если ваш стек всё ещё одномодельный — одна модель обрабатывает всё — вы либо переплачиваете на простых запросах, либо недовыполняете на сложных. Или и то, и другое. То, в чём хорош mini, — не быть самой умной моделью в комнате. А быть самой дешёвой моделью, достаточно умной для большей части комнаты.
Что я реально сделала бы перед добавлением в уровень маршрутизации:
Прогоните неделю реального трафика через него на тех нагрузках, которые вы ему отдадите. Измерьте стоимость, задержку и качество по той метрике, от которой реально зависит ваш продукт. Зафиксируйте снэпшот. Постройте правило эскалации до выпуска, а не после.
Трёх месяцев достаточно, чтобы сказать: mini держится в продакшене. Недостаточно, чтобы говорить что-либо о долгосрочной стабильности цен — это на усмотрение OpenAI.
Проверять по документации в день, когда реально строите.
Продолжение следует.
Предыдущие статьи:
