Цены на GPT-5.4 Mini: стоимость входных, кэшированных и выходных токенов

Подробное объяснение цен на GPT-5.4 Mini: стоимость входных, кэшированных входных и выходных токенов, а также почему небольшие модели снижают расходы на API при больших объёмах запросов.

By Dora 9 min read

Привет, меня зовут Дора. Несколько недель я направляю высоконагруженный классификационный воркфлоу через OpenAI. Вопрос, который мне постоянно задают финансисты, — тот же, который задают разработчики каждый раз, когда выходит модель с пометкой «mini»: математика действительно работает, или экономия на токенах съедается чем-то другим?

Этот материал — для тех, кто прямо сейчас считает то же самое по ценам GPT-5.4 Mini: разработчиков, думающих об экономике, и техлидов с финансовой ответственностью. Я разберу ставки для входных, кэшированных входных и выходных токенов, покажу, где юнит-экономика работает, и укажу, где Mini незаметно обходится дороже, чем говорит заголовок. Все ставки взяты с официальной страницы ценообразования OpenAI API, актуальны на дату публикации — они меняются, поэтому проверяйте перед тем, как цитировать.

Это не руководство по интеграции. Маршрутизация и контракт API описаны в отдельном материале. Здесь речь идёт о деньгах.

Разбор стоимости GPT-5.4 Mini

Ставки входных и выходных токенов

GPT-5.4 Mini стоит $0,75 за миллион входных токенов и $4,50 за миллион выходных токенов. Коэффициент 6x для выходных — это то, что большинство людей осознают слишком поздно. Входные токены дёшевы. Выходные — то, что сжигает бюджет.

Для сравнения, положение Mini в семействе GPT-5.4 на дату публикации:

МодельВходные ($/M)Кэш. входные ($/M)Выходные ($/M)
GPT-5.5$5,00$0,50$30,00
GPT-5.4$2,50$0,25$15,00
GPT-5.4 Mini$0,75$0,08$4,50

Mini примерно в 3,3 раза дешевле GPT-5.4 и в 6,7 раза дешевле GPT-5.5. Это соотношение — вся история, когда вы решаете, подходит ли воркфлоу для Mini.

Стандартные ставки применяются к контекстным окнам размером менее ~270 тыс. входных токенов. Сверх этого OpenAI применяет удвоенные ставки для входных и полуторные для выходных токенов ко всей сессии — включая тарифы Batch и Flex. Это самый дорогой сюрприз на платформе.

Скидка на кэшированные входные токены

Кэшированные входные токены в GPT-5.4 Mini стоят $0,075 за миллион — скидка 90% от стандартной входной ставки, по той же схеме, что у семейств GPT-5.4 и GPT-5.5. Кэш автоматический: никаких флагов в API, никаких изменений в коде. Если ваш запрос повторно использует префикс, уже вычисленный OpenAI, эти токены тарифицируются по кэшированной ставке.

Важные правила:

  • Префикс должен быть байт-в-байт стабильным. Временная метка в системном промпте уничтожает кэш.
  • Префикс должен быть достаточно длинным (минимум около 1 024 токенов).
  • Кэш истекает после нескольких минут бездействия.
  • Ставка для выходных токенов не меняется.

Для RAG-приложений с большими стабильными системными промптами реалистично достичь коэффициента попаданий в кэш выше 70%. Для однократных запросов без общей преамбулы кэш почти не помогает. Экономия реальна, но условна — именно поэтому я никогда не называю финансистам фиксированный процент.

Почему небольшие модели выигрывают при больших объёмах

Математика стоимости задачи против фронтирных моделей

Правильная единица измерения — не стоимость токена. Это стоимость успешно выполненной задачи. Показательный воркфлоу: классификация 1 млн коротких тикетов поддержки, по 800 входных и 200 выходных токенов каждый, без кэширования:

МодельСтоимость входныхСтоимость выходныхИтого
GPT-5.5$4 000$6 000$10 000
GPT-5.4$2 000$3 000$5 000
GPT-5.4 Mini$600$900$1 500

На основе стандартных цен OpenAI по состоянию на июнь 2026 года. Расчёт приведён только в качестве примера — фактические цены могут отличаться в зависимости от региона, коэффициента попаданий в кэш, объёмных скидок и других факторов. Всегда проверяйте официальную страницу цен OpenAI перед расчётами.

Mini обходится в 15% от счёта GPT-5.5. Вопрос в том, достаточно ли близка точность Mini на вашей задаче, чтобы экономия была реальной, а не отложенной в виде доработок, эскалаций или ручной проверки.

Для каждого воркфлоу, который я перевожу на Mini, я веду набор тестов. Если качество падает ниже порога, электронные таблицы теряют смысл.

Скидки Batch и Flex

Ещё два рычага:

  • Batch API: фиксированная скидка 50% на входные и выходные токены, асинхронная обработка в течение 24 часов. Для Mini: $0,375 входных и $2,25 выходных за миллион. Большинство батчей завершается за 1–6 часов.
  • Flex pricing: также скидка 50%, с переменной задержкой вместо асинхронной очереди. Подходит для внутренних инструментов, не обращённых к пользователю.

Проверьте точный расчёт на небольшом тестовом батче перед запуском большого воркфлоу — документация разработчика OpenAI по ценообразованию является источником истины.

Скрытые факторы стоимости

Расползание выходных токенов

Сценарий отказа, который я вижу чаще всего, — и он никак не связан с моделью.

Выходные токены стоят в 6 раз больше входных в Mini. Если не ограничивать длину выходных данных, модель, которая иногда возвращает 2 000 токенов вместо 200, незаметно раздувает ваш счёт на порядок. Исправления банальны:

  • Устанавливайте max_tokens при каждом вызове.
  • Используйте структурированные выходные данные или строгие режимы JSON, где схема ограничивает ответ.
  • При классификации возвращайте метку. Не объяснение. Метку.

Я обнаружил один воркфлоу, где Mini выдавал в среднем 480 выходных токенов, потому что системный промпт просил «краткое обоснование». Краткое, по-видимому, означает столько, сколько захочет модель. После удаления поля обоснования и добавления max_tokens выход сократился до 12 токенов. Счёт сократился соответственно.

Расползание выходных токенов съедает любую экономию от более низкой ставки за токен. Это первое, что нужно проверить.

Кэширование требует стабильных префиксов

«Стабильный системный промпт» в понимании проверки кода — не то же самое, что «стабильный байт-в-байт». Если ваш системный промпт содержит текущую дату, поле персонализации для конкретного пользователя в начале, блок с загруженным документом, который меняется от запроса к запросу, или любой A/B-вариант — кэш для этого префикса уничтожен.

Кэш применяется только к самому длинному общему префиксу с начала входных данных. Решение структурное: помещайте стабильный контент в начало, переменные — в конец.

Это звучит очевидно. Тем не менее я видел продакшн-системы, где предполагалось, что кэш активен, а он не был. Проверяйте коэффициент попаданий в кэш. Не предполагайте.

Кому стоит использовать Mini из соображений стоимости

Лучшие сценарии применения и случаи, где Mini уступает

Mini хорошо работает для высоконагруженной классификации, тегирования, решений по маршрутизации, суммаризации структурированных входных данных, первичного извлечения данных, где фронтирная модель проверяет граничные случаи, и ограниченных диалогов. Всё, где можно агрессивно ограничить длину выходных данных.

Mini уступает в многошаговых рассуждениях по длинным цепочкам, в выходных данных, где качество определяет доверие пользователя (юридические документы, клиентский анализ), в задачах, где граничные случаи часты и дороги, и где разрыв в оценке между Mini и GPT-5.4 на вашей задаче измерим.

Честный тест — ваш собственный набор тестов на ваших собственных данных. Если точность Mini укладывается в приемлемый диапазон от GPT-5.4, экономия реальна. Если нет, вы платите за скидку в виде доработок, тикетов поддержки и пользовательских трений — что никогда не отражается в счёте API, но обязательно всплывает где-нибудь.

Я провожу аудит каждые несколько недель для воркфлоу, которые давно работают на Mini. Дрейф реален. Сравнительные таблицы цен OpenAI API поддерживают актуальное представление, если вам нужно пересмотреть маршрутизацию.

Частые вопросы

Насколько GPT-5.4 Mini дешевле GPT-5.5?

Примерно в семь раз за токен. GPT-5.4 Mini стоит $0,75 за входные и $4,50 за выходные на миллион токенов; GPT-5.5 — $5,00 за входные и $30,00 за выходные. При эквивалентном объёме без кэширования Mini обходится примерно в 15% от стоимости GPT-5.5. Переводится ли это в реальную экономию — зависит от того, справляется ли Mini с вашей задачей без регрессии качества. Смотрите страницу модели GPT-5.5 OpenAI для таблицы сравнения цен.

Распространяется ли ценообразование кэшированных входных токенов на GPT-5.4 Mini?

Да. Кэшированные входные токены на GPT-5.4 Mini стоят $0,075 за миллион, скидка 90% от стандартной ставки $0,75. Применяется автоматически, когда ваш промпт повторно использует стабильный префикс, уже вычисленный OpenAI. Кэш истекает после нескольких минут бездействия и требует достаточной длины префикса (около 1 024 токенов). Ставка для выходных токенов не затрагивается.

Есть ли скидка на батч-обработку для GPT-5.4 Mini?

Да. Batch API даёт фиксированную скидку 50% на входные и выходные токены для эндпоинта gpt 5.4 mini api, с обработкой в течение 24 часов. Эффективные ставки батча: $0,375 за входные и $2,25 за выходные на миллион токенов. Flex pricing предлагает аналогичную скидку 50% с переменной задержкой вместо асинхронной очереди.

Как оценить реальную стоимость высоконагруженного воркфлоу на Mini?

Три числа: токенов на входе за запрос, токенов на выходе за запрос, количество запросов в месяц. Умножьте на соответствующую ставку. Для точности выборки возьмите 100 реальных запросов, измерьте фактическое количество токенов и проверьте коэффициент попаданий в кэш. Калькуляторы дают вам потолок. Выборочные данные дают реальность.

Когда GPT-5.4 Mini слишком слаб для задачи, даже если он дешевле?

Когда ваш набор тестов показывает измеримую регрессию качества по сравнению с GPT-5.4 или GPT-5.5 на важных выходных данных. Типичные триггеры: многошаговые рассуждения, следование инструкциям в длинных промптах, граничные случаи, где неверный ответ дорого обходится, выходные данные, которые должны выглядеть как отполированный текст. Экономия не реальна, если она перекладывает работу в ручную проверку или пользовательские ошибки. Сначала проведите оценку.

Заключение

Ценообразование GPT-5.4 Mini на бумаге простое: $0,75 входные, $0,075 кэшированные входные, $4,50 выходные за миллион токенов. Интересное начинается там, где в игру вступают коэффициенты попаданий в кэш, дисциплина в отношении выходных токенов, батч-маршрутизация и вопрос о том, достаточно ли хороша модель для задачи.

Более низкая ставка за токен необходима, но недостаточна. Расползание выходных токенов, сломанное кэширование и регрессии качества могут каждое в отдельности уничтожить экономию. Математика работает только если вы считаете для своего воркфлоу.

В этом месяце я провожу ещё одну миграцию — пайплайн суммаризации, который сейчас работает на GPT-5.4 и который, как мне кажется, выдержит переход на Mini с более жёсткими ограничениями выходных данных. Прогноз стоимости обещает экономию 70%. Посмотрим, что покажет оценка. Продолжение на следующей неделе.

Предыдущие публикации:

Поделиться