Preços do GPT-5.4 Mini: Custo de Entrada, Cache e Saída
Preços do GPT-5.4 Mini explicados: custos de tokens de entrada, entrada em cache e saída, e por que modelos pequenos reduzem faturas de API de alto volume.
Olá, sou a Dora. Há algumas semanas venho direcionando uma carga de trabalho de classificação de alto volume pelo OpenAI. A pergunta que continuava chegando do financeiro era a que os desenvolvedores fazem sempre que um modelo “mini” é lançado: a matemática realmente funciona, ou a taxa mais barata por token é consumida por outra coisa?
Este artigo é para quem está fazendo o mesmo cálculo sobre preços do GPT-5.4 Mini agora — desenvolvedores conscientes de custos, líderes de engenharia próximos ao financeiro. Vou detalhar as taxas de entrada, entrada em cache e saída, percorrer onde a economia unitária funciona e sinalizar onde o Mini silenciosamente custa mais do que o título sugere. Todas as taxas vêm da página oficial de preços da API da OpenAI, verificadas na data de publicação — elas mudam, então verifique antes de citar.
Este não é o guia de integração. Roteamento e o contrato da API estão em um artigo separado. Este é sobre dinheiro.
Detalhamento de Custos do GPT-5.4 Mini
Taxas de entrada vs saída
!
O GPT-5.4 Mini tem preço de $0,75 por milhão de tokens de entrada e $4,50 por milhão de tokens de saída. O multiplicador 6x na saída é a parte que a maioria das pessoas internaliza tarde demais. Entrada é barata. Saída é o que consome o orçamento.
Para contexto, onde o Mini se posiciona na família GPT-5.4 na data de publicação:
| Modelo | Entrada ($/M) | Entrada em Cache ($/M) | Saída ($/M) |
|---|---|---|---|
| GPT-5.5 | $5,00 | $0,50 | $30,00 |
| GPT-5.4 | $2,50 | $0,25 | $15,00 |
| GPT-5.4 Mini | $0,75 | $0,08 | $4,50 |
O Mini é aproximadamente 3,3x mais barato que o GPT-5.4 e 6,7x mais barato que o GPT-5.5. Essa proporção é a história completa quando você decide se uma carga de trabalho pertence ao Mini.
As taxas padrão se aplicam a janelas de contexto abaixo de ~270K tokens de entrada. Acima disso, a OpenAI aplica preços 2x na entrada e 1,5x na saída para a sessão inteira — inclusive nos planos Batch e Flex. A surpresa mais cara da plataforma.
Desconto de entrada em cache
A entrada em cache no GPT-5.4 Mini é $0,075 por milhão de tokens — uma redução de 90% em relação à taxa de entrada padrão, seguindo o padrão nas famílias GPT-5.4 e GPT-5.5. O cache é automático: sem flag na API, sem alteração de código. Se sua requisição reutilizar um prefixo que a OpenAI já computou, esses tokens são cobrados à taxa em cache.
As regras que importam:
- O prefixo deve ser estável byte a byte. Um timestamp no seu prompt de sistema mata o cache.
- O prefixo precisa ser longo o suficiente (mínimo de cerca de 1.024 tokens).
- O cache expira após alguns minutos de inatividade.
- Os preços de saída não mudam.
Para aplicações RAG com prompts de sistema grandes e estáveis, taxas de acerto de cache acima de 70% são realistas. Para cargas de trabalho de turno único sem preâmbulo compartilhado, o cache mal ajuda. A economia é real, mas condicional — por isso nunca a cito como percentual fixo para o financeiro.
Por Que Modelos Pequenos Ganham em Alto Volume
Matemática de custo por tarefa vs fronteira
A unidade correta não é custo por token. É custo por tarefa bem-sucedida. Uma carga de trabalho representativa — classificar 1M de tickets de suporte curtos, 800 tokens de entrada e 200 de saída cada, sem cache:
| Modelo | Custo de entrada | Custo de saída | Total |
|---|---|---|---|
| GPT-5.5 | $4.000 | $6.000 | $10.000 |
| GPT-5.4 | $2.000 | $3.000 | $5.000 |
| GPT-5.4 Mini | $600 | $900 | $1.500 |
Baseado nos preços padrão da OpenAI em junho de 2026. Apenas cálculo de exemplo — os preços reais podem variar por região, taxa de acerto de cache, descontos por volume ou outros fatores. Sempre verifique a página oficial de preços da OpenAI antes de citar.
O Mini fica em 15% da fatura do GPT-5.5. A questão é se a precisão do Mini na sua tarefa é próxima o suficiente para que a economia seja real e não adiada para retrabalho, escalonamentos ou revisão humana.
Mantenho um conjunto de avaliação em cada carga de trabalho que migro para o Mini. Se a qualidade cair abaixo do limite, a planilha deixa de importar.
Descontos Batch & Flex
Duas alavancas adicionais:
- API Batch: desconto fixo de 50% na entrada e saída, processamento assíncrono em até 24 horas. No Mini: $0,375 de entrada e $2,25 de saída por milhão. A maioria dos lotes conclui em 1–6 horas.
- Preço Flex: também 50% de desconto, com latência variável em vez de filas assíncronas. Útil para ferramentas internas sem interação com usuário.
Verifique a cobrança exata com um pequeno lote de teste antes de confirmar uma grande carga de trabalho — a documentação de preços para desenvolvedores da OpenAI é a fonte de verdade.
Fatores de Custo Ocultos
Expansão de tokens de saída
O modo de falha que vejo com mais frequência, e não tem nada a ver com o modelo.
Tokens de saída custam 6x os de entrada no Mini. Se você não restringir o comprimento da saída, um modelo que ocasionalmente retorna 2.000 tokens quando 200 seriam suficientes está inflando silenciosamente sua fatura por uma ordem de grandeza. As correções são entediantes:
- Defina
max_tokensem cada chamada. - Use saídas estruturadas ou modos JSON estritos onde o esquema limita a resposta.
- Para classificação, retorne um rótulo. Não uma explicação. Um rótulo.
Identifiquei uma carga de trabalho onde o Mini estava gerando em média 480 tokens de saída porque o prompt de sistema pedia “uma breve justificativa.” Breve, aparentemente, significa o que o modelo quiser. Depois de remover o campo de justificativa e adicionar max_tokens, a saída caiu para 12 tokens. A fatura caiu proporcionalmente.
A expansão de saída consome qualquer economia que a taxa mais barata por token proporciona. Primeira coisa a auditar.
O cache exige prefixos estáveis
Um “prompt de sistema consistente” em termos de revisão de código não é o mesmo que “estável byte a byte.” Se o seu prompt de sistema inclui a data atual, um campo de personalização específico do usuário no topo, um bloco de documento recuperado que varia por requisição, ou qualquer variante A/B — o cache é eliminado para esse prefixo.
O cache só se aplica ao prefixo compartilhado mais longo desde o início da entrada. A correção é estrutural: fixe conteúdo estável no início, coloque variáveis no final.
Isso parece óbvio. Mesmo assim, já vi sistemas em produção onde o cache era assumido como ativo e não estava. Verifique sua taxa de acerto de cache. Não assuma.
Quem Deve Usar o Mini por Custo
Melhor adequação vs casos onde tem desempenho inferior
O Mini funciona bem para classificação de alto volume, marcação, decisões de roteamento, sumarização de entrada estruturada, extração de primeira passagem onde um modelo de fronteira revisa casos extremos e chat limitado. Qualquer coisa onde você possa restringir o comprimento de saída de forma agressiva.
O Mini tem desempenho inferior em raciocínio de múltiplas etapas em cadeias longas, em saídas onde a qualidade determina a confiança do usuário (elaboração jurídica, análise voltada ao cliente), em tarefas onde casos extremos são comuns e caros de perder, e onde a lacuna de avaliação entre o Mini e o GPT-5.4 na sua tarefa é mensurável.
O teste honesto é seu próprio conjunto de avaliação nos seus próprios dados. Se a precisão do Mini estiver dentro de uma faixa aceitável em relação ao GPT-5.4, a economia é real. Caso contrário, você está pagando por um desconto em retrabalho, tickets de suporte e atrito do usuário — que nunca aparece na fatura da API, mas absolutamente aparece em algum lugar.
Faço auditoria a cada algumas semanas nas cargas de trabalho que estão no Mini há algum tempo. Degradação é real. Os comparativos de preços da API da OpenAI mantêm uma visão atualizada se você precisar reavaliar o roteamento.
FAQ
Quanto o GPT-5.4 Mini realmente custa em comparação ao GPT-5.5?
Aproximadamente um sétimo por token. O GPT-5.4 Mini custa $0,75 de entrada e $4,50 de saída por milhão de tokens; o GPT-5.5 custa $5,00 de entrada e $30,00 de saída. Com volume equivalente e sem cache, o Mini custa cerca de 15% do GPT-5.5. Se isso se traduz em economia real depende de o Mini lidar com sua tarefa sem regressão de qualidade. Consulte a página do modelo GPT-5.5 da OpenAI para a tabela de preços entre modelos.
O preço de entrada em cache se aplica ao GPT-5.4 Mini?
Sim. A entrada em cache no GPT-5.4 Mini é $0,075 por milhão de tokens, um desconto de 90% em relação à taxa padrão de $0,75. Automático quando seu prompt reutiliza um prefixo estável que a OpenAI já computou. O cache expira após alguns minutos de inatividade e exige que o prefixo seja longo o suficiente (cerca de 1.024 tokens). Os preços de saída não são afetados.
Existe desconto batch para o GPT-5.4 Mini?
Sim. A API Batch oferece um desconto fixo de 50% tanto na entrada quanto na saída para o endpoint da api do gpt 5.4 mini, com processamento em até 24 horas. As taxas efetivas em batch são $0,375 de entrada e $2,25 de saída por milhão de tokens. O preço Flex oferece um desconto semelhante de 50% com latência variável em vez de filas assíncronas.
Como estimo o custo real de uma carga de trabalho de alto volume no Mini?
Três números: tokens de entrada por requisição, tokens de saída por requisição, contagem de requisições por mês. Multiplique pela taxa relevante. Para precisão, amostre 100 requisições reais, meça as contagens de tokens reais e verifique sua taxa de acerto de cache. Calculadoras fornecem um teto. Dados amostrados fornecem a realidade.
Quando o GPT-5.4 Mini é muito fraco para a tarefa mesmo sendo mais barato?
Quando seu conjunto de avaliação mostra regressão de qualidade mensurável em comparação ao GPT-5.4 ou GPT-5.5 nas saídas que importam. Gatilhos comuns: raciocínio de múltiplas etapas, seguimento de instruções em prompts longos, casos extremos onde uma resposta errada é cara, saídas que precisam parecer texto polido. A economia não é real se empurra trabalho para revisão manual ou erros voltados ao usuário. Execute a avaliação primeiro.
Conclusão
O preço do GPT-5.4 Mini é simples no papel: $0,75 de entrada, $0,075 de entrada em cache, $4,50 de saída, por milhão de tokens. Onde os números ficam interessantes é nas taxas de acerto de cache, disciplina de tokens de saída, roteamento em batch e se o modelo é realmente bom o suficiente para a tarefa.
Taxas mais baratas por token são necessárias, mas não suficientes. Expansão de saída, cache quebrado e regressões de qualidade podem cada um, independentemente, apagar a economia. A matemática só funciona se você fizer a matemática na sua própria carga de trabalho.
Estou executando mais uma migração este mês — um pipeline de sumarização atualmente no GPT-5.4 que acho que vai se manter no Mini com limites de saída mais rígidos. A projeção de custo indica 70% de economia. Veremos o que a avaliação diz. Continuando na semana que vem.
Posts anteriores:
