Preço do MiniMax M3: Custo de API de Contexto Longo para Desenvolvedores

Preços do MiniMax M3 para desenvolvedores: níveis de contexto longo, o limite de 512K, pool de tokens, cache e como controlar os custos da API.

By Dora 9 min read

Olá, pessoal. Ainda sou a Dora. Abri a página de preços do M3 esperando um único número. Há quatro. Tier padrão, tier de contexto longo, leituras de cache, multimodal — mais um produto de assinatura separado por cima. Então, se você está tentando responder “o que o cartão de preço do minimax m3 realmente significa para a minha carga de trabalho”, a resposta honesta é: depende em qual dos quatro tiers a sua requisição se encaixar.

Este artigo é para quem precisa justificar a fatura de inferência no final do mês. Se você só quer saber se o M3 é “barato” em termos abstratos, ele está listado a taxas competitivas, mas esse enquadramento não vai resistir ao contato com uma carga de trabalho real.

Como o Preço do M3 É Estruturado

A estrutura de preço do minimax m3 tem quatro partes móveis. A taxa principal é de $0,30 por milhão de tokens de entrada, $1,20 por milhão de tokens de saída — confirmado no blog de lançamento do M3 da MiniMax. Isso é uma promoção de lançamento de 50% no tier padrão. O preço de tabela é $0,60 / $2,40. Eu trataria a promoção como temporária. Não construa um orçamento com base nela.

Taxa padrão (≤512K) vs taxa de contexto longo (>512K)

O M3 suporta uma janela de contexto de 1M de tokens, com um mínimo garantido de 512K. No momento em que sua entrada ultrapassar 512K tokens, a requisição inteira — entrada, saída e leituras de cache — é cobrada na taxa de contexto longo. Essa taxa é exatamente 2x a taxa padrão.

Portanto, na promoção: $0,60 de entrada / $2,40 de saída acima de 512K. No preço de tabela: $1,20 / $4,80. As leituras de cache mudam da mesma forma.

Uma requisição de 600K tokens não custa ligeiramente mais do que uma de 500K. Ela custa aproximadamente o dobro por token em toda a chamada. Isso é um penhasco, não uma inclinação.

Pool de tokens compartilhado (texto/imagem/fala/música)

O M3 é nativo multimodal. Texto, imagem e vídeo atingem o mesmo endpoint e o mesmo medidor. O texto é a modalidade mais barata por uma ampla margem. Entradas de imagem e vídeo são tokenizadas a taxas mais altas e cobradas separadamente da taxa principal. Os números multimodais exatos não estão no cartão de preços padrão — você precisa consultar a documentação da plataforma.

Se o seu fluxo de trabalho com a api do minimax m3 é intensivo em texto com entrada de imagem ocasional, sua fatura parecerá próxima da manchete. Intensivo em vídeo, recalcule. A verificar.

Por Que 1M de Contexto Custa Mais do Que Parece

O MSA (MiniMax Sparse Attention) é o que torna o contexto de 1M prático em vez de apenas um número de ficha técnica. Mas “suporta 1M” e “deve ser executado com 1M” são afirmações diferentes.

Tamanho do prompt + tokens de saída

A saída é 4x mais cara do que a entrada em ambos os tiers. Portanto, uma tarefa que lê muito e escreve pouco é barata; lê muito e escreve muito, não é.

Exemplo prático. Passagem de codificação agente com 500K de entrada, 100K de saída. Na taxa padrão promocional: (0,5 × $0,30) + (0,1 × $1,20) = ​$0,27 por tarefa​. Fica abaixo de 512K.

Empurre a entrada para 600K. Mesmos 100K de saída. Você cruzou o penhasco. Toda a chamada é de contexto longo: (0,6 × $0,60) + (0,1 × $2,40) = ​$0,60 por tarefa. Mais de 2x por 20% a mais de entrada. Essa é a parte da estrutura de preço do minimax m3 que você precisa planejar.

Sessões longas e loops de agentes

Loops de agentes compõem isso. Cada turno acrescenta ao contexto. No turno 10 ou 15, você frequentemente passa de 512K não porque algum passo individual precisava disso, mas porque nada foi podado. Uma janela de contexto de 1M é um limite superior para problemas difíceis, não um padrão.

Pausei aqui quando li os preços pela primeira vez. A taxa por token do M3 é baixa, mas o custo por tarefa é definido por quanto contexto você escolhe arrastar. As faturas da maioria das equipes são determinadas antes da página de preços.

Alavancas de Controle de Custo

O preço do minimax m3 que você realmente paga depende de três alavancas.

Recuperação/chunking em vez de preenchimento de janela completa. Se você pode responder à pergunta com 50K tokens de contexto recuperado, enviar 500K é um imposto. Configurações de recuperação ficam no tier padrão e fora do penhasco de contexto longo. Use a janela de 1M quando você genuinamente precisa de raciocínio entre documentos. Use recuperação quando não precisar.

Cache. O M3 tem cache automático de prompts — sem configuração necessária. As leituras de cache são cobradas a aproximadamente 10% do preço de entrada ($0,06/M promoção padrão, $0,24/M contexto longo). Esta é a maior alavanca em qualquer carga de trabalho de agente ou chat com prompts de sistema estáveis, e é onde a api do minimax m3 recompensa diretamente o esforço de engenharia. Se 60% de sua entrada em cada turno é um prefixo estável que atinge o cache, você reduz aproximadamente 54% da sua fatura de entrada em cada turno após o primeiro. A documentação de cache de prompt da Anthropic explica a mecânica claramente. Embora o MiniMax M3 implemente o cache de forma diferente, o padrão econômico é amplamente similar: uma gravação de cache de custo mais alto seguida por leituras de cache substancialmente mais baratas.

Roteamento de modelos. Nem todo passo em um loop de agente precisa do M3. Um classificador barato na frente, com o M3 sendo invocado apenas quando justificado, pode reduzir o gasto total pela metade em cargas de trabalho que se distribuem por muitas subtarefas pequenas.

Quem Deve Pagar por Contexto Longo

Contexto longo não é inteligência gratuita — é um tier de cobrança com uma borda rígida em 512K.

Melhor adequação: compreensão de código em escala de repositório, onde o modelo precisa do repositório completo; análise de documentos longos onde o chunking quebraria o raciocínio; tarefas de agentes de longo horizonte onde o histórico completo de ações é essencial. Os números de benchmark do minimax m3 que a MiniMax publicou no lançamento — SWE-Bench Pro, BrowseComp — correspondem a essas categorias de carga de trabalho. Trate os benchmarks de fornecedores com o ceticismo habitual.

Gasto excessivo: Q&A de documento único onde a recuperação funcionaria. Aplicações de chat sem requisito real de memória. Classificação em massa — o modelo minimax m3 é excessivo para tarefas que um modelo pequeno resolve bem. Roteie, não escale.

O Token Plan por assinatura é uma questão separada. A MiniMax vende uma assinatura plana para desenvolvedores nos planos Plus ($20), Max ($50) e Ultra ($120) por mês, com cotas mensais de tokens M3 de aproximadamente 1,6B, 5,1B e 9,8B respectivamente. O Token Plan e o PAYG não competem no mesmo eixo que uma pontuação de benchmark do minimax m3 — as cotas são sobre previsibilidade de throughput, não capacidade bruta. Tráfego alto e constante abaixo de 512K, a assinatura provavelmente vence. Instável ou com muito contexto longo, faça o cálculo duas vezes.

Perguntas Frequentes

Onde está a quebra de preço entre padrão e contexto longo (>512K) no MiniMax M3?

Em 512K tokens de entrada. ≤512K é cobrado na taxa padrão; >512K cobra a requisição inteira — entrada, saída e leituras de cache — a 2x. Função degrau, não gradual.

A entrada multimodal (imagem/vídeo) compartilha o mesmo pool de tokens que o texto?

Sim, mesmo endpoint e medidor. Mas imagem e vídeo são tokenizados a uma taxa mais alta e cobrados a um preço separado por milhão não mostrado no cartão principal. Verifique os documentos da plataforma antes de fazer o orçamento.

Como estimo o custo de um fluxo de trabalho de agente de contexto longo no M3?

Três números: entrada média por turno, saída média por turno, número de turnos. Multiplique tudo, some. Em seguida, estime qual fração da entrada é armazenável em cache (tipicamente 50–80% em loops de agentes) e aplique a taxa de leitura de cache de 10% a essa parte. Por fim, verifique se algum turno ultrapassa 512K — se sim, esse turno paga 2x em tudo. A maioria das surpresas na fatura vem da última verificação.

Quais são as alternativas mais baratas se eu não precisar realmente de 1M de contexto?

A linha M2.5 da MiniMax é executada na mesma taxa principal no tier padrão e é adequada para a maioria das cargas de trabalho que cabem em 256K. Se você não precisa de contexto longo de classe MSA, está pagando por uma capacidade que não vai usar.

O Token Plan por assinatura muda como devo pensar sobre os preços da API?

Muda a unidade de contabilidade, não a lógica subjacente. O PAYG cobra por token com o penhasco em 512K. O Token Plan troca isso por cota mensal fixa a preço fixo. A assinatura vence para cargas de trabalho previsíveis e de alto volume abaixo de 512K. O PAYG vence para as instáveis ou com muito contexto longo. Não escolha um sem modelar pelo menos uma semana de tráfego real em ambos.

Conclusão

O preço do minimax m3 que importa não é o que está no cartão de preços. É o custo por tarefa uma vez que você tenha levado em conta o tamanho do prompt, o volume de saída, se você vai cruzar 512K e quanto da entrada é armazenável em cache. A taxa principal é competitiva — verdade. Mas a fatura no final do mês é definida pela arquitetura.

Ordem de operações: modele primeiro uma carga de trabalho representativa, verifique se alguma chamada cruza 512K, adicione estimativas de cache e então compare com os tiers do Token Plan. Pule alternativas até ter feito as primeiras quatro etapas.

É onde meus dados terminam. As taxas promocionais são temporárias e os preços multimodais estão incompletos nos documentos públicos. Faça o cálculo você mesmo antes de se comprometer com volume.

Posts anteriores:

Compartilhar