GPT-5.4 Mini API: 가격, 컨텍스트 및 프로덕션 활용

개발자를 위한 GPT-5.4 Mini API: 가격, 컨텍스트 윈도우, 툴 지원, 그리고 라우팅 설정에서 적합한 대용량 워크로드 안내.

By Dora 7 min read

GPT-5.4 Mini API는 3월 17일부터 출시되어 있습니다. 저는 약 3개월 동안 다른 세 가지 모델과 함께 실제 트래픽을 라우팅해왔습니다. 이 글은 실제로 어디에 적합한지에 대한 작업 노트입니다.

안녕하세요, Dora입니다. 시작하기 전에 한 가지 명확히 하겠습니다. 많은 분들이 혼동하는 것을 계속 보고 있기 때문입니다: GPT-5.4는 더 이상 OpenAI의 최전선 모델이 아닙니다. GPT-5.5가 그 자리를 차지하고 있습니다. 5.5 출시에 대해서는 별도의 글에서 다뤘으며, 3월의 사전 출시 5.4 유출 기사들은 당연히 오래된 정보입니다. 여기서 제가 쓰는 내용은 더 좁은 범위입니다 — 저비용 라우팅 계층으로서의 mini와 nano, 이것이 그들이 자리 잡고 있는 역할입니다.

프로덕션 AI 워크로드를 위한 모델 라우팅을 구축하고 있다면, 사양서보다 이 구분이 훨씬 더 중요합니다.

GPT-5.4 Mini의 위치

2026년 3월 17일 빠른/저비용 변형으로 출시

OpenAI는 3월 17일 GPT-5.4 mini와 nano를 출시했습니다. 몇 주 전 GPT-5.4 출시의 소형 버전으로 나온 것입니다. 발표의 내용은 솔직합니다: 대용량 작업을 위해 증류되고, 더 저렴하고, 더 빠른 버전. OpenAI의 수치에 따르면 GPT-5 mini보다 2배 이상 빠릅니다. (그들의 수치, 그들의 조건입니다. 통제된 벤치마크는 실행하지 않았습니다 — 하지만 실제 워크로드 지연 시간에서 더 빠르다는 것은 제가 보는 것과 일치합니다.)

빌더들에게 더 큰 질문은 “mini가 좋은가”가 아닙니다 — “무엇에 좋은가”입니다. 발표에서는 이 부분을 과소평가하고, 라우팅 질문이 이를 명확하게 만듭니다.

API 접근 (mini는 ChatGPT 무료 티어에서도 제공)

gpt 5.4 mini 모델을 사용할 수 있는 세 가지 장소: OpenAI API 직접, ChatGPT 내부(무료 티어 포함 — 네, 무료 티어), 그리고 OpenAI의 엔드포인트로 라우팅하는 집계자를 통해. GitHub Copilot도 첫날 이를 도입했습니다 — 그들의 변경 로그는 OpenAI 발표와 함께 3월 17일에 업데이트되었습니다.

Nano는 API 전용입니다. ChatGPT 인터페이스는 없습니다. 사용자들을 nano로 직접 안내하려는 경우 알아두어야 합니다 — 그건 불가능하고, 그 주위에 구축한 API 통합에만 접근할 수 있습니다.

가격 및 컨텍스트

입력/출력 요금 & 캐시된 입력

게시일 기준 수치, OpenAI의 공식 모델 페이지에서. 이 수치들은 변동하므로, 확정하기 전에 확인하세요:

  • GPT-5.4 mini: 1M 입력당 $0.75, 1M 출력당 $4.50, 캐시된 입력 $0.075
  • GPT-5.4 nano: 1M 입력당 $0.20, 1M 출력당 $1.25

제가 실제로 계획을 세울 때 중요하게 보는 것은 캐시된 입력 요금입니다. $0.075는 입력에 대한 10배 할인이며, 안정적인 시스템 프롬프트나 반복되는 컨텍스트가 있는 모든 워크로드(거의 모든 에이전트, 대부분의 채팅 인터페이스, RAG 형태의 모든 것)에서 캐싱이 비용에서 주요 역할을 합니다. gpt 5.4 mini 가격의 헤드라인은 최악의 경우이지, 일반적인 경우가 아닙니다.

한 가지 각주: 지역 처리(데이터 상주) 엔드포인트는 10% 할증이 붙습니다. 크지는 않지만, EU나 다른 지역 인터페이스를 통해 라우팅하는 경우 모델링할 가치가 있습니다.

컨텍스트 창

OpenAI 문서에는 mini에 대해 400K 토큰 컨텍스트, 128K 최대 출력이 나열되어 있습니다. 집계자 페이지에서 다른 숫자를 인용하는 것을 봤습니다(한 곳에서는 1.1M을 제시했는데, 출처와 일치하지 않습니다). 의심스러울 때는 공식 모델 페이지가 우선입니다 — 그리고 공식 수치는 400K입니다.

350K에서 테스트했습니다(가득 찬 에이전트 트랜스크립트와 도구 출력). 문제없이 작동했습니다. 한계까지 밀어붙이지는 않았습니다 — 이 가격대에서는 진정으로 긴 컨텍스트 케이스를 최전선 모델로 라우팅하는 것이 mini의 한계를 스트레스 테스트하는 것보다 낫습니다.

최적화된 프로덕션 워크로드

대용량, 지연 시간에 민감한 작업

여기서 mini가 라우팅 테이블에서 자신의 위치를 확보합니다. 제가 투입한 프로젝트들에서 유지된 패턴:

  • 분류, 추출, 가벼운 재포맷 — 빠른 구조화된 답변이 필요하고 추론이 한두 단계인 모든 것. Mini는 최전선 비용의 일부로 처리합니다.
  • 간단한 턴이 있는 긴 채팅 세션 — 턴의 80%가 심도 있는 추론이 필요하지 않을 때, 모든 것에 GPT-5.5 요금을 지불하는 것은 잘못된 것입니다.
  • 높은 팬아웃 하위 작업 — 50가지 변형 생성, 200개의 검색 문서 점수 매기기 등. 단위 비용 차이가 빠르게 누적됩니다.

실패하는 것을 본 경우: 깊은 다단계 계획이 필요하거나, 모델이 잘 지정된 단계를 실행하는 것이 아니라 무엇을 해야 할지 결정해야 하는 경우. (mini가 플래너 역할을 하는 워크플로우가 있었습니다. 3일 지속했습니다. 교체했습니다. 제 실수를 반복하지 마세요.)

도구 사용 및 에이전트 하위 작업

이 부분이 저를 놀라게 했기 때문에 언급할 가치가 있습니다. 발표에 따르면, 컴퓨터 사용 벤치마크인 OSWorld-Verified에서 mini는 전체 GPT-5.4에 근접하고 GPT-5 mini를 크게 능가합니다. 실제 사용에서 제가 설명하자면: 계획이 존재하면 도구 호출 실행에는 신뢰할 수 있고, 모호한 상황에서 어떤 도구를 사용할지 결정하는 데는 덜 신뢰할 수 있습니다.

따라서 효과적인 패턴은:

  1. 최전선 모델(GPT-5.5 또는 다른 것)이 계획하고 결정합니다.
  2. Mini가 단계들을 실행합니다 — 도구를 호출하고, 결과를 파싱하고, 플래너에게 돌려줍니다.

OpenAI는 이를 “Codex의 하위 에이전트”라고 부릅니다. 일반적인 형태는 그 용어보다 오래되었습니다 — 그것은 단지 표준 무거운 플래너/저렴한 실행자 분리입니다. Mini는 실행자 역할에 유독 뛰어납니다.

다중 모델 설정에서 Mini 라우팅

최전선 모델로 에스컬레이션할 시점

Mini를 사용할 때 라우팅이 핵심입니다. 맹목적으로 모든 곳에 사용하면 어려운 턴에서 추론 실패를 경험하게 됩니다. 전혀 사용하지 않으면 쉬운 턴에서 돈을 낭비합니다. 제가 사용하는 에스컬레이션 규칙, 중요도 순서로:

  1. 계획 형태의 질문에서 에스컬레이션. 전략 선택, 모호한 목표 분해, 또는 트레이드오프 검토가 필요한 모든 것. Mini는 무엇을 해야 하는지 알 때는 괜찮습니다. 무엇을 해야 할지 파악해야 할 때는 어려움을 겪습니다.

  2. 입력이 272K 토큰을 초과할 때 에스컬레이션. Mini가 400K를 처리하지 못해서가 아니라 — 처리할 수 있습니다 — 프롬프트가 그렇게 클 때 워크로드는 보통 최전선 모델의 혜택을 받는 문서 간 추론을 포함하기 때문입니다. (GPT-5.5도 272K 이상에서 입력 2배 요금이 부과됩니다, 따라서 비용 그림이 거기서 변합니다.)

  3. 중요한 단일 호출에서 에스컬레이션. 답변이 중요하고 하류에 인간 검토가 없다면, 추가 비용을 지불하세요. 한 번의 호출에서 비용 차이는 무관합니다; 틀렸을 때의 비용은 그렇지 않습니다.

  4. 질문이 “어려워 보인다”는 이유만으로 에스컬레이션하지 마세요. 그것이 mini가 과소 활용되는 방식입니다. 많은 “어려워 보이는” 질문들은 실제로 잘 지정되어 있고 mini가 처리합니다. 추정하기 전에 테스트하세요.

실용적인 설정: 저렴한 분류기(mini 자체 또는 nano)가 라우트를 결정하도록 합니다. 완벽하지는 않지만, 모든 것을 최전선으로 라우팅하거나 모든 것을 mini로 라우팅하는 것보다 낫습니다.

한계 및 트레이드오프

제가 실제로 경험한 몇 가지를 있는 그대로 나열합니다:

  • Nano는 mini보다 의미 있게 약합니다. 가격 차이로는 같은 대화에 있는 것처럼 보입니다. 그렇지 않습니다. Nano는 매우 좁은 작업(저렴한 분류, 하위 단계 라우팅)에는 작동합니다. 적당한 추론이 필요한 것에는 가격 비율이 제안하는 것보다 더 큰 차이로 mini가 이깁니다. 비용만으로 nano를 선택하지 마세요.
  • 컨텍스트 창 대 컨텍스트 사용성. 400K는 한계입니다. 모델은 여전히 마지막 100K보다 첫 번째 100K에서 일관성을 유지하는 데 더 뛰어납니다 — 거의 모든 대용량 컨텍스트 모델과 같습니다. 그에 따라 프롬프트를 계획하세요.
  • OpenAI API의 mini는 ChatGPT 무료에 있는 mini이기도 합니다. 이것은 빌더들보다 제품 포지셔닝에 더 중요합니다 — 사용자들이 ChatGPT에서 무료로 할 수 있는 것을 구축하고 있다면, 차별화는 모델 접근이 아닌 애플리케이션에서 와야 합니다.
  • GPT-5.4는 더 이상 최전선이 아닙니다. 위에서 언급했지만 한계 섹션에서 반복할 가치가 있습니다. “GPT-5.4로 구동됨”이 최첨단인 것처럼 제품을 홍보하지 마세요 — 관심 있는 사람들은 그것이 아니라는 것을 알고 있습니다. 정직한 홍보는 모델 이름이 아닌 라우팅 로직입니다.

또한 지루한 것도 언급하겠습니다: API 동작이 변경됩니다. 재현성이 중요하다면 모델 스냅샷을 고정하세요. 자동 라우팅 별칭(gpt-5.4-mini)은 시간이 지남에 따라 더 새로운 스냅샷으로 자동으로 이동합니다.

FAQ

GPT-5.4 Mini는 API를 통해서만 사용 가능한가요, 아니면 ChatGPT에서도 사용 가능한가요?

둘 다입니다. GPT-5.4 Mini API는 개발자 인터페이스입니다. 동일한 모델이 무료 티어를 포함한 ChatGPT에서도 실행됩니다. Nano는 API 전용입니다.

GPT-5.4 Mini의 실제 컨텍스트 창 크기는 얼마인가요?

OpenAI의 공식 문서에 따르면 400K 입력 토큰, 128K 최대 출력입니다. 일부 집계자 페이지에서 다른 숫자를 나열합니다 — 충돌할 경우 OpenAI의 모델 페이지가 우선입니다.

GPT-5.4 Mini는 도구 사용과 멀티모달 입력을 지원하나요?

네. 텍스트 및 이미지 입력, 함수 호출, 웹 검색, 파일 검색, 컴퓨터 사용, 그리고 Responses API를 통한 기술. 텍스트 출력만 지원합니다. 도구 실행에 강하고, 모호함 하에서 어떤 도구를 사용할지 결정하는 데는 약합니다.

언제 Mini 대신 GPT-5.5로 작업을 라우팅해야 하나요?

작업이 실행보다 계획을 요구할 때, 입력이 ~272K 토큰을 초과할 때, 단일 호출 답변 품질이 비용 차이보다 더 중요할 때, 또는 프롬프트 형태보다 모델 능력으로 귀속될 수 있는 추론 실패를 경험할 때. 그 외의 모든 것에는 mini를 사용하세요.

라우팅 설정에서 GPT-5.4 Mini와 다른 모델 중 어떻게 결정하나요?

각 후보 모델을 통해 실제 프로덕션 트래픽의 소규모 홀드아웃을 실행하세요. 비용, 지연 시간, 그리고 실제로 중요한 작업별 품질 지표를 측정하세요 — 일반적인 벤치마크가 아닌. 그런 다음 그에 따라 라우팅하세요. 결정은 경험적이고 워크로드별입니다; 데이터와 접촉하면 살아남는 일반적인 규칙은 없습니다.

결론

GPT-5.4 Mini API에서 흥미로운 점은 그 능력이 아닙니다. 라우팅 설정의 실행자 역할에 배치하기에 적합한 모델이라는 것입니다 — 최전선 모델이 능력이 가장 중요한 소수의 턴을 처리하는 동안 대부분의 작업을 하는 저렴하고 빠른 레이어.

스택이 여전히 단일 모델이라면 — 하나의 모델이 모든 것을 처리한다면 — 쉬운 턴에 과도하게 지불하거나 어려운 턴에 성능이 부족하거나, 또는 둘 다입니다. Mini가 잘하는 것은 방에서 가장 똑똑한 모델이 되는 것이 아닙니다. 방의 대부분에 충분히 똑똑한 가장 저렴한 모델이 되는 것입니다.

라우팅 레이어에 추가하기 전에 실제로 할 것:

주어질 워크로드에 대해 일주일간 실제 트래픽을 통해 실행하세요. 제품이 실제로 의존하는 지표에서 비용, 지연 시간, 품질을 측정하세요. 스냅샷을 고정하세요. 출시 후가 아닌 출시 전에 에스컬레이션 규칙을 구축하세요.

3개월은 mini가 프로덕션에서 유지된다고 말하기에 충분합니다. 장기적인 가격 안정성에 대해 말하기에는 충분하지 않습니다 — 그것은 OpenAI에 달려 있습니다.

실제로 구축하는 날 문서를 통해 확인하세요.

더 많은 내용이 나올 예정입니다.

이전 게시물: