업데이트: 2026-06-06
모델 공식 정가 방식
이 문서는 업스트림 벤더의 공식 과금 기준만 설명하며, Crazyrouter의 실제 판매가와는 다릅니다.- 업스트림 공식 기준: 벤더 자체의
input,output,cached input,tool call,search grounding,prompt caching등 과금 방식 - Crazyrouter 기준: 본 사이트 자체의 판매가, 배율, 할인, 채널 차이 및 정산 방식
본 페이지는
2026-04-27에 조회한 벤더의 공식 문서를 기준으로 정리되었습니다. 벤더는 가격을 변경할 수 있으며, 프리뷰 모델, 롱 컨텍스트, 검색 도구 및 캐시 규칙도 조정될 수 있습니다. 실제 적용 전 공식 링크에서 다시 한 번 확인하시기 바랍니다.공식 단가 예시표
아래 예시는 각 벤더에서 가장 흔하고 업무 예산과 직접 대응하기 쉬운 한 단계만 골랐습니다:- Anthropic: 표준 API 가격이며,
Fast mode,US-only inference배율 및 Batch 할인은 포함하지 않습니다 - OpenAI:
Standard가격이며, Batch, Priority, Regional Processing 추가 요금은 포함하지 않습니다 - Gemini:
Standard가격이며, 기본적으로 텍스트/이미지/비디오 입력을 기준으로 하고,Gemini 3*에 대해서는<= 200K prompt구간을 취합니다 - xAI: 사이트 내 라우팅 명칭에 공개된 독립 단가가 없는 경우, 본 표에는 “단독 명시 없음”으로 명확히 표기합니다
- Z.AI: 공식
Text Models가격을 취합니다 - MiniMax: 메인 표는
Pay as You Go를 기준으로 하고, 구독제는Token Plan으로 별도 표기합니다
특별히 표기되지 않은 경우, 아래 표의 금액은 기본적으로
USD / 1M tokens입니다.Anthropic 예시 단가
OpenAI 예시 단가
Gemini 예시 단가
xAI 예시 단가
xAI 현재 공개된 정적 문서에서 안정적으로 확인할 수 있는 것은 token 분류 규칙, tool invocation 비용, Batch
50% 할인, 그리고 “모델 상세 페이지 또는 콘솔에서 구체적인 per-model token price를 확인하라”는 안내입니다. grok-4.1 / grok-4.1-fast가 정적 문서에 단독 가격으로 명시되어 있지 않으므로, 본 페이지는 다른 SKU의 숫자를 이들에게 억지로 대입하지 않습니다.Z.AI / GLM 예시 단가
MiniMax 예시 단가
Pay as You Go
Token Plan
Anthropic
Anthropic 계열 모델의 공식 과금 방식은 단순한input / output 두 항목이 아니라 다음과 같이 나뉩니다:
Base Input Tokens5m Cache Writes1h Cache WritesCache Hits & RefreshesOutput Tokens
Batch API의 입력과 출력은 보통 표준가50% 할인으로 계산됩니다- Prompt caching의 공개된 배율 규칙은 다음과 같습니다:
5분 쓰기 캐시 = 1.25배 input,1시간 쓰기 캐시 = 2배 input,읽기 캐시 = 0.1배 input
공식 링크:
- Anthropic Pricing: platform.claude.com/docs/en/about-claude/pricing
- Anthropic Models Overview: platform.claude.com/docs/en/about-claude/models/overview
OpenAI
OpenAI 계열 텍스트 모델의 공식 공개 기준이 가장 통일되어 있으며, 핵심은 다음과 같습니다:InputCached inputOutput
Responses API자체는 별도로 요금이 추가되지 않으며, 선택한 모델의 token 단가로 계속 과금됩니다Web search, 컨테이너/코드 실행, Computer Use 등의 도구는 도구별로 과금되며, 순수 token 단가에는 포함되지 않습니다Batch API의 입력과 출력은 보통 표준가50% 할인으로 계산됩니다
공식 링크:
- OpenAI Pricing: openai.com/api/pricing
- OpenAI Docs Pricing: platform.openai.com/docs/pricing
- OpenAI Models: developers.openai.com/api/docs/models
Google Gemini
Gemini의 공식 과금 방식은 앞의 두 벤더와 차이가 가장 크며, 보통 표준가 하나만 있는 것이 아니라 다음을 동시에 제공합니다:StandardBatchFlexPriority
InputOutput (including thinking tokens)Context caching priceContext caching storageGrounding with Google SearchGrounding with Google Maps
공식 링크:
- Gemini Pricing: ai.google.dev/gemini-api/docs/pricing
- Gemini Models: ai.google.dev/models/gemini
xAI Grok
xAI 공식 규칙의 핵심은 “thinking 모델에 별도의 가격표가 있는가”가 아니라, token과 도구를 분리하는 것입니다:Prompt tokensCached prompt tokensCompletion tokensReasoning tokens
Reasoning tokens는completion token price로 과금Web Search,X Search,Code Execution,Collections Search등 server-side tools는1000회 호출당별도 과금Batch API는 token 관련 비용에 대해 보통50% 할인
공식 링크:
- xAI Models and Pricing: docs.x.ai/developers/models
- xAI Consumption and Rate Limits: docs.x.ai/developers/rate-limits
- xAI Prompt Caching Pricing: docs.x.ai/developers/advanced-api-usage/prompt-caching/usage-and-pricing
Z.AI / GLM
Z.AI의GLM-5 공식 기준은 OpenAI와 유사하지만, 캐시 저장 비용이 하나 더 추가됩니다:
InputCached InputCached Input StorageOutput
Web Search 등 내장 도구는 사용 횟수에 따라 별도로 과금됩니다.
공식 링크:
- Z.AI Pricing: docs.z.ai/guides/overview/pricing
- GLM-5 Overview: docs.z.ai/guides/llm/glm-5
MiniMax
MiniMax 계열 모델은 먼저 두 가지 공식 판매 방식을 구분해야 합니다:Pay as You GoToken Plan
Pay as You Go는 표준 API 사용량 기반 과금입니다Token Plan은 구독제이며,M2.7은5시간 롤링 윈도우의 요청 할당량으로 계산되고, 단순히 token으로 정산되지 않습니다
공식 링크:
- MiniMax Pricing Overview: platform.minimax.io/docs/pricing/overview
- MiniMax Pay as You Go: platform.minimax.io/docs/guides/pricing-paygo
- MiniMax Token Plan: platform.minimax.io/docs/guides/pricing-token-plan
결론
“공식적으로 도대체 어떤 기준으로 과금하는가”를 빠르게 파악하려면 다음 몇 가지만 기억하면 됩니다:- Anthropic:
base input + cache write/read + output - OpenAI:
input + cached input + output, 도구는 별도 계산 - Gemini:
여러 처리 모드 + input/output + caching + search/maps grounding - xAI:
prompt/cached/completion/reasoning, server-side tools는 별도 계산 - Z.AI:
input + cached input + cached storage + output - MiniMax:
사용량 기반 token또는구독 할당량두 방식이 병존