Grok 4.6 API 요금: 200K 절벽과 4.5가 이기는 지점
Grok 4.6은 100만 토큰당 $2/$6이지만 프롬프트가 20만 토큰에 닿는 순간 모든 토큰이 두 배가 됩니다. 요청마다 따라붙는 고정 오버헤드까지 포함해 Grok 4.5와 실측 비교했습니다.
Grok 4.6은 100만 토큰당 입력 $2.00, 출력 $6.00입니다. Grok 4.5와 정확히 같은 값입니다. 두 모델 카드는 요청 한도까지 나머지가 전부 같습니다. 다른 숫자는 하나, 캐시된 입력이고, 거기서는 새 모델이 더 비쌉니다.
정작 더 큰 숫자는 두 모델 사이의 차이가 아닙니다. 프롬프트 20만 토큰에서 모든 요금이 두 배가 되고, 그것도 요청 전체에 대해 두 배가 됩니다.
모델 ID: grok-4.6 / grok-4.5 (게이트웨이에서는 x-ai/grok-4.6)
컨텍스트: 500K 토큰, 둘 다
200K 미만: 입력 $2.00 / 출력 $6.00 두 모델 동일
캐시 4.6은 $0.50, 4.5는 $0.30
200K 이상: 입력 $4.00 / 출력 $12.00 두 모델 동일
캐시 4.6은 $1.00, 4.5는 $0.60
기준선: 초과분이 아니라 요청의 모든 토큰에 적용
실측: 요청당 고정 오버헤드 4.6은 206토큰, 4.5는 494토큰
손익분기: 캐시된 토큰 약 575개, 그 아래에서는 4.6이 호출당 더 쌈
스냅샷: 2026-08-19
Grok 4.6 API 요금은 얼마인가
프롬프트가 200K에 닿기 전까지 100만 토큰당 입력 $2.00, 캐시 입력 $0.50, 출력 $6.00입니다. 문서 사이트를 이제 SpaceXAI로 표기하는 xAI의 모델 목록에서 그대로 가져온 값입니다.
| 모델 | 컨텍스트 | 입력 | 캐시 입력 | 출력 |
|---|---|---|---|---|
| grok-4.6, 프롬프트 200K 미만 | 500K | $2.00 | $0.50 | $6.00 |
| grok-4.6, 프롬프트 200K 이상 | 500K | $4.00 | $1.00 | $12.00 |
| grok-4.5, 프롬프트 200K 미만 | 500K | $2.00 | $0.30 | $6.00 |
| grok-4.5, 프롬프트 200K 이상 | 500K | $4.00 | $0.60 | $12.00 |
| grok-4.3 | 1M | $1.25 | $0.20 | $2.50 |
Grok 4.3을 표에 넣은 데는 이유가 있습니다. 두 4.x 플래그십 어느 쪽과 비교해도 입력이 38%, 출력이 58% 싸고, 컨텍스트는 500K가 아니라 1M입니다. 최신 모델이 꼭 필요한 워크로드가 아니라면 한 단계 아래는 작은 절감이 아닙니다.
게이트웨이는 헤드라인 요금을 그대로 전달합니다. OpenRouter와 ofox 모두 x-ai/grok-4.6을 컨텍스트 50만 토큰에 $2.00 / $6.00으로 표기합니다. 어느 카탈로그에도 드러나지 않는 것이 둘째 행입니다. 게이트웨이 모델 목록은 보통 모델당 요금 한 쌍만 싣기 때문에, 200K 초과 시의 두 배 과금은 청구서에 찍히기 전까지 보이지 않습니다. 카탈로그 필드가 아니라 xAI 표에서 읽으세요.
프롬프트가 20만 토큰을 넘으면 어떻게 되나
초과분이 아니라 요청 전체가 다시 매겨집니다. xAI의 표현은 모호하지 않습니다. 프롬프트가 기준선에 도달한 요청은 그 요청의 모든 토큰에 높은 요금이 적용됩니다.
2,000토큰 차이가 나는 두 요청, 출력은 둘 다 2,000토큰입니다.
| 프롬프트 크기 | 입력 비용 | 출력 비용 | 합계 |
|---|---|---|---|
| 199,000 토큰 | $0.398 | $0.012 | $0.410 |
| 201,000 토큰 | $0.804 | $0.024 | $0.828 |
프롬프트는 1% 커졌는데 청구액은 102% 커졌습니다. 완만한 기울기도 없고, 선 아래 토큰에 대한 부분 감면도 없습니다.
실무적으로는 이렇습니다. 컨텍스트 윈도우가 500K까지 가더라도 비용에 민감한 작업에서 200K는 부드러운 한계가 아니라 딱딱한 천장입니다. 윈도우의 40%를 넘어가는 순간 비싼 등급입니다.
이 선을 생각보다 쉽게 넘게 만드는 요인이 둘 있습니다. 첫째, 기준이 프롬프트이므로 긴 대화는 한 턴씩 이 선을 향해 걸어가고, 어느 한 메시지도 크지 않은 채로 선을 넘습니다. 둘째, 프롬프트 안에 들어 있는 것이 당신이 보낸 것만은 아닙니다. 다음 절의 주제입니다.
배치 처리 중이라면 해법은 선을 넘은 뒤가 아니라 넘기 전에 쪼개는 것입니다. 150K 요청 두 개는 낮은 등급에서 입력 $0.60이고, 같은 토큰을 300K 요청 하나로 보내면 $1.20입니다.
Grok 4.6과 4.5의 차이
공개된 카드에서는 숫자 하나입니다. 두 모델 카드를 가져와 모든 필드를 나란히 놓았습니다.
| 항목 | Grok 4.6 | Grok 4.5 |
|---|---|---|
| 컨텍스트 윈도우 | 500,000 | 500,000 |
| 모달리티 | 텍스트·이미지 → 텍스트 | 텍스트·이미지 → 텍스트 |
| Function calling | 지원 | 지원 |
| Structured outputs | 지원 | 지원 |
| Reasoning | 지원 | 지원 |
| 초당 요청 수 | 150 | 150 |
| 분당 토큰 수 | 50,000,000 | 50,000,000 |
| 리전 | us-east-1, us-west-2 | us-east-1, us-west-2 |
| 입력 / 출력 | $2.00 / $6.00 | $2.00 / $6.00 |
| 캐시 입력 | $0.50 | $0.30 |
| 별칭 | 없음 | grok-4.5-latest, grok-build-latest |
캐시 입력은 새 모델이 67% 더 비쌉니다. 보통의 방향과 반대이고, 4.5를 계속 두는 문서상의 근거는 이것뿐입니다.
Grok Build를 쓴다면 별칭 행을 다시 보세요. grok-build-latest는 4.6이 아니라 Grok 4.5로 해석됩니다. Build 등급이 플래그십을 따라간다고 가정했다면 그렇지 않습니다.
왜 같은 프롬프트가 Grok 4.5에서 더 비싼가
모든 요청에 고정된 입력 토큰 덩어리가 따라붙는데, 그게 4.5에서 두 배 넘게 크기 때문입니다.
2026-08-19에 같은 단어를 1개, 50개, 200개 반복한 동일한 본문을 OpenAI 호환 게이트웨이를 통해 네 모델에 보내고 직선을 맞췄습니다. 모든 모델이 본문을 단어당 정확히 1.00토큰으로 토큰화했습니다. 절편은 일치하지 않았습니다.
| 모델 | 고정 입력 오버헤드 | 그중 캐시로 보고된 양 |
|---|---|---|
x-ai/grok-4.6 | 206 토큰 | 128 |
x-ai/grok-4.5 | 494 토큰 | 384 |
x-ai/grok-4.3 | 4 토큰 | 없음 |
z-ai/glm-5.3 | 12 토큰 | 없음 |
4토큰과 12토큰은 평범한 채팅 템플릿입니다. 206토큰과 494토큰은 프리앰블입니다. 직접 system 메시지를 넣었더니 두 수치가 그 메시지 크기만큼, 정확히 7토큰씩 올라갔습니다. 즉 이것은 당신이 보내는 것을 대체하는 게 아니라 그 아래에 깔려 있습니다.
출처를 특정할 두 번째 경로를 시험하지 못했으므로 원인은 미확인으로 두겠습니다. 같은 엔드포인트의 4.3과 xAI가 아닌 모델에서는 이 오버헤드가 전혀 보이지 않으므로 게이트웨이가 아니라 모델을 따라다니는 것으로 보이지만, 상류에서 비롯되는지 확인하려면 직접 키가 필요합니다. 어느 쪽이든 청구서에는 올라오니 값을 매겨 두세요.
공개 요금으로 계산하면, 당신의 토큰을 한 개도 보내기 전에 이렇습니다.
| Grok 4.6 | Grok 4.5 | |
|---|---|---|
| 캐시된 부분 | 128 × $0.50/M = $0.000064 | 384 × $0.30/M = $0.000115 |
| 캐시되지 않은 부분 | 78 × $2.00/M = $0.000156 | 110 × $2.00/M = $0.000220 |
| 요청당 | $0.000220 | $0.000335 |
| 100만 요청당 | $220 | $335 |
4.5의 캐시 요금이 싼 것은 사실이고, 짧은 호출에서는 더 큰 프리앰블이 그 이점을 다 먹고도 남습니다.
여유 공간도 먹습니다. 4.5에서는 자기 토큰 계산이 알려 주는 것보다 494토큰 일찍 200K 절벽에 닿고, 4.6에서는 206토큰 일찍 닿습니다. 프롬프트를 정확히 199,800토큰으로 잡고 있다면 이미 넘은 것입니다.
내 워크로드에는 어느 쪽이 싼가
캐시된 토큰 약 575개 근처에서 답이 뒤집힙니다.
계산은 손으로 확인할 만큼 작습니다. Grok 4.5는 캐시 토큰 100만 개당 $0.20을 아끼고, 이는 캐시 토큰 하나당 $0.0000002입니다. 대신 더 큰 프리앰블 때문에 요청당 $0.000115를 잃습니다. 하나를 다른 하나로 나누면 575토큰이 나옵니다.
- 캐시 프리픽스가 약 575토큰 미만: Grok 4.6이 호출당 더 쌉니다
- 캐시 프리픽스가 약 575토큰 초과: Grok 4.5가 더 싸고, 격차는 선형으로 벌어집니다
- 10만 토큰짜리 캐시된 시스템 프롬프트와 도구 스키마라면 4.5에서 요청당 $0.02를 아낍니다. 프리앰블 손해의 약 170배입니다
200K 기준선은 이 선을 움직이지 않습니다. 그 위에서는 두 모델 모두 모든 요금이 두 배가 되므로, 캐시 이점도 100만 토큰당 $0.40으로 두 배가 되고 프리앰블 손해도 두 배가 됩니다. 손익분기는 약 575토큰에 그대로 남습니다.
여기까지가 입력입니다. 출력은 두 모델이 진짜로 갈라지는 지점이고, 캐시 논리를 전혀 따르지 않습니다. 같은 코드 생성 프롬프트를 양쪽에 8회씩 돌렸습니다.
| Grok 4.6 | Grok 4.5 | |
|---|---|---|
completion_tokens 중앙값 | 216 | 225 |
reasoning_tokens 중앙값 | 723 | 30 |
| 과금된 출력 중앙값 | 948 | 263 |
| 지연 시간 중앙값 | 15.8초 | 5.0초 |
| 1,000 작업당 비용, 총합 | $6.18 | $2.64 |
마지막 행만 출력 쪽 숫자가 아니므로 근거를 밝힙니다. 100만 토큰당 $6.00인 출력에 더해 100만 토큰당 $2.00인 입력 전체를 포함했고, 입력 쪽에는 앞 절의 요청당 고정 오버헤드가 들어 있습니다. 4.6은 244 입력 토큰, 4.5는 532 입력 토큰입니다. 출력만 따지면 $5.69와 $1.58입니다. 이 실행들에서는 캐시 적중을 기록하지 않았기 때문에 입력을 전부 캐시되지 않은 요금으로 계산했고, 그래서 총합 수치는 상한입니다. 프리앰블이 캐시에서 나왔다면 $5.98과 $1.99에 가깝습니다. 어느 쪽이든 순서는 바뀌지 않습니다.
16개 응답 모두 함수 정의와 docstring을 포함했습니다. 이는 품질 평가가 아니라 구조 확인이며, 코드에 점수를 매기지는 않았습니다. 의심의 여지가 없는 쪽은 지출입니다. 이 과제에서 Grok 4.6은 출력 토큰을 3.6배 청구했고 벽시계 시간을 3.2배 썼습니다. 두 모델 다 완수한 작업입니다.
필드 이름을 잘 보세요. 이 모델들에서 completion_tokens는 reasoning 토큰을 제외합니다. completion 216토큰을 보고한 응답에 reasoning 723토큰이 함께 있었고, total_tokens는 prompt와 completion과 reasoning의 합이었습니다. prompt_tokens × 입력단가 + completion_tokens × 출력단가로 만든 비용 추정기는 이 워크로드에서 과금된 출력을 77%, 호출 전체로는 약 71% 적게 셉니다. 이 필드 하나가 이 글의 모든 요금 차이보다 큰 오차입니다.
짧게 정리하면 이렇습니다. 긴 캐시 프리픽스가 있거나, 숙고에 돈을 쓰고 싶지 않은 짧고 결정적인 작업이라면 4.5입니다. 그 추가 추론이 목적이라면 4.6입니다.
Grok 4.6을 어떻게 호출하나
OpenAI 호환이라 base URL과 모델 문자열만 있으면 됩니다.
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.ofox.ai/v1")
r = client.chat.completions.create(
model="x-ai/grok-4.6", # 캐시가 싼 등급은 x-ai/grok-4.5
messages=[{"role": "user", "content": "이 모듈을 리팩터링하고 테스트를 돌려 줘."}],
)
u = r.usage
billed_output = u.completion_tokens + u.completion_tokens_details.reasoning_tokens
print(u.prompt_tokens, billed_output)
들어가는 길에 사람들이 자주 걸리는 것 셋입니다.
- 게이트웨이에서는 ID에 네임스페이스가 붙습니다. xAI에 직접 호출할 때는
grok-4.6이 되지만, OpenRouter와 ofox에서는x-ai/grok-4.6입니다. 하이픈이 중요합니다. logprobs는 조용히 실패합니다. xAI는 grok-4.20 이후 모델에서 미지원으로 문서화하고 해당 필드를 무시한다고 밝힙니다. 두 모델에logprobs: true와top_logprobs: 3을 보내 봤습니다. HTTP 200, 오류 없음, 응답에logprobs객체 없음. 동작하지 않았다는 사실을 알려 주는 것이 아무것도 없습니다.- 두 모델 모두 us-east-1과 us-west-2에만 있습니다. 미국 밖 데이터 레지던시 제약이 있다면 요금과 무관하게 이 조합은 답이 아닙니다.
ofox에서는 x-ai/grok-4.6과 x-ai/grok-4.5가 나머지 140여 개 모델과 같은 키, 같은 엔드포인트에 올라와 있습니다. 위의 A/B 비교가 문자열 하나 교체로 끝나는 이유입니다. 라이브 카탈로그 사양은 Grok 4.6과 Grok 4.5 모델 페이지에 있습니다.
참고 자료
- xAI 개발자 문서: 모델과 요금
- xAI 개발자 문서: Grok 4.6 모델 카드
- xAI 개발자 문서: Grok 4.5 모델 카드
- OpenRouter: x-ai/grok-4.6
- ofox 모델 페이지: Grok 4.6
- ofox 모델 페이지: Grok 4.5
요금과 사양은 xAI 문서에 대조해 확인했습니다. 실측치는 2026-08-19 스냅샷이며, Ofox 카탈로그 요금과 모델 수는 2026년 9월 3일 라이브 /v1/models 엔드포인트에서 다시 확인했습니다.
자주 묻는 질문
- Grok 4.6 API 요금은 얼마인가요?
- 프롬프트가 20만 토큰 미만인 동안에는 100만 토큰당 입력 $2.00, 캐시된 입력 $0.50, 출력 $6.00입니다. 프롬프트가 20만 토큰 이상이 되면 각각 $4.00, $1.00, $12.00이 되고, 초과분만이 아니라 해당 요청의 모든 토큰에 높은 요금이 적용됩니다.
- Grok 4.6과 Grok 4.5의 차이는 무엇인가요?
- 공개된 모델 카드 기준으로는 숫자 하나입니다. 둘 다 500K 컨텍스트, 텍스트·이미지 입력에 텍스트 출력, function calling과 structured outputs와 reasoning 지원, 초당 150요청, 분당 5천만 토큰, us-east-1과 us-west-2 리전, 입력 $2.00 출력 $6.00으로 동일합니다. 문서상 유일한 차이는 캐시된 입력으로 4.6은 $0.50, 4.5는 $0.30입니다.
- Grok 4.5가 Grok 4.6보다 싼가요?
- 프롬프트 중 캐시되는 비중에 달려 있습니다. 캐시 읽기는 4.5가 40% 싸지만, 저희 측정에서는 4.5의 요청당 고정 오버헤드가 더 컸습니다. 4.6이 약 206토큰, 4.5가 약 494토큰이었습니다. 손익분기는 캐시된 토큰 약 575개 근처로, 그 아래에서는 4.6이, 그 위에서는 4.5가 호출당 더 쌉니다.
- 20만 토큰 기준선을 넘으면 초과분만 비싼 요금이 적용되나요?
- 아닙니다. xAI 문서는 프롬프트가 기준선에 도달한 요청은 그 요청의 모든 토큰에 높은 요금이 적용된다고 명확히 밝히고 있습니다. 199K 프롬프트에서 201K 프롬프트로 가면 청구액이 1% 늘어나는 것이 아니라 거의 두 배가 됩니다.
- Grok 4.6의 모델 ID는 무엇인가요?
- xAI 자체 API에서는 grok-4.6입니다. 게이트웨이에서는 네임스페이스가 붙어 OpenRouter와 ofox 모두 x-ai/grok-4.6입니다. Grok 4.5에는 grok-4.5-latest와 grok-build-latest라는 별칭이 더 있어서, grok-build-latest는 4.6이 아니라 4.5로 해석됩니다.
- Grok 4.6은 logprobs를 지원하나요?
- 지원하지 않습니다. xAI는 grok-4.20 이후 모델에서 logprobs와 top_logprobs를 미지원으로 문서화하고 있으며 조용히 무시된다고 밝힙니다. 저희도 확인했습니다. 요청은 오류 없이 HTTP 200을 돌려주고 응답에 logprobs 객체가 없습니다. 여기에 의존하는 파이프라인은 요란하게가 아니라 조용히 실패합니다.
- Grok 4.6은 실제로 몇 토큰으로 추론하나요?
- completion 필드에 보이는 것보다 많습니다. 작은 코드 생성 과제에서 Grok 4.6은 8회 실행 중앙값으로 completion 216토큰에 reasoning 723토큰을 보고했고, Grok 4.5는 225토큰에 30토큰이었습니다. reasoning 토큰은 completion_tokens와 별도로 집계되며 total_tokens에는 포함됩니다.


