Gemini 3.8 Flash API 가격: 지금은 $0.75, 1월부터 $1.50
Gemini 3.8 Flash는 100만 입력 토큰당 $0.75, 출력 $3.75로 2026년 말까지 적용됩니다. 모든 티어, 요청 제한 규칙, 키 발급 방법까지 정리했습니다.
Gemini 3.8 Flash는 100만 입력 토큰당 $0.75, 출력 $3.75(thinking 토큰 포함)이며 2026년 12월 31일까지 적용됩니다. 2027년 1월 1일부터 두 수치 모두 두 배가 됩니다. 모델 ID는 gemini-3.8-flash이고, Gemini API와 Vertex AI 양쪽에서 GA 상태이며, thinking 레벨은 세 단계입니다. 아래 내용은 모두 출시 다음 날인 2026년 9월 3일에 Google의 가격 페이지와 요청 제한 페이지에서 읽은 것입니다.
모델 ID: gemini-3.8-flash
표준 요금: 100만당 입력 $0.75 / 출력 $3.75, 2026-12-31까지
2027-01-01부터 $1.50 / $7.50
Batch, Flex: $0.375 / $1.875, 이후 $0.75 / $3.75
Priority: $1.35 / $6.75, 이후 $2.70 / $13.50
캐시: 읽기 $0.075(이후 $0.15); 저장 100만당 시간당 $0.50(이후 $1.00)
무료 티어: 있음, 가격 페이지의 '무료' 열
컨텍스트: 입력 1,048,576 / 출력 65,536
thinking: low | medium(기본값) | high, minimal은 오류
Vertex AI: GA, 2026-09-02, global + us / eu 멀티 리전
게이트웨이: 2026-09-03 기준 Ofox 카탈로그에 아직 없음
최종 업데이트 2026년 9월 3일. 도입 가격은 2026년 12월 31일에 만료되므로, 그 이후까지 걸치는 예산은 두 번째 행 수치로 계산해야 한다.
Gemini 3.8 Flash API는 얼마인가?
입력 $0.75, 출력 $3.75. 2027년 요금도 같은 칸에 함께 적혀 있다. Google의 가격표는 Gemini 3.8 Flash에 대해 입력 항목에 “$0.75, 2026년 12월 31일까지. $1.50, 2027년 1월 1일부터.”라고, 출력 항목에 “$3.75, 2026년 12월 31일까지. $7.50, 2027년 1월 1일부터.”라고 그대로 적어 두었다.
| 티어 | 입력/100만 | 출력/100만 | 2026-12-31까지 | 2027-01-01부터 |
|---|---|---|---|---|
| 표준 | $0.75 | $3.75 | 적용 | $1.50 / $7.50 |
| Batch | $0.375 | $1.875 | 적용 | $0.75 / $3.75 |
| Flex | $0.375 | $1.875 | 적용 | $0.75 / $3.75 |
| Priority | $1.35 | $6.75 | 적용 | $2.70 / $13.50 |
| 컨텍스트 캐시 읽기 | $0.075 | — | 적용 | $0.15 |
| 캐시 저장 | 100만 토큰당 시간당 $0.50 | — | 적용 | $1.00 |
| Google Search 그라운딩 | 월 5,000회 무료, 모든 Gemini 3.x 모델이 공유, 이후 1,000회당 $14 |
이 표에서 청구액을 실제로 좌우하는 것은 세 가지다.
- 출력 가격에 thinking 토큰이 포함된다. 추론은 출력 단가인 $3.75로 과금된다. effort 레벨은 사실상 가격 배율이다.
- Batch와 Flex는 정확히 절반이다. 기다릴 수 있는 작업이라면 같은 모델을 $0.375 / $1.875에 쓸 수 있다.
- Priority는 1.8배다. $1.35 / $6.75로 사는 것은 다른 모델이 아니라 별도의 요청 제한 풀이다.
Gemini 3.7 Flash와 3.6 Flash도 같은 요금 체계를 갖고 있다. 토큰 단가만 보면 이들 사이를 옮겨 다녀도 절약되는 것은 없다. 자세한 내용은 3.8 Flash vs 3.7 Flash 비교를 참고하라.
Gemini 3.8 Flash는 무료인가?
무료 티어에서 쓸 수 있지만, 요청 제한 수치는 Google이 공개하지 않는다. 가격 페이지에는 Gemini 3.8 Flash용 무료 티어 열이 있고, 입력, 출력, 컨텍스트 캐싱 모두 ‘무료’라고 적혀 있다. 그라운딩은 어느 티어에서든 월 5,000회까지 무료다.
무료 티어에 없는 것은 분당 요청 수의 공개 수치다. 요청 제한 페이지는 “요청 제한은 Google AI Studio에서 확인할 수 있습니다”라고 안내하며, “명시된 요청 제한은 보장된 것이 아니며 실제 용량은 달라질 수 있습니다”라고도 적어 두었다. 서드파티 가이드들이 무료 티어 기준 10 RPM, 하루 1,500회 요청 같은 수치를 인용하기도 하는데, 이는 1차 출처가 확인되지 않으므로 미검증으로 간주하고, 실제 자신의 프로젝트 제한은 AI Studio 요청 제한 페이지에서 확인해야 한다.
Gemini 3.8 Flash의 요청 제한은 어떻게 되는가?
모델별 RPM과 TPM은 AI Studio에서만 표시된다. Google이 공개하는 것은 티어 사다리, 지출 기반 상한, 배치 상한이다.
| 사용 티어 | 자격 조건 | 10분당 지출 상한 | 3.8 Flash 배치 대기열 토큰 상한 |
|---|---|---|---|
| 무료 | 활성 프로젝트 또는 무료 체험 | 해당 없음 | 명시되지 않음 |
| Tier 1 | 유효한 결제 계정 연결 | $10 | 3,000,000 |
| Tier 2 | $100 결제 완료, 첫 결제 후 3일 경과 | $50 | 400,000,000 |
| Tier 3 | $1,000 결제 완료, 첫 결제 후 30일 경과 | $200 | 1,000,000,000 |
모두 2026년 9월 3일 기준 Google 요청 제한 페이지의 수치다. 실제 운영에서 중요한 규칙이 네 가지 있다.
- 제한은 API 키가 아니라 프로젝트 단위로 적용된다. 같은 프로젝트 안에서 키를 돌려써도 소용없다. 일일 쿼터는 태평양 시간 자정에 초기화된다.
- 지출 기반 제한도
429 RESOURCE_EXHAUSTED를 반환한다. RPM 초과와 같은 오류 코드다. Tier 1에서는 표준 요금 기준 $10이 대략 출력 270만 토큰에 해당하므로, high effort로 긴 호출을 몰아치면 요청 수 제한보다 지출 상한에 먼저 걸릴 수 있다. - Priority 추론에는 별도의 풀이 있다. 같은 모델, 같은 티어의 표준 요청 제한의 0.3배다.
- 티어 승급은 자동이다. 지출과 경과 기간 조건을 충족하면 무료에서 Tier 1로는 즉시, 이후로는 10분 이내에 반영된다.
Gemini 호출에서 이미 429가 발생하고 있다면, Google 자체의 오류 코드 레퍼런스가 rate_limit_exceeded와 quota_exceeded라는 두 가지 429 원인을 구분해 놓았다. 사이트 내 Claude Code 429 가이드도 헤더를 읽고 백오프를 적용하는 방법을 같은 방식으로 다루는데, 토큰 버킷 방식으로 요청을 제한하는 API라면 Gemini에도 그대로 적용된다.
작업당 실제로 얼마를 내는가
토큰당 단가는 3.7 Flash와 같지만, high effort에서는 작업당 약 45% 더 비싸다. 모델이 더 많이 쓰기 때문이다. Google의 발표 글은 이렇게 말한다. “때로는 성능을 극대화하기 위해 모델이 더 많은 토큰을 사용할 수 있으며, 특히 effort 레벨이 높을 때 그렇습니다.” 개발자 문서는 여기에 “Gemini 3.8 Flash는 설계상 더 길게 실행되는 복잡한 작업에서 더 많은 토큰을 사용할 수 있습니다.”라고 덧붙인다.
Artificial Analysis는 구체적인 수치를 제시했다.
| 모델, effort | AA Intelligence Index | AA 작업당 비용 | 작업당 출력 토큰 |
|---|---|---|---|
| Gemini 3.8 Flash, high | 59 | $0.58 | 48k, “약 30% 증가” |
| Gemini 3.8 Flash, medium(기본값) | 57 | $0.41 | — |
| Gemini 3.8 Flash, low | 52 | $0.24 | — |
| Gemini 3.7 Flash, high | 56 | $0.40 | — |
전체 인덱스를 실행하는 데 AA는 3.8 Flash에서 $825.83, 3.7 Flash에서 $484.73을 썼다. 기본값인 medium이 이 가격표의 핵심이다. 57점, 작업당 $0.41은 3.7 Flash의 high(56점)보다 1점 높으면서 비용은 1센트 정도만 더 든다. 같은 발표 글에 나온 HLE-Verified 점수는 54.9%다.
3.7 Flash의 출력량을 기준으로 짠 예산은 3.8 Flash의 high effort에서는 맞지 않는다. 실제로 투입하기 전에 자신의 트래픽에서 completion_tokens(OpenAI 호환) 또는 usageMetadata.candidatesTokenCount(네이티브)를 확인해야 한다.
Gemini 3.8 Flash API 키는 어떻게 발급받는가
Google AI Studio로 가서 Create API key를 클릭하면 된다. 별도 가입 절차는 없다. Google의 API 키 가이드는 이렇게 설명한다. “신규 사용자라면, 이용약관에 동의한 후 Google AI Studio가 기본 Google Cloud 프로젝트와 API 키를 자동으로 생성합니다.” 기존 Google Cloud 사용자는 대시보드에서 프로젝트를 선택하면 된다. 이 키는 무료 티어에서 바로 쓸 수 있고, 카드 등록은 필요 없다.
실제 서비스에 투입하기 전에 해야 할 일이 두 가지 있다.
- 키를 클라이언트 측 코드에 넣지 말 것. 같은 가이드는 분명하게 경고한다. “클라이언트 측 코드에 컴파일된 키는 사용자에 의해 추출될 수 있습니다.” 브라우저나 모바일에서 오는 트래픽은 자체 백엔드를 거치게 하거나, 자체적으로 범위가 제한된 키를 발급하는 게이트웨이를 거치게 해야 한다.
- 기한 전에 Standard 키에서 옮길 것. Google 페이지에는 이렇게 적혀 있다. “2026년 9월: Gemini API는 Standard 키의 요청을 거부합니다. 서비스 중단을 피하려면 이 날짜 이전에 auth 키로 마이그레이션해야 합니다.” Standard 키는 프로젝트에 과금될 뿐 호출자를 식별하지 않지만, auth 키는 service account에 묶여 있어 유출 시 대응도 더 빠르다. 페이지에는 월 중 구체적인 날짜까지는 나와 있지 않다. 오늘 키를 발급받았더라도 이 마이그레이션은 선택 사항이 아니라 이번 달 안에 반드시 끝내야 하는 일이다.
Gemini 3.8 Flash에 접근하는 방법
세 가지 경로가 있다. AI Studio 키로 Gemini API에 직접, Vertex AI를 통해, 또는 이 모델을 등록한 OpenAI 호환 게이트웨이를 통해서다.
Gemini API, 네이티브 프로토콜
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{"parts": [{"text": "이 GROUP BY를 윈도우 함수로 바꿔줘."}]}],
"generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}
}'
thinkingLevel은 low, medium, high를 받는다. minimal은 검증 오류를 반환한다. 3.7 Flash 가이드에 그 400 오류의 실제 내용이 있으며, 3.8 Flash도 같은 제한을 갖는다.
Gemini API, OpenAI 호환
from openai import OpenAI
client = OpenAI(
base_url="https://generativelanguage.googleapis.com/v1beta/openai/",
api_key="YOUR_GEMINI_API_KEY",
)
r = client.chat.completions.create(
model="gemini-3.8-flash",
reasoning_effort="medium",
messages=[{"role": "user", "content": "이 GROUP BY를 윈도우 함수로 바꿔줘."}],
)
print(r.usage.completion_tokens)
이 인터페이스에서는 파라미터 이름이 reasoning_effort이지만, 대응하는 레벨은 같은 세 단계다.
Vertex AI
Google의 Vertex 모델 페이지는 gemini-3.8-flash에 대해 “Launch stage: GA, Release date: September 2, 2026”이라고 표시하며, global 엔드포인트와 us, eu 멀티 리전에서 이용할 수 있고, 결제 방식은 Standard, Flex, Priority 종량제에 더해 Provisioned Throughput도 지원한다. Vertex는 Google Cloud를 통해 과금되며 쿼터 체계도 독립적이다. Gemini API가 지역 제한으로 오류를 반환할 때 Google이 안내하는 대체 경로도 Vertex다.
Ofox를 통해
2026년 9월 3일 기준으로 Ofox 카탈로그에는 아직 Gemini 3.8 Flash가 없다. google/gemini-3.7-flash는 카탈로그에 있으며, Google 제공자 경로로 입력 $0.75, 출력 $3.75(같은 모델 페이지의 CloudVertex 경로는 $1.50 / $7.50이고, /v1/models의 pricing 필드가 현재 반환하는 것은 이 더 높은 수치다), OpenAI 호환 엔드포인트 https://api.ofox.ai/v1와 Google 네이티브 Gemini 프로토콜 https://api.ofox.ai/gemini 양쪽으로 호출할 수 있다. 3.8 Flash가 추가되면 모델 문자열에 google/ 접두어를 붙이는 것만으로 동일하게 호출할 수 있다. 실제로 호출 가능한 모델은 GET https://api.ofox.ai/v1/models의 실시간 응답이 기준이며, 이 글의 내용을 그대로 전제해서는 안 된다.
client = OpenAI(base_url="https://api.ofox.ai/v1", api_key="YOUR_OFOX_API_KEY")
r = client.chat.completions.create(
model="google/gemini-3.7-flash", # 등록되는 대로 google/gemini-3.8-flash로 교체
reasoning_effort="medium",
messages=[{"role": "user", "content": "ping"}],
)
Gemini 3.8 Flash 가격을 다른 선택지와 비교하면
| 모델 | 입력/100만 | 출력/100만 | AA Index | 비고 |
|---|---|---|---|---|
| Gemini 3.8 Flash | $0.75 | $3.75 | 59(high) | 2027-01-01 두 배 |
| Gemini 3.7 Flash | $0.75 | $3.75 | 56(high) | 2027-01-01 두 배 |
| Gemini 3.5 Flash | $1.50 | $9.00 | — | 예정된 인상 없음 |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | — | |
| DeepSeek V4 Flash 0731 | $0.44 | $1.32 | 52 | 피크 시간대 요금, 오프피크는 절반; 자세한 내용은 3.8 Flash vs DeepSeek V4 Flash |
Gemini 가격은 Google 가격 페이지에서, DeepSeek은 자체 API 가격 페이지에서 모두 2026년 9월 3일에 가져왔다. 인덱스 점수는 같은 날 Artificial Analysis에서 가져왔다. 토큰당 단가로 보면 3.8 Flash는 3.7, 3.6 Flash와 나란히 현세대 Flash 중 가장 저렴한 축에 든다. 작업당으로 보면 AA의 측정에서 3.8 Flash의 low가 $0.24로 가장 싸지만 점수는 52점에 그친다. 56점에서 57점 구간에서는 3.7 Flash의 high와 3.8 Flash의 medium이 단 1센트 차이다.
달력에 표시해 둘 날짜
2027년 1월 1일, Gemini 3.8 Flash의 모든 요금 행이 두 배가 된다. 표준 $1.50 / $7.50, Batch와 Flex $0.75 / $3.75, Priority $2.70 / $13.50, 캐시 읽기 $0.15, 저장은 100만 토큰당 시간당 $1.00. 토큰 사용량이 그대로라면 AA가 측정한 작업당 $0.58 / $0.41 / $0.24 비용 사다리는 대략 $1.16 / $0.82 / $0.48이 된다. 이 정보는 출시 때부터 계속 가격 페이지에 적혀 있었다. 지켜봐야 할 소문이 아니라, 일정표에 바로 넣어 두어야 할 항목이다.
출처
- https://ai.google.dev/gemini-api/docs/pricing
- https://ai.google.dev/gemini-api/docs/rate-limits
- https://ai.google.dev/gemini-api/docs/latest-model
- https://ai.google.dev/gemini-api/docs/api-key
- https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
- https://docs.cloud.google.com/vertex-ai/generative-ai/docs/models/gemini/3-8-flash
- https://artificialanalysis.ai/articles/gemini-3-8-flash
- https://ofox.ai/models/google/gemini-3.7-flash
가격, 요청 제한 규칙, 배치 상한은 Google 각 페이지의 2026년 9월 3일 기준 내용을 참고했다. Ofox 카탈로그 정보도 같은 날 /v1/models 실시간 응답과 대조했다.
자주 묻는 질문
- Gemini 3.8 Flash API는 100만 토큰당 얼마인가요?
- 입력 100만 토큰당 $0.75, 출력 $3.75이며 2026년 12월 31일까지 적용됩니다. 2027년 1월 1일부터 같은 칸이 $1.50과 $7.50으로 바뀝니다. 출력 가격에는 thinking 토큰이 포함됩니다. 캐시 입력은 현재 $0.075, 1월부터 $0.15이고, 캐시 저장은 100만 토큰당 시간당 $0.50이며 같은 날 두 배가 됩니다.
- Gemini 3.8 Flash는 무료로 쓸 수 있나요?
- 네, Gemini API 무료 티어에서 사용할 수 있습니다. Google의 가격 페이지는 Gemini 3.8 Flash의 무료 티어 열에 입력, 출력, 컨텍스트 캐싱 모두 '무료'라고 표시하고 있습니다. 무료 티어는 유료 티어보다 요청 제한이 낮고, 모델별 정확한 RPM과 TPM 수치는 AI Studio 안에서만 볼 수 있으며 공개 문서에는 나와 있지 않습니다.
- Gemini 3.8 Flash의 요청 제한은 어떻게 되나요?
- Google은 Gemini 3.8 Flash의 모델별 RPM이나 TPM 수치를 공개하지 않습니다. 요청 제한 페이지는 '이는 Google AI Studio에서 확인할 수 있습니다'라고만 안내합니다. 공개된 것은 Tier 1, 2, 3에서 각각 10분당 $10, $50, $200의 지출 기반 제한, 같은 티어에서 3.8 Flash의 배치 대기열 토큰 상한 300만, 4억, 10억, 그리고 Priority 추론이 표준 요청 제한의 0.3배라는 점입니다. 제한은 API 키가 아니라 프로젝트 단위로 적용됩니다.
- Gemini 3.8 Flash가 Gemini 3.7 Flash보다 저렴한가요?
- 토큰당 가격은 동일합니다. 입력 $0.75, 출력 $3.75, Batch, Flex, Priority, 캐싱 요금도 같고 2027년 1월 1일 두 배가 되는 시점도 같습니다. 작업당으로 보면 3.8 Flash가 더 비쌉니다. Artificial Analysis 측정에 따르면 high effort 기준 Intelligence Index 작업당 3.8 Flash는 $0.58, 3.7 Flash는 $0.40이며, 이는 3.8 Flash가 작업당 출력 토큰을 약 30% 더 쓰기 때문입니다.
- Gemini 3.8 Flash의 모델 ID는 무엇인가요?
- gemini-3.8-flash입니다. Gemini API와 Vertex AI 양쪽에서 같은 ID를 씁니다. Vertex에서는 2026년 9월 2일 GA로 출시되었고 global 엔드포인트와 us, eu 두 멀티 리전에서 이용할 수 있습니다. OpenAI 호환 엔드포인트에서도 모델 문자열은 동일합니다. Ofox를 통해서는 google/gemini-3.8-flash가 될 예정이지만, 2026년 9월 3일 기준 Ofox 카탈로그에는 google/gemini-3.7-flash만 있고 3.8은 아직 없습니다.
- Gemini 3.8 Flash는 minimal thinking 레벨을 지원하나요?
- 지원하지 않습니다. Google 모델 문서에는 minimal이 'Gemini 3.8 Flash에서는 지원되지 않으며 오류를 반환합니다'라고 명시되어 있습니다. 지원되는 thinking 레벨은 low, medium(기본값), high입니다. 이전 세대 Flash 모델에서 minimal을 하드코딩한 설정을 그대로 가져오면 모델 ID를 바꾸는 순간 오류가 발생합니다.
- Gemini 3.8 Flash API 키는 어떻게 발급받나요?
- Google AI Studio(aistudio.google.com/apikey)에 가서 Create API key를 클릭하면 됩니다. 별도 가입 절차는 없습니다. 신규 사용자는 이용약관에 동의하면 기본 Google Cloud 프로젝트와 API 키가 자동으로 생성됩니다. 기존 Google Cloud 사용자는 대시보드에서 프로젝트를 선택하면 됩니다. 무료 티어에서는 카드 등록 없이 바로 사용할 수 있습니다. Google 공식 가이드는 키를 클라이언트 측 코드에 넣지 말라고 경고하며, 지금 발급받는 Standard 키는 2026년 9월에 사용이 중단됩니다. 공식 문구는 'Gemini API가 Standard 키의 요청을 거부합니다'입니다. 그 전에 service account에 연결된 auth 키로 옮겨야 합니다.


