Gemini 3.8 Flash vs 3.7 Flash: 같은 가격, 청구서는 45% 증가
Gemini 3.8 Flash와 3.7 Flash는 토큰 단가가 같지만 3.8 Flash가 출력을 30% 더 쓰기 때문에 작업당 비용이 $0.40에서 $0.58로 오르고, 얻는 것은 3점입니다.
Gemini 3.8 Flash의 가격은 Gemini 3.7 Flash와 정확히 같습니다. Google 요금 페이지의 모든 칸이 두 모델에서 동일하고, 2027년 1월 1일에 둘 다 두 배로 올리는 각주까지 같습니다. 청구서는 같지 않습니다. Artificial Analysis 측정에서 3.8 Flash는 작업당 출력 토큰을 30% 더 쓰고, Intelligence Index 작업당 비용은 $0.40에서 $0.58로 올랐습니다.
요약
- 토큰 단가: 같다. 입력 $0.75, 출력 $3.75, 캐시 입력 $0.075, Batch와 Flex는 절반, Priority는 1.8배, 2027년 1월 1일에 모두 두 배. 비교할 것이 없다.
- 작업당: high effort에서 3.8 Flash가 약 45% 비싸다. Artificial Analysis에서 $0.58 대 $0.40, 59점 대 56점. 같은 차이를 AA 자체는 “약 40%“로 반올림한다.
- 거의 무료인 업그레이드는 medium effort. 3.8 Flash는 기본값 medium에서 작업당 $0.41에 57점. 3.7 Flash보다 1점 높고 1센트 비싸다.
- Google은 남아도 된다고 말한다. 3.7 Flash는 “효율 우선 워크로드에 대해 계속 완전히 지원된다”. 벤더의 문장이고 우리 문장이 아니다.
Google이 바꾼 것과 바꾸지 않은 것
Gemini 3.8 Flash는 2026년 9월 2일, 8월 13일의 3.7 Flash로부터 3주 뒤에 나왔습니다. Google 발표문은 차이를 가격이 아닌 행동으로 설명합니다(이하 인용은 번역). “3.8 Flash는 더 열심히 일합니다. 복잡한 작업에서 더 큰 성실함을 보이며 추가 추론 단계를 실행하고 도구를 반복적으로 호출합니다. 때로는, 특히 높은 effort 수준에서는 성능을 극대화하기 위해 더 많은 토큰을 쓸 수 있습니다.”
그다음은 대부분의 글이 건너뛰는 권고입니다. “개발자는 토큰 오버헤드를 최소화하기 위해 더 낮은 effort 수준을 활용하거나, 효율 우선 워크로드에 대해 계속 완전히 지원되는 Gemini 3.7 Flash에 계속 의존할 수 있습니다.” 개발자 문서도 반복합니다. “Gemini 3.8 Flash는 오래 실행되는 복잡한 작업에서 설계상 더 많은 토큰을 쓸 수 있습니다.”
즉 벤더의 프레임은 같은 가격, 호출당 더 많은 일, 그리고 3.7 Flash로 돌아갈 명시적 출구입니다.
Gemini 3.8 Flash vs 3.7 Flash: 스펙과 가격
| 항목 | Gemini 3.7 Flash | Gemini 3.8 Flash |
|---|---|---|
| 출시 | 2026-08-13 | 2026-09-02 |
| 입력 / 출력, 100만 토큰당 | $0.75 / $3.75 | $0.75 / $3.75 |
| 2027-01-01부터 | $1.50 / $7.50 | $1.50 / $7.50 |
| 캐시 입력 | $0.075 | $0.075 |
| 컨텍스트 윈도우 | 1M 토큰 | 1M 토큰 |
| 최대 출력 | 64K 토큰 | 64K 토큰 |
| thinking 수준 | low / medium(기본) / high | low / medium(기본) / high |
minimal | 오류 반환 | 오류 반환 |
| AA Intelligence Index(high) | 56 | 59 |
| AA 작업당 비용(high) | $0.40 | $0.58 |
| AA 작업당 출력 토큰(high) | — | 4만 8천, “30% 증가” |
| AA 인덱스 완주 출력 토큰 | 6,400만 | 1억 2천만 |
| AA 인덱스 완주 비용 | $484.73 | $825.83 |
| AA 출력 속도 | 약 287 토큰/초 | 약 302 토큰/초 |
| AA 작업당 시간(high) | 2.2분 | 2.5분 |
가격은 Google 요금 페이지, 인덱스·토큰·비용·속도는 Artificial Analysis 자료로, 모두 2026년 9월 3일에 읽었습니다. 출시일을 제외하면 다른 것은 마지막 7행입니다. AA는 비용과 시간 행의 변화를 두 가지로 설명합니다. 작업당 출력 토큰 30% 증가, 그리고 에이전트 평가에서의 턴 수 증가입니다.
Gemini 3.8 Flash는 3.7 Flash보다 얼마나 나은가
Gemini 3.8 Flash는 Artificial Analysis Intelligence Index에서 high effort로 59점, Gemini 3.7 Flash는 56점입니다. 그 3점에는 작업당 약 45% 더 많은 비용, $0.58 대 $0.40이 듭니다. Artificial Analysis는 모델과 effort 수준마다 종합 점수 하나를 공개합니다.
| 모델, effort | AA Intelligence Index | AA 작업당 비용 |
|---|---|---|
| Gemini 3.8 Flash, high | 59 | $0.58 |
| Gemini 3.8 Flash, medium(기본) | 57 | $0.41 |
| Gemini 3.7 Flash, high | 56 | $0.40 |
| Gemini 3.8 Flash, low | 52 | $0.24 |
| Gemini 3.6 Flash, high | 52 | — |
비용 열을 아래로 읽으면 이야기는 분명합니다. Gemini 3.8 Flash high(59)는 3.7 Flash high(56)보다 작업당 45% 비쌉니다. medium(57)은 2.5% 비쌉니다. low(52)는 40% 싸고, 52는 3.6 Flash가 이미 갖고 있던 점수입니다.
AA 자체의 출시 요약은 “Intelligence Index 3점 향상”에 “작업당 평균 출력 토큰 30% 증가, 4만 8천”입니다. 두 숫자 모두 high effort 기준입니다. 기본값인 medium에서는 추가 지출을 거의 들이지 않고 향상의 대부분을 얻습니다. 우리가 배포한다면 이 구성입니다.
Gemini 3.8 Flash 토큰 사용량: 추가 30%는 어디로 가나
Gemini 3.8 Flash는 high effort에서 3.7 Flash보다 작업당 출력 토큰을 약 30% 더 쓰며, Artificial Analysis 기준 평균 4만 8천입니다. 추가 토큰은 추가 추론 단계와 반복적 도구 호출에 들어갑니다. 토큰 단가는 청구서의 작은 절반입니다. 나머지 절반은 모델이 멈추기 전까지 얼마나 쓰느냐이고, 이 세대에서 그 숫자가 움직였습니다.
인덱스 전체에서 AA는 3.7 Flash의 출력 토큰을 6,400만으로 기록하고 “중앙값 7,100만에 비해 꽤 간결하다”고 평했습니다. 3.8 Flash는 1억 2천만으로 “중앙값에 비해 매우 장황하다”입니다. AA가 인용하는 작업당 평균은 3.8 Flash high에서 4만 8천으로, 3.7 Flash보다 30% 많습니다.
토큰은 Google이 말한 곳으로 갑니다. 추가 추론 단계와 반복적 도구 호출입니다. 그것이 필요한 작업에서는 그것이 3점입니다. 필요 없는 작업에서는 같은 답에 30% 더 많은 출력이 100만 토큰당 $3.75로 청구됩니다. 여러분의 트래픽이 어느 쪽인지 벤치마크는 알려주지 못합니다. 여러분 호출의 completion_tokens 필드는 알려줍니다.
속도는 상쇄
3.8 Flash는 AA 측정에서 초당 약 302 출력 토큰, 3.7 Flash는 287입니다. 5% 속도 향상은 30% 토큰 증가를 상쇄하지 못하며, 그래서 AA의 작업당 시간은 내려가지 않고 올라갑니다. high effort에서 2.2분에서 2.5분으로. 실제 벽시계 지연을 최적화한다면 3.8 Flash low effort의 작업당 0.8분이 레버이고, 대가는 점수입니다.
마이그레이션은 문자열 하나
요청에서 바뀌는 것은 모델 이름뿐입니다.
- model="gemini-3.7-flash"
+ model="gemini-3.8-flash"
두 모델 모두 low, medium, high를 받고 기본값은 medium이며 minimal은 오류로 거부합니다. 3.7 Flash API 가이드(영어)에 정확한 400 응답과 가장 싼 유효 티어의 비용이 있습니다. 컨텍스트 윈도우와 64K 출력 상한은 그대로입니다. OpenAI 호환 표면에서 파라미터는 reasoning_effort, Google 네이티브 프로토콜에서는 thinking_level입니다.
교체 후 다시 확인할 두 가지:
- 출력 예산과 알림. 같은 요금에 high effort에서 작업당 약 30% 더 많은 토큰. 3.7 Flash 출력량에 맞춰 조정된 것은 모두 울립니다.
- effort 수준. 점수 때문에 3.7 Flash를
high로 두었다면 3.8 Flashmedium을 먼저 시도하세요. 3.7 Flash high보다 1점 높고 AA 작업당 차이는 1센트입니다.
Gemini 3.8 Flash로 업그레이드해야 하나
- 작업에 59점이 필요하고, 3.7 Flash의 56점이 그 작업에서 실제로 부족했음을 추정이 아닌 확인으로 알고 있다.
- medium effort로 배포할 수 있다. 작업당 $0.41에 57점은 $0.40에 56점인 3.7 Flash보다 엄밀히 개선이다.
- 트래픽이 에이전트형이고 도구 호출이 많다. Google이 추가 단계가 실리는 곳이라고 말한 지점이다.
3.7 Flash에 남을 때
- 3.7 Flash가 이미 일을 해낸다. Google의 표현은 “완전히 지원”이고, 가격상 옮길 이유는 없으며 high effort에서 작업당 45%라는 옮기지 않을 이유는 있다.
- 출력량으로 과금하고 30% 증가를 감당할 여유가 없다.
- 프롬프트가 3.7 Flash 행동에 맞춰 조정되어 있고, 재조정 비용이 1점의 가치보다 크다.
두 모델이 공유하는 절벽
2027년 1월 1일 두 모델은 입력 $1.50, 출력 $7.50으로 두 배가 됩니다. 토큰 수가 그대로라면 3.8 Flash의 $0.58 / $0.41 / $0.24 작업당 비용은 대략 $1.16 / $0.82 / $0.48로, 3.7 Flash의 $0.40은 대략 $0.80으로 바뀝니다. 둘 사이 45% 차이는 그날을 지나도 그대로 남고, 절대값만 움직입니다. 12월을 넘기는 예산에는 두 번째 줄이 필요합니다.
Ofox로 호출하기
google/gemini-3.7-flash는 Ofox 카탈로그에 있으며 Google 제공자 경로로 입력 $0.75, 출력 $3.75입니다(같은 모델 페이지의 CloudVertex 경로는 $1.50 / $7.50이고, /v1/models의 pricing 필드가 현재 반환하는 값은 후자). https://api.ofox.ai/v1의 OpenAI 호환 엔드포인트와 Google 네이티브 Gemini 프로토콜 모두로 접근할 수 있습니다. Gemini 3.8 Flash는 2026년 9월 3일 기준 카탈로그에 없습니다. 추가되면 Ofox를 통한 마이그레이션도 위와 같은 문자열 하나 변경에 google/ 접두사만 붙습니다. 무엇을 호출할 수 있는지의 최종 기준은 GET /v1/models의 라이브 카탈로그입니다.
from openai import OpenAI
client = OpenAI(base_url="https://api.ofox.ai/v1", api_key="YOUR_OFOX_API_KEY")
for model in ["google/gemini-3.7-flash"]: # 등재되면 "google/gemini-3.8-flash" 추가
for effort in ["low", "medium", "high"]:
r = client.chat.completions.create(
model=model,
reasoning_effort=effort,
messages=[{"role": "user", "content": "이 GROUP BY를 윈도우 함수로 다시 써 주세요."}],
)
print(f"{model:28} {effort:7} out={r.usage.completion_tokens:6}")
자기 프롬프트로 돌려서 out 열을 읽으세요. 업그레이드 결정은 실제로 배포할 effort 수준에서 3.7 Flash 행과 3.8 Flash 행의 차이에 100만 토큰당 $3.75를 곱한 값입니다. 이 글은 그 숫자를 줄 수 없습니다. 이 루프는 줄 수 있습니다.
출처
- https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
- https://ai.google.dev/gemini-api/docs/pricing
- https://ai.google.dev/gemini-api/docs/latest-model
- https://artificialanalysis.ai/articles/gemini-3-8-flash
- https://artificialanalysis.ai/models/gemini-3-8-flash
- https://artificialanalysis.ai/models/gemini-3-7-flash
- https://ofox.ai/models/google/gemini-3.7-flash
가격, 인덱스 점수, 토큰 수, 속도는 2026년 9월 3일에 확인했습니다. Ofox 카탈로그 등재 여부는 같은 날 라이브 /v1/models 엔드포인트로 확인했고, Ofox 가격은 모델 페이지에서 가져왔습니다.
자주 묻는 질문
- Gemini 3.8 Flash는 Gemini 3.7 Flash보다 비싼가요?
- 토큰 단가로는 아닙니다. 둘 다 100만 토큰당 입력 $0.75, 출력 $3.75로 2026년 12월 31일까지 적용되고, 2027년 1월 1일부터 $1.50과 $7.50이 되며 캐싱, Batch, Flex, Priority 요금도 동일합니다. 작업당으로는 비쌉니다. Artificial Analysis 측정에서 high effort 기준 Intelligence Index 작업당 3.8 Flash는 $0.58, 3.7 Flash는 $0.40입니다. 3.8 Flash가 작업당 출력 토큰을 약 30% 더 쓰기 때문입니다.
- Gemini 3.8 Flash는 3.7 Flash보다 얼마나 나은가요?
- Artificial Analysis Intelligence Index에서 high effort 기준 3점, 59 대 56입니다. 3.8 Flash의 기본값인 medium effort에서는 57점으로 3.7 Flash보다 1점 높고 작업당 비용은 거의 같은 $0.41입니다. low effort에서는 3.8 Flash가 52점으로 3.7 Flash보다 낮습니다.
- Gemini 3.7 Flash에서 3.8 Flash로 업그레이드해야 하나요?
- Google 자체 안내는 3.7 Flash가 '효율 우선 워크로드에 대해 계속 완전히 지원된다'는 것입니다. high effort의 59점이 필요하고 작업당 비용 약 45% 증가를 감당할 수 있으면 업그레이드하세요. medium effort로 전환하면 3.7 Flash와 거의 같은 작업당 비용으로 57점을 얻습니다. 3.7 Flash가 이미 일을 해내고 있다면 가격상 옮길 이유는 없습니다.
- Gemini 3.8 Flash와 3.7 Flash의 API 파라미터는 같은가요?
- 같습니다. 둘 다 low, medium, high thinking 수준을 받고 기본값은 medium이며 minimal에는 오류를 반환합니다. 둘 다 컨텍스트 윈도우 1M 토큰, 출력 상한 64K 토큰입니다. 모델 문자열이 gemini-3.7-flash에서 gemini-3.8-flash로 바뀌는 것 외에 요청에서 바꿀 것은 없습니다.
- Ofox에서 Gemini 3.8 Flash를 쓸 수 있나요?
- 2026년 9월 3일 기준으로는 아직입니다. google/gemini-3.7-flash는 Ofox 카탈로그에 있으며 Google 제공자 경로로 입력 $0.75, 출력 $3.75(같은 페이지의 CloudVertex 경로는 $1.50 / $7.50)이고 OpenAI 호환 프로토콜과 네이티브 Gemini 프로토콜 모두로 쓸 수 있습니다. 3.8 Flash가 추가되면 마이그레이션은 Google 직접 호출과 같은 문자열 하나 변경입니다.


