Qwen3.8-Max-0902: 같은 가격, 호출당 입력 토큰 38개 추가
0902 스냅샷은 8월 빌드와 같은 100만당 $2/$6로 과금되지만, 호출마다 프롬프트 토큰이 고정으로 38개 늘어나는 것을 측정했습니다. 그 비용과 버전 고정 시점.
Qwen3.8-Max의 0902 스냅샷은 이전 빌드와 정확히 같은 값, 입력 100만 토큰당 $2.00, 출력 $6.00입니다. 동시에 요청마다 입력 토큰을 38개 더 씁니다. 길이가 다른 프롬프트 세 개에서 이 격차를 측정했고 매번 38개, 편차는 없었습니다. 아래 내용은 모두 2026년 9월 4일 라이브 Ofox 카탈로그와 실제 API 호출에서 나왔습니다.
무엇을 측정했나
같은 프롬프트, 같은 파라미터, 두 개의 모델 문자열. 유일한 차이는 어느 스냅샷이 응답하느냐입니다.
| 프롬프트 | qwen3.8-max | qwen3.8-max-0902 | 차이 |
|---|---|---|---|
Reply with exactly: ok | 28 | 66 | +38 |
What is 2+2? | 30 | 68 | +38 |
Rewrite this GROUP BY as a window function. | 33 | 71 | +38 |
/v1/chat/completions가 돌려준 usage.prompt_tokens이고, 요청 본문은 모델 문자열만 빼면 동일합니다. 길이가 다른 프롬프트 셋에서 일정한 오프셋이 나온다는 것은, 입력 길이에 비례해 커질 토크나이저 변경이 아니라 모든 호출 앞에 붙는 고정 오버헤드라는 뜻입니다.
입력 100만 토큰당 $2.00이면 38토큰은 요청당 $0.000076입니다. 호출이 몇 번뿐이면 없는 셈이고, 규모가 커지면 실제 돈입니다.
| 요청 수 | 추가 입력 토큰 | 추가 비용 |
|---|---|---|
| 10,000 | 380,000 | $0.76 |
| 1,000,000 | 38,000,000 | $76 |
| 10,000,000 | 380,000,000 | $760 |
정직하게 요약하면, 토큰 단가는 그대로고 호출당 바닥값이 달라졌으며, 그게 문제가 되는지는 토큰 총량이 아니라 요청 횟수의 함수입니다. 짧은 프롬프트를 고빈도로 쓰는 워크로드가 가장 크게 체감합니다. 28토큰짜리 프롬프트에 38토큰이 얹히면 입력 쪽이 두 배 넘게 늘어나니까요.
가격표는 동일
| 100만 토큰당 요금 | qwen3.8-max | qwen3.8-max-0902 |
|---|---|---|
| 입력 | $2.00 | $2.00 |
| 출력 | $6.00 | $6.00 |
| 캐시 읽기 | $0.25 | $0.25 |
| 캐시 쓰기 | $2.50 | $2.50 |
| 웹 검색 | 호출당 $0.01 | 호출당 $0.01 |
2026년 9월 4일 라이브 /v1/models 응답의 pricing 객체에서 읽었고 모든 필드가 일치합니다. 요금을 올리지 않고 능력이 좋아지는 건 좋은 경우입니다. 이 요금이 이전 세대 플래그십이나 QwenCloud 직접 호출과 어떻게 비교되는지는 Qwen3.8 Max 요금 및 접근 가이드에 있습니다.
Alibaba가 말하는 변경점
코딩, 협업 에이전트 능력, 시각 이해입니다. 2026-09-02 스냅샷의 카탈로그 설명은 코딩과 협업 에이전트 능력이 크게 강화되고 시각 이해가 최적화되었다고 하면서, 이전 빌드의 1M 컨텍스트, 심층 추론 모드, 이미지 및 영상 입력을 명시적으로 유지한다고 적습니다.
그 설명에 없는 것은 벤치마크 수치라서, 지금은 리더보드에 대조해 검증할 것이 없습니다. 능력 주장은 벤더의 말로 받아들이고, 38토큰 측정치를 독립적으로 확인 가능한 부분으로 다루세요. 실제로 확인이 되니까요.
컨텍스트 창 행에는 단서가 필요합니다
두 빌드 모두 1M 컨텍스트 모델이지만 카탈로그의 보고 방식이 다릅니다. 날짜 없는 빌드는 context_length: 1131072, 0902 스냅샷은 1000000을 보고합니다. 두 설명 모두 1M이라 적고, 최대 응답도 둘 다 131,072 토큰입니다.
능력이 깎인 것처럼 보이지만 거의 확실히 아닙니다. 1,131,072는 1,048,576에 82,496을 더한 값으로, 깔끔한 공표 수치라기보다 입력 상한에 여유를 더한 것처럼 읽힙니다. 1,000,000이 오히려 둥근 마케팅 숫자죠. 안전한 해석은 모델이 아니라 보고 관행이 바뀌었다는 것입니다. 위험한 해석은 숫자가 작아졌으니 Alibaba가 창을 줄였다고 단정하고, 존재하지 않을 수도 있는 제한에 맞춰 설계하는 것입니다.
워크로드가 실제로 100만 토큰 컨텍스트에 근접한다면, 카탈로그의 어느 숫자도 믿지 말고 출시할 스냅샷에서 진짜 상한을 재보세요. 1,000,000 토큰 아래는 두 빌드 모두 안전합니다.
나머지는 전부 동일
| 속성 | 두 빌드 |
|---|---|
| 최대 응답 토큰 | 131,072 |
| 입력 모달리티 | 텍스트, 이미지 |
| 출력 모달리티 | 텍스트 |
| 엔드포인트 | /v1/chat/completions, /v1/responses |
| 파라미터 | temperature, top_p, max_tokens, stop, tools, tool_choice, response_format, reasoning |
| 토크나이저 | qwen |
파라미터 목록이 바이트 단위로 같고, 그래서 마이그레이션이 문자열 하나만 바꾸는 일이 됩니다.
- "model": "bailian/qwen3.8-max"
+ "model": "bailian/qwen3.8-max-0902"
알아둘 만한 함정: 빈 content
두 빌드 모두 추론 모델이고, 그래서 실패처럼 보이지만 실패가 아닌 결과가 나옵니다.
{"usage": {"prompt_tokens": 66, "completion_tokens": 20,
"completion_tokens_details": {"reasoning_tokens": 20}}}
응답 토큰 20개, 전부 추론 토큰이고 content는 빈 문자열로 돌아왔습니다. 아무것도 망가지지 않았습니다. 추론 모델에서 max_tokens를 20으로 두면, 눈에 보이는 글자가 하나 나오기 전에 예산이 사고에 쓰이고 응답이 상한에서 잘립니다.
고치는 방법은 max_tokens를 올리는 것이지 재시도나 모델 교체가 아닙니다. 실무 규칙은 이렇습니다. 추론 모델에서 max_tokens는 추론과 답변을 모두 감당해야 하고, 추론은 여러분이 보든 안 보든 출력 요금으로 과금됩니다. max_tokens를 답변 길이인 양 잡는 것이, 잘 돌아가는 모델을 고장 난 것처럼 보이게 만드는 원인입니다.
날짜를 고정할까, 포인터를 따라갈까
bailian/qwen3.8-max-0902는 고정되어 있고, bailian/qwen3.8-max는 아닙니다.
날짜가 붙은 문자열을 고정할 때:
- 출력이 재현 가능해야 한다. 예를 들어 리뷰나 승인 절차 아래에 있다.
- 큰 프롬프트 라이브러리가 한 빌드에 대해 검증되어 있고 재검증 비용이 크다.
- 동작이 언제 바뀔지를 프로덕션에서 발견하는 대신 직접 통제하고 싶다.
날짜 없는 문자열을 쓸 때:
- 재배포 없이 Alibaba의 현재 권장을 따라가고 싶다.
- 프롬프트가 충분히 견고해서 스냅샷 변경이 회귀 위험이 아니다.
트레이드오프는 늘 그렇듯이고 양쪽 다 비용이 있습니다. 고정하면 직접 움직이기 전까지 개선이 도달하지 않고, 포인터를 따라가면 아무것도 배포하지 않았는데 제품 아래의 모델이 바뀔 수 있습니다. 무엇을 고르든 의식하고 고르세요. “처음에 쳐 넣은 문자열 그대로”라는 기본값이야말로, 영원히 고정된 모델이 조용히 낡아가는 경로니까요.
이 모델의 위치
더 넓은 판에서 보면 $2.00 / $6.00의 Qwen3.8 Max는 플래그십 등급 가격입니다. 더 싼 대안이라는 질문은 Qwen3.8 Max 대 DeepSeek V4 Flash가 다루고, 코딩 백엔드로 돌리는 이야기는 Codex CLI 설정 가이드가 다루는데, 후자가 바로 0902 스냅샷이 가장 크게 개선했다고 주장하는 워크로드입니다.
출처
가격, 컨텍스트 길이, 파라미터, 모달리티는 2026년 9월 4일 라이브 Ofox /v1/models 엔드포인트에서 읽었습니다. 38토큰 차이는 같은 날 각 모델에 대해 모델 문자열만 다른 동일한 요청 본문으로 /v1/chat/completions를 세 번씩 실제 호출해 측정했습니다.
자주 묻는 질문
- Qwen3.8-Max-0902가 이전 스냅샷보다 비싼가요?
- 토큰 단가로는 아닙니다. Ofox에서 둘 다 입력 100만 토큰당 $2.00, 출력 $6.00이고 캐시 읽기, 캐시 쓰기, 웹 검색 요금도 동일합니다. 호출 단위로는 약간 비쌉니다. 서로 다른 프롬프트 세 개에서 0902 스냅샷이 날짜 없는 빌드보다 프롬프트 토큰을 정확히 38개 더 쓰는 것을 측정했고, 입력 요금으로 요청당 약 $0.000076입니다.
- Qwen3.8-Max의 0902 스냅샷에서 무엇이 바뀌었나요?
- 2026-09-02 스냅샷에 대한 Alibaba의 카탈로그 설명은 코딩과 협업 에이전트 능력의 큰 향상, 시각 이해 최적화를 언급하면서, 이전 빌드의 1M 컨텍스트, 심층 추론, 이미지 및 영상 입력은 유지한다고 밝힙니다. 가격, 파라미터 목록, 엔드포인트는 그대로입니다.
- qwen3.8-max-0902를 고정해야 하나요, 날짜 없는 모델 문자열을 써야 하나요?
- 재현 가능한 출력이 필요할 때, 예를 들어 승인 절차를 거치거나 프롬프트 라이브러리를 한 빌드에 대해 검증해 둔 경우에는 날짜가 붙은 문자열을 고정하세요. 재배포 없이 Alibaba의 현재 권장을 따라가고 싶다면 날짜 없는 bailian/qwen3.8-max를 쓰세요. 날짜 없는 문자열은 고정되어 있지 않고 언젠가 더 새 스냅샷으로 옮겨갑니다.
- 0902 스냅샷도 여전히 1M 컨텍스트인가요?
- 네. Ofox는 0902 스냅샷에서 1,000,000 토큰, 날짜 없는 빌드에서 1,131,072 토큰을 보고하고 두 설명 모두 1M이라고 적습니다. 차이는 능력 축소가 아니라 상한을 보고하는 방식이며, 둘 다 최대 응답은 131,072 토큰입니다.
- 두 Qwen3.8-Max 빌드의 모델 ID는 무엇인가요?
- 날짜 없는 빌드는 bailian/qwen3.8-max, 9월 스냅샷은 bailian/qwen3.8-max-0902이며 후자는 qwen3.8-max-2026-09-02 별칭에도 응답합니다. 둘 다 /v1/chat/completions와 /v1/responses에 있고 같은 파라미터 집합을 받습니다.
- 응답의 content가 비어서 오는 이유는?
- 보이는 답이 나오기 전에 추론이 토큰 예산을 다 써버렸기 때문입니다. 두 빌드 모두 추론 모델이고, max_tokens를 낮게 두면 usage 객체는 completion_tokens가 전부 reasoning_tokens로 소비되고 content는 비어 있다고 표시합니다. 모델이 실패했다고 보지 말고 max_tokens를 올리세요.


