Qwen 3.8 Max в Codex CLI 2026: конфиг, лимит 258K, цена
Рабочий конфиг Codex CLI для Qwen 3.8 Max: 6 строк через ofox, $0.08 за три реальные задачи против $0.54 на GPT-5.5, плюс лимит контекста 258K.
Поддерживает ли Codex CLI Qwen 3.8 Max?
Да, через шлюз, и полный agent-цикл работает. Встроенной записи для неё в Codex нет, поэтому вы объявляете кастомный provider и направляете его на эндпоинт, говорящий по Responses API. Вся настройка одним экраном:
Что получится: Полный agent-цикл Codex (apply_patch, shell, много ходов) на Qwen 3.8 Max
Сколько времени: 6 строк TOML, около 5 минут
Что нужно: codex-cli 0.146.x, ключ ofox, подписка ChatGPT не нужна
Slug модели: bailian/qwen3.8-max
Протокол: responses (единственное значение, которое Codex принимает в 2026)
Контекст на руки: 258 400 токенов по умолчанию, а не 1M, который модель поддерживает
Снятие лимита: model_catalog_json, не model_context_window
Стоимость 3 задач: $0.0804 против $0.5387 на GPT-5.5 (замерено 2026-08-06)
Прайс: $2 / $6 за 1M вход/выход, чтение кэша $0.25
Qwen выпустила 3.8 Max 3 августа 2026 года с окном контекста в 1M и ценой примерно впятеро ниже GPT-5.5. Codex CLI — очевидное место, где этот бюджет тратить. Подключение работает, конфиг короткий, но две вещи посередине тихо стоят вам денег: контекстное окно, которое Codex реально выдаёт модели, и число токенов, которое CLI печатает в конце прогона.
Оба замерены ниже на codex-cli 0.146.1.
Что можно и чего нельзя сделать с Qwen 3.8 Max в Codex?
Вы получаете настоящий agent-цикл, а не чат-окно. В тестах Qwen 3.8 Max читала файлы, правила их через инструмент apply_patch, запускала python3, чтобы проверить собственную правку, и отчитывалась. Последняя часть важнее, чем звучит. Именно на apply_patch на этом самом пути отваливаются несколько других моделей: Claude Sonnet 5 через тот же шлюз отвергает freeform-форму инструмента Codex с tools.0.custom.strict: Extra inputs are not permitted, а DeepSeek и Grok падают на Encrypted content is not supported with this model. Qwen 3.8 Max — нет.
Чего вы не получаете:
- Полный контекст в 1M. Codex зажимает неизвестные модели до 258 400 токенов. Лечится, но не тем параметром, который называет большинство гайдов.
- Встроенный системный промпт Codex. Как только вы подсовываете кастомный каталог моделей, чтобы снять лимит, вам приходится подсунуть и собственные
base_instructions. Вкомпилированный промпт OpenAI сторонним slug-ам недоступен. - Показания по расходу, которым можно верить. Строка
tokens usedзанижает ровно на то, что ушло в кэш, — в одном прогоне это 85% ввода. - Списание по тарифу ChatGPT. Это путь через API-ключ. Ваш недельный лимит Codex не тратится, подписка ChatGPT — тоже.
Когда так стоит делать, а когда нет?
Когда проблема — счёт за Codex, а не качество модели. Всё дальше исходит из того, что вы уже работаете в Codex ежедневно и знаете свои траты.
Когда стоит:
- Вы выжигаете недельный лимит Codex на GPT-5.5 и хотите модель подешевле для рутинных двух третей работы: рефакторинги, каркасы тестов, объяснение кода.
- Вам нужен один API-ключ, который достаёт до моделей Qwen, GPT и Claude, без поддержки трёх путей аутентификации.
- Вы уже работаете в Codex и не хотите менять CLI ради доступа к китайской фронтир-модели.
Когда не стоит:
- Вам нужен настроенный системный промпт Codex и поведение skills. Записи кастомного каталога заменяют его тем, что напишете вы.
- Вашей работе действительно нужно больше 258K контекста, а поддерживать JSON-каталог ради этого вы не готовы.
- Вы хотите сравнить качество моделей, а не гонять агента. Прямой вызов API проще и пропускает весь этот слой.
Правило остановки: если вам нужна просто модель подешевле для коротких задач — останавливайтесь после шага 3. Работа с каталогом на шаге 4 окупается только тогда, когда ваши сессии достаточно длинные, чтобы упереться в лимит.
Что нужно перед стартом?
Свежий Codex, ключ от шлюза и ничего от OpenAI.
| Пункт | Проверенная версия | Примечания |
|---|---|---|
| codex-cli | 0.146.1 | wire_api = "chat" убрали до этого релиза |
| Node / npm | любая актуальная | npm i @openai/codex |
| API-ключ | ofox sk-of-... | Или любой шлюз, отдающий /v1/responses |
| Slug модели | bailian/qwen3.8-max | Форма с неймспейсом, валидна только под кастомным provider |
| ОС | macOS 26.4 (arm64) | Конфиг не зависит от платформы |
На одном правиле именования спотыкаются регулярно. Под кастомным provider вы используете slug с неймспейсом bailian/qwen3.8-max. Под нативной аутентификацией OpenAI вы писали бы голые имена вроде gpt-5.5, без префикса. Префикс — это неймспейс каталога шлюза, а не часть идентичности модели, и смешать обе формы в одном конфиге — самый быстрый способ получить ошибку «модель не найдена».
Как настроить Qwen 3.8 Max в Codex CLI?
Три шага: установка, объявление provider, запуск. Конфиг ниже — та версия, которая работала на 0.146.1, а не шаблон для адаптации.
Шаг 1: установить Codex и задать ключ
npm i -g @openai/codex
export OFOX_API_KEY="sk-of-..."
codex --version # ожидаем 0.146.x
Не используйте здесь codex login --with-api-key. Этот путь пишет ключ OpenAI в auth.json для встроенного provider, а кастомный provider читает не оттуда.
Шаг 2: написать блок provider
Создайте ~/.codex/config.toml:
model = "bailian/qwen3.8-max"
model_provider = "ofox"
[model_providers.ofox]
name = "ofox"
base_url = "https://api.ofox.ai/v1"
env_key = "OFOX_API_KEY"
wire_api = "responses"
requires_openai_auth = false
Шесть строк конфигурации provider, и каждая нужна:
wire_api = "responses"— теперь единственное принимаемое значение. Передача"chat"даёт жёсткую ошибку на старте, а не предупреждение, и указывает на обсуждение депрекации у OpenAI. Актуальная справка по конфигу прямо говорит, чтоresponses«единственное поддерживаемое значение и оно же по умолчанию, если параметр опущен».env_keyназывает переменную, которую читает Codex. Опустите эту строку — и Codex не выдаст ошибку. Он откатится к ключу OpenAI, лежащему вauth.json, и отправит его в ваш шлюз, породив 401, который обвиняет ваш ключ, тогда как проблема в том, что ушёл другой ключ.requires_openai_auth = falseпропускает экран логина ChatGPT. К форматам ключей, о которых пишут старые гайды, это отношения не имеет.
Шаг 3: запустить
codex exec --sandbox workspace-write "median() is wrong for even-length input. Fix it in stats.py."
Ожидаемый результат: Codex читает файл, вызывает apply_patch, запускает скрипт, чтобы проверить собственную работу, и печатает итог. Наш тестовый репозиторий прошёл путь от однострочного return xs[n // 2] до корректной ветки для чётной длины плюс защита от пустого ввода, а модель сама проверила это, запустив python3 stats.py и прочитав в ответ 2.5.
Если это сработало — интеграция живая. Дальше речь про два числа, которые Codex сообщает по пути.
Почему Codex зажимает контекстное окно до 258 400 токенов?
Потому что Codex знает возможности только собственных моделей OpenAI, а всё остальное получает консервативные значения по умолчанию. На первом же прогоне вы увидите:
warning: Model metadata for `bailian/qwen3.8-max` not found.
Defaulting to fallback metadata; this can degrade performance and cause issues.
Предупреждение читается как косметический шум. Это не так. Codex несёт вкомпилированный каталог записей о моделях, и любой slug вне его откатывается к фиксированному профилю. Чтение лога сессии показывает цену:
grep -o '"model_context_window":[0-9]*' \
~/.codex/sessions/2026/08/06/rollout-*.jsonl | tail -1
"model_context_window":258400
На странице модели ofox у Qwen 3.8 Max 1 131 072 токена. Codex выдаёт ей 258 400 — около 23% того, за доступ к чему вы платите. Длинные сессии начинают автоматически сжиматься куда раньше, чем должны бы, и причину вы не видите.
Помогает ли model_context_window?
Нет, и эту часть стоит проверить прежде, чем ей доверять. Ходовой совет по этой проблеме — добавить model_context_window в начало config.toml. Ключ настоящий, задокументирован как «число токенов контекстного окна, доступное активной модели». Здесь он не сработал.
| Попытка | Предупреждение ушло? | Сообщённое окно |
|---|---|---|
| По умолчанию (без переопределения) | Нет | 258 400 |
model_context_window = 1131072 в config.toml | Нет | 258 400 |
-c model_context_window=1131072 в CLI | Нет | 258 400 |
model_catalog_json с кастомной записью | Да | 1 131 072 |
Три из четырёх — это и есть тот фикс, который советуют. На 0.146.1 число сдвинул только четвёртый.
Как на самом деле снять ограничение контекста?
Направьте model_catalog_json на JSON-файл, который объявляет модель как следует. Codex валидирует этот файл строго, а в структуре ModelInfo 39 полей. Обход валидатора по одной ошибке за раз дал вот это — загружается чисто:
{"models": [{
"slug": "bailian/qwen3.8-max",
"display_name": "Qwen3.8 Max",
"description": "Qwen3.8 Max via ofox",
"context_window": 1131072,
"max_context_window": 1131072,
"effective_context_window_percent": 100,
"default_reasoning_level": "medium",
"supported_reasoning_levels": [
{"effort": "low", "description": "low"},
{"effort": "medium", "description": "med"},
{"effort": "high", "description": "high"}],
"shell_type": "shell_command",
"visibility": "list",
"supported_in_api": true,
"priority": 1,
"support_verbosity": false,
"default_verbosity": "low",
"truncation_policy": {"mode": "tokens", "limit": 10000},
"apply_patch_tool_type": "freeform",
"web_search_tool_type": "text_and_image",
"input_modalities": ["text", "image"],
"supports_image_detail_original": false,
"supports_parallel_tool_calls": true,
"tool_mode": "direct",
"multi_agent_version": null,
"use_responses_lite": false,
"include_skills_usage_instructions": false,
"auto_review_model_override": null,
"auto_compact_token_limit": null,
"comp_hash": "3000",
"reasoning_summary_format": "experimental",
"default_reasoning_summary": "none",
"minimal_client_version": "0.0.1",
"prefer_websockets": false,
"supports_reasoning_summary_parameter": true,
"supports_search_tool": false,
"experimental_supported_tools": [],
"additional_speed_tiers": [],
"service_tiers": [],
"default_service_tier": null,
"availability_nux": null,
"upgrade": null,
"model_specialty": null,
"memory_consolidation": null,
"base_instructions": "You are Codex, a coding agent running in the Codex CLI. Use apply_patch for file edits."
}]}
Сохраните и загрузите:
codex exec -c model_catalog_json=/path/to/catalog.json \
--sandbox workspace-write "your task here"
Предупреждение исчезает, сессия сообщает полные 1 131 072. Agent-цикл продолжает работать: та же правка median прошла через apply_patch с активным каталогом.
Прочитайте последнее поле, прежде чем на это соглашаться. base_instructions обязательно и должно быть строкой, а значит вы заменяете системный промпт Codex своим. Вкомпилированные инструкции OpenAI — это тысячи слов про дисциплину работы с инструментами, формат вывода и правила автономности. Однострочной заглушки выше хватило, чтобы агент оставался работоспособным в тестах, но эквивалентом она не является. Если ваши сессии спокойно укладываются в 258K, пропустить весь этот шаг — защитимое решение.
Какие ошибки вылезут при настройке?
В основном ошибки аутентификации, обвиняющие не то. Каждая строка ниже воспроизведена на 0.146.1, а не собрана из чужих гайдов.
| Что видно | Настоящая причина | Что делать |
|---|---|---|
Missing bearer or basic authentication in header | До шлюза не доехал ни один ключ | Задать переменную, названную в env_key, а не OPENAI_API_KEY |
| 401 про невалидный ключ, хотя ключ работает в других местах | Нет строки env_key, и Codex отправил ключ OpenAI из auth.json | Добавить env_key в блок provider |
You didn't provide an API key | Перевод строки в конце значения ключа снёс заголовок | Убрать перевод строки. Пробелы в конце безвредны |
wire_api = "chat" is no longer supported | Убрано из Codex до 0.146 | Поставить wire_api = "responses" |
| 404 на каждый запрос | В base_url нет суффикса /v1 | Использовать https://api.ofox.ai/v1 |
Model metadata ... not found | Slug вне встроенного каталога Codex | Косметика, но см. лимит 258K выше |
missing field 'display_name' при загрузке каталога | Неполная запись ModelInfo | Все 39 полей обязательны, скопируйте блок выше |
invalid type: null, expected i64 | Поле, которому нельзя быть null, обычно effective_context_window_percent | Дать число, а не null |
| Модель не найдена под нативной аутентификацией | Slug с неймспейсом без кастомного provider | Префиксы вида openai/ работают только под model_provider |
Две строки заслуживают отдельного внимания, потому что вводят в заблуждение активно. Отсутствие env_key порождает ошибку аутентификации про ключ, который вы вообще не собирались отправлять. А codex login status не делает никакой сетевой проверки, так что он радостно доложит о рабочем логине, пока каждый запрос падает. Диагностика аутентификации — это отправка настоящего запроса; /v1/models тоже не подойдёт, поскольку ofox отдаёт каталог публично и возвращает 200 вообще без ключа. Полную матрицу мы разобрали в Codex CLI 401 unauthorized.
Сколько Qwen 3.8 Max реально стоит в Codex?
Около $0.08 за три настоящие задачи против $0.54 за те же три на GPT-5.5. Оба прогона прошли через один CLI, один шлюз, один репозиторий, одни и те же промпты, 2026-08-06.
Цены — со страниц моделей ofox на тот день: Qwen 3.8 Max $2/M на вход, $6/M на выход, $0.25/M чтение кэша; GPT-5.5 $5/M, $30/M, $0.5/M.
| Задача | Qwen 3.8 Max | GPT-5.5 | Разрыв |
|---|---|---|---|
Починить баг в median() | $0.0244 | $0.1223 | 5.0x |
| Добавить type hints и покрытие unittest | $0.0373 | $0.2017 | 5.4x |
| Объяснить репозиторий и указать риски корректности | $0.0187 | $0.2146 | 11.5x |
| Итого | $0.0804 | $0.5387 | 6.7x |
Токены под этими суммами, потому что одни итоги не проверяемы:
| Задача | Qwen без кэша / кэш / выход | GPT-5.5 без кэша / кэш / выход |
|---|---|---|
Починить median() | 7 287 / 17 920 / 887 | 14 772 / 52 736 / 736 |
| Type hints + тесты | 7 637 / 29 312 / 2 447 | 27 650 / 38 784 / 1 470 |
| Объяснить репозиторий | 4 527 / 15 744 / 957 | 29 674 / 75 008 / 958 |
Реален ли разрыв в 6.7x?
Частично. Прайс оправдывает 2.5x на входе и 5x на выходе; остальное — конфигурация и разброс между задачами, а не большая эффективность Qwen. Две вещи раздувают замеренный разрыв сверх разницы в цене, и обе стоит знать, прежде чем цитировать число.
Первая — системный промпт. GPT-5.5 разрешается по встроенному каталогу Codex и получает полный набор инструкций OpenAI на каждом ходу. Qwen 3.8 Max, работающая под кастомным каталогом, получает однострочные base_instructions из примера выше. Эта разница едет во входных токенах каждого хода.
Вторая — число ходов, которое модель выбирает себе сама. На задаче «объяснить репозиторий» GPT-5.5 сделала 8 обращений к API и 7 вызовов инструментов; Qwen — 4 и 3. Одно это объясняет большую часть 11.5x в той строке. На задаче с type hints картина перевернулась: у Qwen 6 обращений против 5 у GPT-5.5, и она всё равно вышла дешевле — вот там разница в накладных расходах на ход видна чисто.
Три задачи, по одному прогону, один репозиторий. Доля попаданий в кэш плавает между прогонами в зависимости от того, что вы вызывали раньше. Считайте 6.7x тем, что эта конфигурация выставила в счёт в тот день, а 2.5x/5x — полом, на который можно рассчитывать по одному прайсу. Сравнение по бенчмаркам, а не по счетам, — в Qwen 3.8 Max против DeepSeek V4 Flash.
Почему число токенов в Codex меньше моего счёта?
Потому что строка tokens used вычитает закэшированный ввод. Правка median напечатала tokens used 5,859. Лог сессии того же прогона:
{"input_tokens": 37401, "cached_input_tokens": 32512,
"output_tokens": 970, "total_tokens": 38371}
38 371 минус 32 512 — это 5 859. Показанное число есть суммарные токены минус кэшированная часть: разумное приближение предельной стоимости и плохое приближение вашего счёта. Те 32 512 кэшированных токенов тарифицируются по ставке чтения кэша, а не бесплатны. Настоящие числа тяните из лога:
grep -o '"total_token_usage":{[^}]*}' \
~/.codex/sessions/2026/08/06/rollout-*.jsonl | tail -1
Сильно ли reasoning effort меняет счёт?
Не так сильно, как намекает число токенов. Та же задача, та же модель, менялся только model_reasoning_effort:
| Effort | Reasoning-токены | Всего токенов | Стоимость |
|---|---|---|---|
| low | 200 | 26 094 | $0.0244 |
| high | 493 | 26 884 | $0.0252 |
Reasoning-вывод вырос в 2.5 раза. Счёт вырос на 3.3%. В agent-цикле доминирует повторная отправка диалога, а reasoning — тонкий слой сверху. Это идёт вразрез с привычным советом держать effort низким ради экономии — по крайней мере для Qwen 3.8 Max в Codex. Выбирайте effort по качеству вывода и оставьте аргумент про бюджет в стороне.
Оговорка: это верно для коротких агентных задач. Один длинный запрос с тяжёлым рассуждением и малым числом вызовов инструментов сместит пропорцию.
Как раздать этот конфиг на команду?
Через профили, чтобы никто не правил общий файл ради смены модели. Профили — способ не дать общему конфигу превратиться в приватные хаки трёх человек. Определите оба стека один раз и позвольте каждому разработчику выбирать под проект:
[profiles.cheap]
model = "bailian/qwen3.8-max"
model_provider = "ofox"
model_reasoning_effort = "medium"
[profiles.heavy]
model = "openai/gpt-5.5"
model_provider = "ofox"
model_reasoning_effort = "high"
codex exec --profile cheap "add tests for the parser"
codex exec --profile heavy "redesign the scheduler's backpressure"
Три вещи, которые команде стоит утрясти до того, как это разойдётся:
- Ключи живут в окружении.
env_keyчитает имя переменной, так что сам файл конфига не содержит секретов и может лежать в репозитории. Не давайте никому вставлять туда ключ текстом. - У файла каталога должен быть дом. Если вы снимаете лимит контекста,
model_catalog_jsonуказывает на абсолютный путь. Закоммитьте JSON в репозиторий и ссылайтесь относительно у каждого разработчика — иначе получите отчёты «у меня работает», которые на деле означают «файл лежит по другому пути». - Зафиксируйте версию CLI. Удаление
wire_api = "chat"сломало конфиги, работавшие год. Записывайте проверенную версию рядом с конфигом.
Раскладки общего ~/.codex/config.toml подробнее разобраны в нашем разборе config.toml для Codex и гайде по нескольким provider.
Продвинутое: какие модели реально заменят здесь Qwen?
Не всякая модель за OpenAI-совместимым шлюзом переживает путь через Responses API, которого требует Codex. Наличие /v1/responses в каталоге необходимо, но не достаточно, и отказы молчат до первого настоящего запроса. Все шесть строк ниже прогнаны через один и тот же шлюз 2026-08-06:
| Модель | Результат в Codex |
|---|---|
bailian/qwen3.8-max | Работает, полный agent-цикл |
openai/gpt-5.5 | Работает |
anthropic/claude-sonnet-5 | Падает на форме инструмента apply_patch |
deepseek/deepseek-v4-pro | Encrypted content is not supported with this model |
x-ai/grok-4.3 | Тот же отказ по encrypted-content |
z-ai/glm-5.2 | 503, на стороне апстрима нет поддержки Responses |
Отказы по encrypted-content с вашей стороны не чинятся. Codex зашивает reasoning.encrypted_content в каждый запрос, переключателя в конфиге нет. Поэтому модель может заявлять правильный эндпоинт и всё равно падать.
Чтобы проверить кандидатов, не тратя на выяснение целую сессию:
curl -s https://api.ofox.ai/v1/models -H "Authorization: Bearer $OFOX_API_KEY" \
| jq -r '.data[] | select(.supported_endpoints | index("/v1/responses")) | .id'
А затем отправьте один настоящий запрос. Этот список отсеивает очевидные отказы и пропускает тонкие. Актуальные цены и поддержка протоколов по каждой модели — на страницах моделей ofox.
Альтернативы, которые стоит рассмотреть
- Шлюз ofox. Один ключ, оба протокола и те самые slug-и моделей, что используются в статье. Qwen 3.8 Max по $2/$6, чтение кэша $0.25/M.
- Alibaba DashScope напрямую. Международная база совместимого режима действительно отдаёт путь
/responses: без ключа отвечает 401, а не 404, значит эндпоинт есть. Ключа DashScope у нас не было, цикл Codex против него не проверялся — считайте это непроверенным, а не подтверждённым. Совместимый режим Alibaba описывает в гайде по совместимости Model Studio с OpenAI. - OpenRouter. Широкое покрытие моделей, хотя требование Responses со стороны Codex сужает пригодный список ровно так же, как и здесь.
- Остаться на GPT-5.5. Если настроенный системный промпт Codex и поведение skills нужны вам больше, чем впятеро дешевле выход, — это настоящий компромисс, а не очевидно неверный выбор.
FAQ
Стоит ли переходить на Qwen 3.8 Max только ради цены? Для рутинной агентной работы разрыв по прайсу достаточно велик, чтобы это имело значение: 2.5x на входе и 5x на выходе. Для работы, где неверный ответ стоит сессии отладки, сначала оцените качество. Детали цен и спецификации запуска — в нашем разборе запуска Qwen 3.8 Max.
Влияет ли это на лимиты моего тарифа ChatGPT или Codex? Нет. Кастомный provider — это путь через API-ключ с отдельным биллингом. Ваш недельный лимит Codex не трогается.
Можно ли использовать в Codex ввод изображений у Qwen 3.8 Max? Модель принимает текст и изображения на вход, и запись каталога выше объявляет обе модальности. Работа с изображениями внутри цикла Codex в это тестирование не входила.
Починят ли лимит 258K на стороне апстрима? Codex разрешает метаданные модели из вкомпилированного каталога, так что сторонние slug-и будут откатываться к дефолтам, пока этот дизайн не изменится. Файл каталога — поддерживаемый обходной путь на сегодня.
References
- Справочник по конфигурации Codex CLI, ключи
wire_apiиmodel_catalog_json(проверено 2026-08-06): https://learn.chatgpt.com/docs/config-file/config-reference - Обсуждение OpenAI Codex 7782, депрекация поддержки chat/completions: https://github.com/openai/codex/discussions/7782
- Пост о запуске Qwen 3.8 Max, команда Alibaba Qwen: https://qwen.ai/blog?id=qwen3.8
- Документация Alibaba Model Studio по совместимости с OpenAI: https://www.alibabacloud.com/help/en/model-studio/compatibility-of-openai-with-dashscope
- Снимки страниц моделей ofox для
bailian/qwen3.8-maxиopenai/gpt-5.5(2026-08-06) - Локальные прогоны на codex-cli 0.146.1, macOS 26.4 arm64, логи сессий в
$CODEX_HOME/sessions/2026/08/06/
Часто задаваемые вопросы
- Поддерживает ли Codex CLI модель Qwen 3.8 Max?
- Нативно — нет. Codex CLI несёт встроенные метаданные только для моделей OpenAI, а транспорт у него — Responses API. Qwen 3.8 Max работает через OpenAI-совместимый шлюз, который отдаёт /v1/responses. Проверено на codex-cli 0.146.1 против ofox с bailian/qwen3.8-max: полный agent-цикл проходит, включая правки через apply_patch и проверку через shell.
- Почему Codex пишет «Model metadata not found» для моей кастомной модели?
- Codex несёт вкомпилированный каталог возможностей моделей — только для OpenAI. Любой slug вне этой таблицы откатывается к консервативным значениям по умолчанию. Само предупреждение косметическое, но откат молча зажимает контекстное окно до 258 400 токенов независимо от того, сколько модель реально поддерживает.
- Qwen 3.8 Max дешевле GPT-5.5 для кодинг-агентов?
- По прайсу — да: $2/$6 за 1M входных/выходных против $5/$30, то есть 2.5x на входе и 5x на выходе. На трёх настоящих задачах в Codex, замеренных end-to-end 2026-08-06, разрыв вышел шире — 6.7x ($0.0804 против $0.5387), но часть этого — конфигурация, а не эффективность модели. В статье разобрано, что именно чему.
- Снимает ли model_context_window ограничение контекста?
- Нет. Проверено на 0.146.1 и как ключ верхнего уровня в config.toml, и как -c переопределение в CLI: сессия по-прежнему сообщает model_context_window = 258400, предупреждение о метаданных всё так же печатается. Единственное, что сдвинуло число, — model_catalog_json с кастомной записью ModelInfo.
- Можно ли направить Codex CLI напрямую на эндпоинт Alibaba DashScope?
- Международная база совместимого режима DashScope действительно отдаёт путь /responses (без ключа отвечает 401 InvalidApiKey, а не 404), то есть эндпоинт существует. Ключа DashScope у нас не было, полный agent-цикл Codex против него мы не проверяли — считайте прямое подключение непроверенным, а не поддерживаемым или сломанным.
- Сильно ли дорожает Qwen 3.8 Max в Codex при высоком reasoning effort?
- Меньше, чем можно подумать. Переход с low на high на одной и той же задаче поднял reasoning-токены с 200 до 493, а счёт сдвинулся с $0.0244 до $0.0252 — около 3%. В agent-цикле reasoning — тонкий слой сверху, а доминирует повторная отправка истории диалога.
- Что на самом деле означает число «tokens used» в Codex?
- Это суммарные токены минус закэшированный ввод, а не то, за что вам выставляют счёт. Одна задача показала 5 859, тогда как лог сессии записал 38 371 токен всего, из них 32 512 из кэша. Кэшированная часть тоже стоит денег, просто по ставке чтения кэша.


