Параметры DeepSeek V4.1 Flash: что означают 552B, 16B и размер весов

Как различать параметры основной архитектуры DeepSeek V4.1 Flash, Engram, активные параметры и размер файлов при расчёте памяти.

Обложка на песочном фоне: светлая бумага с линейным рисунком с рулеткой, геометрические акценты и заголовок DeepSeek V4.1 Parameters.

Число параметров основной архитектуры DeepSeek V4.1 Flash, активных параметров и размер загружаемых весов описывают разные величины. Официальная карточка указывает 552B для backbone, 8B активных при prefill, 16B при decode и отдельно компонент условной памяти Engram на 196B. Ни одно из этих чисел само по себе не задаёт полную потребность в GPU-памяти.

Разберём обозначения и проверим список файлов весов. Официальный репозиторий и метаданные проверены 14 сентября 2026 года. Мы не загружали примерно 510 GB весов и не запускали модель локально. Наблюдаемые размеры файлов ниже отделены от гипотетической арифметики хранения.

Сохраняйте область подсчёта рядом с числом

Официальная карточка DeepSeek описывает архитектуру через backbone и активные параметры. Не опускайте эти термины, сопоставляя числа со счётчиком репозитория или сторонним графиком.

Число или показательЧто описываетЧего не устанавливает
552B backboneОсновную архитектуру в определении карточкиВсе сохранённые тензоры репозитория
8B prefill activeАктивное вычисление на этапе обработки входаВсе веса, необходимые для загрузки
16B decode activeАктивное вычисление при декодированииБюджет запуска плотной модели 16B
196B EngramОтдельно описанную условную памятьЗамену счётчика backbone
Размер файловМесто выбранных файлов на носителеПиковую RAM или VRAM

Не складывайте округлённые архитектурные показатели, выдавая сумму за точное число параметров в сериализованных тензорах. Важны округление и границы компонентов. Точный счётчик репозитория и краткая округлённая характеристика могут отличаться без опечатки.

Почему активные параметры не определяют размер загрузки

Разреженная модель использует часть вычислений для отдельного токена. Это снижает работу выбранного пути, но не позволяет исключить остальные обученные веса из дистрибутива. Другим токенам и этапам могут понадобиться другие компоненты.

Система инференса может распределять компоненты между устройствами или выгружать их на CPU. Это меняет размещение, пропускную способность и скорость, но не позволяет вывести рабочую конфигурацию обычной видеокарты только из активного числа. Нужно проверить поддержку размещения и квантования в движке.

Умножение 16 миллиардов на выбранное количество байт — не оценка загрузки всей модели. Это лишь пример хранения условного подмножества с указанной точностью. Называть его требованием VRAM для модели неверно.

Что показали метаданные файлов

Для ревизии dba1be0a40aa45a94ad051997016db3960a90277 официальные метаданные содержали 48 частей safetensors общим размером 510 296 708 312 байт, или примерно 510,297 десятичных GB. Это сумма выбранных файлов: не всех дополнительных материалов и не измеренной рабочей памяти.

Метаданные Hugging Face также указывали safetensors.total = 763 205 315 794 с категориями BF16, F32, F8_E4M3 и I8. Это счётчик хостинга, а не независимо подтверждённое архитектурное число параметров. Его область отличается от 552B backbone. Смешанные типы — ещё одна причина, по которой умножение одного краткого числа на единую ширину значения не воспроизводит объём файлов.

Метаданные меняются вместе с файлами и ревизиями. Записывайте ревизию рядом с цифрами. Для аппаратного расчёта прикладывайте список файлов и различайте десятичные GB и двоичные GiB: это позволяет повторить вычисление.

Как проверить объём без загрузки весов

Команда получает только публичные метаданные. Скрипт выводит ревизию и складывает размеры файлов с окончанием .safetensors. Отсутствующий размер должен вызывать ошибку, а не подменяться нулём.

curl --fail --silent --show-error \
  'https://huggingface.co/api/models/deepseek-ai/DeepSeek-V4.1-Flash?blobs=true' \
  -o model-metadata.json
import json
from pathlib import Path

metadata = json.loads(Path("model-metadata.json").read_text())
shards = [f for f in metadata["siblings"] if f["rfilename"].endswith(".safetensors")]
if not shards or any(type(f.get("size")) is not int or f["size"] < 0 for f in shards):
    raise ValueError("Complete safetensors file sizes are required")
size_bytes = sum(f["size"] for f in shards)
print(metadata["sha"], len(shards), size_bytes, size_bytes / 1_000_000_000)

Это метод инвентаризации, не тест инференса. Зафиксируйте возвращённую ревизию перед сравнением во времени. Нельзя незаметно соединять новую сумму с числом файлов или архитектурными данными старого снимка.

Рабочую память рассчитывайте отдельно

Учтите представление весов в движке, преобразование при загрузке, KV-кеш для выбранного контекста, временные тензоры, выделения фреймворка и параллельные запросы. Пик загрузки может отличаться от установившейся генерации.

До выбора количества GPU проверьте реализацию архитектуры и рецепт запуска. Типы хранения не доказывают, что ускоритель непосредственно исполняет все операции. Offloading переносит нагрузку на RAM и обмен данными, а не устраняет её.

Если задача — интеграция приложения, а не локальный инференс, используйте инструкцию по DeepSeek V4.1 API. Стоимость API определяется правилами провайдера, а не платой за каждый сохранённый параметр. Размер 510 GB нельзя использовать для вычисления цены одного запроса.

Число параметров не заменяет проверку качества

Параметры не устанавливают, какая модель лучше в вашей задаче. Нужно учитывать качество, действующие настройки рассуждений, контекст и инструменты. Если модель ведёт себя по-разному в двух приложениях, пригодится диагностика разных клиентов.

Для размещения важнее, помещаются ли проверенный движок и полная нагрузка на оборудовании с приемлемой скоростью. В примере K2 Horizon тем же способом разделены активные параметры и реально доступные файлы меньшей разреженной модели.

Частые вопросы

552B — точное число параметров во всех сохранённых тензорах?

Нет. Сохраняйте официальный термин backbone. Счётчики хранилища могут включать другие компоненты и иметь иной охват.

Можно рассчитать всю VRAM по 16B активных параметров?

Нет. Активные вычисления не охватывают все веса; рабочая память также включает кеши и временные выделения.

Достаточно ровно 510,297 GB GPU-памяти?

Это не установлено. Число описывает размер 48 файлов весов на одной ревизии, а не проверенные требования загрузки или инференса.

Часто задаваемые вопросы

552B — точное число параметров во всех сохранённых тензорах?
Нет. Сохраняйте официальный термин backbone. Счётчики хранилища могут включать другие компоненты и иметь иной охват.
Можно рассчитать всю VRAM по 16B активных параметров?
Нет. Активные вычисления не охватывают все веса; рабочая память также включает кеши и временные выделения.
Достаточно ровно 510,297 GB GPU-памяти?
Это не установлено. Число описывает размер 48 файлов весов на одной ревизии, а не проверенные требования загрузки или инференса.