MiniMax H3 API 价格:2K 每秒 $0.13,以及为什么「先出草稿再升级」一分钱都省不下

MiniMax H3 在 2K 下每秒 $0.13,768P 每秒 $0.08。768P 转 2K 的重生成档是 $0.05,$0.08 + $0.05 正好等于 $0.13。这对真实预算意味着什么。

MiniMax H3 API 价格:2K 每秒 $0.13,以及为什么「先出草稿再升级」一分钱都省不下

MiniMax H3 的 2K 输出每秒 $0.13,768P 每秒 $0.08。把已完成的 768P 片子转成 2K 的重生成档是 $0.05。 后两个加起来是 $0.13——和直接出 2K 的价格分毫不差。这道算术是关于这个模型定价你最该知道的一件事,而它没写在营销页上。

模型 ID:      MiniMax-H3
输出:         2K 每秒 $0.13,768P 每秒 $0.08
重生成:       每秒 $0.05(仅 768P → 2K)
时长:         4–15 秒,只能取整数,24 fps
音频:         原生立体声,同一遍生成
输入音频:     免费
输入图像:     前 5 张免费,之后每张 $0.04
输入视频:     按它自己的时长、以输出档费率计费
端点:         POST /v2/video_generation(异步,轮询取结果)
权重:         H3-Base 开源(768P);2K 模块与 Context-IR 未发布
网关:         截至 2026-09-06 不在 Ofox 目录内

费率读取自 MiniMax 2026 年 9 月 6 日的按量付费定价页。H3 于 2026 年 7 月 31 日发布,权重在 8 月 3 日跟上。

MiniMax H3 到底是什么

一个在一次请求里同时吃文本、图像、视频、音频,并返回带声音视频的多模态生成模型。 不是语言模型——搜索结果里一起冒出来的 M3 是另一个编程与语言模型,在同一场 WAIC 2026 上发布。

H3 区别于多数视频模型的地方在于,音频是在同一遍里生成的,不是事后配上去。MiniMax 自己的说法是,它把过去要分开的一堆专家模型——文生视频、图生视频、首尾帧、主体参考、动作参考、视频编辑——收进了一个模型里,模式由你送进去的东西决定,而不是由不同的端点决定。

规格MiniMax H3
输出分辨率768P 或 2K
时长4–15 秒,只能取整数
帧率24 fps
音频原生立体声,同一遍生成
画幅比adaptive、21:9、16:9、4:3、1:1、3:4、9:16
参考输入最多 9 张图、3 段视频、3 段音频
请求体总计 ≤ 64 MB

价目表

两档输出、一档重生成,输入素材另计。

计费项费率
2K 输出每秒 $0.13
768P 输出每秒 $0.08
768P → 2K 重生成每秒 $0.05
输入音频免费
输入图像前 5 张免费,之后每张 $0.04
输入视频按输入时长、以输出分辨率对应的费率计费

另有一个单独的 MiniMax-H3-Max 模型,480P 每秒 $0.05、768P 每秒 $0.08,目前只支持文生视频和图生视频,且不对输入素材计费。

按公开费率算,一段片子多少钱:

时长768P2K
4 秒$0.32$0.52
5 秒$0.40$0.65
10 秒$0.80$1.30
15 秒$1.20$1.95

定价页上没人写的那道算术

$0.08 + $0.05 = $0.13。 先在 768P 出草稿、再把选中的那条升到 2K,花的钱和直接拍 2K 一模一样。

这件事要紧,是因为「便宜地多生成,把赢家升级」是个显而易见的工作流,听上去像在省钱。就单条片子而言,它不省:

路径10 秒片子
直接 2K$1.30
768P 草稿,再重生成$0.80 + $0.50 = $1.30

草稿路线真正省钱的地方,是你扔掉的那些镜头。 每一秒被丢弃的素材只花 $0.05 而不是 $0.13,所以省是真省,但省多少取决于你的废片率,而不是取决于这个工作流本身。五条 5 秒的镜头扔掉四条,这一批省下 $1.00。全都留下,那你花了同样的钱,还多等了一遍。

它更贵的地方:参考素材重的活儿。 重生成会把原始输入素材重新计一遍费。图像重新给你 5 张免费额度,之后每张 $0.025,参考视频也按它自己的时长再计一次每秒 $0.05。如果你每次生成都要喂一张角色设定图加一段动作参考,那草稿再升级这条路一定比直接上 2K 更贵。

诚实的判断是:把 768P 当成筛选层,而不是省钱手段。 你在探索、并且预计大部分生成结果都会被丢掉时,它划算。你已经明确知道自己要什么时,它反而让你多花钱。

重生成端点的限制很死

在围绕它做开发之前值得先读一遍,因为它不是超分工具。按 MiniMax 自己的 API 文档,源视频必须严格符合 H3 的 768P 输出规格:

要求取值
音轨必须有——没有音频的视频会被拒
帧率24 fps
宽 / 高都要能被 32 整除
面积≤ 768 × 1344(1,032,192 像素)
总帧数107–362,步长为 17

还有两条会咬人的约束:

  • 原始输入必须原样重新提交。 768P 那次任务里所有的参考图、视频和音频都要再传一遍,另加一个 role=base_videovideo_url 项。
  • prompt 必须是后处理之后的那一版。 MiniMax 明确要求 text 必须是 “the final prompt actually sent to the model when generating the 768P source video, not the original prompt from before H3-Context-IR processing.”(生成 768P 源视频时实际送给模型的最终 prompt,而不是 H3-Context-IR 处理之前的原始 prompt。)如果你没把那个中间产物记下来,这个任务你就复现不了。

最后这条是真正的坑。Context-IR 会在生成前重写你的指令,而重生成要的是重写之后的那一版。生成时就把它记下来,否则你之后就失去了升级这段片子的能力。

开源的只是模型的一半

H3-Base 是公开的。撑起那些宣传参数的两个模块不是。

MiniMax 于 2026 年 8 月 3 日开源了 H3——两个 BF16 检查点(FL2VA 用于文本和首尾帧类任务,Ref2VA 用于参考类任务),33B 稠密单流 transformer,托管在 Hugging Face 上,许可是 MiniMax 自家的 Community License,不是 Apache 或 MIT。

你拿不到的部分:

  • H3-Regenerate-2K,模型卡上写的是 “not yet open-sourced”(尚未开源)。这正是产出 2K 的那个模块。本地部署只能生成 768P。
  • H3-Context-IR,把你的多模态指令转成模型真正消费的内容的托管层,因为横跨多个托管服务而被排除。MiniMax 称它对输出质量至关重要。
  • 稀疏注意力推理。 模型原生支持,但开源版本只带了全注意力。

所以自部署拿到的是 768P 那一半。官方参考部署是四张 GPU 走 SGLang。在把一个工程师投进去之前,请拿它和每秒 $0.13 掂量一下——另外注意 Community License 在若干地区限制使用,并要求营收超过某个门槛后取得书面授权,这属于法务评估而不是技术评估。

H3 的价格横向对比

H3 不在 Ofox 目录里,所以这是一次跨渠道对比,不是同口径对比。Ofox 的费率读取自 2026 年 9 月 6 日的实时 /v1/models 端点;H3 的是 MiniMax 自己的标价。

模型每秒最长时长分辨率原生音频
MiniMax H3(2K)$0.13015 秒768P、2K
MiniMax H3(768P)$0.08015 秒768P、2K
alibaba/wan-3.0$0.05030 秒480p–1080p
alibaba/wan-3.0-prime$0.08030 秒480p–1080p
bytedance/seedance-2.5$0.11030 秒480p–1080p
alibaba/happyhorse-1.1$0.13015 秒720p、1080p
bytedance/seedance-2.0$0.07015 秒480p–4K

这张表要仔细读,因为分辨率那一列很关键。H3 是表里唯一输出 2K 的模型,同时也是唯一一个最便宜档位天花板低于 1080p 的。拿 2K 的 $0.13 去比 Wan 3.0 在 1080p 下的 $0.05,比的不是同一件东西。

各自适合什么:

  • 你要 2K 且音画同步: 这张表上只有 H3 能给。除了 Seedance 2.0 能到 4K($0.07),其余都上不了 1080p 以上。
  • 你要 1080p 且价格最低: Wan 3.0 每秒 $0.05,不到 H3 768P 档的一半,输出的分辨率还更高。
  • 你要超过 15 秒的片子: H3 封顶 15 秒。Wan 3.0 和 Seedance 2.5 都能到 30。
  • 你要塞大量参考素材: Seedance 2.5 接受 30 张图、10 段视频、10 段音频,H3 是 9 / 3 / 3。

怎么调

H3 跑在 MiniMax 自己的平台上,异步——先创建任务,再轮询取结果:

curl -X POST https://api.minimax.io/v2/video_generation \
  -H "Authorization: Bearer $MINIMAX_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "MiniMax-H3",
    "content": [
      {"type": "text", "text": "A paper boat drifting down a rain gutter, close on the water line"}
    ],
    "resolution": "2K",
    "duration": 5,
    "ratio": "16:9"
  }'

两条实用提示:纯文生视频时 ratio 是必填的,且不能填 adaptive。另外请求体要控制在 64 MB 以内——Base64 会让载荷膨胀约三分之一,稍大一点的素材都该用公网 URL。

Ofox 这边,截至 2026 年 9 月 6 日 H3 不可用。 目录里的 MiniMax 模型是 M 系列语言模型,包括 minimax/minimax-m3,每百万 $0.60 / $2.40——就是那个老被和 H3 搞混的模型。今天在同一把 key 上做视频:

curl -X POST https://api.ofox.ai/v1/videos \
  -H "Authorization: Bearer $OFOX_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "alibaba/wan-3.0",
    "prompt": "A paper boat drifting down a rain gutter, close on the water line",
    "duration": 5,
    "resolution": "1080p"
  }'

到底哪些模型可调,以 GET https://api.ofox.ai/v1/models 为准,不要以本页为准。

后续要盯的

有三件事会改变上面的判断:

  1. H3-Regenerate-2K 开源。 在那之前,自部署就意味着只有 768P,「开源权重」这件事的实际分量比标题看上去小得多。MiniMax 没给日期。
  2. 独立的质量测量。 目前所有关于 H3 输出质量的公开材料,要么是 MiniMax 自己的 demo,要么是上手体验。这个领域没有可类比 Artificial Analysis 在语言模型上做的第三方视频基准,所以「不到主流模型三分之一」这种说法是厂商口径,不是已被验证的结论。
  3. 网关上架。 H3 上了聚合平台,你就能在一把 key 上把它和 Wan 3.0、Seedance 2.5 做 A/B——这正是本文今天做不了的那次对比。

来源

H3 的费率、时长范围、输入素材规则和重生成源视频规格,读取自 MiniMax 2026 年 9 月 6 日的按量付费定价页与 API 文档。2026 年 7 月 31 日发布、8 月 3 日开源权重这两个日期出自 MiniMax 自己的公告。Ofox 的对比费率和视频属性读取自同一天的实时 /v1/models 端点。截至该日期 MiniMax H3 不在 Ofox 目录内;本页没有任何内容出自我们自己的实测。

常见问题

MiniMax H3 API 多少钱?
输出视频 2K 每秒 $0.13、768P 每秒 $0.08,在 MiniMax 的按量付费方案下按秒计费。一段 10 秒的 2K 片子是 $1.30。把已生成的 768P 片子重生成为 2K,另按每秒 $0.05 计。输入音频免费,前五张参考图免费、之后每张 $0.04,参考视频按它自己的时长、以输出分辨率对应的费率计费。
先在 768P 生成再升到 2K 更便宜吗?
对你要留下的片子来说不便宜。768P 那一遍 $0.08 加上重生成 $0.05 正好是 $0.13,和直接出 2K 的价格分毫不差。草稿再升级这条路只在你丢弃的镜头上省钱,每秒省到 $0.05;而且重生成会把原始参考素材重新计一遍费,所以参考素材多的活儿反而可能比直接拍 2K 更贵。
MiniMax H3 是什么?
MiniMax 于 2026 年 7 月 31 日发布的通用多模态生成模型。它在一次请求里接受文本、图像、视频和音频输入,返回一段 4 到 15 秒、768P 或 2K、24 fps 的片子,并在同一遍里原生生成立体声音频,而不是事后配上去。它是视频模型,不是命名规律相似的 M3 语言模型。
MiniMax H3 的权重开源了吗?
部分开源,而没开的那部分很关键。MiniMax 在 2026 年 8 月 3 日以自家 Community License 开源了 H3-Base,两个 BF16 检查点。但产出 2K 的 H3-Regenerate-2K 模块没有发布,负责处理多模态指令的托管层 H3-Context-IR 因为横跨多个服务也被排除在外。本地部署只能生成 768P。
MiniMax H3 的视频能有多长?
4 到 15 秒,只能取整数,24 fps。重生成端点的要求更严:源视频必须是 24 fps,宽高都能被 32 整除,面积不超过 768×1344,总帧数在 107 到 362 之间且以 17 为步长。它不是通用超分工具,非 H3 在 768P 下产出的视频会被拒。
Ofox 上能用 MiniMax H3 吗?
截至 2026 年 9 月 6 日不能。Ofox 目录里的 MiniMax 模型是 M 系列语言模型。同一把 key 上要做视频,alibaba/wan-3.0 是每秒 $0.05、最高 1080p,bytedance/seedance-2.5 是 $0.11,alibaba/happyhorse-1.1 是 $0.130。到底哪些可调,以 GET /v1/models 的实时目录为准。
MiniMax H3 和 M3 有什么区别?
是两个互不相干的模型,只是在同一场 WAIC 2026 上发布,所以搜索结果里老是被混在一起。H3 是本文讲的多模态视频模型。M3 是语言和编程模型,Ofox 上是 minimax/minimax-m3,每百万输入 $0.60、输出 $2.40。