Seedance 2.0 怎么用(2026):官方 prompt 规范、6 个故障修法、成本

画面中途换脸、凭空冒字幕?字节官方 prompt 规范、6 个有据可查的修法、720p 每秒 $0.16、最低档 $0.04/s,一把 ofox key 三个档位全走通。

Seedance 2.0 怎么用(2026):官方 prompt 规范、6 个故障修法、成本

Seedance 2.0 吃文本、图片、视频、音频四种输入,吐 4 到 15 秒带同步声音的片子,按输出秒数计费,最低 $0.04/s。字节其实为它发过一份正经的提示词规范:一条公式、四个模型认得的标点符号、一份它希望你别用满的素材预算,还有一串有据可查的故障模式和修法。中文和英文的教程基本只会告诉你「写详细生动的提示词」,上面这些一个字都不提。

这篇就是那份规范,核对时间 2026-08-06,再对上真正在用这个模型的人反馈的情况,以及每种入口下一条片子到底多少钱。

能做什么文本 / 图片 / 视频 / 音频转视频,4 到 15 秒,最高 4K,默认带同步音频
出第一条片要多久Dreamina 上约 2 分钟,走 API 约 5 分钟
需要准备什么一个字节消费端账号,或者一把 API key
最便宜的一条真实片子bytedance/seedance-2.0-mini 480p 4 秒 $0.16
720p 每秒最低价Mini $0.08/s,旗舰 $0.16/s
最常见的翻车人物中途换脸,靠单独一张头部特写解决
数据快照2026-08-06

Seedance 2.0 在哪儿能用?

五个入口,其中只有一个能给你不依赖字节消费端账号、还能自己核算的每秒单价。

入口是什么实际的坎
Dreamina字节的国际版网页应用额度数字不公开;人脸偏多的提示词被过滤得厉害
即梦面向国内的应用要中国手机号和抖音账号,界面只有中文
豆包字节的消费端助手应用同样需要国内侧账号
ComfyUI本地节点图,但节点走 API仍然在向托管 API 计费,没有一步跑在你自己的显卡上
API任何聚合平台或托管服务商模型权重闭源,所以每条路最终都是别人的托管端点

大家最容易搞错的一点:Seedance 2.0 不是开放权重。没有本地安装,没有 GGUF,没有「在 4090 上跑一个」。上面那张表里每一条路的终点都是字节托管的模型,你唯一能选的是谁给你开账单。

想走程序化路线的话,三个档位在 ofox 上是同一个端点:bytedance/seedance-2.0bytedance/seedance-2.0-fastbytedance/seedance-2.0-mini。完整的请求体和轮询写法在 Seedance 2.0 API 接入指南里。

Seedance 2.0 免费吗?

不免费,而且那些张口就报积分数字的文章是编的。

Dreamina 自己的 Seedance 页面只说 Dreamina「可能为符合条件的用户提供免费试用额度」,并且「具体额度和可用性会有变化,登录后查看你当前的选项」。这是厂商明确不公布数字。那些信誓旦旦写着「260 积分、每日刷新」的文章,抄的是另一篇文章,不是字节。

真正能确定的只有这些:

  • 消费端入口会给新账号一些试用额度,具体多少跟账号有关,字节没有任何书面承诺。
  • 任何地方都没有免费的 API 档位,每一条程序化路线都按输出秒数计费。
  • 真实底价是 Mini 480p 的 $0.04/s。一条 4 秒测试片 $0.16,用来判断这个模型能不能干你要的活,这个价格已经跟免费差不多了。

如果你的目的只是花真钱之前先试试,那就用 Mini 出 480p,别去找一个并不存在的免费档。十条测试片加起来不到两美元。

该用应用还是用 API?

只做一条片子就用应用。同一条片子要做第二遍的那一刻,就该换 API。

这些情况用应用:

  • 你在摸模型的边界,想先看看效果再决定投入。
  • 你的流程是一次一条,每条都有人在看结果。
  • 你要的是内置的编辑界面,而不是把文件下载下来。

这些情况用 API:

  • 你在批量出变体,这时候一个每秒单价比一包你算不清的积分划算得多。
  • 你要结果进流水线,用 callback_url 而不是让人盯着进度条。
  • 你想拿同一条提示词 A/B 三个档位,这在 API 上只是改一个字符串。

退出条件:如果你一个月出不到二十条片,也不需要文件进流水线,消费端应用完全够用,这篇剩下的部分可以不看。下面的内容默认你在乎输出质量,在乎到愿意去控制它。

Seedance 2.0 的提示词该怎么写?

写指令,别写描述。 字节的官方提示词指南说得很直白:模型会把你的输入拆成「空间层」(画面里有什么)和「时间层」(怎么随时间变化)。一条读起来像广告文案的提示词,等于什么都没给时间层。

官方公布的进阶公式,顺序是固定的:

精确主体 + 动作细节 + 场景环境 + 光线与色调
+ 运镜 + 视觉风格 + 画质 + 约束

参考类任务另有三个更短的句式,它们之间的区别比看起来重要:

任务类型句式
多模态参考Reference <Subject_N> in <Image_N> to generate...
视频编辑Strictly edit <Video_N>, and modify <Original> to <New>
视频续写Extend <Video_N> forward/backward to generate...

有个坑在文档里只是一条 note,但很容易踩进去。编辑和续写任务里,直接用 <Video_1> 指代那段片子。要是写成 reference <Video_1>,模型会把整个任务判成参考类任务,你拿到的是一条新片,不是改好的片。

同一份指南里还有三条跟大家习惯的写法相反的规则:

  1. 优先小幅、慢速、连续的动作。 指南要求避开冲刺、大跳、剧烈翻滚,推荐的是「慢慢走、轻轻抬手、微微低头」。那些写得最带劲的动作提示词,正是最容易崩的。
  2. 一个镜头只给一种运镜。 同一个镜头里既要推又要拉、既要摇又要移,会明显降低画面稳定性。挑一个。
  3. 别掐精确时间点。 官方描述「0 到 3 秒」这类指令的支持并不稳定,强行限制「可能导致异常的生成结果」。排好镜头顺序就行,别拿秒表卡。

只要片子不止一个节拍,就写分镜。按事件发生顺序标 Shot 1、Shot 2、Shot 3,每一段依次给运镜、主体动作、位置、声音。指南自己举的反面例子是「一个男人紧张地在街上奔跑,画面很有电影感」,这正是那种读起来漂亮、生成起来稀烂的句子。

Seedance 2.0 到底认哪几个符号?

四个,而且不是装饰。 字节按一套标点约定训练了模型,用来把不同类型的声音彼此分开、也跟画面描述分开。台词用大白话写,正是很多人的片子里台词被烤成屏幕文字的原因。

信息类型符号例子
音乐()(fast-paced rock music is playing in the background)
音效<><dog barking can be heard in the distance>
台词{}{Hello, world}
字幕【】【Chapter One: Departure】

附带两个条件。中文和英文以外的台词必须标语种,写成 says in Japanese {こんにちは} 这样。另外指南要求一条片子里台词语种保持一致,别中英混着来,专有名词除外。

参考图到底该放几张?

四到五个。不是十五个。

Seedance 2.0 单次最多接受 9 张图、3 段视频、3 段音频。这个数字出现在每一个关于它的宣传页上,通常还是头条卖点。然后字节自己的指南告诉你别用满:「不建议使用完整的素材上限。素材过多会导致模型难以判断特征优先级」,结果就是风格冲突、主体识别模糊、跑偏你的要求。

官方推荐的配置给每个素材都指派了职能:

  • 1 到 2 张人物图,一张面部特写加一张全身,用来锁住长相
  • 1 张场景图,定环境和风格
  • 1 段运镜参考视频,定镜头语言和节奏
  • 1 段音频,控制情绪和音色

顺序也有讲究。越是需要被精确遵循的素材,越要往提示词前面放。

人物为什么演到一半就换脸了?

因为脸的参考被稀释了,不是因为模型不会画脸。

文档写明的根因是混合参考图:一张图同时承载面部、姿势、服装、细节四种参考。脸在整张图里占比很小,模型给它的特征分配的权重就低,背景反而赢了。片子演到一半,人物就悄悄变成另一个人。

修法分三步:

  1. 单独准备一张只有头的特写。不带肩膀、不带脖子、背景尽量干净,没有表情最好。
  2. 在提示词里给角色命名并绑定素材,写成「把图 1 里穿红裙戴草帽的女人定义为 Subject 1」,之后每一次提到她都用同一个标签。
  3. 把脸的参考放在所有素材的最前面。

还有一条反直觉的:不要用三视图或者多视角人设图。它看起来是给模型一个稳定角色的最自然方式,实际上正是「双胞胎」bug 有据可查的成因——模型把不同角度当成了不同的人,同一帧里出现两个一模一样的角色。

Seedance 为什么会加我根本没要的字幕?

因为它是在带字幕的视频上训练出来的,而且指南承认这件事没法彻底压掉。 字节的原话是「目前无法直接 100% 避免生成字幕」。你能拿到的只有三个降低概率的手段:

  • 在提示词里写明确的约束,「保持无字幕」「避免生成任何文字或字幕」。
  • 参考图先把文字去掉再喂进去,别指望模型会自己忽略。
  • 交付格式允许的话,先出横屏再裁。指南明确说横屏出现无关字幕的概率显著低于竖屏,如果你在做竖版社媒内容,这条相当有用。

最后这条属于只有厂商文档里才会写的细节。它也正好跟「竖屏优先」的工作流默认做法相反。

还有什么会坏,怎么修?

有据可查的故障模式一共六个,每个都有修法。它们全是模型行为,不是用户操作问题,所以没有一个能靠「把提示词写得更长」解决。

#症状修法
1人物中途换脸单独头部特写、显式角色标签、重要素材前置、不用多视角人设图
2冒出你没要的字幕明确约束词、参考素材先去字、出横屏再裁
3画面里出现别家平台的 logo 或水印加「不要生成水印」「不要生成 logo」作为约束词
4二次元风格漂成实拍显式写出风格词,或者先把参考图转成目标风格再生成
5续写拼接处跳帧前一段末尾去掉 6 帧、后一段开头去掉 1 帧,每个接点都做
6同一帧里出现两个同样的人每个角色绑各自的图、加禁止重复角色的约束、用单人参考图

第 5 条最值得背下来,因为它给的是精确数字而不是建议。每个接点 6 帧和 1 帧,用什么剪辑软件都一样。另外反复续写会累积画质劣化,最先花掉的是人脸区域的色块,所以指南建议先把源片转成纯白 3D 模型片再续,并且控制续写次数。

一条 Seedance 2.0 片子多少钱?

按输出秒数计费,单价随分辨率翻。 目录页上那些「$0.04 起」「$0.07 起」是 480p 的地板价,可几乎没人真拿 480p 交付。下面是核对于 2026-08-06 的完整价目表

分辨率MiniFast旗舰
480p$0.04/s$0.06/s$0.07/s
720p$0.08/s$0.13/s$0.16/s
1080p不支持不支持$0.34/s
4K不支持不支持$1.37/s

视频转视频每一行都略贵:Mini 720p 是 $0.10/s 对文生视频的 $0.08/s,旗舰 1080p 是 $0.45/s 对 $0.34/s。

一条 5 秒片子,也就是大多数人真正会生成的长度:

档位与分辨率5 秒
Mini,720p$0.40
Fast,720p$0.65
旗舰,720p$0.80
旗舰,1080p$1.70
旗舰,4K$6.85

托管商之间的价差比档位之间还大。 7 月有个做短剧的人在 r/Seedance_AI 贴了一张横向价目表(查看时间 2026-08-06),列的 720p 单价是:BytePlus $0.152/s、SeeGen $0.16/s、Replicate $0.18/s、AtlasCloud $0.194/s、PiAPI $0.20/s、fal $0.302/s。fal 今天公布的价格是 720p 带音频 $0.3034/s、1080p $0.682/s,那张表到现在还站得住。同一个模型、同一份权重,看你从谁那儿买,差价接近 2 倍。

一个每月出 200 条 5 秒 720p 片子的小团队,$0.16/s 是每月 $160,按 fal 当前的 $0.3034/s 则是 $303。选哪个档位是另一个问题,在 Mini、Fast 与旗舰的档位对比里;如果你连要不要选 Seedance 都还没定,那先看 Seedance 与 Wan 的对比

几乎每个服务商讨论帖里都会出现的一条限制:人物参考是能用的,但受版权保护的角色和公众人物在基本所有路由上都会被过滤。用自己的素材和原创角色来搭。

两个值得抄的社区工作流

这两个都不在官方文档里,都来自晒结果的人,而且都能映射到普通的 API 参数上。

首尾帧补间。 与其凭空生成一条片,不如先做出第一帧和最后一帧,把两张都交给模型,让它补中间。流传的那套提示词写法固定两个部分不动,「Show what happens in between」和「5 different camera angles」,只改中间那句描述动作的话。然后把这一段的最后一帧当作下一段的第一帧,一个镜头一个镜头往前推故事。落到 API 上就是 frame_images 传首帧和尾帧。它拿一次成片的省事换控制节奏的能力,这笔交易通常划算。

路径控制。 在一张静态图上手绘出相机路线,用显眼的颜色,然后把这张标注过的图作为参考喂进去,告诉模型严格沿着画出来的路径走并从成片里抹掉标记。有人晒的效果好到值得知道这个技巧,但要带上那条帖子里赞数最高的回复给的实话:生成出来的飞行路径跟画的那条肉眼可见地对不上。把它当成很强的引导,别当成关键帧动画。

怎么用代码调 Seedance 2.0?

一次 POST,然后轮询。 端点是异步的,不流式,也不阻塞。

import os, time, requests

BASE = "https://api.ofox.ai/v1"
H = {"Authorization": f"Bearer {os.environ['OFOX_API_KEY']}"}

job = requests.post(f"{BASE}/videos", headers=H, json={
    "model": "bytedance/seedance-2.0-mini",
    "prompt": (
        "Shot 1: fixed medium shot, a woman in a grey coat walks slowly to a "
        "rain-streaked window and stops. Shot 2: slow push-in to a close-up, "
        "she gently lowers her head. (soft piano) <rain on glass> "
        "Cinematic texture, natural colours, soft lighting. "
        "Keep it subtitle-free, do not generate a watermark."
    ),
    "duration": 5,
    "resolution": "720p",
    "aspect_ratio": "16:9",
}).json()

while True:
    r = requests.get(f"{BASE}/videos/{job['id']}", headers=H).json()
    if r["status"] in ("completed", "failed", "cancelled", "expired"):
        break
    time.sleep(2)

print(r["status"], r.get("usage", {}).get("video_cost"))

bytedance/seedance-2.0-mini 换成 -fast 或者旗舰,就是全部的换档动作。有地方接 webhook 的话,传 callback_url 代替轮询。包含 frame_imagesinput_references 的完整字段说明在接入指南里;至于该挑哪个视频模型这个更大的问题,在按使用场景选视频 API 那篇。

Seedance 2.5 呢?

它 2026-07-31 发布,截至本文写作时,它的 BytePlus API 定的开放日期是 2026-08-07。 消费端先在即梦和豆包上铺开,这是字节一贯的顺序。

Seedance 2.0Seedance 2.5
单次时长15 秒30 秒
参考素材上限9 图、3 视频、3 音频30 图、10 视频、10 音频
分辨率上限4K4K
2026-08-06 的 API 状态各服务商已上线2026-08-07 开放

如果你需要超过 15 秒的连续片段,值得等,因为大部分肉眼可见的接缝都出在拼接上。除此之外不值得等:Seedance 2.0 同期已经升到 4K,而且这篇里的一切,提示词公式、符号、素材预算、六个修法,都是针对 2.0 系列写的,往上也照样成立。

那份发布公告里更有价值的部分,是字节 Seed 团队愿意承认自家新模型的哪些不足。他们以团队名义、没有任何个人署名,在 Seedance 2.5 的发布文结尾写道:

「在复杂运动的物理合理性、以及多主体交互场景的稳定性上,仍有提升空间。」

把这句话和提示词指南放在一起看,所有建议都对得上。复杂运动不可靠,所以指南才要求慢速、小幅、连续的动作。多主体交互不稳定,所以单人参考图才比人设图管用,「双胞胎」bug 才会存在。厂商在卖升级的同一周告诉你模型薄在哪儿。顺着这个安排镜头,别顶着来。另外,状态请以 ByteDance Seed 官方页为准,别信任何一篇博客里写的日期,包括这一篇。

常见问题

Seedance 2.0 生成一条片子要多久? 从不到一分钟到几分钟不等,取决于档位、分辨率、时长和当时的托管方负载。接口是异步的就是这个原因:提交后拿到任务 id,每一到两秒轮询一次,或者传 callback_url 让结果自己送上门。

Seedance 2.0 单次最长能生成多长的视频? 单次 15 秒,最短 4 秒。更长的片子靠续写或者分段拼接。2026-07-31 发布的 Seedance 2.5 把单次上限抬到 30 秒。

Seedance 2.0 能离线跑或者自部署吗? 不能。权重是闭源的,没有本地安装包也没有 GGUF。ComfyUI 这类本地工具是通过 API 节点调它,生成仍然发生在托管端点上,仍然按秒计费。

Seedance 2.0 能出声音吗? 能,原生支持,三个档位默认都开。控制方式是模型认得的那几个符号:圆括号写音乐,尖括号写音效,花括号写台词。

Seedance 2.0 支持视频转视频吗? 三个档位都支持,而且比文生视频贵:旗舰版 720p 是 $0.20/s 对 $0.16/s,1080p 是 $0.45/s 对 $0.34/s。续写和编辑都算视频转视频。

我的 Seedance 2.0 提示词为什么被拒了? 多数拒绝来自内容过滤器读到了提示词文本或者某个参考素材。受版权保护的角色和能认出来的公众人物是常见触发点,不同路由的严格程度还不一样。围绕自己的原创素材重搭这个镜头是最稳的解法。

Seedance 2.0 支持哪些画幅? 16:9、9:16、1:1 和自适应。字节明确提到竖屏出片冒无关字幕的概率明显更高,所以先出 16:9 再裁竖版,有时反而是拿到干净竖屏片的省事路径。

本次核实的来源

常见问题

Seedance 2.0 生成一条片子要多久?
从不到一分钟到几分钟不等,取决于档位、分辨率、时长和当时的托管方负载。接口是异步的就是这个原因:提交后拿到任务 id,每一到两秒轮询一次,或者传 callback_url 让结果自己送上门。
Seedance 2.0 单次最长能生成多长的视频?
单次 15 秒,最短 4 秒。更长的片子靠续写或者分段拼接。2026-07-31 发布的 Seedance 2.5 把单次上限抬到 30 秒。
Seedance 2.0 能离线跑或者自部署吗?
不能。权重是闭源的,没有本地安装包也没有 GGUF。ComfyUI 这类本地工具是通过 API 节点调它,生成仍然发生在托管端点上,仍然按秒计费。
Seedance 2.0 能出声音吗?
能,原生支持,三个档位默认都开。控制方式是模型认得的那几个符号:圆括号写音乐,尖括号写音效,花括号写台词。
Seedance 2.0 支持视频转视频吗?
三个档位都支持,而且比文生视频贵:旗舰版 720p 是 $0.20/s 对 $0.16/s,1080p 是 $0.45/s 对 $0.34/s。续写和编辑都算视频转视频。
我的 Seedance 2.0 提示词为什么被拒了?
多数拒绝来自内容过滤器读到了提示词文本或者某个参考素材。受版权保护的角色和能认出来的公众人物是常见触发点,不同路由的严格程度还不一样。围绕自己的原创素材重搭这个镜头是最稳的解法。
Seedance 2.0 支持哪些画幅?
16:9、9:16、1:1 和自适应。字节明确提到竖屏出片冒无关字幕的概率明显更高,所以先出 16:9 再裁竖版,有时反而是拿到干净竖屏片的省事路径。