全部文章
reference2026/09/11

Seedance 2.5 是什么 | 规格、限制与真实价格

Seedance 2.5 是什么 | 规格、限制与真实价格

Seedance 2.5 是什么:字节跳动 2026 年 7 月 31 日发布的 30 秒视频模型。完整字段表、参考素材额度、每秒单价与硬性限制。

Seedance 2.5 是字节跳动视频生成模型的当前版本,于 2026 年 7 月 31 日发布。在实际层面问 Seedance 2.5 是什么,其实是在问三件事:它能做多长的片段、它接受什么作为输入、以及一秒成片要多少钱。答案是 4 到 30 秒、一套很宽的参考素材,以及一个跨分辨率相差四倍的费率。

Seedance 2.5 是什么,以及它变了什么

相对 Seedance 2.0 的三处差异保留到了发布版本里。

片段长度翻了一倍。一次 Seedance 2.5 生成最长 30 秒,而 2.0 停在 15 秒。多个镜头能放进这个窗口,所以一次请求的行为更像一个短场景,而不是单一长镜头。

参考输入显著变宽。一次请求同时接受最多 30 张参考图片、10 段参考片段和 10 条音频轨。

编辑和延长到位了。给定一段源片,模型可以改动那段素材或者把它往后接,而不是只能在旁边另外生成一个新的。

原生音频、多镜头场景和真实的运动从 2.0 原样延续,没有变化。

规格

字段可接受的值
时长4 到 30 秒,默认 5
分辨率480p、720p、1080p,默认 720p
宽高比16:9、9:16、1:1、4:3、3:4、21:9、自适应(默认)
提示词最长 20,000 字符
参考图片最多 30 张
参考视频最多 10 段,每段 2 到 30 秒,合计 30 秒
参考音频最多 10 条
音频生成默认开启
内容过滤默认开启

提示词在文生视频里是必填的,一旦附上参考素材就变成可选。媒体以公开可访问的 HTTP(S) URL 提供;data URI 被拒绝。把时长设为 -1 会让模型自己决定长度,而预扣按 30 秒上限来取。

声音和画面一起出来

音频与视频在同一趟里生成,覆盖语音、音效和音乐,以单声道轨交付。没有单独的配音步骤,也不需要事后再跑一遍口型对齐。

对白写在提示词里的引号中。引号之间的内容就是会被说出来的内容,所以那句话必须短到能在请求的时长里说完。把音频生成关掉会得到一段无声片段。

一段 Seedance 2.5 片段要多少钱

按成片秒数计费,费率由分辨率决定,也由请求是否携带了参考片段决定。

分辨率仅生成带参考视频
480p$0.118589$0.071153
720p$0.266824$0.160094
1080p$0.461856$0.275904

从零生成十秒 1080p 约为 $4.62。1080p 跑满 30 秒约为 $13.86。同样 30 秒在 480p 上约为 $3.56,这正是草稿阶段该留在低一档的原因。

参考图片和音频轨是免费的。参考视频按它自己的长度在输出之外另行计费,而且包含参考视频的请求,计费永远不低于输出时长的三分之五,向上取整。一段六秒的参考片段配十秒的 1080p 输出,计费 17 秒而不是 16 秒,合约 $4.69。

生成平均两到五分钟,任务是异步的,轮询结果免费,失败任务全额退款。

限制

分辨率停在 1080p。发布前的材料描述过一个 4K 档,而它从未兑现,所以任何为这个模型列出 4K 的规格表,引用的都是一份发布预告。没有任何平台、套餐或参数能产出它。

三十秒是单次生成的硬上限。更长的成片是串起来的片段,这一点对这个级别的每一个模型都成立。

指名道姓的真实名人、第三方版权内容和违法内容在模型内部被拦住,没有任何平台设置能拿掉它们。content_filter 字段默认为 true;把它设成 false 会选中一条限制更宽松的通道,审核依然在位。拒绝返回错误码 80006,它不会说是哪一环触发的。

常见问题

Seedance 2.5 是什么时候发布的? 字节跳动在 2026 年 7 月 31 日发布了它。通过托管 API 的可用性随后跟进,所以它在哪一天变得可调用,取决于具体平台。

Seedance 2.5 的视频能有多长? 单次生成四到三十秒,默认五秒。好几个镜头可以放在这个窗口里。

Seedance 2.5 支持 4K 吗? 不支持。分辨率选项是 480p、720p 和 1080p。4K 这个数字来自该模型发布前的报道,从未交付。

一段 Seedance 2.5 视频要多少钱? 在 1080p 上,每秒输出约 $0.46,所以十秒大约 $4.62。在 480p 上,同样十秒约 $1.19。参考视频会把它自己的秒数加进账单,从而改变这笔计算。

一句话总结

Seedance 2.5 是什么:字节跳动 2026 年 7 月 31 日的视频模型,在一趟里生成 4 到 30 秒带同步单声道音频的视频,输入是一段最长 20,000 字符的提示词,外加最多 30 张参考图片、10 段片段和 10 条音频轨。它按秒计费,最高到 1080p、任何地方都没有 4K,对每一次失败全额退款,并且无论内容过滤怎么设,审核都保持开启。