Seedance 2.5:我们负担得起的最后一个角色 AI 模型吗?

2026年8月19日1 min read
Glassworker weighs two furnaces inside a converted hydroelectric dam

走进一家摄影器材租赁店,在新一代旗舰机身上市一年后,你会在货架上看到一个古老的技术规律。曾经的顶级相机依然能够拍出漂亮的影像,但租赁价格已经下降。制造商收回了部分研发成本,竞争对手已经追赶上来,市场也开始把同一台机器视为上一代产品。创意技术会贬值。

AI 视频似乎打破了这一规律,因为 AI 模型并不只是一台相机。它是一台相机、一座渲染农场和一间电影实验室,被打包成按量计费的服务。客户从未真正购买这件工具,而是为每一次计算付费。每一帧生成画面都必须从噪声中被制造出来,无论模型是昨天发布的,还是去年发布的。当新相机到来时,旧相机仍然留在货架上;当新视频模型到来时,旧模型每次接到生成镜头的请求,仍然必须执行数十亿次计算。

因此,字节跳动的 Seedance 2.5 的到来,不只是越来越拥挤的模型排行榜上又多了一个名字。它提出了一个令人不安的经济学问题:如果每一次实质性改进都需要更多训练算力、更大的数据集和更昂贵的推理,我们最终会不会得到一个技术上令人惊叹、但在经济上已经走到尽头的模型?Seedance 2.5 是否已经接近这样一个临界点:再往前一步,创作者——甚至是构建这些系统的公司——都再也负担不起?

简短答案或许是否定的。更有价值的答案是,这个问题暴露了 AI 经济学中的一道真实裂缝:前沿模型的创造成本正在急剧上升,而就在同一时间,昨天的能力却正变得越来越便宜。

玻璃工人在生产开始时走进水坝炉窑大厅

Seedance 2.5 究竟为角色 AI 增加了什么

字节跳动近期的开发速度,有助于解释为什么这种担忧听起来合理。Seedance 2.0 于 2026 年 2 月正式发布。它可以接受文本、图像、视频和音频作为参考,生成音画同步的内容,并输出 15 秒的多镜头视频。根据字节跳动的发布材料,用户在一次请求中最多可以提供九张图片、三个视频片段和三个音频片段。

仅仅几个月后,Seedance 2.5 就随之推出。它将单次生成的最长时长翻倍至 30 秒,并把参考素材上限扩展到 30 张图片、10 个视频片段和 10 个音频片段。它支持多轮延展、时间戳级别编辑、改进后的绿幕处理、更可控的摄影机视角,以及更强的场景切换连续性。字节跳动对它的定位,不只是更好的片段生成器,而是一个能够理解整套创意素材,并把一个想法进一步推进到制作阶段的系统。

在这一语境下,角色 AI 并不只是一个对话界面。它指的是:当角色在一个镜头内或多个场景之间移动时,模型能否保持角色身份、表演、服装和空间连续性。

对于电影制作人来说,这一区别很重要。更长的片段并不自动意味着更好的镜头;模型生成的序列越多,也可能制造越多错误。然而,从提示词和起始帧,走向参考素材、调度、剪辑指令和时间控制,确实代表了进步。它让模型更接近导演已经在使用的工作方式:通过不断累积的决策工作,而不是依赖一句文字描述。

这也让计算变得更加繁重。视频本来就同时包含空间复杂度与时间维度。时长越长,帧数越多;分辨率越高,每一帧包含的信息越多;同步声音会增加另一条生成流;而参考视频必须先被解析,才能生成输出。在当前的视频扩散架构中,一段 5 秒的 720p 视频可能展开为超过 100,000 个内部 token。研究高效视频扩散的研究人员指出,负责建立这些 token 之间关联的注意力机制,是扩展规模时的主要瓶颈。

从这个角度看,对成本上限的担忧似乎很理性。每次模型发布都承诺更多能力:更长的镜头、更高的分辨率、更强的物理规律、更原生的声音、更多参考素材、更好的编辑能力,以及更少的连续性错误。每项承诺看起来都在给机器增加新的负担。

人工智能的两条成本曲线

第一条曲线正是大多数警报的来源。前沿 AI 开发正变得极其依赖资本。Epoch AI 的分析估计,自 2020 年以来,前沿语言模型的训练算力大约以每年 5 倍的速度增长,而训练成本则以每年约 3.5 倍的速度上升。电力需求每年翻倍。如今,一个拥有 1 吉瓦 IT 容量的典型 AI 数据中心,前期资本投入约为 380 亿美元。

视频模型开发商披露的信息远不足以进行同等计算,因此不能轻率地把语言模型的数据当成 Seedance 的成本。不过,这些数据确实展示了基础模型发展的方向。能力最强的系统越来越需要只有少数公司或国家支持的组织才能组建的基础设施。五家超大规模云服务商已经控制了全球超过三分之二的 AI 算力。

如果只有这一条曲线,结论会相当悲观。前沿模型将变得越来越昂贵;API 提供商要么把成本转嫁给客户,要么以低于完整成本的价格出售生成服务;独立实验室会逐渐消失;创意创作的使用权则取决于字节跳动、谷歌、OpenAI 以及少数其他公司是否愿意补贴它。

但第二条曲线正在朝相反方向移动:获得固定水平 AI 能力的成本正在极快下降。斯坦福大学的《2025 年 AI 指数报告》发现,在 2022 年 11 月至 2024 年 10 月期间,达到 GPT-3.5 水平系统的推理成本下降了 280 多倍。硬件成本每年下降约 30%,能源效率每年提升约 40%。麻省理工学院近期的研究估计,达到固定性能水平的价格正以每年 5 至 10 倍的速度下降,其中算法改进贡献了大约每年 3 倍的效率提升。

这就是为什么更新的模型可以同时拥有更强能力和更低价格。GPT-4o 发布时,价格是 GPT-4 Turbo 的一半,速度却是后者的两倍。谷歌将 Veo 3的价格从最初的每秒 0.75 美元降至 0.40 美元,同时推出了每秒 0.15 美元的 Veo 3 Fast。新硬件、量化、蒸馏、稀疏计算、缓存、更好的批处理,以及改进后的服务软件,都在持续改变每一美元算力能够提取出的有效工作量。

旧模型的计算并不会凭空消失,但它也不会被冻结在诞生它的数据中心里。模型权重可以在更新的芯片上运行,也可以通过更好的软件提供服务。更常见的情况是,提供商不会无限期降低旧产品的价格,而是将其退役,或用一个更小、更快、能够以更高效率提供相近结果的模型替代它。昨天的智能,会变成明天平价模型中的一项功能。

玻璃工人从炉窑中拉出发光的连续玻璃人像

AI 视频的一秒究竟要花多少钱

Seedance 的定价本身就揭示了为什么简单的代际比较会产生误导。在 Runway 的 API 上,多个第三方模型共用一个计费系统,Seedance 2.0 目前生成 720p 视频的价格是每秒 0.36 美元。相同分辨率下,Seedance 2.5 的价格为每秒 0.30 美元,不过输入和参考视频会产生额外费用。在 1080p 下,关系却反过来:Seedance 2.0 每秒 0.40 美元,Seedance 2.5 每秒 0.68 美元。完整价格表也显示,其他模型的标准、快速和轻量版本之间存在类似的巨大差异。

BytePlus 让这种变化更加直观。其 500 万 token 的 Seedance 2.5 套餐,宣传可生成约 120 至 500 秒的 480p 视频。同样的 token 配额,根据生成模式和输入不同,产出范围相差超过四倍。若不说明分辨率、时长、参考素材、服务商和工作流程,就无法诚实地回答“Seedance 2.5 每秒成本是多少?”

不过,对于实际工作的创意人员来说,这个计算仍然不完整。真正有用的指标不是每生成一秒的成本,而是每获得一秒可接受画面的成本

假设旧模型每秒成本为 0.30 美元,但需要尝试 8 次,才能生成一段在解剖结构、表演和连续性方面都可接受的镜头。新模型每秒 0.60 美元,却只需要 3 次尝试。还没计算修复错误、重建参考素材,或向客户解释演员的外套为何出于艺术原因改变颜色之前,所谓更昂贵的模型其实已经胜出了。

AI 视频定价很少包含失败率,但失败正是制作预算消耗最大的一部分。正如 Ciaro Pro 的AI 电影预算指南所指出的,可见的生成费用只是制作成本的一部分;规划、连续性、迭代、剪辑工作和后期制作,才决定这些生成出来的秒数能否最终成为一部电影。

一个能够遵循分镜脚本、尊重参考表演,并在摄影机移动时保持场景一致的模型,即使标价是两倍,也可能在经济上更优。可靠的角色 AI 能够减少废弃镜头和连续性修复,因此可以证明更高的生成价格是合理的。相反,当模型最出色的能力与镜头无关时,一个令人惊叹的模型也可能性价比很低。一个固定机位的插入镜头,并不需要行业中最昂贵的物理和对白推理能力。

这改变了制作软件的角色。真正有价值的层,可能不是永远绑定当前排行榜领先的模型,而是一个AI 电影制作系统:它能够让剧本、分镜、角色、参考素材、版本和剪辑保持关联,同时针对不同镜头使用不同的生成引擎。随着模型越来越专业化、价格曲线彼此分化,模型路由将成为创意和财务决策。

这种路由也需要清晰的类别意识:poly ai 和 polybuzz ai 面向对话使用场景,magicschool ai 专注教育,humanizers ai、humanize ai 和 ai humanizer 关注文本转换,而 google ai studio 和 ai mode 则支持更广泛的创作或搜索工作流——它们都不是镜头级视频经济学的同类产品。

成本上限可能改变行业,但不会让进步停止

这些因素并没有消除前沿成本问题,而是改变了它最可能带来的后果。我们不太可能遇到一个最终版视频模型,更可能看到的是:前沿开发集中在那些能够同时通过多项业务为研发投入提供正当性的公司手中。

字节跳动不需要让 Seedance 像一家独立相机公司那样运作。该模型可以支持消费者创作产品、云服务、广告工具和内部媒体工作流。字节跳动还表示,Seedance 2.5 正被应用于合成训练数据、工业模拟、机器人和自动驾驶场景。因此,同一项研究投入可以在多个市场创造价值,而这些价值并不是独立电影制作人的订阅收入单独能够支撑的。

谷歌也可以在云基础设施、广告、YouTube 和 Workspace 之间进行类似的计算。Meta 则可以通过广告业务为模型提供资金。没有这些周边经济基础的专业模型公司,面临的问题会更加棘手。即使付费 API 请求的推理服务拥有健康利润率,收回数十亿美元的研究、数据获取和基础设施成本仍然是另一回事。

因此,真正的危险并不是视频模型突然停止进步,而是前沿能力变得与少数企业生态系统不可分割。创意使用权可能依然负担得起,但底层技术的控制权却会越来越集中。价格可能很低,是因为效率提高了,是因为平台正在获取客户,是因为另一个业务部门从模型中受益,或者是因为服务商正在进行价格战。这些情况在 API 账单上看起来完全相同,却会造成截然不同的长期依赖关系。

我们没有理由宣布某个最终模型,还有一个技术层面的原因。昂贵的规模化压力正在催生更高效的架构。视频稀疏注意力研究人员报告称,在没有相应增加扩散损失的情况下,他们将训练计算量降低了 2.53 倍。在一个拥有 140 亿参数的视频模型上,他们的方法将生成时间从 1,274 秒缩短至 576 秒。将稀疏注意力与蒸馏结合后,他们报告称,在一个更小的模型上实现了 50.9 倍加速,同时保持了质量。

这些数据来自研究系统,并不能证明下一代商业模型会便宜 50 倍。不过,它们仍然说明,进步并不局限于购买更多 GPU。模型也可以因为开发者发现哪些计算其实没有必要而得到改进。

那么,Seedance 2.5 是我们负担得起的最后一个模型吗?

几乎可以肯定不是。Seedance 2.5 甚至可能在更强大的后继模型占据高端档位时,变得更加便宜。这一直是语言、图像和视频生成领域的主流模式:前沿能力不断上移,而此前的能力则扩散到更快、更便宜的系统中。

真正严峻的限制在别处。暴力扩大规模不能永远成为改进的唯一可靠路径。如果每一次连贯性或物理准确性的提升,都要求几何级增长的训练规模,以及每生成一帧都增加计算量,那么有能力参与竞争的组织数量将持续减少。下一轮决定性的突破,必须改善计算与可用创意控制之间的关系,而不仅仅是提高基准测试分数。

对于在视频中评估角色 AI 的电影制作人来说,这意味着一种不那么耀眼、却更加持久的进步评估方式。要问的是,有多少生成出来的秒数能够留在剪辑成片中。要问参考素材是否保持稳定,模型能否只修改某一个瞬间而不破坏其余部分,以及更便宜的引擎是否足以完成这个镜头。最终胜出的系统,不一定是在单独片段中生成最惊人画面的系统,而是从创意意图到完成序列之间浪费最少资金的系统。

Seedance 2.5 并不是 AI 视频的终点。不过,它可能标志着经济因素已经无法再被忽视的时刻。生成式电影制作的未来,不仅取决于模型能够想象什么,也取决于这种想象能否被高效地引导、重复并付费实现。

完成的玻璃序列延伸穿过寂静的水坝大厅

Your vision. Every frame.

Start free. Scale when the production is ready.

Recommended articles

Your vision. Every frame.

Start free. Scale when the production is ready.