首页
产品服务
模型广场
Token工厂
算力市场算力商情行业资讯
注册

中金:Seedance2.0对互联网有何影响?

发布日期:2026-03-23 来源:百家号作者:百家号

Seedance 2.0:AI视频生成“DeepSeek时刻”的开启

26年2月,字节跳动发布了AI视频模型Seedance2.0,其模型在全模态输入/输出,镜头&叙事一致性等维度展现了系统性领先能力,短期内成为全球现象级产品,如即梦DAU从2月2日的328万人持续提升至2月23日的572万人。

焦点一:“世界模型”或是视频模型下一阶段演进方向

相比于人类智能,当下大模型仍欠缺“世界模型”这一关键的基础能力。而多模态生成模型有成为世界模型的潜力。图像模型Nano Banana Pro展现了智能化的显著飞跃,我们认为智能化亦是视频模型的下一阶段演化方向,Seedance2.0在智能化上取得突破,加速了视频模型“世界模型”时代到来。

焦点二:当前视频生成赛道矛盾首先是市场空间,其次是竞争格局

视频生成模型仍处于发展初期,当前制约因素是市场空间(根据Fortune Business Insights等机构估算,2025年仅10-20亿美元)。随着模型能力持续进步,我们认为基础创意工具情形市场空间有望达数百亿美元。从竞争格局维度,我们认为模型能力短期难以成为壁垒,且现有用户往往同时使用多个模型,市场难以一家独大,且市场定位有望成为不同参与者的差异化关键。

焦点三:Seedance2.0等AIGC工具对互联网格局如何影响?

我们认为Agent崛起不会显著影响主流线上内容平台格局,两者存在场景差异,前者属于“主动搜索”而后者是“被动消费”,且Agent若能显著提升人类工作效率,娱乐时间会增加。此外,视频模型等AIGC工具将降低内容制作门槛,对于供过于求赛道如短视频,行业格局或稳定;而对于长视频、音乐等供不应求赛道有望创造增量需求,甚至诞生新平台。

风险

系统性领先的量化验证

Seedance 2.0与此前模型的核心差异,在于其从底层架构上改变了视频生成的模态处理逻辑,主要体现为以下三项技术创新:

  1. 双分支并行架构:Seedance 2.0采用了双分支扩散Transformer架构(Dual-Branch Diffusion Transformer),在生成链路中实现了视觉与听觉信息流的并行处理。与传统“视频生成后配乐”的流水线式处理不同,这一并行机制实现了在帧级精度上的声画同步,从技术路径上解决了“音画错位”及“口型匹配”等长期存在的工程难题。

与领先的AI视频生成模型对比,Seedance 2.0凭借强大的中文理解能力、多模态的文件输入功能以及对视频叙事连贯性的深度优化,在多维度叙事、创意生成方面形成独特优势。相较而言,Kling 3.0在运动控制和复杂交互方面表现优异;Sora 2则保持着物理真实感的领先地位,发挥物理模拟、细节呈现以及长镜头优势;Veo 3.1生成的视频更具电影级质感,色彩、景深与光影的极致呈现使其单帧画面优势更为突出。

AI视频生成模型对比

图表:AI视频生成模型对比(基于截至2026.3我们和市场测评)

当前,豆包作为免费的流量入口,通过提供10个固定视频额度,承担用户教育及引流职能;小云雀则结合免费体验与轻度付费,每日赠送清零积分以培养轻度用户习惯,并以首月半价的39元订阅套餐促进转化;即梦AI则定位为核心变现渠道,依托连续包月6折、包年5折的优惠策略,推出79元至649元的多档位订阅套餐,以满足从进阶到专业级创作者的高频需求。

普遍采取“个人订阅+企业API”的双轨制商业化策略

国内厂商围绕订阅制、API商用构建多元变现体系。Seedance将免费版作为流量漏斗,设置多层付费体系;可灵则结合订阅制与一次性积分包,将套餐设置得更精细化,覆盖从轻度体验到重度生产的全场景。

OpenAI和Google旗下的模型Sora 2与Veo 3.1绑定其付费会员体系,用户在额度用尽后可购买积分继续使用,使其顶级视频生成能力成为现有订阅体系(ChatGPT Pro、Google AI Ultra等)的增值服务。

对于企业端,根据Seedance 2.0目前公布的定价,整体调用价格低于Sora 2和Veo 3.1,也略低于国内快手Kling 3.0模型调用价格,形成了具备竞争力的“高质中价”优势,我们认为或有希望快速切入B端市场。

主流音视频大模型单价测算对比

图表:主流音视频大模型单价测算对比(2026.3)

注:按照汇率1人民币≈0.145美元换算

资料来源:即梦AI官网,Kling官网,OpenAI官网,Google官网,中金公司研究部

Sogodance请速听加试公,在创新与保护间寻找平衡

Seedance遭遇版权诉讼,在创新与保护间寻找平衡

据The Information,截至3月15日,字节跳动已暂停其最新AI视频生成模型Seedance 2.0的全球发布计划(该模型原计划于3月中旬面向全球用户推出),原因在于与好莱坞多家制片厂及流媒体平台产生版权纠纷。迪士尼上月向字节跳动发送停止侵权函,指控其未经许可使用迪士尼旗下角色训练并驱动Seedance 2.0模型,包括《星球大战》《漫威》等系列IP。据洛杉矶时报派拉蒙影业、华纳兄弟、Netflix也采取了类似法律行动。目前字节跳动法务团队正排查潜在法律问题,并暂停支持用户上传真人图片或视频作为主体参考,以防止进一步侵权。

如何看待Seedance未来,以及对行业影响?

《智能简史》(Max Bennett,2024.10)中将人类智能进化历史分为五步:第一层是对称动物的导航趋利避害,其能够基于相关性记忆将事物分为好坏。第二层是脊椎动物的基于化合物分泌的加强学习,其能够基于预测奖励情况,和外界不断互动进行记忆和学习。第三层是哺乳动物的仿真世界模型,基于模型的仿真系统构成了系统2,而重复动作则内化为习惯成为系统1。第四层是灵长类动物的意识,推己及人让动物能够基于动机,观察他人学习,仿真自己未来需求等。第五层是人类的语言,其能够思想他人的思想,让知识可传递可积累,人类发展从此进入震荡上升节奏。

类比人类智能发展历程,结合近期大模型的发展浪潮,我们认为世界模型或成为接下来模型智能取得突破的重要底层变革点:如果我们把大语言模型预训练阶段看成以人类语言为媒介,基于transformer的高效压缩机制的关联性记忆;而后训练推理环节则结合了加强学习机制。然而,当下预训练需要海量用户数据,同时模型泛化能力仍然有局限性。而加强学习则需要清晰的目标函数,所以在编程、数学等领域表现较出色。相反的,在缺乏足够数据,没有清晰目标函数领域,当下AI机制或存在短板。如何让AI类似人类可以仅通过数十小时的训练学会开车等复杂技能?如果AI能够具备世界模型,或许得以解决这个问题。

世界模型是什么?哺乳动物具备大脑新皮层,新皮层允许其通过仿真来学习,而世界模型则是其仿真的底层模型,其本质上哺乳动物通过感官和基因认识外界世界的高度浓缩的智能。例如,人类如果身处自己家中,即使在黑夜看不清房间布置,依然可以对房间布置基于记忆有感知。对于人类,这种智能主要呈现两种形态,系统2是逻辑深度思考模型,系统1则是高度重复行为压缩成为习惯和直觉。世界模型允许哺乳动物通过思考仿真学习,且底层世界模型在学习新技能时可以复用(比如对重力感知),由此哺乳动物仅需少数试错就可以学习新技能,类似案例还包括人类学习开车。需要注意的是,新皮层具有通用性,感知世界和仿真世界所用的大脑区域是相同的,底层机制也是类似的。

准确仿真物理世界,需要以世界模型为前提。在生成现实世界维度上,图像、视频、3D等多模态生成模型的本质是对世界的仿真,由此,具备高度一致性、且能精准遵循物理规律的多模态生成模型,其本身或许就是世界模型。反过来,类似的世界模型也可以用来赋能感知世界和预测世界,典型的例子是提升机器人的智能水平。由此,就宏观意义而言,多模态生成模型或将不只是重构创意领域,更有望成为接下来综合大模型智能提升的关键基础设施,进而赋能机器人、自动驾驶等领域的进展。

冯哲

ChatGPT在22年年底走红,推动了Transformer和GPT模式在陈语言模型之外赛道的试验,其中就包括视频赛道。Google VideoPoet(2023)就是基于Auto Regression自回归路线(以下简称AR路线)的视频生成。与扩散模型不同,它将视频、音频、图像都转为“词语”(Token),以类似文本预测的方式生成视频序列,与当前主流大语言模型架构一致,理论上具备更强的可扩展性,在长视频内容一致性上表现良好。然而,AR路线也存在复合累计误差,易造成物体变形等严重问题,在生成画面质量方面不及后续的DiT等路线。

VideoPoet生成的视频案例

图表:VideoPoet生成的视频案例

2024年年初OpenAI发布了基于DiT(Diffusion Transformer)架构的Sora视频生成模型,并凭借高度逼真的视频效果迅速出圈。据OpenAI介绍,Sora首先将视频数据压缩为“时空块”(Patches,类似大语言模型的Tokens),此后“时空块”被输入DiT模块进行处理,其中Diffusion扩散模块执行类似图像Diffusion模型的能力,利用先加入噪音后去除噪音方法,奠定生成基础,而Transformer则核心保障生成视频帧内容一致性、物理正确性等效果。以雕塑类比,Diffusion更像雕塑的流程手册,而Transformer则是雕塑家的技巧和眼光。Diffusion和Transformer高效协同,产生了良好的化学反应。此外,DiT架构具备良好的可扩展性(Scalability),更高质量、更大规模的训练数据可持续提升模型效果。目前,DiT仍构成了Sora,Veo,可灵等主流视频生成模型的核心底层模型架构。

基干DiT架构的Sora视频生成模型

图表:基干DiT(Diffusion Transformer)架构的Sora视频生成模型

Seedance 2.0加速了视频生成Nano Banana时刻到来。相较于同期其他视频生成模型,Seedance 2.0在音视频同步、物理规律遵循、复杂运镜等多维度均实现了明显提升,不仅体现在画面质感、美学表现等维度,还体现在智能性上:例如基于MMDiT多模态扩散Transformer架构,通过创新的双流+单流融合范式,打造出真正意义上的音视频联合生成模型,带来了极致的视听体验。此外,其在物理规律遵循维度也表现更优异。不过整体来看,Seedance 2.0在智能性上仍有较大的提升空间,例如文字乱码问题依然较多,物理规律表现略显生硬等,这也表明视频生成模型从创作工具到世界模型演进的道路依然有距离。

Alive架构实现音视频联合生成

图表:Alive架构(基于MMDiT)实现音视频联合生成

综合VS垂直优劣势各异。从ToC角度看,C端用户对效果阈值、可靠性等要求通常低于B端用户,但对便利性与价格的要求更高。我们认为综合型的公司或占优,除在AI模型有系统性布局外,往往拥有渠道与流量优势,因此在把握AIGC ToC平台型机遇时具备体系性优势。而对于ToB赛道,我们认为垂直参与者仍有机会通过深耕特定需求、聚焦细分赛道构建差异化壁垒。企业用户对工具的效果阈值、可靠性、安全性与工作流集成度要求远高于普通消费者。他们更愿意为持续提升效率、优化产出或降低风险的确定性而付费。对于AI视频赛道,我们认为部分产品仍有希望凭借垂直聚焦的定位实现可持续发展。风投a16z在25年10月《There is no God Tier video model》也表达了类似的判断,其认为不同视频模型正在专业化,垂直聚焦是一条具备潜力的发展路径。

焦点三:如何看待Seedance对现有互联网生态影响?

本文转载自百家号, 作者:百家号, 原文标题:《 中金:Seedance2.0对互联网有何影响? 》, 原文链接: https://baijiahao.baidu.com/s?id=1860407606988760228&wfr=spider&for=pc。 本平台仅做分享和推荐,不涉及任何商业用途。文章版权归原作者所有。如涉及作品内容、版权和其它问题,请与我们联系,我们将在第一时间删除内容!
本文相关推荐
暂无相关推荐
点击立即订阅