@-Reference 系统“@Image1 走过 @Image2,镜头运动来自 @Video1,背景音乐来自 @Audio1”
结合所有模态的多重参考提示词
字节跳动新一代AI视频模型,搭载革命性的 @-reference 系统。将文字、图片、视频片段和音频融合在单一提示词中。原生音视频同步、V2V编辑、最高2K分辨率30fps输出——全部在统一的生成流程中完成。
Seedance 2.0 是字节跳动最先进的AI视频生成模型,于2026年2月发布。它采用统一的多模态音视频联合生成架构,同时支持4种输入模态——文字、最多9张图片、最多3段视频片段和最多3条音轨。开创性的 @-reference 系统让您可以在提示词中标记特定元素,并将其绑定到上传的参考素材,实现对镜头运动、角色外观、音频节奏和视觉风格的精细控制。输出最高可达2K分辨率,并配备原生同步音频,包括多语言口型同步、音效和背景音乐。
@-reference系统、4模态输入、原生音频同步、V2V编辑、2K分辨率
@-reference 系统是 Seedance 2.0 的标志性创新。您在文字提示词中用 @Image1、@Video1、@Audio1 标记元素,并将其绑定到上传的参考文件。模型从视频参考中提取镜头运动,从音频参考中提取节拍节奏和声音特征,从图片参考中提取构图和风格。这实现了前所未有的控制力:『一个 @Image1 走过 @Image2,同时播放 @Video1 的镜头运动,并由 @Audio1 营造氛围。』
@Image1 走过 @Image2,镜头运动来自 @Video1,背景音乐来自 @Audio1
结合所有模态的多重参考提示词

@Image1 角色跟随 @Audio1 的节奏在 @Image3 环境中跳舞
角色动作由音频节拍参考引导

Seedance 2.0 采用双分支扩散Transformer架构,通过共享交叉注意力机制并行处理视频和音频的潜在表示。这意味着音频不是作为后期处理步骤添加的——而是与视觉画面同时生成,确保毫秒级同步。模型可以生成多语言口型同步对话、与动作匹配的音效和符合氛围的背景音乐,全部通过文字提示词或音频参考进行控制。
一个人进行演示演讲,配有同步的英语语音和幻灯片切换
口型同步对话配合视觉内容

烹饪教程,配有逐步旁白和厨房环境音
旁白与烹饪动作同步

探索 Seedance 2.0 在多模态参考控制、原生音频生成和视频编辑方面的强大能力
@-Reference 系统“@Image1 走过 @Image2,镜头运动来自 @Video1,背景音乐来自 @Audio1”
结合所有模态的多重参考提示词
@-Reference 系统“@Image1 角色跟随 @Audio1 的节奏在 @Image3 环境中跳舞”
角色动作由音频节拍参考引导
原生音频生成“一个人进行演示演讲,配有同步的英语语音和幻灯片切换”
口型同步对话配合视觉内容
原生音频生成“烹饪教程,配有逐步旁白和厨房环境音”
旁白与烹饪动作同步
Seedance 2.0 FAQ
@-reference 系统让您可以在提示词中用 @Image1、@Video1、@Audio1 标签标记元素,并将其绑定到上传的参考文件。Seedance 2.0 会从视频参考中提取镜头运动,从音频中提取节拍节奏,从图片中提取构图风格。这使您能精细控制生成视频的每一个方面。
Seedance 2.0 同时支持4种输入模态:文字提示词(长度不限)、最多9张参考图片(每张≤30MB)、最多3段视频片段(总时长2-15秒,每段≤50MB)和最多3条音轨(总时长≤15秒,每条≤15MB)。文件总数限制:每次请求最多12个文件。
Seedance 2.0 输出原生2K(2048×1080)分辨率,30fps,提供多种质量级别:480p、720p和1080p。每次生成时长为4至15秒。支持的画面比例包括横屏、竖屏和21:9超宽屏。
Seedance 2.0 采用双分支架构,并行处理视频和音频的潜在表示。音频与视觉画面同时生成,确保毫秒级同步。支持多语言口型同步对话、与动作匹配的音效和符合氛围的背景音乐。您也可以上传音频参考作为输入。
V2V 编辑功能让您可以上传现有视频片段作为参考,生成继承其运动模式、镜头轨迹和节奏的新视频。您可以在保留原始动作结构的同时修改服装、动作或场景细节等特定元素。
Seedance 2.0 新增了视频和音频参考输入,图片参考从1张增加到9张,引入了 @-reference 系统实现多模态控制,增加了 V2V 视频编辑,最大分辨率从1080p提升到2K,时长从12秒延长至15秒,并且比 1.5 Pro 快约30%。
Seedance 2.0 采用按秒动态定价,基于分辨率收费:480p(每秒14-28积分)、720p(每秒28.5-57积分)和1080p(每秒640-3,810积分)。提供标准和高两种速度模式,高速模式约快30%。
Seedance 2.0 非常适合需要精确运动控制的视频导演、希望免去后期制作即可实现原生音频同步的内容创作者、制作品牌视频内容的广告从业者、制作旁白教程的教育工作者,以及任何需要专业级AI视频与同步音频的用户。
“@-reference 系统是真正的革命性创新。我可以从参考片段中提取镜头运动并即时应用——这是一种全新的创作工作流。”
Alex Kim: “@-reference 系统是真正的革命性创新。我可以从参考片段中提取镜头运动并即时应用——这是一种全新的创作工作流。”
Priya Sharma: “原生音频同步省去了数小时的后期制作时间。即使是非英语对话,口型同步的精准度也令人惊叹。”
Lucas Müller: “V2V 编辑让我无需重新拍摄就能增强现有素材。Seedance 2.0 已经成为我们制作流程中的核心工具。”
Yuki Tanaka: “4模态输入是一个颠覆性的改变。我可以将角色设计、镜头运动参考和背景音乐全部放入一个提示词中,得到完全符合预期的结果。”