Seed Audio 1.0
注册
电影级音频工作室,人声、氛围、效果和音乐波形汇聚成一个声音场景
独立能力指南 · 2026 年 8 月更新

Seed Audio 2.0:从文本、语音和视频创建完整音频

Seed Audio 2.0 被呈现为一个统一的工作流程,可从一份连贯的简报中创建对话、情感表演、氛围、拟音、音效和音乐。本指南解释了已发布的 T2A、TA2A、TV2A 和 TAV2A 模式、相对 1.0 基准的变化,以及本站今日实际可用的功能。

已发布的输入模式

T2A、TA2A、TV2A 和 TAV2A

参考容量

Dreamina 工作流程支持最多六个参考音频

已发布的输出长度

每个结果最多六分钟

本页生成器

当前 Seed Audio 1.0 集成

在线开始生成 Seed Audio 1.0

使用下方 Seed Audio 1.0 工作区,通过提示词、可选参考音频或一张参考图像生成声音场景。

输入

以提示词为核心,可选更多生成控制。

提示词*
83/2048

更多设置

展开后可调整更多输入控制。

历史记录

你的 Seed Audio 1.0 Preview 最近生成记录。

登录后可查看生成历史。

模型方向

导演整个声音场景,而非一堆孤立的片段

Seed Audio 2.0 背后的实际理念是,创作者应该能够在生成开始前描述语音、环境、动作、音乐和时间之间的关系。一句紧张的台词应与打断它的脚步声处于相同的室内氛围中,而音乐提示应在预定的戏剧节拍处增强。

Dreamina 描述了一种工作流程,通过文本提示、允许的参考语音、可选的参考视频、时间戳和独立音轨保持这些层级的连接。这使得 seedaudio 2.0 适用于短片、配音、播客、有声书、广告、游戏、动画和其他声音必须跟随场景而不仅仅是朗读脚本的项目。

新的 Seed Audio 2.0 概念图,展示对话、氛围、拟音和音乐层形成雨景电影场景
输入映射

四条路径通向一个可审查的音频结果

Seed Audio 2.0 通过四个模式名称来描述。有用的区别不在于缩写本身,而在于模型可以使用哪些源材料来保留语音身份、遵循视觉时间并塑造完整混音。

T2A · 文本转音频

从书面制作简报开始。定义说话人、对话、表达方式、环境、拟音事件、音效、音乐方向、节奏和期望的结局,使结果作为一个场景构成。

TA2A · 参考音频控制

当身份重要时,添加允许的语音参考。描述哪些维度可以变化,例如情感、节奏、口音、强度、停顿或非语言表达,同时保持说话人可识别。

TV2A · 视频感知音频

提供参考视频加上文本方向。已发布的工作流程使用视觉剪辑和动作节拍来指导配音、氛围、效果、音乐以及剪辑中的布局。

TAV2A · 语音加视频

将允许的语音参考与视频上下文和书面方向相结合。此路径适用于角色一致的配音或配乐,其中语音身份和视觉时间都很重要。

1.0 基准与已发布的 2.0 方向

最明显的变化是参考、时长、视频上下文和可编辑性

ByteDance Seed 官方 1.0 公告提供了技术基准。Dreamina 的 Seed Audio 2.0 页面描述了下面扩展的产品方向;公共 API 细节和独立基准尚未被假定。

工作流程领域
Seed Audio 1.0 基准
已发布的 2.0 方向
完整场景
从单个场景提示中统一语音、情感、时间、氛围和音效。
在更长的制作工作流程中保持对话、氛围、拟音、效果和音乐的连接。
参考
官方模型支持授权参考语音指导;本站当前工具总共接受最多三个音频输入。
Dreamina 表示支持最多六个参考音频,每个参考文件代表一个单独的说话人。
时长
ByteDance Seed 记录单次最多两分钟,对于更长的内容可续接。
Dreamina 表示一个生成结果最长可达六分钟。
视频上下文
官方 1.0 发布说明中,视频参考被描述为未来方向。
TV2A 和 TAV2A 被呈现为用于配音、氛围、效果和配乐的视频感知路径。
时间与音轨
提示级对话时间以 100 毫秒间隔记录;其他声音层级的控制粒度较低。
时间戳、独立音轨和可重复使用的语音资产被呈现为审查和混音修订的工具。
提示与审查工作流程

撰写一份能经得起首次生成的制作简报

一个强有力的 Seed Audio 2.0 请求会解释关系和时机,而不是列出无关的关键词。分轮构建提示,以便更容易诊断失败的输出,并且下一次修订只更改一个创意变量。

视频感知配音的新概念图,语音、氛围、效果和音乐排列在单独的同步波形轨道上

步骤 1

定义戏剧性任务

说明场景类型、目标时长、语言、说话人、情感转折、地点和最终节拍。这为后续每个声音层提供共同的叙事目的。

步骤 2

将参考映射到说话人

只使用您有权使用的声音,每个参考文件对应一个说话人,并描述可以更改的内容,而不要求模型在未经同意的情况下模仿可识别的人物。

步骤 3

安排对话和事件

说明台词、停顿、动作、氛围变化和音乐进入的顺序。当提供视频时,将这些指令与可见剪辑或动作节拍相关联,而不是依赖通用的情绪。

步骤 4

逐层审查

分别检查语音身份、可懂度、时机、房间连续性、效果和音乐。先修改最弱的维度,这样就不会因为一个背景层需要调整而丢弃有用的表演。

示例完整场景指示

创建一个 45 秒的原创广播剧场景,地点是夜晚几乎空无一人的火车站。两位虚构说话人用英语进行克制的对话。保持他们的声音鲜明,在第二句台词之前放置远处火车的声响,添加湿漉漉的脚步声和微弱的电流嗡嗡声,然后在最后十秒引入低沉的原创音乐底垫。在台词之间留出短暂的呼吸空间,并以车站广播逐渐消失在雨声中结束。

可用性与负责任的使用

了解哪些声明属于模型、产品页面和本网站

Seed Audio 2.0 在完整的公开技术和 API 记录易于验证之前就引起了搜索兴趣。这些界限帮助团队评估工作流程,而不会将营销描述变成无根据的保证。

Dreamina 发布了名为 2.0 的工作流程,而 ByteDance Seed 的公开模型目录目前列出了 Seed Audio 1.0。在官方来源记录之前,请将公共 API 可用性、定价、发布日期和基准视为未经确认。

参考语音、视频、脚本、音乐方向和最终输出可能涉及版权、隐私、公开权或合同权利。获得同意并审查用于生成的访问渠道的条款。

更长、分层的音频仍可能产生时间冲突、掩蔽、身份不一致或不想要的伪影。人工审查和选择性重新生成仍然是制作工作流程的一部分。

常见问题

在选择模式或编写提示之前的实用答案

这些答案将已发布的 2.0 方向与 seedaudio.co 上当前生成器的功能区分开来。

什么是 Seed Audio 2.0?

Seed Audio 2.0 由 Dreamina 呈现为统一的音频生成工作流程,用于对话、情感语音表演、氛围、拟音、效果、音乐、参考音频控制和视频感知配音。本页面将该产品描述视为来源,并不推断未记录的 API 行为。

T2A、TA2A、TV2A 和 TAV2A 是什么意思?

T2A 从文本开始,TA2A 添加参考音频,TV2A 添加参考视频,TAV2A 结合文本、允许的参考音频和视频。添加的上下文决定了工作流程是专注于场景构图、语音身份、视觉时间还是三者兼有。

Seed Audio 2.0 与 Seed Audio 1.0 有何不同?

已发布的差异集中在最多六个参考音频、最长六分钟的输出、视频感知的 TV2A 和 TAV2A 路径、时间戳、独立音轨和可重复使用的语音资产。完整场景的概念本身已存在于官方 1.0 模型中。

它能生成多长时间,能使用多少参考资料?

Dreamina 表示 2.0 工作流程最多可输出六分钟,最多可使用六个参考音频。这些限制不适用于此处嵌入的生成器,该生成器目前遵循本网站的 Seed Audio 1.0 限制。

此页面上的生成器是否运行 Seed Audio 2.0?

不是。它与首页使用的生产级 Seed Audio 1.0 生成器相同。提供它是为了让您可以在明确模型版本的情况下练习完整场景提示。

seedaudio.co 上是否有公开的 seed-audio-2.0 API?

目前没有。该网站的公共音频 API 和网络生成器使用现有的 1.0 集成。未来的 2.0 集成需要经过验证的提供商文档、请求字段、计费规则、回调和结果处理,然后才能进行宣传。

seedaudio 2.0 的输出可以用于商业用途吗?

商业使用取决于实际生成音频的平台的条款,以及每个提示、语音、视频、脚本和输出附带的权利。请审查这些条款并获得许可,而不是假设存在通用许可。

研究轨迹

阅读已发布的声明和 1.0 技术基准

本 Seed Audio 2.0 指南的事实核心来自 Dreamina 的模型页面和 ByteDance Seed 官方 Seed Audio 1.0 发布文章。通过 OpenCLI 尝试了 X 搜索,但返回了会话速率限制,因此没有社交媒体声明作为证据。