
在线开始生成 Seed Audio 1.0
使用下方 Seed Audio 1.0 工作区,通过提示词、可选参考音频或一张参考图像生成声音场景。
输入
以提示词为核心,可选更多生成控制。
更多设置
展开后可调整更多输入控制。
历史记录
你的 Seed Audio 1.0 Preview 最近生成记录。
登录后可查看生成历史。
导演整个声音场景,而非一堆孤立的片段
Seed Audio 2.0 背后的实际理念是,创作者应该能够在生成开始前描述语音、环境、动作、音乐和时间之间的关系。一句紧张的台词应与打断它的脚步声处于相同的室内氛围中,而音乐提示应在预定的戏剧节拍处增强。
Dreamina 描述了一种工作流程,通过文本提示、允许的参考语音、可选的参考视频、时间戳和独立音轨保持这些层级的连接。这使得 seedaudio 2.0 适用于短片、配音、播客、有声书、广告、游戏、动画和其他声音必须跟随场景而不仅仅是朗读脚本的项目。

四条路径通向一个可审查的音频结果
Seed Audio 2.0 通过四个模式名称来描述。有用的区别不在于缩写本身,而在于模型可以使用哪些源材料来保留语音身份、遵循视觉时间并塑造完整混音。
T2A · 文本转音频
从书面制作简报开始。定义说话人、对话、表达方式、环境、拟音事件、音效、音乐方向、节奏和期望的结局,使结果作为一个场景构成。
TA2A · 参考音频控制
当身份重要时,添加允许的语音参考。描述哪些维度可以变化,例如情感、节奏、口音、强度、停顿或非语言表达,同时保持说话人可识别。
TV2A · 视频感知音频
提供参考视频加上文本方向。已发布的工作流程使用视觉剪辑和动作节拍来指导配音、氛围、效果、音乐以及剪辑中的布局。
TAV2A · 语音加视频
将允许的语音参考与视频上下文和书面方向相结合。此路径适用于角色一致的配音或配乐,其中语音身份和视觉时间都很重要。
最明显的变化是参考、时长、视频上下文和可编辑性
ByteDance Seed 官方 1.0 公告提供了技术基准。Dreamina 的 Seed Audio 2.0 页面描述了下面扩展的产品方向;公共 API 细节和独立基准尚未被假定。
撰写一份能经得起首次生成的制作简报
一个强有力的 Seed Audio 2.0 请求会解释关系和时机,而不是列出无关的关键词。分轮构建提示,以便更容易诊断失败的输出,并且下一次修订只更改一个创意变量。

步骤 1
定义戏剧性任务
说明场景类型、目标时长、语言、说话人、情感转折、地点和最终节拍。这为后续每个声音层提供共同的叙事目的。
步骤 2
将参考映射到说话人
只使用您有权使用的声音,每个参考文件对应一个说话人,并描述可以更改的内容,而不要求模型在未经同意的情况下模仿可识别的人物。
步骤 3
安排对话和事件
说明台词、停顿、动作、氛围变化和音乐进入的顺序。当提供视频时,将这些指令与可见剪辑或动作节拍相关联,而不是依赖通用的情绪。
步骤 4
逐层审查
分别检查语音身份、可懂度、时机、房间连续性、效果和音乐。先修改最弱的维度,这样就不会因为一个背景层需要调整而丢弃有用的表演。
示例完整场景指示
创建一个 45 秒的原创广播剧场景,地点是夜晚几乎空无一人的火车站。两位虚构说话人用英语进行克制的对话。保持他们的声音鲜明,在第二句台词之前放置远处火车的声响,添加湿漉漉的脚步声和微弱的电流嗡嗡声,然后在最后十秒引入低沉的原创音乐底垫。在台词之间留出短暂的呼吸空间,并以车站广播逐渐消失在雨声中结束。
了解哪些声明属于模型、产品页面和本网站
Seed Audio 2.0 在完整的公开技术和 API 记录易于验证之前就引起了搜索兴趣。这些界限帮助团队评估工作流程,而不会将营销描述变成无根据的保证。
Dreamina 发布了名为 2.0 的工作流程,而 ByteDance Seed 的公开模型目录目前列出了 Seed Audio 1.0。在官方来源记录之前,请将公共 API 可用性、定价、发布日期和基准视为未经确认。
参考语音、视频、脚本、音乐方向和最终输出可能涉及版权、隐私、公开权或合同权利。获得同意并审查用于生成的访问渠道的条款。
更长、分层的音频仍可能产生时间冲突、掩蔽、身份不一致或不想要的伪影。人工审查和选择性重新生成仍然是制作工作流程的一部分。
在选择模式或编写提示之前的实用答案
这些答案将已发布的 2.0 方向与 seedaudio.co 上当前生成器的功能区分开来。
什么是 Seed Audio 2.0?
Seed Audio 2.0 由 Dreamina 呈现为统一的音频生成工作流程,用于对话、情感语音表演、氛围、拟音、效果、音乐、参考音频控制和视频感知配音。本页面将该产品描述视为来源,并不推断未记录的 API 行为。
T2A、TA2A、TV2A 和 TAV2A 是什么意思?
T2A 从文本开始,TA2A 添加参考音频,TV2A 添加参考视频,TAV2A 结合文本、允许的参考音频和视频。添加的上下文决定了工作流程是专注于场景构图、语音身份、视觉时间还是三者兼有。
Seed Audio 2.0 与 Seed Audio 1.0 有何不同?
已发布的差异集中在最多六个参考音频、最长六分钟的输出、视频感知的 TV2A 和 TAV2A 路径、时间戳、独立音轨和可重复使用的语音资产。完整场景的概念本身已存在于官方 1.0 模型中。
它能生成多长时间,能使用多少参考资料?
Dreamina 表示 2.0 工作流程最多可输出六分钟,最多可使用六个参考音频。这些限制不适用于此处嵌入的生成器,该生成器目前遵循本网站的 Seed Audio 1.0 限制。
此页面上的生成器是否运行 Seed Audio 2.0?
不是。它与首页使用的生产级 Seed Audio 1.0 生成器相同。提供它是为了让您可以在明确模型版本的情况下练习完整场景提示。
seedaudio.co 上是否有公开的 seed-audio-2.0 API?
目前没有。该网站的公共音频 API 和网络生成器使用现有的 1.0 集成。未来的 2.0 集成需要经过验证的提供商文档、请求字段、计费规则、回调和结果处理,然后才能进行宣传。
seedaudio 2.0 的输出可以用于商业用途吗?
商业使用取决于实际生成音频的平台的条款,以及每个提示、语音、视频、脚本和输出附带的权利。请审查这些条款并获得许可,而不是假设存在通用许可。
阅读已发布的声明和 1.0 技术基准
本 Seed Audio 2.0 指南的事实核心来自 Dreamina 的模型页面和 ByteDance Seed 官方 Seed Audio 1.0 发布文章。通过 OpenCLI 尝试了 X 搜索,但返回了会话速率限制,因此没有社交媒体声明作为证据。