描述声音场景
从角色、情绪、地点、节奏、对白、音乐氛围和需要出现的音效开始。
Seed Audio 1.0 是字节 Seed 的一体化音频生成模型,面向完整声音场景创作。你可以用文本、图像或音频上下文引导多角色对白、情绪表达、原生口音、环境声、背景音乐与拟音音效。
Seed Audio 1.0
声音场景 Prompt 预览

Prompt 概念
两个角色在雨夜巷口低声交谈,底部有紧张弦乐,远处车流、脚步声,最后一声金属门撞击。
使用下方 Seed Audio 1.0 工作区,通过提示词、可选参考音频或一张参考图像生成声音场景。
输入
以提示词为核心,可选更多生成控制。
更多设置
展开后可调整更多输入控制。
历史记录
你的 Seed Audio 1.0 Preview 最近生成记录。
登录后可查看生成历史。
使用方法
在线使用 Seed Audio 1.0 时,先写清声音场景提示词,按需添加音频或图片参考,选择输出设置,然后在 SeedAudio.co 工作区生成并检查音频结果。

描述角色、语言、情绪、地点、对白、环境声、音乐方向,以及你希望出现的声音事件。

可以用最多 3 段音频参考来引导声音或风格,也可以用 1 张图片参考来引导情绪和场景上下文。

生成前选择声音、输出格式、采样率、速度、音量、音高和最大积分上限。

先生成一段短草稿,检查人声清晰度和各声音层的平衡,再复制、下载或继续修改结果。
清晰流程
从声音想法出发,用一条 Prompt 定义角色、情绪、地点、对白、音乐、环境与音效,形成完整的声音场景方向。
从角色、情绪、地点、节奏、对白、音乐氛围和需要出现的音效开始。
Seed Audio 1.0 面向对白、情绪语气、原生口音、环境声、BGM 与独立音效的一体化合成。
为短片、广告、播客、游戏、学习内容等需要快速验证完整声景的项目提供声音方向。
Seed Audio 1.0 技术方向
Seed Audio 1.0 面向完整音频场景:多角色对白、情绪、语气、口音、环境底声、BGM 和拟音可以在一次创作流程中完成。
多说话人
长声音场景中的音色连续性
文本 / 图像 / 音频
面向音频创作的多模态提示
不再把人声、音乐、环境和音效拆到多个工具里拼接,而是在一次生成里编排多层声音。
引导语气、情绪表达、方言和原生口音,同时让反复出现的声音在不同语境中保持可识别。
在对白旁同步生成环境底声、背景音乐、房间声、天气、人群或远处城市质感。
Seed Audio 1.0 面向更长的声音场景,适合对白、环境声和带音乐的片段化内容生成。
创作可能性
当项目需要的不只是旁白,而是有角色、情绪、空间和事件的完整声景时,Seed Audio 1.0 的价值最明显。
为分镜或预演草拟对白、情绪点、拟音、环境和音乐。
为产品演示、社媒短片和本地化广告快速生成声音方向。
在最终音频制作前,原型化环境循环、角色语音、UI 声和过场声效。
用空间声音线索构建情景课程、角色对话和沉浸式讲解。
带情绪语气的多角色表达
雨声、车流、房间、人群与自然底声
脚步、撞击、开门、质感与时机
价格
按需购买一次性积分包,适合测试、个人创作和更高用量的 AI 音频生成。所有付费订阅和积分包均包含 Seed Audio 1.0 API 调用权限,网页版与 API 共用同一积分余额。
无需订阅,小额积分包适合先试用。
适合偶尔做内容项目的灵活积分包。
适合不订阅但需要较高用量的一次性积分包。
常见问题
给想了解 Seed Audio 1.0 并用于 AI 音频生成的创作者提供实用答案。