Seed Audio 1.0
註冊
電影感音訊工作室,分層人聲、環境聲、效果與音樂波形匯聚成一個聲音場景
獨立功能指南 · 更新於 2026 年 8 月

Seed Audio 2.0:從文字、語音與影片建立完整音訊

Seed Audio 2.0 被呈現為一個統一的流程,可從一份連貫的簡報建立對話、情感表演、環境聲、擬音、音效與音樂。本指南說明已發布的 T2A、TA2A、TV2A 與 TAV2A 模式、從 1.0 基準改變了什麼,以及目前此網站實際上提供了什麼。

已發布的輸入模式

T2A、TA2A、TV2A 與 TAV2A

參考容量

在 Dreamina 工作流程中最多六個參考音訊

已發布的輸出長度

每個結果最多六分鐘

此頁面上的產生器

目前的 Seed Audio 1.0 整合

線上開始生成 Seed Audio 1.0

使用下方 Seed Audio 1.0 工作區,通過提示詞、可選參考音訊或一張參考影像生成聲音場景。

輸入

以提示詞為核心,可選更多生成控制。

提示詞*
83/2048

更多設定

展開後可調整更多輸入控制。

歷史記錄

你的 Seed Audio 1.0 Preview 最近生成記錄。

登入後可檢視生成歷史。

模型方向

指揮整個聲音場景,而非一堆孤立片段

Seed Audio 2.0 背後的實際概念是,創作者應能在生成開始前描述語言、場景、動作、音樂與時間之間的關係。緊張的台詞應與打斷它的腳步聲處於相同的空間氛圍中,而音樂提示應在預期的戲劇節拍上揚起。

Dreamina 描述了一種工作流程,透過文字提示、允許的參考人聲、選擇性參考影片、時間戳記與獨立音軌,讓這些層次保持連結。這使得 seedaudio 2.0 與短片、配音、播客、有聲書、廣告、遊戲、動畫以及其他聲音必須配合場景而非單純朗讀腳本的專案相關。

新的 Seed Audio 2.0 概念圖,顯示對話、環境聲、擬音與音樂圖層構成下雨的電影場景
輸入對照

四條路徑通往一個可檢查的音訊結果

Seed Audio 2.0 透過四個模式名稱描述。有用的差異不在於縮寫本身,而在於模型可以使用哪些來源素材來保留聲音身分、遵循視覺時間並塑造整體混音。

T2A · 文字轉音訊

從書面製作簡報開始。定義說話者、對話、表達方式、環境、擬音事件、音效、音樂方向、節奏以及期望的結尾,使結果能構成一個場景。

TA2A · 參考音訊控制

當身分很重要時,加入允許的語音參考。描述哪些維度可以改變,例如情緒、節奏、口音、強度、停頓或非語言表達,同時讓說話者保持可辨識。

TV2A · 影片感知音訊

提供參考影片加上文字指示。已發布的工作流程使用視覺剪輯與動作節拍,引導旁白、氛圍、效果、音樂以及在剪輯中的放置位置。

TAV2A · 語音加影片

結合允許的語音參考與影片情境及文字指示。此路徑適用於角色一致的配音或配樂,其中聲音身分與視覺時間都很重要。

1.0 基準與已發布的 2.0 方向

最明顯的改變是參考、時長、影片情境與可編輯性

ByteDance Seed 的官方 1.0 公告提供了技術基準。Dreamina 的 Seed Audio 2.0 頁面描述了下方擴充的產品方向;尚未假定公開 API 細節與獨立基準測試。

工作流程領域
Seed Audio 1.0 基準
已發布的 2.0 方向
完整場景
從單一場景提示統一語言、情緒、時間、環境聲與音效。
在更長的製作工作流程中,保持對話、環境聲、擬音、效果與音樂的連結。
參考
官方模型支援授權的參考語音引導;此網站目前的工具總共接受最多三個音訊輸入。
Dreamina 表示支援最多六個參考音訊,每個參考檔案代表一個獨立的說話者。
時長
ByteDance Seed 記錄單次最多兩分鐘,並可延續更長的素材。
Dreamina 表示一個生成結果最長可執行六分鐘。
影片情境
官方 1.0 發布說明中將影片參考描述為未來方向。
TV2A 與 TAV2A 被呈現為用於配音、氛圍、效果與配樂的影片感知路徑。
時間與音軌
提示層級的對話時間以 100 毫秒間隔記錄;其他聲音圖層的控制粒度較低。
時間戳記、獨立音軌與可重複使用的語音素材被呈現為審查與混音修訂的工具。
提示與審查工作流程

撰寫能通過首次生成的製作簡報

一份好的 Seed Audio 2.0 請求會說明關係與時間,而非列出不相關的關鍵字。分階段建立提示,讓失敗的輸出更容易診斷,且下一次修訂只改變一個創意變數。

影片感知配音的新概念圖,語音、環境聲、效果與音樂排列在各自同步的波形音軌上

步驟 1

定義戲劇性任務

說明場景類型、目標時長、語言、說話者、情緒轉折、地點與最終節拍。這能為後續每個聲音圖層提供共同的敘事目的。

步驟 2

將參考對應到說話者

只使用你有權使用的聲音,每個參考檔案對應一位說話者,並描述可以改變的部分,不要要求模型未經同意模仿可識別的個人。

步驟 3

安排對話與事件

說明台詞、停頓、動作、環境聲變化與音樂進場的順序。提供影片時,將這些指示連接到可見的剪輯或動作節拍,而不是依賴籠統的情緒。

步驟 4

逐層審查

分別檢查聲音身分、可理解性、時間、空間連續性、效果與音樂。先修訂最弱的維度,以免一個有用的表演因為某個背景圖層需要調整而被丟棄。

完整場景指示範例

創作一個 45 秒的原創廣播劇場景,地點在夜晚幾乎空無一人的火車站。兩位虛構說話者以英語交換克制對話。保持他們的聲音清晰可辨,在第二句台詞前放置遠處的火車聲,加入潮濕的腳步聲與安靜的電力嗡嗡聲,然後在最後十秒引入低音量的原創音樂底層。在台詞之間留下短暫的喘息空間,並以車站廣播漸弱、融入雨聲做結尾。

可用性與負責任使用

了解哪些說法屬於模型、產品頁面與此網站

Seed Audio 2.0 在完整的公開技術與 API 記錄容易驗證之前,已吸引搜尋關注。這些界限有助於團隊評估工作流程,而不會將行銷描述變成未經支持的保證。

Dreamina 發布了名為 2.0 的工作流程,而 ByteDance Seed 的公開模型目錄目前列出 Seed Audio 1.0。在官方來源記載之前,請將公開 API 可用性、定價、發布日期與基準測試視為未確認。

參考語音、影片、腳本、音樂指示與最終輸出可能涉及著作權、隱私、公開權或合約權利。取得同意並審查用於生成的存取管道條款。

較長且分層的音訊仍可能產生時間衝突、遮蔽、不一致的身分或不想要的偽影。人工審查與選擇性重新生成仍是生產工作流程的一部分。

常見問題

在選擇模式或撰寫提示前的實用解答

這些解答將已發布的 2.0 方向與 seedaudio.co 上目前產生器的功能區分開來。

什麼是 Seed Audio 2.0?

Seed Audio 2.0 由 Dreamina 呈現為統一的音訊生成工作流程,用於對話、情感語音表演、環境聲、擬音、效果、音樂、參考音訊控制與影片感知配音。此頁面將該產品描述視為來源,且不推論未記載的 API 行為。

T2A、TA2A、TV2A 與 TAV2A 分別是什麼意思?

T2A 從文字開始,TA2A 加入參考音訊,TV2A 加入參考影片,TAV2A 結合文字、允許的參考音訊與影片。加入的情境決定了工作流程能否專注於場景構成、聲音身分、視覺時間,或三者兼具。

Seed Audio 2.0 與 Seed Audio 1.0 有何不同?

已發布的差異集中在最多六個參考音訊、輸出最多六分鐘、影片感知 TV2A 與 TAV2A 路徑、時間戳記、獨立音軌與可重複使用的語音素材。完整場景的概念本身已存在於官方 1.0 模型中。

它可以生成多長,以及可以使用多少參考?

Dreamina 表示 2.0 工作流程最多可輸出六分鐘,並使用最多六個參考音訊。這些限制不適用於此處嵌入的產生器,該產生器目前遵循此網站的 Seed Audio 1.0 限制。

此頁面上的產生器是否執行 Seed Audio 2.0?

不是。它與首頁使用的正式 Seed Audio 1.0 產生器相同。提供它是為了讓你能練習完整場景提示,同時明確保留模型版本。

seedaudio.co 上是否有公開的 seed-audio-2.0 API?

目前沒有。此網站的公開音訊 API 與網頁產生器使用現有的 1.0 整合。未來的 2.0 整合需要經過驗證的提供者文件、請求欄位、計費規則、回呼與結果處理,才能進行宣傳。

seedaudio 2.0 的輸出能否用於商業用途?

商業用途取決於實際生成音訊的平台條款,以及每個提示、語音、影片、腳本與輸出所附的權利。請審查這些條款並取得許可,而非假設有通用授權。

研究來源

閱讀已發布的說法與 1.0 技術基準

此 Seed Audio 2.0 指南的事實核心來自 Dreamina 的模型頁面與 ByteDance Seed 的官方 Seed Audio 1.0 發布文章。已嘗試透過 OpenCLI 進行 X 搜尋,但回傳工作階段速率限制,因此沒有任何社群媒體說法被當作證據。