Seed Audio 1.0
サインアップ
ボイス、アンビエンス、効果音、音楽のウェーブフォームが一つのサウンドシーンに収束するシネマティックなオーディオスタジオ
独立機能ガイド · 2026年8月更新

Seed Audio 2.0: テキスト、音声、ビデオから完全なオーディオ制作

Seed Audio 2.0 は、1つの統合されたブリーフから、ダイアログ、感情表現、アンビエンス、フォーリー、効果音、音楽を生成する統合ワークフローとして紹介されています。このガイドでは、公開されている T2A、TA2A、TV2A、TAV2A の各モード、1.0 ベースラインからの変更点、そして現在このサイトで実際に利用できる内容について説明します。

公開されている入力モード

T2A、TA2A、TV2A、TAV2A

参照対応数

Dreamina ワークフローで最大6つの参照音声

公開されている出力時間

結果あたり最大6分

このページのジェネレーター

現在の Seed Audio 1.0 統合

Seed Audio 1.0 をオンラインで生成開始。

下のSeed Audio 1.0ワークスペースを使って、プロンプト、任意の参照音声、または1枚の参照画像からサウンドシーンを作成できます。

入力

プロンプト優先の音声生成。必要に応じて追加コントロールを利用できます。

プロンプト*
83/2048

追加設定

入力をより細かくカスタマイズできます。

履歴

最近のSeed Audio 1.0 Preview生成履歴。

生成履歴を見るにはサインインしてください。

モデルの方向性

孤立したクリップの山ではなく、サウンドシーン全体を演出する

Seed Audio 2.0 の実用的なアイデアは、生成を開始する前に、クリエイターが音声、設定、アクション、音楽、タイミングの関係を記述できるようにすることです。緊張感のあるセリフは、それを遮る足音と同じ部屋のトーンの中にあるべきであり、音楽のキューは意図した劇的なビートで高まるべきです。

Dreamina は、テキストプロンプト、許可された参照音声、任意の参照ビデオ、タイムスタンプ、個別トラックを通じてこれらのレイヤーを接続し続けるワークフローを説明しています。これにより、seedaudio 2.0 は、ショートフィルム、吹き替え、ポッドキャスト、オーディオブック、広告、ゲーム、アニメーションなど、単にスクリプトを読むのではなくシーンに従う必要があるサウンドを必要とするプロジェクトに関連します。

雨の映画的なシーンを形成するダイアログ、アンビエンス、フォーリー、音楽のレイヤーを示す新しい Seed Audio 2.0 コンセプト画像
入力マップ

1つの確認可能なオーディオ結果への4つの経路

Seed Audio 2.0 は、4つのモード名で説明されています。有用な違いは頭字語自体ではなく、モデルが音声の同一性を維持し、視覚的なタイミングに従い、完全なミックスを形成するために使用できるソース素材です。

T2A · テキストからオーディオへ

書面の制作ブリーフから始めます。話者、ダイアログ、話し方、環境、フォーリーイベント、効果音、音楽の方向性、ペース、希望する結末を定義して、結果が1つのシーンとして構成されるようにします。

TA2A · 参照オーディオ制御

同一性が重要な場合は、許可された音声参照を追加します。話者を認識できるように保ちながら、感情、リズム、アクセント、強度、間合い、非言語表現など、変更可能な側面を記述します。

TV2A · ビデオ対応オーディオ

参照ビデオとテキストによる指示を提供します。公開されているワークフローでは、視覚的なカットとアクションビートを使用して、ナレーション、雰囲気、効果音、音楽、配置を編集全体にわたってガイドします。

TAV2A · 音声とビデオ

許可された音声参照をビデオコンテキストと書面による指示と組み合わせます。この経路は、声の同一性と視覚的タイミングの両方が重要となる、キャラクターの一貫した吹き替えやスコアリングを目的としています。

1.0 ベースラインと公開された 2.0 の方向性

最も明確な変更点は、参照、時間、ビデオコンテキスト、編集可能性です。

ByteDance Seed の公式 1.0 アナウンスは技術的なベースラインを提供します。Dreamina の Seed Audio 2.0 ページは以下の拡張された製品方向性を説明しています。公開 API の詳細や独立したベンチマークはまだ想定されていません。

ワークフロー領域
Seed Audio 1.0 ベースライン
公開された 2.0 の方向性
完全なシーン
1つのシーンプロンプトから、音声、感情、タイミング、アンビエンス、効果音を統合します。
ダイアログ、アンビエンス、フォーリー、効果音、音楽をより長い制作ワークフロー全体で接続し続けます。
参照
公式モデルは許可された参照音声のガイダンスをサポートしています。このサイトの現在のツールは、合計最大3つのオーディオ入力を受け入れます。
Dreamina は、各参照ファイルが別々の話者を表す、最大6つの参照音声のサポートを述べています。
長さ
ByteDance Seed は、1回のパスで最大2分を文書化しており、より長い素材には継続機能があります。
Dreamina は、生成された1つの結果が最大6分間実行できると述べています。
ビデオコンテキスト
公式 1.0 ローンチノートでは、ビデオ参照は将来の方向性として説明されていました。
TV2A と TAV2A は、吹き替え、雰囲気、効果音、スコアリングのためのビデオ対応パスとして提示されています。
タイミングとトラック
プロンプトレベルのダイアログタイミングは100ms間隔で文書化されています。他のサウンドレイヤーは、より細かい制御ができません。
タイムスタンプ、個別トラック、再利用可能な音声アセットは、レビューとミックス修正のためのツールとして提示されています。
プロンプトとレビューのワークフロー

最初の生成に耐える制作ブリーフを書く

強力な Seed Audio 2.0 のリクエストは、関連性のないキーワードを列挙するのではなく、関係とタイミングを説明します。プロンプトを段階的に構築して、失敗した出力を診断しやすくし、次のリビジョンでは1つの創造的な変数のみを変更するようにします。

音声、アンビエンス、効果音、音楽が個別の同期ウェーブフォームトラックに配置された、ビデオ対応吹き替えの新しいコンセプト画像

ステップ 1

ドラマチックな目的を定義する

シーンタイプ、目標時間、言語、話者、感情の転換、場所、最終ビートを指定します。これにより、後続のすべてのサウンドレイヤーに共通の物語上の目的が与えられます。

ステップ 2

参照を話者にマッピングする

使用が許可されている音声のみを使用し、参照ファイルごとに1人の話者を維持し、同意なしに識別可能な人物を模倣するようにモデルに要求せずに、変更可能な点を説明します。

ステップ 3

ダイアログとイベントを配置する

セリフ、間合い、アクション、アンビエンスの変化、音楽の入りの順序を指定します。ビデオが提供される場合は、一般的なムードに依存するのではなく、これらの指示を目に見えるカットやアクションビートに関連付けます。

ステップ 4

レイヤーごとにレビューする

声の同一性、明瞭度、タイミング、部屋の連続性、効果音、音楽を個別に確認します。最も弱い側面を最初に修正して、1つの背景レイヤーに修正が必要という理由で有用なパフォーマンスを破棄しないようにします。

完全なシーン指示の例

ほぼ空の駅で夜に展開する、45秒のオリジナルラジオドラマシーンを作成します。2人の架空の話者が英語で抑制の効いた会話を交わします。彼らの声ははっきりと区別できるようにし、2番目のセリフの前に遠くの列車を配置し、濡れた足音と静かな電気的なハム音を加え、最後の10秒間は低いオリジナルの音楽ベッドを入れます。セリフの間には短い呼吸の間隔を残し、駅のアナウンスが雨に消えていくところで終わります。

利用可能性と責任ある使用

どの主張がモデル、製品ページ、このサイトに属するかを知る

Seed Audio 2.0 は、完全な公開技術情報と API 記録を簡単に検証できるようになる前に、検索の関心を集めています。これらの境界線は、マーケティング記述を裏付けのない保証に変えることなく、チームがワークフローを評価するのに役立ちます。

Dreamina は名前付きの 2.0 ワークフローを公開していますが、ByteDance Seed の公開モデルディレクトリには現在 Seed Audio 1.0 がリストされています。公開 API の利用可能性、価格、リリース日、ベンチマークは、公式ソースが文書化するまで未確認として扱ってください。

参照音声、ビデオ、スクリプト、音楽の指示、最終出力には、著作権、プライバシー、パブリシティ、または契約上の権利が関与する場合があります。同意を得て、生成に使用されるアクセスチャネルの利用規約を確認してください。

より長く、レイヤー化されたオーディオでも、タイミングの競合、マスキング、一貫性のないアイデンティティ、不要なアーティファクトが発生する可能性があります。人的なレビューと選択的な再生成は、制作ワークフローの一部であり続けます。

よくある質問

モードを選択したりプロンプトを書く前の実用的な回答

これらの回答は、公開された 2.0 の方向性と、seedaudio.co の現在のジェネレーターの機能を区別します。

Seed Audio 2.0 とは何ですか?

Seed Audio 2.0 は、Dreamina によって、ダイアログ、感情的な音声パフォーマンス、アンビエンス、フォーリー、効果音、音楽、参照オーディオ制御、ビデオ対応吹き替えのための統合オーディオ生成ワークフローとして提示されています。このページはその製品説明を情報源として扱い、文書化されていない API の動作を推測しません。

T2A、TA2A、TV2A、TAV2A とはどういう意味ですか?

T2A はテキストから始まり、TA2A は参照オーディオを追加し、TV2A は参照ビデオを追加し、TAV2A はテキスト、許可された参照オーディオ、ビデオを組み合わせます。追加されたコンテキストによって、ワークフローがシーン構成、声の同一性、視覚的タイミング、またはその3つすべてに焦点を当てることができるかが決まります。

Seed Audio 2.0 は Seed Audio 1.0 とどう違いますか?

公開されている違いは、最大6つの参照オーディオ、最大6分の出力、ビデオ対応の TV2A と TAV2A パス、タイムスタンプ、個別トラック、再利用可能な音声アセットに集中しています。フルシーンのアイデア自体は、公式 1.0 モデルにすでに存在します。

どのくらいの長さを生成でき、いくつの参照を使用できますか?

Dreamina は、2.0 ワークフローについて、最大6分の出力と最大6つの参照オーディオを述べています。これらの制限は、ここに埋め込まれたジェネレーターには適用されません。現在はこのサイトの Seed Audio 1.0 の制約に従っています。

このページのジェネレーターは Seed Audio 2.0 を実行していますか?

いいえ。これはホームページで使用されているのと同じ本番の Seed Audio 1.0 ジェネレーターです。モデルバージョンを明示的に保ちながら、完全なシーンのプロンプトを練習できるように提供されています。

seedaudio.co に公開の seed-audio-2.0 API はありますか?

現時点ではありません。サイトの公開オーディオ API と Web ジェネレーターは、既存の 1.0 統合を使用しています。将来の 2.0 統合を宣伝するには、検証済みのプロバイダー文書、リクエストフィールド、課金ルール、コールバック、結果処理が必要です。

seedaudio 2.0 の出力は商用利用できますか?

商用利用は、実際にオーディオを生成するプラットフォームの利用規約と、すべてのプロンプト、音声、ビデオ、スクリプト、出力に付随する権利によって異なります。普遍的なライセンスを想定するのではなく、これらの条件を確認し、許可を得てください。

調査情報源

公開された主張と 1.0 の技術的ベースラインを読む

この Seed Audio 2.0 ガイドの事実の中核は、Dreamina のモデルページと ByteDance Seed の公式 Seed Audio 1.0 ローンチ記事から来ています。X 検索は OpenCLI を通じて試みられましたが、セッションのレート制限が返されたため、ソーシャル上の主張は証拠として提示されません。