Seed Audio 1.0
S'inscrire
Studio audio cinématographique avec des couches de voix, d'ambiance, d'effets et de formes d'onde musicales convergeant vers une scène sonore unique
Guide indépendant des capacités · Mis à jour en août 2026

Seed Audio 2.0 : création audio complète à partir de texte, de voix et de vidéo

Seed Audio 2.0 est présenté comme un flux de travail unifié pour créer des dialogues, des performances émotionnelles, de l'ambiance, des bruitages, des effets sonores et de la musique à partir d'un brief connecté. Ce guide explique les modes publiés T2A, TA2A, TV2A et TAV2A, ce qui a changé par rapport à la version de base 1.0 et ce qui est réellement disponible sur ce site aujourd'hui.

Modes d'entrée publiés

T2A, TA2A, TV2A et TAV2A

Capacité de référence

Jusqu'à six audios de référence sur le flux de travail Dreamina

Durée de sortie publiée

Jusqu'à six minutes par résultat

Générateur sur cette page

Intégration actuelle de Seed Audio 1.0

Commencez à générer Seed Audio 1.0 en ligne.

Utilisez l'espace de travail ci-dessous pour créer des scènes sonores à partir d'un prompt, d'un fichier audio ou d'une image de référence.

Entrée

Génération audio par prompt avec contrôles optionnels.

Prompt*
83/2048

Paramètres supplémentaires

Personnalisez votre entrée avec plus de contrôle.

Historique

Vos générations Seed Audio 1.0 Preview récentes.

Connectez-vous pour voir votre historique de générations.

Direction du modèle

Dirigez toute la scène sonore, pas un tas de clips isolés

L'idée pratique derrière Seed Audio 2.0 est qu'un créateur doit pouvoir décrire la relation entre la parole, le lieu, l'action, la musique et le timing avant le début de la génération. Une réplique tendue doit se trouver dans le même ton de pièce que les pas qui l'interrompent, tandis qu'un signal musical doit monter au moment dramatique prévu.

Dreamina décrit un flux de travail qui maintient ces couches connectées grâce à des invites textuelles, des voix de référence autorisées, une vidéo de référence optionnelle, des horodatages et des pistes séparées. Cela rend seedaudio 2.0 pertinent pour les courts métrages, le doublage, les podcasts, les livres audio, la publicité, les jeux, l'animation et d'autres projets où le son doit suivre une scène plutôt que simplement lire un script.

Nouvelle image conceptuelle Seed Audio 2.0 montrant des couches de dialogue, d'ambiance, de bruitage et de musique formant une scène cinématographique pluvieuse
Carte des entrées

Quatre chemins vers un résultat audio révisable

Seed Audio 2.0 est décrit à travers quatre noms de modes. La différence utile n'est pas l'acronyme en lui-même, mais le matériau source que le modèle peut utiliser pour préserver l'identité vocale, suivre le timing visuel et façonner le mix complet.

T2A · Texte vers audio

Commencez par un brief de production écrit. Définissez les intervenants, les dialogues, le jeu, l'environnement, les événements de bruitage, les effets sonores, la direction musicale, le rythme et la fin souhaitée afin que le résultat soit composé comme une scène unique.

TA2A · Contrôle audio de référence

Ajoutez une référence vocale autorisée lorsque l'identité compte. Décrivez les dimensions qui peuvent changer, comme l'émotion, le rythme, l'accent, l'intensité, les pauses ou l'expression non verbale, tout en gardant l'intervenant reconnaissable.

TV2A · Audio sensible à la vidéo

Fournissez une vidéo de référence ainsi qu'une direction textuelle. Le flux de travail publié utilise les coupes visuelles et les battements d'action pour guider la voix off, l'atmosphère, les effets, la musique et le placement dans le montage.

TAV2A · Voix plus vidéo

Combinez une référence vocale autorisée avec un contexte vidéo et une direction écrite. Ce chemin est destiné au doublage cohérent des personnages ou à la composition musicale où l'identité vocale et le timing visuel comptent tous deux.

Référence 1.0 par rapport à la direction 2.0 publiée

Les changements les plus nets concernent les références, la durée, le contexte vidéo et la possibilité de modification

L'annonce officielle de ByteDance Seed pour la version 1.0 fournit la base technique. La page Seed Audio 2.0 de Dreamina décrit ci-dessous la direction produit élargie ; les détails de l'API publique et les benchmarks indépendants ne sont pas encore supposés.

Zone de flux de travail
Référence Seed Audio 1.0
Direction 2.0 publiée
Scènes complètes
Parole, émotion, timing, ambiance et effets sonores unifiés à partir d'une invite de scène.
Maintient le dialogue, l'ambiance, les bruitages, les effets et la musique connectés sur un flux de production plus long.
Références
Le modèle officiel prend en charge le guidage vocal de référence autorisé ; l'outil actuel de ce site accepte jusqu'à trois entrées audio au total.
Dreamina indique une prise en charge de jusqu'à six audios de référence, chaque fichier de référence représentant un intervenant distinct.
Durée
ByteDance Seed documente jusqu'à deux minutes en une seule passe, avec une continuation pour les contenus plus longs.
Dreamina indique qu'un résultat généré peut durer jusqu'à six minutes.
Contexte vidéo
Les références vidéo ont été décrites comme une direction future dans la note de lancement officielle de la version 1.0.
TV2A et TAV2A sont présentés comme des chemins sensibles à la vidéo pour le doublage, l'atmosphère, les effets et la composition musicale.
Timing et pistes
Le timing du dialogue au niveau de l'invite est documenté à intervalles de 100 ms ; les autres couches sonores ont un contrôle moins granulaire.
Les horodatages, les pistes séparées et les ressources vocales réutilisables sont présentés comme des outils de révision et de modifications du mix.
Flux de travail d'invite et de révision

Rédigez un brief de production qui survit à la première génération

Une demande Seed Audio 2.0 solide explique les relations et le timing au lieu de lister des mots-clés déconnectés. Construisez l'invite en plusieurs passes afin que les sorties échouées soient plus faciles à diagnostiquer et que la révision suivante ne modifie qu'une seule variable créative.

Nouvelle image conceptuelle du doublage sensible à la vidéo avec voix, ambiance, effets et musique disposés sur des pistes de formes d'onde synchronisées séparées

Étape 1

Définissez la mission dramatique

Indiquez le type de scène, la durée cible, la langue, les intervenants, le tournant émotionnel, le lieu et le dernier temps fort. Cela donne à chaque couche sonore ultérieure un objectif narratif commun.

Étape 2

Mappez les références aux intervenants

Utilisez uniquement les voix que vous êtes autorisé à utiliser, gardez un intervenant par fichier de référence et décrivez ce qui peut changer sans demander au modèle d'imiter une personne identifiable sans consentement.

Étape 3

Placez le dialogue et les événements

Nommez l'ordre des répliques, des pauses, des actions, des changements d'ambiance et des entrées musicales. Lorsqu'une vidéo est fournie, reliez ces instructions aux coupes visibles ou aux temps forts de l'action plutôt que de vous fier à une ambiance générique.

Étape 4

Révisez couche par couche

Vérifiez séparément l'identité vocale, l'intelligibilité, le timing, la continuité spatiale, les effets et la musique. Révisez d'abord la dimension la plus faible afin qu'une performance utile ne soit pas écartée parce qu'une couche d'arrière-plan nécessite du travail.

Exemple de direction de scène complète

Créez une scène originale de dramatique radio de 45 secondes dans une gare presque vide la nuit. Deux intervenants fictifs échangent un dialogue retenu en anglais. Gardez leurs voix distinctes, placez un train lointain avant la deuxième réplique, ajoutez des pas mouillés et un léger bourdonnement électrique, puis introduisez un lit musical original discret pour les dix dernières secondes. Laissez un bref espace de respiration entre les répliques et terminez sur l'annonce de la gare qui s'estompe dans la pluie.

Disponibilité et utilisation responsable

Sachez quelles affirmations appartiennent au modèle, à la page produit et à ce site

Seed Audio 2.0 attire l'intérêt des recherches avant qu'un dossier technique public et API complet soit facile à vérifier. Ces limites aident les équipes à évaluer le flux de travail sans transformer les descriptions marketing en garanties non fondées.

Dreamina publie le flux de travail 2.0 nommé, tandis que le répertoire public de modèles de ByteDance Seed répertorie actuellement Seed Audio 1.0. Considérez la disponibilité de l'API publique, les tarifs, les dates de sortie et les benchmarks comme non confirmés jusqu'à ce qu'une source officielle les documente.

Les voix de référence, les vidéos, les scripts, les directions musicales et les sorties finales peuvent impliquer des droits d'auteur, des droits à la vie privée, des droits à l'image ou des droits contractuels. Obtenez le consentement et vérifiez les conditions du canal d'accès utilisé pour la génération.

Un audio plus long et multicouche peut encore produire des conflits de timing, du masquage, une identité incohérente ou des artefacts indésirables. La révision humaine et la régénération sélective restent des éléments d'un flux de production.

Questions fréquentes

Réponses pratiques avant de choisir un mode ou de rédiger une invite

Ces réponses distinguent la direction 2.0 publiée des capacités du générateur actuel sur seedaudio.co.

Qu'est-ce que Seed Audio 2.0 ?

Seed Audio 2.0 est présenté par Dreamina comme un flux de travail unifié de génération audio pour le dialogue, la performance vocale émotionnelle, l'ambiance, les bruitages, les effets, la musique, le contrôle audio de référence et le doublage sensible à la vidéo. Cette page traite cette description produit comme la source et ne déduit pas un comportement d'API non documenté.

Que signifient T2A, TA2A, TV2A et TAV2A ?

T2A part du texte, TA2A ajoute l'audio de référence, TV2A ajoute la vidéo de référence, et TAV2A combine texte, audio de référence autorisé et vidéo. Le contexte ajouté détermine si le flux de travail peut se concentrer sur la composition de la scène, l'identité vocale, le timing visuel, ou les trois.

En quoi Seed Audio 2.0 diffère-t-il de Seed Audio 1.0 ?

Les différences publiées portent sur jusqu'à six audios de référence, une sortie allant jusqu'à six minutes, les chemins TV2A et TAV2A sensibles à la vidéo, les horodatages, les pistes séparées et les ressources vocales réutilisables. L'idée de scène complète existe déjà dans le modèle officiel 1.0.

Combien de temps peut-il générer et combien de références peut-il utiliser ?

Dreamina indique jusqu'à six minutes de sortie et jusqu'à six audios de référence pour le flux de travail 2.0. Ces limites ne s'appliquent pas au générateur intégré ici, qui suit actuellement les contraintes de Seed Audio 1.0 de ce site.

Le générateur de cette page exécute-t-il Seed Audio 2.0 ?

Non. C'est le même générateur Seed Audio 1.0 de production que celui utilisé sur la page d'accueil. Il est fourni pour que vous puissiez vous entraîner à créer des invites de scène complètes tout en gardant la version du modèle explicite.

Existe-t-il une API publique seed-audio-2.0 sur seedaudio.co ?

Pas actuellement. L'API audio publique du site et le générateur web utilisent l'intégration 1.0 existante. Une future intégration 2.0 nécessiterait une documentation de fournisseur vérifiée, des champs de requête, des règles de facturation, des rappels et un traitement des résultats avant de pouvoir être annoncée.

La sortie de seedaudio 2.0 peut-elle être utilisée commercialement ?

L'utilisation commerciale dépend des conditions de la plateforme qui génère réellement l'audio et des droits attachés à chaque invite, voix, vidéo, script et sortie. Vérifiez ces conditions et obtenez l'autorisation plutôt que de supposer une licence universelle.