
Seed Audio 2.0 : création audio complète à partir de texte, de voix et de vidéo
Seed Audio 2.0 est présenté comme un flux de travail unifié pour créer des dialogues, des performances émotionnelles, de l'ambiance, des bruitages, des effets sonores et de la musique à partir d'un brief connecté. Ce guide explique les modes publiés T2A, TA2A, TV2A et TAV2A, ce qui a changé par rapport à la version de base 1.0 et ce qui est réellement disponible sur ce site aujourd'hui.
Modes d'entrée publiés
T2A, TA2A, TV2A et TAV2A
Capacité de référence
Jusqu'à six audios de référence sur le flux de travail Dreamina
Durée de sortie publiée
Jusqu'à six minutes par résultat
Générateur sur cette page
Intégration actuelle de Seed Audio 1.0
Commencez à générer Seed Audio 1.0 en ligne.
Utilisez l'espace de travail ci-dessous pour créer des scènes sonores à partir d'un prompt, d'un fichier audio ou d'une image de référence.
Entrée
Génération audio par prompt avec contrôles optionnels.
Paramètres supplémentaires
Personnalisez votre entrée avec plus de contrôle.
Historique
Vos générations Seed Audio 1.0 Preview récentes.
Connectez-vous pour voir votre historique de générations.
Dirigez toute la scène sonore, pas un tas de clips isolés
L'idée pratique derrière Seed Audio 2.0 est qu'un créateur doit pouvoir décrire la relation entre la parole, le lieu, l'action, la musique et le timing avant le début de la génération. Une réplique tendue doit se trouver dans le même ton de pièce que les pas qui l'interrompent, tandis qu'un signal musical doit monter au moment dramatique prévu.
Dreamina décrit un flux de travail qui maintient ces couches connectées grâce à des invites textuelles, des voix de référence autorisées, une vidéo de référence optionnelle, des horodatages et des pistes séparées. Cela rend seedaudio 2.0 pertinent pour les courts métrages, le doublage, les podcasts, les livres audio, la publicité, les jeux, l'animation et d'autres projets où le son doit suivre une scène plutôt que simplement lire un script.

Quatre chemins vers un résultat audio révisable
Seed Audio 2.0 est décrit à travers quatre noms de modes. La différence utile n'est pas l'acronyme en lui-même, mais le matériau source que le modèle peut utiliser pour préserver l'identité vocale, suivre le timing visuel et façonner le mix complet.
T2A · Texte vers audio
Commencez par un brief de production écrit. Définissez les intervenants, les dialogues, le jeu, l'environnement, les événements de bruitage, les effets sonores, la direction musicale, le rythme et la fin souhaitée afin que le résultat soit composé comme une scène unique.
TA2A · Contrôle audio de référence
Ajoutez une référence vocale autorisée lorsque l'identité compte. Décrivez les dimensions qui peuvent changer, comme l'émotion, le rythme, l'accent, l'intensité, les pauses ou l'expression non verbale, tout en gardant l'intervenant reconnaissable.
TV2A · Audio sensible à la vidéo
Fournissez une vidéo de référence ainsi qu'une direction textuelle. Le flux de travail publié utilise les coupes visuelles et les battements d'action pour guider la voix off, l'atmosphère, les effets, la musique et le placement dans le montage.
TAV2A · Voix plus vidéo
Combinez une référence vocale autorisée avec un contexte vidéo et une direction écrite. Ce chemin est destiné au doublage cohérent des personnages ou à la composition musicale où l'identité vocale et le timing visuel comptent tous deux.
Les changements les plus nets concernent les références, la durée, le contexte vidéo et la possibilité de modification
L'annonce officielle de ByteDance Seed pour la version 1.0 fournit la base technique. La page Seed Audio 2.0 de Dreamina décrit ci-dessous la direction produit élargie ; les détails de l'API publique et les benchmarks indépendants ne sont pas encore supposés.
Rédigez un brief de production qui survit à la première génération
Une demande Seed Audio 2.0 solide explique les relations et le timing au lieu de lister des mots-clés déconnectés. Construisez l'invite en plusieurs passes afin que les sorties échouées soient plus faciles à diagnostiquer et que la révision suivante ne modifie qu'une seule variable créative.

Étape 1
Définissez la mission dramatique
Indiquez le type de scène, la durée cible, la langue, les intervenants, le tournant émotionnel, le lieu et le dernier temps fort. Cela donne à chaque couche sonore ultérieure un objectif narratif commun.
Étape 2
Mappez les références aux intervenants
Utilisez uniquement les voix que vous êtes autorisé à utiliser, gardez un intervenant par fichier de référence et décrivez ce qui peut changer sans demander au modèle d'imiter une personne identifiable sans consentement.
Étape 3
Placez le dialogue et les événements
Nommez l'ordre des répliques, des pauses, des actions, des changements d'ambiance et des entrées musicales. Lorsqu'une vidéo est fournie, reliez ces instructions aux coupes visibles ou aux temps forts de l'action plutôt que de vous fier à une ambiance générique.
Étape 4
Révisez couche par couche
Vérifiez séparément l'identité vocale, l'intelligibilité, le timing, la continuité spatiale, les effets et la musique. Révisez d'abord la dimension la plus faible afin qu'une performance utile ne soit pas écartée parce qu'une couche d'arrière-plan nécessite du travail.
Exemple de direction de scène complète
Créez une scène originale de dramatique radio de 45 secondes dans une gare presque vide la nuit. Deux intervenants fictifs échangent un dialogue retenu en anglais. Gardez leurs voix distinctes, placez un train lointain avant la deuxième réplique, ajoutez des pas mouillés et un léger bourdonnement électrique, puis introduisez un lit musical original discret pour les dix dernières secondes. Laissez un bref espace de respiration entre les répliques et terminez sur l'annonce de la gare qui s'estompe dans la pluie.
Sachez quelles affirmations appartiennent au modèle, à la page produit et à ce site
Seed Audio 2.0 attire l'intérêt des recherches avant qu'un dossier technique public et API complet soit facile à vérifier. Ces limites aident les équipes à évaluer le flux de travail sans transformer les descriptions marketing en garanties non fondées.
Dreamina publie le flux de travail 2.0 nommé, tandis que le répertoire public de modèles de ByteDance Seed répertorie actuellement Seed Audio 1.0. Considérez la disponibilité de l'API publique, les tarifs, les dates de sortie et les benchmarks comme non confirmés jusqu'à ce qu'une source officielle les documente.
Les voix de référence, les vidéos, les scripts, les directions musicales et les sorties finales peuvent impliquer des droits d'auteur, des droits à la vie privée, des droits à l'image ou des droits contractuels. Obtenez le consentement et vérifiez les conditions du canal d'accès utilisé pour la génération.
Un audio plus long et multicouche peut encore produire des conflits de timing, du masquage, une identité incohérente ou des artefacts indésirables. La révision humaine et la régénération sélective restent des éléments d'un flux de production.
Réponses pratiques avant de choisir un mode ou de rédiger une invite
Ces réponses distinguent la direction 2.0 publiée des capacités du générateur actuel sur seedaudio.co.
Qu'est-ce que Seed Audio 2.0 ?
Seed Audio 2.0 est présenté par Dreamina comme un flux de travail unifié de génération audio pour le dialogue, la performance vocale émotionnelle, l'ambiance, les bruitages, les effets, la musique, le contrôle audio de référence et le doublage sensible à la vidéo. Cette page traite cette description produit comme la source et ne déduit pas un comportement d'API non documenté.
Que signifient T2A, TA2A, TV2A et TAV2A ?
T2A part du texte, TA2A ajoute l'audio de référence, TV2A ajoute la vidéo de référence, et TAV2A combine texte, audio de référence autorisé et vidéo. Le contexte ajouté détermine si le flux de travail peut se concentrer sur la composition de la scène, l'identité vocale, le timing visuel, ou les trois.
En quoi Seed Audio 2.0 diffère-t-il de Seed Audio 1.0 ?
Les différences publiées portent sur jusqu'à six audios de référence, une sortie allant jusqu'à six minutes, les chemins TV2A et TAV2A sensibles à la vidéo, les horodatages, les pistes séparées et les ressources vocales réutilisables. L'idée de scène complète existe déjà dans le modèle officiel 1.0.
Combien de temps peut-il générer et combien de références peut-il utiliser ?
Dreamina indique jusqu'à six minutes de sortie et jusqu'à six audios de référence pour le flux de travail 2.0. Ces limites ne s'appliquent pas au générateur intégré ici, qui suit actuellement les contraintes de Seed Audio 1.0 de ce site.
Le générateur de cette page exécute-t-il Seed Audio 2.0 ?
Non. C'est le même générateur Seed Audio 1.0 de production que celui utilisé sur la page d'accueil. Il est fourni pour que vous puissiez vous entraîner à créer des invites de scène complètes tout en gardant la version du modèle explicite.
Existe-t-il une API publique seed-audio-2.0 sur seedaudio.co ?
Pas actuellement. L'API audio publique du site et le générateur web utilisent l'intégration 1.0 existante. Une future intégration 2.0 nécessiterait une documentation de fournisseur vérifiée, des champs de requête, des règles de facturation, des rappels et un traitement des résultats avant de pouvoir être annoncée.
La sortie de seedaudio 2.0 peut-elle être utilisée commercialement ?
L'utilisation commerciale dépend des conditions de la plateforme qui génère réellement l'audio et des droits attachés à chaque invite, voix, vidéo, script et sortie. Vérifiez ces conditions et obtenez l'autorisation plutôt que de supposer une licence universelle.
Lisez les affirmations publiées et la base technique 1.0
Le noyau factuel de ce guide Seed Audio 2.0 provient de la page du modèle Dreamina et de l'article officiel de lancement de Seed Audio 1.0 de ByteDance Seed. Une recherche X a été tentée via OpenCLI mais a renvoyé une limite de débit de session, donc aucune affirmation sociale n'est présentée comme preuve.
Dreamina / CapCut
Page du modèle Dreamina Seed Audio 2.0
Source pour les modes publiés, la limite de six références, la sortie de six minutes, la génération sensible à la vidéo, les horodatages, les pistes séparées et le flux de doublage.
ByteDance Seed
Article de lancement de ByteDance Seed Audio 1.0
Source pour la base audio de scène complète, le timing du dialogue, la direction de la voix de référence, la génération de deux minutes, le contexte d'évaluation et les directions futures énoncées.