
Seed Audio 2.0: criação completa de áudio a partir de texto, voz e vídeo
O Seed Audio 2.0 é apresentado como um fluxo de trabalho unificado para criar diálogo, performance emocional, ambiente, foley, efeitos sonoros e música a partir de um único briefing conectado. Este guia explica os modos publicados T2A, TA2A, TV2A e TAV2A, o que mudou em relação à linha de base 1.0 e o que está realmente disponível neste site hoje.
Modos de entrada publicados
T2A, TA2A, TV2A e TAV2A
Capacidade de referências
Até seis áudios de referência no fluxo do Dreamina
Duração da saída publicada
Até seis minutos por resultado
Gerador nesta página
Integração atual do Seed Audio 1.0
Comece a gerar Seed Audio 1.0 online.
Use o espaço de trabalho abaixo para criar cenas sonoras a partir de um prompt, áudio de referência ou imagem.
Entrada
Geração de áudio por prompt com controles opcionais.
Configurações adicionais
Personalize sua entrada com mais controle.
Histórico
Suas gerações recentes do Seed Audio 1.0 Preview.
Faça login para ver seu histórico.
Direcione toda a cena sonora, não uma pilha de clipes isolados
A ideia prática por trás do Seed Audio 2.0 é que um criador deve ser capaz de descrever a relação entre fala, ambiente, ação, música e ritmo antes de a geração começar. Uma fala tensa deve estar no mesmo tom ambiente que os passos que a interrompem, enquanto uma deixa musical deve surgir na batida dramática pretendida.
A Dreamina descreve um fluxo de trabalho que mantém essas camadas conectadas por meio de prompts de texto, vozes de referência autorizadas, vídeo de referência opcional, marcações de tempo e faixas separadas. Isso torna o seedaudio 2.0 relevante para curtas-metragens, dublagem, podcasts, audiolivros, publicidade, jogos, animação e outros projetos em que o som deve seguir uma cena em vez de apenas ler um roteiro.

Quatro caminhos para um único resultado de áudio revisável
O Seed Audio 2.0 é descrito por quatro nomes de modos. A diferença útil não é o acrônimo em si, mas qual material de origem o modelo pode usar para preservar a identidade vocal, seguir o ritmo visual e moldar a mixagem completa.
T2A · Texto para áudio
Comece com um briefing de produção escrito. Defina falantes, diálogo, entrega, ambiente, eventos de foley, efeitos sonoros, direção musical, ritmo e o final desejado para que o resultado seja composto como uma única cena.
TA2A · Controle de áudio de referência
Adicione uma referência de voz autorizada quando a identidade for importante. Descreva quais dimensões podem mudar, como emoção, ritmo, sotaque, intensidade, pausas ou expressão não falada, mantendo o falante reconhecível.
TV2A · Áudio com consciência de vídeo
Forneça um vídeo de referência mais uma direção de texto. O fluxo de trabalho publicado usa cortes visuais e batidas de ação para orientar narração, atmosfera, efeitos, música e posicionamento ao longo da edição.
TAV2A · Voz mais vídeo
Combine uma referência de voz autorizada com contexto de vídeo e direção escrita. Esse caminho é destinado a dublagem ou composição musical consistente com o personagem, onde tanto a identidade vocal quanto o ritmo visual importam.
As mudanças mais evidentes são referências, duração, contexto de vídeo e editabilidade
O anúncio oficial 1.0 da ByteDance Seed fornece a base técnica. A página do Seed Audio 2.0 da Dreamina descreve a direção expandida do produto abaixo; detalhes públicos de API e benchmarks independentes ainda não são presumidos.
Escreva um briefing de produção que sobreviva à primeira geração
Uma boa solicitação do Seed Audio 2.0 explica relações e ritmo em vez de listar palavras-chave soltas. Construa o prompt em etapas para que saídas com falhas sejam mais fáceis de diagnosticar e a próxima revisão mude apenas uma variável criativa.

Passo 1
Defina a tarefa dramática
Informe o tipo de cena, duração alvo, idioma, falantes, virada emocional, local e batida final. Isso dá a cada camada sonora posterior um propósito narrativo compartilhado.
Passo 2
Mapeie referências para os falantes
Use apenas vozes que você tem permissão de usar, mantenha um falante por arquivo de referência e descreva o que pode mudar sem pedir ao modelo para imitar uma pessoa identificável sem consentimento.
Passo 3
Posicione diálogo e eventos
Nomeie a ordem das falas, pausas, ações, mudanças de ambiente e entradas de música. Quando o vídeo for fornecido, conecte essas instruções a cortes visíveis ou batidas de ação em vez de depender de um clima genérico.
Passo 4
Revise camada por camada
Verifique identidade vocal, inteligibilidade, ritmo, continuidade do ambiente, efeitos e música separadamente. Revise a dimensão mais fraca primeiro para que uma performance útil não seja descartada porque uma camada de fundo precisa de ajustes.
Exemplo de direção de cena completa
Crie uma cena original de radiodrama de 45 segundos em uma estação de trem quase vazia à noite. Dois falantes fictícios trocam um diálogo contido em inglês. Mantenha as vozes distintas, coloque um trem distante antes da segunda fala, adicione passos molhados e um zumbido elétrico baixo, depois introduza uma base musical original suave nos dez segundos finais. Deixe um breve espaço de respiração entre as falas e termine com o anúncio da estação desaparecendo na chuva.
Saiba quais afirmações pertencem ao modelo, à página do produto e a este site
O Seed Audio 2.0 está atraindo interesse de busca antes que um registro técnico e de API público completo seja fácil de verificar. Esses limites ajudam as equipes a avaliar o fluxo de trabalho sem transformar descrições de marketing em garantias sem suporte.
A Dreamina publica o fluxo de trabalho nomeado 2.0, enquanto o diretório público de modelos da ByteDance Seed lista atualmente o Seed Audio 1.0. Trate disponibilidade pública de API, preços, datas de lançamento e benchmarks como não confirmados até que uma fonte oficial os documente.
Vozes de referência, vídeos, roteiros, direções musicais e saídas finais podem envolver direitos autorais, privacidade, publicidade ou direitos contratuais. Obtenha consentimento e revise os termos do canal de acesso usado para a geração.
Áudio mais longo e em camadas ainda pode produzir conflitos de ritmo, mascaramento, identidade inconsistente ou artefatos indesejados. A revisão humana e a regeneração seletiva continuam fazendo parte do fluxo de produção.
Respostas práticas antes de escolher um modo ou escrever um prompt
Estas respostas separam a direção 2.0 publicada das capacidades do gerador atual em seedaudio.co.
O que é o Seed Audio 2.0?
O Seed Audio 2.0 é apresentado pela Dreamina como um fluxo de trabalho unificado de geração de áudio para diálogo, performance vocal emocional, ambiente, foley, efeitos, música, controle de áudio de referência e dublagem com consciência de vídeo. Esta página trata essa descrição do produto como fonte e não infere comportamento de API não documentado.
O que significam T2A, TA2A, TV2A e TAV2A?
T2A parte do texto, TA2A adiciona áudio de referência, TV2A adiciona vídeo de referência e TAV2A combina texto, áudio de referência autorizado e vídeo. O contexto adicionado determina se o fluxo de trabalho pode focar na composição da cena, identidade vocal, ritmo visual ou todos os três.
Como o Seed Audio 2.0 é diferente do Seed Audio 1.0?
As diferenças publicadas giram em torno de até seis áudios de referência, saída de até seis minutos, caminhos TV2A e TAV2A com consciência de vídeo, marcações de tempo, faixas separadas e ativos de voz reutilizáveis. A ideia de cena completa em si já existe no modelo oficial 1.0.
Quanto tempo ele pode gerar e quantas referências pode usar?
A Dreamina afirma até seis minutos de saída e até seis áudios de referência para o fluxo de trabalho 2.0. Esses limites não se aplicam ao gerador incorporado aqui, que atualmente segue as restrições de Seed Audio 1.0 deste site.
O gerador nesta página está executando o Seed Audio 2.0?
Não. É o mesmo gerador de produção Seed Audio 1.0 usado na página inicial. Ele é fornecido para que você possa praticar prompts de cena completa mantendo a versão do modelo explícita.
Existe uma API pública seed-audio-2.0 em seedaudio.co?
No momento, não. A API pública de áudio e o gerador web do site usam a integração 1.0 existente. Uma futura integração 2.0 exigiria documentação verificada do provedor, campos de solicitação, regras de cobrança, callbacks e tratamento de resultados antes de ser divulgada.
A saída do seedaudio 2.0 pode ser usada comercialmente?
O uso comercial depende dos termos da plataforma que realmente gera o áudio e dos direitos associados a cada prompt, voz, vídeo, roteiro e saída. Revise esses termos e obtenha permissão em vez de presumir uma licença universal.
Leia as afirmações publicadas e a base técnica da 1.0
O núcleo factual deste guia do Seed Audio 2.0 vem da página do modelo da Dreamina e do artigo oficial de lançamento do Seed Audio 1.0 da ByteDance Seed. Foi feita uma tentativa de busca no X por meio do OpenCLI, mas ela retornou um limite de taxa de sessão, portanto nenhuma afirmação de rede social é apresentada como evidência.
Dreamina / CapCut
Página do modelo Seed Audio 2.0 da Dreamina
Fonte para os modos publicados, limite de seis referências, saída de seis minutos, geração com consciência de vídeo, marcações de tempo, faixas separadas e fluxo de dublagem.
ByteDance Seed
Artigo de lançamento do Seed Audio 1.0 da ByteDance Seed
Fonte para a base de áudio de cena completa, ritmo de diálogo, direção de voz de referência, geração de dois minutos, contexto de avaliação e direções futuras declaradas.