Seed Audio 1.0
Registrarse
Estudio de audio cinematográfico con capas de voz, ambiente, efectos y formas de onda de música que convergen en una única escena sonora
Guía independiente de capacidades · Actualizado en agosto de 2026

Seed Audio 2.0: creación completa de audio a partir de texto, voz y vídeo

Seed Audio 2.0 se presenta como un flujo de trabajo unificado para crear diálogos, interpretación emocional, ambiente, foley, efectos de sonido y música a partir de un único brief conectado. Esta guía explica los modos publicados T2A, TA2A, TV2A y TAV2A, qué cambió respecto a la línea base 1.0 y qué está realmente disponible en este sitio hoy.

Modos de entrada publicados

T2A, TA2A, TV2A y TAV2A

Capacidad de referencia

Hasta seis audios de referencia en el flujo de trabajo de Dreamina

Longitud de salida publicada

Hasta seis minutos por resultado

Generador en esta página

Integración actual de Seed Audio 1.0

Empiece a generar Seed Audio 1.0 en línea.

Use el espacio de trabajo para crear escenas sonoras desde un prompt, audio de referencia o imagen.

Entrada

Generación de audio por prompt con controles opcionales.

Prompt*
83/2048

Ajustes adicionales

Personalice su entrada con más control.

Historial

Sus generaciones recientes de Seed Audio 1.0 Preview.

Inicie sesión para ver su historial.

Dirección del modelo

Dirige toda la escena sonora, no una pila de clips aislados

La idea práctica detrás de Seed Audio 2.0 es que un creador pueda describir la relación entre el habla, el entorno, la acción, la música y el ritmo antes de que comience la generación. Una línea tensa debe encajar en el mismo tono de sala que los pasos que la interrumpen, mientras que una señal musical debe elevarse en el momento dramático previsto.

Dreamina describe un flujo de trabajo que mantiene esas capas conectadas mediante prompts de texto, voces de referencia permitidas, vídeo de referencia opcional, marcas de tiempo y pistas separadas. Eso hace que seedaudio 2.0 sea relevante para cortometrajes, doblaje, podcasts, audiolibros, publicidad, juegos, animación y otros proyectos donde el sonido debe seguir una escena en lugar de simplemente leer un guion.

Nueva imagen conceptual de Seed Audio 2.0 que muestra capas de diálogo, ambiente, foley y música formando una escena cinematográfica lluviosa
Mapa de entradas

Cuatro vías hacia un resultado de audio revisable

Seed Audio 2.0 se describe a través de cuatro nombres de modo. La diferencia útil no es el acrónimo en sí, sino qué material de origen puede utilizar el modelo para preservar la identidad de la voz, seguir el ritmo visual y dar forma a la mezcla completa.

T2A · Texto a audio

Comienza con un brief de producción escrito. Define hablantes, diálogo, entrega, entorno, eventos de foley, efectos de sonido, dirección musical, ritmo y el final deseado para que el resultado se componga como una sola escena.

TA2A · Control de audio de referencia

Añade una referencia de voz permitida cuando la identidad sea importante. Describe qué dimensiones pueden cambiar, como emoción, ritmo, acento, intensidad, pausas o expresión no verbal, manteniendo al hablante reconocible.

TV2A · Audio consciente del vídeo

Aporta un vídeo de referencia más una dirección de texto. El flujo de trabajo publicado utiliza cortes visuales y ritmos de acción para guiar la voz en off, la atmósfera, los efectos, la música y la ubicación a lo largo de la edición.

TAV2A · Voz más vídeo

Combina una referencia de voz permitida con contexto de vídeo y dirección escrita. Esta vía está pensada para doblaje o composición musical coherente con el personaje, donde importan tanto la identidad vocal como el ritmo visual.

Línea base 1.0 frente a la dirección 2.0 publicada

Los cambios más claros son las referencias, la duración, el contexto de vídeo y la editabilidad

El anuncio oficial 1.0 de ByteDance Seed proporciona la línea base técnica. La página de Seed Audio 2.0 de Dreamina describe la dirección ampliada del producto a continuación; los detalles públicos de la API y los benchmarks independientes no se dan por sentados.

Área del flujo de trabajo
Línea base de Seed Audio 1.0
Dirección 2.0 publicada
Escenas completas
Voz, emoción, ritmo, ambiente y efectos de sonido unificados a partir de un prompt de escena.
Mantiene conectados el diálogo, el ambiente, el foley, los efectos y la música a lo largo de un flujo de trabajo de producción más extenso.
Referencias
El modelo oficial admite guía de voz de referencia autorizada; la herramienta actual de este sitio acepta hasta tres entradas de audio en total.
Dreamina declara soporte para hasta seis audios de referencia, representando cada archivo de referencia a un hablante distinto.
Duración
ByteDance Seed documenta hasta dos minutos en una sola pasada, con continuación para material más largo.
Dreamina afirma que un resultado generado puede durar hasta seis minutos.
Contexto de vídeo
Las referencias de vídeo se describieron como una dirección futura en la nota de lanzamiento oficial 1.0.
TV2A y TAV2A se presentan como vías conscientes del vídeo para doblaje, atmósfera, efectos y composición musical.
Sincronización y pistas
El ritmo del diálogo a nivel de prompt está documentado en intervalos de 100 ms; otras capas de sonido tienen un control menos granular.
Las marcas de tiempo, las pistas separadas y los activos de voz reutilizables se presentan como herramientas para la revisión y las revisiones de mezcla.
Flujo de trabajo de prompt y revisión

Escribe un brief de producción que sobreviva a la primera generación

Una solicitud sólida de Seed Audio 2.0 explica relaciones y ritmo en lugar de enumerar palabras clave inconexas. Construye el prompt en pasadas para que los resultados fallidos sean más fáciles de diagnosticar y la siguiente revisión cambie solo una variable creativa.

Nueva imagen conceptual de doblaje consciente del vídeo con voz, ambiente, efectos y música organizados en pistas de forma de onda sincronizadas por separado

Paso 1

Define el objetivo dramático

Indica el tipo de escena, la duración objetivo, el idioma, los hablantes, el giro emocional, la ubicación y el remate final. Esto le da a cada capa de sonido posterior un propósito narrativo compartido.

Paso 2

Asigna referencias a hablantes

Usa solo voces que tengas permitido utilizar, mantén un hablante por archivo de referencia y describe qué puede cambiar sin pedirle al modelo que imite a una persona identificable sin consentimiento.

Paso 3

Coloca el diálogo y los eventos

Nombra el orden de las líneas, las pausas, las acciones, los cambios de ambiente y las entradas de música. Cuando se proporciona vídeo, conecta esas instrucciones a cortes visibles o ritmos de acción en lugar de confiar en un estado de ánimo genérico.

Paso 4

Revisa capa por capa

Comprueba por separado la identidad de la voz, la inteligibilidad, el ritmo, la continuidad de la sala, los efectos y la música. Revisa primero la dimensión más débil para no descartar una interpretación útil porque una capa de fondo necesita trabajo.

Ejemplo de dirección de escena completa

Crea una escena original de radionovela de 45 segundos en una estación de ferrocarril casi vacía por la noche. Dos hablantes ficticios intercambian un diálogo contenido en inglés. Mantén sus voces diferenciadas, coloca un tren distante antes de la segunda línea, añade pasos húmedos y un zumbido eléctrico suave, luego introduce una cama musical original baja durante los últimos diez segundos. Deja un breve espacio de respiración entre las líneas y termina con el anuncio de la estación desvaneciéndose en la lluvia.

Disponibilidad y uso responsable

Sabe qué afirmaciones pertenecen al modelo, a la página del producto y a este sitio

Seed Audio 2.0 está atrayendo interés de búsqueda antes de que sea fácil verificar un registro técnico y de API público completo. Estos límites ayudan a los equipos a evaluar el flujo de trabajo sin convertir las descripciones de marketing en garantías sin respaldo.

Dreamina publica el flujo de trabajo 2.0 mencionado, mientras que el directorio público de modelos de ByteDance Seed actualmente lista Seed Audio 1.0. Trata la disponibilidad pública de la API, los precios, las fechas de lanzamiento y los benchmarks como no confirmados hasta que una fuente oficial los documente.

Las voces de referencia, vídeos, guiones, direcciones musicales y resultados finales pueden implicar derechos de autor, privacidad, publicidad o derechos contractuales. Obtén consentimiento y revisa los términos del canal de acceso utilizado para la generación.

El audio más largo y en capas aún puede producir conflictos de sincronización, enmascaramiento, identidad inconsistente o artefactos no deseados. La revisión humana y la regeneración selectiva siguen siendo parte de un flujo de trabajo de producción.

Preguntas frecuentes

Respuestas prácticas antes de elegir un modo o escribir un prompt

Estas respuestas separan la dirección 2.0 publicada de las capacidades del generador actual en seedaudio.co.

¿Qué es Seed Audio 2.0?

Seed Audio 2.0 es presentado por Dreamina como un flujo de trabajo unificado de generación de audio para diálogos, interpretación vocal emocional, ambiente, foley, efectos, música, control de audio de referencia y doblaje consciente del vídeo. Esta página trata esa descripción del producto como la fuente y no infiere comportamiento no documentado de la API.

¿Qué significan T2A, TA2A, TV2A y TAV2A?

T2A parte del texto, TA2A añade audio de referencia, TV2A añade vídeo de referencia, y TAV2A combina texto, audio de referencia permitido y vídeo. El contexto añadido determina si el flujo de trabajo puede centrarse en la composición de escena, la identidad de voz, el ritmo visual o los tres.

¿En qué se diferencia Seed Audio 2.0 de Seed Audio 1.0?

Las diferencias publicadas se centran en hasta seis audios de referencia, salida de hasta seis minutos, vías TV2A y TAV2A conscientes del vídeo, marcas de tiempo, pistas separadas y activos de voz reutilizables. La idea de escena completa ya existe en el modelo oficial 1.0.

¿Cuánto tiempo puede generar y cuántas referencias puede usar?

Dreamina afirma hasta seis minutos de salida y hasta seis audios de referencia para el flujo de trabajo 2.0. Esos límites no se aplican al generador integrado aquí, que actualmente sigue las restricciones de Seed Audio 1.0 de este sitio.

¿El generador de esta página está ejecutando Seed Audio 2.0?

No. Es el mismo generador de producción Seed Audio 1.0 utilizado en la página de inicio. Se proporciona para que practiques con prompts de escena completa manteniendo explícita la versión del modelo.

¿Existe una API pública seed-audio-2.0 en seedaudio.co?

Actualmente no. La API de audio pública y el generador web del sitio utilizan la integración 1.0 existente. Una futura integración 2.0 requeriría documentación verificada del proveedor, campos de solicitud, reglas de facturación, callbacks y manejo de resultados antes de poder anunciarse.

¿Se puede utilizar comercialmente la salida de seedaudio 2.0?

El uso comercial depende de los términos de la plataforma que realmente genera el audio y de los derechos asociados a cada prompt, voz, vídeo, guion y salida. Revisa esos términos y obtén permiso en lugar de asumir una licencia universal.

Rastro de investigación

Lee las afirmaciones publicadas y la línea base técnica 1.0

El núcleo factual de esta guía de Seed Audio 2.0 proviene de la página del modelo de Dreamina y del artículo oficial de lanzamiento de Seed Audio 1.0 de ByteDance Seed. Se intentó una búsqueda en X a través de OpenCLI, pero devolvió un límite de sesión, por lo que no se presenta ninguna afirmación social como evidencia.