Seed Audio 1.0
สมัคร
สตูดิโอเสียงสไตล์ภาพยนตร์ที่มีเสียงพูด เสียงบรรยากาศ เอฟเฟกต์ และคลื่นเสียงเพลงหลอมรวมเป็นฉากเสียงเดียว
คู่มือความสามารถอิสระ · อัปเดตสิงหาคม 2026

Seed Audio 2.0: สร้างเสียงได้ครบทุกองค์ประกอบจากข้อความ เสียง และวิดีโอ

Seed Audio 2.0 ถูกนำเสนอเป็นขั้นตอนการทำงานแบบรวมศูนย์สำหรับสร้างบทสนทนา การแสดงอารมณ์ เสียงบรรยากาศ เสียงโฟลีย์ เอฟเฟกต์เสียง และเพลงจากบรีฟที่เชื่อมโยงกันเพียงอันเดียว คู่มือนี้อธิบายโหมด T2A, TA2A, TV2A และ TAV2A ที่เผยแพร่ สิ่งที่เปลี่ยนไปจากพื้นฐานเวอร์ชัน 1.0 และสิ่งที่พร้อมใช้งานจริงบนเว็บไซต์นี้ในปัจจุบัน

โหมดอินพุตที่เผยแพร่

T2A, TA2A, TV2A และ TAV2A

ความจุเสียงอ้างอิง

เสียงอ้างอิงสูงสุดหกไฟล์ในเวิร์กโฟลว์ Dreamina

ความยาวเอาต์พุตที่เผยแพร่

สูงสุดหกนาทีต่อผลลัพธ์

ตัวสร้างบนหน้านี้

การผสานรวม Seed Audio 1.0 ในปัจจุบัน

เริ่มสร้าง Seed Audio 1.0 ออนไลน์

ใช้พื้นที่ทำงาน Seed Audio 1.0 ด้านล่างเพื่อสร้างฉากเสียงจากพรอมต์ เสียงอ้างอิง หรือรูปภาพอ้างอิง

อินพุต

สร้างเสียงด้วยพรอมต์เป็นหลัก พร้อมควบคุมเพิ่มเติม

พรอมต์*
83/2048

การตั้งค่าเพิ่มเติม

ปรับแต่งอินพุตของคุณด้วยการควบคุมเพิ่มเติม

ประวัติ

การสร้าง Seed Audio 1.0 Preview ล่าสุดของคุณ

เข้าสู่ระบบเพื่อดูประวัติการสร้างของคุณ

ทิศทางของโมเดล

ควบคุมฉากเสียงทั้งหมด ไม่ใช่กองคลิปแยกส่วน

แนวคิดเชิงปฏิบัติเบื้องหลัง Seed Audio 2.0 คือผู้สร้างควรสามารถอธิบายความสัมพันธ์ระหว่างเสียงพูด สถานที่ การกระทำ ดนตรี และจังหวะเวลาก่อนเริ่มสร้างเสียง เส้นเสียงที่ตึงเครียดควรอยู่ในบรรยากาศเดียวกันกับเสียงฝีเท้าที่ขัดจังหวะ ขณะที่คิวเพลงควรดังขึ้นตามจังหวะดราม่าที่ต้องการ

Dreamina อธิบายเวิร์กโฟลว์ที่ทำให้เลเยอร์เหล่านั้นเชื่อมโยงกันผ่านพรอมป์ข้อความ เสียงอ้างอิงที่ได้รับอนุญาต วิดีโออ้างอิงแบบไม่บังคับ ไทม์สแตมป์ และแทร็กแยกต่างหาก ทำให้ seedaudio 2.0 เกี่ยวข้องกับหนังสั้น การพากย์ พอดแคสต์ หนังสือเสียง โฆษณา เกม แอนิเมชัน และโปรเจกต์อื่นๆ ที่เสียงต้องตามฉาก ไม่ใช่แค่อ่านบท

ภาพคอนเซ็ปต์ใหม่ของ Seed Audio 2.0 แสดงเลเยอร์บทสนทนา เสียงบรรยากาศ เสียงโฟลีย์ และเพลงประกอบเป็นฉากฝนตกสไตล์ภาพยนตร์
แผนผังอินพุต

สี่เส้นทางสู่ผลลัพธ์เสียงเดียวที่ตรวจสอบได้

Seed Audio 2.0 ถูกอธิบายผ่านชื่อโหมดสี่ชื่อ ความแตกต่างที่มีประโยชน์ไม่ใช่ตัวย่อ แต่เป็นวัสดุต้นทางที่โมเดลสามารถใช้เพื่อรักษาเอกลักษณ์เสียง ปฏิบัติตามจังหวะภาพ และสร้างมิกซ์ที่สมบูรณ์

T2A · ข้อความเป็นเสียง

เริ่มต้นด้วยบรีฟการผลิตที่เป็นลายลักษณ์อักษร กำหนดผู้พูด บทสนทนา การส่งเสียง สภาพแวดล้อม เหตุการณ์โฟลีย์ เอฟเฟกต์เสียง ทิศทางดนตรี จังหวะ และตอนจบที่ต้องการ เพื่อให้ผลลัพธ์ถูกเรียบเรียงเป็นฉากเดียว

TA2A · การควบคุมเสียงอ้างอิง

เพิ่มเสียงอ้างอิงที่ได้รับอนุญาตเมื่อเอกลักษณ์ของเสียงสำคัญ อธิบายว่ามิติใดบ้างที่เปลี่ยนได้ เช่น อารมณ์ จังหวะ สำเนียง ความเข้มข้น การหยุด หรือการแสดงออกที่ไม่ใช่คำพูด ขณะที่ยังคงจำเสียงผู้พูดได้

TV2A · เสียงที่รับรู้วิดีโอ

ส่งวิดีโออ้างอิงพร้อมทิศทางข้อความ เวิร์กโฟลว์ที่เผยแพร่ใช้การตัดภาพและจังหวะการกระทำเพื่อนำทางเสียงพากย์ บรรยากาศ เอฟเฟกต์ ดนตรี และการวางตำแหน่งทั่วทั้งการตัดต่อ

TAV2A · เสียงบวกวิดีโอ

รวมเสียงอ้างอิงที่ได้รับอนุญาตเข้ากับบริบทวิดีโอและทิศทางที่เขียนไว้ เส้นทางนี้มีไว้สำหรับการพากย์หรือทำดนตรีประกอบที่สอดคล้องกับตัวละคร ซึ่งทั้งเอกลักษณ์เสียงและจังหวะภาพมีความสำคัญ

พื้นฐานเวอร์ชัน 1.0 กับทิศทางเวอร์ชัน 2.0 ที่เผยแพร่

การเปลี่ยนแปลงที่ชัดเจนที่สุดคือเสียงอ้างอิง ระยะเวลา บริบทวิดีโอ และความสามารถในการแก้ไข

ประกาศอย่างเป็นทางการของ ByteDance Seed สำหรับเวอร์ชัน 1.0 ให้พื้นฐานทางเทคนิค หน้า Seed Audio 2.0 ของ Dreamina อธิบายทิศทางผลิตภัณฑ์ที่ขยายออกไปด้านล่างนี้ รายละเอียด API สาธารณะและเกณฑ์วัดอิสระยังไม่ถูกสันนิษฐาน

ขอบเขตเวิร์กโฟลว์
พื้นฐาน Seed Audio 1.0
ทิศทาง 2.0 ที่เผยแพร่
ฉากที่สมบูรณ์
เสียงพูด อารมณ์ จังหวะเวลา เสียงบรรยากาศ และเอฟเฟกต์เสียงที่รวมเป็นหนึ่งจากพรอมป์ฉากเดียว
รักษาการเชื่อมโยงของบทสนทนา เสียงบรรยากาศ เสียงโฟลีย์ เอฟเฟกต์ และดนตรีในเวิร์กโฟลว์การผลิตที่ยาวขึ้น
เสียงอ้างอิง
โมเดลอย่างเป็นทางการรองรับการนำทางด้วยเสียงอ้างอิงที่ได้รับอนุญาต เครื่องมือปัจจุบันของไซต์นี้รับอินพุตเสียงรวมสูงสุดสามไฟล์
Dreamina ระบุว่ารองรับเสียงอ้างอิงสูงสุดหกไฟล์ โดยแต่ละไฟล์อ้างอิงแทนผู้พูดคนละคน
ระยะเวลา
ByteDance Seed ระบุความยาวสูงสุดสองนาทีในครั้งเดียว พร้อมการต่อเนื่องสำหรับเนื้อหาที่ยาวขึ้น
Dreamina ระบุว่าผลลัพธ์ที่สร้างหนึ่งครั้งสามารถยาวได้ถึงหกนาที
บริบทวิดีโอ
การอ้างอิงวิดีโอถูกอธิบายว่าเป็นทิศทางในอนาคตในหมายเหตุเปิดตัวเวอร์ชัน 1.0 อย่างเป็นทางการ
TV2A และ TAV2A ถูกนำเสนอเป็นเส้นทางที่รับรู้วิดีโอสำหรับการพากย์ บรรยากาศ เอฟเฟกต์ และการทำดนตรีประกอบ
จังหวะเวลาและแทร็ก
จังหวะเวลาบทสนทนาระดับพรอมป์ถูกบันทึกเป็นช่วง 100 มิลลิวินาที เลเยอร์เสียงอื่นๆ มีการควบคุมที่ละเอียดน้อยกว่า
ไทม์สแตมป์ แทร็กแยก และทรัพยากรเสียงที่ใช้ซ้ำได้ถูกนำเสนอเป็นเครื่องมือสำหรับการตรวจทานและแก้ไขมิกซ์
ขั้นตอนการทำงานของพรอมป์และการตรวจทาน

เขียนบรีฟการผลิตที่อยู่รอดจากการสร้างครั้งแรก

คำขอ Seed Audio 2.0 ที่ดีจะอธิบายความสัมพันธ์และจังหวะเวลาแทนการระบุคีย์เวิร์ดที่ขาดการเชื่อมต่อ สร้างพรอมป์เป็นรอบๆ เพื่อให้ผลลัพธ์ที่ล้มเหลววินิจฉัยได้ง่ายขึ้น และการแก้ไขรอบถัดไปเปลี่ยนเพียงตัวแปรสร้างสรรค์เดียว

ภาพคอนเซ็ปต์ใหม่ของการพากย์ที่รับรู้วิดีโอ โดยมีเสียงพูด บรรยากาศ เอฟเฟกต์ และเพลงจัดเรียงบนแทร็กรูปคลื่นที่ซิงโครไนซ์แยกกัน

ขั้นตอนที่ 1

กำหนดหน้าที่ด้านดราม่า

ระบุประเภทฉาก เป้าหมายระยะเวลา ภาษา ผู้พูด จุดเปลี่ยนอารมณ์ สถานที่ และจังหวะสุดท้าย สิ่งนี้ทำให้ทุกเลเยอร์เสียงในภายหลังมีจุดประสงค์ของการเล่าเรื่องร่วมกัน

ขั้นตอนที่ 2

จับคู่เสียงอ้างอิงกับผู้พูด

ใช้เฉพาะเสียงที่คุณได้รับอนุญาต เก็บผู้พูดหนึ่งคนต่อไฟล์อ้างอิง และอธิบายสิ่งที่เปลี่ยนได้โดยไม่ขอให้โมเดลเลียนแบบบุคคลที่ระบุตัวตนได้โดยไม่ได้รับความยินยอม

ขั้นตอนที่ 3

วางบทสนทนาและเหตุการณ์

ระบุลำดับของบทพูด การหยุด การกระทำ การเปลี่ยนแปลงบรรยากาศ และการเข้าเพลง เมื่อมีวิดีโอ ให้เชื่อมโยงคำสั่งเหล่านั้นกับการตัดภาพหรือจังหวะการกระทำที่มองเห็น แทนที่จะพึ่งพาอารมณ์ทั่วไป

ขั้นตอนที่ 4

ตรวจทานทีละเลเยอร์

ตรวจสอบเอกลักษณ์เสียง ความชัดเจน จังหวะเวลา ความต่อเนื่องของห้อง เอฟเฟกต์ และเพลงแยกกัน แก้ไขมิติที่อ่อนแอที่สุดก่อน เพื่อไม่ให้การแสดงที่มีประโยชน์ถูกทิ้งเพราะเลเยอร์พื้นหลังหนึ่งเลเยอร์ต้องปรับปรุง

ตัวอย่างทิศทางฉากที่สมบูรณ์

สร้างฉากละครวิทยุต้นฉบับความยาว 45 วินาทีในสถานีรถไฟที่เกือบว่างเปล่าในเวลากลางคืน ผู้พูดสมมติสองคนสนทนากันอย่างมีมารยาทเป็นภาษาอังกฤษ ให้เสียงทั้งสองแตกต่างกัน วางเสียงรถไฟไกลก่อนบทที่สอง เพิ่มเสียงฝีเท้าบนพื้นเปียกและเสียงฮัมไฟฟ้าเบาๆ จากนั้นใส่เพลงประกอบต้นฉบับเสียงต่ำในช่วงสิบวินาทีสุดท้าย เว้นช่วงหายใจสั้นๆ ระหว่างบทพูด และจบด้วยประกาศของสถานีที่ค่อยๆ จางหายไปพร้อมเสียงฝน

ความพร้อมใช้งานและการใช้งานอย่างรับผิดชอบ

รู้ว่าข้อกล่าวอ้างใดเป็นของโมเดล หน้าเว็บผลิตภัณฑ์ และไซต์นี้

Seed Audio 2.0 กำลังได้รับความสนใจในการค้นหาก่อนที่บันทึกทางเทคนิคและ API สาธารณะที่สมบูรณ์จะตรวจสอบได้ง่าย ขอบเขตเหล่านี้ช่วยให้ทีมประเมินเวิร์กโฟลว์โดยไม่เปลี่ยนคำอธิบายทางการตลาดเป็นการรับประกันที่ไม่มีหลักฐาน

Dreamina เผยแพร่เวิร์กโฟลว์ 2.0 ที่ระบุชื่อ ในขณะที่ไดเรกทอรีโมเดลสาธารณะของ ByteDance Seed ยังคงแสดง Seed Audio 1.0 โปรดถือว่าความพร้อมใช้งาน API สาธารณะ ราคา วันเผยแพร่ และเกณฑ์วัดยังไม่ได้รับการยืนยันจนกว่าแหล่งข้อมูลอย่างเป็นทางการจะบันทึกไว้

เสียงอ้างอิง วิดีโอ บทเพลง ทิศทางดนตรี และผลลัพธ์สุดท้ายอาจเกี่ยวข้องกับลิขสิทธิ์ ความเป็นส่วนตัว สิทธิในภาพลักษณ์ หรือสิทธิตามสัญญา ต้องได้รับความยินยอมและตรวจสอบข้อกำหนดของช่องทางการเข้าถึงที่ใช้สำหรับการสร้าง

เสียงที่ยาวขึ้นและมีหลายเลเยอร์ยังคงทำให้เกิดความขัดแย้งของจังหวะเวลา การบดบัง เอกลักษณ์ที่ไม่สอดคล้อง หรืออาร์ติแฟกต์ที่ไม่ต้องการ การตรวจทานโดยมนุษย์และการสร้างใหม่เฉพาะจุดยังคงเป็นส่วนหนึ่งของเวิร์กโฟลว์การผลิต

คำถามที่พบบ่อย

คำตอบเชิงปฏิบัติก่อนเลือกโหมดหรือเขียนพรอมป์

คำตอบเหล่านี้แยกทิศทาง 2.0 ที่เผยแพร่ออกจากความสามารถของตัวสร้างปัจจุบันบน seedaudio.co

Seed Audio 2.0 คืออะไร

Seed Audio 2.0 ถูกนำเสนอโดย Dreamina ในฐานะเวิร์กโฟลว์การสร้างเสียงแบบรวมศูนย์สำหรับบทสนทนา การแสดงเสียงที่มีอารมณ์ เสียงบรรยากาศ เสียงโฟลีย์ เอฟเฟกต์ ดนตรี การควบคุมเสียงอ้างอิง และการพากย์ที่รับรู้วิดีโอ หน้านี้ถือว่าคำอธิบายผลิตภัณฑ์นั้นเป็นแหล่งข้อมูล และไม่ได้อนุมานพฤติกรรม API ที่ไม่ได้บันทึกไว้

T2A, TA2A, TV2A และ TAV2A หมายความว่าอะไร

T2A เริ่มจากข้อความ TA2A เพิ่มเสียงอ้างอิง TV2A เพิ่มวิดีโออ้างอิง และ TAV2A รวมข้อความ เสียงอ้างอิงที่ได้รับอนุญาต และวิดีโอ บริบทที่เพิ่มเข้ามาจะกำหนดว่าเวิร์กโฟลว์จะมุ่งเน้นไปที่การประกอบฉาก เอกลักษณ์เสียง จังหวะภาพ หรือทั้งสามอย่าง

Seed Audio 2.0 แตกต่างจาก Seed Audio 1.0 อย่างไร

ความแตกต่างที่เผยแพร่เน้นที่เสียงอ้างอิงสูงสุดหกไฟล์ เอาต์พุตสูงสุดหกนาที เส้นทาง TV2A และ TAV2A ที่รับรู้วิดีโอ ไทม์สแตมป์ แทร็กแยก และทรัพยากรเสียงที่ใช้ซ้ำได้ แนวคิดฉากเต็มรูปแบบนั้นมีอยู่แล้วในโมเดล 1.0 อย่างเป็นทางการ

สร้างได้ยาวแค่ไหนและใช้เสียงอ้างอิงได้กี่ไฟล์?

Dreamina ระบุเอาต์พุตสูงสุดหกนาทีและเสียงอ้างอิงสูงสุดหกไฟล์สำหรับเวิร์กโฟลว์ 2.0 ข้อจำกัดเหล่านั้นไม่ใช้กับตัวสร้างที่ฝังไว้ที่นี่ ซึ่งปัจจุบันปฏิบัติตามข้อจำกัด Seed Audio 1.0 ของไซต์นี้

ตัวสร้างบนหน้านี้กำลังใช้ Seed Audio 2.0 หรือไม่

ไม่ใช่ มันคือตัวสร้าง Seed Audio 1.0 ตัวเดียวกับที่ใช้ในหน้าแรก มอบให้เพื่อให้คุณฝึกเขียนพรอมป์ฉากที่สมบูรณ์ ขณะที่ระบุเวอร์ชันโมเดลอย่างชัดเจน

มี API seed-audio-2.0 สาธารณะบน seedaudio.co หรือไม่

ยังไม่มีในปัจจุบัน API เสียงสาธารณะและตัวสร้างเว็บของไซต์ใช้การผสานรวม 1.0 ที่มีอยู่ การผสานรวม 2.0 ในอนาคตจะต้องมีเอกสารผู้ให้บริการที่ตรวจสอบแล้ว ฟิลด์คำขอ กฎการเรียกเก็บเงิน คอลแบ็ก และการจัดการผลลัพธ์ ก่อนที่จะประกาศได้

ผลลัพธ์ของ seedaudio 2.0 สามารถใช้เชิงพาณิชย์ได้หรือไม่

การใช้เชิงพาณิชย์ขึ้นอยู่กับข้อกำหนดของแพลตฟอร์มที่สร้างเสียงจริง และสิทธิที่ผูกกับพรอมป์ เสียง วิดีโอ บท และผลลัพธ์ทุกอย่าง ตรวจสอบข้อกำหนดเหล่านั้นและขออนุญาต แทนที่จะสมมติว่ามีใบอนุญาตสากล

เส้นทางการวิจัย

อ่านข้อกล่าวอ้างที่เผยแพร่และพื้นฐานทางเทคนิคเวอร์ชัน 1.0

แก่นข้อเท็จจริงของคู่มือ Seed Audio 2.0 นี้มาจากหน้าโมเดลของ Dreamina และบทความเปิดตัว Seed Audio 1.0 อย่างเป็นทางการของ ByteDance Seed มีการพยายามค้นหา X ผ่าน OpenCLI แต่พบขีดจำกัดอัตราเซสชัน ดังนั้นจึงไม่มีข้อกล่าวอ้างทางโซเชียลถูกนำเสนอเป็นหลักฐาน