
Seed Audio 2.0: สร้างเสียงได้ครบทุกองค์ประกอบจากข้อความ เสียง และวิดีโอ
Seed Audio 2.0 ถูกนำเสนอเป็นขั้นตอนการทำงานแบบรวมศูนย์สำหรับสร้างบทสนทนา การแสดงอารมณ์ เสียงบรรยากาศ เสียงโฟลีย์ เอฟเฟกต์เสียง และเพลงจากบรีฟที่เชื่อมโยงกันเพียงอันเดียว คู่มือนี้อธิบายโหมด T2A, TA2A, TV2A และ TAV2A ที่เผยแพร่ สิ่งที่เปลี่ยนไปจากพื้นฐานเวอร์ชัน 1.0 และสิ่งที่พร้อมใช้งานจริงบนเว็บไซต์นี้ในปัจจุบัน
โหมดอินพุตที่เผยแพร่
T2A, TA2A, TV2A และ TAV2A
ความจุเสียงอ้างอิง
เสียงอ้างอิงสูงสุดหกไฟล์ในเวิร์กโฟลว์ Dreamina
ความยาวเอาต์พุตที่เผยแพร่
สูงสุดหกนาทีต่อผลลัพธ์
ตัวสร้างบนหน้านี้
การผสานรวม Seed Audio 1.0 ในปัจจุบัน
เริ่มสร้าง Seed Audio 1.0 ออนไลน์
ใช้พื้นที่ทำงาน Seed Audio 1.0 ด้านล่างเพื่อสร้างฉากเสียงจากพรอมต์ เสียงอ้างอิง หรือรูปภาพอ้างอิง
อินพุต
สร้างเสียงด้วยพรอมต์เป็นหลัก พร้อมควบคุมเพิ่มเติม
การตั้งค่าเพิ่มเติม
ปรับแต่งอินพุตของคุณด้วยการควบคุมเพิ่มเติม
ประวัติ
การสร้าง Seed Audio 1.0 Preview ล่าสุดของคุณ
เข้าสู่ระบบเพื่อดูประวัติการสร้างของคุณ
ควบคุมฉากเสียงทั้งหมด ไม่ใช่กองคลิปแยกส่วน
แนวคิดเชิงปฏิบัติเบื้องหลัง Seed Audio 2.0 คือผู้สร้างควรสามารถอธิบายความสัมพันธ์ระหว่างเสียงพูด สถานที่ การกระทำ ดนตรี และจังหวะเวลาก่อนเริ่มสร้างเสียง เส้นเสียงที่ตึงเครียดควรอยู่ในบรรยากาศเดียวกันกับเสียงฝีเท้าที่ขัดจังหวะ ขณะที่คิวเพลงควรดังขึ้นตามจังหวะดราม่าที่ต้องการ
Dreamina อธิบายเวิร์กโฟลว์ที่ทำให้เลเยอร์เหล่านั้นเชื่อมโยงกันผ่านพรอมป์ข้อความ เสียงอ้างอิงที่ได้รับอนุญาต วิดีโออ้างอิงแบบไม่บังคับ ไทม์สแตมป์ และแทร็กแยกต่างหาก ทำให้ seedaudio 2.0 เกี่ยวข้องกับหนังสั้น การพากย์ พอดแคสต์ หนังสือเสียง โฆษณา เกม แอนิเมชัน และโปรเจกต์อื่นๆ ที่เสียงต้องตามฉาก ไม่ใช่แค่อ่านบท

สี่เส้นทางสู่ผลลัพธ์เสียงเดียวที่ตรวจสอบได้
Seed Audio 2.0 ถูกอธิบายผ่านชื่อโหมดสี่ชื่อ ความแตกต่างที่มีประโยชน์ไม่ใช่ตัวย่อ แต่เป็นวัสดุต้นทางที่โมเดลสามารถใช้เพื่อรักษาเอกลักษณ์เสียง ปฏิบัติตามจังหวะภาพ และสร้างมิกซ์ที่สมบูรณ์
T2A · ข้อความเป็นเสียง
เริ่มต้นด้วยบรีฟการผลิตที่เป็นลายลักษณ์อักษร กำหนดผู้พูด บทสนทนา การส่งเสียง สภาพแวดล้อม เหตุการณ์โฟลีย์ เอฟเฟกต์เสียง ทิศทางดนตรี จังหวะ และตอนจบที่ต้องการ เพื่อให้ผลลัพธ์ถูกเรียบเรียงเป็นฉากเดียว
TA2A · การควบคุมเสียงอ้างอิง
เพิ่มเสียงอ้างอิงที่ได้รับอนุญาตเมื่อเอกลักษณ์ของเสียงสำคัญ อธิบายว่ามิติใดบ้างที่เปลี่ยนได้ เช่น อารมณ์ จังหวะ สำเนียง ความเข้มข้น การหยุด หรือการแสดงออกที่ไม่ใช่คำพูด ขณะที่ยังคงจำเสียงผู้พูดได้
TV2A · เสียงที่รับรู้วิดีโอ
ส่งวิดีโออ้างอิงพร้อมทิศทางข้อความ เวิร์กโฟลว์ที่เผยแพร่ใช้การตัดภาพและจังหวะการกระทำเพื่อนำทางเสียงพากย์ บรรยากาศ เอฟเฟกต์ ดนตรี และการวางตำแหน่งทั่วทั้งการตัดต่อ
TAV2A · เสียงบวกวิดีโอ
รวมเสียงอ้างอิงที่ได้รับอนุญาตเข้ากับบริบทวิดีโอและทิศทางที่เขียนไว้ เส้นทางนี้มีไว้สำหรับการพากย์หรือทำดนตรีประกอบที่สอดคล้องกับตัวละคร ซึ่งทั้งเอกลักษณ์เสียงและจังหวะภาพมีความสำคัญ
การเปลี่ยนแปลงที่ชัดเจนที่สุดคือเสียงอ้างอิง ระยะเวลา บริบทวิดีโอ และความสามารถในการแก้ไข
ประกาศอย่างเป็นทางการของ ByteDance Seed สำหรับเวอร์ชัน 1.0 ให้พื้นฐานทางเทคนิค หน้า Seed Audio 2.0 ของ Dreamina อธิบายทิศทางผลิตภัณฑ์ที่ขยายออกไปด้านล่างนี้ รายละเอียด API สาธารณะและเกณฑ์วัดอิสระยังไม่ถูกสันนิษฐาน
เขียนบรีฟการผลิตที่อยู่รอดจากการสร้างครั้งแรก
คำขอ Seed Audio 2.0 ที่ดีจะอธิบายความสัมพันธ์และจังหวะเวลาแทนการระบุคีย์เวิร์ดที่ขาดการเชื่อมต่อ สร้างพรอมป์เป็นรอบๆ เพื่อให้ผลลัพธ์ที่ล้มเหลววินิจฉัยได้ง่ายขึ้น และการแก้ไขรอบถัดไปเปลี่ยนเพียงตัวแปรสร้างสรรค์เดียว

ขั้นตอนที่ 1
กำหนดหน้าที่ด้านดราม่า
ระบุประเภทฉาก เป้าหมายระยะเวลา ภาษา ผู้พูด จุดเปลี่ยนอารมณ์ สถานที่ และจังหวะสุดท้าย สิ่งนี้ทำให้ทุกเลเยอร์เสียงในภายหลังมีจุดประสงค์ของการเล่าเรื่องร่วมกัน
ขั้นตอนที่ 2
จับคู่เสียงอ้างอิงกับผู้พูด
ใช้เฉพาะเสียงที่คุณได้รับอนุญาต เก็บผู้พูดหนึ่งคนต่อไฟล์อ้างอิง และอธิบายสิ่งที่เปลี่ยนได้โดยไม่ขอให้โมเดลเลียนแบบบุคคลที่ระบุตัวตนได้โดยไม่ได้รับความยินยอม
ขั้นตอนที่ 3
วางบทสนทนาและเหตุการณ์
ระบุลำดับของบทพูด การหยุด การกระทำ การเปลี่ยนแปลงบรรยากาศ และการเข้าเพลง เมื่อมีวิดีโอ ให้เชื่อมโยงคำสั่งเหล่านั้นกับการตัดภาพหรือจังหวะการกระทำที่มองเห็น แทนที่จะพึ่งพาอารมณ์ทั่วไป
ขั้นตอนที่ 4
ตรวจทานทีละเลเยอร์
ตรวจสอบเอกลักษณ์เสียง ความชัดเจน จังหวะเวลา ความต่อเนื่องของห้อง เอฟเฟกต์ และเพลงแยกกัน แก้ไขมิติที่อ่อนแอที่สุดก่อน เพื่อไม่ให้การแสดงที่มีประโยชน์ถูกทิ้งเพราะเลเยอร์พื้นหลังหนึ่งเลเยอร์ต้องปรับปรุง
ตัวอย่างทิศทางฉากที่สมบูรณ์
สร้างฉากละครวิทยุต้นฉบับความยาว 45 วินาทีในสถานีรถไฟที่เกือบว่างเปล่าในเวลากลางคืน ผู้พูดสมมติสองคนสนทนากันอย่างมีมารยาทเป็นภาษาอังกฤษ ให้เสียงทั้งสองแตกต่างกัน วางเสียงรถไฟไกลก่อนบทที่สอง เพิ่มเสียงฝีเท้าบนพื้นเปียกและเสียงฮัมไฟฟ้าเบาๆ จากนั้นใส่เพลงประกอบต้นฉบับเสียงต่ำในช่วงสิบวินาทีสุดท้าย เว้นช่วงหายใจสั้นๆ ระหว่างบทพูด และจบด้วยประกาศของสถานีที่ค่อยๆ จางหายไปพร้อมเสียงฝน
รู้ว่าข้อกล่าวอ้างใดเป็นของโมเดล หน้าเว็บผลิตภัณฑ์ และไซต์นี้
Seed Audio 2.0 กำลังได้รับความสนใจในการค้นหาก่อนที่บันทึกทางเทคนิคและ API สาธารณะที่สมบูรณ์จะตรวจสอบได้ง่าย ขอบเขตเหล่านี้ช่วยให้ทีมประเมินเวิร์กโฟลว์โดยไม่เปลี่ยนคำอธิบายทางการตลาดเป็นการรับประกันที่ไม่มีหลักฐาน
Dreamina เผยแพร่เวิร์กโฟลว์ 2.0 ที่ระบุชื่อ ในขณะที่ไดเรกทอรีโมเดลสาธารณะของ ByteDance Seed ยังคงแสดง Seed Audio 1.0 โปรดถือว่าความพร้อมใช้งาน API สาธารณะ ราคา วันเผยแพร่ และเกณฑ์วัดยังไม่ได้รับการยืนยันจนกว่าแหล่งข้อมูลอย่างเป็นทางการจะบันทึกไว้
เสียงอ้างอิง วิดีโอ บทเพลง ทิศทางดนตรี และผลลัพธ์สุดท้ายอาจเกี่ยวข้องกับลิขสิทธิ์ ความเป็นส่วนตัว สิทธิในภาพลักษณ์ หรือสิทธิตามสัญญา ต้องได้รับความยินยอมและตรวจสอบข้อกำหนดของช่องทางการเข้าถึงที่ใช้สำหรับการสร้าง
เสียงที่ยาวขึ้นและมีหลายเลเยอร์ยังคงทำให้เกิดความขัดแย้งของจังหวะเวลา การบดบัง เอกลักษณ์ที่ไม่สอดคล้อง หรืออาร์ติแฟกต์ที่ไม่ต้องการ การตรวจทานโดยมนุษย์และการสร้างใหม่เฉพาะจุดยังคงเป็นส่วนหนึ่งของเวิร์กโฟลว์การผลิต
คำตอบเชิงปฏิบัติก่อนเลือกโหมดหรือเขียนพรอมป์
คำตอบเหล่านี้แยกทิศทาง 2.0 ที่เผยแพร่ออกจากความสามารถของตัวสร้างปัจจุบันบน seedaudio.co
Seed Audio 2.0 คืออะไร
Seed Audio 2.0 ถูกนำเสนอโดย Dreamina ในฐานะเวิร์กโฟลว์การสร้างเสียงแบบรวมศูนย์สำหรับบทสนทนา การแสดงเสียงที่มีอารมณ์ เสียงบรรยากาศ เสียงโฟลีย์ เอฟเฟกต์ ดนตรี การควบคุมเสียงอ้างอิง และการพากย์ที่รับรู้วิดีโอ หน้านี้ถือว่าคำอธิบายผลิตภัณฑ์นั้นเป็นแหล่งข้อมูล และไม่ได้อนุมานพฤติกรรม API ที่ไม่ได้บันทึกไว้
T2A, TA2A, TV2A และ TAV2A หมายความว่าอะไร
T2A เริ่มจากข้อความ TA2A เพิ่มเสียงอ้างอิง TV2A เพิ่มวิดีโออ้างอิง และ TAV2A รวมข้อความ เสียงอ้างอิงที่ได้รับอนุญาต และวิดีโอ บริบทที่เพิ่มเข้ามาจะกำหนดว่าเวิร์กโฟลว์จะมุ่งเน้นไปที่การประกอบฉาก เอกลักษณ์เสียง จังหวะภาพ หรือทั้งสามอย่าง
Seed Audio 2.0 แตกต่างจาก Seed Audio 1.0 อย่างไร
ความแตกต่างที่เผยแพร่เน้นที่เสียงอ้างอิงสูงสุดหกไฟล์ เอาต์พุตสูงสุดหกนาที เส้นทาง TV2A และ TAV2A ที่รับรู้วิดีโอ ไทม์สแตมป์ แทร็กแยก และทรัพยากรเสียงที่ใช้ซ้ำได้ แนวคิดฉากเต็มรูปแบบนั้นมีอยู่แล้วในโมเดล 1.0 อย่างเป็นทางการ
สร้างได้ยาวแค่ไหนและใช้เสียงอ้างอิงได้กี่ไฟล์?
Dreamina ระบุเอาต์พุตสูงสุดหกนาทีและเสียงอ้างอิงสูงสุดหกไฟล์สำหรับเวิร์กโฟลว์ 2.0 ข้อจำกัดเหล่านั้นไม่ใช้กับตัวสร้างที่ฝังไว้ที่นี่ ซึ่งปัจจุบันปฏิบัติตามข้อจำกัด Seed Audio 1.0 ของไซต์นี้
ตัวสร้างบนหน้านี้กำลังใช้ Seed Audio 2.0 หรือไม่
ไม่ใช่ มันคือตัวสร้าง Seed Audio 1.0 ตัวเดียวกับที่ใช้ในหน้าแรก มอบให้เพื่อให้คุณฝึกเขียนพรอมป์ฉากที่สมบูรณ์ ขณะที่ระบุเวอร์ชันโมเดลอย่างชัดเจน
มี API seed-audio-2.0 สาธารณะบน seedaudio.co หรือไม่
ยังไม่มีในปัจจุบัน API เสียงสาธารณะและตัวสร้างเว็บของไซต์ใช้การผสานรวม 1.0 ที่มีอยู่ การผสานรวม 2.0 ในอนาคตจะต้องมีเอกสารผู้ให้บริการที่ตรวจสอบแล้ว ฟิลด์คำขอ กฎการเรียกเก็บเงิน คอลแบ็ก และการจัดการผลลัพธ์ ก่อนที่จะประกาศได้
ผลลัพธ์ของ seedaudio 2.0 สามารถใช้เชิงพาณิชย์ได้หรือไม่
การใช้เชิงพาณิชย์ขึ้นอยู่กับข้อกำหนดของแพลตฟอร์มที่สร้างเสียงจริง และสิทธิที่ผูกกับพรอมป์ เสียง วิดีโอ บท และผลลัพธ์ทุกอย่าง ตรวจสอบข้อกำหนดเหล่านั้นและขออนุญาต แทนที่จะสมมติว่ามีใบอนุญาตสากล
อ่านข้อกล่าวอ้างที่เผยแพร่และพื้นฐานทางเทคนิคเวอร์ชัน 1.0
แก่นข้อเท็จจริงของคู่มือ Seed Audio 2.0 นี้มาจากหน้าโมเดลของ Dreamina และบทความเปิดตัว Seed Audio 1.0 อย่างเป็นทางการของ ByteDance Seed มีการพยายามค้นหา X ผ่าน OpenCLI แต่พบขีดจำกัดอัตราเซสชัน ดังนั้นจึงไม่มีข้อกล่าวอ้างทางโซเชียลถูกนำเสนอเป็นหลักฐาน
Dreamina / CapCut
หน้าโมเดล Dreamina Seed Audio 2.0
แหล่งข้อมูลสำหรับโหมดที่เผยแพร่ ข้อจำกัดหกเสียงอ้างอิง เอาต์พุตหกนาที การสร้างที่รับรู้วิดีโอ ไทม์สแตมป์ แทร็กแยก และเวิร์กโฟลว์การพากย์
ByteDance Seed
บทความเปิดตัว ByteDance Seed Audio 1.0
แหล่งข้อมูลสำหรับพื้นฐานเสียงเต็มฉาก จังหวะเวลาบทสนทนา ทิศทางเสียงอ้างอิง การสร้างสองนาที บริบทการประเมิน และทิศทางในอนาคตที่ระบุไว้