MiniMax H3 Lip Sync and Audio: ฉันป้อนเสียง 6 วินาทีให้มัน และลบเครื่องมือ 4 ตัวออกจากไปป์ไลน์ของฉัน

MiniMax H3 ลิปซิงก์และการแทนที่เสียงทำให้ห่วงโซ่การพากย์หกขั้นตอนของผมเหลือเพียงการเรียก API ครั้งเดียว สองเทคจริง ข้อจำกัดของเสียงอ้างอิงที่ไม่มีใครบอก และบิลตัวจริง

ผู้ชายสวมหูฟังพูดใส่ไมโครโฟนขณะอ่านสคริปต์

เฟรมวิทยุช่วงกะดึกที่ทุกเทคในบทความนี้เริ่มต้นจาก สร้างด้วย openai/gpt-image-2/text-to-image ที่คุณภาพสูง 2048x1152

ภาพนิ่งนี้เป็นอินพุตสำหรับบทช่วยสอนทั้งหมดด้านล่าง สร้างด้วย openai/gpt-image-2/text-to-image คุณภาพสูง 2048x1152

ลองนึกถึงครั้งสุดท้ายที่คุณทำช็อต 8 วินาทีเสร็จแล้วมันออกมาเงียบ

คุณส่งออกคลิป คุณเปิดแท็บ TTS แล้วพิมพ์บรรทัด คุณค้นหาในคลังเสียงเพื่อหาเสียงฝนและเสียงบรรยากาศห้อง คุณลากทุกอย่างลงในไทม์ไลน์แล้วเลื่อนรูปคลื่นไปมาจนกว่าปากจะหยุดโกหก จากนั้นคุณจ่ายค่าโมเดลซิงค์ปากแยกต่างหากเพื่อแก้ปากอยู่ดี สี่เครื่องมือ ไฟล์ wav สามไฟล์ หนึ่งชั่วโมง และการแสดงก็ยังรู้สึกเหมือนพากย์ทับ เพราะมันเป็นอย่างนั้น

ห่วงโซ่นั้นคือสิ่งที่ MiniMax H3 ลบออกอย่างเงียบๆ ไม่ใช่เพราะมัน "มีเสียง" (หลายโมเดลอ้างว่าเช่นนั้น) แต่เพราะมีช่องหนึ่งใน body ของคำขอที่แทบไม่มีใครทดสอบ: คุณสามารถใส่เสียงที่คุณมีอยู่แล้วเข้าไปได้ฟรี และรับเสียงนั้นกลับมาบนใบหน้า

ด้านล่างนี้คือการทดสอบสองเทคที่แยกช่องนั้นออกมา ราคาจริงของทุกขั้นตอนที่มันแทนที่ ข้อจำกัดที่เข้มงวดที่จะปฏิเสธคำขอของคุณ และบิลจริง

ประเด็นสำคัญ

  • หนึ่งคำขอคืนภาพ บทสนทนา เสียงบรรยากาศห้อง และการขยับปากพร้อมกัน ข้อความ ภาพ และเสียงถูกเข้ารหัสแยกกัน จากนั้น Omni Transformer ตัวเดียวจะทำนาย latents ของวิดีโอและเสียงร่วมกัน (Hugging Face model card, สิงหาคม 2026)
  • เสียงอินพุตฟรี แต่วิดีโออินพุตไม่ฟรี: MiniMax คิดเงินวิดีโออ้างอิงในอัตราเดียวกับเอาต์พุต ดังนั้นเนื้อหา 15 วินาทีเดียวกันจะมีค่าใช้จ่าย $0 เป็นเพลง และประมาณ $1.95 เป็นคลิปวิดีโอ
  • ข้อจำกัดที่เข้มงวด: คลิปเสียงสูงสุด 3 คลิป แต่ละคลิป 2 ถึง 15 วินาที รวม 15 วินาที และเสียงไม่สามารถเดินทางเดี่ยวได้ ต้องมีภาพหรือวิดีโออย่างน้อยหนึ่งรายการประกอบ
  • ในราคา $0.14 ต่อวินาทีสำหรับ 2K บน Atlas Cloud ช็อต 10 วินาทีแบบเต็มพร้อมเสียงมีค่าใช้จ่าย $1.40 ซึ่งน้อยกว่าการจ่ายค่าโมเดลซิงค์ปากเฉพาะ $0.22 ต่อวินาทีเพื่อแก้ไขคลิปที่คุณเรนเดอร์ไว้แล้ว

เสียงเปิด: สองเทค MiniMax H3 ซิงค์ปากและเสียง ต่างกัน 6 วินาที

ใส่หูฟังสำหรับอันนี้ ทั้งสองท่อนได้เฟรมพื้นฐานเดียวกัน บทสนทนาสองบรรทัดเดียวกัน และพรอมต์เดียวกันทุกคำ มีเพียงหนึ่งในนั้นที่ได้ยินเสียงบันทึก 6 วินาทีก่อน

fXlyer__czg

เปิดเสียงและใช้หูฟัง: ครึ่งซ้าย (เทค A ไม่มีเสียงอ้างอิง) เล่นในหูซ้าย ครึ่งขวา (เทค B มีเสียงอ้างอิง 6 วินาที) เล่นในหูขวา เฟรมเดียวกัน บรรทัดเดียวกัน พรอมต์เดียวกัน ทั้งสองเทค: minimax/h3/reference-to-video, 2K, 10 วินาที, ส่งออกเป็น 2560x1440 ที่ 24fps พร้อมแทร็กสเตอริโอ 32 kHz

เทค A ไม่มีอะไรนอกจากคำว่า "calm, low, magnetic male broadcast voice" ในพรอมต์ ดังนั้นมันจึงสร้างเสียงขึ้นมาเอง เทค B ได้รับเสียง 6.19 วินาทีของประโยคที่แตกต่างกันโดยสิ้นเชิง และบอกให้ถือเป็นเพียงจุดยึดเสียงต่ำ ไม่มีการพากย์ทับเทคใดๆ หลังจากนั้น ไม่มีเทคใดเข้าใกล้โมเดลซิงค์ปาก ในทั้งสองเทค ปากจะขยับตามเสียงที่โมเดลสร้างขึ้น เพราะปากและเสียงถูกสร้างขึ้นมาพร้อมกัน

ตัดสินเสียงต่ำด้วยหูของคุณเองดีกว่าที่จะเชื่อคำพูดของฉัน สิ่งที่ฉันบอกได้อย่างแน่นอนคือกลไก การตั้งค่า และบิล ซึ่งจะตามมา

ทำไม MiniMax H3 ซิงค์ปากและเสียงถึงทำลายห่วงโซ่การพากย์หกขั้นตอนของทุกคน

ห่วงโซ่เก่าไม่เคยเป็นเวิร์กโฟลว์จริงๆ มันเป็นงานซ่อมแซม

ImGr2NgcCCY

เปิดเสียง. คางคกและกิ้งก่า 3D แอนิเมชันกำลังคุยกันในเต็นท์ละครสัตว์ตอนกลางคืน พร้อมบรรยากาศของกรงที่อยู่ใต้บทสนทนา คลิปอ้างอิง MiniMax สำหรับเสียงเนทีฟ H3 รูปร่างปากบนตัวละครแอนิเมชันเป็นกรณีที่ยากที่สุดในการปลอม ซึ่งเป็นเหตุผลว่าทำไมอันนี้ถึงคุ้มค่ากับความสนใจ 20 วินาทีของคุณ

สามสิ่งที่พังอยู่เสมอ และมันพังด้วยเหตุผลเชิงโครงสร้าง ไม่ใช่เพราะโชคร้าย

ไทม์ไลน์อยู่ในมือคุณ โมเดลวิดีโอให้เฟรมมา โมเดล TTS ให้รูปคลื่นมา ไม่มีอะไรในเอาต์พุตทั้งสองที่รู้เกี่ยวกับอีกฝ่าย ดังนั้นการจัดตำแหน่งจึงเป็นการตัดสินใจของมนุษย์ที่ 30 เฟรมต่อวินาที โดยใช้สายตา ตอนตี 1 ทุกครั้งที่เรนเดอร์ใหม่ การตัดสินใจนั้นก็เริ่มต้นใหม่

การซิงค์ปากแบบแพทช์มีข้อจำกัด โมเดลซิงค์ปากเฉพาะจะควบคุมเฉพาะบริเวณปากของฟุตเทจที่มีอยู่แล้วเท่านั้น มันสามารถทำให้ปากตรงกับเสียงได้ แต่มันไม่สามารถทำให้กรามเกร็งก่อนพยัญชนะแข็ง หรือใส่ลมหายใจก่อนบรรทัด หรือปล่อยให้ไหล่ตกเมื่อประโยคจบ เพราะเฟรมเหล่านั้นถูกเรนเดอร์ก่อนที่ใครจะรู้ว่าตัวละครจะพูดอะไร คุณได้ความแม่นยำโดยไม่มีการแสดง ซึ่งให้ความรู้สึกไม่เป็นธรรมชาติ

การออกแบบเสียงเป็นโปรเจกต์ที่สอง ฝน เสียงบรรยากาศห้อง เสียงเก้าอี้ดังเอี๊ยด เส้นเบสที่อยู่ใต้บทสนทนา ทั้งหมดมาจากแหล่งที่แตกต่างกันและต้องปรับสมดุลกับเสียงที่ถูกแปะไว้

สิ่งที่ Audio VAE บอกคุณเกี่ยวกับ MiniMax H3 ซิงค์ปากและเสียง

นี่คือส่วนที่ไม่ใช่ภาษาการตลาด เพราะคุณสามารถเห็นมันได้ในชื่อไฟล์

ใน H3 ข้อความจะผ่าน H3-Encoder อินพุตภาพจะผ่านทั้ง H3-Encoder และ H3-VisualVAE และเสียงจะผ่าน H3-AudioVAE แบบสแตนด์อโลนเท่านั้น จากนั้น H3-Omni-Transformer จะทำนาย latents ของวิดีโอและเสียงร่วมกัน ซึ่งจะถูกถอดรหัสเป็นวิดีโอและเสียงสเตอริโอแยกกัน AudioVAE มีตัวเข้ารหัสและตัวถอดรหัสเดียวร่วมกันสำหรับช่องซ้ายและขวา ประมวลผลแต่ละช่องอย่างอิสระ รวมกลับเป็นสเตอริโอ และบีบอัดเสียง 32 kHz เป็นลำดับโทเค็น latents ที่อัตราเวลา 40 Hz (Hugging Face model card)

เมื่อ ComfyUI รองรับตั้งแต่วันแรก สถาปัตยกรรมนั้นปรากฏเป็นสองไฟล์แยกกันในโฟลเดอร์ VAE: minimax_h3_video_vae_fp16.safetensors และ minimax_h3_audio_vae_fp32.safetensors โหลดโดยตัวโหลด VAE แบบคู่ที่รับ path วิดีโอและ path เสียง (ComfyUI blog, สิงหาคม 2026) เสียงเป็นโมดอลลิตี้ที่โมเดลถูกสร้างขึ้นมา ไม่ใช่กระบวนการหลังการผลิตที่ถูกต่อท้าย

ลีดเดอร์บอร์ดเห็นพ้องต้องกันว่าสิ่งนั้นแสดงออกตรงไหน Artificial Analysis จัดให้ H3 อยู่อันดับหนึ่งในลีดเดอร์บอร์ดการตัดต่อวิดีโอด้วยเสียงที่ 1,130 Elo จากตัวอย่าง 5,043 ตัวอย่างแบบ blind-preference ในขณะที่จัดให้อยู่ในสามอันดับแรกทั้งในข้อความเป็นวิดีโอและภาพเป็นวิดีโอ (Artificial Analysis, กรกฎาคม 2026) ช่องว่างระหว่าง "ภาพดีมาก" และ "อันดับหนึ่ง" ในการจัดอันดับนั้นคือเสียง

เวิร์กโฟลว์ MiniMax H3 ซิงค์ปากและเสียง ตั้งราคาเทียบกับห่วงโซ่ที่มันแทนที่

วิธีที่ซื่อสัตย์ในการตัดสินนี้ไม่ใช่ความรู้สึก แต่คือการตั้งราคาห่วงโซ่เก่าทีละขั้น โดยใช้อัตราต่อวินาทีจริงสำหรับช็อต 10 วินาทีที่เสร็จสมบูรณ์ จากนั้นตั้งราคาสิ่งที่แทนที่

#ห่วงโซ่เก่า ทีละขั้นอะไรที่รันมันค่าใช้จ่ายของขั้นตอนนั้นด้วย MiniMax H3 ซิงค์ปากและเสียง
1เรนเดอร์ภาพนิ่งที่เงียบโมเดลวิดีโอ เช่น bytedance/seedance-2.0 ที่ $0.112/วินาที$1.12คำขอเดียวเดียวกัน
2พากย์เสียงบรรทัดminimax/speech-2.6-hdประมาณ $0.02 สำหรับ ~250 ตัวอักษรคำขอเดียวเดียวกัน
3หาหรือทำดนตรีประกอบminimax/music-2.6$0.15 ต่อแทร็กคำขอเดียวเดียวกัน
4วางเสียงบรรยากาศและเอฟเฟกต์เฉพาะจุดคลังเสียงบวกมือคุณตอนเย็นของคุณคำขอเดียวเดียวกัน
5จัดตำแหน่งทุกอย่างบนไทม์ไลน์ตัวตัดต่อบวกมือคุณตอนเย็นของคุณไม่มี
6มิกซ์ตัวตัดต่อบวกมือคุณตอนเย็นของคุณไม่มี
7แก้ไขปากsync/lipsync-v3 ที่ $0.22/วินาที$2.20ไม่มี
รวม4 โมเดลบวก 2 รอบ manualประมาณ $3.49 บวกตอนเย็นของคุณ1 คำขอ, $1.40

อ่านแถวที่ 7 สองครั้ง การแก้ไขปากของคลิปที่คุณเรนเดอร์ไว้แล้วมีค่าใช้จ่าย $0.22 ต่อวินาที ในขณะที่การสร้างช็อตทั้งหมดด้วยเสียง เสียงบรรยากาศ และการขยับปากมีค่าใช้จ่าย $0.14 ต่อวินาที การแก้ไขแพงกว่าต้นฉบับ การเปรียบเทียบเดียวนั่นคือข้อโต้แย้งทั้งหมด

ความไม่สมดุลที่ไม่มีใครพูดถึง: เสียงของคุณเองฟรี แต่วิดีโอของคุณเองไม่ฟรี

ตารางราคาแบบจ่ายตามการใช้งานของ MiniMax แยกรายการอินพุตออกจากเอาต์พุต สำหรับ H3 อินพุตเสียงฟรี ภาพอินพุตห้าภาพแรกฟรี และแต่ละภาพหลังจากนั้น $0.04 อินพุตวิดีโอคิดเงินตามระยะเวลาของคลิปอินพุตในอัตราความละเอียดเอาต์พุต ซึ่งคือ $0.13 ต่อวินาทีที่ 2K (MiniMax pricing docs, ตรวจสอบเมื่อ 3 สิงหาคม 2026) ดังนั้นเนื้อหาอ้างอิง 15 วินาทีเดียวกันไม่มีค่าใช้จ่ายเมื่อเป็นเพลง บันทึกเสียง หรือ VO ที่ลูกค้าให้มา และประมาณ $1.95 เมื่อเป็นคลิปวิดีโอ

นั่นคือเส้นที่ควรเปลี่ยนวิธีที่คุณสร้าง เสียงอ้างอิงเป็นพื้นผิวควบคุมที่ถูกที่สุดในโมเดล และเป็นสิ่งที่ไม่มีใครทดสอบ

อินพุตอ้างอิงจำนวนเท่าใดต่อคลิปรวมการคิดเงิน (MiniMax)
ภาพสูงสุด 9n/an/a5 ภาพแรกฟรี หลังจากนั้น $0.04 ต่อภาพ
วิดีโอสูงสุด 32 ถึง 15 วินาทีสูงสุด 15 วินาทีคิดเงินในอัตราเอาต์พุต, $0.13/วินาทีที่ 2K
เสียงสูงสุด 32 ถึง 15 วินาทีสูงสุด 15 วินาทีฟรี
ผสมใดๆสูงสุด 12 ไฟล์n/an/aตามข้างต้น ตามประเภท
เสียงเดี่ยวไม่อนุญาต เสียงต้องมีภาพหรือวิดีโอประกอบ และไม่สามารถใช้เป็นอินพุตเดียว

ข้อจำกัดจากสเปก H3-Base-Ref2VA ใน model card สคีมา Atlas Cloud สำหรับ minimax/h3/reference-to-video พูดสิ่งเดียวกันในภาษาของมันเอง: "ต้องมีอย่างน้อยหนึ่งภาพหรือวิดีโอ (เสียงเดี่ยวไม่ได้รับอนุญาต)"

เชิงอรรถสองข้อในด้านมิเตอร์ของ Atlas ทั้งคู่จากการรันของฉันเอง ไม่ใช่จากหน้าเอกสาร Atlas คิดเงินอัตราเดียวคงที่ $0.14 ต่อวินาทีเอาต์พุตสำหรับทั้งสามเอนด์พอยต์ H3 และวิดีโออ้างอิงที่ฉันแนบไปไม่ได้เพิ่มค่าธรรมเนียมแยกต่างหาก นั่นคือข้อสังเกตหนึ่งข้อ ไม่ใช่นโยบาย ดังนั้นควรจัดงบประมาณตามกฎของ MiniMax และถือว่าอัตราคงที่เป็นโบนัส Atlas ยังรับ resolution: "768P" และคิดเงินในอัตรา $0.14 เท่ากัน ซึ่งเป็นความแตกต่างที่ควรอ่านใน MiniMax H3 API pricing breakdown มากกว่าที่นี่

ทุกอย่างด้านล่างทำงานในแท็บเบราว์เซอร์เดียวบน Atlas Cloud: เฟรมพื้นฐาน เสียงอ้างอิง และทั้งสองเทค H3 บนคีย์ API เดียวกับลูป poll เดียว เอนด์พอยต์ H3 สามตัวต่างกันแค่รูปร่างของอินพุต ดังนั้น refers กลายเป็น image กลายเป็นข้อความธรรมดา และไม่มีอะไรอื่นในโค้ดของคุณที่เปลี่ยนไป

MiniMax H3 ซิงค์ปากและเสียง ทีละขั้น

ห้าขั้นตอน สองขั้นตอนเป็นการตั้งค่าราคาถูก สองขั้นตอนเป็นการทดสอบจริง และขั้นตอนสุดท้ายไม่มีค่าใช้จ่ายเพราะมันถูกออกแบบมาให้ล้มเหลว

ขั้นตอนที่ 1: สร้างเฟรมพื้นฐานด้วย GPT Image 2

เดโมนี้เป็นพิธีกรวิทยุกะดึก เลือกด้วยเหตุผลเดียว: การถ่าย close-up แนบปากเป็นองค์ประกอบเดียวที่คุณสามารถตัดสินการซิงค์ปากได้จริงๆ ช็อตกว้างช่วยให้โมเดลโกงได้

สองสิ่งในพรอมต์นี้ไม่สามารถต่อรองได้ ปากต้องเปิดเล็กน้อยในขณะที่กำลังพูดคำกลาง เพื่อให้เฟรมแรกดูเหมือนกำลังพูดอยู่แล้ว และต้องไม่มีข้อความใดๆ ในเฟรม เพื่อให้คำบรรยายแบบไดนามิกในภายหลังไม่สู้กับตัวอักษรที่ฝังอยู่

plaintext
1Photoreal cinematic still, 16:9, night-shift radio studio, tight chest-up framing on a
2man in his late thirties leaning into a vintage silver condenser microphone on a boom arm,
3foam windscreen inches from his lips, headphones half-off one ear. Warm tungsten desk lamp
4from camera-left carves his cheekbone; a red neon ON AIR sign burns out of focus behind his
5shoulder and bleeds crimson onto the mixing desk faders in the lower foreground. Rain streaks
6the studio window on the right, city lights smeared into bokeh. Thin cigarette smoke drifts
7through the lamp beam. Mouth slightly open mid-word, eyes down toward a paper script. Shot on
835mm, shallow depth of field, fine film grain, deep shadows, no text anywhere in the frame.
9

การตั้งค่าบน openai/gpt-image-2/text-to-image: คุณภาพ สูง ขนาด 16:9 ที่ 2048x1152 หนึ่งภาพ $0.009 ในรายการโมเดลเป็นราคาพื้นขั้นโทเค็น ไม่ใช่สิ่งที่คุณจ่ายจริง ที่ขนาดและคุณภาพนี้ ปุ่ม Run จะแสดงราคา $0.1745 ต่อการวาด ซึ่งคุณสามารถอ่านได้ในภาพหน้าจอด้านล่าง

อินเทอร์เฟซตัวสร้างภาพ AI แสดงพรอมต์และเอาต์พุตที่สร้างขึ้น

GPT Image 2 บน Atlas Cloud พร้อมพรอมต์ห้องวิทยุที่พิมพ์ไว้ คุณภาพสูงและ 16:9 2048x1152 ที่เลือกไว้ และเฟรมพื้นฐานที่เสร็จแล้วเรนเดอร์ในแผง OUTPUT_GPT Image 2 บน Atlas Cloud: พรอมต์ด้านบนทุกประการ คุณภาพสูง 16:9 ที่ 2048x1152 และการวาดครั้งที่สองของเฟรมเดียวกันใน OUTPUT_

ขั้นตอนที่ 2: สร้างเสียงอ้างอิง 6 วินาที

นี่คือขั้นตอนที่คนมักทำผิด ดังนั้นอ่านเหตุผลก่อนพรอมต์

เสียงอ้างอิงต้องพูด ประโยคที่แตกต่าง จากประโยคที่คุณต้องการในวิดีโอ มันเป็นเพียงจุดยึดเสียงต่ำ ไม่มีอะไรอื่น บทบรรทัดมาจากพรอมต์ ตัวอย่าง reference-to-video ของ MiniMax เองทำให้การแบ่งนี้ชัดเจน: มันระบุคลิปหนึ่งเป็นแทร็กต้นทางที่จะใช้ซ้ำบางส่วนสำหรับเพลง และคลิปที่สองเป็นเพียง "เสียงอ้างอิงเสียงต่ำ" โดยมีบทสนทนาใหม่เขียนไว้ในพรอมต์ หากเสียงอ้างอิงของคุณพูดคำเดียวกับที่คุณขอ คุณกำลังเชิญชวนให้โมเดลคัดลอกแทร็กแทนที่จะถ่ายโอนเสียง

plaintext
1You're listening to Night Line, ninety-one point four, and it is coming up on
2three in the morning.
3

การตั้งค่าบน minimax/speech-2.6-hd: เสียงผู้ชายทุ้มต่ำสงบๆ ใช้ได้ทุกแบบ และฉันเลือก Magnetic-voiced Male (English_magnetic_voiced_man) ตั้งค่า speed เป็น 0.95 เพื่อให้เทคอยู่ในกรอบเวลา 2 ถึง 15 วินาทีโดยมีที่ว่างเหลือ ปล่อย vol ไว้ที่ 1.0 และเก็บเอาต์พุตเป็น mp3 โมเดลราคา $0.08 ต่อ 1,000 ตัวอักษร ลดลงจาก $0.10 ซึ่งเป็นส่วนลด 20% ที่มีผลตั้งแต่เดือนสิงหาคม 2026 บรรทัดของฉันกลับมา 6.19 วินาที และคิดเงิน $0.00792

อินเทอร์เฟซตัวสร้างเสียงพร้อมอินพุตข้อความและเอาต์พุตรูปคลื่นเสียง

MiniMax Speech 2.6 HD บน Atlas Cloud พร้อมบรรทัดอ้างอิงพิมพ์ในช่องข้อความและรูปคลื่นเสียงที่เรนเดอร์ในแผง OUTPUT

MiniMax Speech 2.6 HD บน Atlas Cloud: หนึ่งบรรทัดเข้า หนึ่ง mp3 สั้นออก พร้อมส่วนลด 20% แสดงบนปุ่ม Run ภาพหน้าจอถูกจับขณะใช้เสียง Expressive Narrator เริ่มต้น ดังนั้นให้เปลี่ยนตัวเลือกเสียงเป็น Magnetic-voiced Male และลด Speed เป็น 0.95 ก่อนรัน

ขั้นตอนที่ 3: รัน MiniMax H3 ซิงค์ปากและเสียงพร้อมเสียงอ้างอิง

ตอนนี้ทั้งสองไฟล์ไปที่ refers พร้อมกัน: ภาพนิ่งจากขั้นตอนที่ 1 และ mp3 จากขั้นตอนที่ 2 นี่คือเทค B

พรอมต์ใช้โครงสร้างแบบแบ่งส่วนที่ H3 ถูกฝึกมา subject_definitions ระบุว่าใครและอะไรคือข้อมูลอ้างอิง detailed_description มีบทสนทนาอยู่ในแท็ก <d>[English] ...</d> และส่วนเสียงสองส่วนอธิบายมิกซ์ หากชื่อส่วนเหล่านี้ใหม่สำหรับคุณ คู่มือพรอมต์ MiniMax H3 ครอบคลุมโครงสร้างทั้งหมด มีเพียงสามฟิลด์ที่สำคัญสำหรับงานเสียง และทั้งหมดอยู่ที่นี่

plaintext
1subject_definitions:
2<Subject 1> is the man at the radio microphone in <Picture 1>, late thirties, headphones
3half-off one ear, red ON AIR neon behind his shoulder.
4<Picture 1> is the opening frame of the target video.
5<Audio 2> is the voice timbre reference for <Subject 1>: a calm, low, magnetic male
6broadcast voice. Reference the timbre only; do not reuse its words.
7
8summary:
9[image reference + audio timbre reference] A single continuous 10-second close-up. <Subject 1>
10delivers two lines straight into the microphone in the voice timbre of <Audio 2>, while the
11camera pushes in slowly. The mouth movement, the breath before each line, and the room tone
12are generated together.
13
14detailed_description:
15The shot opens exactly on <Picture 1>. Warm tungsten from camera-left, red neon bleeding onto
16the mixing desk in the foreground, rain on the window behind. <Subject 1> takes a short breath,
17tilts a few degrees toward the windscreen, and speaks, <d>[English] It's three in the morning,
18and I know exactly who's still awake.</d> As he speaks, his jaw and lips move naturally with
19every syllable; the plosives on "three" and "morning" are visible. He glances down at the script,
20then back up past the lens, and continues, <d>[English] So let's keep this between us.</d>
21Exactly as his voice stops, his lips settle closed and he exhales through his nose. Throughout,
22the camera executes one slow, deliberate push-in; the neon flickers once, faintly, around second
23seven. No on-screen text.
24
25overall_soundscape:
26Close, dry, booth-treated voice with a touch of proximity effect from the microphone. Under it:
27a low electrical hum from the desk, rain steady against the glass, one distant car passing on
28the wet street, the soft creak of the chair as he leans in, and a single audible breath before
29each line.
30
31non_diegetic_music:
32A sparse, slow late-night jazz double bass, very quiet, well under the voice, entering around
33second two and never rising above the dialogue.
34

การตั้งค่าบน minimax/h3/reference-to-video: ความละเอียด 2K ระยะเวลา 10 อัตราส่วนภาพ 16:9 และ refers เก็บทั้งสองไฟล์ ลำดับภายในอาร์เรย์ไม่สำคัญ มีเพียงแค่ต้องมีอย่างน้อยหนึ่งรายการที่เป็นภาพหรือวิดีโอ แถบเลื่อน Duration ค่าเริ่มต้นคือ 8 ดังนั้นให้เลื่อนมัน และเปลี่ยน Aspect Ratio ออกจาก adaptive หากคุณต้องการเฟรมที่คุณขอ

กับดักพารามิเตอร์สี่อย่าง ซึ่งสามอย่างทำให้ฉันเสียเงินแล้ว คีย์คือ ratio ไม่ใช่ aspect_ratio และการใส่ผิดจะส่งกลับ 400 เสมอให้ส่ง duration อย่างชัดเจน เพราะค่าเริ่มต้นสคีมาบอกว่า 8 แต่คำขอที่ไม่มีมันกลับมาเป็นไฟล์ 5 วินาที ในเอนด์พอยต์นี้ การส่ง image ควบคู่กับ refers จะเสร็จสมบูรณ์ คิดเงินเต็มจำนวน และทิ้งหนึ่งในนั้นอย่างเงียบๆ และถ้าคุณส่งเสียงเป็น data URL base64 ให้ระบุว่า data:audio/mp3 ไม่ใช่ data:audio/mpeg ความพยายามครั้งแรกของฉันตายด้วยข้อผิดพลาดนี้:

plaintext
1content[2].audio_url: invalid param: audio format ".mpeg" not allowed
2

อันนั้นอย่างน้อยก็ฟรี ซึ่งนำเราไปสู่วิธีที่มีประโยชน์ในการเรียนรู้ข้อจำกัด

อินเทอร์เฟซตัวสร้างวิดีโอ AI แสดงอินพุตพรอมต์ข้อความและเอาต์พุตวิดีโอ

เพลย์กราวด์ MiniMax H3 reference-to-video บน Atlas Cloud พร้อม mp3 ในช่องที่ 1 และเฟรมพื้นฐานในช่องที่ 2 ของ Reference Materials ความละเอียด 2K และคลิปที่เสร็จแล้วกำลังเล่นในแผง OUTPUT

MiniMax H3 reference-to-video บน Atlas Cloud: Reference Materials แสดง 2/9 โดยมี mp3 ในช่องที่หนึ่งและภาพนิ่งในช่องที่สอง ความละเอียด 2K คลิปที่เสร็จแล้วทางด้านขวา ภาพนี้รันที่ค่าเริ่มต้น 8 วินาทีของเพลย์กราวด์ ซึ่งเป็นเหตุผลว่าทำไมปุ่ม Run ถึงบอกว่า $1.12; สองเทคของฉันด้านบนรันที่ 10 วินาทีในราคา $1.40 ต่อเทค

ขั้นตอนที่ 4: รัน MiniMax H3 ซิงค์ปากและเสียงเทคควบคุม

เปลี่ยนอินพุตหนึ่งรายการและการกล่าวถึงทั้งหมด ลบ mp3 ออกจาก refers เพื่อให้เหลือเพียงภาพ ลบคำจำกัดความ <Audio 2> ตัดวลี "in the voice timbre of <Audio 2>" ออกจาก summary และเปลี่ยนแท็กวงเล็บเป็น [image reference] ไม่มีอะไรอื่นเปลี่ยนแปลง และการตั้งค่ายังคงเหมือนเดิม: 2K, 10 วินาที, 16:9

นั่นคือสิ่งที่ทำให้มันเป็นการควบคุมแทนที่จะเป็นความพยายามครั้งที่สอง ตอนนี้โมเดลไม่มีจุดยึดเสียงต่ำ ดังนั้นมันจึงสร้างเสียงขึ้นมาจากคำอธิบายที่เป็นลายลักษณ์อักษรและซิงค์ปากกับเสียงที่มันเพิ่งสร้างขึ้นมา ทั้งสองเทคกลับมาที่ 10.13 วินาทีและคิดเงิน $1.40 ต่อเทค ถึงเซ็นต์

WnfqR2I-a-8

เปิดเสียง. เทค A เพียงอย่างเดียว: เฟรมเดียวกัน บรรทัดเดียวกัน ไม่มีเสียงอ้างอิง เสียงที่นี่เป็นสิ่งประดิษฐ์ของโมเดล และปากยังคงขยับตามมัน

สองเทค หนึ่งตัวแปร นั่นคือการทดลองที่ถูกที่สุดในบทความนี้ทั้งหมด และเป็นเพียงอันเดียวที่บอกคุณว่าช่องเสียงนั้นทำอะไรจริงๆ

ขั้นตอนที่ 5: จงใจทำให้ MiniMax H3 ซิงค์ปากและเสียงพัง

ขั้นตอนสุดท้ายฟรี และคุ้มค่าที่จะทำสักครั้งเพื่อให้คุณจำความล้มเหลวได้ตอนตี 2

ใส่ mp3 ใน refers และไม่มีอะไรอื่น ไม่มีภาพ ไม่มีวิดีโอ แค่เสียง จากนั้นส่ง

plaintext
1curl -s https://api.atlascloud.ai/api/v1/model/generateVideo \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  -H "Content-Type: application/json" \
4  -d '{
5    "model": "minimax/h3/reference-to-video",
6    "prompt": "A man at a radio microphone speaks two lines into the windscreen.",
7    "refers": [{"url": "https://example.com/voice-reference.mp3", "type": "audio"}],
8    "resolution": "2K",
9    "duration": 10,
10    "ratio": "16:9"
11  }'
12

นี่คือส่วนที่ควรรู้ เพราะมันไม่ใช่สิ่งที่สคีมาบอกเป็นนัย คำขอ submit ส่งคืน HTTP 200 พร้อม task id ปกติและ "status": "processing" ดังนั้นไคลเอนต์ที่ไร้เดียงสาจะคิดว่ามันทำงาน ยี่สิบสามมิลลิวินาทีต่องานก็ตาย:

plaintext
1{
2  "status": "failed",
3  "error_code": 1010001,
4  "error": "generate task failed, minimaxh3: reference-to-video requires at least one reference image or video",
5  "latency_ms": 23
6}
7

ไม่มีฟิลด์ price ปรากฏบน prediction นั้น ดังนั้นมันไม่มีค่าใช้จ่าย บทเรียนเชิงปฏิบัติเกี่ยวกับโค้ดของคุณ ไม่ใช่กระเป๋าเงินของคุณ: การได้รับ 200 เมื่อ submit ไม่ใช่ความสำเร็จ ให้ poll id และตรวจสอบ status ก่อนที่คุณจะคิดว่าคุณมีคลิป

อีกสี่วิธีในการผลักดัน MiniMax H3 ซิงค์ปากและเสียง

การทดสอบสองเทคคือการทดลองที่มีประโยชน์น้อยที่สุด นี่คือจุดที่ช่องเดียวกันไปต่อ

ช็อตเดียว หลายภาษา เก็บเฟรม เก็บการบล็อก เปลี่ยนแท็กภาษาภายใน <d>...</d> แล้วรันอีกครั้ง ปากจะขยับตามภาษาใหม่แทนภาษาเก่า เพราะปากและเสียงออกมาจาก forward pass เดียวกัน model card ระบุการสนับสนุนบทสนทนาที่เสถียรสำหรับ 11 ภาษา: อาหรับ จีน อังกฤษ ฝรั่งเศส เยอรมัน อิตาลี ญี่ปุ่น เกาหลี โปรตุเกส รัสเซีย และสเปน โดยมีภาษาอื่นๆ ที่รองรับในระดับที่แตกต่างกัน คลิปทั้งสองนี้เป็นเทรลเลอร์เดียวกันกับแทร็กเสียงที่แตกต่างกัน และ MiniMax ยังตัดเวอร์ชันภาษาฝรั่งเศสและเวอร์ชันที่ไม่มีพากย์จากชุดเดียวกัน

hj7ZId3KOKk

เปิดเสียง. เวอร์ชันพากย์ภาษาอังกฤษ: close-up นักบินอวกาศบนดาวเคราะห์สีส้มฝุ่น พากย์และดนตรีประกอบมาพร้อมกับภาพ งานเทรลเลอร์คือสามฟิลด์พรอมต์เดียวกันกับซาวด์สเคปที่แตกต่างกัน

Hv62FGyBNPM

เปิดเสียง. เวอร์ชันภาษาญี่ปุ่น เฟรมต่อเฟรม เทรลเลอร์เดียวกัน ไม่มีการพากย์ทับและไม่มีเซสชัน VO แยกต่างหาก

ร้องเพลง โดยใช้ท่อนฮุกที่คุณมีอยู่แล้ว นี่คือจุดที่เสียงอินพุตฟรีหยุดเป็นเชิงอรรถ วางท่อนฮุกหรือเครื่องดนตรีที่มีอยู่แล้วลงใน refers ที่ 15 วินาทีหรือน้อยกว่า อธิบายการแสดง และตัวละครจะแสดงตามนั้น คุณไม่ได้จ่ายค่าเพลงที่คุณนำมา

zui3Zw_UWnY

เปิดเสียง. วงดนตรีตัดในลุคกล้องวิดีโอแบบย้อนยุค หลังเวทีสู่การแสดง โดยมีแทร็กและภาพมาพร้อมกัน นั่นคือรูปร่างที่งานมิวสิกวิดีโอส่วนใหญ่ต้องการจริงๆ

คนสองคนคุยกันยากกว่าคนเดียว ผู้พูดคนเดียวใน close-up เป็นกรณีง่าย ซึ่งเป็นเหตุผลว่าทำไมบทความนี้ถึงใช้ สำหรับบทสนทนาระหว่างสองตัวละคร ให้ระบุพวกเขาอย่างชัดเจนตามที่ตัวอย่างของ MiniMax เองทำ ด้วย <Subject 1> (S1) และ <Subject 2> (S2) ที่แนบกับแต่ละบรรทัด <d> และคาดว่าจะต้อง rerun เมื่อโมเดลได้ลำดับหรือการระบุผิด ให้จัดงบประมาณสองรอบสำหรับบทสนทนาสองคน

บรรยากาศโดยไม่ต้องพูดสักคำ overall_soundscape เป็นฟิลด์ของมันเอง และมันทำงานได้โดยไม่มีบทสนทนาเลย ฝนกระทบกระจก เสียงเก้าอี้ดังเอี๊ยด เสียงตู้เย็นฮัม ห้องเอง ทำให้เอนด์พอยต์เดียวกันนี้เป็นเครื่องมือ ASMR และบรรยากาศที่ถูกต้องตามกฎหมาย และเป็นกรณีการใช้งานเดียวที่ปากไม่สำคัญ

ข้อจำกัดที่ซื่อสัตย์ข้อหนึ่งจากสองเทคของฉัน: การสร้างใน pass เดียวกันหมายความว่าปากและเสียงสอดคล้องกัน และไม่ได้หมายความว่ารายละเอียดทางกายภาพทุกอย่างในเฟรมสอดคล้องกับเสียง บรรทัดยาวที่ยัดเยียดในระยะเวลาสั้น คำแนะนำการแสดงที่คลุมเครือ และฉากที่มีผู้พูดหลายคน ล้วนทำให้ผลลัพธ์แย่ลง ดูคลิปของคุณก่อนส่งออก เช่นเดียวกับที่คุณดูเทคจากนักแสดงที่เป็นมนุษย์

MiniMax H3 ซิงค์ปากและเสียงมีค่าใช้จ่ายเท่าไรจริงๆ

ทุกตัวเลขด้านล่างเป็นค่าใช้จ่ายจริงบนบัญชีจริง ดึงมาหลังจากข้อเท็จจริง ฟิลด์ price บน prediction จะเติมช้า ดังนั้นการ poll จนกว่า completed มักจะไม่คืนค่าใดๆ ให้ดึง id ใหม่เพื่อรับตัวเลข

ขั้นตอนโมเดลอะไรที่รันคิดเงิน
1openai/gpt-image-2/text-to-image1 เฟรมพื้นฐาน คุณภาพสูง 2048x1152$0.1745 (แสดงบนปุ่ม Run)
2minimax/speech-2.6-hd99 ตัวอักษร, 6.19 วินาทีของเสียงอ้างอิง$0.01
3minimax/h3/reference-to-videoเทค B, 10 วินาทีที่ 2K, ภาพ+เสียงใน refers$1.40
4minimax/h3/reference-to-videoเทค A, 10 วินาทีที่ 2K, ภาพเท่านั้น$1.40
5minimax/h3/reference-to-videoคำขอเสียงเท่านั้น ล้มเหลวใน 23ms$0.00
การทดลองทั้งหมด ทั้งสองเทคประมาณ $2.98

บันทึกทางบัญชีสองข้อ เพราะความซื่อสัตย์ถูกกว่าเชิงอรรถ data URL audio/mpeg ที่ผิดในขั้นตอนที่ 3 ก็ไม่มีค่าใช้จ่ายเช่นกัน เพราะมัน 400 ตอน submit การปฏิเสธฟรี แต่คำขอที่มีรูปแบบดีแต่อินพุตเสียไม่ฟรี ดังนั้น URL อ้างอิงที่ 404 อย่างเงียบๆ จะยังคิดเงินคุณเต็มจำนวน และการจับภาพเพลย์กราวด์ในภาพหน้าจอขั้นตอนที่ 3 เป็นการรัน H3 ครั้งที่สามที่ค่าเริ่มต้น 8 วินาทีของแผง ซึ่งคิดเงิน $1.12 เพิ่มเติมจากตาราง การรันนั้นมีไว้สำหรับบทความนี้ ไม่ใช่สำหรับการทดลอง

ห่วงโซ่เก่า ราคาในตารางด้านบน ประมาณ $3.49 สำหรับหนึ่งช็อต 10 วินาทีบวกหนึ่งเย็นของการจัดตำแหน่งด้วยมือ นี่คือสองช็อต 10 วินาทีที่สมบูรณ์พร้อมเสียง A/B ควบคุม และคำขอที่จงใจทำให้พังสองครั้ง ในราคาที่น้อยกว่า

อย่างไรก็ตาม H3 เป็นเครื่องมือที่ผิดสำหรับงานหลายอย่างที่ผู้คนจะพยายามใช้มัน และทางเลือกก็ถูกกว่า

สิ่งที่คุณต้องการจริงๆโมเดลที่ถูกต้องราคาเหตุผล
ภาพบุคคลหนึ่งภาพบวกไฟล์เสียงที่มีอยู่หนึ่งไฟล์ เป็นหัวพูดbytedance/avatar-omni-human-v1.5$0.12/วินาทีสร้างมาเพื่อเสียงเป็นวิดีโอโดยเฉพาะ และความยาวเอาต์พุตเป็นไปตามเสียงของคุณ
คลิปที่เสร็จแล้วที่ปากต้องพูดภาษาใหม่sync/lipsync-v3$0.22/วินาทีH3 ไม่แก้ไขเรนเดอร์ที่มีอยู่ของคุณ และการแพทช์คืองานของโมเดลนี้พอดี
การแก้ไขปากที่ถูกที่สุดบนหัวพูดveed/lipsync$0.013/วินาทีถูกกว่าประมาณสิบเท่า และมันแตะเฉพาะปาก ไม่ใช่การแสดง
ช็อตที่กำกับทั้งช็อต พร้อมเสียงต่ำ บรรยากาศ และดนตรีประกอบร่วมกันminimax/h3/reference-to-video$0.14/วินาทีภาพและเสียงมาจาก pass เดียว ดังนั้นการแสดงถูกออกแบบมา ไม่ใช่ซ่อมแซม

หากคุณกำลังเลือกระหว่าง H3 กับคู่แข่งที่ใกล้เคียงที่สุดในงานตัวละครมากกว่าเสียง การเปรียบเทียบ Seedance 2.5 เป็นการอ่านที่ดีกว่า และหากคุณสงสัยว่าน้ำหนักแบบเปิดทำให้ฟรีหรือไม่ มันไม่ได้ทำให้เร็ว: 2K ยังคงมาจากฝั่ง API และรายงานจากชุมชนระบุว่า 480p ท้องถิ่น 10 วินาทีใช้เวลาหลายนาทีแทนที่จะเป็นวินาทีบนการ์ดผู้บริโภค

ข้อสังเกตที่ซื่อสัตย์หนึ่งข้อเกี่ยวกับเสียง เพลง และสิทธิ์

การอัปโหลดฟรีไม่เหมือนกับการใช้ฟรี เพลงที่คุณไม่ได้เขียนและเสียงที่ไม่ใช่ของคุณเป็นสิทธิ์สองอย่างที่แยกจากกัน และทั้งสองอย่างไม่ได้ถูกให้โดย API ที่ไม่คิดเงินคุณสำหรับการอัปโหลด ใช้บันทึกของคุณเอง เพลงที่ได้รับอนุญาต หรือเสียงสังเคราะห์ที่คุณสร้างขึ้นเอง ซึ่งเป็นสิ่งที่ขั้นตอนที่ 2 ทำ

นอกจากนี้ น้ำหนักชุมชนมีข้อจำกัดด้านอาณาเขตที่ปัจจุบันไม่ครอบคลุม EU สหราชอาณาจักร เกาหลีใต้ หรือสหรัฐอเมริกา โดยมีช่องทางการอนุญาตอย่างเป็นทางการให้เลือกแทน นั่นเป็นเรื่องที่ยาวกว่า และมีบอกไว้ใน คู่มือน้ำหนักเปิด MiniMax H3

MiniMax H3 ซิงค์ปากและเสียง: คำถามที่พบบ่อย

MiniMax H3 ซิงค์ปากและเสียงสร้างเสียงใน pass เดียวกันจริงๆ หรือเป็นการพากย์ทับทีหลัง?

Pass เดียวกัน ข้อความผ่าน H3-Encoder ภาพผ่าน H3-Encoder บวก H3-VisualVAE และเสียงผ่าน H3-AudioVAE แบบสแตนด์อโลน H3-Omni-Transformer ทำนาย latents ของวิดีโอและเสียงร่วมกัน ซึ่งจากนั้นจะถูกถอดรหัสแยกกันเป็นภาพและเสียงสเตอริโอ 32 kHz ไม่มีอะไรถูกวางซ้อนทีหลัง ซึ่งเป็นเหตุผลว่าทำไมปาก ลมหายใจ และเสียงบรรยากาศห้องจึงเป็นของเทคเดียวกัน

ฉันสามารถป้อนเพลงหรือเสียงของตัวเองลงใน MiniMax H3 ซิงค์ปากและเสียงได้ไหม และมีค่าใช้จ่ายเพิ่มหรือไม่?

ได้ และไม่ ตารางราคาแบบจ่ายตามการใช้งานของ MiniMax ระบุอินพุตเสียง H3 ว่าฟรี ความไม่สมดุลที่ต้องระวังคือวิดีโอ: อินพุตวิดีโอคิดเงินตามระยะเวลาที่อัตราเอาต์พุต $0.13 ต่อวินาทีที่ 2K ดังนั้นวิดีโออ้างอิง 15 วินาทีมีค่าใช้จ่ายประมาณ $1.95 ในขณะที่เสียงอ้างอิง 15 วินาทีมีค่าใช้จ่าย $0

ทำไม MiniMax H3 ซิงค์ปากและเสียงถึงปฏิเสธคำขอที่มีแค่เสียง?

เพราะเสียงเป็นประเภทอ้างอิงเดียวที่ไม่สามารถเดินทางเดี่ยวได้ ต้องมีภาพหรือวิดีโออย่างน้อยหนึ่งรายการประกอบ ข้อจำกัดที่เหลือ จากสเปก H3-Base-Ref2VA: ภาพสูงสุด 9 ภาพ วิดีโอสูงสุด 3 คลิป และคลิปเสียงสูงสุด 3 คลิป แต่ละคลิปวิดีโอหรือเสียงระหว่าง 2 ถึง 15 วินาที รวม 15 วินาทีต่อประเภท และสูงสุด 12 ไฟล์ในทุกประเภทรวมกันในหนึ่งคำขอ

MiniMax H3 ซิงค์ปากและเสียงจะคงอยู่ตลอดทั้งคลิปหรือแค่บรรทัดแรก?

สำหรับผู้พูดคนเดียวที่มีพื้นที่หายใจ มันคงอยู่ตลอดทั้งคลิปมากกว่าจะลงหนึ่งบรรทัดแล้วลอย สามสิ่งที่ทำให้มันพัง: การยัดสคริปต์ยาวในระยะเวลาสั้น คำแนะนำการแสดงที่คลุมเครือหรือขาดหายไป และฉากที่มีผู้พูดหลายคนซึ่งโมเดลต้องตัดสินใจว่าใครจะพูดเมื่อไหร่ กำหนดผู้พูดที่มีป้ายชื่อให้แต่ละบรรทัดและมีวินาทีเพียงพอที่จะพูด

MiniMax H3 ซิงค์ปากและเสียงจำเป็นต้องพากย์ใหม่สำหรับภาษาอื่นหรือไม่?

ไม่ เปลี่ยนแท็กภาษาภายในมาร์กอัปบทสนทนา จาก <d>[English] ...</d> เป็น <d>[Japanese] ...</d> และรันพรอมต์เดียวกันอีกครั้ง ปากถูกสร้างขึ้นด้วยเสียงใหม่ ดังนั้นมันจึงตรงกับภาษาใหม่แทนภาษาเก่า model card ระบุการสนับสนุนบทสนทนาที่เสถียรสำหรับ 11 ภาษา

การรัน MiniMax H3 ซิงค์ปากและเสียงในเครื่องถูกกว่าหรือไม่?

ถูกกว่าต่อคลิป แต่แพงในทุกด้านอื่น น้ำหนักเปิด แต่รายงานจากชุมชนของการรันในเครื่องบนการ์ดผู้บริโภค 16GB วัดการสร้าง 480p 10 วินาทีในหน่วยนาที การโฮสต์เองทำให้เรนเดอร์ที่ด้านสั้น 768 และ 2K ยังคงมาจากขั้นตอนการสร้างใหม่ฝั่ง API เพิ่มข้อจำกัดด้านอาณาเขตในสัญญาอนุญาตชุมชน และ API ยังคงเป็นเส้นทางที่ใช้งานได้จริงสำหรับงานที่เสร็จสมบูรณ์

โมเดลล่าสุด

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด