Seedance 2.5 ใช้งานได้แล้ววันนี้ — ที่แรกบน Atlas Cloud

ฉันสร้างมิวสิควิดีโอ MiniMax H3 จากฮุคความยาว 32 วินาทีในราคา $4.80 แทร็กเสียงทำให้ฉันประหลาดใจ

ผมป้อนท่อนฮุคยาว 32 วินาทีให้ MiniMax H3 เป็นเสียงอ้างอิงฟรี ได้ช็อตที่ล็อกจังหวะกลับมา 4 ช็อต แล้วตัดต่อมิวสิกวิดีโอ MiniMax H3 จริงๆ ด้วยเงิน $4.80 รวมพรอมต์และใบเสร็จแล้ว

บรรณาธิการวิดีโอทำงานที่คอนโซลพร้อมจอมอนิเตอร์วิดีโอหลายจอ

ห้องคัลเลอร์เกรดช่วงดึก จอมอนิเตอร์หกจอแสดงภาพช็อตเดียวกันหกช็อตของนักร้องผมสีเงินคนเดียวกัน_หก_ ช็อต ศิลปินหนึ่งคน เพลงหนึ่งเพลง สร้างด้วย openai/gpt-image-2/text-to-image .

ผู้ใช้ Suno สร้างเพลงประมาณ 7 ล้านเพลงต่อวัน คร่าวๆ เทียบเท่าแคตตาล็อก Spotify ทั้งหมดทุกสองสัปดาห์ (TechCrunch กุมภาพันธ์ 2026) แทบไม่มีเพลงไหนเลยที่จะมีรูปภาพประกอบ ไม่ใช่เพราะรูปภาพเป็นไปไม่ได้ แต่เพราะเส้นทางดั้งเดิมต้องผ่านเครื่องมือสี่อย่าง: สร้างภาพนิ่ง, ทำให้เคลื่อนไหว, ใช้การซิงค์ปากแยกต่างหาก, จากนั้นแก้ไขทุกอย่างในการตัดต่อ ทุกขั้นตอนจะสูญเสียใบหน้า เสื้อผ้า หรือจังหวะ

ดังนั้นฉันจึงข้ามขั้นตอนเหล่านั้น ฉันตัดท่อนฮุกยาว 8 วินาทีใส่ลงในช่องอ้างอิงของโมเดลวิดีโอโดยตรง แล้วกดรัน มันไม่คิดเงินค่าเสียงให้ฉันเลย

จากนั้นฉันก็แยกไฟล์ mp4 ที่เสร็จแล้วออกมาเพื่อตอบคำถามเดียวที่ไม่มีใครบนอินเทอร์เน็ตตอบตรงๆ: เสียงที่ออกมาจากโมเดลเป็นเพลงของฉันจริง หรือเป็นสิ่งที่มันสร้างขึ้นมาเองที่ฟังดูคล้ายๆ กันเท่านั้น? ฉันวัดมันแล้ว คำตอบไม่ใช่สิ่งที่ฉันคาดหวัง และมันเปลี่ยนวิธีที่คุณควรตัดต่อสิ่งนี้

ประเด็นสำคัญ

  • เสียงอ้างอิงฟรี MiniMax H3 คิดเงินเฉพาะวินาทีที่ส่งออกเท่านั้น เสียงอ้างอิง 8 วินาทีสี่อันของฉันเพิ่ม $0.00 ในบิล วิดีโออ้างอิงต่างหากที่มีราคาแพง
  • 15 วินาทีคือขีดจำกัดต่อการสร้างครั้งเดียว ไม่ใช่ต่อโปรเจกต์ ตัดเพลงออกเป็นส่วนๆ ถ่ายส่วนละหนึ่งช็อต แล้วต่อกัน การตัดต่อ 32 วินาทีของฉันคือการสร้างสี่ครั้ง
  • เขียนท่อนฮุกที่ 120 BPM หนึ่งบาร์ยาว 2.000 วินาทีพอดี ดังนั้นค่า duration เป็นจำนวนเต็มวินาทีของ H3 จะลงตรงเส้นบาร์โดยไม่ต้องปรับแต่งด้วยมือ 8 วินาที = 4 บาร์
  • เสียงที่ส่งออกคือแทร็กของคุณ ตรงกันตัวอย่างแม่นยำ ฉันวัดความสัมพันธ์ของรูปคลื่นได้ 0.892 ที่ระยะหน่วงศูนย์ระหว่างอินพุตของฉันและมิกซ์สเตอริโอที่ H3 ส่งออก มันไม่ได้ถูกสร้างขึ้นมาใหม่ คุณยังคงต้องการวางมาสเตอร์กลับเข้าไปในคัทสุดท้าย ด้วยเหตุผลที่ต่างออกไป (ด้านล่าง)
  • ค่าใช้จ่ายจริงทั้งหมด: $7.53 จากการสร้างเก้าครั้งรวมถึงครั้งที่ล้มเหลว สี่ช็อตที่เข้าคัทสุดท้ายบวกกับเพลงและเฟรมฐานรวมเป็น $4.80

มิวสิควิดีโอ MiniMax H3 ที่ฉันตัดจากท่อนฮุก 32 วินาทีเดียว

เปิดเสียง นี่คือการสร้างสี่ครั้งแยกกัน ต่อกันโดยไม่มีทรานซิชัน โดยวางมาสเตอร์ 32 วินาทีเดิมกลับทับด้านบน

TfrOvWHf4ys

"MIRA" 32 วินาที 2560x1440 24 fps สี่ minimax/h3/reference-to-video generations ครั้งละ 8 วินาที ราคา $1.12 ต่อช็อต เพลงถูกใส่เป็นเสียงอ้างอิงและคิดเงิน $0.00

สี่ครั้งที่สร้าง สี่โลกแสงที่แตกต่างกันโดยสิ้นเชิง ใบหน้าเดียว ไม่มีการตกแต่งใดๆ ระหว่างช็อตเหล่านี้

มุมมองสี่มุมของผู้หญิงผมสีเงินสวมปลอกคอเรืองแสงสีแดง

สี่เฟรมจากสี่ช็อตแสดงนักร้องคนเดียวกันบนดาดฟ้าสีนีออน ทางหลวงทะเลทราย สตูดิโอสีขาว และถังน้ำสีดำ_หนึ่งเฟรมที่ดึงมาจากคลิปที่ส่งออกแต่ละคลิป ผมเดียวกัน เสื้อตาข่ายเดียวกัน ปลอกคอ LED สีแดงเดียวกันทั้งในสายฝน แสงแดดต่ำ ไฟแบนสูง และใต้น้ำ_


ทำไมความพยายามทำมิวสิควิดีโอ MiniMax H3 ส่วนใหญ่ถึงพังเมื่อถึงวินาทีที่สิบหก

รูปแบบความล้มเหลวสามแบบ ที่หลีกเลี่ยงได้ทั้งหมด

หนึ่ง: มองว่า 15 วินาทีคือขีดจำกัดของโปรเจกต์ H3 จำกัดการสร้างครั้งละ 15 วินาที ผู้คนอ่านแล้วสรุปว่า "ไม่มีมิวสิควิดีโอ" แล้วเลิก แต่มิวสิควิดีโอไม่เคยเป็นช็อตเดียว มิวสิควิดีโอจริงตัดทุก 4 ถึง 8 วินาทีอยู่แล้ว ขีดจำกัดแค่บังคับให้คุณทำในสิ่งที่บรรณาธิการจะทำอยู่แล้ว

สอง: อธิบายจังหวะด้วยคำพูด "สนุกสนาน มีพลัง เต้นตามจังหวะ" ไม่ได้ให้อะไรที่โมเดลจะยึดได้ มันจะสร้างจังหวะขึ้นมาเอง และจุดตัดของคุณจะตกครึ่งจังหวะตลอดไป การส่งเสียงจริงให้มันช่วยขจัดการเดา

สาม: ปล่อยให้เครื่องแต่งกายเปลี่ยน ทุกช็อตต้องการภาพอ้างอิงเดียวกัน และ คำอธิบายเครื่องแต่งกายเดียวกันแบบคำต่อคำ เปลี่ยน "เสื้อตาข่ายสีดำด้าน" เป็น "เสื้อตาข่ายสีเข้ม" ระหว่างช็อต คุณจะได้คนละคน

นี่คือสิ่งที่สองเส้นทางมีค่าใช้จ่ายจริง:

 ห่วงโซ่เครื่องมือสี่แบบดั้งเดิมการเรียก H3 แบบอ้างอิงครั้งเดียว
เครื่องมือต่อช็อตโมเดลภาพ, โมเดลวิดีโอ, เครื่องมือซิงค์ปาก, NLEเอนด์พอยต์เดียว จากนั้น NLE ตอนท้าย
ขั้นตอนด้วยมือต่อช็อต4 การส่งต่อ, 3 การส่งออกไฟล์1 การส่ง
อะไรยึดตัวละครไว้การรีพรอมต์ด้วยตนเองและโชคภาพอ้างอิงเดียวใช้ซ้ำแบบคำต่อคำ
ภาพและเสียงเรนเดอร์แยกกัน จัดแนวทีหลังสร้างในรอบเดียวกัน สเตอริโอ 32 kHz
ค่าใช้จ่ายต่อช็อต 8 วินาทีมิเตอร์แยกสี่อัน$1.12 ที่ 2K, $0.80 ที่ 768P

เพื่อความเป็นธรรมกับเส้นทางเก่า: มันไม่ใช่จินตนาการ Arata Fukoe ผู้สร้างชาวญี่ปุ่นได้รับรางวัลเหรียญทองแดง Project Odyssey จากมิวสิควิดีโอ AI เต็มรูปแบบ และทั้ง Queen และ Linkin Park ได้เผยแพร่มิวสิควิดีโอที่ได้รับความช่วยเหลือจาก AI อย่างเป็นทางการแล้ว ห่วงโซ่เหล่านั้นแค่ใช้เครื่องมือสี่หรือห้าชิ้น ซึ่งเป็นสิ่งที่ศิลปินอิสระที่มีเพลงเดียวไม่มีเวลาทำ

เสียงอ้างอิงซื้ออะไรให้มิวสิควิดีโอ MiniMax H3

นี่คือส่วนที่ควรทำความเข้าใจก่อนที่คุณจะใช้จ่ายอะไร

H3 สร้างภาพและเสียงในรอบเดียว แทนที่จะพากย์เสียงลงบนเฟรมที่เสร็จแล้ว เมื่อคุณส่งแทร็กอ้างอิง แทร็กนั้นไม่ใช่แค่โน้ตอารมณ์ ฉันเปรียบเทียบชิ้นส่วนอินพุตของฉันกับสตรีมเสียงภายใน mp4 ที่ส่งออก ในระดับรูปคลื่น การดาวน์มิกซ์โมโน 8 kHz:

  • ความสัมพันธ์ของเอนเวโลป: 0.956 ที่ระยะหน่วงศูนย์
  • ความสัมพันธ์ของรูปคลื่นดิบในหน้าต่าง 2 วินาที: 0.892 ที่ ค่าออฟเซ็ตตัวอย่างเป็นศูนย์

นั่นไม่ใช่โมเดลที่สร้างเพลงที่คล้ายกัน นั่นคือไฟล์ของคุณ ตรงกันตัวอย่าง แอมเบียนซ์ที่พรอมต์ขอถูกวางทับด้านบน และการเข้ารหัส AAC หนึ่งรอบ สำหรับการเปรียบเทียบ การวัดเดียวกันกับเทคควบคุมที่สร้างโดยไม่มีเสียงอ้างอิง ได้ค่า 0.26 ซึ่งเป็นพื้นเสียงรบกวน

รูปคลื่นเสียงสองอันที่เกือบจะเหมือนกัน แสดงอินพุตสีน้ำเงินและเอาต์พุตสีแดง

รูปคลื่นของชิ้นส่วนอินพุตด้านบน เสียงที่ H3 ส่งออกด้านล่าง จัดแนวที่ออฟเซ็ตศูนย์_ด้านบน: mp3 8 วินาทีที่ฉันอัปโหลด ด้านล่าง: สตรีมเสียงภายใน mp4 ที่ H3 ส่งคืน พีคเดียวกัน ตำแหน่งเดียวกัน ไม่มีออฟเซ็ต_

ขีดจำกัดอินพุตนั้นเข้มงวด และถูกบังคับใช้ในเวลาที่ส่ง แทนที่จะเงียบๆ

อินพุตอ้างอิงขีดจำกัดคิดเงิน
รูปภาพสูงสุด 9ฟรีบนเอนด์พอยต์ H3 ของ Atlas Cloud
วิดีโอสูงสุด 3, แต่ละ 2-15 วินาทีคิดเงินในอัตราเอาต์พุต
เสียงสูงสุด 3, แต่ละ 2-15 วินาที, รวมทั้งหมด 15 วินาที$0.00
เสียงอย่างเดียวถูกปฏิเสธ ต้องมีรูปภาพหรือวิดีโออย่างน้อยหนึ่งอย่างไม่มี

ฉันทดสอบขีดจำกัดเสียงรวมโดยตั้งใจ ส่งสามชิ้นส่วน 8 วินาทีในการเรียกครั้งเดียว มันล้มเหลวใน 5.8 วินาทีด้วย invalid params, total audio duration 24138 ms exceeds 15000 ms และไม่ถูกคิดเงิน ข่าวดี: H3 ไม่ได้ทิ้งไฟล์พิเศษอย่างเงียบๆ แล้วคิดเงินคุณอยู่ดี

อีกหนึ่งกับดักที่ฉันเจอก่อนหน้านี้ ถ้าคุณส่งเสียงเป็น data URL base64 ชนิด MIME จะเป็นตัวกำหนดนามสกุลที่ API อนุมาน data:audio/mpeg ถูกปฏิเสธด้วย audio format ".mpeg" not allowed data:audio/mp3 ผ่านฉลุย มีสี่ครั้งที่ส่งแล้วล้มเหลวเพราะเรื่องนี้ก่อนที่ฉันจะสังเกตเห็น ทั้งหมดฟรี


เวิร์กโฟลว์มิวสิควิดีโอ MiniMax H3 และแต่ละวินาทีมีค่าใช้จ่ายเท่าไหร่

ทุกอย่างด้านล่างทำงานผ่านคีย์ API หนึ่งอันบน Atlas Cloud ซึ่งเป็นที่ที่ฉันรันและคิดเงินทั้งหมด สามโมเดล หนึ่งแท็บเบราว์เซอร์

ขั้นตอนโมเดลสิ่งที่ทำราคาที่ฉันถูกเรียกเก็บจริง
เขียนท่อนฮุกminimax/music-2.6เพลงเต็มจากพรอมต์สไตล์และเนื้อร้อง, mp3 สูงสุด ~5 นาที$0.15 ต่อเพลง, คงที่
ล็อคศิลปินopenai/gpt-image-2/text-to-imageหนึ่งเฟรมฐานที่ทุกช็อตจะสืบทอด$0.1745 ที่ quality high, 2048x1152
ถ่ายแต่ละช็อตminimax/h3/reference-to-videoภาพบวกเสียงเข้า, คลิปล็อคจังหวะพร้อมเสียงสเตอริโอออก$0.14/วินาทีที่ 2K, $0.10/วินาทีที่ 768P. อินพุตเสียง $0.00

สองหมายเหตุเกี่ยวกับตารางนั้น เพราะตัวเลขที่แสดงไว้โกหกทั้งสองทิศทาง GPT Image 2 แสดง $0.009 เป็นพื้นในแคตตาล็อก นั่นคือระดับ token ต่ำสุด และการเรนเดอร์ high ขนาด 2048x1152 จริงๆ คิดเงิน $0.1745 รายการแคตตาล็อกของ H3 แสดง $0.10 ซึ่งเป็นเฉพาะระดับ 768P เท่านั้น งาน 2K 8 วินาทีของฉันแต่ละครั้งถูกเรียกเก็บ $1.12 พอดี ซึ่งคือ $0.14 ต่อวินาที

ถ้าคุณต้องการล็อคเฟรมแรกแทนการอ้างอิงวัตถุ [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) ใช้อัตราเดียวกัน และ [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) ครอบคลุมช็อตที่ใช้พรอมต์ล้วนๆ

การแก้ไขที่ควรทำ: แผนเวอร์ชันก่อนหน้านี้สันนิษฐานว่าคุณต้องนำเพลงของคุณเองมาเพราะไม่มีตัวสร้างเพลงเต็มบนแพลตฟอร์ม ตอนนี้มีแล้ว minimax/music-2.6 เขียนแทร็กได้ ดังนั้นทั้งห่วงโซ่ รวมถึงเพลง ทำงานในที่เดียว


วิธีทำมิวสิควิดีโอ MiniMax H3 ทีละขั้นตอน

ขั้นตอนที่ 1: เขียนท่อนฮุก 120 BPM และตัดเป็นชิ้นส่วนต่อช็อต

ขอ 120 BPM อย่างชัดเจน ที่ 120 BPM หนึ่งบาร์ยาว 2.000 วินาที พอดี ดังนั้นค่า duration เป็นจำนวนเต็มวินาทีของ H3 จะลงตรงเส้นบาร์โดยอัตโนมัติ: 4 วินาที = 2 บาร์, 6 วินาที = 3 บาร์, 8 วินาที = 4 บาร์, 10 วินาที = 5 บาร์ การตัดของคุณจะตรงกับจังหวะตกโดยที่คุณไม่ต้องแตะมาร์กเกอร์ใดๆ

โมเดล: minimax/music-2.6 การตั้งค่า: format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false

พรอมต์สไตล์:

plaintext
1Synth-pop ที่ 120 BPM พอดี, เตะสี่ต่อสี่ตรงๆ, แพดอะนาล็อกสว่างๆ ไซด์เชน, เสียงร้องนำหญิงใสสะอาดอยู่ข้างหน้ามิกซ์, คอรัสสเตอริโอกว้าง, ไม่มีแร็พ, สระเปิดยาว, ซีนีมาติกและเศร้าเล็กน้อย, มาสเตอร์พร้อมออกอากาศ

เนื้อร้อง:

plaintext
1[Chorus]
2Hold the line, hold the light
3I am running out of night
4Say my name into the rain
5And I will burn again

มันส่งคืนแทร็กยาว 70 วินาทีใน 75 วินาที ราคา $0.15 จากนั้นฉันตรวจสอบจังหวะแทนที่จะเชื่อมัน โดยรันออโตคอร์รีเลชันของ onset-novelty เหนือไฟล์ ค่าหน่วงที่แรงที่สุดกลับมาที่ 0.500 วินาทีพอดี ซึ่งคือ 120 BPM และกริดจังหวะเริ่มที่ 0.24 วินาที เข้าไปในไฟล์ที่ถอดรหัส แทนที่จะเป็นศูนย์ ค่าออฟเซ็ตนั้นสำคัญ: ตัดจาก 0.24 และทุกชิ้นส่วนจะเริ่มต้นที่จังหวะตก

plaintext
1# มาสเตอร์ 32 วินาที เริ่มต้นที่จังหวะตกที่ 0.24s
2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3
3
4# สี่ชิ้นส่วน 8 วินาที หนึ่งชิ้นต่อช็อต แต่ละชิ้น 4 บาร์ และต่ำกว่าขีดจำกัด 15s มาก
5for i in 0 8 16 24; do
6  ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3
7done

ถ้าคุณมีแทร็กของตัวเองอยู่แล้ว ให้ข้ามขั้นตอนนี้ไปเลย นั่นคือกรณีปกติ และเป็นกรณีที่ถูกที่สุด

ขั้นตอนที่ 2: ล็อคศิลปินด้วยเฟรมฐาน GPT Image 2 เพียงเฟรมเดียว

ทุกช็อตอ้างอิงไฟล์นี้เพียงไฟล์เดียว อะไรที่ผิดที่นี่จะผิดสี่ครั้ง ดังนั้นใช้เงิน $0.17 และดูให้ดี

โมเดล: openai/gpt-image-2/text-to-image การตั้งค่า: quality high , size 2048x1152 (16:9)

plaintext
1ภาพนิ่งมิวสิควิดีโอซีนีมาติก ภาพครึ่งตัวบน นักร้องหญิง synth-pop เชื้อสายเอเชียตะวันออก อายุ 25 ปี ผมสั้นสีเงินขาว หน้าม้าตัดตรง เสื้อตาข่ายสีดำด้าน ปลอกคอ LED สีแดงบางๆ เรืองแสงที่กระดูกไหปลาร้า ต่างหูเงินข้างเดียว เธอยืนบนดาดฟ้าที่เปียกฝนตอนกลางคืน ถือไมโครโฟนมือถือโครเมียมวินเทจแนบปาก ข้างหลังเธอ ป้ายนีออนสีม่วงแดงและฟ้าไม่อยู่ในโฟกัส ฝนละอองเล็กๆ ถูกจับด้วยแสงหลังที่แข็ง หมอกลอยจากช่องระบายอากาศ ถ่ายด้วย 35mm anamorphic, ความชัดตื้น, เกรดสี teal-and-magenta, เห็นเกรนฟิล์ม ใบหน้าของเธอคมชัดและสว่างสม่ำเสมอด้วยแสงหลักนุ่มนวลจากด้านซ้ายของกล้อง ไม่มีข้อความใดๆ ในเฟรม

ผู้หญิงผมสีเงินถือไมโครโฟนวินเทจในเมืองนีออนที่ฝนตก

เฟรมฐานที่สร้างขึ้น: นักร้องผมสีเงินกับไมโครโฟนโครเมียมบนดาดฟ้านีออนที่เปียกฝน_เฟรมฐานที่ทุกช็อตต่อมาสืบทอด สร้างด้วย_ openai/gpt-image-2/text-to-image , quality high, 2048x1152, คิดเงิน $0.1745

อินเทอร์เฟซตัวสร้างภาพ AI แสดงการตั้งค่าอินพุตและเอาต์พุตที่สร้างขึ้น

GPT Image 2 กำลังรันพรอมต์นี้ใน playground ของ Atlas Cloud พร้อมเฟรมที่เสร็จแล้วในแผงเอาต์พุต

พรอมต์เดียวกันใน playground: ขนาด 16:9 ที่ 2048x1152, Quality high, และปุ่ม Run แสดงราคา $0.1745 ซึ่งเป็นสิ่งที่ API เรียกเก็บจากฉันจริงๆ ราคา $0.009 ในแคตตาล็อกคือระดับ token ต่ำสุด ไม่ใช่อันนี้ พรอมต์เดียวกัน ต่าง seed ดังนั้นการเรนเดอร์นี้ไม่ใช่ไฟล์ด้านบน

คำศัพท์เครื่องแต่งกายในพรอมต์นั้น (ผมสั้นสีเงินขาว, เสื้อตาข่ายสีดำด้าน, ปลอกคอ LED สีแดง, ต่างหูเงิน) จะถูกนำมาใช้ซ้ำแบบคำต่อคำในทุกพรอมต์ด้านล่าง การทำซ้ำนั้นคือกลไกความสอดคล้องทั้งหมด อย่าใช้คำพูดอื่น

ขั้นตอนที่ 3: รันช็อตแรกของมิวสิควิดีโอ MiniMax H3 พร้อมเสียงอ้างอิงฟรี

โมเดล: minimax/h3/reference-to-video การตั้งค่า: refers = เฟรมฐานบวก slice-0.mp3 , resolution: 2K, duration: 8, ratio: 16:9

ตั้งค่า ratio อย่างชัดเจน ค่าเริ่มต้นใน playground คือ adaptive และเอนด์พอยต์จะทำงานดีกว่ามากเมื่อคุณระบุรูปทรงที่ต้องการ

plaintext
1ช็อตมิวสิควิดีโอ ผู้หญิงในภาพอ้างอิงร้องเพลงอ้างอิงตรงไปที่เลนส์บนดาดฟ้านีออนที่เปียกฝน ถือไมโครโฟนโครเมียมที่ปาก เธอร้องบรรทัดแรกหนักๆ ลงจังหวะตก สบตากล้อง จากนั้นเอียงศีรษะไปข้างหลังในโน้ตที่ยืดยาว ค่อยๆ ซูมเข้าจากครึ่งตัวถึงคลูสอัพแน่นตลอดแปดวินาที กล้องสั่นเล็กน้อยแบบมือถือ ฝนสาดผ่านแสงหลังที่แข็ง ปากของเธอขยับตามสระที่ร้องในเสียงอ้างอิงพอดี เธอกำลังร้องเพลง ไม่ใช่พูด ผมสั้นสีเงินขาว เสื้อตาข่ายสีดำด้าน และปลอกคอ LED สีแดงเรืองแสงเหมือนกับภาพอ้างอิง เสียง: แทร็กอ้างอิงในสเตอริโอ บวกเสียงฝนเบาๆ และเสียงเมืองที่อยู่ไกลๆ ผสมอยู่เบาๆ

7sPeYEe-xII

ช็อต 1 เปิดเสียง 2560x1440, 8.00 วินาทีพอดี, 24 fps, สเตอริโอ 32 kHz 345 วินาทีจากการส่งถึงไฟล์ คิดเงิน $1.12 ดูการเอียงศีรษะไปข้างหลังในโน้ตที่ยืดยาวประมาณ 5 วินาที

อินเทอร์เฟซตัวสร้างวิดีโอ AI แสดงการตั้งค่าอินพุตและวิดีโอที่สร้างขึ้น

playground reference-to-video ที่มีเฟรมฐานและชิ้นส่วนเสียงโหลดอยู่ และคลิปที่เสร็จแล้วในแผงเอาต์พุต

Reference Materials อ่านว่า 2/9: slice-0.mp3 ในช่องหนึ่ง เฟรมฐานในอีกช่อง Resolution 2K, Duration 8, และปุ่ม Run แสดงราคา $1.12 ซึ่งคือ 8 x $0.14 พอดี สังเกตเมนู Aspect Ratio ที่ตั้งเป็น adaptive ซึ่งเป็นค่าเริ่มต้นของหน้า การเรียก API ของฉันตั้งค่า ratio เป็น 16:9 อย่างชัดเจน

ตัวเลขหนึ่งที่ควรจด: duration: 8 ส่งคอนเทนเนอร์ที่มีความยาว 8.00 วินาทีพอดี duration: 4 ส่งคืน 4.46 วินาที ถ้าคุณวางแผนจะต่อกันที่เส้นบาร์ ให้ใช้ระยะเวลาที่ส่งคืนมาตรง

ขั้นตอนที่ 4: ถ่ายอีกสามโลกโดยไม่สูญเสียใบหน้า

เฟรมฐานเดียวกัน ประโยคเครื่องแต่งกายเดียวกัน ชิ้นส่วนเสียงถัดไป ทุกอย่างอื่นเปลี่ยน

4a. ทางหลวงทะเลทรายยามโกลเดนอาวร์ refers = เฟรมฐาน + slice-8.mp3, 2K, duration: 8, ratio: 16:9

plaintext
1ช็อตมิวสิควิดีโอ ผู้หญิงคนเดียวกันจากภาพอ้างอิงยืนบนเส้นกลางของทางหลวงทะเลทรายที่ว่างเปล่ายามโกลเดนอาวร์ ไม่มีไมโครโฟน สวมแจ็กเก็ตยีนส์สีครามเปิดทับเสื้อตาข่ายสีดำด้านตัวเดิม ปลอกคอ LED สีแดงยังติดสว่าง เธอขยับปากร้องตามคอรัสของแทร็กอ้างอิงกลางสายลม ขณะที่กล้องเคลื่อนถอยหลังต่ำเหนือยางมะตอย ความร้อนสั่นไหวเหนือถนน ฝุ่นปลิว เงาของเธอยาวทอดยาวไปทางเลนส์ แฟลร์ anamorphic พาดผ่านที่จุดกึ่งกลาง ผม ใบหน้า และเครื่องแต่งกายเหมือนกับภาพอ้างอิง เสียง: แทร็กอ้างอิงทับลมทะเลทรายเปิด กว้างและโปร่ง

4XEki-v2vCU

ช็อต 2 เปิดเสียง ใบหน้าเดียวกัน อุณหภูมิสีตรงกันข้าม และแทร็กอ้างอิงรีมิกซ์ภายใต้ลมเปิด 332 วินาที, $1.12

4b. สตูดิโอ infinity cove สีขาว refers = เฟรมฐาน + slice-16.mp3, 2K, duration: 8, ratio: 16:9

plaintext
1ช็อตมิวสิควิดีโอ ผู้หญิงคนเดียวกันจากภาพอ้างอิงในสตูดิโอ infinity cove สีขาวบริสุทธิ์ภายใต้แสงสูงแบนราบไม่มีเงา สวมเสื้อโค้ทไวนิลสีแดงมันวาวทับเสื้อตาข่ายสีดำด้านตัวเดิม ปลอกคอ LED สีแดงมองเห็นได้ที่คอเสื้อ เธอเต้นสี่บาร์ตามแทร็กอ้างอิง ผมสีเงินขาวปลิวตามทุกครั้งที่หมุน เฟรมกว้างล็อคอยู่ จากนั้นซูมกระชากไปที่ช็อตกลางที่จังหวะตกที่สอง กระดาษสี่เหลี่ยมสีขาวเล็กๆ ร่วงเหมือนคอนเฟตติในช่วงสองวินาทีสุดท้าย ใบหน้าและผมเหมือนกับภาพอ้างอิง เสียง: แทร็กอ้างอิง แห้งและใกล้ บวกกับเสียงรองเท้าลากบนพื้นสตูดิโอ

VAyqdkVpnm0

ช็อต 3 เปิดเสียง แสงไร้เงาแบนราบเป็นที่ที่ยากที่สุดในการซ่อนการเปลี่ยนใบหน้า และมันก็ คงอยู่ 8.00 วินาที, $1.12

4c. ใต้น้ำ b-roll ไม่มีการซิงค์ปาก refers = เฟรมฐาน + slice-24.mp3, 2K, duration: 8, ratio: 16:9

plaintext
1ช็อตมิวสิควิดีโอ ผู้หญิงคนเดียวกันจากภาพอ้างอิงลอยอยู่ใต้น้ำในถังสีดำ ผมสีเงินขาวปลิวรอบตัวเธอ ปลอกคอ LED สีแดงเรืองแสงผ่านน้ำ เสื้อตาข่ายสีดำด้านพลิ้วไหวช้าๆ ลำแสงเดียวจากด้านบน ฟองอากาศลอยผ่านเลนส์แบบสโลว์โมชั่น เธอลืมตาที่จังหวะตกและยื่นมือข้างหนึ่งไปทางผิวน้ำ เธอไม่ร้องเพลงและปากยังคงปิด กล้องหมุน 30 องศารอบตัวเธอตลอดช็อต ใบหน้าเหมือนกับภาพอ้างอิง เสียง: แทร็กอ้างอิงที่ได้ยินจากเหนือผิวน้ำ อู้อี้และตัดความถี่สูง พร้อมเสียงฟองอากาศ

fibdweUMRpY

ช็อต 4 เปิดเสียง คำสั่ง "เธอไม่ร้องเพลงและปากยังคงปิด" ถูกรับฟัง ซึ่งเป็นส่วนที่มีประโยชน์: เสียงอ้างอิงขับเคลื่อนเวลา ไม่ใช่การแสดงที่บังคับ 329 วินาที, $1.12

ขั้นตอนที่ 5: รันเทคควบคุม โดยเปิดช่องเสียงว่างไว้

พรอมต์เดียวกันกับขั้นตอนที่ 3 คำต่อคำ การเปลี่ยนแปลงเดียว: refers เก็บรูปภาพและไม่มีอะไรอื่น 768P, duration: 8

คลิปนี้อธิบายกลไกทั้งหมดได้ดีกว่าย่อหน้าใดๆ ฟังมันเทียบกับขั้นตอนที่ 3

FAoPplGmKJc

เทคควบคุม พรอมต์เดียวกัน ไม่มีเสียงอ้างอิง 1344x768, 8.00 วินาที, 200 วินาที, $0.80 H3 เขียนเพลงประกอบของตัวเอง และการแสดงก็เป็น "มีคนกำลังร้องเพลง" ทั่วไป ไม่ใช่คำเหล่านี้

วัดเทียบกับมาสเตอร์ของฉัน เสียงของเทคควบคุมได้คะแนนความสัมพันธ์เอนเวโลป 0.26 ขั้นตอนที่ 3 ได้ 0.956 ช่องว่างนั้นคือสิ่งที่ช่องเสียงฟรีซื้อให้คุณ

ขั้นตอนที่ 6: ทำลายการซิงค์ปากโดยตั้งใจ

ทุกโมเดลมีขีดจำกัดพยางค์ การหาขีดจำกัดของคุณมีค่าใช้จ่าย $0.40

ฉันสร้างแทร็กแร็พจังหวะสองเท่าแยกต่างหาก (minimax/music-2.6 อีกครั้ง $0.15) ตัดชิ้นส่วน 4 วินาทีที่มีประมาณหกพยางค์ต่อวินาที และป้อนเข้าไปในฉากดาดฟ้าเดิมที่ 768P, duration: 4

plaintext
1ช็อตมิวสิควิดีโอ ผู้หญิงในภาพอ้างอิงแร็พแทร็กอ้างอิงตรงไปที่เลนส์บนดาดฟ้านีออนที่เปียกฝน ถือไมโครโฟนโครเมียมที่ปาก ส่งทุกพยางค์ของท่อนแร็พจังหวะสองเท่าที่เร็ว คลูสอัพขนาดกลางล็อคอยู่ กล้องสั่นเล็กน้อยแบบมือถือ ฝนสาดในแสงหลังที่แข็ง ปากของเธอขยับตามพยางค์ที่แร็พในเสียงอ้างอิงพอดี ผมสั้นสีเงินขาว เสื้อตาข่ายสีดำด้าน และปลอกคอ LED สีแดงเรืองแสงเหมือนกับภาพอ้างอิง เสียง: แทร็กอ้างอิงในสเตอริโอ บวกเสียงฝนเบาๆ

jiQVCjOCbKg

การทดสอบความเครียด เปิดเสียง 1344x768, 4.46 วินาที, 192 วินาที, $0.40 ปากขยับตลอดและตรงจังหวะ แต่มันหยุดแยกแยะพยัญชนะแต่ละตัวและกลายเป็นวงจรเปิด-ปิดซ้ำๆ เส้นร้องเพลงได้รูปสระที่ชัดเจน นี่ไม่ใช่

การอ่านที่ตรงไปตรงมาของฉันจากไฟล์ที่ส่งมา: สระร้องเพลงที่ยืดยาวคือจุดที่การขยับปากของ H3 น่าเชื่อถือจริงๆ และพยัญชนะแร็พที่หนาแน่นคือจุดที่มันลดระดับลงเป็นการเคลื่อนไหวที่ดูเป็นไปได้ วางแผนคลูสอัพของคุณรอบๆ เส้นร้องเพลง และใส่บาร์ที่เร็วใน b-roll มีรายละเอียดเพิ่มเติมเกี่ยวกับความแตกต่างระหว่างการพูดและการร้องเพลงใน การวิเคราะห์การซิงค์ปากและเสียง

ขั้นตอนที่ 7: ต่อ, ปิดเสียง, และวางมาสเตอร์กลับทับบนมิวสิควิดีโอ MiniMax H3 ของคุณ

สี่คลิปที่มีความยาว 8.00 วินาทีพอดี เมื่อต่อกันจะได้ 32.00 วินาทีพอดี ซึ่งคือ 16 บาร์ที่ 120 BPM ไม่ต้องตัดแต่ง

plaintext
1# 1. ลบเสียงของแต่ละคลิป
2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do
3  ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4
4done
5
6# 2. ต่อตามลำดับบาร์ (4 x 8s = 32s = 16 bars @ 120 BPM)
7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt
8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4
9
10# 3. วางมาสเตอร์เดิมกลับ
11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4

ทำไมต้องกวนใจปิดเสียง ถ้าโมเดลให้แทร็กของคุณกลับมาอยู่แล้ว? เพราะมิกซ์สเตอริโอของแต่ละคลิปมีแอมเบียนซ์ที่พรอมต์ของคลิปนั้นขอ: ฝนในช็อต 1 ลมทะเลทรายในช็อต 2 ฟิลเตอร์ใต้น้ำตัดความถี่สูงในช็อต 4 สวยงามต่อช็อต แต่ไม่สอดคล้องกันเมื่อตัดข้าม มาสเตอร์ให้มิกซ์ต่อเนื่องหนึ่งเดียวที่บิตเรตเต็ม โดยไม่ต้องเข้ารหัสใหม่ต่อช็อต H3 ส่งมอบการซิงค์การแสดง มาสเตอร์ของคุณส่งมอบเพลง


สี่รูปแบบของสูตรมิวสิควิดีโอ MiniMax H3

คัทแนวตั้งสำหรับแพลตฟอร์ม ตั้งค่า ratio: 9:16 คุณจะได้ Spotify Canvas หรือชิ้นส่วน Shorts จากเฟรมฐานและชิ้นส่วนเดียวกัน มันส่งคืน 768x1344 จริง ดังนั้นต่างจากเมนู Aspect ใน playground ค่า ratio ของ API นั้นคงที่ Canvas loops เงียบโดยการออกแบบ ดังนั้นอันนี้จึงส่งเป็น GIF

ผู้หญิงผมสีเงินถือไมโครโฟนบนดาดฟ้าเมืองที่ฝนตก

คัทลูปแนวตั้ง 9:16 ของศิลปินคนเดียวกันบนดาดฟ้านีออน_เฟรมฐานเดียวกัน ชิ้นส่วนอ้างอิงเดียวกัน_ ratio: 9:16 ที่ 768P ราคา $0.80 หนึ่งรอยย่นที่ซื่อสัตย์: ฉันขอ "ไม่ร้องเพลง" แต่ได้ร้องเพลงมา เมื่อมีเสียงร้องในช่องอ้างอิง เสียงจะเป็นฝ่ายชนะการโต้แย้ง ถ้าคุณต้องการนักแสดงที่เงียบ ให้ป้อนชิ้นส่วนที่เป็นดนตรีเท่านั้น

วิดีโออ้างอิงแทนภาพอ้างอิง คุณสามารถส่งคลิปวิดีโออ้างอิงได้ถึงสามคลิปเพื่อถ่ายทอดการเคลื่อนไหวและเฟรมแทนการอธิบาย ดูมิเตอร์: วิดีโออ้างอิง คิดเงิน ในอัตราเอาต์พุต ในขณะที่เสียงอ้างอิงฟรี ความไม่สมดุลนั้นคือข้อเท็จจริงด้านราคาที่มีประโยชน์ที่สุดในเอนด์พอยต์นี้

ภาพ Visualiser b-roll ล้วนๆ ละทิ้งนักแสดงทั้งหมด ป้อนภาพผลิตภัณฑ์ ปกอัลบั้ม หรือแผ่นพื้นผิว พร้อมชิ้นส่วนเสียง และพรอมต์เฉพาะการเคลื่อนไหวของกล้อง ไม่ต้องรักษาใบหน้า ไม่ต้องซิงค์ปากให้เสีย และคุณสามารถถ่ายทั้งหมดที่ 768P

ร่างราคาถูก ทำเสร็จราคาแพง 768P ราคา $0.10/วินาที เทียบกับ 2K ที่ $0.14/วินาที และทั้งคู่ส่งคืนสเตอริโอ 32 kHz เหมือนกัน ดังนั้นการแสดงที่คุณกำลังประเมินก็เหมือนกัน การประหยัดไม่ได้อยู่ที่ช็อตที่เก็บ แต่อยู่ที่ช็อตที่ถูกปฏิเสธ: ทุกเทค 8 วินาทีที่ล้มเหลวมีค่าใช้จ่าย $0.80 แทนที่จะเป็น $1.12 ถ่ายที่ 768P จนกว่าเทคจะถูกต้อง จากนั้นจ่าย $1.12 ครั้งเดียว สำหรับช็อตที่ใช้สามครั้ง นั่นคือ $2.72 แทนที่จะเป็น $3.36 ข้อมูลเพิ่มเติมเกี่ยวกับความแตกต่างของระดับใน การเปรียบเทียบ 768P กับ 2K และเกี่ยวกับความยาวที่คลิปเดียวสามารถยืดได้ใน คู่มือความยาวคลิป


มิวสิควิดีโอ MiniMax H3 เต็มรูปแบบมีค่าใช้จ่ายจริงเท่าไหร่

ทุกบรรทัดด้านล่างเป็นตัวเลขที่ถูกเรียกเก็บจริง ซึ่งดึงมาจากบันทึกการพยากรณ์หลังจากเสร็จสิ้น ไม่ใช่ราคาในรายการ

รายการโมเดลและการตั้งค่าคิดเงิน
ท่อนฮุก, เพลง 70 วินาทีminimax/music-2.6, mp3 44.1 kHz$0.15
เฟรมฐานศิลปินopenai/gpt-image-2/text-to-image, high, 2048x1152$0.17
ช็อต 1, ดาดฟ้านีออนminimax/h3/reference-to-video, 2K, 8 วินาที$1.12
ช็อต 2, ทางหลวงทะเลทรายเหมือนกัน, 2K, 8 วินาที$1.12
ช็อต 3, โคฟสีขาวเหมือนกัน, 2K, 8 วินาที$1.12
ช็อต 4, ใต้น้ำเหมือนกัน, 2K, 8 วินาที$1.12
ยอดรวมวิดีโอที่เสร็จ $4.80
โพรบตรวจสอบ768P, 4 วินาที$0.40
เทคควบคุม, ไม่มีเสียง768P, 8 วินาที$0.80
แทร็กแร็พสำหรับการทดสอบความเครียดminimax/music-2.6$0.15
การทดสอบความเครียดซิงค์ปาก768P, 4 วินาที$0.40
คัท Canvas แนวตั้ง768P, 8 วินาที, 9:16$0.80
ภาพฮีโร่สำหรับบทความนี้openai/gpt-image-2/text-to-image, high$0.17
ทดสอบเกินขีดจำกัด, เสียง 24 วินาทีถูกปฏิเสธตอนส่ง$0.00
สี่ครั้งที่ส่งด้วย MIME เสียงผิดถูกปฏิเสธตอนส่ง$0.00
เสียงอ้างอิง, 4 x 8 วินาทีอินพุตฟรี$0.00
ค่าใช้จ่ายทั้งหมด $7.53

นั่นคือ $9.00 ต่อนาทีที่เสร็จ ที่ 2K ในช็อตที่ผ่านการคัดเลือก ก่อนความผิดพลาดของฉัน ถ่ายทั้งหมดที่ 768P นาทีเดียวกันจะอยู่ที่ $6.61 ทีมงาน MV มนุษย์ไม่เสนอราคาใดๆ ในสองตัวเลขนั้น

สองหมายเหตุในการดำเนินงานถ้าคุณกำลังวางงบประมาณสำหรับชิ้นงานที่ยาวขึ้น การปฏิเสธตอนส่งนั้นฟรี ดังนั้นพารามิเตอร์ที่ไม่ดีเสียเวลาเท่านั้น ไม่เสียเงิน และฟิลด์ price ในการพยากรณ์จะปรากฏขึ้นหลังจากดีเลย์ ดังนั้นให้สอบถามรหัสคำขออีกครั้งหลังจากไฟล์ดาวน์โหลด ถ้าคุณต้องการใบแจ้งหนี้จริงแทนที่จะเป็น null


เพลงของใคร ใบหน้าของใคร: สิ่งที่ต้องตรวจสอบก่อนเผยแพร่

สั้น เพราะมันสำคัญและไม่ต้องการคำเทศนา

คุณต้องมีสิทธิ์ในแทร็กอ้างอิง อินพุตฟรีไม่ได้หมายถึงการเคลียร์สิทธิ์ฟรี การป้อนซิงเกิลที่มีลิขสิทธิ์ทางการค้าเป็นเสียงอ้างอิง แล้วเผยแพร่สิ่งที่ออกมา เป็นเส้นทางด่วนสู่การลบเนื้อหา การบันทึกของคุณเอง แทร็กที่คุณว่าจ้าง หรือสิ่งที่คุณสร้างขึ้นนั้นใช้ได้

อย่าสร้างเฟรมฐานจากใบหน้าของศิลปินจริงที่มีชีวิต กลไกความสอดคล้องที่นี่เก่งมากในการรักษาใบหน้าข้ามช็อต ซึ่งเป็นเหตุผลว่าทำไมการชี้มันไปที่บุคคลจริงจึงเป็นความคิดที่ไม่ดี

น้ำหนักแบบเปิดและการเข้าถึง API เป็นสองใบอนุญาตที่แตกต่างกัน MiniMax เผยแพร่น้ำหนักของ H3 บน Hugging Face ในเดือนสิงหาคม 2026 และใบอนุญาตชุมชนของมันปัจจุบันไม่รวมถึง EU, UK, เกาหลีใต้ และสหรัฐอเมริกา โดยมีช่องทางใบอนุญาตอย่างเป็นทางการสำหรับดินแดนเหล่านั้น ข้อจำกัดนั้นแนบมากับการรันน้ำหนักด้วยตัวเอง การเรียกโมเดลผ่าน API ที่โฮสต์เป็นความสัมพันธ์ด้านบริการ และไม่ได้ทำให้คุณอยู่ภายใต้ใบอนุญาตน้ำหนัก ควรรู้ว่าคุณอยู่ในสถานการณ์ไหนก่อนที่จะสันนิษฐานอย่างใดอย่างหนึ่ง

สำหรับมุมมองที่กว้างขึ้นว่า H3 อยู่ตรงไหนเมื่อเทียบกับทางเลือกอื่น มี การเปรียบเทียบ Seedance 2.5 และ คู่มือโครงสร้างพรอมต์ สำหรับบริบทว่าทำไมมันถึงคุ้มค่าที่จะลำบาก: ในกระดานผู้นำการตัดต่อวิดีโอที่ให้คะแนนโมเดลที่มีเสียง H3 ปัจจุบันอยู่อันดับหนึ่งที่ 1,126 Elo นำหน้า Gemini Omni Flash ที่ 1,119 และ Dreamina Seedance 2.0 ที่ 1,027 (Artificial Analysis ตรวจสอบเมื่อ 10 สิงหาคม 2026) คะแนนเหล่านั้นเปลี่ยนตามคะแนนโหวต ดังนั้นให้ถือเป็นภาพรวมชั่วคราว


มิวสิควิดีโอ MiniMax H3: คำถามที่พบบ่อย

มิวสิควิดีโอ MiniMax H3 หนึ่งครั้งสามารถรันเต็มสามนาทีได้ไหม?

ไม่ได้ในการสร้างครั้งเดียว การเรียกครั้งเดียวจำกัดที่ 15 วินาที แต่นั่นคือขีดจำกัดต่อการสร้าง ไม่ใช่ต่อโปรเจกต์ วิดีโอสามนาทีที่ 8 วินาทีต่อช็อตคือ 23 การสร้าง ประมาณ $25.76 ที่ 2K และแต่ละครั้งจะลงตรงเส้นบาร์ถ้าแทร็กของคุณเป็น 120 BPM ตัด, ถ่าย, ต่อ, วางมาสเตอร์กลับ

มิวสิควิดีโอ MiniMax H3 ใช้เพลงจริงของฉัน หรือโมเดลสร้างเสียงขึ้นมาใหม่?

มันใช้เพลงจริงของคุณ ฉันวัดความสัมพันธ์ของรูปคลื่นดิบได้ 0.892 ที่ออฟเซ็ตตัวอย่างเป็นศูนย์ระหว่าง mp3 8 วินาทีที่ฉันอัปโหลดและสตรีมเสียงภายใน mp4 ที่ส่งคืน โดยมีแอมเบียนซ์ที่พรอมต์ขอวางทับด้านบน เทคควบคุมที่สร้างโดยไม่มีเสียงอ้างอิงได้คะแนน 0.26 เทียบกับมาสเตอร์เดียวกัน คุณควรวางมาสเตอร์ของคุณกลับทับการต่อสุดท้าย เพราะแต่ละคลิปมีแอมเบียนซ์ต่อช็อตของตัวเองและการเข้ารหัส AAC ของตัวเอง ซึ่งไม่รอดจากการตัดอย่างเรียบร้อย

การป้อนเพลงลงในมิวสิควิดีโอ MiniMax H3 มีค่าใช้จ่ายเพิ่มเติมไหม?

ไม่ ชิ้นส่วนเสียงอ้างอิง 8 วินาทีสี่อันของฉันเพิ่ม $0.00 ในบิลช็อต $4.48 วิดีโออ้างอิงต่างหากที่ต้องระวัง เพราะมันคิดเงินในอัตราเอาต์พุต ขีดจำกัดคือสามคลิปเสียง แต่ละคลิป 2 ถึง 15 วินาที รวม 15 วินาที และเสียงไม่สามารถเป็นข้อมูลอ้างอิงเพียงอย่างเดียวได้

การซิงค์ปากของ MiniMax H3 สำหรับการร้องเพลงดีแค่ไหนเมื่อเทียบกับการพูด?

สระร้องเพลงที่ยืดยาวคือจุดแข็ง: รูปปากที่ชัดเจน การค้างที่ตรงกับโน้ต และการเอียงศีรษะกลับในโน้ตยาวอ่านได้ว่าเป็นการแสดงมากกว่าลูป การส่งที่หนาแน่นคือจุดที่มันยอมแพ้ การทดสอบแร็พหกพยางค์ต่อวินาทีของฉันยังคงจังหวะแต่หยุดแยกแยะพยัญชนะและตกเป็นวงจรเปิด-ปิดซ้ำๆ ใส่บาร์ที่เร็วใน b-roll

ฉันจะรักษาใบหน้าเดียวกันในทุกช็อตของมิวสิควิดีโอ MiniMax H3 ได้อย่างไร?

สามสิ่ง ทั้งหมดน่าเบื่อ ภาพอ้างอิงหนึ่งภาพใช้ซ้ำในทุกการเรียก ไม่เคยสร้างใหม่ คำศัพท์เครื่องแต่งกายเดียวกันคัดลอกแบบคำต่อคำระหว่างพรอมต์ ไม่ใช้คำพ้อง และข้อความ "เหมือนกับภาพอ้างอิง" อย่างชัดเจนในแต่ละพรอมต์ สี่ช็อตของฉันข้ามฝน แสงแดดต่ำ แสงสูงแบนราบ และใต้น้ำโดยไม่มีการเลื่อนไหล

มิวสิควิดีโอ MiniMax H3 มีค่าใช้จ่ายเท่าไหร่ต่อนาทีที่เสร็จ?

$9.00 ต่อนาทีที่เสร็จที่ 2K จากบิลจริงของฉัน $4.80 สำหรับคัท 32 วินาที ถ่ายทั้งหมดที่ 768P นาทีเดียวกันมีค่าใช้จ่าย $6.61 และ 768P ให้สเตอริโอ 32 kHz เหมือนกัน ดังนั้นการแสดงที่คุณประเมินจึงเหมือนกัน ถ่ายเทคที่ถูกปฏิเสธที่ $0.80 และจ่าย $1.12 เฉพาะเทคที่รอดชีวิตในการตัดต่อ

โมเดลล่าสุด

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด