
ห้องคัลเลอร์เกรดช่วงดึก จอมอนิเตอร์หกจอแสดงภาพช็อตเดียวกันหกช็อตของนักร้องผมสีเงินคนเดียวกัน_หก_ ช็อต ศิลปินหนึ่งคน เพลงหนึ่งเพลง สร้างด้วย openai/gpt-image-2/text-to-image .
ผู้ใช้ Suno สร้างเพลงประมาณ 7 ล้านเพลงต่อวัน คร่าวๆ เทียบเท่าแคตตาล็อก Spotify ทั้งหมดทุกสองสัปดาห์ (TechCrunch กุมภาพันธ์ 2026) แทบไม่มีเพลงไหนเลยที่จะมีรูปภาพประกอบ ไม่ใช่เพราะรูปภาพเป็นไปไม่ได้ แต่เพราะเส้นทางดั้งเดิมต้องผ่านเครื่องมือสี่อย่าง: สร้างภาพนิ่ง, ทำให้เคลื่อนไหว, ใช้การซิงค์ปากแยกต่างหาก, จากนั้นแก้ไขทุกอย่างในการตัดต่อ ทุกขั้นตอนจะสูญเสียใบหน้า เสื้อผ้า หรือจังหวะ
ดังนั้นฉันจึงข้ามขั้นตอนเหล่านั้น ฉันตัดท่อนฮุกยาว 8 วินาทีใส่ลงในช่องอ้างอิงของโมเดลวิดีโอโดยตรง แล้วกดรัน มันไม่คิดเงินค่าเสียงให้ฉันเลย
จากนั้นฉันก็แยกไฟล์ mp4 ที่เสร็จแล้วออกมาเพื่อตอบคำถามเดียวที่ไม่มีใครบนอินเทอร์เน็ตตอบตรงๆ: เสียงที่ออกมาจากโมเดลเป็นเพลงของฉันจริง หรือเป็นสิ่งที่มันสร้างขึ้นมาเองที่ฟังดูคล้ายๆ กันเท่านั้น? ฉันวัดมันแล้ว คำตอบไม่ใช่สิ่งที่ฉันคาดหวัง และมันเปลี่ยนวิธีที่คุณควรตัดต่อสิ่งนี้
ประเด็นสำคัญ
- เสียงอ้างอิงฟรี MiniMax H3 คิดเงินเฉพาะวินาทีที่ส่งออกเท่านั้น เสียงอ้างอิง 8 วินาทีสี่อันของฉันเพิ่ม $0.00 ในบิล วิดีโออ้างอิงต่างหากที่มีราคาแพง
- 15 วินาทีคือขีดจำกัดต่อการสร้างครั้งเดียว ไม่ใช่ต่อโปรเจกต์ ตัดเพลงออกเป็นส่วนๆ ถ่ายส่วนละหนึ่งช็อต แล้วต่อกัน การตัดต่อ 32 วินาทีของฉันคือการสร้างสี่ครั้ง
- เขียนท่อนฮุกที่ 120 BPM หนึ่งบาร์ยาว 2.000 วินาทีพอดี ดังนั้นค่า
durationเป็นจำนวนเต็มวินาทีของ H3 จะลงตรงเส้นบาร์โดยไม่ต้องปรับแต่งด้วยมือ 8 วินาที = 4 บาร์- เสียงที่ส่งออกคือแทร็กของคุณ ตรงกันตัวอย่างแม่นยำ ฉันวัดความสัมพันธ์ของรูปคลื่นได้ 0.892 ที่ระยะหน่วงศูนย์ระหว่างอินพุตของฉันและมิกซ์สเตอริโอที่ H3 ส่งออก มันไม่ได้ถูกสร้างขึ้นมาใหม่ คุณยังคงต้องการวางมาสเตอร์กลับเข้าไปในคัทสุดท้าย ด้วยเหตุผลที่ต่างออกไป (ด้านล่าง)
- ค่าใช้จ่ายจริงทั้งหมด: $7.53 จากการสร้างเก้าครั้งรวมถึงครั้งที่ล้มเหลว สี่ช็อตที่เข้าคัทสุดท้ายบวกกับเพลงและเฟรมฐานรวมเป็น $4.80
มิวสิควิดีโอ MiniMax H3 ที่ฉันตัดจากท่อนฮุก 32 วินาทีเดียว
เปิดเสียง นี่คือการสร้างสี่ครั้งแยกกัน ต่อกันโดยไม่มีทรานซิชัน โดยวางมาสเตอร์ 32 วินาทีเดิมกลับทับด้านบน
TfrOvWHf4ys
"MIRA" 32 วินาที 2560x1440 24 fps สี่ minimax/h3/reference-to-video generations ครั้งละ 8 วินาที ราคา $1.12 ต่อช็อต เพลงถูกใส่เป็นเสียงอ้างอิงและคิดเงิน $0.00
สี่ครั้งที่สร้าง สี่โลกแสงที่แตกต่างกันโดยสิ้นเชิง ใบหน้าเดียว ไม่มีการตกแต่งใดๆ ระหว่างช็อตเหล่านี้

สี่เฟรมจากสี่ช็อตแสดงนักร้องคนเดียวกันบนดาดฟ้าสีนีออน ทางหลวงทะเลทราย สตูดิโอสีขาว และถังน้ำสีดำ_หนึ่งเฟรมที่ดึงมาจากคลิปที่ส่งออกแต่ละคลิป ผมเดียวกัน เสื้อตาข่ายเดียวกัน ปลอกคอ LED สีแดงเดียวกันทั้งในสายฝน แสงแดดต่ำ ไฟแบนสูง และใต้น้ำ_
ทำไมความพยายามทำมิวสิควิดีโอ MiniMax H3 ส่วนใหญ่ถึงพังเมื่อถึงวินาทีที่สิบหก
รูปแบบความล้มเหลวสามแบบ ที่หลีกเลี่ยงได้ทั้งหมด
หนึ่ง: มองว่า 15 วินาทีคือขีดจำกัดของโปรเจกต์ H3 จำกัดการสร้างครั้งละ 15 วินาที ผู้คนอ่านแล้วสรุปว่า "ไม่มีมิวสิควิดีโอ" แล้วเลิก แต่มิวสิควิดีโอไม่เคยเป็นช็อตเดียว มิวสิควิดีโอจริงตัดทุก 4 ถึง 8 วินาทีอยู่แล้ว ขีดจำกัดแค่บังคับให้คุณทำในสิ่งที่บรรณาธิการจะทำอยู่แล้ว
สอง: อธิบายจังหวะด้วยคำพูด "สนุกสนาน มีพลัง เต้นตามจังหวะ" ไม่ได้ให้อะไรที่โมเดลจะยึดได้ มันจะสร้างจังหวะขึ้นมาเอง และจุดตัดของคุณจะตกครึ่งจังหวะตลอดไป การส่งเสียงจริงให้มันช่วยขจัดการเดา
สาม: ปล่อยให้เครื่องแต่งกายเปลี่ยน ทุกช็อตต้องการภาพอ้างอิงเดียวกัน และ คำอธิบายเครื่องแต่งกายเดียวกันแบบคำต่อคำ เปลี่ยน "เสื้อตาข่ายสีดำด้าน" เป็น "เสื้อตาข่ายสีเข้ม" ระหว่างช็อต คุณจะได้คนละคน
นี่คือสิ่งที่สองเส้นทางมีค่าใช้จ่ายจริง:
| ห่วงโซ่เครื่องมือสี่แบบดั้งเดิม | การเรียก H3 แบบอ้างอิงครั้งเดียว | |
|---|---|---|
| เครื่องมือต่อช็อต | โมเดลภาพ, โมเดลวิดีโอ, เครื่องมือซิงค์ปาก, NLE | เอนด์พอยต์เดียว จากนั้น NLE ตอนท้าย |
| ขั้นตอนด้วยมือต่อช็อต | 4 การส่งต่อ, 3 การส่งออกไฟล์ | 1 การส่ง |
| อะไรยึดตัวละครไว้ | การรีพรอมต์ด้วยตนเองและโชค | ภาพอ้างอิงเดียวใช้ซ้ำแบบคำต่อคำ |
| ภาพและเสียง | เรนเดอร์แยกกัน จัดแนวทีหลัง | สร้างในรอบเดียวกัน สเตอริโอ 32 kHz |
| ค่าใช้จ่ายต่อช็อต 8 วินาที | มิเตอร์แยกสี่อัน | $1.12 ที่ 2K, $0.80 ที่ 768P |
เพื่อความเป็นธรรมกับเส้นทางเก่า: มันไม่ใช่จินตนาการ Arata Fukoe ผู้สร้างชาวญี่ปุ่นได้รับรางวัลเหรียญทองแดง Project Odyssey จากมิวสิควิดีโอ AI เต็มรูปแบบ และทั้ง Queen และ Linkin Park ได้เผยแพร่มิวสิควิดีโอที่ได้รับความช่วยเหลือจาก AI อย่างเป็นทางการแล้ว ห่วงโซ่เหล่านั้นแค่ใช้เครื่องมือสี่หรือห้าชิ้น ซึ่งเป็นสิ่งที่ศิลปินอิสระที่มีเพลงเดียวไม่มีเวลาทำ
เสียงอ้างอิงซื้ออะไรให้มิวสิควิดีโอ MiniMax H3
นี่คือส่วนที่ควรทำความเข้าใจก่อนที่คุณจะใช้จ่ายอะไร
H3 สร้างภาพและเสียงในรอบเดียว แทนที่จะพากย์เสียงลงบนเฟรมที่เสร็จแล้ว เมื่อคุณส่งแทร็กอ้างอิง แทร็กนั้นไม่ใช่แค่โน้ตอารมณ์ ฉันเปรียบเทียบชิ้นส่วนอินพุตของฉันกับสตรีมเสียงภายใน mp4 ที่ส่งออก ในระดับรูปคลื่น การดาวน์มิกซ์โมโน 8 kHz:
- ความสัมพันธ์ของเอนเวโลป: 0.956 ที่ระยะหน่วงศูนย์
- ความสัมพันธ์ของรูปคลื่นดิบในหน้าต่าง 2 วินาที: 0.892 ที่ ค่าออฟเซ็ตตัวอย่างเป็นศูนย์
นั่นไม่ใช่โมเดลที่สร้างเพลงที่คล้ายกัน นั่นคือไฟล์ของคุณ ตรงกันตัวอย่าง แอมเบียนซ์ที่พรอมต์ขอถูกวางทับด้านบน และการเข้ารหัส AAC หนึ่งรอบ สำหรับการเปรียบเทียบ การวัดเดียวกันกับเทคควบคุมที่สร้างโดยไม่มีเสียงอ้างอิง ได้ค่า 0.26 ซึ่งเป็นพื้นเสียงรบกวน

รูปคลื่นของชิ้นส่วนอินพุตด้านบน เสียงที่ H3 ส่งออกด้านล่าง จัดแนวที่ออฟเซ็ตศูนย์_ด้านบน: mp3 8 วินาทีที่ฉันอัปโหลด ด้านล่าง: สตรีมเสียงภายใน mp4 ที่ H3 ส่งคืน พีคเดียวกัน ตำแหน่งเดียวกัน ไม่มีออฟเซ็ต_
ขีดจำกัดอินพุตนั้นเข้มงวด และถูกบังคับใช้ในเวลาที่ส่ง แทนที่จะเงียบๆ
| อินพุตอ้างอิง | ขีดจำกัด | คิดเงิน |
|---|---|---|
| รูปภาพ | สูงสุด 9 | ฟรีบนเอนด์พอยต์ H3 ของ Atlas Cloud |
| วิดีโอ | สูงสุด 3, แต่ละ 2-15 วินาที | คิดเงินในอัตราเอาต์พุต |
| เสียง | สูงสุด 3, แต่ละ 2-15 วินาที, รวมทั้งหมด 15 วินาที | $0.00 |
| เสียงอย่างเดียว | ถูกปฏิเสธ ต้องมีรูปภาพหรือวิดีโออย่างน้อยหนึ่งอย่าง | ไม่มี |
ฉันทดสอบขีดจำกัดเสียงรวมโดยตั้งใจ ส่งสามชิ้นส่วน 8 วินาทีในการเรียกครั้งเดียว มันล้มเหลวใน 5.8 วินาทีด้วย invalid params, total audio duration 24138 ms exceeds 15000 ms และไม่ถูกคิดเงิน ข่าวดี: H3 ไม่ได้ทิ้งไฟล์พิเศษอย่างเงียบๆ แล้วคิดเงินคุณอยู่ดี
อีกหนึ่งกับดักที่ฉันเจอก่อนหน้านี้ ถ้าคุณส่งเสียงเป็น data URL base64 ชนิด MIME จะเป็นตัวกำหนดนามสกุลที่ API อนุมาน data:audio/mpeg ถูกปฏิเสธด้วย audio format ".mpeg" not allowed data:audio/mp3 ผ่านฉลุย มีสี่ครั้งที่ส่งแล้วล้มเหลวเพราะเรื่องนี้ก่อนที่ฉันจะสังเกตเห็น ทั้งหมดฟรี
เวิร์กโฟลว์มิวสิควิดีโอ MiniMax H3 และแต่ละวินาทีมีค่าใช้จ่ายเท่าไหร่
ทุกอย่างด้านล่างทำงานผ่านคีย์ API หนึ่งอันบน Atlas Cloud ซึ่งเป็นที่ที่ฉันรันและคิดเงินทั้งหมด สามโมเดล หนึ่งแท็บเบราว์เซอร์
| ขั้นตอน | โมเดล | สิ่งที่ทำ | ราคาที่ฉันถูกเรียกเก็บจริง |
|---|---|---|---|
| เขียนท่อนฮุก | minimax/music-2.6 | เพลงเต็มจากพรอมต์สไตล์และเนื้อร้อง, mp3 สูงสุด ~5 นาที | $0.15 ต่อเพลง, คงที่ |
| ล็อคศิลปิน | openai/gpt-image-2/text-to-image | หนึ่งเฟรมฐานที่ทุกช็อตจะสืบทอด | $0.1745 ที่ quality high, 2048x1152 |
| ถ่ายแต่ละช็อต | minimax/h3/reference-to-video | ภาพบวกเสียงเข้า, คลิปล็อคจังหวะพร้อมเสียงสเตอริโอออก | $0.14/วินาทีที่ 2K, $0.10/วินาทีที่ 768P. อินพุตเสียง $0.00 |
สองหมายเหตุเกี่ยวกับตารางนั้น เพราะตัวเลขที่แสดงไว้โกหกทั้งสองทิศทาง GPT Image 2 แสดง $0.009 เป็นพื้นในแคตตาล็อก นั่นคือระดับ token ต่ำสุด และการเรนเดอร์ high ขนาด 2048x1152 จริงๆ คิดเงิน $0.1745 รายการแคตตาล็อกของ H3 แสดง $0.10 ซึ่งเป็นเฉพาะระดับ 768P เท่านั้น งาน 2K 8 วินาทีของฉันแต่ละครั้งถูกเรียกเก็บ $1.12 พอดี ซึ่งคือ $0.14 ต่อวินาที
ถ้าคุณต้องการล็อคเฟรมแรกแทนการอ้างอิงวัตถุ [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) ใช้อัตราเดียวกัน และ [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) ครอบคลุมช็อตที่ใช้พรอมต์ล้วนๆ
การแก้ไขที่ควรทำ: แผนเวอร์ชันก่อนหน้านี้สันนิษฐานว่าคุณต้องนำเพลงของคุณเองมาเพราะไม่มีตัวสร้างเพลงเต็มบนแพลตฟอร์ม ตอนนี้มีแล้ว minimax/music-2.6 เขียนแทร็กได้ ดังนั้นทั้งห่วงโซ่ รวมถึงเพลง ทำงานในที่เดียว
วิธีทำมิวสิควิดีโอ MiniMax H3 ทีละขั้นตอน
ขั้นตอนที่ 1: เขียนท่อนฮุก 120 BPM และตัดเป็นชิ้นส่วนต่อช็อต
ขอ 120 BPM อย่างชัดเจน ที่ 120 BPM หนึ่งบาร์ยาว 2.000 วินาที พอดี ดังนั้นค่า duration เป็นจำนวนเต็มวินาทีของ H3 จะลงตรงเส้นบาร์โดยอัตโนมัติ: 4 วินาที = 2 บาร์, 6 วินาที = 3 บาร์, 8 วินาที = 4 บาร์, 10 วินาที = 5 บาร์ การตัดของคุณจะตรงกับจังหวะตกโดยที่คุณไม่ต้องแตะมาร์กเกอร์ใดๆ
โมเดล: minimax/music-2.6 การตั้งค่า: format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false
พรอมต์สไตล์:
plaintext1Synth-pop ที่ 120 BPM พอดี, เตะสี่ต่อสี่ตรงๆ, แพดอะนาล็อกสว่างๆ ไซด์เชน, เสียงร้องนำหญิงใสสะอาดอยู่ข้างหน้ามิกซ์, คอรัสสเตอริโอกว้าง, ไม่มีแร็พ, สระเปิดยาว, ซีนีมาติกและเศร้าเล็กน้อย, มาสเตอร์พร้อมออกอากาศ
เนื้อร้อง:
plaintext1[Chorus] 2Hold the line, hold the light 3I am running out of night 4Say my name into the rain 5And I will burn again
มันส่งคืนแทร็กยาว 70 วินาทีใน 75 วินาที ราคา $0.15 จากนั้นฉันตรวจสอบจังหวะแทนที่จะเชื่อมัน โดยรันออโตคอร์รีเลชันของ onset-novelty เหนือไฟล์ ค่าหน่วงที่แรงที่สุดกลับมาที่ 0.500 วินาทีพอดี ซึ่งคือ 120 BPM และกริดจังหวะเริ่มที่ 0.24 วินาที เข้าไปในไฟล์ที่ถอดรหัส แทนที่จะเป็นศูนย์ ค่าออฟเซ็ตนั้นสำคัญ: ตัดจาก 0.24 และทุกชิ้นส่วนจะเริ่มต้นที่จังหวะตก
plaintext1# มาสเตอร์ 32 วินาที เริ่มต้นที่จังหวะตกที่ 0.24s 2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3 3 4# สี่ชิ้นส่วน 8 วินาที หนึ่งชิ้นต่อช็อต แต่ละชิ้น 4 บาร์ และต่ำกว่าขีดจำกัด 15s มาก 5for i in 0 8 16 24; do 6 ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3 7done
ถ้าคุณมีแทร็กของตัวเองอยู่แล้ว ให้ข้ามขั้นตอนนี้ไปเลย นั่นคือกรณีปกติ และเป็นกรณีที่ถูกที่สุด
ขั้นตอนที่ 2: ล็อคศิลปินด้วยเฟรมฐาน GPT Image 2 เพียงเฟรมเดียว
ทุกช็อตอ้างอิงไฟล์นี้เพียงไฟล์เดียว อะไรที่ผิดที่นี่จะผิดสี่ครั้ง ดังนั้นใช้เงิน $0.17 และดูให้ดี
โมเดล: openai/gpt-image-2/text-to-image การตั้งค่า: quality high , size 2048x1152 (16:9)
plaintext1ภาพนิ่งมิวสิควิดีโอซีนีมาติก ภาพครึ่งตัวบน นักร้องหญิง synth-pop เชื้อสายเอเชียตะวันออก อายุ 25 ปี ผมสั้นสีเงินขาว หน้าม้าตัดตรง เสื้อตาข่ายสีดำด้าน ปลอกคอ LED สีแดงบางๆ เรืองแสงที่กระดูกไหปลาร้า ต่างหูเงินข้างเดียว เธอยืนบนดาดฟ้าที่เปียกฝนตอนกลางคืน ถือไมโครโฟนมือถือโครเมียมวินเทจแนบปาก ข้างหลังเธอ ป้ายนีออนสีม่วงแดงและฟ้าไม่อยู่ในโฟกัส ฝนละอองเล็กๆ ถูกจับด้วยแสงหลังที่แข็ง หมอกลอยจากช่องระบายอากาศ ถ่ายด้วย 35mm anamorphic, ความชัดตื้น, เกรดสี teal-and-magenta, เห็นเกรนฟิล์ม ใบหน้าของเธอคมชัดและสว่างสม่ำเสมอด้วยแสงหลักนุ่มนวลจากด้านซ้ายของกล้อง ไม่มีข้อความใดๆ ในเฟรม

เฟรมฐานที่สร้างขึ้น: นักร้องผมสีเงินกับไมโครโฟนโครเมียมบนดาดฟ้านีออนที่เปียกฝน_เฟรมฐานที่ทุกช็อตต่อมาสืบทอด สร้างด้วย_ openai/gpt-image-2/text-to-image , quality high, 2048x1152, คิดเงิน $0.1745

GPT Image 2 กำลังรันพรอมต์นี้ใน playground ของ Atlas Cloud พร้อมเฟรมที่เสร็จแล้วในแผงเอาต์พุต
พรอมต์เดียวกันใน playground: ขนาด 16:9 ที่ 2048x1152, Quality high, และปุ่ม Run แสดงราคา $0.1745 ซึ่งเป็นสิ่งที่ API เรียกเก็บจากฉันจริงๆ ราคา $0.009 ในแคตตาล็อกคือระดับ token ต่ำสุด ไม่ใช่อันนี้ พรอมต์เดียวกัน ต่าง seed ดังนั้นการเรนเดอร์นี้ไม่ใช่ไฟล์ด้านบน
คำศัพท์เครื่องแต่งกายในพรอมต์นั้น (ผมสั้นสีเงินขาว, เสื้อตาข่ายสีดำด้าน, ปลอกคอ LED สีแดง, ต่างหูเงิน) จะถูกนำมาใช้ซ้ำแบบคำต่อคำในทุกพรอมต์ด้านล่าง การทำซ้ำนั้นคือกลไกความสอดคล้องทั้งหมด อย่าใช้คำพูดอื่น
ขั้นตอนที่ 3: รันช็อตแรกของมิวสิควิดีโอ MiniMax H3 พร้อมเสียงอ้างอิงฟรี
โมเดล: minimax/h3/reference-to-video การตั้งค่า: refers = เฟรมฐานบวก slice-0.mp3 , resolution: 2K, duration: 8, ratio: 16:9
ตั้งค่า ratio อย่างชัดเจน ค่าเริ่มต้นใน playground คือ adaptive และเอนด์พอยต์จะทำงานดีกว่ามากเมื่อคุณระบุรูปทรงที่ต้องการ
plaintext1ช็อตมิวสิควิดีโอ ผู้หญิงในภาพอ้างอิงร้องเพลงอ้างอิงตรงไปที่เลนส์บนดาดฟ้านีออนที่เปียกฝน ถือไมโครโฟนโครเมียมที่ปาก เธอร้องบรรทัดแรกหนักๆ ลงจังหวะตก สบตากล้อง จากนั้นเอียงศีรษะไปข้างหลังในโน้ตที่ยืดยาว ค่อยๆ ซูมเข้าจากครึ่งตัวถึงคลูสอัพแน่นตลอดแปดวินาที กล้องสั่นเล็กน้อยแบบมือถือ ฝนสาดผ่านแสงหลังที่แข็ง ปากของเธอขยับตามสระที่ร้องในเสียงอ้างอิงพอดี เธอกำลังร้องเพลง ไม่ใช่พูด ผมสั้นสีเงินขาว เสื้อตาข่ายสีดำด้าน และปลอกคอ LED สีแดงเรืองแสงเหมือนกับภาพอ้างอิง เสียง: แทร็กอ้างอิงในสเตอริโอ บวกเสียงฝนเบาๆ และเสียงเมืองที่อยู่ไกลๆ ผสมอยู่เบาๆ
7sPeYEe-xII
ช็อต 1 เปิดเสียง 2560x1440, 8.00 วินาทีพอดี, 24 fps, สเตอริโอ 32 kHz 345 วินาทีจากการส่งถึงไฟล์ คิดเงิน $1.12 ดูการเอียงศีรษะไปข้างหลังในโน้ตที่ยืดยาวประมาณ 5 วินาที

playground reference-to-video ที่มีเฟรมฐานและชิ้นส่วนเสียงโหลดอยู่ และคลิปที่เสร็จแล้วในแผงเอาต์พุต
Reference Materials อ่านว่า 2/9: slice-0.mp3 ในช่องหนึ่ง เฟรมฐานในอีกช่อง Resolution 2K, Duration 8, และปุ่ม Run แสดงราคา $1.12 ซึ่งคือ 8 x $0.14 พอดี สังเกตเมนู Aspect Ratio ที่ตั้งเป็น adaptive ซึ่งเป็นค่าเริ่มต้นของหน้า การเรียก API ของฉันตั้งค่า ratio เป็น 16:9 อย่างชัดเจน
ตัวเลขหนึ่งที่ควรจด: duration: 8 ส่งคอนเทนเนอร์ที่มีความยาว 8.00 วินาทีพอดี duration: 4 ส่งคืน 4.46 วินาที ถ้าคุณวางแผนจะต่อกันที่เส้นบาร์ ให้ใช้ระยะเวลาที่ส่งคืนมาตรง
ขั้นตอนที่ 4: ถ่ายอีกสามโลกโดยไม่สูญเสียใบหน้า
เฟรมฐานเดียวกัน ประโยคเครื่องแต่งกายเดียวกัน ชิ้นส่วนเสียงถัดไป ทุกอย่างอื่นเปลี่ยน
4a. ทางหลวงทะเลทรายยามโกลเดนอาวร์ refers = เฟรมฐาน + slice-8.mp3, 2K, duration: 8, ratio: 16:9
plaintext1ช็อตมิวสิควิดีโอ ผู้หญิงคนเดียวกันจากภาพอ้างอิงยืนบนเส้นกลางของทางหลวงทะเลทรายที่ว่างเปล่ายามโกลเดนอาวร์ ไม่มีไมโครโฟน สวมแจ็กเก็ตยีนส์สีครามเปิดทับเสื้อตาข่ายสีดำด้านตัวเดิม ปลอกคอ LED สีแดงยังติดสว่าง เธอขยับปากร้องตามคอรัสของแทร็กอ้างอิงกลางสายลม ขณะที่กล้องเคลื่อนถอยหลังต่ำเหนือยางมะตอย ความร้อนสั่นไหวเหนือถนน ฝุ่นปลิว เงาของเธอยาวทอดยาวไปทางเลนส์ แฟลร์ anamorphic พาดผ่านที่จุดกึ่งกลาง ผม ใบหน้า และเครื่องแต่งกายเหมือนกับภาพอ้างอิง เสียง: แทร็กอ้างอิงทับลมทะเลทรายเปิด กว้างและโปร่ง
4XEki-v2vCU
ช็อต 2 เปิดเสียง ใบหน้าเดียวกัน อุณหภูมิสีตรงกันข้าม และแทร็กอ้างอิงรีมิกซ์ภายใต้ลมเปิด 332 วินาที, $1.12
4b. สตูดิโอ infinity cove สีขาว refers = เฟรมฐาน + slice-16.mp3, 2K, duration: 8, ratio: 16:9
plaintext1ช็อตมิวสิควิดีโอ ผู้หญิงคนเดียวกันจากภาพอ้างอิงในสตูดิโอ infinity cove สีขาวบริสุทธิ์ภายใต้แสงสูงแบนราบไม่มีเงา สวมเสื้อโค้ทไวนิลสีแดงมันวาวทับเสื้อตาข่ายสีดำด้านตัวเดิม ปลอกคอ LED สีแดงมองเห็นได้ที่คอเสื้อ เธอเต้นสี่บาร์ตามแทร็กอ้างอิง ผมสีเงินขาวปลิวตามทุกครั้งที่หมุน เฟรมกว้างล็อคอยู่ จากนั้นซูมกระชากไปที่ช็อตกลางที่จังหวะตกที่สอง กระดาษสี่เหลี่ยมสีขาวเล็กๆ ร่วงเหมือนคอนเฟตติในช่วงสองวินาทีสุดท้าย ใบหน้าและผมเหมือนกับภาพอ้างอิง เสียง: แทร็กอ้างอิง แห้งและใกล้ บวกกับเสียงรองเท้าลากบนพื้นสตูดิโอ
VAyqdkVpnm0
ช็อต 3 เปิดเสียง แสงไร้เงาแบนราบเป็นที่ที่ยากที่สุดในการซ่อนการเปลี่ยนใบหน้า และมันก็ คงอยู่ 8.00 วินาที, $1.12
4c. ใต้น้ำ b-roll ไม่มีการซิงค์ปาก refers = เฟรมฐาน + slice-24.mp3, 2K, duration: 8, ratio: 16:9
plaintext1ช็อตมิวสิควิดีโอ ผู้หญิงคนเดียวกันจากภาพอ้างอิงลอยอยู่ใต้น้ำในถังสีดำ ผมสีเงินขาวปลิวรอบตัวเธอ ปลอกคอ LED สีแดงเรืองแสงผ่านน้ำ เสื้อตาข่ายสีดำด้านพลิ้วไหวช้าๆ ลำแสงเดียวจากด้านบน ฟองอากาศลอยผ่านเลนส์แบบสโลว์โมชั่น เธอลืมตาที่จังหวะตกและยื่นมือข้างหนึ่งไปทางผิวน้ำ เธอไม่ร้องเพลงและปากยังคงปิด กล้องหมุน 30 องศารอบตัวเธอตลอดช็อต ใบหน้าเหมือนกับภาพอ้างอิง เสียง: แทร็กอ้างอิงที่ได้ยินจากเหนือผิวน้ำ อู้อี้และตัดความถี่สูง พร้อมเสียงฟองอากาศ
fibdweUMRpY
ช็อต 4 เปิดเสียง คำสั่ง "เธอไม่ร้องเพลงและปากยังคงปิด" ถูกรับฟัง ซึ่งเป็นส่วนที่มีประโยชน์: เสียงอ้างอิงขับเคลื่อนเวลา ไม่ใช่การแสดงที่บังคับ 329 วินาที, $1.12
ขั้นตอนที่ 5: รันเทคควบคุม โดยเปิดช่องเสียงว่างไว้
พรอมต์เดียวกันกับขั้นตอนที่ 3 คำต่อคำ การเปลี่ยนแปลงเดียว: refers เก็บรูปภาพและไม่มีอะไรอื่น 768P, duration: 8
คลิปนี้อธิบายกลไกทั้งหมดได้ดีกว่าย่อหน้าใดๆ ฟังมันเทียบกับขั้นตอนที่ 3
FAoPplGmKJc
เทคควบคุม พรอมต์เดียวกัน ไม่มีเสียงอ้างอิง 1344x768, 8.00 วินาที, 200 วินาที, $0.80 H3 เขียนเพลงประกอบของตัวเอง และการแสดงก็เป็น "มีคนกำลังร้องเพลง" ทั่วไป ไม่ใช่คำเหล่านี้
วัดเทียบกับมาสเตอร์ของฉัน เสียงของเทคควบคุมได้คะแนนความสัมพันธ์เอนเวโลป 0.26 ขั้นตอนที่ 3 ได้ 0.956 ช่องว่างนั้นคือสิ่งที่ช่องเสียงฟรีซื้อให้คุณ
ขั้นตอนที่ 6: ทำลายการซิงค์ปากโดยตั้งใจ
ทุกโมเดลมีขีดจำกัดพยางค์ การหาขีดจำกัดของคุณมีค่าใช้จ่าย $0.40
ฉันสร้างแทร็กแร็พจังหวะสองเท่าแยกต่างหาก (minimax/music-2.6 อีกครั้ง $0.15) ตัดชิ้นส่วน 4 วินาทีที่มีประมาณหกพยางค์ต่อวินาที และป้อนเข้าไปในฉากดาดฟ้าเดิมที่ 768P, duration: 4
plaintext1ช็อตมิวสิควิดีโอ ผู้หญิงในภาพอ้างอิงแร็พแทร็กอ้างอิงตรงไปที่เลนส์บนดาดฟ้านีออนที่เปียกฝน ถือไมโครโฟนโครเมียมที่ปาก ส่งทุกพยางค์ของท่อนแร็พจังหวะสองเท่าที่เร็ว คลูสอัพขนาดกลางล็อคอยู่ กล้องสั่นเล็กน้อยแบบมือถือ ฝนสาดในแสงหลังที่แข็ง ปากของเธอขยับตามพยางค์ที่แร็พในเสียงอ้างอิงพอดี ผมสั้นสีเงินขาว เสื้อตาข่ายสีดำด้าน และปลอกคอ LED สีแดงเรืองแสงเหมือนกับภาพอ้างอิง เสียง: แทร็กอ้างอิงในสเตอริโอ บวกเสียงฝนเบาๆ
jiQVCjOCbKg
การทดสอบความเครียด เปิดเสียง 1344x768, 4.46 วินาที, 192 วินาที, $0.40 ปากขยับตลอดและตรงจังหวะ แต่มันหยุดแยกแยะพยัญชนะแต่ละตัวและกลายเป็นวงจรเปิด-ปิดซ้ำๆ เส้นร้องเพลงได้รูปสระที่ชัดเจน นี่ไม่ใช่
การอ่านที่ตรงไปตรงมาของฉันจากไฟล์ที่ส่งมา: สระร้องเพลงที่ยืดยาวคือจุดที่การขยับปากของ H3 น่าเชื่อถือจริงๆ และพยัญชนะแร็พที่หนาแน่นคือจุดที่มันลดระดับลงเป็นการเคลื่อนไหวที่ดูเป็นไปได้ วางแผนคลูสอัพของคุณรอบๆ เส้นร้องเพลง และใส่บาร์ที่เร็วใน b-roll มีรายละเอียดเพิ่มเติมเกี่ยวกับความแตกต่างระหว่างการพูดและการร้องเพลงใน การวิเคราะห์การซิงค์ปากและเสียง
ขั้นตอนที่ 7: ต่อ, ปิดเสียง, และวางมาสเตอร์กลับทับบนมิวสิควิดีโอ MiniMax H3 ของคุณ
สี่คลิปที่มีความยาว 8.00 วินาทีพอดี เมื่อต่อกันจะได้ 32.00 วินาทีพอดี ซึ่งคือ 16 บาร์ที่ 120 BPM ไม่ต้องตัดแต่ง
plaintext1# 1. ลบเสียงของแต่ละคลิป 2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do 3 ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4 4done 5 6# 2. ต่อตามลำดับบาร์ (4 x 8s = 32s = 16 bars @ 120 BPM) 7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt 8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4 9 10# 3. วางมาสเตอร์เดิมกลับ 11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4
ทำไมต้องกวนใจปิดเสียง ถ้าโมเดลให้แทร็กของคุณกลับมาอยู่แล้ว? เพราะมิกซ์สเตอริโอของแต่ละคลิปมีแอมเบียนซ์ที่พรอมต์ของคลิปนั้นขอ: ฝนในช็อต 1 ลมทะเลทรายในช็อต 2 ฟิลเตอร์ใต้น้ำตัดความถี่สูงในช็อต 4 สวยงามต่อช็อต แต่ไม่สอดคล้องกันเมื่อตัดข้าม มาสเตอร์ให้มิกซ์ต่อเนื่องหนึ่งเดียวที่บิตเรตเต็ม โดยไม่ต้องเข้ารหัสใหม่ต่อช็อต H3 ส่งมอบการซิงค์การแสดง มาสเตอร์ของคุณส่งมอบเพลง
สี่รูปแบบของสูตรมิวสิควิดีโอ MiniMax H3
คัทแนวตั้งสำหรับแพลตฟอร์ม ตั้งค่า ratio: 9:16 คุณจะได้ Spotify Canvas หรือชิ้นส่วน Shorts จากเฟรมฐานและชิ้นส่วนเดียวกัน มันส่งคืน 768x1344 จริง ดังนั้นต่างจากเมนู Aspect ใน playground ค่า ratio ของ API นั้นคงที่ Canvas loops เงียบโดยการออกแบบ ดังนั้นอันนี้จึงส่งเป็น GIF

คัทลูปแนวตั้ง 9:16 ของศิลปินคนเดียวกันบนดาดฟ้านีออน_เฟรมฐานเดียวกัน ชิ้นส่วนอ้างอิงเดียวกัน_ ratio: 9:16 ที่ 768P ราคา $0.80 หนึ่งรอยย่นที่ซื่อสัตย์: ฉันขอ "ไม่ร้องเพลง" แต่ได้ร้องเพลงมา เมื่อมีเสียงร้องในช่องอ้างอิง เสียงจะเป็นฝ่ายชนะการโต้แย้ง ถ้าคุณต้องการนักแสดงที่เงียบ ให้ป้อนชิ้นส่วนที่เป็นดนตรีเท่านั้น
วิดีโออ้างอิงแทนภาพอ้างอิง คุณสามารถส่งคลิปวิดีโออ้างอิงได้ถึงสามคลิปเพื่อถ่ายทอดการเคลื่อนไหวและเฟรมแทนการอธิบาย ดูมิเตอร์: วิดีโออ้างอิง คิดเงิน ในอัตราเอาต์พุต ในขณะที่เสียงอ้างอิงฟรี ความไม่สมดุลนั้นคือข้อเท็จจริงด้านราคาที่มีประโยชน์ที่สุดในเอนด์พอยต์นี้
ภาพ Visualiser b-roll ล้วนๆ ละทิ้งนักแสดงทั้งหมด ป้อนภาพผลิตภัณฑ์ ปกอัลบั้ม หรือแผ่นพื้นผิว พร้อมชิ้นส่วนเสียง และพรอมต์เฉพาะการเคลื่อนไหวของกล้อง ไม่ต้องรักษาใบหน้า ไม่ต้องซิงค์ปากให้เสีย และคุณสามารถถ่ายทั้งหมดที่ 768P
ร่างราคาถูก ทำเสร็จราคาแพง 768P ราคา $0.10/วินาที เทียบกับ 2K ที่ $0.14/วินาที และทั้งคู่ส่งคืนสเตอริโอ 32 kHz เหมือนกัน ดังนั้นการแสดงที่คุณกำลังประเมินก็เหมือนกัน การประหยัดไม่ได้อยู่ที่ช็อตที่เก็บ แต่อยู่ที่ช็อตที่ถูกปฏิเสธ: ทุกเทค 8 วินาทีที่ล้มเหลวมีค่าใช้จ่าย $0.80 แทนที่จะเป็น $1.12 ถ่ายที่ 768P จนกว่าเทคจะถูกต้อง จากนั้นจ่าย $1.12 ครั้งเดียว สำหรับช็อตที่ใช้สามครั้ง นั่นคือ $2.72 แทนที่จะเป็น $3.36 ข้อมูลเพิ่มเติมเกี่ยวกับความแตกต่างของระดับใน การเปรียบเทียบ 768P กับ 2K และเกี่ยวกับความยาวที่คลิปเดียวสามารถยืดได้ใน คู่มือความยาวคลิป
มิวสิควิดีโอ MiniMax H3 เต็มรูปแบบมีค่าใช้จ่ายจริงเท่าไหร่
ทุกบรรทัดด้านล่างเป็นตัวเลขที่ถูกเรียกเก็บจริง ซึ่งดึงมาจากบันทึกการพยากรณ์หลังจากเสร็จสิ้น ไม่ใช่ราคาในรายการ
| รายการ | โมเดลและการตั้งค่า | คิดเงิน |
|---|---|---|
| ท่อนฮุก, เพลง 70 วินาที | minimax/music-2.6, mp3 44.1 kHz | $0.15 |
| เฟรมฐานศิลปิน | openai/gpt-image-2/text-to-image, high, 2048x1152 | $0.17 |
| ช็อต 1, ดาดฟ้านีออน | minimax/h3/reference-to-video, 2K, 8 วินาที | $1.12 |
| ช็อต 2, ทางหลวงทะเลทราย | เหมือนกัน, 2K, 8 วินาที | $1.12 |
| ช็อต 3, โคฟสีขาว | เหมือนกัน, 2K, 8 วินาที | $1.12 |
| ช็อต 4, ใต้น้ำ | เหมือนกัน, 2K, 8 วินาที | $1.12 |
| ยอดรวมวิดีโอที่เสร็จ | $4.80 | |
| โพรบตรวจสอบ | 768P, 4 วินาที | $0.40 |
| เทคควบคุม, ไม่มีเสียง | 768P, 8 วินาที | $0.80 |
| แทร็กแร็พสำหรับการทดสอบความเครียด | minimax/music-2.6 | $0.15 |
| การทดสอบความเครียดซิงค์ปาก | 768P, 4 วินาที | $0.40 |
| คัท Canvas แนวตั้ง | 768P, 8 วินาที, 9:16 | $0.80 |
| ภาพฮีโร่สำหรับบทความนี้ | openai/gpt-image-2/text-to-image, high | $0.17 |
| ทดสอบเกินขีดจำกัด, เสียง 24 วินาที | ถูกปฏิเสธตอนส่ง | $0.00 |
| สี่ครั้งที่ส่งด้วย MIME เสียงผิด | ถูกปฏิเสธตอนส่ง | $0.00 |
| เสียงอ้างอิง, 4 x 8 วินาที | อินพุตฟรี | $0.00 |
| ค่าใช้จ่ายทั้งหมด | $7.53 |
นั่นคือ $9.00 ต่อนาทีที่เสร็จ ที่ 2K ในช็อตที่ผ่านการคัดเลือก ก่อนความผิดพลาดของฉัน ถ่ายทั้งหมดที่ 768P นาทีเดียวกันจะอยู่ที่ $6.61 ทีมงาน MV มนุษย์ไม่เสนอราคาใดๆ ในสองตัวเลขนั้น
สองหมายเหตุในการดำเนินงานถ้าคุณกำลังวางงบประมาณสำหรับชิ้นงานที่ยาวขึ้น การปฏิเสธตอนส่งนั้นฟรี ดังนั้นพารามิเตอร์ที่ไม่ดีเสียเวลาเท่านั้น ไม่เสียเงิน และฟิลด์ price ในการพยากรณ์จะปรากฏขึ้นหลังจากดีเลย์ ดังนั้นให้สอบถามรหัสคำขออีกครั้งหลังจากไฟล์ดาวน์โหลด ถ้าคุณต้องการใบแจ้งหนี้จริงแทนที่จะเป็น null
เพลงของใคร ใบหน้าของใคร: สิ่งที่ต้องตรวจสอบก่อนเผยแพร่
สั้น เพราะมันสำคัญและไม่ต้องการคำเทศนา
คุณต้องมีสิทธิ์ในแทร็กอ้างอิง อินพุตฟรีไม่ได้หมายถึงการเคลียร์สิทธิ์ฟรี การป้อนซิงเกิลที่มีลิขสิทธิ์ทางการค้าเป็นเสียงอ้างอิง แล้วเผยแพร่สิ่งที่ออกมา เป็นเส้นทางด่วนสู่การลบเนื้อหา การบันทึกของคุณเอง แทร็กที่คุณว่าจ้าง หรือสิ่งที่คุณสร้างขึ้นนั้นใช้ได้
อย่าสร้างเฟรมฐานจากใบหน้าของศิลปินจริงที่มีชีวิต กลไกความสอดคล้องที่นี่เก่งมากในการรักษาใบหน้าข้ามช็อต ซึ่งเป็นเหตุผลว่าทำไมการชี้มันไปที่บุคคลจริงจึงเป็นความคิดที่ไม่ดี
น้ำหนักแบบเปิดและการเข้าถึง API เป็นสองใบอนุญาตที่แตกต่างกัน MiniMax เผยแพร่น้ำหนักของ H3 บน Hugging Face ในเดือนสิงหาคม 2026 และใบอนุญาตชุมชนของมันปัจจุบันไม่รวมถึง EU, UK, เกาหลีใต้ และสหรัฐอเมริกา โดยมีช่องทางใบอนุญาตอย่างเป็นทางการสำหรับดินแดนเหล่านั้น ข้อจำกัดนั้นแนบมากับการรันน้ำหนักด้วยตัวเอง การเรียกโมเดลผ่าน API ที่โฮสต์เป็นความสัมพันธ์ด้านบริการ และไม่ได้ทำให้คุณอยู่ภายใต้ใบอนุญาตน้ำหนัก ควรรู้ว่าคุณอยู่ในสถานการณ์ไหนก่อนที่จะสันนิษฐานอย่างใดอย่างหนึ่ง
สำหรับมุมมองที่กว้างขึ้นว่า H3 อยู่ตรงไหนเมื่อเทียบกับทางเลือกอื่น มี การเปรียบเทียบ Seedance 2.5 และ คู่มือโครงสร้างพรอมต์ สำหรับบริบทว่าทำไมมันถึงคุ้มค่าที่จะลำบาก: ในกระดานผู้นำการตัดต่อวิดีโอที่ให้คะแนนโมเดลที่มีเสียง H3 ปัจจุบันอยู่อันดับหนึ่งที่ 1,126 Elo นำหน้า Gemini Omni Flash ที่ 1,119 และ Dreamina Seedance 2.0 ที่ 1,027 (Artificial Analysis ตรวจสอบเมื่อ 10 สิงหาคม 2026) คะแนนเหล่านั้นเปลี่ยนตามคะแนนโหวต ดังนั้นให้ถือเป็นภาพรวมชั่วคราว
มิวสิควิดีโอ MiniMax H3: คำถามที่พบบ่อย
มิวสิควิดีโอ MiniMax H3 หนึ่งครั้งสามารถรันเต็มสามนาทีได้ไหม?
ไม่ได้ในการสร้างครั้งเดียว การเรียกครั้งเดียวจำกัดที่ 15 วินาที แต่นั่นคือขีดจำกัดต่อการสร้าง ไม่ใช่ต่อโปรเจกต์ วิดีโอสามนาทีที่ 8 วินาทีต่อช็อตคือ 23 การสร้าง ประมาณ $25.76 ที่ 2K และแต่ละครั้งจะลงตรงเส้นบาร์ถ้าแทร็กของคุณเป็น 120 BPM ตัด, ถ่าย, ต่อ, วางมาสเตอร์กลับ
มิวสิควิดีโอ MiniMax H3 ใช้เพลงจริงของฉัน หรือโมเดลสร้างเสียงขึ้นมาใหม่?
มันใช้เพลงจริงของคุณ ฉันวัดความสัมพันธ์ของรูปคลื่นดิบได้ 0.892 ที่ออฟเซ็ตตัวอย่างเป็นศูนย์ระหว่าง mp3 8 วินาทีที่ฉันอัปโหลดและสตรีมเสียงภายใน mp4 ที่ส่งคืน โดยมีแอมเบียนซ์ที่พรอมต์ขอวางทับด้านบน เทคควบคุมที่สร้างโดยไม่มีเสียงอ้างอิงได้คะแนน 0.26 เทียบกับมาสเตอร์เดียวกัน คุณควรวางมาสเตอร์ของคุณกลับทับการต่อสุดท้าย เพราะแต่ละคลิปมีแอมเบียนซ์ต่อช็อตของตัวเองและการเข้ารหัส AAC ของตัวเอง ซึ่งไม่รอดจากการตัดอย่างเรียบร้อย
การป้อนเพลงลงในมิวสิควิดีโอ MiniMax H3 มีค่าใช้จ่ายเพิ่มเติมไหม?
ไม่ ชิ้นส่วนเสียงอ้างอิง 8 วินาทีสี่อันของฉันเพิ่ม $0.00 ในบิลช็อต $4.48 วิดีโออ้างอิงต่างหากที่ต้องระวัง เพราะมันคิดเงินในอัตราเอาต์พุต ขีดจำกัดคือสามคลิปเสียง แต่ละคลิป 2 ถึง 15 วินาที รวม 15 วินาที และเสียงไม่สามารถเป็นข้อมูลอ้างอิงเพียงอย่างเดียวได้
การซิงค์ปากของ MiniMax H3 สำหรับการร้องเพลงดีแค่ไหนเมื่อเทียบกับการพูด?
สระร้องเพลงที่ยืดยาวคือจุดแข็ง: รูปปากที่ชัดเจน การค้างที่ตรงกับโน้ต และการเอียงศีรษะกลับในโน้ตยาวอ่านได้ว่าเป็นการแสดงมากกว่าลูป การส่งที่หนาแน่นคือจุดที่มันยอมแพ้ การทดสอบแร็พหกพยางค์ต่อวินาทีของฉันยังคงจังหวะแต่หยุดแยกแยะพยัญชนะและตกเป็นวงจรเปิด-ปิดซ้ำๆ ใส่บาร์ที่เร็วใน b-roll
ฉันจะรักษาใบหน้าเดียวกันในทุกช็อตของมิวสิควิดีโอ MiniMax H3 ได้อย่างไร?
สามสิ่ง ทั้งหมดน่าเบื่อ ภาพอ้างอิงหนึ่งภาพใช้ซ้ำในทุกการเรียก ไม่เคยสร้างใหม่ คำศัพท์เครื่องแต่งกายเดียวกันคัดลอกแบบคำต่อคำระหว่างพรอมต์ ไม่ใช้คำพ้อง และข้อความ "เหมือนกับภาพอ้างอิง" อย่างชัดเจนในแต่ละพรอมต์ สี่ช็อตของฉันข้ามฝน แสงแดดต่ำ แสงสูงแบนราบ และใต้น้ำโดยไม่มีการเลื่อนไหล
มิวสิควิดีโอ MiniMax H3 มีค่าใช้จ่ายเท่าไหร่ต่อนาทีที่เสร็จ?
$9.00 ต่อนาทีที่เสร็จที่ 2K จากบิลจริงของฉัน $4.80 สำหรับคัท 32 วินาที ถ่ายทั้งหมดที่ 768P นาทีเดียวกันมีค่าใช้จ่าย $6.61 และ 768P ให้สเตอริโอ 32 kHz เหมือนกัน ดังนั้นการแสดงที่คุณประเมินจึงเหมือนกัน ถ่ายเทคที่ถูกปฏิเสธที่ $0.80 และจ่าย $1.12 เฉพาะเทคที่รอดชีวิตในการตัดต่อ






