MiniMax H3 วิดีโอมีความยาว 15 วินาที ฉันนับได้สิบครั้งที่ตัดต่อในหนึ่งในนั้น

MiniMax H3 ความยาววิดีโออยู่ที่ 4 ถึง 15 วินาทีเต็ม ที่ 24 FPS ดูว่าคุณได้อะไรกลับมาทีละเฟรม มีกี่คัทที่พอดีในคลิปเดียว และวิธีเชื่อมต่อ 45 วินาที

ทุกคนทำสิ่งเดียวกันในวันแรก คุณเปิดดรอปดาวน์ระยะเวลา เห็น 15 แล้วเริ่มหาร หนังยาว 10 นาที? 40 เจเนอเรชัน คลิปอธิบาย 3 นาที? 12 แล้วคุณมองตัวเลขที่ได้จากการหารนั้น ปิดแท็บ แล้วตัดสินใจว่าโมเดลยังไม่พร้อมสำหรับอะไรก็ตามที่มีเนื้อเรื่อง

ผมก็หารเหมือนกัน จากนั้นผมรัน ffmpeg กับคลิป H3 จริงเก้าคลิป และพบสิ่งที่ทำให้การคำนวณทั้งหมดดูไร้สาระ

หนึ่งในคลิปนั้นยาว 15.10 วินาที ข้างในนั้น ตัวตรวจจับฉากทำเครื่องหมายการตัดที่ชัดเจนสิบครั้ง สิบครั้ง เสื้อผ้าต่างกัน เฟรมต่างกัน ฉากหลังต่างกัน การ์ดแบบเต็มเฟรม ทั้งหมดนี้ภายในเจเนอเรชันเดียวที่เสียค่าใช้จ่ายเท่ากับหนึ่งเจเนอเรชัน ถ้าผมวางแผนคลิปนั้นตามวิธีที่การหารบอกไว้ คือหนึ่งเจเนอเรชันต่อหนึ่งช็อต ผมจะต้องจ่ายมากกว่าสิบเท่าสำหรับ 15 วินาทีเดียวกัน

การหารคือความผิดพลาด ขีดจำกัดไม่ใช่นาฬิกาจับเวลา มันคือภาชนะ และแทบไม่มีใครเติมมันให้เต็ม

ลำดับภาพของนักสเก็ตบอร์ดกระโดดข้ามขอบคอนกรีตในเวลากลางคืน

นักสเก็ตบอร์ดกำลังทำท่ากลางอากาศที่ถูกจับเป็นลำดับภาพสโตรบ หลายตำแหน่งที่แตกต่างกันถูกแช่แข็งภายในเฟรมเดียว

หนึ่งเฟรม หลายช่วงเวลา นั่นคือแบบจำลองทางความคิดที่ดรอปดาวน์ระยะเวลาพยายามทำให้คุณละทิ้ง

ประเด็นสำคัญ

  • พารามิเตอร์ duration รับเฉพาะจำนวนเต็มตั้งแต่ 4 ถึง 15 เท่านั้น ค่าเริ่มต้นคือ 8 ไม่มี 7.5 และไม่มีค่าที่มากกว่า 15
  • ทุกคลิปจะกลับมาที่ 24 FPS สูงสุด 2K เนทีฟ พร้อมเสียงสเตอริโอที่สร้างขึ้นในพาสเดียวกันกับภาพ
  • คลิป "15 วินาที" ของคุณจริงๆ แล้วมี 362 เฟรม ซึ่งเท่ากับ 15.083 วินาที ระยะเวลาจะถูกปัดขึ้นตามกริด 17 เฟรม และมีเพียง duration: 8 เท่านั้นที่ลงตัวพอดีวินาที
  • หนึ่งเจเนอเรชันสามารถมีหลายช็อต เขียน SHOT 1 / CUT TO ลงในพรอมต์ แล้วโมเดลจะตัดให้คุณ โดยไม่มีค่าใช้จ่ายเพิ่มเติม
  • ไม่มีพารามิเตอร์ extend ใน API คุณจะผ่าน 15 วินาทีได้โดยการต่อเนื่อง: เฟรมสุดท้ายไปยังเฟรมแรกถัดไป, ภาพอ้างอิงเพื่อคงลุคไว้, จากนั้นต่อแบบ hard concat

ดู 45 วินาทีของ MiniMax H3 Video Length ที่สร้างจากสามคลิป

ก่อนจะถึงทฤษฎีใดๆ นี่คือตัวของมันเอง สปอตโฆษณาแนวราเมนยามดึกยาว 45 วินาทีชื่อ MIDNIGHT BOWL สามเจเนอเรชัน เจเนอเรชันละ 15 วินาที สามช็อตในแต่ละเจเนอเรชัน เก้าช็อต เนื้อเรื่องต่อเนื่องหนึ่งชิ้น ไม่มีการซ่อนรอยต่อด้วยการละลาย

คลิปตัดต่อ 45 วินาทีเต็ม สามเจเนอเรชัน MiniMax H3 ที่ต่อกันโดยไม่มีเอฟเฟกต์ทรานซิชัน เชฟ ผ้ากันเปื้อน หลอดไฟ และป้ายไม้ที่วาดด้วยมือ ยังคงอยู่ผ่านการเปลี่ยนผ่านสองครั้ง

เก้าเฟรมวิดีโอแสดงเชฟกำลังเตรียมและเสิร์ฟราเมน

เก้าเฟรมจากสปอต MIDNIGHT BOWL จัดเรียงเป็นแผ่นสัมผัส 3x3 ติดป้าย SHOT 1 ถึง SHOT 9 พร้อมไทม์โค้ด

เก้าช็อต สามเจเนอเรชัน แต่ละแถวคือหนึ่งเจเนอเรชัน แต่ละคอลัมน์คือการตัดที่โมเดลทำเอง ช็อต 3 และ 4 มีความคล้องจองกันเพราะเจเนอเรชัน 2 เริ่มจากเฟรมสุดท้ายของเจเนอเรชัน 1 ซึ่งเป็นสิ่งที่ทำให้รอยต่อมองไม่เห็น

สามเจเนอเรชัน ไม่ใช่เก้า ช่องว่างนั้นคือประเด็นทั้งหมดของบทความนี้

ผมไม่ได้ตัดต่อด้วยมือใดๆ เลย ผมขอให้แต่ละเจเนอเรชันสร้างสามช็อตพร้อมไทม์โค้ด และตัวตรวจจับฉากของ ffmpeg พบการตัดที่ 4.9 วินาที และ 9.1 วินาทีในคลิปแรก 4.9 วินาทีและ 9.0 วินาทีในคลิปที่สอง 5.3 วินาทีและ 11.0 วินาทีในคลิปที่สาม เก้าช็อต สามใบแจ้งหนี้

ทำไม MiniMax H3 Video Length ถึงทำลายแผนการสร้างเนื้อหายาว

ตัวเลขนั้นไม่ใช่ปัญหา สิบห้าวินาทีที่สูงสุดของช่วงนั้นถือว่าใจกว้างสำหรับโมเดลรุ่นนี้ และคลิปต่างๆ เป็น 2K พร้อมเสียงสเตอริโอจริง สิ่งที่ทำลายคนคือหน่วยที่พวกเขาใช้วางแผน

หากคุณจัดงบประมาณเป็นวินาที คลิปหนึ่งนาทีคือ "สี่คลิป" และคลิปสิบนาทีคือ "สี่สิบคลิป" และสี่สิบคลิปของอะไรก็ตามเป็นฝันร้ายของงานต่อเนื่อง หากคุณจัดงบประมาณเป็นช็อต คลิปหนึ่งนาทีคือสี่เจเนอเรชันที่ถือประมาณสิบสองช็อต ซึ่งเป็นจำนวนปกติของคัฟเวอเรจสำหรับโฆษณา โมเดลเดียวกัน ขีดจำกัดเดียวกัน แผนการผลิตที่แตกต่างกันโดยสิ้นเชิง

นิ้วมือถือแถบฟิล์มสีซีเปียที่แสดงถนน มือ และเงา

ภาพประกอบโปสเตอร์แบนสไตล์ย้อนยุคของแถบฟิล์ม 35 มม. เส้นเดียว ซึ่งสามเฟรมติดต่อกันแต่ละเฟรมมีฉากที่แตกต่างกันโดยสิ้นเชิง

จัดงบประมาณเป็นช็อต ไม่ใช่วินาที แถบฟิล์มที่เรียกเก็บเงินหนึ่งครั้ง มีสามฉากที่แตกต่างกันอยู่ข้างใน

มีอีกสิ่งหนึ่งที่ทำลายแผนการสร้างเนื้อหายาว และมันไม่ใช่ขีดจำกัดเลย มันคือรอยต่อ คลิปแต่ละคลิปแทบจะไม่พัง崩กลางคลิปเลย พวกมันพังที่รอยต่อ เพราะแต่ละเจเนอเรชันสร้างชุดเสียงของตัวเองขึ้นมาใหม่ และเบี่ยงเบนเล็กน้อยในเรื่องเสื้อผ้าและแสง วางแผนสำหรับรอยต่อ แล้ว 45 วินาทีก็ง่ายดาย ละเลยมัน แล้วสี่คลิปที่สมบูรณ์แบบก็ยังดูเหมือนสี่คลิป

MiniMax H3 Video Length จริงๆ คืออะไร: 4 ถึง 15 วินาทีเต็มบนกริด 17 เฟรม

เริ่มต้นด้วยสเปค เพราะมีตัวเลขสองตัวที่แตกต่างกันกำลังแพร่กระจาย สคีมา API สดสำหรับทั้งสามเอนด์พอยต์ H3 บน Atlas Cloud ระบุ duration เป็น enum ของ 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15 พอดี โดยมีค่าเริ่มต้นเป็น 8 จำนวนเต็มทั้งหมด ไม่มีเศษส่วน ไม่เกิน 15 บทความเปิดตัวตรงกับค่านั้น: เอาต์พุต 2K, 4 ถึง 15 วินาที, ระยะเวลาเป็นจำนวนเต็มเท่านั้น (MarkTechPost, สิงหาคม 2026) โพสต์เปิดตัวของ MiniMax เองอธิบายว่าสูงสุด 15 วินาทีที่ 2K พร้อมเสียงสเตอริโอเนทีฟ (MiniMax, สิงหาคม 2026)

คุณยังจะเห็น "5 ถึง 15 วินาที" เขียนไว้ในคำอธิบายโปรไฟล์และคำแนะนำด่วนต่างๆ รวมถึงข้อความในแพลตฟอร์ม ให้ถือว่าสคีมา enum เป็นความจริง พื้นคือ 4 และผมได้เรียกเก็บเงินคลิป 4 วินาทีเพื่อพิสูจน์แล้ว

ตอนนี้ส่วนที่แทบไม่มีใครพูดถึง ขอ 15 วินาที คุณจะไม่ได้ 360 เฟรม คุณจะได้ 362

H3 สร้างวิดีโอเป็นบล็อก 17 เฟรม และปัดระยะเวลาที่คุณร้องขอขึ้นไปยังจำนวนเฟรม 17k + 5 ถัดไปที่ 24 FPS กริดนั้นถูกบันทึกไว้ในบทช่วยสอน H3 อย่างเป็นทางการของ ComfyUI (ComfyUI Docs, 2026) และมันใช้ได้กับฝั่ง API เช่นกัน ผมนับเฟรมบนไฟล์ H3 จริงเก้าไฟล์ด้วย ffmpeg:

text
1ffmpeg -i video-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | tail -1
2# frame=  362  ...
3#   Duration: 00:00:15.10, 1280x720, 24 fps
4

ทุกไฟล์ 15 วินาทีกลับมาที่ 362 เฟรม ทุกไฟล์ 10 วินาทีกลับมาที่ 243 สามเจเนอเรชันใหม่ที่ผมรันสำหรับบทความนี้กลับมาที่ 362 เช่นกัน และการซ้อม 4 วินาทีในขั้นตอนที่ 5 กลับมาที่ 107 รันผ่านกริด: 362 คือ 17x21+5, 243 คือ 17x14+5, และ 107 คือ 17x6+5 สูตรทำนายทั้งสามอย่างได้ถูกต้อง ซึ่งเป็นความสอดคล้องที่ทำให้ผมเชื่อถือส่วนที่เหลือของตาราง

ระยะเวลาเฟรมที่ส่ง (17k+5)ความยาวจริงที่ 24 FPSลงตัวพอดีวินาที?แหล่งที่มา
41074.458 sไม่วัดแล้ว
51245.167 sไม่กริด
61586.583 sไม่กริด
71757.292 sไม่กริด
81928.000 sใช่กริด
92269.417 sไม่กริด
1024310.125 sไม่วัดแล้ว
1127711.542 sไม่กริด
1229412.250 sไม่กริด
1332813.667 sไม่กริด
1434514.375 sไม่กริด
1536215.083 sไม่วัดแล้ว

สามสิ่งที่หลุดออกมาจากตารางนั้น

duration: 8 เป็นค่าเดียวในช่วงทั้งหมดที่ให้วินาทีเต็มที่สะอาด และมันเป็นค่าเริ่มต้นโดยบังเอิญ นั่นไม่ใช่เรื่องบังเอิญ มันคือ 17x11+5 = 192 = 8 x 24 พอดี

ขอ 6 คุณจะได้รับ 6.583 วินาที ภาพฟรีมากกว่าครึ่งวินาที ขอ 13 คุณจะได้ 13.667 กริดจะปัดขึ้นเสมอ ไม่เคยปัดลง ดังนั้นคุณจะไม่ขาด

และถ้าคุณตัดต่อเข้ากับเพลงหรือจับคู่การตัดต่อที่แม่นยำต่อเฟรม อย่าคำนวณไทม์ไลน์ของคุณเป็น duration x 24 วัดไฟล์ โปรเจ็กต์ 40 คลิปที่วางแผนบนสมมติฐานของวินาทีเต็มจะคลาดเคลื่อนไปเกือบสี่วินาทีเมื่อถึงตอนจบ

สิบครั้งตัดภายในหนึ่งเจเนอเรชัน MiniMax H3 15 วินาที

นี่คือคลิปที่ผมกล่าวถึงตอนต้น หนึ่งเจเนอเรชัน 362 เฟรม 15.10 วินาทีในคอนเทนเนอร์ มันเป็นชิ้นงานแฟชั่นแบบ kinetic-type และมันทำงานเหมือนมิวสิกวิดีโอที่ตัดต่อแล้วมากกว่าการถ่ายเทคเดียว

ภาพใกล้ชิดดวงตาผู้หญิงหลังข้อความสีขาวตัวหนา ONE LOOK

หนึ่งเจเนอเรชัน MiniMax H3 เดียว การเปลี่ยนเสื้อผ้า การเปลี่ยนเฟรม การแยกหน้าจอ และการ์ดข้อความแบบเต็มเฟรม ทั้งหมดภายในงาน 15 วินาทีเดียว

ผมรันตัวตรวจจับฉากของ ffmpeg บนมันแทนที่จะนับด้วยตา:

text
1ffmpeg -i video-5.mp4 -vf "select='gt(scene,0.6)',showinfo" -f null -
2# 18 breaks flagged, at 1.54 2.88 3.63 4.21 5.54 5.83 6.92 8.88 11.17 13.00 ...
3

สิบครั้งในนั้นคือการเปลี่ยนช็อตที่สะอาดตลอดสิบสามวินาทีแรก ส่วนท้ายเป็นการ์ดชื่อเรื่องที่กระพริบบนพื้นดำ ซึ่งทำให้จำนวนดิบสูงขึ้น ดังนั้นสิบจึงเป็นจำนวนที่อนุรักษ์นิยมและซื่อสัตย์ ไม่ว่าจะเป็นอย่างไรมันไม่ใช่ช็อตเดียว และไม่ใช่สามช็อต

ตอนนี้กรณีควบคุม เพราะ "H3 มักจะสับคลิปของคุณเป็นชิ้นๆ" เป็นความล้มเหลวตรงกันข้ามและผิดพอๆ กัน ไฟล์ถัดไปนี้ก็เป็นหนึ่งเจเนอเรชัน 15 วินาทีเดียวกัน 362 เฟรมเช่นกัน และตัวตรวจจับเดียวกันพบว่ามีศูนย์การตัดในนั้น

มุมมองบุคคลที่หนึ่งของตึกระฟ้าถล่มลงบนถนนในเมือง

เจเนอเรชันเดียวที่แตกต่างกัน เฟรม 362 เท่ากัน ศูนย์การตัดที่ตรวจพบ หนึ่งการเคลื่อนไหวกล้องต่อเนื่องตลอดสิบห้าวินาที

ดังนั้นขีดจำกัดไม่ใช่ "ฟุตเทจ 15 วินาที" มันคือเวลาบนหน้าจอ 15 วินาทีที่คุณสามารถแบ่งย่อยได้ตามต้องการ ตั้งแต่เทคเดียวไม่ขาด ไปจนถึงสิบตัด คุณควบคุมมันจากพรอมต์ และคุณจ่ายเท่ากันไม่ว่าจะแบบไหน

สามเอนด์พอยต์เบื้องหลัง MiniMax H3 Video Length ในหนึ่งแท็บ

การจะผ่าน 15 วินาทีจำเป็นต้องมีสามงานที่แตกต่างกัน: บางอย่างเพื่อสร้างเฟรมยึด, บางอย่างเพื่อเคลื่อนไหวและต่อเนื่อง, และบางอย่างเพื่อขยับกล้องโดยไม่สูญเสียวัตถุ บนAtlas Cloud ทั้งสี่อยู่ในแคตตาล็อกเดียวกันด้วยคีย์เดียวและยอดคงเหลือเดียว ซึ่งสำคัญที่นี่ส่วนใหญ่เพราะห่วงโซ่ในส่วนถัดไปจะส่งไฟล์ระหว่างกันซ้ำแล้วซ้ำเล่า

ขั้นตอนโมเดลงานในบิลด์นี้ช่วงความยาวอัตราที่ระบุ 4 ส.ค. 2026
เฟรมยึดopenai/gpt-image-2/text-to-imageภาพนิ่งหนึ่งภาพที่กำหนดลุคทั้งหมดn/a$0.1745 สำหรับรันของผมที่ high
เปิด ไม่ต้องใช้ภาพนิ่งminimax/h3/text-to-videoจากพรอมต์ตรงไปยังคลิป4 ถึง 15 วินาที, ค่าเริ่มต้น 8$0.14 / วินาที
เจเนอเรชัน 1 และ 2minimax/h3/image-to-videoทำให้เฟรมแรกเคลื่อนไหว แล้วต่อจากเฟรมสุดท้าย4 ถึง 15 วินาที, ค่าเริ่มต้น 8$0.14 / วินาที
เจเนอเรชัน 3minimax/h3/reference-to-videoตำแหน่งกล้องใหม่ วัตถุเดียวกัน4 ถึง 15 วินาที, ค่าเริ่มต้น 8$0.14 / วินาที

เอนด์พอยต์ H3 ทั้งสามไม่มีส่วนลดในตอนนี้ ดังนั้นอัตราคืออัตรา คุณสามารถยืนยันได้ทั้งหมดในแคตตาล็อกโมเดลเต็ม

กับดักพารามิเตอร์สามข้อที่ควรรู้ก่อนเขียน request แรก ทั้งหมดนำมาจากสคีมาสดแทนที่จะเป็นข้อความในเอกสาร:

  1. ratio ทำงานแตกต่างกันในแต่ละเอนด์พอยต์ text-to-video มีหก ratio และค่าเริ่มต้นเป็น 1:1 ซึ่งจะส่งคลิปสี่เหลี่ยมให้คุณอย่างเงียบๆ ถ้าคุณลืมตั้งค่า และมันไม่ยอมรับ adaptive เลย image-to-video มี เฉพาะ adaptive ดังนั้นเฟรมจะตามเฟรมแรกของคุณ reference-to-video เป็นเพียงตัวเดียวที่มีชุดเต็มบวก adaptive
  2. resolution คือ 768P หรือ 2K ค่าเริ่มต้นเป็น 2K ทั้งสองระดับอยู่ภายใต้อัตราต่อวินาทีรายการเดียวในแคตตาล็อก ดังนั้นการลดลงเป็น 768P ไม่ได้ช่วยประหยัดเงิน ใช้ 2K
  3. image-to-video ยังรับ end_image ที่เป็นตัวเลือกได้ คุณสามารถยึดทั้งสองปลายของคลิป ไม่ใช่แค่จุดเริ่มต้น สิ่งนั้นเปลี่ยนเทคนิคการต่อเนื่องด้านล่างให้เป็นสิ่งที่คุณสามารถบังคับทิศทางจากทั้งสองด้าน

วิธีเอาชนะขีดจำกัด MiniMax H3 Video Length ทีละขั้นตอน

นี่คือบิลด์ MIDNIGHT BOWL เต็มรูปแบบ ทุกพรอมต์ด้านล่างคือสิ่งที่ผมส่งจริง คัดลอกตามตัวอักษร เวลาทำงานทั้งหมดคือสามเจเนอเรชัน H3 บวกหนึ่งภาพนิ่ง และทั้งหมดสามารถทำซ้ำได้ในแท็บเบราว์เซอร์

ขั้นตอนที่ 1: ล็อกลุคในเฟรมยึดหนึ่งภาพ

อย่าเริ่มต้นด้วยวิดีโอ เริ่มต้นด้วยภาพนิ่งหนึ่งภาพที่คุณชอบจริงๆ เพราะทุกคลิปในห่วงโซ่จะสืบทอดแสง เสื้อผ้า และป้ายของมัน การทำผิดพลาดที่นี่แพง การทำถูกต้องมีค่าใช้จ่ายแค่ cents

โมเดล: openai/gpt-image-2/text-to-image ตั้งค่า: quality high, ratio 16:9

text
1Film still, 2am at a narrow Tokyo back-alley noodle stall. A 50-year-old chef in a navy apron and white bandana leans over a steaming stockpot behind a scratched wooden counter, sleeves rolled to the elbow, forearms lit hot orange by a single hanging bulb. Rain-slick asphalt reflects red and green signage; paper lanterns and a hand-painted wooden sign reading "MIDNIGHT BOWL" hang above the counter. Steam rolls across the frame from camera right. Shot on a 35mm lens at f/2, shallow depth of field, deep shadows, warm tungsten key against cool blue night, visible fine film grain, no text overlays.
2

อินเทอร์เฟซเครื่องสร้างภาพ AI แสดงพรอมต์ข้อความและภาพที่ได้

สนามเด็กเล่น GPT Image 2 บน Atlas Cloud พร้อมพรอมต์ยึด MIDNIGHT BOWL ที่กรอกแล้วและภาพที่เสร็จแล้วในแผงเอาต์พุต

GPT Image 2 บน Atlas Cloud: คุณภาพตั้งค่าเป็น high, 16:9, เฟรมยึดแสดงผลทางด้านขวา

4

เฟรมยึด MIDNIGHT BOWL: เชฟในผ้ากันเปื้อนสีกรมท่าเอียงอยู่เหนือหม้อน้ำซุปที่กำลังเดือดใต้หลอดไฟดวงเดียวในตรอกซอกซอยที่ฝนตก

เฟรมยึด ทุกสิ่งที่ตามมาสืบทอดหลอดไฟนี้ ผ้ากันเปื้อนนี้ และป้ายนี้

ขั้นตอนที่ 2: ใส่สามช็อตภายในหนึ่งเจเนอเรชัน MiniMax H3 15 วินาที

นี่คือการเคลื่อนไหวที่เปลี่ยนงบประมาณ แทนที่จะขอหนึ่งสิบห้าวินาทีต่อเนื่อง ให้ส่งรายการช็อตพร้อมไทม์โค้ดที่ชัดเจนและคำว่า CUT TO ให้โมเดล มันจะตัดให้คุณ ภายในหนึ่งเจเนอเรชันที่เรียกเก็บเงิน

โมเดล: minimax/h3/image-to-video ตั้งค่า: resolution 2K, duration 15, ratio adaptive (ตัวเลือกเดียวที่นี่ เฟรมตามเฟรมแรกของคุณ), เฟรมแรก = ภาพนิ่งจากขั้นตอนที่ 1

text
1SHOT 1 (0-5s): Locked-off wide of the stall. Steam billows; the chef ladles broth into a black bowl; rain drips off the awning edge. SHOT 2 (5-10s): CUT TO a macro close-up of the ladle breaking the broth surface, golden fat swirling, chopped scallion falling in slow arcs. SHOT 3 (10-15s): CUT TO a medium shot of the chef looking straight into the lens, wiping his hands on the apron, and saying in Japanese with a tired smile: "Ippai, dozo." He sets the bowl down on the counter and the shot holds on his face.
2Audio: heavy rain on the awning, broth simmering, the ladle knocking the pot rim, a distant train, low late-night city hum. One line of clear male Japanese dialogue, natural room tone, no music.
3Keep the same chef, apron, bandana, bulb and signage in all three shots. Hard cuts only, no dissolves, no camera whip transitions. Warm tungsten key, cool blue night, 35mm look, film grain.
4

สามสิ่งที่ทำให้สิ่งนี้ได้ผล ช่วงวินาทีที่ชัดเจน สตริงตัวอักษร CUT TO และอนุประโยคความต่อเนื่องที่ด้านล่างที่ระบุชื่อทุกองค์ประกอบที่ต้องคงอยู่ผ่านการตัด ละเว้นอนุประโยคความต่อเนื่อง แล้วช็อต 3 จะกลับมาพร้อมผ้ากันเปื้อนที่แตกต่างกัน

อินเทอร์เฟซเครื่องสร้างวิดีโอ AI แสดงการตั้งค่าอินพุตและเอาต์พุตวิดีโอที่เสร็จแล้ว

สนามเด็กเล่น MiniMax H3 image-to-video บน Atlas Cloud พร้อมเฟรมยึดที่โหลดแล้ว เลือกระยะเวลา 15 และ 2K คลิปที่เสร็จแล้วกำลังเล่นในแผงเอาต์พุต

MiniMax H3 image-to-video บน Atlas Cloud: เฟรมยึดโหลดเป็นเฟรมแรก ความละเอียด 2K คลิปที่เสร็จแล้วทางด้านขวา สังเกตแถบเลื่อน Duration และราคาที่ติดตาม การรันนี้ปล่อย Duration เป็นค่าเริ่มต้น 8 ซึ่งเป็นสาเหตุที่ปุ่มอ่านว่า $1.12; ที่ 15 อ่านว่า $2.10

เชฟกำลังเตรียมอาหารที่แผงลอยริมถนนที่มีไอน้ำในคืนที่ฝนตก

เจเนอเรชัน 1 หนึ่งงานที่เรียกเก็บเงิน สามช็อต (วัดการตัดที่ 4.92 วินาทีและ 9.13 วินาที) หนึ่งบรรทัดบทสนทนาพร้อมลิปซิงค์ 2560x1440 เนทีฟ และเสียงสเตอริโอ 32 kHz ในไฟล์เดียวกัน

ขั้นตอนที่ 3: ต่อเนื่อง 15 วินาทีถัดไปจากเฟรมสุดท้าย

ไม่มีพารามิเตอร์ extend การต่อเนื่องเป็นแบบ manual และมันง่ายดาย: ดึงเฟรมสุดท้ายของเจเนอเรชัน 1 และป้อนกลับเป็นเฟรมแรกของเจเนอเรชัน 2

bash
1ffmpeg -sseof -0.08 -i generation-1.mp4 -frames:v 1 -q:v 2 handoff-frame-01.jpg
2

โมเดล: minimax/h3/image-to-video อีกครั้ง ตั้งค่า: เฟรมแรก = handoff-frame-01.jpg, resolution 2K, duration 15, ratio adaptive

วินัยที่สำคัญที่นี่คือสิ่งที่คุณละเว้น อย่าอธิบายเชฟอีกครั้ง เขาอยู่ในพิกเซลที่คุณส่งไปแล้ว และการอธิบายเขาซ้ำจะทำให้โมเดลมีสิทธิ์ในการตีความเขาขึ้นมาใหม่

text
1Continue from this exact frame, same man, same apron, same light. SHOT 1 (0-5s): He slides the bowl across the counter with both hands toward camera. SHOT 2 (5-10s): CUT TO over-the-shoulder of a customer's hands lifting wooden chopsticks and splitting them, sleeve cuffs of a wet grey raincoat visible. SHOT 3 (10-15s): CUT TO an extreme macro noodle pull, steam curling up past the lens, broth dripping back into the bowl.
2Audio: continuous rain and simmering carried over from before, ceramic on wood, chopsticks snapping, a slurp, the same distant train. No music, no narration.
3Hard cuts only. Same tungsten key from the hanging bulb, same cool blue night behind, same 35mm shallow depth of field and film grain.
4

เชฟยิ้มสวมผ้าคาดหัวกำลังเสิร์ฟชามอาหารที่มีไอน้ำ

เจเนอเรชัน 2 เริ่มจากเฟรมสุดท้ายของเจเนอเรชัน 1 เชฟคนเดิม ลายผ้าคาดหัวเดิม เสื้อสีกรมท่าเดิม ห้องครัวด้านหลังเดิม สามช็อตอีกครั้ง ตัดที่ 4.92 วินาทีและ 9.04 วินาที

เชฟยิ้มสวมผ้าคาดหัวเสิร์ฟชามดำที่มีไอน้ำ

ลูปสองวินาทีข้ามรอยต่อระหว่างเจเนอเรชันที่หนึ่งและเจเนอเรชันที่สอง

รอยต่อนั้นเอง: วินาทีสุดท้ายของเจเนอเรชัน 1 ต่อวินาทีแรกของเจเนอเรชัน 2 ไม่มีเอฟเฟกต์ทรานซิชัน แค่การตัด

ขั้นตอนที่ 4: ขยับกล้องด้วย Reference-to-Video

การต่อเนื่องด้วยเฟรมสุดท้ายมีข้อจำกัดในตัวเดียว: มันจะเริ่มต่อจากที่กล้องก่อนหน้านี้ยืนอยู่เสมอ เพื่อกระโดดไปยังมุมใหม่จริงๆ โดยที่ยังคงวัตถุเดียวกัน ให้เปลี่ยนเอนด์พอยต์

โมเดล: minimax/h3/reference-to-video ตั้งค่า: refers = เฟรมยึดขั้นตอนที่ 1 บวกเฟรมสุดท้ายของเจเนอเรชัน 2, resolution 2K, duration 15, และตั้งค่า ratio อย่างชัดเจนเป็น 16:9 ที่นี่แทนที่จะปล่อยเป็น adaptive เอนด์พอยต์นี้รับภาพอ้างอิงได้สูงสุดเก้าภาพ วิดีโออ้างอิงสามรายการ และคลิปเสียงสามรายการ โดยวิดีโออ้างอิงจำกัดที่ 15 วินาทีรวม (MarkTechPost, สิงหาคม 2026)

text
1Wide low-angle shot from the middle of the wet street looking back at the same noodle stall, the same chef inside it. SHOT 1 (0-6s): Rain streaks through the frame; two silhouetted customers sit at the counter; the chef works under the single bulb. SHOT 2 (6-11s): CUT TO the hand-painted wooden sign as kinetic white type animates on beside it, letter by letter: "MIDNIGHT BOWL - OPEN TILL 4AM". Type stays razor-sharp and locked to the sign as the camera drifts. SHOT 3 (11-15s): CUT BACK to the wide as the chef looks up, raises one hand in a small wave, and the bulb flickers once.
2Audio: rain, street ambience, a scooter passing, the same faint train, a single low sub hit as the type lands. No dialogue.
3Same chef, same apron and bandana, same signage and lantern colours as the reference images. Hard cuts only, film grain, 35mm, warm tungsten against cool blue.
4

คำสั่ง ratio นั้นไม่ใช่ความหวาดระแวง นี่คือสิ่งที่เกิดขึ้นเมื่อคุณปล่อยดรอปดาวน์ไว้ตามเดิมในเอนด์พอยต์นี้:

อินเทอร์เฟซเครื่องสร้างวิดีโอ AI แสดงข้อความ error การตรวจสอบอินพุต

สนามเด็กเล่น MiniMax H3 reference-to-video บน Atlas Cloud พร้อมภาพอ้างอิงสองภาพที่โหลดแล้ว อัตราส่วนภาพปล่อยเป็น adaptive และ error 400 ในแผงเอาต์พุต

MiniMax H3 reference-to-video บน Atlas Cloud: ภาพอ้างอิงทั้งสองภาพโหลดแล้ว ความละเอียด 2K และ Aspect Ratio ยังคงอยู่ที่ค่าเริ่มต้น adaptive การรันกลับมา 400: "ratio is required for t2va (text-only) and cannot be 'adaptive'; allowed: 16:9/4:3/1:1/3:4/9:16/21:9" ตั้งค่าอย่างชัดเจนแล้ว request เดียวกันจะผ่าน ซึ่งเป็นวิธีที่สร้างคลิปด้านล่างนี้ สังเกตข้อความในหน้าด้านบนยังอ่านว่า "768P/1080P/2K, 5s/10s" ในขณะที่สคีมาบอกว่า 768P หรือ 2K และ 4 ถึง 15 วินาที เชื่อถือสคีมา

ผมไม่สามารถทำให้ดรอปดาวน์ ratio ของ playground เก็บการเปลี่ยนแปลงที่เขียนสคริปต์ไว้ได้ในสามครั้งที่ลอง ดังนั้นเจเนอเรชัน 3 ที่สำเร็จด้านล่างนี้มาจาก API โดยมี ratio: "16:9" ตั้งค่าใน body ของ request การรันที่ล้มเหลวไม่มีค่าใช้จ่าย

เชฟกำลังเตรียมอาหารให้ลูกค้าที่แผงลอยอาหารริมถนนในคืนฝนตก

เจเนอเรชัน 3 ตำแหน่งกล้องใหม่จากฝั่งตรงข้ามถนนที่เปียก เชฟคนเดิม และตัวอักษรสีขาวเคลื่อนไหวบนป้ายยังคงคมชัดขณะที่กล้องเลื่อน ตัดที่ 5.29 วินาทีและ 10.96 วินาที

เปรียบเทียบแบบเคียงข้างกันของแผงลอยอาหารญี่ปุ่นในเวลากลางคืน

เปรียบเทียบเคียงข้างกันของเฟรมยึดเดิมและเฟรมจากเจเนอเรชันที่สาม แสดงเชฟและป้ายเดียวกัน 41 วินาทีและสองครั้งส่งต่อในภายหลัง

ซ้าย: เฟรมยึดขั้นตอนที่ 1 ขวา: เจเนอเรชัน 3 ที่จุด 41 วินาที สองครั้งส่งต่อในภายหลัง เชฟคนเดิม ผ้าคาดหัวเดิม เสื้อสีกรมท่าเดิม ป้ายวาดมือเดิม โคมแดงเดิม

ขั้นตอนที่ 5: วัด MiniMax H3 Video Length จริง แล้วต่อ

สองนิสัยที่จะจบด้วย ประการแรก ให้ซ้อมราคาถูกก่อนที่จะซื้อ 15 วินาที พรอมต์เดียวกัน duration 4 แล้วคุณจะพบว่าโมเดลเข้าใจรายการช็อตของคุณหรือไม่ด้วยราคาประมาณหนึ่งในสี่

เชฟกำลังทำอาหารที่แผงลอยกลางแจ้งที่มีไอน้ำในตรอกที่ฝนตก

การซ้อม 4 วินาทีของรายการช็อตเดียวกัน วัดได้ 107 เฟรม ซึ่งเท่ากับ 4.458 วินาที ตรงกับที่กริดทำนายพอดี เพียงพอที่จะดูว่าโมเดลเข้าใจฉากหรือไม่ก่อนที่จะซื้อเทคเต็ม

ประการที่สอง วัดทุกไฟล์ก่อนตัด เพราะไม่มีไฟล์ใดที่มีความยาวตามที่คุณร้องขอ:

bash
1# จำนวนเฟรมจริงและระยะเวลาคอนเทนเนอร์ ไม่ใช่ duration x 24
2ffmpeg -i generation-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | grep -o 'frame= *[0-9]*' | tail -1
3
4# hard-cut concat ไม่มีทรานซิชัน ไม่มีการเข้ารหัสใหม่
5printf "file 'generation-1.mp4'\nfile 'generation-2.mp4'\nfile 'generation-3.mp4'\n" > list.txt
6ffmpeg -f concat -safe 0 -i list.txt -c copy midnight-bowl-45s.mp4
7

สามไฟล์ที่ 362 เฟรมแต่ละไฟล์ให้ 1086 เฟรม ซึ่งผมวัดได้จาก concat ที่เสร็จแล้ว: 45.25 วินาทีของภาพ ไม่ใช่ 45 เล็กน้อย จนกว่าคุณจะต่อสี่สิบไฟล์

รูปแบบต่างๆ: บทสนทนา แนวตั้ง และการซ้อม 4 วินาที

เมื่อห่วงโซ่ทำงานได้แล้ว เอนด์พอยต์สามตัวเดียวกันก็ครอบคลุมสิ่งที่ผู้คนมักขอ

Shot และ reverse shot บทสนทนา ใส่ทั้งสองฝ่ายของการสนทนาไว้ในเจเนอเรชันเดียวแทนที่จะกระจายสองฝั่ง ลิปซิงค์และชุดเสียงจะต่อเนื่องภายในงานเดียว และเป็นอิสระระหว่างงาน ดังนั้นการสนทนาที่แยกเป็นสองเจเนอเรชันจะได้เสียงห้องสองแบบที่ไม่เกี่ยวข้องกัน เก็บการแลกเปลี่ยนไว้ในคลิปเดียว

หญิงสาวร้องไห้เงยหน้ามองชายคนหนึ่งในบันได

นักแสดงหนุ่มสาวสองคนกำลังโต้เถียงกันกลางทางลงบันไดคอนกรีต แสงจากหน้าต่างส่องผ่านพวกเขา ถ่ายข้ามไหล่

Shot และ reverse shot ใช้ได้ ตราบใดที่ทั้งสองมุมอยู่ในเจเนอเรชันเดียวกัน

แนวตั้ง ใน image-to-video คุณไม่ได้ตั้งค่า ratio คุณตั้งค่าเฟรมแรก สร้างเฟรมยึดสูงแล้ว adaptive จะตามไป หนึ่งในคลิปที่ผมวัดกลับมาที่ 1280x2276 ด้วยจำนวนเฟรม 243 เท่ากับพี่น้อง 16:9 ดังนั้นกริดเฟรมไม่สนใจอัตราส่วนภาพของคุณ

การซ้อม 4 วินาทีเป็นแนวปฏิบัติมาตรฐาน ที่ $0.14 ต่อวินาที สี่วินาทีคือ $0.56 เทียบกับ $2.10 สำหรับเทคเต็ม ในการสร้างเก้าช็อต การซ้อมทุกเจเนอเรชันก่อนตัดสินใจใช้มีค่าใช้จ่ายน้อยกว่างาน 15 วินาทีที่เสียไปหนึ่งงาน

จุดที่ขีดจำกัดกัดกินจริงๆ อะไรก็ตามที่ต้องการการแสดงต่อเนื่องยาวนานกว่า 15 วินาที บทพูดคนเดียว 30 วินาทีต่อเนื่องไม่ใช่ปัญหาการต่อเนื่อง มันคือปัญหาลิปซิงค์ข้ามรอยต่อ และไม่มีวินัยเรื่องพรอมต์ใดจะแก้ไขได้

45 วินาทีของ MiniMax H3 Video Length มีค่าใช้จ่ายเท่าไหร่

ที่ $0.14 ต่อวินาที เจเนอเรชัน 15 วินาทีเต็มคือ $2.10 นั่นคือตัวเลขเดียวที่คุณต้องการ ที่เหลือคือการคูณ คอลัมน์ที่น่าสนใจคือคอลัมน์สุดท้าย

ความยาวเป้าหมายเจเนอเรชันที่ 15 วินาทีต้นทุนเส้นตรงสมจริงที่อัตราเก็บไว้ 1 ใน 3ช็อตที่ส่งต้นทุนต่อช็อต
15 วินาที1$2.10$6.303$0.70
45 วินาที (บิลด์นี้)3$6.30$18.909$0.70
60 วินาที4$8.40$25.2012$0.70
3 นาที12$25.20$75.6036$0.70
10 นาที40$84.00$252.00120$0.70

อ่านคอลัมน์ต่อช็อตแล้วความตื่นตระหนกเกี่ยวกับขีดจำกัดก็หายไปเกือบหมด การวางแผนหนึ่งเจเนอเรชันต่อช็อตทำให้คุณอยู่ที่ $2.10 ต่อช็อต การบรรจุสามช็อตในแต่ละเจเนอเรชันทำให้คุณอยู่ที่ $0.70 โมเดลเดียวกัน ขีดจำกัด 15 วินาทีเดียวกัน หนึ่งในสามของใบแจ้งหนี้

คอลัมน์อัตราการเก็บไว้คือคอลัมน์ที่คนลืม ไม่มีอะไรที่ใช้งานได้กลับมาในครั้งแรกทุกครั้ง และแผนที่สมมติว่ามันจะเกิดขึ้นคือแผนที่หมดงบประมาณในนาทีที่สอง

สำหรับบริบทว่าขีดจำกัดอยู่ที่ไหนเมื่อเทียบกับทุกอย่างอื่นในแคตตาล็อก ทั้งหมดนี้เป็นปัจจุบัน ณ วันที่ 4 สิงหาคม 2026:

โมเดลเจเนอเรชันเดี่ยวสูงสุดโดดเด่นอัตราที่ระบุ
minimax/h34 ถึง 15 วินาที768P หรือ 2K, เสียงสเตอริโอเนทีฟ$0.14 / วินาที
bytedance/seedance-2.04 ถึง 15 วินาที หรือ -1 สำหรับอัตโนมัติ480p ถึง 4K เนทีฟ$0.112 / วินาที
kwaivgi/kling-v3.0-pro3 ถึง 15 วินาทีมีแฟล็ก multi_shot ที่ชัดเจนพร้อมพรอมต์ต่อช็อต$0.095 / วินาที, ลด 15%
alibaba/wan-2.72 ถึง 15 วินาทีพื้นกว้างที่สุด, 720P หรือ 1080P$0.10 / วินาที
google/veo3.14, 6 หรือ 8 วินาทีเท่านั้นไม่มีตัวเลือก 15 วินาทีเลย$0.20 / วินาที
alibaba/wan-2.5/video-extendเพิ่ม 5 ถึง 10 วินาทีขยายไฟล์ที่มีอยู่แทนที่จะสร้างใหม่$0.052 / วินาที

สองข้อสรุป H3 สิบห้าวินาทีอยู่ในระดับสูงสุดของรุ่นปัจจุบัน ไม่ใช่ล้าหลัง และ Veo 3.1 มีขีดสูงสุดที่แปดวินาที และถ้าสิ่งที่คุณต้องการจริงๆ คือไฟล์ยาวหนึ่งไฟล์จากเอนด์พอยต์เดียว มีโมเดล extend โดยเฉพาะอยู่ แต่การเปลี่ยนโมเดลกลางห่วงโซ่หมายถึงการเปลี่ยนใบหน้า

หมายเหตุตรงไปตรงมาหนึ่งข้อเกี่ยวกับเสียง น้ำหนัก และ MiniMax H3 Video Length

สามข้อแม้ ซึ่งไม่มีข้อใดเปลี่ยนขีดจำกัด

เสียงไม่ถูกส่งต่อระหว่างเจเนอเรชัน แต่ละงานประกอบชุดเสียงสเตอริโอของตัวเองตั้งแต่ต้น สามคลิปที่ต่อเนื่องหมายถึงสามชุดเสียงฝนที่ไม่เกี่ยวข้องกัน และคุณจะได้ยินการเปลี่ยนแปลงแม้ว่าภาพจะตรงกันพอดี สองวิธีแก้ไข: เขียนอนุประโยคบรรยากาศเหมือนกันในทุกพรอมต์เพื่อให้ชุดเสียงใกล้เคียงกัน หรือปิดเสียงคลิปที่ต่อแล้ววางแทร็กต่อเนื่องหนึ่งแทร็กไว้ข้างใต้ สำหรับบทสนทนา ให้เก็บการแลกเปลี่ยนไว้ในเจเนอเรชันเดียว

คลื่นเสียงเล็กสีดำหกคลื่นถัดจากคลื่นเสียงสีส้มยาวหนึ่งคลื่น

เศษส่วนคลื่นเสียงสั้นแยกกันหลายส่วนที่มีช่องว่างระหว่างกันทางซ้าย คลื่นเสียงต่อเนื่องเส้นเดียวทางขวา บนพื้นหลังสีซีดสม่ำเสมอ

ซ้าย: สิ่งที่การต่อเนื่องให้คุณจริงๆ ขวา: สิ่งที่คุณต้องสร้างข้างใต้

การโฮสต์เองไม่ได้ปลดล็อกคลิปที่ยาวขึ้น น้ำหนักโอเพนซอร์สถูกปล่อยเมื่อวันที่ 2 สิงหาคม 2026 (Hugging Face, สิงหาคม 2026) และการรันในเครื่องจะให้ขอบสั้น 768 พิกเซลที่ปัดเป็นทวีคูณของ 32 ตามบันทึกการตั้งค่าของ ComfyUI กริด 17 เฟรมและเพดาน 15 วินาทีเหมือนกัน ใบอนุญาตชุมชนยังไม่ครอบคลุม EU, UK, เกาหลี หรือสหรัฐอเมริกาในขณะนี้ ดังนั้น API จึงเป็นเส้นทางที่ใช้งานได้จริงสำหรับทีมส่วนใหญ่

โมเดลสามารถเขียนคุณใหม่ได้อย่างเงียบๆ ผมเคยเจอ H3 ส่งคืน completed ในงานที่มันละทิ้งองค์ประกอบที่ผมขอไปอย่างเงียบๆ ดึงเฟรมจากทุกคลิปและดูมันก่อนต่อ ในห่วงโซ่เก้าช็อต คลิปหนึ่งที่ไม่ได้ดูคือรอยต่อที่เสียไปหนึ่งรอยต่อ

คำถามที่พบบ่อย

MiniMax H3 video length สูงสุดเท่าไหร่?

สิบห้าวินาที พารามิเตอร์ duration เป็น enum ของจำนวนเต็มตั้งแต่ 4 ถึง 15 โดยมีค่าเริ่มต้นเป็น 8 ดังนั้น 16 จะถูกปฏิเสธ และ 7.5 ไม่ใช่ค่าที่ถูกต้อง ทุกคลิปเป็น 24 FPS สูงสุด 2K เนทีฟ พร้อมเสียงสเตอริโอที่สร้างขึ้นพร้อมกับภาพ

MiniMax H3 สามารถสร้างวิดีโอที่ยาวกว่า 15 วินาทีได้หรือไม่?

ไม่ได้ในเจเนอเรชันเดียว และ API ไม่มีพารามิเตอร์ extend คุณผ่าน 15 วินาทีได้โดยการต่อเนื่อง: ดึงเฟรมสุดท้ายของคลิปหนึ่งเป็นเฟรมแรกของคลิปถัดไป ใช้ reference-to-video เมื่อคุณต้องการมุมกล้องใหม่ จากนั้นต่อด้วยการตัดแบบ hard cut ฟร้อนท์เอนด์สำหรับผู้บริโภคบางตัวมีฟีเจอร์ extend ของตัวเองที่ทำงานบน H3 เพื่อให้ถึงประมาณ 30 วินาที แต่นั่นคือผลิตภัณฑ์ที่ทำการต่อ ไม่ใช่โมเดลที่สร้างยาวขึ้น

ทำไมคลิป MiniMax H3 15 วินาทีของฉันถึงเป็น 15.08 วินาที?

เพราะระยะเวลาถูกปัดขึ้นตามกริด 17 เฟรม การขอ 15 วินาทีจะได้ 362 เฟรม ซึ่งคือ 17x21+5 และที่ 24 FPS นั่นคือ 15.083 วินาที การขอ 10 จะได้ 243 เฟรม หรือ 10.125 วินาที มีเพียง duration: 8 เท่านั้นที่ลงตัวพอดีวินาที ที่ 192 เฟรมพอดี ถ้าคุณตัดต่อแบบแม่นยำต่อเฟรม ให้วัดแต่ละไฟล์แทนที่จะคำนวณ duration x 24

ฉันสามารถใส่หลายช็อตในหนึ่งเจเนอเรชัน MiniMax H3 ได้หรือไม่?

ได้ และมันเป็นประหยัดที่ใหญ่ที่สุดที่มี เขียนช็อตที่มีไทม์โค้ดชัดเจนลงในพรอมต์ด้วยคำว่า CUT TO และเพิ่มอนุประโยคความต่อเนื่องที่ระบุว่าอะไรต้องคงอยู่ผ่านการตัด ผมวัดการตัดที่สะอาดสิบครั้งภายในหนึ่งเจเนอเรชัน 15 วินาทีจริง สามช็อตต่อเจเนอเรชันนั้นสบายและเชื่อถือได้ ซึ่งเปลี่ยนคลิป $2.10 เป็นสามช็อต $0.70

MiniMax H3 video length ที่สั้นกว่ามีค่าใช้จ่ายน้อยกว่าหรือไม่?

ใช่ เป็นเส้นตรง การคิดค่าบริการเป็นต่อวินาทีที่ $0.14 ดังนั้นการซ้อม 4 วินาทีมีค่าใช้จ่าย $0.56 เทียบกับ $2.10 สำหรับเทค 15 วินาทีเต็ม ความละเอียดเป็นเรื่องที่แตกต่าง: 768P และ 2K อยู่ภายใต้อัตราที่ระบุเดียวในแคตตาล็อก ดังนั้นการลดความละเอียดไม่ได้ช่วยประหยัดอะไร ทำให้คลิปสั้นลง ไม่ใช่พิกเซล

ฉันต้องใช้คลิป MiniMax H3 กี่คลิปสำหรับวิดีโอหนึ่งนาที?

สี่ ถ้าคุณเติมเต็ม 15 วินาทีในแต่ละครั้ง แต่นับเป็นช็อตแทน: สี่เจเนอเรชันที่สามช็อตต่อเจเนอเรชันให้คุณได้ 12 ช็อตของคัฟเวอเรจ ซึ่งเป็นจำนวนปกติสำหรับโฆษณาหนึ่งนาที จากนั้นคูณงบประมาณของคุณด้วยประมาณสามเพื่อบัญชีสำหรับเทคที่คุณทิ้งไป

โมเดลล่าสุด

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด