บทความทุกบทความเกี่ยวกับโมเดลนี้หยุดอยู่ที่บรรทัดเดียวกัน ภาพเก้าภาพ คลิปวิดีโอสามคลิป คลิปเสียงสามคลิป รวมสิบสองไฟล์ มันอ่านเหมือนบัตรรับประกัน
ผมเลยปฏิบัติกับมันแบบนั้น สร้างตัวละคร สร้างอุปกรณ์ประกอบฉาก สร้างฉากกลางคืน นำฉากกลางคืนนั้นป้อนกลับเป็นวิดีโออ้างอิง ตัดแจ๊สแปดวินาทีเป็นแทร็กเสียงอ้างอิง และส่งข้อมูลอ้างอิงทั้งสามประเภทผ่านคำขอเดียว จากนั้นก็เริ่มแหกกฎโดยเจตนาเพื่อดูว่ากฎไหนที่ API ป้องกันจริง
สี่ข้อไม่ได้ถูกป้องกันอย่างที่คุณคาดหวัง หนึ่งในนั้นยังคงเรียกเก็บเงินคุณเต็มราคาสำหรับวิดีโอที่คุณไม่ได้ขอ และข้อความแสดงข้อผิดพลาดที่คุณหวังว่าจะได้รับก็ไม่เคยมาถึง นั่นคือข้อที่ควรอ่านจนจบ
ประเด็นสำคัญ
- สามประเภทอ้างอิง, อาร์เรย์เดียว มากถึง 9 ภาพ, 3 คลิปวิดีโอ และ 3 คลิปเสียง รวม 12 ไฟล์ ทั้งหมดอยู่ในฟิลด์
refersเดียวกัน และtypeเป็นตัวเลือกเพราะ API อนุมานจากนามสกุลไฟล์ - เสียงไม่สามารถบินเดี่ยวได้ คำขอที่ใช้เฉพาะเสียงจะถูกปฏิเสธพร้อมข้อผิดพลาดที่มีชื่อ เสียงต้องมากับภาพอย่างน้อยหนึ่งภาพหรือวิดีโอหนึ่งคลิป
- การอ้างอิงเป็นวิดีโอและภาพเป็นวิดีโอนั้นแยกจากกัน แต่ไม่มีอะไรบอกคุณ ส่ง
imageเฟรมแรกพร้อมกับrefersงานก็เสร็จสมบูรณ์อยู่ดี หนึ่งในสองอินพุตของคุณจะถูกทิ้งอย่างเงียบ ๆ ในราคาเต็ม ตรวจสอบแล้วสองครั้งเมื่อวันที่ 2026-08-12 ทั้งสองเอนด์พอยต์ - ไม่มีการตรวจสอบใด ๆ เมื่อคุณส่ง ทุกคำขอที่ผิดพลาดในบทความนี้คืนค่า HTTP 200 และ ID คำตัดสินที่แท้จริงจะมาถึงสองถึงสามนาทีต่อมาในขั้นตอนการสร้าง การปฏิเสธที่นั่นฟรี ส่วนการเสร็จสมบูรณ์ไม่ฟรี
- ไฟล์อ้างอิงที่เกินมาไม่เสียค่าใช้จ่าย ภาพอ้างอิงหนึ่งภาพและสิบภาพถูกเรียกเก็บเงินในจำนวนเท่ากันสำหรับความยาวคลิปเดียวกัน ราคาตามวินาทีเอาต์พุต ไม่ใช่จำนวนอินพุต
นี่คือสิ่งที่ออกมาจากปลายทางอีกด้าน สองช็อต หนึ่งใบหน้า สองสถานที่ที่แตกต่างกันโดยสิ้นเชิง และช็อตที่สองถูกสร้างขึ้นจากภาพ ไฟล์วิดีโอ และไฟล์เสียงพร้อมกัน
Shot A (ฝน, กลางคืน, ซอยนีออน) แล้ว Shot B (ตลาดในร่มที่ว่างเปล่าในเช้าวันรุ่งขึ้น) ต่อกันโดยไม่เพิ่มอะไรเลยนอกจากรอยต่อ ผู้หญิงคนเดียวกัน รอยแผลเป็นเดียวกันเหนือคิ้วขวา แจ็กเก็ตสีครามเดียวกัน ผ้าขนหนูผืนเดียวกัน Shot B ถูกสร้างขึ้นจากสามแหล่งอ้างอิงพร้อมกัน: ภาพเหมือนของเธอ, คลิป Shot A เอง, และแจ๊สแปดวินาที ทั้งสองช็อตเป็น minimax/h3/reference-to-video ที่ 2K, 2560x1440, 24fps, พร้อมแทร็กสเตอริโอ 32kHz ดั้งเดิม คุ้มค่าที่จะเปิดเสียงในช่วงครึ่งหลังที่เธอพูดบทของเธอ
ทำไม MiniMax H3 Reference to Video ถึงดีกว่าพรอมต์ใด ๆ ที่คุณเขียนได้
พรอมต์อธิบายบุคคล การอ้างอิง คือ บุคคลนั้น ความแตกต่างนั้นคือเหตุผลทั้งหมดที่เอนด์พอยต์นี้มีอยู่ และเป็นเหตุผลที่ MiniMax H3 ปัจจุบันครองอันดับสูงสุดของกระดานผู้นำการตัดต่อวิดีโอ: Elo 1,125 จาก 10,280 โหวต (Artificial Analysis, สิงหาคม 2026) อย่างไรก็ตาม ควรระวังตัวเลขนั้นให้ชัดเจน: ตารางเดียวกันระบุช่วงอันดับเป็น 1 ถึง 2 โดยเสมอกันทางสถิติกับ Google Gemini Omni Flash ที่ 1,122 อันดับหนึ่ง ภายในช่วงความเชื่อมั่นที่ใช้ร่วมกัน ข้ออ้างที่เกี่ยวข้องว่า H3 ยังอยู่ในสามอันดับแรกสำหรับทั้ง text to video และ image to video นั้นมาจากโพสต์ประกาศของห้องปฏิบัติการเดียวกัน (Artificial Analysis on X, สิงหาคม 2026)
อันดับนั้นถูก ต่อไปนี้คือพฤติกรรมจริง พรอมต์เดียวกัน ระดับการอ้างอิงสามระดับ ทุกอย่างอื่นเหมือนกัน

สามการรัน MiniMax H3 reference to video บนพรอมต์เดียวกัน: ไม่มีการอ้างอิง, ภาพอ้างอิงตัวละครหนึ่งภาพ, และภาพอ้างอิงสองภาพ
พรอมต์เดียวกัน, การตั้งค่า 768P 4s เหมือนกัน, จากซ้ายไปขวา: ไม่มีการอ้างอิงเลย (text to video), ภาพอ้างอิงตัวละครหนึ่งภาพ, ภาพอ้างอิงสองภาพ (ตัวละครบวกชามราเมน) พรอมต์บอกว่า "ผู้หญิงจากภาพอ้างอิง" ในทั้งสาม ในแผงด้านซ้าย วลีนั้นไม่ได้อ้างถึงใครเลย โมเดลจึงสร้างคนแปลกหน้าขึ้นมา สร้างด้วย minimax/h3/text-to-video และ minimax/h3/reference-to-video
การตีความแถบนั้นอย่างตรงไปตรงมาสองแบบ การกระโดดจากแผงที่หนึ่งไปยังแผงที่สองนั้นมหาศาล: หากไม่มีการอ้างอิง "ผู้หญิงจากภาพอ้างอิง" เป็นวลีที่ชี้ไปที่ความว่างเปล่า และโมเดลก็เติมช่องว่างนั้นอย่างเงียบ ๆ ด้วยบุคคลที่ไม่มีความสัมพันธ์ใด ๆ กับโปรเจ็กต์ของคุณ การกระโดดจากแผงที่สองไปยังแผงที่สามนั้นเล็กกว่ามาก เพราะพรอมต์ของผมยัง อธิบาย ชามเป็นคำพูดด้วย และ H3 ก็วาดชามสีกรมท่าที่ดูใช้ได้กับนกกระเรียนจากข้อความเพียงอย่างเดียว นั่นคือส่วนที่มีประโยชน์ ภาพอ้างอิงและวลีคำนามที่ดีแข่งขันกันเพื่องานเดียวกัน ดังนั้นควรใช้ช่องอ้างอิงของคุณกับสิ่งที่ภาษาไม่สามารถระบุได้แน่ชัด: ใบหน้าเฉพาะ, ผลิตภัณฑ์เฉพาะ, โลโก้เฉพาะ
รูปแบบเบื้องหลังความล้มเหลวเกือบทุกครั้งในบทความนี้เหมือนกับแผงที่หนึ่ง ไม่มีอะไรเตือนคุณว่าส่วนหนึ่งของคำขอของคุณไปตกอยู่ที่ความว่างเปล่า
สิ่งที่การอ้างอิงล็อคจริง ๆ และสิ่งที่ไม่ได้ล็อค ภาพอ้างอิงล็อคเอกลักษณ์: โครงสร้างใบหน้า, เส้นผม, จุดเด่น, เสื้อผ้า มันไม่ได้ล็อคแสง และนี่คือสิ่งที่สร้างความประหลาดใจมากที่สุด มันยังลากแสงของภาพถ่ายอ้างอิงไปด้วย ซึ่งเป็นสาเหตุที่แผ่นตัวละครที่ถ่ายในสภาพแวดล้อมที่มีอารมณ์ให้ตัวละครที่ไม่สามารถอยู่รอดในการเปลี่ยนฉากได้ ถ่ายภาพอ้างอิงของคุณให้แบนและเป็นกลาง วิดีโออ้างอิงล็อคการเคลื่อนไหว, โทนสี, และเกรน ไม่ใช่เอกลักษณ์ เสียงอ้างอิงล็อคพื้นเสียงเอง หากคุณต้องการใบหน้าเดียวกันพูดบรรทัดเดียวกันด้วยเสียงเดียวกันในชุดภาพ กองอ้างอิงกำลังทำงานสามอย่างที่แตกต่างกัน และคุณต้องบอกว่าอันไหนเป็นอันไหน คู่มือผู้ปฏิบัติงานมักจะแนะนำให้ตั้งชื่อตามตำแหน่งในพรอมต์ ("ภาพที่ 1 คือตัวละคร, ภาพที่ 2 คือผลิตภัณฑ์") และธรรมเนียมนี้คุ้มค่าที่จะนำมาใช้ พรอมต์ของผมด้านล่างใช้การตั้งชื่อแบบพรรณนาธรรมดาแทน ซึ่งก็ใช้ได้เช่นกันเมื่อการอ้างอิงนั้นชัดเจนทางสายตา
ทำไมการเรียกครั้งแรกมักจะทำให้ผิดหวัง สี่สิ่ง วัดทั้งหมดเมื่อวันที่ 2026-08-12:
- เอนด์พอยต์การส่งไม่ตรวจสอบอะไรเลย MIME ผิด, เสียง 164 วินาที, URL ที่ตายแล้ว, ฟิลด์ที่แยกจากกัน: ทั้งหมดคืนค่า HTTP 200 พร้อม ID การคาดการณ์ คุณจะรู้ทีหลัง
ratioค่าเริ่มต้นเป็นadaptiveซึ่งระบุว่า "ปล่อยให้โมเดลเลือก" ด้วยการอ้างอิง 16:9 ผมได้ 1344x768 ที่ 768P ไม่ว่าจะปล่อยไว้ที่adaptiveหรือบังคับ 16:9 ดังนั้นค่าเริ่มต้นจึงไม่เป็นอันตรายเมื่ออินพุตของคุณสอดคล้องกันอยู่แล้ว มันเป็นเหมือนการเสี่ยงโชคเมื่อไม่สอดคล้องกัน และนี่เป็นเอนด์พอยต์ H3 เพียงแห่งเดียวที่คุณสามารถตัดสินใจแทนมันได้- ภาพเฟรมแรกบวกกับการอ้างอิงไม่ทำให้เกิดข้อผิดพลาด มันทิ้งหนึ่งในนั้นอย่างเงียบ ๆ และเรียกเก็บเงินคุณ
- หากโมเดลไม่มีอะไรเป็นรูปธรรมให้ยึด มันจะเติมช่องว่างอย่างมั่นใจ และใบหน้าที่ผิดอย่างมั่นใจดูเหมือนการรันที่ประสบความสำเร็จทุกประการ
สำหรับด้านการเขียนพรอมต์ คู่มือพรอมต์ MiniMax H3 ลงลึกเกี่ยวกับการใช้ถ้อยคำมากกว่าที่ผมจะทำได้ที่นี่
กฎของ MiniMax H3 Reference to Video: สามประเภท, หนึ่งคำขอ
การอ้างอิงทั้งสามประเภทใช้อาร์เรย์เดียวกัน นี่คือสัญญาตามที่เผยแพร่ ถัดจากสิ่งที่เอนด์พอยต์ทำจริงเมื่อผมทดสอบ
ตารางที่ 1: การอ้างอิงสามประเภท
| ภาพอ้างอิง | วิดีโออ้างอิง | เสียงอ้างอิง | |
|---|---|---|---|
| ไฟล์สูงสุด | 9 | 3 คลิป | 3 คลิป |
| เพดานรวม | 12 ไฟล์จากทั้งสามประเภท | ||
| ระยะเวลาต่อไฟล์ | n/a | 2 ถึง 15 วินาที | 2 ถึง 15 วินาที |
| ระยะเวลาทั้งหมด | n/a | 15 วินาที | 15 วินาที |
| รูปแบบ | png, jpeg, jpg, webp | mp4, mov | mp3, wav |
| ใช้เดี่ยวได้หรือไม่? | ได้ | ได้ | ไม่ได้, ต้องมีภาพหรือวิดีโอ |
| สิ่งที่ล็อค | เอกลักษณ์, เสื้อผ้า, ผลิตภัณฑ์, สไตล์ | การเคลื่อนไหว, กล้อง, สี, เกรน | พื้นเสียงเอง |
| สิ่งที่ไม่ล็อค | แสงของฉากใหม่ | ใครอยู่ในช็อต | แทร็กที่แน่นอน (ดูขั้นตอนที่ 6) |
| ส่งเป็น | URL สาธารณะหรือ base64 data URL | URL สาธารณะหรือ base64 data URL | ต้องประกาศเป็น audio/mp3 ไม่ใช่ audio/mpeg |
| บังคับใช้หรือไม่? | 10 ภาพผ่านไปได้ดี | ยังไม่ทดสอบเกิน 1 คลิป | หน้าต่างต่อคลิปบังคับใช้, 15 วินาที ทั้งหมด ไม่ได้บังคับใช้ |
จำนวนไฟล์และหน้าต่างระยะเวลาเป็นขีดจำกัดที่เผยแพร่โดย MiniMax (Hailuo, สิงหาคม 2026) ตรวจสอบข้ามกับบทความเปิดตัวซึ่งระบุหน้าต่างวิดีโออ้างอิงเดียวกัน 2 ถึง 15 วินาทีต่อคลิปและรวม 15 วินาที (MarkTechPost, สิงหาคม 2026) ทุกอย่างในสามแถวสุดท้ายเป็นของผม วัดเอง
สองสิ่งที่สเปกชีตไม่ได้บอกคุณ อย่างแรก ฟิลด์ type ในแต่ละรายการเป็นตัวเลือกและอนุมานจากนามสกุล URL ซึ่งหมายความว่า base64 data URL หรือลิงก์ที่ไม่มีนามสกุล ต้อง ประกาศประเภทของมัน มิฉะนั้นคำขอจะเดาผิด อย่างที่สอง ตัวอัปโหลดในเบราว์เซอร์จำกัดไว้ที่เก้าไฟล์ (Reference Materials (2/9), MAX:9 ในภาพหน้าจอขั้นตอนที่ 5 ด้านล่าง) ซึ่งต่ำกว่าสิบสองของ MiniMax เอง ผมส่งภาพอ้างอิงสิบภาพผ่าน API อยู่ดี และงานก็เสร็จสมบูรณ์ตามปกติ ดังนั้นเก้าคือขีดจำกัดของ UI ไม่ใช่ขีดจำกัดของโมเดล
ตารางที่ 2: reference to video vs image to video vs text to video
| reference-to-video | image-to-video | text-to-video | |
|---|---|---|---|
| ยอมรับ refers | ได้, จำเป็น, ขั้นต่ำ 1 | ไม่ได้ (ละเว้นอย่างเงียบ ๆ) | ไม่ได้ |
| ยอมรับ image first frame | ไม่ได้ (ละเว้นอย่างเงียบ ๆ) | ได้, จำเป็น | ไม่ได้ |
| ยอมรับ end_image last frame | ไม่ | ได้ | ไม่ได้ |
| ตัวเลือก ratio | ทั้ง 7, รวม 16:9, 9:16, 21:9 | adaptive เท่านั้น | ทั้ง 7 |
| ความละเอียด | 768P หรือ 2K, ค่าเริ่มต้น 2K | เหมือนกัน | เหมือนกัน |
| ระยะเวลา | 4 ถึง 15s จำนวนเต็ม, ค่าเริ่มต้น 8 | เหมือนกัน | เหมือนกัน |
| การผสมอินพุตของเอนด์พอยต์อื่น | งานเสร็จสมบูรณ์, อินพุตถูกทิ้ง, คิดเงินเต็ม | งานเสร็จสมบูรณ์, refers ถูกทิ้ง, คิดเงินเต็ม | n/a |
แถวที่สี่นั่นคือความแตกต่างที่ไม่มีใครกล่าวถึง ใน image to video การแจกแจงอัตราส่วนภาพมีค่าเดียวคือ adaptive เพราะเฟรมแรกเป็นตัวกำหนดรูปร่าง ใน reference to video คุณจะได้รับทั้งเจ็ด ซึ่งทำให้เป็นเอนด์พอยต์ H3 เพียงแห่งเดียวที่คุณสามารถบังคับรูปร่างเฟรมในขณะที่ยังยึดตัวละครไว้ได้ หากคุณกำลังเลือกระดับสำหรับงานนี้ 2K vs 768P สำหรับ MiniMax H3 ครอบคลุมว่าพิกเซลที่เพิ่มขึ้นมาซื้ออะไรได้บ้าง
แถวสุดท้ายคือแถวที่แพง เอกสารประกอบถือว่าทั้งสองเอนด์พอยต์แยกจากกัน และมันก็เป็นเช่นนั้น ในแง่ที่ว่ามีเพียงเส้นทางอินพุตเดียวเท่านั้นที่ได้รับเกียรติ แต่ไม่มีข้อผิดพลาด ผมรันมันทั้งสองทางเมื่อวันที่ 2026-08-12: การเรียก reference-to-video ที่มี image เฟรมแรก เสร็จสมบูรณ์ใน 115 วินาที และคิดเงิน $0.40 และการเรียก image-to-video ที่มี refers เสร็จสมบูรณ์ใน 167 วินาที และคิดเงิน $0.40 ทั้งสองสร้างวิดีโอ ทั้งสองทิ้งสิ่งที่ผมส่งไปครึ่งนึง และไม่มีฟิลด์ใดในการตอบสนองที่บอกว่าครึ่งไหน
ตารางที่ 3: โมเดลที่เวิร์กโฟลว์นี้ใช้
ทุกอย่างด้านล่างทำงานในแท็บเบราว์เซอร์เดียวบน Atlas Cloud ซึ่งเป็นที่มาของราคาและภาพหน้าจอ อัตราที่ตรวจสอบเมื่อ 2026-08-12
| ขั้นตอน | โมเดล | อัตรา | รันที่นี่ | ต้นทุน |
|---|---|---|---|---|
| ตัวละคร + อุปกรณ์ประกอบฉากอ้างอิง | openai/gpt-image-2/text-to-image | ระบุตั้งแต่ $0.009; คุณภาพสูงที่ 2048x1152 วัดได้ที่ $0.1745 | 2 | $0.35 |
| เสียงอ้างอิง | minimax/music-2.6 | $0.15 ต่อแทร็ก | 1 | $0.15 |
| Shot A และ Shot B | minimax/h3/reference-to-video | $0.10/s ที่ 768P, $0.14/s ที่ 2K | 2 x 8s ที่ 2K | $2.24 |
| บันไดอ้างอิง | เหมือนกัน, บวก minimax/h3/text-to-video | $0.10/s ที่ 768P | 3 x 4s ที่ 768P | $1.20 |
ไม่มีส่วนลดใด ๆ ที่ใช้งานอยู่ในเอนด์พอยต์ H3 ทั้งสามในเดือนนี้ สองตัวใกล้เคียงถูกกว่าในตอนนี้ถ้าคุณกำลังสร้างภาพนิ่งอ้างอิงเท่านั้น: gpt-image-2-developer/text-to-image ลด 50% จาก $0.009 เหลือ $0.004 ณ เดือนสิงหาคม 2026 รายละเอียดต่อวินาทีเต็มอยู่ในคู่มือ MiniMax H3 API pricing
MiniMax H3 Reference to Video ทีละขั้นตอน
ฉาก: ผู้หญิงคนหนึ่งกำลังขายร้านราเมน Shot A คือซอยนีออนฝนตกตอนกลางคืน Shot B คือผู้หญิงคนเดียวกันในเช้าวันรุ่งขึ้นในตลาดในร่มที่ว่างเปล่า สถานที่ที่แตกต่าง เวลาที่แตกต่าง และเลนส์ที่แตกต่าง ไม่มีอะไรส่งต่อระหว่างสองการเรียกยกเว้นการอ้างอิง ซึ่งเป็นจุดประสงค์ของการทดสอบ
ขั้นตอนที่ 1: สร้างการอ้างอิงตัวละคร ถ่ายแสงแบนโดยเจตนา
นี่คือขั้นตอนที่คนมักทำผิด การอ้างอิงตัวละครไม่ใช่รูปถ่ายสวย ๆ ของตัวละครของคุณ มันคือ การวัด ใบหน้าของพวกเขา แสงที่เป็นกลาง, พื้นหลังธรรมดา, ไม่มีฉาก, ไม่มีอารมณ์ H3 เรียนรู้แสงไปพร้อมกับใบหน้า ดังนั้นการอ้างอิงที่มีบรรยากาศจะสร้างตัวละครที่เชื่อมโยงกับบรรยากาศนั้น
โมเดล: openai/gpt-image-2/text-to-image การตั้งค่า: quality high, size 2048x1152 (16:9), format png.
text1Editorial photograph of a woman in her early thirties, a street-food chef. Close three-quarter portrait, neutral expression, direct eye contact with camera. Short black hair tucked behind one ear, a small scar above the right eyebrow, warm olive skin. She wears a faded indigo work jacket with the sleeves rolled to the elbow and a folded white towel over the left shoulder. Plain light grey studio background, soft even key light, no props, sharp focus on the face, natural skin texture, no retouching. Photorealistic, 50mm lens. 2

GPT Image 2 playground บน Atlas Cloud พร้อมพรอมต์อ้างอิงตัวละครที่โหลดและภาพเหมือนที่เสร็จแล้วในแผงเอาต์พุต
GPT Image 2 บน Atlas Cloud: คุณภาพตั้งเป็น high, 16:9, แผ่นตัวละครแสดงผลทางด้านขวา

ภาพอ้างอิงตัวละครสำหรับ MiniMax H3 reference to video: ภาพเหมือนในสตูดิโอที่เป็นกลางของเชฟราเมนที่มีรอยแผลเป็นเหนือคิ้วขวา
ภาพอ้างอิงที่ 1 รอยแผลเป็นเหนือคิ้วขวาและผ้าขนหนูสีขาวพับเป็นจุดยึดเอกลักษณ์ที่ราคาถูกและไม่คลุมเครือซึ่งคุณสามารถตรวจสอบได้ในทุกเฟรมต่อมา
ขั้นตอนที่ 2: สร้างการอ้างอิงอุปกรณ์ประกอบฉาก
ช่องอ้างอิงที่สอง, งานที่สอง วัตถุมีพฤติกรรมดีกว่าใบหน้าในที่นี้ ซึ่งทำให้อุปกรณ์ประกอบฉากที่โดดเด่นเป็นวิธีที่ง่ายที่สุดในการพิสูจน์ว่าการอ้างอิงไปถึง โมเดลเดียวกัน, การตั้งค่าเดียวกัน
text1Product photograph of a single dark navy ceramic ramen bowl with a hand-painted white crane on the side, chipped at the rim, filled with steaming shoyu ramen. Straight-on view, plain light grey background, soft even light, sharp focus, photorealistic, 50mm lens. 2

ภาพอ้างอิงอุปกรณ์ประกอบฉาก: ชามราเมนเซรามิกสีกรมท่าเข้มมีนกกระเรียนทาสีขาวและขอบบิ่น
ภาพอ้างอิงที่ 2 นกกระเรียนทาสีมือและรอยบิ่นที่ขอบคือสิ่งที่บ่งบอก ถ้ามันรอดมาในวิดีโอ แสดงว่าการอ้างอิงถูกอ่านแล้ว
ขั้นตอนที่ 3: Shot A, สองภาพสู่ MiniMax H3 reference to video
ภาพอ้างอิงสองภาพ, ทั้งคู่ type: "image", ใส่ใน refers ตั้งค่า ratio อย่างชัดเจน adaptive เป็นค่าเริ่มต้นและโดยปกติจะทำสิ่งที่ถูกต้องเมื่อการอ้างอิงของคุณเป็น 16:9 อยู่แล้ว แต่มันตัดสินใจแทนคุณ และในเอนด์พอยต์นี้คุณไม่จำเป็นต้องปล่อยให้มันทำ
โมเดล: minimax/h3/reference-to-video การตั้งค่า: resolution 2K, duration 8, ratio 16:9.
text1Wide establishing shot. Heavy rain at night in a narrow neon-lit alley. The woman from the reference image works alone behind a small steaming ramen stall under a plastic awning, ladling broth into the navy bowl with the white crane from the reference image. Steam rises through pink and green neon reflections on the wet pavement. Slow push-in on the stall. Ambient sound: rain on plastic, boiling broth, distant traffic. No dialogue. 2
เอาต์พุตของการเรียกนี้คือครึ่งแรกของคลิปตัวอย่างที่อยู่ด้านบน เก็บ URL ของมันไว้ มันคืออินพุตสำหรับขั้นตอนที่ 5
ขั้นตอนที่ 4: ตัดเสียงอ้างอิงแปดวินาที
เสียงอ้างอิงไม่ใช่ช่องซาวด์แทร็ก มันคือพื้นเสียงที่โมเดลจับคู่มิกซ์ของตัวเอง และมันเป็นอินพุตที่จุกจิกที่สุดบนเอนด์พอยต์ สร้างแทร็ก แล้วตัดมันลง เพราะเพลงเต็มจะถูกปฏิเสธ
โมเดล: minimax/music-2.6, พร้อม is_instrumental: true และ format: "mp3".
text1Sparse late-night jazz, brushed snare, upright bass, one muted trumpet, melancholic, 70 BPM, instrumental. 2
จากนั้นตัดประมาณแปดวินาทีแล้วเข้ารหัสเป็น URL data:audio/mp3 สามสิ่งที่ผมทำผิดที่นี่เป็นอย่างแรก ทั้งหมดมีข้อความแสดงข้อผิดพลาดที่แน่นอนดังนี้:
- สตริง MIME มีความสำคัญมากกว่าไบต์ ประกาศเป็น
data:audio/mpegแล้วการอ้างอิงจะถูกปฏิเสธด้วยaudio format ".mpeg" not allowedถึงแม้ว่าไฟล์จะเป็น MP3 ธรรมดา ๆ ก็ตาม เขียนเป็นaudio/mp3 - 2 ถึง 15 วินาทีต่อคลิป และมันถูกบังคับใช้ แทร็กที่สร้างของผมยาว 164 วินาที มันคืนค่ามาว่า
invalid param: audio duration 164258 ms, expected [2000, 15000] msการตัดเหลือ 8.05 วินาทีแก้ไขได้ การปฏิเสธทั้งสองครั้งไม่เสียค่าใช้จ่าย - เพดานรวม 15 วินาทีมีเอกสารแต่ไม่ได้บังคับใช้ ผมส่งสองคลิปยาว 8 วินาทีในคำขอเดียวกัน รวม 16.1 วินาที คาดว่าจะถูกปฏิเสธ งานเสร็จสมบูรณ์และคิดเงินตามปกติ อย่าวางแผนบนพื้นฐานนั้น: มันถูกเผยแพร่เป็นขีดจำกัดและอาจเริ่มทำงานเป็นขีดจำกัดได้ทุกเมื่อ

MiniMax Music 2.6 playground บน Atlas Cloud พร้อมพรอมต์แจ๊สและแทร็กที่เสร็จแล้วในแผงเอาต์พุต
MiniMax Music 2.6 บน Atlas Cloud, $0.15 ต่อการรัน, แทร็กที่เสร็จแล้วทางด้านขวา สิ่งหนึ่งที่ควรคัดลอกจากภาพหน้าจอนี้และสิ่งหนึ่งที่ไม่ควร: ราคาและรูปแบบ mp3 ถูกต้อง แต่ Is Instrumental ยังปิดอยู่ และเนื้อเพลงตัวอย่างของหน้ายังคงอยู่ในช่อง ดังนั้นการรันนี้จึงกลับมาเป็นเพลงยาว 1:35 พร้อมเสียงร้อง เปิดสวิตช์นั้นและล้างฟิลด์ Lyrics ก่อนที่คุณจะรัน มิฉะนั้นคุณจะต้องตัดพื้นเสียงอ้างอิงที่มีคนร้องทับ การเรียก API ของผม พร้อม isinstrumental: true คืนค่าเพลงบรรเลงยาว 2:44 ใน 209 วินาที
ขั้นตอนที่ 5: Shot B, หนึ่งคำขอ MiniMax H3 reference to video พร้อมทั้งสามประเภท
นี่คือการเรียกที่คำหลักเกี่ยวข้องจริง ๆ การอ้างอิงสามประเภท สามงานที่แตกต่างกัน หนึ่งอาร์เรย์:
- ภาพเหมือนตัวละครจากขั้นตอนที่ 1,
type: "image", เพื่อยึดใบหน้าของเธอ - mp4 ของ Shot A จากขั้นตอนที่ 3,
type: "video", เพื่อนำโทนสีและเกรนข้ามการตัด - แจ๊สแปดวินาทีจากขั้นตอนที่ 4,
type: "audio", เป็นพื้นเสียง
URL เอาต์พุตจากรุ่นอื่น ๆ บนแพลตฟอร์มสามารถวางลงใน refers โดยตรงเป็นวิดีโออ้างอิง ซึ่งเป็นกลไกที่แท้จริงเบื้องหลังความต่อเนื่องแบบหลายช็อต ไม่ใช่ "H3 จำตัวละครของคุณได้" แต่คุณส่งช็อตก่อนหน้ากลับไปให้มัน
โมเดล: minimax/h3/reference-to-video การตั้งค่า: resolution 2K, duration 8, ratio 16:9.
text1The same woman from the reference image, the next morning. Bright empty covered market, cold clean daylight through a skylight, shutters still down behind her. Medium close-up, static camera. She wipes the counter with the folded white towel, looks up at the camera and says one line, then goes back to work. Keep her face, hair, scar and indigo jacket identical to the reference. Carry the grade and grain of the reference clip. Use the reference audio as the underscore. 2

MiniMax H3 reference to video playground บน Atlas Cloud พร้อมภาพและเสียงอ้างอิงที่โหลดและคลิปที่สร้างขึ้นในแผงเอาต์พุต
การเรียกเดียวกันใน MiniMax H3 Reference-to-Video playground ที่ 2K และ 8 วินาที ช่องอ้างอิงสองช่องประเภทต่าง ๆ มองเห็นได้ใน Reference Materials (2/9): ช่องที่ 1 คือ ref-audio-8s.mp3, ช่องที่ 2 คือภาพเหมือนของเธอ วิดีโออ้างอิงใส่ผ่าน "Add via link" (มุมขวาบนของแผงนั้น) หรือผ่าน API เพราะมันอยู่ที่ URL ไม่ใช่บนดิสก์ สามสิ่งที่ควรอ่านจากแผงนี้: ตัวอัปโหลดบอกว่า MAX:9 แม้ว่าเพดานของ MiniMax เองคือ 12, Aspect Ratio ตั้งอยู่ที่ adaptive เว้นแต่คุณจะเปลี่ยนมัน, และราคารันสำหรับ 2K ที่ 8 วินาทีคือ $1.12 ซึ่งเป็นระดับ $0.14 ต่อวินาที
ขั้นตอนที่ 6: ตรวจสอบว่าการอ้างอิงไปถึงจริงหรือไม่
งานที่เสร็จสมบูรณ์ไม่ใช่งานที่ประสบความสำเร็จ สองการตรวจสอบ ทั้งคู่ถูก
ตรวจสอบใบหน้า ดึงเฟรมจากแต่ละช็อตแล้ววางไว้เคียงข้างกัน คุณกำลังมองหาจุดยึดที่คุณวางไว้: รอยแผลเป็น, เส้นผม, แจ็กเก็ต, ผ้าขนหนู

เฟรมจาก Shot A ถัดจากเฟรมจาก Shot B แสดงตัวละคร MiniMax H3 reference to video เดียวกันในสองฉากที่แตกต่างกัน
ซ้าย: Shot A, กลางคืน, นีออน, กว้าง ขวา: Shot B, ตลาดในร่ม, เช้าวันรุ่งขึ้น, กลางช็อต ใบหน้าเดียวกัน, รอยแผลเป็นเดียวกันเหนือคิ้วขวา, แจ็กเก็ตและผ้าขนหนูเดียวกัน ข้ามฉากและการเปลี่ยนเฟรมโดยไม่มีอะไรที่ใช้ร่วมกันนอกจากข้อมูลอ้างอิง
สิ่งหนึ่งที่ไม่ได้เป็นไปตามที่ผมเขียนในพรอมต์ ผมขอ "ตลาดในร่มที่สว่างสดใส, กลางวันเย็นสะอาด" และ "นำโทนสีและเกรนของคลิปอ้างอิงมาใช้" และคลิปอ้างอิงชนะ Shot B เป็นเวลาเช้าอย่างไม่ต้องสงสัยและเป็นสถานที่ที่แตกต่างอย่างไม่ต้องสงสัย แต่มันมีอารมณ์มากกว่า "สว่าง" มาก เพราะโทนสีกลางคืนส่งผ่านมาพร้อมกับวิดีโออ้างอิง คุณไม่สามารถขอให้การเรียกครั้งเดียวมีลุคเดียวกันและแสงตรงกันข้ามได้ หากคุณต้องการให้แสงเปลี่ยน ละคำสั่งเกี่ยวกับโทนสี หรือละวิดีโออ้างอิงแล้วยึดเอกลักษณ์ด้วยภาพเพียงอย่างเดียว
ตรวจสอบเสียง พล็อตรูปคลื่นของแปดวินาทีที่คุณอัปโหลดถัดจากแทร็กที่กลับมาภายใน mp4 และเพิ่มตัวควบคุม: คลิปที่สร้างขึ้นโดยไม่มีเสียงอ้างอิงเลย

รูปคลื่นของเสียงอ้างอิงแปดวินาทีที่อัปโหลด, แทร็กเสียงที่ส่งคืนภายในคลิปที่สร้างขึ้น, และตัวควบคุมที่ไม่มีเสียงอ้างอิง
บน: แจ๊ส 8.05 วินาทีที่ส่งเป็นข้อมูลอ้างอิง กลาง: แทร็กที่สกัดจาก mp4 Shot B ที่ส่งคืน, ครอบงำโดยบทสนทนาประมาณ 5.5 วินาที ล่าง: Shot A, เวิร์กโฟลว์เดียวกัน, ไม่มีเสียงอ้างอิง
นี่คือจุดที่ผมต้องแก้ไขสิ่งที่ผมเชื่อก่อนเริ่ม เสียงอ้างอิง ไม่ได้ กลับมาเหมือนเดิมทุกประการ ความสัมพันธ์ของรูปคลื่นระหว่างชิ้นส่วนของผมและแทร็กที่ส่งคืนคือ 0.25 เทียบกับ −0.05 สำหรับตัวควบคุมที่ไม่มีเสียงอ้างอิง ดังนั้นทั้งสองมีความเกี่ยวข้องกันแต่อยู่ห่างไกลจากความเหมือนกัน และรูปร่างที่ส่งคืนนั้นเป็นมิกซ์ของมันเองอย่างชัดเจน ไม่ใช่ไฟล์ของผมที่มีอะไรมาวางทับ สิ่งที่เสียงอ้างอิงทำอย่างชัดเจนคือการวางบางอย่างไว้ข้างใต้: พื้นเสียงของ Shot B ร้อนแรงกว่าตัวควบคุมที่ไม่มีเสียงประมาณ 7 dB ในช่วงห้าวินาทีแรก ก่อนที่บทสนทนาจะเริ่มใด ๆ อ่านว่าเสียงอ้างอิงเป็นตัวชี้นำในการมิกซ์ ไม่ใช่ช่องเพลง หากคุณต้องการแทร็กที่แน่นอนของคุณใต้ภาพ ให้วางมันทีหลัง
หากคุณกำลังสร้างต่อจากด้านเสียงของสิ่งนี้ MiniMax H3 lip sync and audio และ MiniMax H3 music video ทั้งคู่เริ่มต้นจากพฤติกรรมเสียงอ้างอิงนี้ สำหรับโค้ดการโพลและลองใหม่เกี่ยวกับทั้งหมดนี้ MiniMax H3 tutorial มีลูป
การตั้งค่า MiniMax H3 Reference to Video อีกสี่แบบที่ควรขโมย
ปรับสไตล์คลิปที่คุณมีอยู่แล้ว ใส่คลิปที่เสร็จแล้วใน refers เป็นวิดีโออ้างอิง ไม่มีภาพเลย และขอสื่อที่แตกต่าง การเคลื่อนไหว, การจัดเฟรม, การค่อย ๆ ขยับเข้า, และอุปกรณ์ประกอบฉากจะอยู่รอด; พื้นผิวเปลี่ยนไป นี่คือกลไกเบื้องหลังอันดับการตัดต่อวิดีโอของ H3 และเป็นกลไกเดียวกันกับที่อยู่เบื้องหลังงานอนิเมะใน MiniMax H3 vs Veo 3.1 for anime

อนิเมะรีสไตล์ที่สร้างจากคลิป Shot A ที่ใช้เป็นข้อมูลอ้างอิง MiniMax H3 reference to video
ซอย Shot A ที่ส่งกลับเป็นข้อมูลอ้างอิงเพียงอย่างเดียว พร้อมพรอมต์อนิเมะแบบเซลเฉด ร้านเดียวกัน, ทัพพีเดียวกัน, ชามนกกระเรียนเดียวกัน, การค่อย ๆ ขยับเข้าเดียวกัน, วาดใหม่ รายละเอียดหนึ่งที่ควรรู้: การแปลงจะอ่อนที่สุดในเฟรมแรกและแข็งแกร่งที่สุดเมื่อกล้องมุ่งมั่นที่จะเคลื่อนไหว แสดงเป็น GIF เงียบ สร้างด้วย minimax/h3/reference-to-video ที่ 768P, 4s, $0.40
ทำให้ภาพถ่ายมีชีวิตชีวา ภาพเหมือนหนึ่งภาพบวกกับคลิปเสียงหนึ่งคลิปภายในหน้าต่าง 2 ถึง 15 วินาที พรอมต์การแสดง ถูกกว่าท่อส่งลิปซิงค์เพราะเป็นการเรียกครั้งเดียว
ล็อคผลิตภัณฑ์ในฉากใด ๆ ภาพอ้างอิงยึดวัตถุได้แข็งกว่าหน้า ดังนั้นภาพผลิตภัณฑ์จริงบวกกับพรอมต์ฉากจึงเป็นสิ่งที่เชื่อถือได้มากที่สุดในเอนด์พอยต์นี้ ตรวจสอบ สิ่งที่คุณสามารถทำได้กับผลลัพธ์ ก่อนที่จะนำไปใช้ในโฆษณา
สร้างซีรีส์ ไม่ใช่แค่คลิป เชื่อมต่อมัน: เอาต์พุตของช็อต N กลายเป็นวิดีโออ้างอิงของช็อต N+1 แต่ละการเรียกยังคงจำกัดที่ 15 วินาที ดังนั้นความต่อเนื่องคืองานของคุณ ไม่ใช่ของโมเดล How long a MiniMax H3 video can be ครอบคลุมว่าเพดานนั้นส่งผลกระทบตรงไหน
กำลังเปรียบเทียบเอนจินก่อนที่จะมุ่งมั่นกับซีรีส์กับเอนจินเดียว? Seedance 2.5 vs MiniMax H3 และ MiniMax H3 alternatives เป็นสองสิ่งที่ควรอ่าน
ฉากสองช็อต MiniMax H3 Reference to Video มีค่าใช้จ่ายเท่าไรจริง
ทุกบรรทัดด้านล่างเป็นงานจริงจากวันที่ 2026-08-12 โดยมีจำนวนเงินที่นำมาจากฟิลด์ price ที่ API ส่งคืนในการทำนายที่เสร็จสมบูรณ์แต่ละครั้ง
ตารางที่ 4: บิลจริง
| งาน | โมเดล | การตั้งค่า | ผลลัพธ์ | คิดเงิน |
|---|---|---|---|---|
| ตัวละครอ้างอิง | gpt-image-2 | high, 2048x1152 | เสร็จสมบูรณ์ | $0.1745 |
| อุปกรณ์ประกอบฉากอ้างอิง | gpt-image-2 | high, 2048x1152 | เสร็จสมบูรณ์ | $0.1745 |
| เสียงอ้างอิง | music-2.6 | instrumental, mp3 | เสร็จสมบูรณ์, แทร็ก 164s, รอ 209s | $0.15 |
| Shot A | h3/reference-to-video | 2K, 8s, 2 image refs | เสร็จสมบูรณ์ใน 309s | $1.12 |
| Shot B | h3/reference-to-video | 2K, 8s, image + video + audio refs | เสร็จสมบูรณ์ใน 557s | $1.12 |
| บันได, ไม่มีการอ้างอิง | h3/text-to-video | 768P, 4s | เสร็จสมบูรณ์ใน 154s | $0.40 |
| บันได, 1 image ref | h3/reference-to-video | 768P, 4s | เสร็จสมบูรณ์ใน 119s | $0.40 |
| บันได, 2 image refs | h3/reference-to-video | 768P, 4s | เสร็จสมบูรณ์ใน 128s | $0.40 |
| อนิเมะรีสไตล์ | h3/reference-to-video | 768P, 4s, 1 video ref | เสร็จสมบูรณ์ใน 239s | $0.40 |
| รันซ้ำขั้นตอนที่ 5 ใน playground | h3/reference-to-video | 2K, 8s, image + audio refs | เสร็จสมบูรณ์ | $1.12 |
| ควบคุม: 10 image refs | h3/reference-to-video | 768P, 4s | เสร็จสมบูรณ์ใน 150s | $0.40 |
| ควบคุม: first-frame image + refers | h3/reference-to-video | 768P, 4s | เสร็จสมบูรณ์, อินพุตหนึ่งถูกทิ้ง | $0.40 |
| ควบคุม: refers on image-to-video | h3/image-to-video | 768P, 4s | เสร็จสมบูรณ์, refers ถูกทิ้ง | $0.40 |
| ควบคุม: 16.1s of reference audio | h3/reference-to-video | 768P, 4s | เสร็จสมบูรณ์เกินขีดจำกัดที่ระบุไว้ | $0.40 |
| ควบคุม: ratio omitted, then ratio adaptive | h3/reference-to-video | 768P, 4s, twice | ทั้งคู่เสร็จสมบูรณ์, เหมือนกัน 1344x768 | $0.80 |
| รันซ้ำภาพหน้าจอของขั้นตอนที่ 1 และ 4 | gpt-image-2, music-2.6 | เหมือนข้างบน | เสร็จสมบูรณ์ | $0.32 |
| ควบคุม: audio reference alone | h3/reference-to-video | 768P, 4s | ล้มเหลวใน 7ms | $0.00 |
| ควบคุม: 164s reference audio | h3/reference-to-video | 768P, 4s | ล้มเหลวใน 16s | $0.00 |
| ควบคุม: audio/mpeg MIME | h3/reference-to-video | 768P, 4s | ล้มเหลวใน 17s | $0.00 |
| ควบคุม: dead reference URL | h3/reference-to-video | 768P, 4s | ล้มเหลวใน 21s | $0.00 |
| รวม | $8.18 |
แบ่งยอดรวมนั้นอย่างซื่อสัตย์ ฉากสองช็อตที่เสร็จแล้วที่ด้านบนของบทความนี้ รวมถึงข้อมูลอ้างอิงและเสียง คือ $2.74 ของมัน อีก $5.44 คือการสอบสวน: ตัวควบคุม, การทำลายโดยเจตนา, และการรันขั้นตอนซ้ำในเบราว์เซอร์สำหรับภาพหน้าจอ หากคุณรู้กฎอยู่แล้ว ลำดับสองช็อต 16 วินาทีที่ 2K มีค่าใช้จ่ายน้อยกว่าแซนด์วิช
สามสิ่งที่หลุดออกจากตารางนั้น
ข้อมูลอ้างอิงฟรี ตัวควบคุมสิบภาพมีค่าใช้จ่าย $0.40 เท่ากับการรันบันไดหนึ่งภาพที่ความยาวและความละเอียดเดียวกัน บนแพลตฟอร์มนี้ มิเตอร์ทำงานบนวินาทีเอาต์พุตและความละเอียดเท่านั้น ควรชี้ให้เห็นข้อขัดแย้งหนึ่งข้อ: กฎของแพลตฟอร์ม MiniMax เองอธิบายว่าวิดีโออินพุตถูกคิดเงินในอัตราเอาต์พุต และสคีมารวมบน OpenRouter มีรายการ reference_images แยกต่างหาก ไม่มีรายการใดปรากฏในใบแจ้งหนี้ของผมที่นี่ หากคุณกำลังจัดงบประมาณที่อื่น ให้กำหนดราคาด้วยตัวเองแทนที่จะสันนิษฐาน
ความล้มเหลวฟรี และมันมาช้า การปฏิเสธทั้งสี่ครั้งไม่มีค่าใช้จ่าย ซึ่งเป็นข่าวดี ข่าวร้ายคือเมื่อมันมาถึง: 7 มิลลิวินาทีสำหรับกฎเสียงเดี่ยว, 16 ถึง 21 วินาทีสำหรับความยาวเสียง, MIME ผิด และ URL ที่ตายแล้ว และไม่มีอะไรเลยในเวลาส่ง คำขอที่ไม่ถูกต้องทุกคำขอในบทความนี้ได้รับ HTTP 200 และ ID การคาดการณ์ก่อน ดังนั้นให้ถือว่าการตอบสนองการส่งเป็นใบเสร็จ ไม่ใช่การตรวจสอบ และโพลฟิลด์ status ก่อนที่คุณจะเชื่ออะไร
ความสำเร็จเงียบคือความล้มเหลวที่มีราคาแพง ตัวควบคุมการผสมทั้งสองมีค่าใช้จ่าย $0.40 เต็มและส่งคืนวิดีโอที่ใช้ได้อย่างสมบูรณ์ซึ่งสร้างจากอินพุตครึ่งหนึ่งของผม ไม่มีข้อผิดพลาด, ไม่มีฟิลด์เตือน, และไม่มีวิธีบอกจากการตอบสนองว่ามีอะไรถูกทิ้งไป นั่นเป็นบรรทัดเดียวในตารางที่เงินออกจากบัญชีและผมไม่ได้สิ่งที่ต้องการ
การแก้ไขอย่างตรงไปตรงมาหนึ่งข้อในประเด็นสุดท้าย เพราะมันเปลี่ยนไปในขณะที่ผมกำลังเขียน ในช่วงต้นเดือนสิงหาคม URL อ้างอิงที่ 404'd มีพฤติกรรมแบบเดียวกัน: งานเสร็จสมบูรณ์, การอ้างอิงถูกเพิกเฉยอย่างเงียบ ๆ, และคิดเงินเต็มจำนวน การรันซ้ำในวันที่ 2026-08-12 ตอนนี้เอนด์พอยต์ตรวจสอบการเข้าถึงได้และทำให้งานล้มเหลวฟรีพร้อมข้อผิดพลาดที่มีชื่อ content[1].image_url: media not found (HTTP 404) รูเฉพาะนั้นถูกปิดแล้ว รูอินพุตที่แยกจากกันยังไม่ถูกปิด สำหรับคณิตศาสตร์เครดิตต่อคลิป MiniMax H3 credits per video มีตาราง
หน้าใคร เสียงใคร: ตรวจสอบสิ่งนี้ก่อนที่คุณจะอัปโหลดข้อมูลอ้างอิง
เอนด์พอยต์นี้แตกต่างจาก text to video ในประเด็นที่เกี่ยวข้องทางกฎหมายหนึ่งประเด็น: คุณเป็นผู้จัดหาความคล้ายคลึง ภาพอ้างอิงของบุคคลจริง, คลิปอ้างอิงจากภาพยนตร์ของใครบางคน, เสียงอ้างอิงในน้ำเสียงที่จดจำได้, ทั้งหมดนี้เป็นเนื้อหาที่คุณยืนยันว่ามีสิทธิ์ใช้ กฎเนื้อหาฝั่งโมเดลยังคงมีผลบังคับใช้เพิ่มเติม และกฎเหล่านั้นเข้มงวดกว่าเกี่ยวกับบุคคลจริงมากกว่าบุคคลที่สมมติขึ้น คู่มือสองเล่มที่ควรอ่านก่อนที่ลูกค้าจะเห็นผลลัพธ์: MiniMax H3 content restrictions และ commercial use and licensing ซึ่งครอบคลุมถึงข้อยกเว้นอาณาเขตในข้อกำหนดของ MiniMax
MiniMax H3 Reference to Video: คำถามที่พบบ่อย
MiniMax H3 reference to video สามารถรักษาตัวละครเดียวกันในสองช็อตที่แตกต่างกันได้หรือไม่?
ได้ และการทดสอบสองช็อตของผมด้านบนใช้งานได้แม้จะมีการกลับด้านแสงจากกลางคืนเป็นเช้าอย่างสมบูรณ์ แต่ภาพตัวละครเพียงอย่างเดียวไม่ใช่สิ่งที่ทำได้ รูปแบบที่เชื่อถือได้คือการส่ง URL เอาต์พุตของช็อตก่อนหน้ากลับเป็นวิดีโออ้างอิงควบคู่ไปกับภาพตัวละคร เพื่อให้การเรียกครั้งที่สองสืบทอดโทนสีและเกรนรวมถึงเอกลักษณ์
ฉันสามารถใช้ first-frame image และ references ในคำขอ MiniMax H3 reference to video เดียวกันได้หรือไม่?
ไม่ได้ และโหมดความล้มเหลวคือปัญหา การส่งทั้ง image และ refers ไม่ทำให้เกิดข้อผิดพลาด ทดสอบเมื่อวันที่ 2026-08-12 งานเสร็จสมบูรณ์ใน 115 วินาที คิดเงิน $0.40 และทิ้งหนึ่งในสองอินพุตอย่างเงียบ ๆ สิ่งเดียวกันเกิดขึ้นในทางกลับกันบนเอนด์พอยต์ image to video เลือกหนึ่งเส้นทางต่อการเรียก
ฉันสามารถส่งไฟล์เสียงเพียงอย่างเดียวเป็นข้อมูลอ้างอิง MiniMax H3 reference to video ได้หรือไม่?
ไม่ได้ เสียงต้องมาพร้อมกับภาพหรือวิดีโออ้างอิงอย่างน้อยหนึ่งรายการ และเอนด์พอยต์บังคับใช้ด้วยข้อผิดพลาดที่ชัดเจน: reference-to-video requires at least one reference image or video มันมาถึงในขั้นตอนการสร้าง ไม่ใช่ตอนส่ง และงานที่ถูกปฏิเสธนั้นฟรี เสียงอ้างอิงยังต้องอยู่ในช่วง 2 ถึง 15 วินาที รวมไม่เกิน 15 วินาที และประกาศเป็น audio/mp3 แทนที่จะเป็น audio/mpeg
MiniMax H3 reference to video คิดเงินเพิ่มสำหรับแต่ละไฟล์อ้างอิงหรือไม่?
ไม่บน Atlas Cloud การรันที่มีภาพอ้างอิงสิบภาพและการรันที่มีภาพเดียวคิดเงิน $0.40 เท่ากันที่ 768P และ 4 วินาที ดังนั้นมิเตอร์ติดตามเฉพาะวินาทีเอาต์พุตและความละเอียดเท่านั้น อย่างไรก็ตาม ควรสังเกตข้อขัดแย้ง: กฎของ MiniMax เองกล่าวถึงวิดีโออินพุตที่ถูกคิดเงินในอัตราเอาต์พุต และแพลตฟอร์มอื่น ๆ แสดงรายการรูปภาพอ้างอิงแยกต่างหาก ตรวจสอบบนพื้นผิวที่คุณเรียกเก็บเงินผ่าน
จะเกิดอะไรขึ้นหากหนึ่งใน URL MiniMax H3 reference to video ของฉันเสีย?
ณ วันที่ 2026-08-12 เอนด์พอยต์ตรวจสอบการเข้าถึงได้และทำให้งานทั้งหมดล้มเหลวฟรี พร้อม content[1].image_url: media not found (HTTP 404) หลังจากประมาณ 21 วินาที นั่นคือการเปลี่ยนแปลง: ก่อนหน้านี้ในเดือนสิงหาคม คำขอเดียวกันเสร็จสมบูรณ์, เพิกเฉยต่อข้อมูลอ้างอิงที่หายไปอย่างเงียบ ๆ และเรียกเก็บเงินเต็มจำนวน อย่าถือว่ารายงานพฤติกรรมเก่ายังคงใช้ได้ และตรวจสอบฟิลด์ status แทนที่จะคิดว่า 200 ตอนส่งหมายถึงอะไร
MiniMax H3 reference to video เป็นโมเดลที่ดีที่สุดสำหรับสิ่งนี้จริงหรือ?
ในการแข่งขันแบบตัวต่อตัวสาธารณะเดียวที่วัดมัน ใช่ แคบ ๆ MiniMax H3 นำกระดานผู้นำการตัดต่อวิดีโอที่ Elo 1,125 จาก 10,280 โหวต แต่ช่วงอันดับที่ระบุคือ 1 ถึง 2 และ Gemini Omni Flash อยู่ห่าง 3 คะแนน Elo โดยมีช่วงที่ทับซ้อนกัน ปฏิบัติต่อมันว่า "ดีที่สุดที่มีร่วมกัน" เลือกจากเวิร์กโฟลว์ที่เหลือ และอ่าน MiniMax H3 alternatives หากการเสมอกันนั้นสำคัญสำหรับคุณ






