ตลอดฤดูร้อนนี้ ฟีดของฉันวนซ้ำวิดีโอเดียวกันไม่หยุด นักฟุตบอลโลกถูกวาดใหม่เป็นตัวเอกสไตล์โชเน็น เผด็จการ กัปตันโจรสลัด เมนเทอร์ที่ดูโหดเหี้ยมโผล่มาในสี่วินาทีสุดท้าย แต่ละโพสต์มีผู้ชมเป็นล้าน และเนื้อเรื่องก็อัปเดตหลังเกือบทุกแมตช์
คนที่สร้างวิดีโอพวกนั้นไม่ได้เขียนโพสต์ benchmark พวกเขาแค่เลือกโมเดล เผาเครดิต และปล่อยงานก่อนการเตะครั้งถัดไป
ผมเลยหยิบคีย์เฟรมอนิเมะหนึ่งภาพและพรอมต์หนึ่งอัน แล้วทดสอบ MiniMax H3 ในฐานะวิดีโอเจเนอเรเตอร์แนวอนิเมะเทียบกับ Veo 3.1 โดยตั้งค่าทั้งคู่ให้สูงสุดในอินพุตที่เหมือนกัน
สิ่งแรกที่พังไม่ใช่คุณภาพภาพ มันคือดรอปดาวน์ Veo 3.1 หยุดที่ 8 วินาทีและให้อัตราส่วนภาพมาแค่สองแบบ ช็อตที่โฟกัสที่ใบหน้า, แพนกล้องตามลูกบอลอย่างรวดเร็ว, แล้วให้การ์ดไตเติลลงจอด — มันไม่พอดีกับ 8 วินาที ตั้งแต่แรกมันไม่มีโอกาสล้มเหลวเรื่องคุณภาพด้วยซ้ำ
ประเด็นสำคัญ
durationenum ของ Veo 3.1 คือ[4, 6, 8]และaspect_ratioenum คือ[16:9, 9:16]ส่วน MiniMax H3 รองรับทุกวินาทีเต็มตั้งแต่ 4 ถึง 15 และมี21:9, 16:9, 4:3, 1:1, 3:4, 9:16การไม่มี 4:3 บน Veo หมายความว่าไม่มีเฟรมแบบ OVA ย้อนยุคเลย- การ์ดโมเดลของ H3 ระบุว่าเสถียรกับ 11 ภาษาสำหรับบทสนทนา และภาษาญี่ปุ่นเป็นหนึ่งในนั้น เสียงและภาพถูกสร้างขึ้นพร้อมกันที่ 32 kHz สเตอริโอ ไม่ใช่พากย์ทีหลัง
- ชุดอ้างอิงไม่ใกล้เคียงกัน: H3 รับได้สูงสุด 9 ภาพ บวกวิดีโอสูงสุด 3 คลิป และคลิปเสียงสูงสุด 3 คลิป (รวม 12 ไฟล์) จุดสิ้นสุดการอ้างอิงของ Veo 3.1 รับได้ 3 ภาพ และทันทีที่คุณใช้
durationจะลดลงเหลือแค่[8]เท่านั้น - กับดักสองอย่างที่ทำให้เทสพังเงียบๆ: API ของ Veo กำหนดค่าเริ่มต้น
generate_audioเป็นfalseและresolutionเป็น720pส่วน text-to-video ของ H3 กำหนดratioเริ่มต้นเป็น1:1ปล่อยไว้แบบนั้นก็เท่ากับเปรียบเทียบคลิป 720p ไร้เสียงกับคลิปสี่เหลี่ยม - Veo 3.1 มีสองสิ่งที่ H3 ไม่มีเลย:
seedและnegative_promptสำหรับอนิเมะ 2D สิ่งที่สองนี้สำคัญจริงๆ และผมจะแสดงให้เห็นว่าที่ไหน
MiniMax H3 วิดีโอเจเนอเรเตอร์แนวอนิเมะ vs Veo 3.1 เฟรมเดียวกัน วางเทียบกัน
ตัวละครต้นฉบับหนึ่งตัว คีย์เฟรมหนึ่งภาพ พรอมต์หนึ่งอัน คัดลอกตัวอักษรต่อตัวอักษรลงในทั้งสองโมเดล ทุกอย่างอื่นตั้งค่าสูงสุดในแต่ละฝั่ง
MiniMax H3, image-to-video, 2K, 8 วินาที, เสียงจากเนทีฟ เปิดเสียง: เสียงฝูงชน เสียงบอลกระทบ และเสียงตะโกนภาษาญี่ปุ่นถูกสร้างขึ้นในพาสเดียวกับภาพ สร้างด้วย minimax/h3/image-to-video บน Atlas Cloud
Veo 3.1, image-to-video, 1080p, 8 วินาที, generateaudio เปิดด้วยมือ พร้อม negativeprompt ที่ช่วยคงลายเส้นแบนๆ ให้แบนราบ เฟรมแรกเดียวกัน คำเดียวกัน สร้างด้วย google/veo3.1/image-to-video บน Atlas Cloud
ทั้งคู่ดึงภาพออกมาได้สวย ช็อตกว้างของ Veo ตอนเตะ มีเส้นแรงกระแทกแบบวาดมือ และเอฟเฟกต์เสียงมังงะลอยอยู่ในอากาศ สวยงามจริงๆ นั่นคือจุดเริ่มต้นที่ซื่อสัตย์ และเป็นเหตุผลว่าทำไมที่เหลือของบทความนี้จะเกี่ยวกับพารามิเตอร์และการทำตามคำสั่ง มากกว่าความรู้สึก
ทำไมการทดสอบ MiniMax H3 วิดีโอเจเนอเรเตอร์แนวอนิเมะ vs Veo 3.1 ส่วนใหญ่ถึงผิดพลาด
สองสิ่งเกิดขึ้นพร้อมกันในฤดูร้อนนี้
อนิเมะกลายเป็นฟอร์แมตที่มีปริมาณสูงที่สุดใน AI วิดีโอ ฟุตบอลโลก 2026 ถูกเขียนใหม่เป็นทัวร์นาเมนต์สไตล์โชเน็น โดยมีผู้เล่นสวมบทเป็นเผด็จการ กัปตันโจรสลัด นายพลนาวิกโยธิน และเมนเทอร์ โดยเนื้อเรื่อง "พัฒนาไปแทบทุกแมตช์" ผ่าน TikTok, Instagram, X และ YouTube (Complex, กรกฎาคม 2026)
และ MiniMax H3 ก็เปิดตัวพร้อมน้ำหนักโอเพนซอร์ส กระทู้ ComfyUI ในวันแรกทะลุ 330 คะแนนและ 95 คอมเมนต์ โดยมีคนโพสต์ตัวเลขจริงจากเครื่องตัวเองภายในไม่กี่ชั่วโมง (Hacker News, สิงหาคม 2026)
เอาสองสิ่งนี้มารวมกันก็คาดว่าจะมีการเปรียบเทียบอนิเมะเป็นกอง แต่แทบไม่มีเลย เพราะการทดสอบส่วนใหญ่สร้างผิดพลาดด้วยหนึ่งในสี่วิธีนี้
พวกเขาเปรียบเทียบภาพ ไม่ใช่ข้อจำกัด ช็อตอนิเมะคือเรื่องของจังหวะเวลา การแพนกล้องแบบ whip pan ตามด้วยการ์ดไตเติลเป็นปัญหาด้านระยะเวลาก่อนที่จะเป็นปัญหาเรื่องการเรนเดอร์
พวกเขาลืมไปว่า API ของ Veo เงียบเป็นค่าเริ่มต้น บน API generate_audio เป็น false และ resolution เป็น 720p โพสต์ "Veo ไม่มีเสียงในอนิเมะ" หลายโพสต์เป็นแค่คนที่ไม่ได้เปิด boolean
พวกเขาลืมไปว่า text-to-video ของ H3 เป็นสี่เหลี่ยมเป็นค่าเริ่มต้น ratio ตั้งเป็น 1:1 ไม่ใช่ 16:9 รันพรอมต์อนิเมะ t2v โดยไม่ตั้งค่า ก็จะได้คลิปสี่เหลี่ยมและข้อสรุปที่สับสน
พวกเขาทดสอบด้วยพรอมต์ที่เหมือนจริง "Cinematic, volumetric light, shallow depth of field" เป็นคำศัพท์ที่ดึงโมเดล 2D ไปทางการแรเงาแบบ 3D เรนเดอร์ โหมดความล้มเหลวในอนิเมะไม่ใช่เบลอ แต่คือความพลาสติก
สามค่าที่กำหนดผลการทดสอบอนิเมะก่อนที่คุณจะกดรัน
ก่อนอื่นให้ตั้งค่าทั้งสองฝั่งเหล่านี้ มิฉะนั้นการเปรียบเทียบจะใช้ไม่ได้
| การตั้งค่า | MiniMax H3 | Veo 3.1 | เกิดอะไรขึ้นถ้าข้ามไป |
|---|---|---|---|
| เสียง | สร้างพร้อมกับภาพ เปิดตลอดเวลา | generate_audio ค่าเริ่มต้นเป็น false | Veo คืนคลิปเงียบและดูแย่กว่าที่เป็นจริง |
| รูปร่างเฟรม | ratio ค่าเริ่มต้นเป็น 1:1 สำหรับ text-to-video | aspect_ratio ค่าเริ่มต้นเป็น 16:9 | H3 ส่งคลิปอนิเมะสี่เหลี่ยมที่คุณใช้ไม่ได้ |
| ความละเอียด | ค่าเริ่มต้นเป็น 2K | ค่าเริ่มต้นเป็น 720p | คุณเปรียบเทียบ 2K กับ 720p แล้วบอกว่าคุณภาพต่างกัน |
อยากทดสอบ MiniMax H3 และ Veo 3.1 ด้วยพรอมต์อนิเมะเดียวกันด้วยตัวเองไหม? Atlas Cloud's model comparison รันทั้งสองแบบในพาสเดียว — พรอมต์และการตั้งค่าเดียวกัน ราคาแสดงก่อนที่คุณจะสร้าง

MiniMax H3 และ Veo 3.1 บนพรอมต์อนิเมะเดียวกันในโมเดลเปรียบเทียบของ Atlas Cloud — การตั้งค่าเดียวกัน ราคาแสดงก่อนสร้าง บันทึกหน้าจอจาก model-explorer
สเปกชีต MiniMax H3 vs Veo 3.1 อนิเมะ: ความยาว, อัตราส่วน, เสียง, ข้อมูลอ้างอิง
ผมดึงสคีมา input จริงของทั้งสองโมเดลมา แทนที่จะเชื่อโพสต์เปิดตัวใดๆ ทุกค่าด้านล่างเป็น enum ที่คุณสามารถอ่านได้เองบนหน้าโมเดล ไม่ใช่ความประทับใจ
ตารางที่ 1: MiniMax H3 vs Veo 3.1 พารามิเตอร์ที่กำหนดช็อตอนิเมะ
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| ระยะเวลา | 4 ถึง 15 ทุกวินาทีเต็ม (ค่าเริ่มต้น 8) | 4, 6, 8 (ค่าเริ่มต้น 8) |
| อัตราส่วนภาพ | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| ค่าเริ่มต้นอัตราส่วน (text-to-video) | 1:01 | 16:09 |
| ความละเอียด | 768P, 2K (ค่าเริ่มต้น 2K) | 720p, 1080p, 4k (ค่าเริ่มต้น 720p) |
| เสียง | สร้างร่วมกัน 32 kHz สเตอริโอ | generate_audio, ค่าเริ่มต้น false |
| ภาษาบทสนทนาจากเนทีฟ | 11 ภาษาที่เสถียร รวมภาษาญี่ปุ่น | ไม่ได้เผยแพร่เป็นรายการที่เสถียร |
| ชุดอ้างอิง | สูงสุด 9 ภาพ, 3 วิดีโอ, 3 คลิปเสียง, รวม 12 ไฟล์ | 3 ภาพ |
| ระยะเวลาเมื่อใช้ข้อมูลอ้างอิง | ยังคง 4 ถึง 15 | ลดเหลือแค่ 8 เท่านั้น |
| seed | ไม่มี | มี |
| negative_prompt | ไม่มี | มี |
| น้ำหนัก | ดาวน์โหลดได้ | ปิด |
ระยะเวลา, อัตราส่วน, ความละเอียด, เสียง และข้อจำกัดของข้อมูลอ้างอิง อ่านจากสคีมาจริงบนหน้า MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video และ Veo 3.1 reference-to-video จำนวนภาพสูงสุด 9 ภาพและไฟล์ 12 ไฟล์ รวมถึงรายการ 11 ภาษา มาจาก MiniMax H3 model card (Hugging Face, สิงหาคม 2026)
ตอนนี้มาตารางคะแนน เพราะมันบอกอะไรบางอย่างที่แตกต่างจากสเปกชีต และทั้งสองอย่างสำคัญ
ตารางที่ 2: คะแนน Elo จากการโหวตและราคาต่อนาที ภาพรวมวันที่ 7 สิงหาคม 2026
| โมเดล | Text-to-video (พร้อมเสียง) | Image-to-video (พร้อมเสียง) | $/นาที |
|---|---|---|---|
| Gemini Omni Flash | 1,244 (#1) ±7 | 1,191 (#2) ±9 | $6.00 |
| MiniMax H3 | 1,238 (#2) ±9 | 1,190 (#3) ±10 | $7.80 |
| Dreamina Seedance 2.0 720p | 1,224 (#3) ±6 | 1,198 (#1) ±7 | $9.07 |
| Kling 3.0 1080p (Pro) | 1,111 (#7) ±6 | ไม่อยู่ใน 10 อันดับแรก | $20.16 |
| Veo 3.1 | 1,093 (#11) ±7 | 1,085 (#10) ±7 | $24.00 |
| Veo 3.1 Fast | 1,091 (#14) ±6 | ไม่อยู่ใน 10 อันดับแรก | $9.00 |
| Veo 3.1 Lite | 1,089 (#15) ±7 | ไม่อยู่ใน 10 อันดับแรก | $4.80 |
Elo และราคาจาก Artificial Analysis Video Arena (Artificial Analysis, สิงหาคม 2026) เป็นคะแนนโหวตจากผู้ใช้แบบเลื่อนได้ และเปลี่ยนแปลงได้ คอลัมน์ $/นาที เป็นค่าประมาณโมเดลที่ปรับมาตรฐาน ไม่ใช่ใบแจ้งหนี้ของคุณ
ช่องว่าง Elo 145 คะแนนถือว่ามาก แต่มันเป็นการโหวตทั่วไป ไม่ใช่การโหวตเฉพาะอนิเมะ และนี่คือส่วนที่ผมต้องพูดตรงๆ: MiniMax ไม่ได้โปรโมท H3 ว่าเป็นโมเดลอนิเมะ ข้อเสนอแนะภายในระดับแรกบอกว่าภาพยนตร์, แอนิเมชัน และดราม่าสไตล์การ์ตูนเป็นพื้นที่ที่ H3 ไม่ได้ ตั้งเป้าไว้ ดังนั้นคำถามที่น่าสนใจไม่ใช่ "อันไหนคือโมเดลอนิเมะ" แต่เป็นว่าทำไมโมเดลที่ไม่ขายตัวเองในฐานะอนิเมะถึงยังชนะในช็อตนี้ และ Google ยังเอาชนะในรอบไหนได้บ้าง
หมายเหตุเชิงปฏิบัติก่อนการสอน: ทุกโมเดลด้านล่างทำงานผ่านคอนโซลเดียวกันและคีย์ API เดียวกัน ซึ่งเป็นเหตุผลเดียวที่พารามิเตอร์สามารถเปรียบเทียบกันได้ คิวเดียวกัน, auth เดียวกัน, บิลเดียว ถ้าคุณตั้งค่า GPT Image 2 บนบริการหนึ่งและ Veo บนอีกบริการหนึ่ง ครึ่งหนึ่งของความแตกต่างที่คุณพบจะเป็นเรื่องของระบบท่อประปา ไม่ใช่โมเดล
สร้างช็อต: MiniMax H3 vs Veo 3.1 ทีละขั้นตอน
ตัวอย่างการทำงานเดียว ตั้งแต่ต้นจนจบ "นกหวีดสุดท้าย": กองหน้าวัยรุ่นต้นฉบับ ผมสีแดง, ชุดขาว-น้ำเงินเบอร์ 9, ไฟสปอร์ตไลท์, แพนกล้อง whip pan ขณะเตะ และการ์ดไตเติลภาษาญี่ปุ่นที่ต้องลงจอดในสองวินาทีสุดท้ายและอยู่นิ่ง
ไม่มีผู้เล่นจริง, ไม่มีตัวละครทางการ, ไม่มี IP อนิเมะที่มีอยู่ มีเพียงสไตล์และการแสดงความเคารพ เพิ่มเติมเกี่ยวกับเหตุผลในอีกสักครู่
ขั้นตอนที่ 1: ออกแบบคีย์เฟรมอนิเมะด้วย GPT Image 2
คีย์เฟรมนำทิศทางศิลปะไปให้โมเดลวิดีโอไม่ต้องประดิษฐ์ขึ้นเอง สังเกตพื้นที่ว่างบนซ้ายหนึ่งในสามของภาพ: มันตั้งใจไว้ การ์ดไตเติลจะถูกเขียนตรงนั้นโดยโมเดลวิดีโอ และนั่นคือการทดสอบความเสถียรของข้อความ
Plain1A single frame from a modern shonen sports anime. Cel-shaded 2D animation, hand-inked 2line art with consistent line weight, flat colour fills, hard-edged graphic shadows, 3absolutely no 3D shading and no photoreal skin. Close-up on an original teenage striker: 4messy dark-red hair, white-and-navy kit with the number 9, sweat and grass streaks across 5one cheek, eyes wide with exhausted determination, mouth open mid-shout. Behind him, 6stadium floodlights blaze into a wall of blurred crowd colour; radial speed lines burst 7from the centre of frame; one blade of grass hangs frozen in the air. Saturated palette, 8deep cyan shadows, warm orange rim light. 16:9 composition, the character framed right of 9centre, clean negative space on the left third. No text anywhere in the image.
การตั้งค่า: model openai/gpt-image-2/text-to-image, quality high, size 16:9 (2048x1152). ไม่มีอย่างอื่น

GPT Image 2 playground บน Atlas Cloud พร้อมพรอมต์คีย์เฟรม Last Whistle และเฟรมอนิเมะที่เสร็จแล้วในแผงเอาต์พุต
GPT Image 2 บน Atlas Cloud: ตั้งค่า quality เป็น high, คีย์เฟรมที่เสร็จแล้วทางด้านขวา

คีย์เฟรมอนิเมะพื้นฐาน: กองหน้าผมแดงต้นฉบับกำลังตะโกนกลางสนามใต้แสงสปอร์ตไลท์ เซลล์เฉดสีแบนพร้อมเส้นความเร็ว
คีย์เฟรมที่ทั้งสองโมเดลได้รับ สีแบน, เงาแข็ง, และพื้นที่ว่างซ้ายหนึ่งในสามที่รอการ์ดไตเติล
ขั้นตอนที่ 2: MiniMax H3 image-to-video ตั้งค่าทุกอย่างสูงสุด
ภาพเดียวกันเข้าไป, 2K ออกมา ผมตั้ง H3 ไว้ที่ 8 วินาทีเท่านั้นเพื่อให้ตรงกับเพดานของ Veo นั่นไม่ใช่ขีดจำกัดของ H3 และขั้นตอนที่ 4 จะถอดแคปออก
Plain1Cel-shaded 2D anime, hand-inked line weight, flat colour, no 3D shading. Hold on the 2striker's face for one beat, then a violent whip pan follows the ball as he strikes it, 3the pan smearing the frame into streaked sakuga motion trails. One frame of total silence 4at impact. Over the final two seconds, bold white Japanese title lettering reading 5ラストホイッスル punches onto the left third of frame and holds rock-steady, no warping, 6no flicker, no drift. The striker shouts one line in Japanese: 「まだ終わってない!」 7Audio: stadium roar swelling, a single sharp ball-strike impact, a low taiko hit under the 8title card.
การตั้งค่า: model minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (image-to-video ใช้รูปร่างเฟรมจากภาพอินพุตของคุณ), image = ผลลัพธ์จากขั้นตอนที่ 1
คำเตือนหนึ่งข้อถ้าคุณแยกไปใช้ text-to-video แทน: เขียน ratio: 16:9 อย่างชัดเจน ค่าเริ่มต้นคือ 1:1 และมันจะส่งคลิปอนิเมะสี่เหลี่ยมให้คุณอย่างมีความสุข

MiniMax H3 image-to-video playground บน Atlas Cloud พร้อมพรอมต์ Last Whistle, คีย์เฟรมที่โหลด และคลิปที่เสร็จแล้วในแผงเอาต์พุต
MiniMax H3 image-to-video บน Atlas Cloud: คีย์เฟรมขั้นตอนที่ 1 โหลดทางซ้าย, คลิปที่เสร็จแล้วกำลังเล่นทางขวา
ขั้นตอนที่ 3: Veo 3.1 image-to-video เปิดเสียงด้วยมือ
พรอมต์เหมือนกันทุกตัวอักษร เปลี่ยนคำคุณศัพท์แม้แต่คำเดียวก็ไม่ใช่การเปรียบเทียบอีกต่อไป สิ่งที่เปลี่ยนคือฟิลด์พิเศษที่ Veo ให้คุณได้และ H3 ไม่มี
negative_prompt ซึ่งสำหรับอนิเมะ 2D เป็นตัวควบคุมที่มีประโยชน์ที่สุดในรายการนี้:
Plain13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur 2soup, warped lettering, gibberish text, extra fingers, subtitle bar
การตั้งค่า: model google/veo3.1/image-to-video, resolution: 1080p (เปลี่ยนเลย ค่าเริ่มต้นคือ 720p), duration: 8 (นี่คือเพดาน), aspect_ratio: 16:9, generate_audio: true (ค่าเริ่มต้น API คือ false, นี่คือกับดักคลิปเงียบ), seed: 20260807, image = ผลลัพธ์ขั้นตอนที่ 1 เดียวกัน

Veo 3.1 image-to-video playground บน Atlas Cloud แสดงการเปิด Generate Audio, คีย์เฟรมอนิเมะที่โหลด และคลิปที่เสร็จแล้วในแผงเอาต์พุต
Veo 3.1 image-to-video บน Atlas Cloud โดยเปิด Generate Audio และคลิปที่เสร็จแล้วทางด้านขวา
ขั้นตอนที่ 4: ให้คะแนนใน 5 แกนเฉพาะอนิเมะ
ไม่มีอะไรต้องสร้าง แค่ดู ในสิ่งที่อนิเมะมักจะพังจริงๆ ทั้งสองคลิปฝังไว้ใกล้ต้นบทความนี้ คุณสามารถให้คะแนนเองแทนที่จะเชื่อผม

ข้างเคียงของเฟรมสุดท้ายจากทั้งสองคลิป MiniMax H3 ทางซ้ายมีตัวอักษรไตเติลภาษาญี่ปุ่นที่ชัดเจน Veo 3.1 ทางขวามีตัวอักษรแนวตั้งที่อ่านไม่ออก
เฟรมสุดท้ายของแต่ละคลิป ซ้าย: H3 เขียน ラストホイッスル, คะตะกานะทั้งแปดตัวถูกต้องและนิ่งสนิท ขวา: Veo 3.1 เขียนสามตัวอักษรที่ไม่ใช่คำที่ขอและไม่ใช่คำ
การ์ดไตเติลคือจุดที่ตัดสินรอบนี้ และมันไม่สูสีเลย H3 เรนเดอร์คะตะกานะที่ร้องขอได้อย่างถูกต้อง แข็งและนิ่ง บนพื้นหลังแพนกล้องที่เบลอของประตู Veo 3.1 ผลิตชุดตัวอักษรแนวตั้งสามตัวที่ไม่ใช่ทั้งคำที่ขอและไม่ใช่คำใดๆ ในเฟรมเดียวกันมันยังทำตัวละครหลุดจากช็อต และปล่อยให้พื้นหลังเลื่อนไปทางภาพสนามกีฬากึ่งเหมือนจริง แม้จะมี photorealistic skin และ 3D render อยู่ใน negative prompt
ตารางที่ 3: ห้าแกนที่ตัดสินช็อตอนิเมะ จากการรันทั้งสองครั้งนี้
| แกน | MiniMax H3 | Veo 3.1 |
|---|---|---|
| ความต่อเนื่องของตัวละครจากคีย์เฟรม | คงใบหน้า, ผม และชุดที่แน่นอนตลอด 8 วินาที | วาดตัวละครใหม่ในช็อตกว้างใหม่ ตรงตามโมเดลแต่เป็นภาพวาดที่แตกต่าง |
| น้ำหนักเส้นและการแรเงาเซลล์แบน | คงที่ ไม่เลื่อนไปทาง 3D | คงที่ในช็อตระยะกลาง แต่เลื่อนไปเป็นภาพสนามกีฬาเหมือนจริงในตอนท้าย |
| การ์ดไตเติลภาษาญี่ปุ่น | ラストホイッスル เรนเดอร์ถูกต้องและนิ่ง | ตัวอักษรสามตัว ไม่ใช่คำที่ขอ ไม่ใช่คำ |
| แทร็กเสียงที่ส่งมอบ | 32 kHz สเตอริโอ ตรงตามที่การ์ดโมเดลระบุ | 48 kHz สเตอริโอ มีอยู่ก็เพราะผมตั้ง generate_audio เอง |
| Whip pan และ sakuga smear | ดำเนินการเป็นแพนกล้องเบลอเข้าสู่ไตเติล | ถูกแทนที่ด้วยคัทฮาร์ดไปยังช็อตใหม่ |
แถวสุดท้ายคือคำวิจารณ์ที่ดังที่สุดต่อ H3 จนถึงตอนนี้ ซึ่งเป็นเหตุผลที่ผมเขียนมันลงในพรอมต์ทั้งสองพอดี ในกระทู้ ComfyUI วันแรก ผู้ใช้ fwip บ่นว่าแม้แต่พรอมต์ตัวอย่างทางการก็ไม่ได้รับการทำตาม: "a violent WHIP PAN off the rooftop that SMEARS the floating words away with it, motion-streaked. And the video just didn't do any of that transition at all, it just replaced it with a cut."
ในการรันนี้ Veo เป็นฝ่ายที่เปลี่ยนแพนเป็นคัท ส่วน H3 กลับทำตามที่สั่ง แค่ครั้งละครั้งไม่ใช่คำตัดสิน และผมจะไม่บอกเป็นอย่างอื่น แต่ก็หมายความว่าคำวิจารณ์ไม่ใช่เฉพาะ H3: whip pan เป็นคำสั่งที่ไม่น่าเชื่อถือที่สุดในการทดสอบนี้ทั้งสองฝ่าย ถ้าสตอรีบอร์ดของคุณขึ้นอยู่กับมัน ให้วางสตอรีบอร์ดรอบมันแทนที่จะผ่านมัน
ขั้นตอนที่ 5: คัท 4:3 ย้อนยุคสไตล์ OVA ที่ Veo 3.1 ไม่สามารถสร้างได้ในเชิงโครงสร้าง
นี่ไม่ใช่ความชอบด้านคุณภาพ มันคือกำแพง aspect_ratio enum ของ Veo มีสองค่า และไม่มี 4:3 และ duration enum ของมันไม่มี 12 ลุค OVA ยุค 90s ไม่สามารถเข้าถึงได้เลย
Plain1A 1990s OVA anime cut, 4:3 full-frame. Hand-painted background art with visible brush 2texture, cel-paint characters with thick uneven ink lines, heavy halation glow around the 3floodlights, 16mm film grain and faint gate weave. The same red-haired striker in a 4white-and-navy number 9 kit walks off a rain-soaked pitch as the crowd noise fades to a 5single ringing tone. Camera pushes in slowly on his face. He says quietly in Japanese: 6「次は、勝つ」. Retro palette: muted teal, dusty amber, deep maroon shadows. Audio: 7distant rain, a lone analogue synth pad, one reverb-heavy whistle in the far distance.
การตั้งค่า: model minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3 ตั้งค่าอัตราส่วนด้วยตนเอง จำค่าเริ่มต้นไว้

MiniMax H3 text-to-video playground บน Atlas Cloud พร้อมพรอมต์ OVA ที่พิมพ์ และคลิปย้อนยุคที่เสร็จแล้วในแผงเอาต์พุต
MiniMax H3 text-to-video บน Atlas Cloud, พิมพ์พรอมต์ OVA, คลิปเสร็จแล้ว ขอเปิดเผย: การรันนี้ตั้ง Aspect Ratio เป็น 16:9 และ Duration เป็น 8 ดังนั้นสิ่งที่คุณเห็นทางขวาคือเวอร์ชันสั้นแบบจอกว้าง คัท 4:3 สิบสองวินาทีด้านล่างมาจากการเรียก API ด้วย ratio: 4:3 และ duration: 12 ที่ตั้งไว้อย่างชัดเจน

คัท OVA 4:3 ย้อนยุค: กองหน้าคนเดิมเดินออกจากสนามที่เปียกฝนในสไตล์อนิเมะยุค 90s
H3 text-to-video, 4:3, 12 วินาที ไฟล์ที่ส่งกลับมาเป็น 1920x1440 ซึ่งเป็น 4:3 พอดี พร้อมแทร็กเสียงสเตอริโอ 32 kHz แสดงเป็น GIF เงียบที่อัตราเฟรมลดลงเพื่อให้หน้าโหลดเบา สร้างด้วย minimax/h3/text-to-video บน Atlas Cloud
ขั้นตอนที่ 6: ภาพอ้างอิงเก้าภาพ ตัวละครเดียว สี่คัท
ความสอดคล้องของตัวละครข้ามช็อตเป็นปัญหาที่ยากที่สุดใน AI อนิเมะ และมันแก้ได้ด้วยปริมาณการอ้างอิง สร้างชุดก่อน: รันพรอมต์ขั้นตอนที่ 1 อีกครั้งโดยเปลี่ยนเฟรมเป็นด้านหน้า, สามในสี่, โปรไฟล์เต็ม, ด้านหลัง, หัวเราะ, กัดฟัน, ยืนเต็มตัว, รายละเอียดชุด และรายละเอียดรองเท้า เก้าภาพ รวมประมาณแปดเซ็นต์

สี่มุมของนักเตะต้นฉบับคนเดียวกันที่สร้างเป็นชุดอ้างอิง จัดเรียงเป็นกริดสองต่อสอง
สี่ในเก้ามุมอ้างอิง H3 รับภาพได้สูงสุดเก้าภาพในชุดอ้างอิงเดียว บวกวิดีโอและเสียงอ้างอิงเพิ่มเติม
Plain1Cel-shaded 2D anime, consistent hand-inked line weight, flat colour, no 3D shading. Keep 2the referenced striker's face, hair silhouette and number 9 kit identical across every cut. 3Four cuts in one continuous take: (1) low-angle push-in on his boots hitting the turf, 4(2) whip-pan up to a tight close-up of his eyes, (3) wide shot of him sprinting past three 5defenders drawn as blurred silhouettes, (4) freeze on a mid-air header, speed lines 6exploding outward. Audio: crowd roar, breath, boot-on-turf impacts, one taiko hit on the 7freeze.
การตั้งค่า: model minimax/h3/reference-to-video, refers = ภาพของคุณพร้อม type: image, resolution: 2K, duration: 8 หรือสูงกว่า, ratio: adaptive หรือ 16:9
การเทียบเท่า Veo 3.1 ไม่สามารถรันได้ในการตั้งค่าเหล่านี้ และคุณไม่ต้องลองก็รู้ว่าทำไม จุดสิ้นสุดการอ้างอิงของมันรับภาพได้สูงสุดสามภาพ และการเลือกจุดสิ้นสุดนั้นทำให้ duration ลดลงเหลือค่าเดียวที่ถูกต้องคือ 8 ชุดภาพเก้าภาพและการถ่าย 10 วินาทีล้วนเกินขอบเขต

MiniMax H3 reference-to-video playground บน Atlas Cloud แสดงตัวนับอ้างอิงที่สี่จากเก้า และคัทแรกในแผงเอาต์พุต
MiniMax H3 reference-to-video บน Atlas Cloud ตัวนับอ่าน Reference Materials (4/9) โดยมี MAX:9 ด้านล่าง ซึ่งเป็นเพดานในอินเทอร์เฟซ ไม่ใช่การอ้างจากสเปกชีต ผลลัพธ์คือคัทแรก มุมต่ำ push-in ที่รองเท้าบู๊ต
อีกสี่การรัน MiniMax H3 วิดีโอเจเนอเรเตอร์แนวอนิเมะที่คุ้มค่าที่จะลอง
ช็อต Last Whistle เน้นแค่สี่ความแตกต่าง สี่อันนี้เน้นส่วนที่เหลือ ทั้งหมดรันบน H3; หมายเหตุบอกว่า Veo 3.1 สามารถจับคู่ตัวไหนได้บ้าง
- Ultrawide sakuga fight,
21:9, 10 วินาที Veo ไม่สามารถสร้าง 21:9 ได้เลย
Plain1Cel-shaded 2D anime action, thick tapered ink lines, flat colour, hard-edged shadows, 2no 3D shading. Two original masked duelists on a windswept temple roof at dusk. Blade 3clash, the frame shudders, both fighters break apart in a burst of hand-drawn impact 4frames and radial speed lines. Camera: low-angle push-in, then a lateral track, then a 5snap to a wide silhouette against the orange sky. Audio: two sharp metal clashes, cloth 6snap, a low taiko hit on the final freeze, no music.
- Beat-synced AMV cut, reference-to-video พร้อมข้อมูลอ้างอิงเสียง H3 รับคลิปเสียงได้สูงสุดสามคลิปเป็นอินพุตอ้างอิง Veo 3.1 ไม่มีอินพุตเสียงเลย มีแต่เอาต์พุตเสียง
Plain1Cel-shaded 2D anime montage cut to the referenced audio track. Five short beats: rain on 2a window, a hand tightening a bandage, a city skyline flashing past a train window, a 3sprint start, a freeze on an outstretched hand. Every cut lands exactly on a downbeat of 4the referenced audio. Flat colour, thick ink lines, high-contrast night palette of deep 5indigo and neon magenta.
- ฉากบทสนทนาภาษาญี่ปุ่นสองบรรทัด 12 วินาที นี่คือการทดสอบความเครียดของลิปซิงค์ และ 12 วินาทีก็อยู่นอกขอบเขตของ Veo แล้ว
Plain1Cel-shaded 2D anime, flat colour, no 3D shading. Two original characters on a rooftop at 2golden hour, shot reverse shot. First says in Japanese:「本当に行くの?」. The second 3answers, half-smiling, in Japanese:「もう決めた」. Mouths match every syllable. Warm rim 4light, long shadows, gentle wind in hair. Audio: two distinct Japanese voices, distant 5traffic, one cicada.
- Vertical shonen short,
9:16, 8 วินาที ทั้งสองโมเดลทำแนวตั้งได้ ดังนั้นนี่คือจุดเดียวที่ควร A/B จริงๆ แทนที่จะคาดเดา
Plain1Cel-shaded 2D anime, vertical composition. An original teenage runner bursts through a 2paper banner in slow-motion, then the frame snaps back to full speed as she accelerates 3down a stadium straight. Speed lines, flat colour, hard shadows, bold graphic sky. 4Camera: low-angle follow shot, then a whip up to her face. Audio: banner tear, crowd 5surge, one breath held then released.
หากคุณต้องการไวยากรณ์พรอมต์ที่อยู่เบื้องหลังเหล่านี้ คู่มือพรอมต์ MiniMax H3 ลงลึกถึงวิธีที่ H3 แยกวิเคราะห์คำสั่งกล้องและเสียงมากกว่าที่ผมจะทำได้ที่นี่
ราคาโอเพนนิ่งอนิเมะ 60 วินาทีบน MiniMax H3 vs Veo 3.1
โอเพนนิ่งอนิเมะมาตรฐานประมาณ 90 วินาที สมมติแปดช็อตๆ ละ 8 วินาที, วิดีโอที่เสร็จแล้ว 64 วินาที, บวกคีย์เฟรมละหนึ่งภาพต่อช็อต ราคา $0.009 ต่อภาพ
มีความแตกต่างด้านราคาจริงที่คุณควรรู้ แทนที่จะให้ผมปิดบัง แคตตาล็อก Atlas Cloud แสดง MiniMax H3 ที่ $0.10 ต่อวินาทีแบบเหมา ในขณะที่ readme ของโมเดลแยกเป็น $0.14/วินาที ที่ 2K และ $0.10/วินาที ที่ 768P Veo 3.1 แสดงที่ $0.20 ต่อวินาที ในขณะที่ readme แยกเป็น $0.40/วินาที พร้อมเสียง และ $0.20/วินาที ไม่มีเสียง
ปุ่มรันในภาพหน้าจอของผมยืนยัน H3 reference-to-video 8 วินาทีที่ 2K แสดง Run $1.12 ซึ่งเท่ากับ $0.14 ต่อวินาทีพอดี Veo 3.1 image-to-video 8 วินาทีที่ 1080p พร้อมเสียงเปิด แสดง Run $3.2 ซึ่งเท่ากับ $0.40 ต่อวินาทีพอดี ดังนั้นอัตรา readme คืออัตราที่เรียกเก็บ และพาดหัวแคตตาล็อกคือระดับเริ่มต้น ผมแสดงทั้งสองค่าด้านล่างไว้แล้ว ราคาเหล่านี้เป็นราคาตามรายการ ณ เดือนสิงหาคม 2026
ตารางที่ 4: แปดช็อตๆ ละ 8 วินาที รวมคีย์เฟรม
| การตั้งค่า | ราคาวิดีโอ (อัตราแคตตาล็อก) | ราคาวิดีโอ (อัตรา readme) | คีย์เฟรม | ช่วงรวม |
|---|---|---|---|---|
| MiniMax H3, 2K | $6.40 | $8.96 | $0.07 | $6.47 ถึง $9.03 |
| MiniMax H3, 768P | $6.40 | $6.40 | $0.07 | $6.47 |
| Veo 3.1, 1080p พร้อมเสียง | $12.80 | $25.60 | $0.07 | $12.87 ถึง $25.67 |
| Veo 3.1 Lite, 720p | $3.20 | $3.20 | $0.07 | $3.27 |
ราคาดึงจากหน้าโมเดล Atlas Cloud ที่เชื่อมโยงในตารางที่ 1, สิงหาคม 2026 ไม่มีราคาใดในสี่นี้ที่มีส่วนลดในขณะนี้
สองสิ่งที่ตารางนั้นไม่รวม และทั้งสองกระทบหนักกว่าอัตราต่อวินาที
การลองใหม่ ไม่มีใครส่งช็อตอนิเมะเทคแรก ไม่ว่าคุณจะใช้ตัวคูณเท่าไหร่ ใช้กับทั้งสองคอลัมน์แล้วช่องว่างจะกว้างขึ้นในสัดส่วนเดียวกัน
เวลาในโลกจริง และอันนี้กลับกัน จับเวลาตั้งแต่ต้นจนจบเมื่อวันที่ 7 สิงหาคม 2026: H3 ที่ 2K 8 วินาที ใช้เวลา 447 วินาที ประมาณ 7.5 นาที H3 text-to-video ที่ 2K 12 วินาที ใช้เวลา 334 วินาที Veo 3.1 ที่ 1080p 8 วินาทีพร้อมเสียง ใช้เวลา 152 วินาที ต่ำกว่า 3 นาที Veo เร็วกว่าประมาณสามเท่าในการได้เทคแรกที่นี่ และถ้าคุณกำลังปรับแต่งช็อตตอนตีสอง นั่นคือเงินจริง คิวเปลี่ยนไป ให้ถือว่าสิ่งเหล่านี้เป็นภาพรวมของบ่ายวันหนึ่ง ไม่ใช่สเปก แต่ใครก็ตามที่อ้างว่า "2 ถึง 3 นาที" สำหรับ H3 ที่ 2K กำลังอ้าง readme ไม่ใช่คิว รายละเอียด 2K กับ 768P ครอบคลุมว่าเมื่อไหร่ที่ระดับสูงกว่าคุ้มกับนาทีที่เพิ่มขึ้น
สไตล์อนิเมะ การแสดงความเคารพ และสิ่งที่คุณสามารถเผยแพร่ได้จริง
ทุกอย่างในบทความนี้คือสไตล์และการแสดงความเคารพ ตัวละครต้นฉบับ, ชุดต้นฉบับ, ชื่อเรื่องต้นฉบับ ไม่มีการสร้างหรือร้องขอตัวละครอนิเมะทางการ และไม่มีการใช้ชื่อหรือรูปลักษณ์ของนักฟุตบอลจริง เทรนด์ฟุตบอลโลกถูกอ้างอิงเป็น รูปแบบ เพราะนั่นคือสิ่งที่มีประโยชน์
ความแตกต่างนั้นไม่ใช่การตกแต่ง หากคุณกำลังผลิตเนื้อหาสไตล์อนิเมะในเชิงพาณิชย์ "ในสไตล์ OVA ยุค 90s" และ "ตัวละครเฉพาะนี้จากรายการเฉพาะนี้" เป็นวัตถุทางกฎหมายที่แตกต่างกัน และมีเพียงหนึ่งเดียวเท่านั้นที่ทำธุรกิจได้
ในส่วนของน้ำหนักโอเพนซอร์ส: H3 ดาวน์โหลดได้จริง และผู้คนก็รันมันในวันแรก ผู้ใช้คนหนึ่งรายงาน 10 นาทีสำหรับคลิป 480p 10 วินาทีบน 4070 Ti Super 16GB และคนอื่นโพสต์ 3 นาทีบน 5080 และ 68 วินาทีบน RTX 6000 Pro แต่การโฮสต์เองรันที่ขอบสั้น 768; ขั้นตอน Context-IR และ Regenerate-2K ที่ผลิต 2K ยังคงอยู่ฝั่ง API
ใบอนุญาตมีข้อแม้จริง ใบอนุญาตชุมชนไม่ครอบคลุมสหภาพยุโรป สหราชอาณาจักร เกาหลีใต้ หรือสหรัฐอเมริกาในปัจจุบัน โดยอ้างถึงภูมิภาคที่ "กำลังพัฒนา หรือบังคับใช้กฎระเบียบที่เกี่ยวข้องกับ AI" ช่องทางการขอใบอนุญาตอย่างเป็นทางการเปิดอยู่ ซึ่งผู้ใช้ HN คนหนึ่งสรุปว่า "คุณแค่ต้องสัญญาแบบยกนิ้วให้ว่าคุณจะไม่ทำให้ดิสนีย์โกรธ แล้วพวกเขาจะส่งใบอนุญาตให้คุณ" ตลกดี และก็เป็นขั้นตอนการปฏิบัติตามที่คุณข้ามไม่ได้หากคุณอยู่ในหนึ่งในสี่ดินแดนนั้น บทความน้ำหนักโอเพนซอร์ส มีรายชื่อดินแดนทั้งหมด
คำถามที่พบบ่อย
MiniMax H3 เป็นวิดีโอเจเนอเรเตอร์แนวอนิเมะที่ดีเมื่อเทียบกับ Veo 3.1 หรือไม่?
สำหรับงานอนิเมะส่วนใหญ่ H3 ดีกว่า และสาเหตุหลักไม่เกี่ยวกับการเรนเดอร์ มันรันได้ 4 ถึง 15 วินาที เทียบกับ 4, 6 หรือ 8 ของ Veo, มีอัตราส่วนภาพหกแบบรวมถึง 4:3 และ 21:9 เทียบกับสองแบบของ Veo, มีภาษาญี่ปุ่นใน 11 ภาษาบทสนทนาที่เสถียรจากเนทีฟ, และรับภาพอ้างอิงเก้าภาพเทียบกับสามภาพของ Veo Veo 3.1 ชนะในสถานการณ์เฉพาะ: เมื่อคุณต้องการ seed สำหรับการถ่ายใหม่ที่ทำซ้ำได้ หรือ negative_prompt เพื่อหยุดช็อตไม่ให้เลื่อนไปทางการแรเงา 3D H3 ไม่มีพารามิเตอร์ใดๆ เลย ถ้าไปป์ไลน์ของคุณขึ้นอยู่กับสิ่งใดสิ่งหนึ่ง นั่นเป็นเหตุผลจริงที่จะอยู่กับ Veo
Veo 3.1 สามารถสร้างอนิเมะใน 4:3 หรือคลิป 15 วินาทีได้หรือไม่?
ไม่ได้ และไม่ใช่เพราะเหตุผลด้านสไตล์ aspect_ratio enum ของ Veo 3.1 มี 16:9 และ 9:16 เท่านั้น และ duration enum มี 4, 6 และ 8 เท่านั้น ไม่มีค่า 4:3 ให้เลือก และไม่มีวิธีร้องขอ 12 หรือ 15 วินาที ถ้าข้อมูลอ้างอิงของคุณคืออนิเมะทีวีหรือ OVA ยุค 90s เฟรมนั้นไม่สามารถเข้าถึงได้บน Veo และมีให้ใช้งานบน H3
ทำไมคลิปอนิเมะ Veo 3.1 ของฉันถึงกลับมาเงียบ?
เพราะ generate_audio กำหนดค่าเริ่มต้นเป็น false บน API โดยทั่วไปสวิตช์ใน Playground จะเปิดอยู่แล้ว ดังนั้นสิ่งนี้จะกระทบเฉพาะคนที่เรียก API โดยตรงเท่านั้น ตั้งค่า generate_audio: true อย่างชัดเจน ขณะที่อยู่ตรงนั้น ให้ตั้งค่า resolution ด้วย เพราะมันกำหนดค่าเริ่มต้นเป็น 720p แทนที่จะเป็น 1080p หรือ 4k ที่คุณอาจหมายถึง
MiniMax H3 รองรับบทสนทนาภาษาญี่ปุ่นและลิปซิงค์สำหรับอนิเมะหรือไม่?
ใช่ การ์ดโมเดลระบุ 11 ภาษาที่รองรับบทสนทนาอย่างเสถียร: อาหรับ, จีน, อังกฤษ, ฝรั่งเศส, เยอรมัน, อิตาลี, ญี่ปุ่น, เกาหลี, โปรตุเกส, รัสเซีย และสเปน เสียงถูกสร้างขึ้นร่วมกับภาพที่ 32 kHz สเตอริโอ แทนที่จะพากย์ทีหลัง ซึ่งเป็นสาเหตุที่การเคลื่อนไหวปากคงที่ตลอดทั้งบรรทัดแทนที่จะเป็นแค่สองสามพยางค์แรก เขียนบรรทัดภาษาญี่ปุ่นลงในพรอมต์โดยตรงเป็นภาษาญี่ปุ่น
ฉันสามารถใช้ภาพอ้างอิงกี่ภาพเพื่อให้ตัวละครอนิเมะคงที่?
MiniMax H3 รับได้สูงสุด 9 ภาพ, สูงสุด 3 คลิปวิดีโอ และสูงสุด 3 คลิปเสียง โดยมีเพดานแข็งที่ 12 ไฟล์จากทุกประเภท จุดสิ้นสุด reference-to-video ของ Veo 3.1 รับได้ 1 ถึง 3 ภาพ และการเลือกมันทำให้ duration ลดลงเหลือ 8 เป็นค่าเดียวที่ถูกต้อง สำหรับตัวละครอนิเมะที่เกิดซ้ำในซีรีส์ ความแตกต่างนั้นคือเกมทั้งหมด
MiniMax H3 มีน้ำหนักโอเพนซอร์ส ฉันสามารถรันไปป์ไลน์อนิเมะของฉันในเครื่องได้ฟรีหรือไม่?
คุณสามารถดาวน์โหลดและรันได้ โดยมีข้อแม้สามประการ การอนุมานที่โฮสต์เองรันที่ขอบสั้น 768 และขั้นตอน Context-IR และ Regenerate-2K ที่ผลิต 2K ยังคงอยู่ฝั่ง API ความเร็วในโลกจริงบนเครื่องของคุณเองจะแตกต่างกันไปตามการ์ด: ประมาณ 10 นาทีสำหรับคลิป 480p 10 วินาทีบน 4070 Ti Super, ประมาณ 3 นาทีบน 5080, ประมาณ 68 วินาทีบน RTX 6000 Pro ตามกระทู้ ComfyUI วันแรก และใบอนุญาตชุมชนไม่ครอบคลุมสหภาพยุโรป สหราชอาณาจักร เกาหลีใต้ หรือสหรัฐอเมริกาในปัจจุบัน ดังนั้นหากคุณอยู่ในหนึ่งในนั้น คุณต้องมีใบอนุญาตทางการก่อนใช้เชิงพาณิชย์






