Seedance 2.5 ใช้งานได้แล้ววันนี้ — ที่แรกบน Atlas Cloud

MiniMax H3 เครื่องสร้างวิดีโออนิเมะ: 15 วินาที, 4:3, และการ์ดชื่อเรื่อง Veo 3.1 ที่พลาด

ตัวสร้างวิดีโออนิเมะ MiniMax H3 เปรียบเทียบกับ Veo 3.1 บนคีย์เฟรมเดียวกัน H3 ทำงานตั้งแต่ 4 ถึง 15 วินาทีและมีอัตราส่วนหกแบบ ส่วน Veo จำกัดที่ 8 วินาทีและสองแบบ บทสนทนาภาษาญี่ปุ่น, 9 รีเฟอเรนซ์, การรันจริง

ตลอดฤดูร้อน ฟีดของฉันมีแต่ video เดียวกันที่วนซ้ำ นักเตะฟุตบอลโลกถูกวาดใหม่เป็นตัวเอกสไตล์โชเน็น เผด็จการ กัปตันโจรสลัด เมนเทอร์หนวดเคราโผล่มาแค่สี่วินาทีสุดท้าย วิดีโอแต่ละโพสต์มีคนดูเป็นล้าน และเนื้อเรื่องก็อัปเดตหลังเกือบทุกนัด

คนที่ทำวิดีโอพวกนั้นไม่ได้กำลังเขียนโพสต์ benchmark พวกเขาแค่เลือกโมเดล เผา credits แล้วปล่อยวิดีโอก่อนเตะบอลครั้งถัดไป

ผมเลยหยิบ anime keyframe มาหนึ่งภาพ พร้อม prompt หนึ่งอัน แล้วทดสอบ MiniMax H3 ในฐานะแอนิเมชั่นวิดีโอเจเนอเรเตอร์เทียบกับ Veo 3.1 โดยปรับทั้งคู่ให้สูงสุดในการตั้งค่าเดียวกันกับอินพุตที่เหมือนกัน

สิ่งแรกที่พังไม่ใช่คุณภาพภาพ มันคือ dropdown Veo 3.1 หยุดที่ 8 วินาทีและให้อัตราส่วนภาพแค่สองแบบ ภาพช็อตที่โฟกัสใบหน้า แพนกล้องตามลูกบอล แล้วให้ title card ลงจอด ไม่พอดีกับ 8 วินาที มันไม่มีโอกาสที่จะล้มเหลวในเรื่องคุณภาพด้วยซ้ำ

ประเด็นสำคัญ

  • duration enum ของ Veo 3.1 คือ [4, 6, 8] และ aspect_ratio enum คือ [16:9, 9:16] ส่วน MiniMax H3 รองรับทุกวินาทีเต็มตั้งแต่ 4 ถึง 15 และมี 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 การไม่มี 4:3 บน Veo หมายความว่าไม่มีเฟรม OVA แนวเรโทรเลย
  • การ์ดโมเดลของ H3 แสดงรายชื่อภาษาที่รองรับบทสนทนาพื้นเมือง 11 ภาษา และภาษาญี่ปุ่นเป็นหนึ่งในนั้น เสียงและภาพถูกสร้างร่วมกันที่สเตอริโอ 32 kHz ไม่ใช่การพากย์เสียงทีหลัง
  • Reference packs ไม่เท่ากัน: H3 รับภาพได้ถึง 9 ภาพ บวกวิดีโอสูงสุด 3 ไฟล์และคลิปเสียง 3 ไฟล์ (รวมสูงสุด 12 ไฟล์) ส่วน endpoint reference ของ Veo 3.1 รับได้ 3 ภาพ และทันทีที่คุณใช้มัน duration จะลดเหลือแค่ [8] เท่านั้น
  • กับดักสองอย่างที่ทำให้การทดสอบพังเงียบ ๆ: API ของ Veo ตั้งค่า generate_audio เป็น false และ resolution เป็น 720p โดยค่าเริ่มต้น ส่วน text-to-video ของ H3 ตั้งค่า ratio เริ่มต้นเป็น 1:1 ปล่อยไว้แบบนั้นคุณจะเปรียบเทียบคลิปเงียบ 720p กับคลิปสี่เหลี่ยมจัตุรัส
  • Veo 3.1 มีสองสิ่งที่ H3 ไม่มีเลย: seed และ negative_prompt สำหรับอนิเมะ 2D อย่างที่สองนี่สำคัญจริง และผมจะแสดงให้เห็นว่าที่ไหน

MiniMax H3 Anime Video Generator vs Veo 3.1 เฟรมเดียวกัน เปรียบเทียบกัน

ตัวละครต้นฉบับหนึ่งตัว Keyframe หนึ่งภาพ Prompt หนึ่งอัน คัดลอกทีละตัวอักษรลงในทั้งสองโมเดล ส่วนอื่น ๆ ปรับสูงสุดทั้งสองฝั่ง

MiniMax H3, image-to-video, 2K, 8 วินาที, เสียงในตัว เปิดเสียงดู: เสียงฝูงชน เสียงตีลูกบอล และเสียงตะโกนภาษาญี่ปุ่นถูกสร้างขึ้นในพาสเดียวกับภาพ สร้างด้วย minimax/h3/image-to-video บน Atlas Cloud

Veo 3.1, image-to-video, 1080p, 8 วินาที, generateaudio เปิดเองด้วยมือ พร้อม negativeprompt ที่ช่วยให้เส้นอาร์ตเรียบ เฟรมแรกเดียวกัน คำเดียวกัน สร้างด้วย google/veo3.1/image-to-video บน Atlas Cloud

ทั้งคู่วาดออกมาสวยงาม ภาพ Wide shot ของ Veo ขณะตีลูกบอล มีเส้นแรงกระแทกที่วาดด้วยมือและเอฟเฟกต์เสียงมังงะลอยอยู่ในอากาศ สวยงามจริง ๆ นั่นคือจุดเริ่มต้นที่ซื่อสัตย์ และเป็นเหตุผลว่าทำไมบทความที่เหลือจะพูดถึงพารามิเตอร์และการทำตามคำสั่ง มากกว่าความรู้สึกลอย ๆ

ทำไมการทดสอบ MiniMax H3 Anime Video Generator เทียบกับ Veo 3.1 ส่วนใหญ่ถึงผิดพลาด

สองสิ่งเกิดขึ้นพร้อมกันในฤดูร้อนนี้

อนิเมะกลายเป็นรูปแบบที่มีปริมาณมากที่สุดใน AI video ฟุตบอลโลก 2026 ถูกเขียนใหม่เป็นทัวร์นาเมนต์โชเน็น โดยมีผู้เล่นรับบทเป็นเผด็จการ กัปตันโจรสลัด นายพลนาวิกโยธิน และเมนเทอร์ โดยมีเนื้อเรื่องที่ "พัฒนาเกือบทุกนัด" ทั่ว TikTok, Instagram, X และ YouTube (Complex, กรกฎาคม 2026)

และ MiniMax H3 ก็ปล่อย Open Weights ออกมา กระทู้ ComfyUI ในวันแรกทำคะแนนถึง 330 แต้มและ 95 ความคิดเห็น โดยมีคนโพสต์ตัวเลขจริงในเครื่องภายในไม่กี่ชั่วโมง (Hacker News, สิงหาคม 2026)

เมื่อรวมสองอย่างนี้ คุณคงคาดว่าจะมีการเปรียบเทียบอนิเมะมากมาย แต่แทบไม่มีเลย เพราะการทดสอบส่วนใหญ่ถูกสร้างผิดในสี่วิธี

พวกเขาเปรียบเทียบภาพ ไม่ใช่ข้อจำกัด ภาพช็อตอนิเมะคือเรื่องของจังหวะเวลา การแพนกล้องเข้าสู่ title card เป็นปัญหาด้านระยะเวลาก่อนที่จะเป็นปัญหาด้านการเรนเดอร์

พวกเขาลืมไปว่า API ของ Veo เงียบโดยค่าเริ่มต้น บน API generate_audio เป็น false และ resolution เป็น 720p มีโพสต์มากมายที่บอกว่า "Veo ไม่มีเสียงในอนิเมะ" เป็นแค่คนที่ไม่เคยเปลี่ยน boolean

พวกเขาลืมไปว่า text-to-video ของ H3 เป็นสี่เหลี่ยมจัตุรัสโดยค่าเริ่มต้น ratio เริ่มต้นเป็น 1:1 ไม่ใช่ 16:9 รัน t2v anime prompt โดยไม่ตั้งค่าและคุณจะได้คลิปสี่เหลี่ยมกับข้อสรุปที่สับสน

พวกเขาทดสอบด้วยโพรเม็ตภาพเสมือนจริง "Cinematic, volumetric light, shallow depth of field" เป็นคำศัพท์ที่ดึงโมเดล 2D ไปสู่การแรเงาแบบ 3D render พอดี ความล้มเหลวในอนิเมะไม่ใช่ภาพเบลอ มันคือความเป็นพลาสติก

การตั้งค่าสามอย่างที่ตัดสินการทดสอบอนิเมะก่อนที่คุณจะกดรัน

ก่อนอื่น ตั้งค่าสิ่งเหล่านี้ทั้งสองฝั่ง มิฉะนั้นการเปรียบเทียบจะเป็นโมฆะ

การตั้งค่าMiniMax H3Veo 3.1จะเกิดอะไรขึ้นถ้าข้าม
เสียงสร้างพร้อมภาพ เปิดตลอดgenerate_audio ค่าเริ่มต้นเป็น falseVeo จะให้คลิปเงียบและดูแย่กว่าที่ควร
รูปร่างเฟรมratio ค่าเริ่มต้นเป็น 1:1 สำหรับ text-to-videoaspect_ratio ค่าเริ่มต้นเป็น 16:9H3 จะส่งคลิปอนิเมะสี่เหลี่ยมที่คุณใช้ไม่ได้
ความละเอียดค่าเริ่มต้นเป็น 2Kค่าเริ่มต้นเป็น 720pคุณเปรียบเทียบ 2K กับ 720p แล้วเรียกมันว่าช่องว่างคุณภาพ

MiniMax H3 vs Veo 3.1 Anime Spec Sheet: ความยาว, อัตราส่วน, เสียง, การอ้างอิง

ผมดึงสคีมาอินพุตสดของทั้งสองโมเดล แทนที่จะเชื่อถือโพสต์เปิดตัวใด ๆ ค่าทุกค่าด้านล่างเป็น enum ที่คุณสามารถอ่านได้เองบนหน้าโมเดล ไม่ใช่ความประทับใจ

ตารางที่ 1: MiniMax H3 vs Veo 3.1 พารามิเตอร์ที่ตัดสินภาพช็อตอนิเมะ

MiniMax H3Veo 3.1
Duration4 ถึง 15 ทุกวินาทีเต็ม (ค่าเริ่มต้น 8)4, 6, 8 (ค่าเริ่มต้น 8)
Aspect ratios21:9, 16:9, 4:3, 1:1, 3:4, 9:1616:9, 9:16
ค่าเริ่มต้น ratio (text-to-video)1:0116:09
Resolution768P, 2K (ค่าเริ่มต้น 2K)720p, 1080p, 4k (ค่าเริ่มต้น 720p)
เสียงสร้างร่วมกัน สเตอริโอ 32 kHzgenerate_audio ค่าเริ่มต้น false
ภาษาที่รองรับบทสนทนาพื้นเมือง11 ภาษาที่เสถียร รวมภาษาญี่ปุ่นไม่ได้เผยแพร่เป็นรายการที่เสถียร
Reference packมากถึง 9 ภาพ, 3 วิดีโอ, 3 คลิปเสียง, รวม 12 ไฟล์3 ภาพ
Duration เมื่อใช้ referenceยังคง 4 ถึง 15ลดเหลือแค่ 8 เท่านั้น
seedไม่มีมี
negative_promptไม่มีมี
Weightsดาวน์โหลดได้ปิด

ระยะเวลา อัตราส่วน ความละเอียด เสียง และขีดจำกัดการอ้างอิง อ่านจากสคีมาสดบนหน้า MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video และ Veo 3.1 reference-to-video ขีดจำกัดภาพ 9 ภาพและ 12 ไฟล์ และรายการบทสนทนา 11 ภาษา มาจาก MiniMax H3 model card (Hugging Face, สิงหาคม 2026)

ตอนนี้เป็นสกอร์บอร์ด เพราะมันบอกอะไรที่แตกต่างจากสเปกชีต และทั้งสองอย่างก็สำคัญ

ตารางที่ 2: Crowd-vote Elo และราคาต่อนาที ข้อมูล ณ 7 สิงหาคม 2026

ModelText-to-video (พร้อมเสียง)Image-to-video (พร้อมเสียง)$/นาที
Gemini Omni Flash1,244 (#1) ±71,191 (#2) ±9$6.00
MiniMax H31,238 (#2) ±91,190 (#3) ±10$7.80
Dreamina Seedance 2.0 720p1,224 (#3) ±61,198 (#1) ±7$9.07
Kling 3.0 1080p (Pro)1,111 (#7) ±6ไม่ติดอันดับ top 10$20.16
Veo 3.11,093 (#11) ±71,085 (#10) ±7$24.00
Veo 3.1 Fast1,091 (#14) ±6ไม่ติดอันดับ top 10$9.00
Veo 3.1 Lite1,089 (#15) ±7ไม่ติดอันดับ top 10$4.80

Elo และราคาจาก Artificial Analysis Video Arena (Artificial Analysis, สิงหาคม 2026) คะแนนเหล่านี้เป็นคะแนนโหวตจากผู้ใช้จำนวนมากและเปลี่ยนแปลงได้ คอลัมน์ $/นาที เป็นค่าประมาณแบบจำลองที่ปรับมาตรฐาน ไม่ใช่ใบแจ้งหนี้ของคุณ

ช่องว่าง Elo 145 คะแนนใหญ่ แต่เป็นคะแนนโหวตทั่วไป ไม่ใช่คะแนนโหวตเฉพาะอนิเมะ และนี่คือส่วนที่ผมต้องพูดตรง ๆ: MiniMax ไม่ได้ทำการตลาด H3 ว่าเป็นโมเดลอนิเมะ คำติชมภายในระดับแรก ๆ ระบุว่าภาพยนตร์ แอนิเมชัน และดราม่าแนวการ์ตูนเป็นพื้นที่ที่ H3 ไม่ได้ มุ่งเป้า ดังนั้นคำถามที่น่าสนใจไม่ใช่ "อันไหนคือโมเดลอนิเมะ" แต่เป็นว่าทำไมโมเดลที่ไม่ได้ขายตัวเองในด้านอนิเมะถึงยังชนะในภาพช็อตนั้น และที่ Google ยังคงคว้าชัยในรอบนั้น

หมายเหตุเชิงปฏิบัติก่อนบทช่วยสอน ทุกโมเดลด้านล่างทำงานผ่านคอนโซลเดียวกันและคีย์ API เดียวกัน ซึ่งเป็นเหตุผลเดียวที่พารามิเตอร์เทียบเคียงกันได้เลย คิวเดียวกัน การยืนยันตัวตนเดียวกัน ใบเรียกเก็บเงินเดียว ถ้าคุณตั้งค่า GPT Image 2 ในบริการหนึ่งและ Veo ในอีกบริการหนึ่ง ครึ่งหนึ่งของความแตกต่างที่คุณพบจะเป็นเรื่องของระบบท่อ ไม่ใช่โมเดล

สร้างภาพช็อต: MiniMax H3 vs Veo 3.1 ทีละขั้นตอน

ตัวอย่างรันเดียว ตั้งแต่ต้นจนจบ "Last Whistle": กองหน้าวัยรุ่นต้นฉบับ ผมสีแดง ชุดขาว-นำ้เงินเบอร์ 9 ไฟสนามกีฬา การแพนกล้องตามลูกบอล และ title card ภาษาญี่ปุ่นที่ต้องลงจอดในสองวินาทีสุดท้ายและนิ่ง

ไม่มีผู้เล่นจริง ไม่มีตัวละครทางการ ไม่มี IP อนิเมะที่มีอยู่ แค่สไตล์และ homage เพิ่มเติมว่าเหตุใดในภายหลัง

ขั้นตอนที่ 1: ออกแบบ anime keyframe ด้วย GPT Image 2

Keyframe นำทิศทางอาร์ตมาให้ ดังนั้นโมเดลวิดีโอไม่ต้องคิดขึ้นมาเอง สังเกตพื้นที่ว่างทางซ้ายหนึ่งในสาม: มันตั้งใจไว้ Title card จะถูกเขียนตรงนั้นโดยโมเดลวิดีโอ และนั่นคือการทดสอบความเสถียรของข้อความ

Plain
1A single frame from a modern shonen sports anime. Cel-shaded 2D animation, hand-inked
2line art with consistent line weight, flat colour fills, hard-edged graphic shadows,
3absolutely no 3D shading and no photoreal skin. Close-up on an original teenage striker:
4messy dark-red hair, white-and-navy kit with the number 9, sweat and grass streaks across
5one cheek, eyes wide with exhausted determination, mouth open mid-shout. Behind him,
6stadium floodlights blaze into a wall of blurred crowd colour; radial speed lines burst
7from the centre of frame; one blade of grass hangs frozen in the air. Saturated palette,
8deep cyan shadows, warm orange rim light. 16:9 composition, the character framed right of
9centre, clean negative space on the left third. No text anywhere in the image.

การตั้งค่า: model openai/gpt-image-2/text-to-image, quality high, size 16:9 (2048x1152) ไม่มีอะไรอื่น

อินเทอร์เฟซ AI image generator แสดงโพรเม็ตและภาพนักเตะอนิเมะที่สร้าง

GPT Image 2 playground บน Atlas Cloud พร้อมโพรเม็ต Last Whistle keyframe และเฟรมอนิเมะที่เสร็จแล้วในแผงผลลัพธ์

GPT Image 2 บน Atlas Cloud: ตั้งค่า quality เป็น high, keyframe ที่เสร็จแล้วทางด้านขวา

นักเตะอนิเมะผมแดงตะโกนในสนามกีฬาที่มีผู้คนหนาแน่น

Keyframe อนิเมะพื้นฐาน: กองหน้าผมแดงต้นฉบับกำลังตะโกนกลางสนามภายใต้ไฟสปอร์ตไลท์ เซลเฉดสีแบน พร้อมเส้นความเร็ว

Keyframe ที่ทั้งสองโมเดลได้รับ สีแบน เงาคม และพื้นที่ว่างหนึ่งในสามซ้ายที่รอ title card

ขั้นตอนที่ 2: MiniMax H3 image-to-video ปรับทุกอย่างสูงสุด

ภาพเดียวกันเข้า 2K ออก ผมจำกัด H3 ให้เหลือ 8 วินาทีที่นี่เพื่อให้ตรงกับเพดานของ Veo เท่านั้น ไม่ใช่ขีดจำกัดของ H3 และขั้นตอนที่ 4 จะปลดล็อก

Plain
1Cel-shaded 2D anime, hand-inked line weight, flat colour, no 3D shading. Hold on the
2striker's face for one beat, then a violent whip pan follows the ball as he strikes it,
3the pan smearing the frame into streaked sakuga motion trails. One frame of total silence
4at impact. Over the final two seconds, bold white Japanese title lettering reading
5ラストホイッスル punches onto the left third of frame and holds rock-steady, no warping,
6no flicker, no drift. The striker shouts one line in Japanese: 「まだ終わってない!」
7Audio: stadium roar swelling, a single sharp ball-strike impact, a low taiko hit under the
8title card.

การตั้งค่า: model minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (image-to-video ใช้รูปร่างเฟรมจากภาพอินพุตของคุณ), image = ผลลัพธ์จากขั้นตอนที่ 1

คำเตือนหนึ่งถ้าคุณเปลี่ยนไปใช้ text-to-video แทน: เขียน ratio: 16:9 อย่างชัดเจน ค่าเริ่มต้นคือ 1:1 และมันจะส่งคลิปอนิเมะสี่เหลี่ยมให้คุณอย่างมีความสุข

อินเทอร์เฟซ AI video generator แสดงโพรเม็ตข้อความและวิดีโออนิเมะที่สร้าง

MiniMax H3 image-to-video playground บน Atlas Cloud พร้อมโพรเม็ต Last Whistle โหลด keyframe และคลิปที่เสร็จแล้วในแผงผลลัพธ์

MiniMax H3 image-to-video บน Atlas Cloud: keyframe ขั้นตอนที่ 1 โหลดทางซ้าย คลิปที่เสร็จแล้วกำลังเล่นทางขวา

ขั้นตอนที่ 3: Veo 3.1 image-to-video เปิดเสียงด้วยมือ

โพรเม็ตเหมือนกันทุกคำ เปลี่ยนคำคุณศัพท์แม้แต่คำเดียว มันก็ไม่ใช่การเปรียบเทียบอีกต่อไป สิ่งที่เปลี่ยนคือฟิลด์พิเศษที่ Veo ให้คุณและ H3 ไม่มี

negative_prompt ซึ่งสำหรับอนิเมะ 2D เป็นคอนโทรลที่มีประโยชน์ที่สุดในรายการนี้:

Plain
13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur
2soup, warped lettering, gibberish text, extra fingers, subtitle bar

การตั้งค่า: model google/veo3.1/image-to-video, resolution: 1080p (เปลี่ยนเลย ค่าเริ่มต้นคือ 720p), duration: 8 (นี่คือเพดาน), aspect_ratio: 16:9, generate_audio: true (ค่าเริ่มต้น API คือ false นี่คือกับดักคลิปเงียบ), seed: 20260807, image = ผลลัพธ์ขั้นตอนที่ 1 เดียวกัน

อินเทอร์เฟซ AI video generator แสดงการตั้งค่าอินพุตและวิดีโออนิเมะที่สร้าง

Veo 3.1 image-to-video playground บน Atlas Cloud แสดง generate audio เปิดอยู่ โหลด keyframe อนิเมะ และคลิปที่เสร็จแล้วในแผงผลลัพธ์

Veo 3.1 image-to-video บน Atlas Cloud โดยเปิด Generate Audio และคลิปที่เสร็จแล้วทางขวา

ขั้นตอนที่ 4: ให้คะแนนตามห้าแกนเฉพาะอนิเมะ

ไม่มีอะไรต้องสร้าง แค่ดู ตามสิ่งที่อนิเมะมักพัง คลิปทั้งสองฝังอยู่ใกล้ต้นบทความนี้ ดังนั้นคุณสามารถให้คะแนนด้วยตัวเองแทนที่จะเชื่อคำพูดผม

การเปรียบเทียบฉากสนามฟุตบอลแบบเบลอและคมชัดแบบเคียงข้างกัน

การเปรียบเทียบเฟรมสุดท้ายของทั้งสองคลิป MiniMax H3 ทางซ้ายมีตัวอักษร title card ภาษาญี่ปุ่นที่ชัดเจน Veo 3.1 ทางขวามีตัวอักษรแนวตั้งที่ไม่เป็นคำ

เฟรมสุดท้ายของแต่ละคลิป ด้านซ้าย H3 เขียน ラストホイッスル คาตาคานะทั้งแปดตัวถูกต้องและนิ่งสนิท ด้านขวา Veo 3.1 เขียนตัวอักษรสามตัวที่ไม่ใช่คำที่ขอ และไม่ใช่คำใด ๆ

Title card คือจุดที่ตัดสินรอบ และมันไม่สูสีกัน H3 เรนเดอร์คาตาคานะที่ขอไว้อย่างถูกต้อง คมและคงที่ บนพื้นหลังแพนกล้องเบลอของประตู Veo 3.1 สร้างตัวอักษรสามตัวเรียงแนวตั้งที่ไม่ใช่ทั้งคำที่ขอและไม่ใช่คำใด ๆ ในเฟรมเดียวกัน มันยังทำให้ตัวละครหลุดออกจากเฟรมและปล่อยให้พื้นหลังเลื่อนไปทางภาพสนามกึ่งเสมือนจริง แม้จะมี photorealistic skin และ 3D render อยู่ใน negative prompt

ตารางที่ 3: ห้าแกนที่ตัดสินภาพตัดอนิเมะ จากการรันสองครั้งนี้

แกนMiniMax H3Veo 3.1
ความต่อเนื่องของตัวละครจาก keyframeคงใบหน้า ผม และชุดที่แน่นอนตลอด 8 วินาทีวาดตัวละครใหม่ใน wide shot ใหม่ ตรงโมเดลแต่เป็นภาพวาดอื่น
น้ำหนักเส้นและการแรเงาเซลแบนคงเดิม ไม่เลื่อนไปทาง 3Dคงเดิมในภาพ mid shot แต่เลื่อนไปทางภาพถ่ายสนามกีฬาเมื่อจบ
Title card ภาษาญี่ปุ่นラストホイッスル เรนเดอร์ถูกต้องและคงที่ตัวอักษรสามตัว ไม่ใช่คำที่ขอ ไม่ใช่คำใด ๆ
แทร็กเสียงที่ส่งออกสเตอริโอ 32 kHz ตรงตามที่การ์ดโมเดลระบุสเตอริโอ 48 kHz มีอยู่เพราะผมตั้งค่า generate_audio เอง
Whip pan และ sakuga smearดำเนินการเป็นแพนกล้องเบลอเข้าสู่ titleถูกแทนที่ด้วยการตัดแบบ hard cut ไปยังฉากใหม่

แถวสุดท้ายนั้นคือคำวิจารณ์สาธารณะที่ดังที่สุดของ H3 จนถึงตอนนี้ ซึ่งเป็นเหตุผลว่าทำไมผมถึงเขียนมันลงในโพรเม็ตทั้งสองอัน ในกระทู้ ComfyUI วันแรก ผู้ใช้ fwip บ่นว่าแม้แต่โพรเม็ตตัวอย่างทางการก็ถูกเมิน: "a violent WHIP PAN off the rooftop that SMEARS the floating words away with it, motion-streaked. And the video just didn't do any of that transition at all, it just replaced it with a cut."

ในการรันนี้ Veo ต่างหากที่เปลี่ยนแพนเป็นการตัด และ H3 ที่ทำ smear หนึ่งเทคต่อข้างไม่ใช่คำตัดสิน และผมจะไม่บอกว่ามันเป็นอย่างนั้น แต่มันหมายความว่าคำวิจารณ์ไม่ได้เฉพาะเจาะจงกับ H3: whip pans เป็นคำสั่งที่เชื่อถือได้น้อยที่สุดในการทดสอบทั้งหมดนี้ทั้งสองฝั่ง ถ้าสตอรีบอร์ดของคุณขึ้นอยู่กับมัน ให้วางสตอรีบอร์ดรอบ ๆ มัน แทนที่จะผ่านมัน

ขั้นตอนที่ 5: ภาพตัด OVA แนวเรโทร 4:3 ที่ Veo 3.1 ไม่สามารถสร้างได้ตามโครงสร้าง

นี่ไม่ใช่ความชอบด้านคุณภาพ มันคือกำแพง aspect_ratio enum ของ Veo มีสองค่า และไม่มี 4:3 และ duration enum ของมันไม่มี 12 ลุค OVA ยุค 90s ไม่สามารถเข้าถึงได้เลย

Plain
1A 1990s OVA anime cut, 4:3 full-frame. Hand-painted background art with visible brush
2texture, cel-paint characters with thick uneven ink lines, heavy halation glow around the
3floodlights, 16mm film grain and faint gate weave. The same red-haired striker in a
4white-and-navy number 9 kit walks off a rain-soaked pitch as the crowd noise fades to a
5single ringing tone. Camera pushes in slowly on his face. He says quietly in Japanese:
6「次は、勝つ」. Retro palette: muted teal, dusty amber, deep maroon shadows. Audio:
7distant rain, a lone analogue synth pad, one reverb-heavy whistle in the far distance.

การตั้งค่า: model minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3 ตั้งค่า ratio ด้วยมือ จำค่าเริ่มต้นไว้

อินเทอร์เฟซ AI video generator แสดงโพรเม็ตข้อความและวิดีโออนิเมะที่สร้าง

MiniMax H3 text-to-video playground บน Atlas Cloud พร้อมโพรเม็ต OVA ที่พิมพ์และคลิปเรโทรที่เสร็จแล้วในแผงผลลัพธ์

MiniMax H3 text-to-video บน Atlas Cloud พิมพ์โพรเม็ต OVA คลิปเสร็จสมบูรณ์ ต้องบอกตามตรงว่า การรันนี้โดยเฉพาะปล่อย Aspect Ratio ไว้ที่ 16:9 และ Duration ที่ 8 ดังนั้นสิ่งที่คุณเห็นทางขวาคือเวอร์ชันสั้นจอกว้าง ภาพตัด 4:3 สิบสองวินาทีด้านล่างมาจากการเรียก API ที่ตั้งค่า ratio: 4:3 และ duration: 12 อย่างชัดเจน

นักเตะอนิเมะในชุดสกปรกยืนอยู่ในสนามกีฬา

ภาพตัด OVA 4:3 แนวเรโทร: กองหน้าคนเดียวกันเดินออกจากสนามที่เปียกฝนในสไตล์อนิเมะยุค 90s

H3 text-to-video, 4:3, 12 วินาที ไฟล์ที่ส่งกลับมาเป็น 1920x1440 ซึ่งเป็น 4:3 พอดีเป๊ะ พร้อมแทร็กเสียงสเตอริโอ 32 kHz แสดงที่นี่เป็น GIF เงียบที่อัตราเฟรมลดลงเพื่อให้หน้ากระดาษเบา สร้างด้วย minimax/h3/text-to-video บน Atlas Cloud

ขั้นตอนที่ 6: ภาพอ้างอิงเก้าภาพ ตัวละครหนึ่งตัว สี่ภาพตัด

ความสม่ำเสมอของตัวละครข้ามช็อตเป็นปัญหาที่ยากที่สุดใน AI อนิเมะ และมันแก้ได้ด้วยปริมาณการอ้างอิง สร้างแพ็คก่อน: รันโพรเม็ตขั้นตอนที่ 1 อีกครั้งโดยเปลี่ยนเฟรมเป็นด้านหน้า สามในสี่ส่วน โปรไฟล์เต็ม ด้านหลัง หัวเราะ กัดฟัน ท่ายืนเต็มตัว รายละเอียดชุด และรายละเอียดรองเท้า เก้าภาพ รวมประมาณแปดเซ็นต์

ภาพประกอบสี่ภาพของนักเตะอนิเมะผมแดงสวมเบอร์ 9

สี่มุมของตัวละครกองหน้าต้นฉบับคนเดียวกันที่สร้างเป็น reference pack จัดเรียงในตารางสองต่อสอง

สี่ในเก้ามุมอ้างอิง H3 รองรับภาพได้ถึงเก้าภาพใน reference pack เดียว พร้อมวิดีโอและเสียงอ้างอิงเพิ่มเติม

Plain
1Cel-shaded 2D anime, consistent hand-inked line weight, flat colour, no 3D shading. Keep
2the referenced striker's face, hair silhouette and number 9 kit identical across every cut.
3Four cuts in one continuous take: (1) low-angle push-in on his boots hitting the turf,
4(2) whip-pan up to a tight close-up of his eyes, (3) wide shot of him sprinting past three
5defenders drawn as blurred silhouettes, (4) freeze on a mid-air header, speed lines
6exploding outward. Audio: crowd roar, breath, boot-on-turf impacts, one taiko hit on the
7freeze.

การตั้งค่า: model minimax/h3/reference-to-video, refers = ภาพของคุณที่มี type: image, resolution: 2K, duration: 8 หรือสูงกว่า, ratio: adaptive หรือ 16:9

ค่าเทียบเท่าของ Veo 3.1 ไม่สามารถรันด้วยการตั้งค่าเหล่านี้ได้ และคุณไม่จำเป็นต้องลองเพื่อรู้ว่าทำไม endpoint reference ของมันรับภาพได้สูงสุดสามภาพ และการเลือก endpoint นั้นทำให้ duration ลดเหลือค่าเดียวที่ถูกต้องคือ 8 แพ็คเก้าภาพและการถ่ายสิบวินาทีนั้นอยู่นอกขอบเขตทั้งคู่

อินเทอร์เฟซ AI video generator แสดงอินพุตโพรเม็ตและวิดีโออนิเมะที่สร้าง

MiniMax H3 reference-to-video playground บน Atlas Cloud แสดงตัวนับการอ้างอิงที่สี่จากเก้า และภาพตัดแรกในแผงผลลัพธ์

MiniMax H3 reference-to-video บน Atlas Cloud ตัวนับอ่าน Reference Materials (4/9) โดยมี MAX:9 อยู่ข้างใต้ ซึ่งเป็นเพดานในอินเทอร์เฟซ ไม่ใช่การอ้างจากสเปกชีต ผลลัพธ์คือภาพตัดแรก การดันกล้องต่ำเข้าหารองเท้า

การรัน MiniMax H3 Anime Video Generator อีกสี่ครั้งที่ควรทำ

ภาพช็อต Last Whistle เน้นแค่สี่ความแตกต่าง การรันสี่ครั้งนี้เน้นส่วนที่เหลือ ทั้งหมดรันบน H3; หมายเหตุบอกว่าอันไหนที่ Veo 3.1 สามารถเทียบได้

  1. Ultrawide sakuga fight, 21:9 , 10 วินาที Veo ไม่สามารถสร้าง 21:9 ได้เลย
Plain
1Cel-shaded 2D anime action, thick tapered ink lines, flat colour, hard-edged shadows,
2no 3D shading. Two original masked duelists on a windswept temple roof at dusk. Blade
3clash, the frame shudders, both fighters break apart in a burst of hand-drawn impact
4frames and radial speed lines. Camera: low-angle push-in, then a lateral track, then a
5snap to a wide silhouette against the orange sky. Audio: two sharp metal clashes, cloth
6snap, a low taiko hit on the final freeze, no music.
  1. Beat-synced AMV cut, reference-to-video พร้อม audio reference H3 รับคลิปเสียงสูงสุดสามไฟล์เป็นอินพุตอ้างอิง Veo 3.1 ไม่มีอินพุตเสียงเลย มีแต่เอาต์พุตเสียง
Plain
1Cel-shaded 2D anime montage cut to the referenced audio track. Five short beats: rain on
2a window, a hand tightening a bandage, a city skyline flashing past a train window, a
3sprint start, a freeze on an outstretched hand. Every cut lands exactly on a downbeat of
4the referenced audio. Flat colour, thick ink lines, high-contrast night palette of deep
5indigo and neon magenta.
  1. ฉากสนทนาสองบรรทัดภาษาญี่ปุ่น, 12 วินาที นี่คือการทดสอบความเครียดเรื่องลิปซิงค์ และ 12 วินาทีก็อยู่นอกช่วงของ Veo อยู่แล้ว
Plain
1Cel-shaded 2D anime, flat colour, no 3D shading. Two original characters on a rooftop at
2golden hour, shot reverse shot. First says in Japanese:「本当に行くの?」. The second
3answers, half-smiling, in Japanese:「もう決めた」. Mouths match every syllable. Warm rim
4light, long shadows, gentle wind in hair. Audio: two distinct Japanese voices, distant
5traffic, one cicada.
  1. Vertical shonen short, 9:16 , 8 วินาที ทั้งสองโมเดลสามารถทำแนวตั้งได้ ดังนั้นนี่คือจุดเดียวที่ควร A/B จริง ๆ แทนที่จะเดา
Plain
1Cel-shaded 2D anime, vertical composition. An original teenage runner bursts through a
2paper banner in slow-motion, then the frame snaps back to full speed as she accelerates
3down a stadium straight. Speed lines, flat colour, hard shadows, bold graphic sky.
4Camera: low-angle follow shot, then a whip up to her face. Audio: banner tear, crowd
5surge, one breath held then released.

ถ้าคุณต้องการไวยากรณ์โพรเม็ตเบื้องหลังเหล่านี้ คู่มือโพรเม็ต MiniMax H3 เจาะลึกกว่าเกี่ยวกับวิธีที่ H3 แยกวิเคราะห์คำสั่งกล้องและเสียงมากกว่าที่ผมจะทำได้ที่นี่

ราคา 60 วินาทีของอนิเมะเปิดเรื่องบน MiniMax H3 vs Veo 3.1

OP อนิเมะมาตรฐานประมาณ 90 วินาที เรียกได้ว่าแปดช็อต ๆ ละ 8 วินาที รวม 64 วินาทีของวิดีโอที่เสร็จ แล้วบวก keyframe หนึ่งภาพต่อช็อตที่ $0.009 ต่อภาพ

มีความแตกต่างของราคาจริงที่คุณควรรู้ แทนที่จะให้ผมปิดบังไว้ แคตตาล็อก Atlas Cloud แสดง MiniMax H3 ที่ $0.10 ต่อวินาทีแบบแบน ในขณะที่ readme ของโมเดลแยกเป็น $0.14/วินาทีที่ 2K และ $0.10/วินาทีที่ 768P Veo 3.1 แสดงที่ $0.20 ต่อวินาที ในขณะที่ readme แยกเป็น $0.40/วินาทีพร้อมเสียง และ $0.20/วินาทีไม่มีเสียง

ปุ่มรันในภาพหน้าจอของผมยืนยันได้ H3 reference-to-video 8 วินาทีที่ 2K คิดราคา Run $1.12 ซึ่งเท่ากับ $0.14 ต่อวินาทีพอดี Veo 3.1 image-to-video 8 วินาทีที่ 1080p พร้อมเสียง คิดราคา Run $3.2 ซึ่งเท่ากับ $0.40 ต่อวินาทีพอดี ดังนั้นอัตรา readme คืออัตราที่เรียกเก็บจริง และหัวข้อแคตตาล็อกคือระดับเริ่มต้น ผมได้แสดงทั้งสองค่าด้านล่างอยู่แล้ว แต่ราคาเหล่านี้เป็นราคาป้าย ณ สิงหาคม 2026

ตารางที่ 4: แปดช็อต ๆ ละ 8 วินาที รวม keyframe

การตั้งค่าราคาวิดีโอ (อัตราแคตตาล็อก)ราคาวิดีโอ (อัตรา readme)Keyframesช่วงรวม
MiniMax H3, 2K$6.40$8.96$0.07$6.47 ถึง $9.03
MiniMax H3, 768P$6.40$6.40$0.07$6.47
Veo 3.1, 1080p พร้อมเสียง$12.80$25.60$0.07$12.87 ถึง $25.67
Veo 3.1 Lite, 720p$3.20$3.20$0.07$3.27

ราคาดึงมาจากหน้าโมเดล Atlas Cloud ที่เชื่อมโยงในตารางที่ 1 สิงหาคม 2026 ไม่มีราคาใดในสี่ราคานี้ที่ลดราคาอยู่ในตอนนี้

สองสิ่งที่ตารางนั้นไม่รวม และทั้งสองส่งผลกระทบหนักกว่าอัตราต่อวินาที

Retries ไม่มีใครส่งเทคแรกของภาพช็อตอนิเมะ ไม่ว่าคุณจะใช้ตัวคูณอะไร ใช้กับทั้งสองคอลัมน์ ช่องว่างจะกว้างขึ้นตามสัดส่วนเดียวกัน

Wall-clock และอันนี้ไปอีกทาง จับเวลาตั้งแต่ต้นจนจบเมื่อวันที่ 7 สิงหาคม 2026: H3 ที่ 2K 8 วินาที ใช้เวลา 447 วินาที ประมาณ 7.5 นาที H3 text-to-video ที่ 2K 12 วินาที ใช้เวลา 334 วินาที Veo 3.1 ที่ 1080p 8 วินาทีพร้อมเสียง ใช้เวลา 152 วินาที ไม่ถึงสามนาที Veo เร็วกว่าประมาณสามเท่าในการได้เทคแรกในที่นี่ และถ้าคุณกำลังทำซ้ำช็อตตอนตีสอง นั่นคือเงินจริง คิวเคลื่อนที่ ดังนั้นให้ถือว่าสิ่งเหล่านี้เป็นภาพรวมของบ่ายวันหนึ่ง ไม่ใช่สเปก แต่ใครก็ตามที่อ้าง "2 ถึง 3 นาที" สำหรับ H3 ที่ 2K กำลังอ้าง readme ไม่ใช่คิว การเปรียบเทียบ 2K กับ 768P ครอบคลุมว่าเมื่อไหร่ระดับสูงกว่าคุ้มกับนาทีที่เพิ่มขึ้น

สไตล์อนิเมะ Homage และสิ่งที่คุณสามารถเผยแพร่ได้จริง

ทุกอย่างในบทความนี้คือสไตล์และ homage ตัวละครต้นฉบับ ชุดต้นฉบับ ชื่อต้นฉบับ ไม่มีการสร้างหรือขอตัวละครอนิเมะทางการ และไม่มีการใช้ชื่อหรือภาพลักษณ์ของนักฟุตบอลจริง เทรนด์ฟุตบอลโลกถูกอ้างถึงเป็น รูปแบบ เพราะนั่นคือสิ่งที่มันมีประโยชน์

ความแตกต่างนั้นไม่ใช่ของตกแต่ง ถ้าคุณกำลังผลิตเนื้อหาสไตล์อนิเมะในเชิงพาณิชย์ "ในสไตล์ OVA ยุค 90s" กับ "ตัวละครเฉพาะนี้จากรายการเฉพาะนี้" เป็นวัตถุทางกฎหมายที่แตกต่างกัน และมีเพียงหนึ่งเดียวเท่านั้นที่เป็นธุรกิจ

ในเรื่อง open weights: H3 ดาวน์โหลดได้จริง และผู้คนรันมันในวันแรก ผู้แสดงความคิดเห็นคนหนึ่งรายงานว่า 10 นาทีสำหรับคลิป 480p 10 วินาทีบน 4070 Ti Super 16GB และคนอื่น ๆ โพสต์ว่า 3 นาทีบน 5080 และ 68 วินาทีบน RTX 6000 Pro แต่การโฮสต์เองจะรันที่ขอบสั้น 768; ขั้นตอน Context-IR และ Regenerate-2K ที่ผลิต 2K จะยังคงอยู่ฝั่ง API

ใบอนุญาตมีข้อแม้จริง ใบอนุญาตชุมชนไม่ครอบคลุมสหภาพยุโรป สหราชอาณาจักร เกาหลีใต้ หรือสหรัฐอเมริกาในขณะนี้ โดยอ้างถึงภูมิภาคที่ "กำลังพัฒนาหรือบังคับใช้กฎระเบียบที่เกี่ยวข้องกับ AI" ช่องทางการขอใบอนุญาตอย่างเป็นทางการเปิดอยู่ ซึ่งผู้แสดงความคิดเห็น HN คนหนึ่งสรุปว่า "คุณแค่ต้องสัญญาด้วยนิ้วก้อยว่าจะไม่ทำให้ดิสนีย์โกรธ แล้วพวกเขาจะส่งใบอนุญาตให้คุณ" ตลก และเป็นขั้นตอนการปฏิบัติตามที่คุณไม่สามารถข้ามได้ถ้าคุณอยู่ในหนึ่งในสี่ดินแดนนั้น บทความ open weights มีรายชื่อดินแดนทั้งหมด

คำถามที่พบบ่อย

MiniMax H3 เป็นอนิเมะวิดีโอเจเนอเรเตอร์ที่ดีเมื่อเทียบกับ Veo 3.1 หรือไม่?

สำหรับงานอนิเมะส่วนใหญ่ H3 ดีกว่า และสาเหตุหลักไม่ใช่เรื่องการเรนเดอร์ มันรันได้ 4 ถึง 15 วินาที ในขณะที่ Veo ทำได้แค่ 4, 6 หรือ 8 มันเสนออัตราส่วนภาพหกแบบรวมถึง 4:3 และ 21:9 ในขณะที่ Veo มีแค่สองแบบ มันระบุภาษาญี่ปุ่นเป็นหนึ่งใน 11 ภาษาที่รองรับบทสนทนาพื้นเมือง และมันรับภาพอ้างอิงได้เก้าภาพในขณะที่ Veo รับได้สาม Veo 3.1 ชนะในสถานการณ์เฉพาะ: เมื่อคุณต้องการ seed สำหรับการถ่ายซ้ำที่ reproducible หรือ negative_prompt เพื่อหยุดไม่ให้ช็อตเลื่อนไปทางการแรเงา 3D render H3 ไม่มีพารามิเตอร์ทั้งสองตัว ถ้าไปป์ไลน์ของคุณขึ้นอยู่กับตัวใดตัวหนึ่ง นั่นคือเหตุผลที่แท้จริงที่จะอยู่กับ Veo

Veo 3.1 สามารถสร้างอนิเมะในอัตราส่วน 4:3 หรือคลิป 15 วินาทีได้หรือไม่?

ไม่ได้ และไม่ใช่เพราะเหตุผลด้านสไตล์ aspect_ratio enum ของ Veo 3.1 มีแค่ 16:9 และ 9:16 และ duration enum มีแค่ 4, 6 และ 8 ไม่มีค่า 4:3 ให้เลือก และไม่มีวิธีขอ 12 หรือ 15 วินาที ถ้าสิ่งอ้างอิงของคุณคืออนิเมะทีวีหรือ OVA ยุค 90s การจัดเฟรมนั้นไม่สามารถเข้าถึงได้บน Veo และมีให้ใช้งานบน H3

ทำไมคลิปอนิเมะ Veo 3.1 ของฉันถึงกลับมาเงียบ?

เพราะ generate_audio มีค่าเริ่มต้นเป็น false บน API สวิตช์ใน playground ปกติเปิดอยู่แล้ว ดังนั้นปัญหานี้จะเกิดกับคนที่เรียก API โดยตรงเท่านั้น ตั้งค่า generate_audio: true อย่างชัดเจน ระหว่างนั้นตั้งค่า resolution ด้วย เพราะมันเริ่มต้นเป็น 720p แทนที่จะเป็น 1080p หรือ 4k ที่คุณอาจหมายถึง

MiniMax H3 รองรับบทสนทนาภาษาญี่ปุ่นและลิปซิงค์สำหรับอนิเมะหรือไม่?

ใช่ การ์ดโมเดลระบุ 11 ภาษาที่รองรับบทสนทนาที่เสถียร: อาหรับ จีน อังกฤษ ฝรั่งเศส เยอรมัน อิตาลี ญี่ปุ่น เกาหลี โปรตุเกส รัสเซีย และสเปน เสียงถูกสร้างร่วมกับภาพที่สเตอริโอ 32 kHz แทนที่จะพากย์ทีหลัง ซึ่งเป็นสาเหตุที่ทำให้จังหวะปากตรงกันตลอดทั้งบรรทัด แทนที่จะเป็นแค่สองสามพยางค์แรก เขียนบรรทัดภาษาญี่ปุ่นลงในโพรเม็ตเป็นภาษาญี่ปุ่นโดยตรง

ฉันสามารถใช้ภาพอ้างอิงได้กี่ภาพเพื่อให้ตัวละครอนิเมะคงเส้นคงวา?

MiniMax H3 รับภาพได้สูงสุด 9 ภาพ คลิปวิดีโอสูงสุด 3 คลิป และคลิปเสียงสูงสุด 3 คลิป โดยมีเพดานสูงสุด 12 ไฟล์รวมทุกประเภท Veo 3.1's reference-to-video endpoint รับภาพได้ 1 ถึง 3 ภาพ และการเลือกมันจะทำให้ duration ลดเหลือ 8 เป็นค่าเดียวที่ถูกต้อง สำหรับตัวละครอนิเมะที่เกิดซ้ำในซีรีส์ ความแตกต่างนั้นคือทุกสิ่ง

MiniMax H3 มี open weights ดังนั้นฉันสามารถรันไปป์ไลน์อนิเมะในเครื่องได้ฟรีหรือไม่?

คุณสามารถดาวน์โหลดและรันได้ โดยมีข้อแม้สามประการ การอนุมานที่โฮสต์เองจะรันที่ขอบสั้น 768 และขั้นตอน Context-IR และ Regenerate-2K ที่ผลิต 2K จะยังคงอยู่ฝั่ง API ความเร็วในเครื่องในโลกจริงแตกต่างกันมากตามการ์ด: ประมาณ 10 นาทีสำหรับคลิป 480p 10 วินาทีบน 4070 Ti Super ประมาณ 3 นาทีบน 5080 ประมาณ 68 วินาทีบน RTX 6000 Pro ตามกระทู้ ComfyUI วันแรก และใบอนุญาตชุมชนไม่ครอบคลุมสหภาพยุโรป สหราชอาณาจักร เกาหลีใต้ หรือสหรัฐอเมริกาในขณะนี้ ดังนั้นถ้าคุณอยู่ในหนึ่งในนั้น คุณต้องมีใบอนุญาตทางการก่อนใช้ในเชิงพาณิชย์

โมเดลล่าสุด

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด