Seedance 2.5 ใช้งานได้แล้ววันนี้ — ที่แรกบน Atlas Cloud

MiniMax H3 Anime Video Generator: 15 วินาที, 4:3, และ Title Card Veo 3.1 บกพร่อง

เครื่องมือสร้างวิดีโออนิเมะ MiniMax H3 เทียบกับ Veo 3.1 บนคีย์เฟรมเดียวกัน H3 รันได้ 4 ถึง 15 วินาทีและหกอัตราส่วน ส่วน Veo จำกัดที่ 8 วินาทีและสองอัตราส่วน บทสนทนาภาษาญี่ปุ่น, 9 รีเฟอเรนซ์, รันจริง

ตลอดฤดูร้อนนี้ ฟีดของฉันมีแต่คลิปวิดีโอเดิมๆ ที่เล่นวนซ้ำ นักเตะฟุตบอลโลกถูกวาดใหม่เป็นตัวเอกของอนิเมะโชเน็น เผด็จการ กัปตันโจรสลัด ที่ปรึกษาผู้ช่ำชองที่โผล่มาในสี่วินาทีสุดท้าย แต่ละโพสต์มีผู้ชมหลายล้านวิว และเนื้อเรื่องก็อัปเดตหลังจากเกือบทุกแมตช์

คนที่สร้างวิดีโอเหล่านั้นไม่ได้เขียนโพสต์วัดผลเปรียบเทียบโมเดล พวกเขาแค่เลือกโมเดล เผาเครดิต และปล่อยงานก่อนการแข่งขันนัดต่อไปจะเริ่มขึ้น

ผมเลยหยิบคีย์เฟรมอนิเมะหนึ่งภาพและพรอมต์หนึ่งอัน มาทดสอบ MiniMax H3 ในฐานะเครื่องสร้างวิดีโออนิเมะเทียบกับ Veo 3.1 โดยตั้งค่าสูงสุดทั้งคู่ป้อนอินพุตที่เหมือนกัน

สิ่งแรกที่พังไม่ใช่คุณภาพของภาพ แต่เป็นเมนูแบบเลื่อนลง Veo 3.1 หยุดที่ 8 วินาทีและมีอัตราส่วนภาพให้เลือกแค่สองแบบ ช็อตภาพใบหน้า ตามด้วยการแพนกล้องตามลูกบอล แล้วให้การ์ดไตเติ้ลปรากฏ ไม่สามารถใส่ใน 8 วินาทีได้ มันไม่มีโอกาสล้มเหลวในเรื่องคุณภาพตั้งแต่แรก

ประเด็นสำคัญ

  • ตัวแปร duration ของ Veo 3.1 มีค่าให้เลือกคือ [4, 6, 8] และ aspect_ratio มีค่าให้เลือกคือ [16:9, 9:16] ส่วน MiniMax H3 ใช้ได้ตั้งแต่ 4 ถึง 15 วินาที (ทีละวินาที) และมีค่า 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 การที่ Veo ไม่มี 4:3 หมายความว่าไม่มีทางสร้างเฟรมแบบ OVA ย้อนยุคได้เลย
  • การ์ดโมเดลของ H3 ระบุภาษาที่รองรับการสนทนาอย่างเสถียรถึง 11 ภาษา และภาษาญี่ปุ่นเป็นหนึ่งในนั้น เสียงและภาพถูกสร้างขึ้นพร้อมกันที่ 32 kHz สเตอริโอ ไม่ใช่การพากย์ทับทีหลัง
  • ชุดอ้างอิง (Reference packs) ไม่ได้ใกล้เคียงกันเลย H3 รองรับรูปภาพสูงสุด 9 ภาพ บวกวิดีโอสูงสุด 3 คลิป และเสียง 3 คลิป (รวมไฟล์สูงสุด 12 ไฟล์) ส่วน Veo 3.1 รับรูปภาพได้ 3 ภาพ และเมื่อใช้ reference endpoint แล้ว duration จะถูกลดเหลือแค่ค่า [8] เท่านั้น
  • กับดักสองอย่างที่ทำให้การทดสอบล้มเหลวอย่างเงียบๆ: API ของ Veo ตั้งค่า generate_audio เป็น false และ resolution เป็น 720p โดยปริยาย ส่วน H3 ตั้งค่า ratio ของ text-to-video เป็น 1:1 โดยปริยาย ปล่อยไว้แบบนี้ก็เท่ากับกำลังเปรียบเทียบคลิป 720p ที่ไม่มีเสียง กับคลิปสี่เหลี่ยมจัตุรัส
  • Veo 3.1 มีสองสิ่งที่ H3 ไม่มีเลย: seed และ negative_prompt สำหรับอนิเมะ 2D ตัวที่สองนี้สำคัญจริงๆ และผมจะแสดงให้ดู

MiniMax H3 ตัวสร้างวิดีโออนิเมะ vs Veo 3.1, เฟรมเดียวกันเทียบกันชัดๆ

ตัวละครต้นฉบับหนึ่งตัว คีย์เฟรมหนึ่งภาพ พรอมต์หนึ่งชุด คัดลอกทีละตัวอักษรเข้าไปในทั้งสองโมเดล ทุกอย่างอื่นตั้งค่าสูงสุดทั้งสองฝั่ง

MiniMax H3, image-to-video, 2K, 8 วินาที, เสียงจากโมเดลโดยตรง เปิดเสียง: เสียงอึกทึกของฝูงชน, เสียงหวดลูกบอล, และเสียงตะโกนภาษาญี่ปุ่น ถูกสร้างขึ้นในพาสเดียวกับภาพ สร้างด้วย minimax/h3/image-to-video บน Atlas Cloud

Veo 3.1, image-to-video, 1080p, 8 วินาที, generateaudio เปิดด้วยตนเอง, พร้อมกับ negativeprompt ที่ช่วยคงเส้นสายให้แบนราบ เฟรมแรกเดียวกัน, คำเดียวกัน สร้างด้วย google/veo3.1/image-to-video บน Atlas Cloud

ทั้งคู่วาดออกมาได้สวยงาม ช็อตมุมกว้างของ Veo ขณะหวดลูกบอล มีเส้นแรงกระแทกแบบวาดมือ และเอฟเฟกต์เสียงมังงะลอยอยู่ในอากาศ สวยงามจริงๆ นั่นคือจุดเริ่มต้นที่ซื่อสัตย์ และเป็นเหตุผลว่าทำไมบทความที่เหลือถึงพูดถึงพารามิเตอร์และการทำตามคำสั่ง มากกว่าความรู้สึกโดยรวม

ทำไมการทดสอบ MiniMax H3 ตัวสร้างวิดีโออนิเมะ vs Veo 3.1 ส่วนใหญ่ถึงผิดพลาด

สองอย่างเกิดขึ้นพร้อมกันในฤดูร้อนนี้

อนิเมะกลายเป็นรูปแบบเนื้อหาที่มีปริมาณมากที่สุดในวงการวิดีโอ AI ฟุตบอลโลก 2026 ถูกเขียนใหม่เป็นทัวร์นาเมนต์โชเน็น โดยมีนักเตะรับบทเป็นเผด็จการ กัปตันโจรสลัด นายพลหน่วยนาวิก และเมนเทอร์ โดยมีเนื้อเรื่องที่ "พัฒนาไปเกือบทุกนัด" บน TikTok, Instagram, X และ YouTube (Complex, กรกฎาคม 2026)

และ MiniMax H3 ก็ปล่อย open weights กระทู้ ComfyUI ในวันแรกทำคะแนนได้ถึง 330 คะแนนและมี 95 คอมเมนต์ โดยมีคนโพสต์ตัวเลขการใช้งานจริงในเครื่องภายในไม่กี่ชั่วโมง (Hacker News, สิงหาคม 2026)

รวมสองอย่างนี้เข้าด้วยกัน คุณคงคาดว่าจะมีบทเปรียบเทียบอนิเมะมากมาย แต่แทบไม่มีเลย เพราะการทดสอบส่วนใหญ่สร้างขึ้นมาผิดๆ ด้วยหนึ่งในสี่วิธีต่อไปนี้

พวกเขาเปรียบเทียบภาพ ไม่ใช่ข้อจำกัด ช็อตอนิเมะคือเรื่องของจังหวะเวลา การแพนกล้องแล้วตามด้วยการ์ดไตเติ้ลเป็นปัญหาด้านระยะเวลาก่อนที่จะเป็นปัญหาด้านการเรนเดอร์

พวกเขาลืมไปว่า API ของ Veo เงียบเป็นค่าเริ่มต้น ใน API ตัวแปร generate_audio ถูกตั้งเป็น false และ resolution เป็น 720p โพสต์มากมายที่บอกว่า "Veo ไม่มีเสียงในอนิเมะ" เป็นเพียงคนที่ไม่เคยพลิกสวิตช์ตัวนั้นเลย

พวกเขาลืมไปว่า text-to-video ของ H3 เป็นสี่เหลี่ยมจัตุรัสเป็นค่าเริ่มต้น ratio ตั้งค่าเริ่มต้นเป็น 1:1 ไม่ใช่ 16:9 รันพรอมต์ t2v อนิเมะโดยไม่ตั้งค่า คุณจะได้คลิปสี่เหลี่ยมจัตุรัสและข้อสรุปที่สับสน

พวกเขาทดสอบด้วยพรอมต์แบบเหมือนจริง คำว่า "Cinematic, volumetric light, shallow depth of field" เป็นคำศัพท์ที่ดึงโมเดล 2D ไปสู่การลงเงานแบบ 3D โดยตรง จุดบกพร่องของอนิเมะไม่ใช่ความเบลอ แต่เป็นความเหมือนพลาสติก

สามการตั้งค่าที่ตัดสินผลการทดสอบอนิเมะก่อนที่คุณจะกดรัน

ก่อนอื่น ให้ตั้งค่าทั้งสองฝั่งตามนี้ ไม่เช่นนั้นการเปรียบเทียบจะไร้ค่า

การตั้งค่าMiniMax H3Veo 3.1จะเกิดอะไรขึ้นถ้าข้ามไป
เสียงสร้างพร้อมกับภาพเสมอgenerate_audio ตั้งค่าเริ่มต้นเป็น falseVeo จะส่งกลับคลิปที่ไม่มีเสียงและดูแย่กว่าความเป็นจริง
รูปร่างเฟรมratio ตั้งค่าเริ่มต้นเป็น 1:1 สำหรับ text-to-videoaspect_ratio ตั้งค่าเริ่มต้นเป็น 16:9H3 จะส่งคลิปอนิเมะสี่เหลี่ยมที่คุณใช้ไม่ได้
ความละเอียดตั้งค่าเริ่มต้นเป็น 2Kตั้งค่าเริ่มต้นเป็น 720pคุณเปรียบเทียบ 2K กับ 720p แล้วเรียกมันว่าช่องว่างของคุณภาพ

สเปกชีต MiniMax H3 vs Veo 3.1 สำหรับอนิเมะ: ความยาว, อัตราส่วน, เสียง, รูปอ้างอิง

ผมดึง schema อินพุตสดของทั้งสองโมเดลมา แทนที่จะเชื่อถือโพสต์เปิดตัวใดๆ ทุกค่าด้านล่างเป็น enum ที่คุณสามารถอ่านได้เองบนหน้าโมเดล ไม่ใช่ความเห็นส่วนตัว

ตาราง 1: MiniMax H3 vs Veo 3.1, พารามิเตอร์ที่กำหนดช็อตอนิเมะ

MiniMax H3Veo 3.1
ระยะเวลา4 ถึง 15 ทุกวินาที (ค่าเริ่มต้น 8)4, 6, 8 (ค่าเริ่มต้น 8)
อัตราส่วนภาพ21:9, 16:9, 4:3, 1:1, 3:4, 9:1616:9, 9:16
ค่าเริ่มต้นอัตราส่วน (text-to-video)1:0116:09
ความละเอียด768P, 2K (ค่าเริ่มต้น 2K)720p, 1080p, 4k (ค่าเริ่มต้น 720p)
เสียงสร้างร่วมกัน, 32 kHz สเตอริโอgenerate_audio, ค่าเริ่มต้นเป็น false
ภาษาที่รองรับการสนทนาตามธรรมชาติ11 ภาษาที่เสถียร, รวมภาษาญี่ปุ่นไม่ได้เผยแพร่เป็นรายการที่เสถียร
ชุดอ้างอิงรูปภาพสูงสุด 9 ภาพ, วิดีโอ 3 คลิป, เสียง 3 คลิป, รวมไฟล์สูงสุด 12 ไฟล์3 ภาพ
ระยะเวลาเมื่อใช้ชุดอ้างอิงยังคง 4 ถึง 15ลดลงเหลือแค่ 8 เท่านั้น
seedไม่มีมี
negative_promptไม่มีมี
น้ำหนักโมเดลดาวน์โหลดได้ปิด

ระยะเวลา, อัตราส่วน, ความละเอียด, เสียง และข้อจำกัดของชุดอ้างอิง อ่านได้จาก schema สดบนหน้า MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video และ Veo 3.1 reference-to-video ข้อมูลเกี่ยวกับรูปภาพ 9 ภาพและไฟล์ 12 ไฟล์สูงสุด รวมถึงรายการภาษา 11 ภาษาสำหรับบทสนทนา มาจาก MiniMax H3 model card (Hugging Face, สิงหาคม 2026)

ต่อมาเป็นตารางคะแนน เพราะมันบอกอะไรบางอย่างที่แตกต่างจากสเปกชีต และทั้งสองอย่างก็สำคัญ

ตาราง 2: คะแนน Elo โหวตจากผู้ใช้ และราคาต่อนาที ณ วันที่ 7 สิงหาคม 2026

โมเดลText-to-video (พร้อมเสียง)Image-to-video (พร้อมเสียง)$/นาที
Gemini Omni Flash1,244 (#1) ±71,191 (#2) ±9$6.00
MiniMax H31,238 (#2) ±91,190 (#3) ±10$7.80
Dreamina Seedance 2.0 720p1,224 (#3) ±61,198 (#1) ±7$9.07
Kling 3.0 1080p (Pro)1,111 (#7) ±6ไม่อยู่ใน 10 อันดับแรก$20.16
Veo 3.11,093 (#11) ±71,085 (#10) ±7$24.00
Veo 3.1 Fast1,091 (#14) ±6ไม่อยู่ใน 10 อันดับแรก$9.00
Veo 3.1 Lite1,089 (#15) ±7ไม่อยู่ใน 10 อันดับแรก$4.80

ข้อมูลคะแนน Elo และราคาจาก Artificial Analysis Video Arena (Artificial Analysis, สิงหาคม 2026) คะแนนเหล่านี้เป็นคะแนนโหวตจากผู้ใช้แบบเลื่อนไหลและเปลี่ยนแปลงอยู่เสมอ คอลัมน์ $/นาที เป็นค่าประมาณจากโมเดลที่ปรับให้เป็นมาตรฐาน ไม่ใช่ใบแจ้งหนี้ของคุณ

ช่องว่างคะแนน Elo 145 คะแนนถือว่ามาก แต่มันเป็นคะแนนโหวตทั่วไป ไม่ใช่คะแนนโหวตเฉพาะอนิเมะ และนี่คือส่วนที่ผมต้องพูดอย่างตรงไปตรงมา: MiniMax ไม่ได้ทำการตลาด H3 ในฐานะโมเดลอนิเมะ ข้อเสนอแนะภายในจากแนวหน้าแรก ระบุว่าภาพยนตร์, แอนิเมชัน และดราม่าตลก เป็นพื้นที่ที่ H3 ไม่ได้ มุ่งเป้าไปที่ ดังนั้นคำถามที่น่าสนใจจึงไม่ใช่ "อันไหนคือโมเดลอนิเมะ" แต่คือทำไมโมเดลที่ไม่ได้ขายตัวเองในเรื่องอนิเมะถึงยังชนะในช็อตนี้ และ Google ยังคงชนะในรอบไหน

หมายเหตุที่ใช้งานได้จริงก่อนถึงบทช่วยสอน ทุกโมเดลด้านล่างทำงานผ่านคอนโซลเดียวกันและคีย์ API เดียวกัน ซึ่งเป็นเหตุผลเดียวที่ทำให้พารามิเตอร์ต่างๆ เปรียบเทียบกันได้ คิวเดียวกัน, การยืนยันตัวตนเดียวกัน, ใบแจ้งหนี้เดียว หากคุณตั้งค่า GPT Image 2 บนบริการหนึ่งและ Veo บนอีกบริการหนึ่ง ความแตกต่างครึ่งหนึ่งที่คุณพบจะเป็นเรื่องของระบบท่อส่งมากกว่าตัวโมเดล

สร้างช็อต: MiniMax H3 vs Veo 3.1 ทีละขั้นตอน

ตัวอย่างที่ใช้จริง ตั้งแต่ต้นจนจบ "Last Whistle": กองหน้าวัยรุ่นตัวละครดั้งเดิม ผมแดง ชุดขาวสลับน้ำเงินหมายเลข 9 ไฟสนาม การแพนกล้องตามลูกฟุตบอลที่ถูกเตะ และการ์ดไตเติ้ลภาษาญี่ปุ่นที่ต้องปรากฏในสองวินาทีสุดท้ายและหยุดนิ่ง

ไม่มีผู้เล่นจริง ไม่มีตัวละครทางการ ไม่มีทรัพย์สินทางปัญญาของอนิเมะที่มีอยู่ แค่สไตล์และการคารวะเท่านั้น อ่านต่อด้านล่างว่าทำไม

ขั้นตอนที่ 1: ออกแบบคีย์เฟรมอนิเมะด้วย GPT Image 2

คีย์เฟรมเป็นตัวกำหนดทิศทางของงานศิลป์ เพื่อให้โมเดลวิดีโอไม่ต้องคิดขึ้นมาเอง สังเกตพื้นที่ว่างด้านซ้ายหนึ่งในสามของเฟรม: มันจงใจวางไว้แบบนั้น การ์ดไตเติ้ลจะถูกเขียนลงไปตรงนั้นโดยโมเดลวิดีโอ และนั่นคือการทดสอบความเสถียรของข้อความ

Plain
1A single frame from a modern shonen sports anime. Cel-shaded 2D animation, hand-inked
2line art with consistent line weight, flat colour fills, hard-edged graphic shadows,
3absolutely no 3D shading and no photoreal skin. Close-up on an original teenage striker:
4messy dark-red hair, white-and-navy kit with the number 9, sweat and grass streaks across
5one cheek, eyes wide with exhausted determination, mouth open mid-shout. Behind him,
6stadium floodlights blaze into a wall of blurred crowd colour; radial speed lines burst
7from the centre of frame; one blade of grass hangs frozen in the air. Saturated palette,
8deep cyan shadows, warm orange rim light. 16:9 composition, the character framed right of
9centre, clean negative space on the left third. No text anywhere in the image.

การตั้งค่า: โมเดล openai/gpt-image-2/text-to-image, คุณภาพ high, ขนาด 16:9 (2048x1152) ไม่มีอะไรอื่น

Interface ตัวสร้างภาพ AI แสดงขั้นตอนที่มีหมายเลขในการสร้างภาพอนิเมะ

GPT Image 2 playground บน Atlas Cloud พร้อมพรอมต์คีย์เฟรม Last Whistle และเฟรมอนิเมะที่เสร็จแล้วในแผงเอาต์พุต

GPT Image 2 บน Atlas Cloud: ตั้งค่าคุณภาพเป็น high, คีย์เฟรมที่เสร็จแล้วทางด้านขวา

นักกีฬาอนิเมะผมแดงหน้าตาเข้มข้นกำลังตะโกนท่ามกลางสนามกีฬาที่มีผู้คนหนาแน่น

คีย์เฟรมอนิเมะพื้นฐาน: กองหน้าผมแดงตัวละครดั้งเดิมกำลังตะโกนท่ามกลางไฟสนามกีฬา ลงสีแบบแบน มีเส้นเงาคม

คีย์เฟรมที่ทั้งสองโมเดลได้รับ สีแบน, เงาแข็ง, และพื้นที่ว่างด้านซ้ายหนึ่งในสามที่รอรับการ์ดไตเติ้ล

ขั้นตอนที่ 2: MiniMax H3 image-to-video, ตั้งค่าทุกอย่างสูงสุด

ภาพเดียวกันเข้าไป, 2K ออกมา ผมจำกัด H3 ให้เหลือ 8 วินาทีที่นี่เพื่อให้เท่ากับเพดานของ Veo เท่านั้น นั่นไม่ใช่ข้อจำกัดของ H3 และขั้นตอนที่ 4 จะปลดล็อกมัน

Plain
1Cel-shaded 2D anime, hand-inked line weight, flat colour, no 3D shading. Hold on the
2striker's face for one beat, then a violent whip pan follows the ball as he strikes it,
3the pan smearing the frame into streaked sakuga motion trails. One frame of total silence
4at impact. Over the final two seconds, bold white Japanese title lettering reading
5ラストホイッスル punches onto the left third of frame and holds rock-steady, no warping,
6no flicker, no drift. The striker shouts one line in Japanese: 「まだ終わってない!」
7Audio: stadium roar swelling, a single sharp ball-strike impact, a low taiko hit under the
8title card.

การตั้งค่า: โมเดล minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (image-to-video จะใช้รูปร่างเฟรมจากภาพอินพุตของคุณ), image = ผลลัพธ์จากขั้นตอนที่ 1

คำเตือนหนึ่งข้อหากคุณเปลี่ยนไปใช้ text-to-video: ให้เขียน ratio: 16:9 อย่างชัดเจน ค่าเริ่มต้นคือ 1:1 และมันจะส่งคลิปอนิเมะสี่เหลี่ยมจัตุรัสให้คุณอย่างมีความสุข

Interface ตัวสร้างวิดีโอ AI แสดงพรอมต์อินพุตและวิดีโอเอาต์พุต

MiniMax H3 image-to-video playground บน Atlas Cloud พร้อมพรอมต์ Last Whistle, โหลดคีย์เฟรม และคลิปที่เสร็จแล้วในแผงเอาต์พุต

MiniMax H3 image-to-video บน Atlas Cloud: คีย์เฟรมจากขั้นตอนที่ 1 โหลดทางด้านซ้าย, คลิปที่เสร็จแล้วกำลังเล่นทางด้านขวา

ขั้นตอนที่ 3: Veo 3.1 image-to-video, เปิดเสียงด้วยตนเอง

พรอมต์เหมือนกันทุกประการ แก้คำคุณศัพท์แม้แต่คำเดียวก็จะไม่ใช่การเปรียบเทียบอีกต่อไป สิ่งที่เปลี่ยนไปคือฟิลด์พิเศษที่ Veo มอบให้และ H3 ไม่มี

negative_prompt ซึ่งสำหรับอนิเมะ 2D ถือเป็นตัวควบคุมที่มีประโยชน์ที่สุดในรายการนี้:

Plain
13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur
2soup, warped lettering, gibberish text, extra fingers, subtitle bar

การตั้งค่า: โมเดล google/veo3.1/image-to-video, resolution: 1080p (เปลี่ยนด้วย ค่าเริ่มต้นคือ 720p), duration: 8 (นี่คือเพดาน), aspect_ratio: 16:9, generate_audio: true (ค่าเริ่มต้นของ API คือ false นี่คือกับดักคลิปเงียบ), seed: 20260807, image = ผลลัพธ์จากขั้นตอนที่ 1 เดียวกัน

Interface ตัวสร้างวิดีโอ AI แสดงการตั้งค่าอินพุตและวิดีโออนิเมะที่สร้างขึ้น

Veo 3.1 image-to-video playground บน Atlas Cloud แสดงการเปิดใช้งานการสร้างเสียง, โหลดคีย์เฟรมอนิเมะ และคลิปที่เสร็จแล้วในแผงเอาต์พุต

Veo 3.1 image-to-video บน Atlas Cloud, โดยเปิด Generate Audio และคลิปที่เสร็จแล้วทางด้านขวา

ขั้นตอนที่ 4: ให้คะแนนตามแกนเฉพาะอนิเมะ 5 แกน

ไม่ต้องสร้างอะไรเพิ่ม แค่ดูในสิ่งที่อนิเมะมักจะพังจริงๆ คลิปทั้งสองถูกฝังไว้ใกล้กับด้านบนของบทความนี้ คุณสามารถให้คะแนนเองแทนที่จะเชื่อผม

ฉากสนามฟุตบอลแบบเคียงข้างกันที่มีป้ายกำกับ MiniMax H3 และ Veo 3.1

เฟรมสุดท้ายของทั้งสองคลิปเคียงข้างกัน MiniMax H3 ทางซ้ายมีตัวอักษรไตเติ้ลภาษาญี่ปุ่นที่ชัดเจน Veo 3.1 ทางขวามีตัวอักษรแนวตั้งที่อ่านไม่ออก

เฟรมสุดท้ายของแต่ละคลิป ทางซ้าย H3 เขียนคำว่า ラストホイッスル คะตะกานะทั้งแปดตัวถูกต้องและนิ่งสนิท ทางขวา Veo 3.1 เขียนสามตัวอักษรที่ไม่ใช่คำที่ขอและไม่ประกอบเป็นคำใดๆ

การ์ดไตเติ้ลคือจุดตัดสินของรอบนี้ และมันไม่สูสีเลย H3 เรนเดอร์คะตะกานะที่ขอไว้อย่างถูกต้อง คมชัดและเสถียร เหนือภาพแพนกล้องแบบเบลอของประตู Veo 3.1 สร้างตัวอักษรสามตัวเรียงแนวตั้งที่ไม่ใช่ทั้งคำที่ขอและไม่ใช่คำใดๆ ในเฟรมเดียวกัน มันยังทำให้ตัวละครหลุดออกจากเฟรม และปล่อยให้พื้นหลังเลื่อนไปทางภาพสนามกีฬากึ่งเหมือนจริง แม้ว่าจะมี photorealistic skin และ 3D render อยู่ใน negative prompt ก็ตาม

ตาราง 3: ห้าแกนที่ตัดสินช็อตอนิเมะ จากการรันทั้งสองครั้งนี้

แกนMiniMax H3Veo 3.1
ความต่อเนื่องของตัวละครจากคีย์เฟรมคงใบหน้า, ผม และชุดที่แน่นอนไว้ตลอด 8 วินาทีวาดตัวละครใหม่ในช็อตกว้างใหม่ ตรงตามโมเดลแต่เป็นภาพวาดคนละภาพ
ความหนาของเส้นและการลงสีแบบแบน (cel shading)คงที่, ไม่เลื่อนไปทาง 3Dคงที่ในช็อตกลาง แต่เลื่อนไปทางภาพสนามกีฬาเหมือนถ่ายภาพในช่วงท้าย
การ์ดไตเติ้ลภาษาญี่ปุ่นラストホイッスル เรนเดอร์ถูกต้องและนิ่งสนิทตัวอักษรสามตัว, ไม่ใช่คำที่ขอ, ไม่ใช่คำใดๆ
แทร็กเสียงที่ส่งออก32 kHz สเตอริโอ, ตรงตามที่การ์ดโมเดลระบุ48 kHz สเตอริโอ, มีอยู่เพียงเพราะผมตั้งค่า generate_audio เอง
การแพนกล้องแบบหวด (whip pan) และลายเส้นซาคุกะ (sakuga smear)ดำเนินการเป็นภาพแพนแบบเบลอเข้าสู่ไตเติ้ลถูกแทนที่ด้วยการตัดภาพแบบคมไปยังฉากใหม่

แถวสุดท้ายนี่คือคำวิจารณ์ที่ดังที่สุดต่อ H3 จนถึงตอนนี้ ซึ่งเป็นเหตุผลว่าทำไมผมถึงเขียนมันลงในพรอมต์ทั้งสอง ในกระทู้ ComfyUI วันแรก ผู้ใช้ fwip บ่นว่าแม้แต่พรอมต์ตัวอย่างอย่างเป็นทางการก็ถูกมองข้าม: "a violent WHIP PAN off the rooftop that SMEARS the floating words away with it, motion-streaked. And the video just didn't do any of that transition at all, it just replaced it with a cut."

ในการรันครั้งนี้ Veo ต่างหากที่เปลี่ยนการแพนเป็นการตัด และ H3 ที่ทำการเบลอ ครั้งละหนึ่งเทคไม่ใช่คำตัดสิน และผมจะไม่อ้างว่ามันเป็นเช่นนั้น แต่มันหมายความว่าคำวิจารณ์นั้นไม่ได้จำเพาะเจาะจงกับ H3: การแพนแบบหวดเป็นคำสั่งที่น่าเชื่อถือน้อยที่สุดในการทดสอบทั้งหมดนี้ ไม่ว่าจะฝั่งไหนก็ตาม ถ้าสตอรีบอร์ดของคุณขึ้นอยู่กับมัน ให้วางแผนสตอรีบอร์ดรอบๆ มันแทนที่จะผ่านมัน

ขั้นตอนที่ 5: ช็อต OVA ย้อนยุค 4:3 ที่ Veo 3.1 ไม่สามารถสร้างได้ตามโครงสร้าง

นี่ไม่ใช่ความชอบด้านคุณภาพ มันคือกำแพง aspect_ratio enum ของ Veo มีสองค่าและไม่มีค่าไหนเป็น 4:3 และ duration enum ของมันไม่มี 12 ลุค OVA ยุค 90 ไม่สามารถเข้าถึงได้โดยสิ้นเชิง

Plain
1A 1990s OVA anime cut, 4:3 full-frame. Hand-painted background art with visible brush
2texture, cel-paint characters with thick uneven ink lines, heavy halation glow around the
3floodlights, 16mm film grain and faint gate weave. The same red-haired striker in a
4white-and-navy number 9 kit walks off a rain-soaked pitch as the crowd noise fades to a
5single ringing tone. Camera pushes in slowly on his face. He says quietly in Japanese:
6「次は、勝つ」. Retro palette: muted teal, dusty amber, deep maroon shadows. Audio:
7distant rain, a lone analogue synth pad, one reverb-heavy whistle in the far distance.

การตั้งค่า: โมเดล minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3 ตั้งค่าอัตราส่วนด้วยตนเอง อย่าลืมค่าเริ่มต้น

Interface ตัวสร้างวิดีโอ AI พร้อมพรอมต์ข้อความและวิดีโออนิเมะที่สร้างขึ้น

MiniMax H3 text-to-video playground บน Atlas Cloud พร้อมพรอมต์ OVA ที่พิมพ์ไว้และคลิปย้อนยุคที่เสร็จแล้วในแผงเอาต์พุต

MiniMax H3 text-to-video บน Atlas Cloud, พิมพ์พรอมต์ OVA เสร็จแล้ว คลิปย้อนยุค เปิดเผย: การรันครั้งนี้ตั้งค่า Aspect Ratio เป็น 16:9 และ Duration เป็น 8 ดังนั้นสิ่งที่คุณเห็นทางด้านขวาคือเวอร์ชันสั้นแบบจอกว้าง ช็อต 4:3 12 วินาทีด้านล่างมาจากการเรียกใช้ API ที่ตั้งค่า ratio: 4:3 และ duration: 12 อย่างชัดแจ้ง

นักฟุตบอลอนิเมะผมแดงยืนอยู่ในสนามกีฬาในชุดที่สกปรก

ช็อต OVA ย้อนยุค 4:3: กองหน้าคนเดิมเดินออกจากสนามที่เปียกฝนในสไตล์อนิเมะยุค 90

H3 text-to-video, 4:3, 12 วินาที ไฟล์ที่ส่งออกมาคือ 1920x1440 ซึ่งเป็น 4:3 พิกเซลต่อพิกเซล พร้อมแทร็กเสียงสเตอริโอ 32 kHz แสดงที่นี่เป็น GIF เงียบที่อัตราเฟรมลดลงเพื่อให้หน้าเว็บเบา สร้างด้วย minimax/h3/text-to-video บน Atlas Cloud

ขั้นตอนที่ 6: รูปอ้างอิงเก้าภาพ, ตัวละครเดียว, สี่ช็อต

ความสอดคล้องของตัวละครในหลายช็อตเป็นปัญหาที่ยากที่สุดในวงการ AI อนิเมะ และมันแก้ได้ด้วยปริมาณของรูปอ้างอิง สร้างชุดก่อน: รันพรอมต์ขั้นตอนที่ 1 อีกครั้งโดยเปลี่ยนการจัดเฟรมเป็น front, three-quarter, full profile, back, หัวเราะ, กัดฟัน, ท่ายืนเต็มตัว, รายละเอียดชุด และรายละเอียดรองเท้า เก้าภาพ รวมแล้วประมาณแปดเซ็นต์

เป็นรูปธรรมและเฉพาะเจาะจงหรือไม่? ใช่ (ระบุภาพประกอบสี่ภาพ, ผมแดง, อนิเมะ, ฟุตบอล)

สี่มุมของตัวละครกองหน้าต้นฉบับเดียวกันที่สร้างเป็นชุดอ้างอิง จัดเรียงในตารางสองคูณสอง

สี่ในเก้ามุมอ้างอิง H3 รองรับรูปภาพสูงสุดเก้าภาพในชุดอ้างอิงเดียว รวมถึงวิดีโอและเสียงอ้างอิงเพิ่มเติมได้อีก

Plain
1Cel-shaded 2D anime, consistent hand-inked line weight, flat colour, no 3D shading. Keep
2the referenced striker's face, hair silhouette and number 9 kit identical across every cut.
3Four cuts in one continuous take: (1) low-angle push-in on his boots hitting the turf,
4(2) whip-pan up to a tight close-up of his eyes, (3) wide shot of him sprinting past three
5defenders drawn as blurred silhouettes, (4) freeze on a mid-air header, speed lines
6exploding outward. Audio: crowd roar, breath, boot-on-turf impacts, one taiko hit on the
7freeze.

การตั้งค่า: โมเดล minimax/h3/reference-to-video, refers = รูปภาพของคุณพร้อม type: image, resolution: 2K, duration: 8 หรือสูงกว่า, ratio: adaptive หรือ 16:9

สิ่งที่เทียบเท่ากับ Veo 3.1 ไม่สามารถรันที่การตั้งค่าเหล่านี้ได้ และคุณไม่ต้องลองก็รู้ว่าทำไม reference endpoint ของมันรับรูปภาพได้สูงสุดสามภาพ และการเลือก endpoint นั้นจะทำให้ duration ลดลงเหลือค่าเดียวที่ถูกต้องคือ 8 ชุดรูปภาพเก้าภาพและการถ่ายทำ 10 วินาที ล้วนอยู่นอกช่วงที่รองรับ

Interface ตัวสร้างวิดีโอ AI แสดงพรอมต์อินพุตและวิดีโออนิเมะที่สร้างขึ้น

MiniMax H3 reference-to-video playground บน Atlas Cloud แสดงตัวนับอ้างอิงที่สี่จากเก้า และช็อตแรกในแผงเอาต์พุต

MiniMax H3 reference-to-video บน Atlas Cloud ตัวนับอ่านว่า Reference Materials (4/9) โดยมี MAX:9 อยู่ด้านล่าง ซึ่งเป็นเพดานในอินเทอร์เฟซ ไม่ใช่การอ้างจากสเปกชีต ผลลัพธ์คือช็อตแรก การดันกล้องมุมต่ำเข้ารองเท้า

การรัน MiniMax H3 ตัวสร้างวิดีโออนิเมะอีกสี่แบบที่ควรลอง

ช็อต Last Whistle เน้นแค่สี่ความแตกต่างเท่านั้น สี่แบบนี้จะเน้นส่วนที่เหลือ ทั้งหมดรันบน H3; หมายเหตุจะบอกว่าแบบไหนที่ Veo 3.1 สามารถเทียบได้

  1. ฉากต่อสู้ซาคุกะจอกว้างพิเศษ, 21:9 , 10 วินาที Veo ไม่สามารถสร้าง 21:9 ได้เลย
Plain
1Cel-shaded 2D anime action, thick tapered ink lines, flat colour, hard-edged shadows,
2no 3D shading. Two original masked duelists on a windswept temple roof at dusk. Blade
3clash, the frame shudders, both fighters break apart in a burst of hand-drawn impact
4frames and radial speed lines. Camera: low-angle push-in, then a lateral track, then a
5snap to a wide silhouette against the orange sky. Audio: two sharp metal clashes, cloth
6snap, a low taiko hit on the final freeze, no music.
  1. ช็อต AMV ที่ตรงจังหวะ, reference-to-video พร้อมเสียงอ้างอิง H3 รองรับเสียงอ้างอิงสูงสุดสามคลิป Veo 3.1 ไม่มีอินพุตเสียงเลย มีแต่เอาต์พุตเสียง
Plain
1Cel-shaded 2D anime montage cut to the referenced audio track. Five short beats: rain on
2a window, a hand tightening a bandage, a city skyline flashing past a train window, a
3sprint start, a freeze on an outstretched hand. Every cut lands exactly on a downbeat of
4the referenced audio. Flat colour, thick ink lines, high-contrast night palette of deep
5indigo and neon magenta.
  1. ฉากบทสนทนาภาษาญี่ปุ่นสองบรรทัด, 12 วินาที นี่คือการทดสอบลิปซิงค์ และ 12 วินาทีก็อยู่นอกระยะของ Veo แล้ว
Plain
1Cel-shaded 2D anime, flat colour, no 3D shading. Two original characters on a rooftop at
2golden hour, shot reverse shot. First says in Japanese:「本当に行くの?」. The second
3answers, half-smiling, in Japanese:「もう決めた」. Mouths match every syllable. Warm rim
4light, long shadows, gentle wind in hair. Audio: two distinct Japanese voices, distant
5traffic, one cicada.
  1. คลิปสั้นแนวตั้งโชเน็น, 9:16 , 8 วินาที ทั้งสองโมเดลทำแนวตั้งได้ ดังนั้นนี่คือจุดเดียวที่ควร A/B จริงๆ แทนที่จะเดา
Plain
1Cel-shaded 2D anime, vertical composition. An original teenage runner bursts through a
2paper banner in slow-motion, then the frame snaps back to full speed as she accelerates
3down a stadium straight. Speed lines, flat colour, hard shadows, bold graphic sky.
4Camera: low-angle follow shot, then a whip up to her face. Audio: banner tear, crowd
5surge, one breath held then released.

หากคุณต้องการไวยากรณ์พรอมต์เบื้องหลังเหล่านี้ คู่มือพรอมต์ MiniMax H3 เจาะลึกเรื่องการแยกวิเคราะห์คำสั่งกล้องและเสียงของ H3 มากกว่าที่ผมจะทำได้ที่นี่

ราคาของโอเพนนิ่งอนิเมะ 60 วินาทีบน MiniMax H3 vs Veo 3.1

โอเพนนิ่งอนิเมะมาตรฐานยาวประมาณ 90 วินาที สมมติว่าแปดช็อต ช็อตละ 8 วินาที รวมวิดีโอที่เสร็จแล้ว 64 วินาที บวกคีย์เฟรมหนึ่งภาพต่อช็อตที่ $0.009 ต่อภาพ

มีความแตกต่างด้านราคาจริงๆ ที่คุณควรรู้ แทนที่จะให้ผมปิดบังไว้ แคตตาล็อก Atlas Cloud ระบุ MiniMax H3 ไว้ที่ $0.10 ต่อวินาทีแบบคงที่ ในขณะที่ readme ของโมเดลแยกเป็น $0.14/วินาทีสำหรับ 2K และ $0.10/วินาทีสำหรับ 768P Veo 3.1 ระบุไว้ที่ $0.20 ต่อวินาที ในขณะที่ readme แยกเป็น $0.40/วินาทีพร้อมเสียง และ $0.20/วินาทีไม่มีเสียง

ปุ่มรันในภาพหน้าจอของผมยืนยันได้ H3 reference-to-video, 8 วินาทีที่ 2K, แสดงราคา Run $1.12 ซึ่งเท่ากับ $0.14 ต่อวินาทีพอดี Veo 3.1 image-to-video, 8 วินาทีที่ 1080p พร้อมเสียง, แสดงราคา Run $3.2 ซึ่งเท่ากับ $0.40 ต่อวินาทีพอดี ดังนั้นอัตรา readme คืออัตราที่คิดเงิน และหัวข้อในแคตตาล็อกคือระดับเริ่มต้น ผมได้แสดงทั้งสองค่าด้านล่างไว้แล้ว นี่คือราคาตามรายการ ณ เดือนสิงหาคม 2026

ตาราง 4: แปดช็อตๆ ละ 8 วินาที รวมคีย์เฟรม

การตั้งค่าราคาวิดีโอ (อัตราแคตตาล็อก)ราคาวิดีโอ (อัตรา readme)คีย์เฟรมช่วงราคารวม
MiniMax H3, 2K$6.40$8.96$0.07$6.47 ถึง $9.03
MiniMax H3, 768P$6.40$6.40$0.07$6.47
Veo 3.1, 1080p พร้อมเสียง$12.80$25.60$0.07$12.87 ถึง $25.67
Veo 3.1 Lite, 720p$3.20$3.20$0.07$3.27

ราคาดึงมาจากหน้าโมเดล Atlas Cloud ที่เชื่อมโยงในตารางที่ 1, สิงหาคม 2026 ไม่มีตัวใดในสี่ตัวนี้ที่ลดราคาอยู่ในขณะนี้

สองสิ่งที่ตารางนั้นไม่รวม และทั้งสองอย่างหนักกว่าอัตราต่อวินาที

การลองใหม่ (Retries) ไม่มีใครส่งช็อตอนิเมะเทคแรกสำเร็จ ไม่ว่าคุณจะคิดว่าต้องลองกี่ครั้ง ใช้กับทั้งสองคอลัมน์และช่องว่างจะกว้างขึ้นในสัดส่วนเดียวกัน

เวลาจริง (Wall-clock), และอันนี้ไปอีกทางหนึ่ง เวลาวัดตั้งแต่ต้นจนจบเมื่อวันที่ 7 สิงหาคม 2026: H3 ที่ 2K เป็นเวลา 8 วินาทีใช้เวลา 447 วินาที ประมาณ 7.5 นาที H3 text-to-video ที่ 2K เป็นเวลา 12 วินาทีใช้เวลา 334 วินาที Veo 3.1 ที่ 1080p เป็นเวลา 8 วินาทีพร้อมเสียงใช้เวลา 152 วินาที ต่ำกว่าสามนาที Veo เร็วกว่าประมาณสามเท่าในการได้เทคแรก และถ้าคุณกำลังปรับแต่งช็อตตอนตีสอง นั่นคือเงินที่คุ้มค่าจริงๆ คิวมีการเปลี่ยนแปลง ดังนั้นให้ถือว่าสิ่งเหล่านี้เป็นภาพรวมในช่วงบ่ายวันหนึ่ง ไม่ใช่ข้อมูลจำเพาะ แต่ใครก็ตามที่อ้างว่า "2 ถึง 3 นาที" สำหรับ H3 ที่ 2K กำลังอ้าง readme ไม่ใช่คิว การเปรียบเทียบ 2K กับ 768P ครอบคลุมว่าเมื่อใดที่ระดับที่สูงกว่าคุ้มกับนาทีที่เพิ่มขึ้น

สไตล์อนิเมะ, การคารวะ, และสิ่งที่คุณสามารถเผยแพร่ได้จริง

ทุกอย่างในบทความนี้คือสไตล์และการคารวะ ตัวละครต้นฉบับ, ชุดต้นฉบับ, ไตเติ้ลต้นฉบับ ไม่มีการสร้างหรือขอตัวละครอนิเมะทางการ และไม่มีการใช้ชื่อหรือรูปลักษณ์ของนักฟุตบอลจริง เทรนด์ฟุตบอลโลกถูกอ้างถึงเป็น รูปแบบ เพราะนั่นคือสิ่งที่มันมีประโยชน์

ความแตกต่างนั้นไม่ใช่เครื่องประดับ หากคุณกำลังผลิตเนื้อหาสไตล์อนิเมะในเชิงพาณิชย์ "ในสไตล์ OVA ยุค 90" และ "ตัวละครเฉพาะนี้จากรายการนี้" เป็นวัตถุทางกฎหมายที่แตกต่างกัน และมีเพียงหนึ่งเดียวเท่านั้นที่ทำธุรกิจได้

ในส่วนของ open weights: H3 สามารถดาวน์โหลดได้จริง และผู้คนก็รันมันในวันแรก ผู้แสดงความคิดเห็นคนหนึ่งรายงานว่าใช้เวลา 10 นาทีสำหรับคลิป 480p 10 วินาทีบน 4070 Ti Super ที่มี RAM 16GB และคนอื่นๆ โพสต์ว่าใช้เวลา 3 นาทีบน 5080 และ 68 วินาทีบน RTX 6000 Pro แต่การรันด้วยตัวเองจะทำงานที่ขอบสั้น 768; ขั้นตอน Context-IR และ Regenerate-2K ที่สร้างเอาต์พุต 2K ยังคงอยู่ฝั่ง API

ใบอนุญาตมีข้อแม้จริงๆ ใบอนุญาตชุมชนไม่ครอบคลุมสหภาพยุโรป สหราชอาณาจักร เกาหลีใต้ หรือสหรัฐอเมริกาในปัจจุบัน โดยอ้างถึงภูมิภาคที่ "กำลังพัฒนาหรือบังคับใช้กฎระเบียบที่เกี่ยวข้องกับ AI" ช่องทางการขอใบอนุญาตอย่างเป็นทางการเปิดอยู่ ซึ่งผู้แสดงความคิดเห็น HN คนหนึ่งสรุปว่า "คุณแค่ต้องสัญญาด้วยเกียรติว่าจะไม่ทำให้ดิสนีย์โกรธ แล้วพวกเขาจะส่งใบอนุญาตให้คุณ" ตลกดี และก็เป็นขั้นตอนการปฏิบัติตามกฎระเบียบที่คุณข้ามไม่ได้หากคุณอยู่ในหนึ่งในสี่ดินแดนนั้น บทความเกี่ยวกับ open weights มีรายชื่อดินแดนทั้งหมด

คำถามที่พบบ่อย

MiniMax H3 เป็นตัวสร้างวิดีโออนิเมะที่ดีเมื่อเทียบกับ Veo 3.1 หรือไม่?

สำหรับงานอนิเมะส่วนใหญ่ H3 ดีกว่า และสาเหตุหลักไม่ใช่เรื่องการเรนเดอร์ มันรันได้ 4 ถึง 15 วินาที เทียบกับ 4, 6 หรือ 8 ของ Veo, มีอัตราส่วนภาพให้เลือกหกแบบรวมถึง 4:3 และ 21:9 เทียบกับสองแบบของ Veo, มีภาษาญี่ปุ่นอยู่ใน 11 ภาษาที่รองรับการสนทนาอย่างเสถียร และรับรูปอ้างอิงเก้าภาพเทียบกับสามภาพของ Veo Veo 3.1 ชนะในสถานการณ์เฉพาะอย่างหนึ่ง: เมื่อคุณต้องการ seed สำหรับการเทคซ้ำที่ทำซ้ำได้ หรือ negative_prompt เพื่อหยุดไม่ให้ช็อตเลื่อนไปทางการลงเงานแบบ 3D H3 ไม่มีพารามิเตอร์ทั้งสองตัว หากไปป์ไลน์ของคุณขึ้นอยู่กับสิ่งใดสิ่งหนึ่ง นั่นคือเหตุผลที่แท้จริงที่จะยังคงอยู่

Veo 3.1 สามารถสร้างอนิเมะในรูปแบบ 4:3 หรือคลิป 15 วินาทีได้หรือไม่?

ไม่ได้ และไม่ใช่เพราะเหตุผลด้านสไตล์ aspect_ratio enum ของ Veo 3.1 มีแค่ 16:9 และ 9:16 และ duration enum มีแค่ 4, 6 และ 8 ไม่มีค่า 4:3 ให้เลือก และไม่มีวิธีขอ 12 หรือ 15 วินาที หากการอ้างอิงของคุณคืออนิเมะทีวีหรือ OVA ยุค 90 การจัดเฟรมนั้นไม่สามารถเข้าถึงได้บน Veo และมีให้ใช้บน H3

ทำไมคลิปอนิเมะ Veo 3.1 ของฉันถึงกลับมาไม่มีเสียง?

เพราะ generate_audio ตั้งค่าเริ่มต้นเป็น false บน API โดยปกติสวิตช์ใน playground จะเปิดอยู่แล้ว ดังนั้นปัญหานี้มักเกิดกับคนที่เรียกใช้ API โดยตรง ให้ตั้งค่า generate_audio: true อย่างชัดเจน ขณะที่คุณอยู่ตรงนั้น ให้ตั้งค่า resolution ด้วย เพราะมันตั้งค่าเริ่มต้นเป็น 720p แทนที่จะเป็น 1080p หรือ 4k ที่คุณอาจต้องการ

MiniMax H3 มีบทสนทนาภาษาญี่ปุ่นและลิปซิงค์สำหรับอนิเมะหรือไม่?

ใช่ การ์ดโมเดลระบุ 11 ภาษาที่รองรับการสนทนาอย่างเสถียร ได้แก่ อาหรับ จีน อังกฤษ ฝรั่งเศส เยอรมัน อิตาลี ญี่ปุ่น เกาหลี โปรตุเกส รัสเซีย และสเปน เสียงถูกสร้างขึ้นพร้อมกับภาพที่ 32 kHz สเตอริโอ แทนที่จะพากย์ทับทีหลัง ซึ่งเป็นสาเหตุที่ทำให้จังหวะปากตรงตลอดทั้งบรรทัด แทนที่จะเป็นแค่พยางค์แรกๆ เขียนบรรทัดภาษาญี่ปุ่นลงในพรอมต์โดยตรงเป็นภาษาญี่ปุ่น

ฉันสามารถใช้รูปอ้างอิงกี่ภาพเพื่อให้ตัวละครอนิเมะคงเส้นคงวา?

MiniMax H3 รับรูปภาพได้สูงสุด 9 ภาพ, คลิปวิดีโอสูงสุด 3 คลิป และคลิปเสียงสูงสุด 3 คลิป โดยมีเพดานสูงสุด 12 ไฟล์รวมทุกประเภท Veo 3.1's reference-to-video endpoint รับ 1 ถึง 3 ภาพ และการเลือกมันจะทำให้ duration ลดลงเหลือ 8 เป็นค่าเดียวที่ถูกต้อง สำหรับตัวละครอนิเมะที่ปรากฏซ้ำในซีรีส์ ความแตกต่างนั้นคือทุกสิ่งทุกอย่าง

MiniMax H3 มี open weights ดังนั้นฉันสามารถรันไปป์ไลน์อนิเมะในเครื่องได้ฟรีหรือไม่?

คุณสามารถดาวน์โหลดและรันมันได้ โดยมีข้อแม้สามประการ การอนุมานด้วยตัวเองจะทำงานที่ขอบสั้น 768 และขั้นตอน Context-IR และ Regenerate-2K ที่สร้างเอาต์พุต 2K ยังคงอยู่ฝั่ง API ความเร็วในเครื่องจริงนั้นแตกต่างกันอย่างมากตามการ์ด: ประมาณ 10 นาทีสำหรับคลิป 480p 10 วินาทีบน 4070 Ti Super, ประมาณ 3 นาทีบน 5080, ประมาณ 68 วินาทีบน RTX 6000 Pro ตามกระทู้ ComfyUI วันแรก และใบอนุญาตชุมชนไม่ครอบคลุมสหภาพยุโรป สหราชอาณาจักร เกาหลีใต้ หรือสหรัฐอเมริกาในปัจจุบัน ดังนั้นหากคุณอยู่ในหนึ่งในนั้น คุณต้องมีใบอนุญาตอย่างเป็นทางการก่อนการใช้เชิงพาณิชย์

โมเดลล่าสุด

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด