ฉันจ้องกระดานผู้นำของ Artificial Analysis สามกระดานเป็นเวลาสิบนาทีเพื่อพยายามหาว่าใครชนะจริงๆ
Text-to-video: Gemini Omni Flash ชนะ 5 คะแนน Image-to-video: Gemini ชนะ 2 คะแนน Video editing: MiniMax H3 ชนะ 9 คะแนน
จากนั้นฉันก็มองไปที่คอลัมน์ช่วงความเชื่อมั่น บวกหรือลบ 7 บวกหรือลบ 9 บวกหรือลบ 10
สามกระดาน สามช่องว่าง ทุกช่องว่างอยู่ภายในค่าความคลาดเคลื่อนของตัวเอง ในการโหวตแบบไม่เห็นภาพ โมเดลทั้งสองนี้คือโมเดลเดียวกัน
ฉันจึงปิดกระดานผู้นำและเปิดเมนูแบบเลื่อนลงแทน ช่องว่างนั้นไม่ใช่ 5 คะแนน ช่องว่างนั้นคือความละเอียดที่ต่างกันทั้งระดับ
ข้อสรุปสำคัญ
- ช่องว่างทั้งสามของ Artificial Analysis (+5, +2, +9, ภาพถ่ายเมื่อวันที่ 6 สิงหาคม 2026) อยู่ในช่วงความเชื่อมั่น ±7 ถึง ±10 ทั้งหมด ในแง่คุณภาพดิบแล้ว นี่คือการเสมอกัน ไม่ใช่ชัยชนะ
- H3 รองรับ 2K นานสูงสุด 15 วินาที และอัตราส่วนภาพหกแบบ API ของ Gemini Omni Flash จำกัดที่ 720p 10 วินาที และอัตราส่วนภาพสองแบบ ค่าเหล่านี้เป็นค่าที่กำหนดไว้ตายตัว ไม่ใช่ความคิดเห็น
- H3 รองรับเสียงเป็นอินพุต Gemini ไม่รองรับ Gemini มี
seedและthinking_levelH3 ไม่มีทั้งสองอย่าง - Gemini มี endpoint
video-editโดยเฉพาะที่แก้ไขคลิปต้นฉบับของคุณ เส้นทางการแก้ไขของ H3 คือreference-to-videoซึ่งสร้างใหม่โดยใช้คลิปของคุณเป็นข้อมูลอ้างอิง การทำงานทั้งสองไม่เหมือนกัน และรอบที่สองก็แสดงให้เห็น - มีเพียงหนึ่งในสองโมเดลนี้เท่านั้นที่มีน้ำหนักให้ดาวน์โหลด และไม่ใช่ของ Google

รอบแรกของการทดสอบ MiniMax H3 vs Gemini Omni Flash โมเดลทั้งสองสร้างภาพเคลื่อนไหวจากเฟรมแรกที่เหมือนกัน แสดงเคียงข้างกัน
รอบแรก: เฟรมแรกเดียวกัน พรอมต์เดียวกัน ระยะเวลาเดียวกัน ด้านซ้าย MiniMax H3 ที่ 2K ด้านขวา Gemini Omni Flash ที่ 720p แสดงเป็น GIF แบบไม่มีเสียง ไฟล์ที่ส่งออกทั้งสองมีเสียงในตัว และฝังเป็นวิดีโอที่เล่นได้ด้านล่าง นี่คือปัญหา โมเดลทั้งสองดีทั้งคู่
ทำไมช่องว่างในกระดานผู้นำระหว่าง MiniMax H3 vs Gemini Omni Flash ถึงถูกตีความผิด
เกือบทุกโพสต์เกี่ยวกับ MiniMax H3 vs Gemini Omni Flash ที่คุณจะพบจะอ้างอิงกระดานผู้นำหนึ่งกระดานและราคาหนึ่งราคา นิสัยทั้งสองอย่างนี้ให้คำตอบที่ผิด
นี่คือกระดานทั้งสามของ Artificial Analysis พร้อมคอลัมน์ที่ทุกคนข้ามไป
ตาราง A: MiniMax H3 vs Gemini Omni Flash บนกระดานผู้นำสามกระดานของ Artificial Analysis (พร้อมเสียง) ภาพถ่ายเมื่อวันที่ 6 สิงหาคม 2026
| กระดานผู้นำ | Gemini Omni Flash | MiniMax H3 | ช่องว่าง | อยู่ในช่วงความคลาดเคลื่อนหรือไม่? |
|---|---|---|---|---|
| Text-to-video | 1,243 (#1) ±7, 11,842 โหวต | 1,238 (#2) ±9, 6,830 โหวต | Gemini +5 | ใช่ |
| Image-to-video | 1,191 (#2) ±9, 6,506 โหวต | 1,189 (#3) ±10, 5,545 โหวต | Gemini +2 | ใช่ |
| Video editing | 1,123 (#2) ±5, 11,706 โหวต | 1,132 (#1) ±6, 9,128 โหวต | H3 +9 | ใช่ แค่เฉียด |
MiniMax H3 เป็นหนึ่งในโมเดลวิดีโอมากกว่า 30 โมเดลที่คุณสามารถรันแบบเคียงข้างกันด้วยพรอมต์เดียวกันใน Atlas Cloud model comparison — โดยแสดงราคาต่อวินาทีก่อนที่คุณจะสร้าง
คะแนน Elo จาก Artificial Analysis Video Arena (Artificial Analysis, สิงหาคม 2026) Image-to-video นำโดย Dreamina Seedance 2.0 720p ที่ 1,197 ดังนั้นทั้งสองโมเดลนี้ไม่ได้ครองตำแหน่งนั้น นี่คือคะแนนโหวตจากฝูงชนแบบหมุนเวียน และมันเปลี่ยนแปลง ซึ่งเป็นเหตุผลว่าทำไมช่องว่าง 5 คะแนนจึงไม่ใช่คำตัดสิน
การนำ 5 คะแนนโดยมีช่วง ±9 หมายความว่าอันดับอาจพลิกในสัปดาห์หน้าเพียงเพราะสัญญาณรบกวนจากการโหวต นั่นไม่ใช่ "Gemini ดีกว่าใน text-to-video" นั่นคือการโยนเหรียญที่มีกระดานคะแนนติดอยู่
อีกสามสิ่งที่ผู้คนเข้าใจผิด:
คอลัมน์ดอลลาร์ต่อนาทีไม่ใช่สิ่งที่คุณจ่าย Artificial Analysis ระบุ $6.00/นาทีสำหรับ Gemini และ $7.80/นาทีสำหรับ H3 คอลัมน์นั้นปรับให้เป็นค่าใช้จ่ายของวิดีโอ 1080p หนึ่งนาทีที่การตั้งค่าเริ่มต้น Gemini Omni Flash ไม่สามารถสร้าง 1080p ได้เลย ดังนั้นตัวเลขจึงเป็นค่าประมาณจากการสร้างแบบจำลอง ไม่ใช่ใบแจ้งหนี้ เปรียบเทียบผลงานที่ส่งมอบได้ ไม่ใช่วินาที
กระดานเดียวไม่ใช่โมเดล H3 อยู่อันดับสอง สาม และหนึ่งบนกระดานสามกระดาน Gemini อยู่อันดับหนึ่ง สอง และสอง อ้างอิงเพียงกระดานเดียวคุณก็สามารถพิสูจน์สิ่งที่คุณเชื่ออยู่แล้วได้
"Omni" ไม่ได้หมายถึง "กินได้ทุกอย่าง" เป็นชื่อที่ดีและทำให้เข้าใจผิด หนึ่งในสองโมเดลนี้รับไฟล์เสียงเป็นอินพุต ไม่ใช่โมเดลที่มีคำว่า "omni" ในชื่อ
สเปกชีต MiniMax H3 vs Gemini Omni Flash ที่ไม่มีใครพิมพ์
ถ้าคะแนน Elo แยกทั้งสองโมเดลไม่ออก ตารางข้อจำกัดก็ทำได้ ฉันดึงสคีมาอินพุตสดของทั้งสองโมเดล แทนที่จะเชื่อถือโพสต์เปิดตัวใดๆ และความแตกต่างนั้นไม่ใช่เรื่องเล็กน้อย
ตาราง B: ข้อจำกัดแบบตายตัวของ MiniMax H3 vs Gemini Omni Flash อ่านจากสคีมา API สดเมื่อวันที่ 6 สิงหาคม 2026
| ข้อจำกัด | MiniMax H3 | Gemini Omni Flash |
|---|---|---|
| ความละเอียด | 768P หรือ 2K | 720p และนั่นคือค่าเดียวใน enum |
| ระยะเวลา | 4 ถึง 15 วินาที | 3 ถึง 10 วินาที |
| อัตราส่วนภาพ | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9 และ 9:16 เท่านั้น |
| เส้นทางการแก้ไข | reference-to-video (สร้างใหม่โดยใช้ข้อมูลอ้างอิง) | video-edit endpoint เฉพาะ (แก้ไขไฟล์ต้นฉบับของคุณ) |
| การควบคุมเฟรมสุดท้าย | รองรับ end_image | ไม่มี |
| ข้อจำกัดของข้อมูลอ้างอิง | ≤9 รูป, ≤3 วิดีโอ, ≤3 เสียง, รวม 12 ไฟล์ | 1 ถึง 10 รูป |
| อินพุตเสียง | ใช่ | ไม่ |
| การทำซ้ำด้วย seed | ไม่ | ใช่ |
| thinking_level | ไม่ | ใช่ (default / high / low) |
| น้ำหนักเปิด | ใช่ บน Hugging Face | ไม่ |
อ่านตารางนั้นอย่างตรงไปตรงมา Gemini ชนะสามแถวอย่างชัดเจน Seeds ที่สามารถทำซ้ำได้มีความสำคัญหากคุณกำลังสร้างไปป์ไลน์ที่ต้องเรนเดอร์เฟรมเดียวกันสองครั้ง endpoint video-edit จริงเป็นเครื่องมือที่แตกต่างอย่างแท้จริงจากการสร้างใหม่แบบมีเงื่อนไขด้วยข้อมูลอ้างอิง และ thinking_level ให้คุณปรับคุณภาพที่ H3 ไม่มี
H3 ชนะห้าแถว และแถวเหล่านั้นคือแถวที่ตัดสินว่าคุณสามารถส่งมอบไฟล์ที่ลูกค้าต้องการได้หรือไม่
ฉันรันทุกอย่างด้านล่างบน Atlas Cloud เพราะโมเดลทั้งสองอยู่เบื้องหลัง endpoint /api/v1/model/generateVideo เดียวกันที่นั่น ซึ่งหมายถึงลูป polling หนึ่งลูปและ header auth หนึ่งตัวสำหรับการทดสอบทั้งหมด การเปลี่ยนโมเดลเป็นเพียงการเปลี่ยนสตริง model รายละเอียดนั้นคือเหตุผลทั้งหมดที่ "ใช้ทั้งสองอย่าง" เป็นคำตอบที่สมจริงมากกว่าการหลบเลี่ยง
ตาราง C: ราคาของแต่ละ endpoint ในการทดสอบนี้ ยืนยันจากราคาสดเมื่อวันที่ 6 สิงหาคม 2026
| Endpoint | ราคา | คลิป 10 วินาทีในการทดสอบนี้ |
|---|---|---|
| openai/gpt-image-2/text-to-image | $0.009 / รูป | $0.01 |
| minimax/h3/image-to-video | $0.14 / วินาที | $1.40 |
| minimax/h3/reference-to-video | $0.14 / วินาที | $1.40 |
| google/gemini-omni-flash/image-to-video | $0.13 / วินาที | $1.30 |
| google/gemini-omni-flash/video-edit | $0.14 / วินาที | $1.40 |
| google/gemini-omni-flash/text-to-video | $0.125 / วินาที | ไม่ได้ใช้ |
| minimax/h3/text-to-video | $0.14 / วินาที | ไม่ได้ใช้ |
ไม่มีโมเดลใดมีส่วนลดในเดือนนี้ Gemini ยังมีระดับนักพัฒนาที่ถูกกว่า ($0.112/วินาที สำหรับ text-to-video และ image-to-video, $0.12/วินาที สำหรับ reference-to-video) H3 ไม่มีระดับที่เทียบเท่า
เส้นน้ำหนักเปิดที่ Gemini Omni Flash ข้ามไม่ได้ น้ำหนักของ H3 เผยแพร่บน Hugging Face (MiniMax, สิงหาคม 2026): Omni Transformer แบบหนาแน่นสตรีมเดียว 33B พร้อมกับ text encoder Qwen3-VL-32B, VAE ภาพ และ VAE เสียง ข้อควรระวังสองข้อสำคัญกว่าขนาดดาวน์โหลด ประการแรก สิ่งที่คุณโฮสต์เองจะทำงานที่ด้านสั้น 768 พิกเซล ขั้นตอน Context-IR preprocessing และโมดูล Regenerate-2K ไม่ได้รวมอยู่ในการเผยแพร่ และเอาต์พุต 2K มาจากสองสิ่งนี้ ประการที่สอง ใบอนุญาตชุมชนปัจจุบันไม่ครอบคลุมสหภาพยุโรป สหราชอาณาจักร เกาหลีใต้ หรือสหรัฐอเมริกา และมีแบบฟอร์มสมัครแยกต่างหากสำหรับดินแดนเหล่านั้น อ่านก่อนที่คุณจะสร้างผลิตภัณฑ์บนมัน Gemini Omni Flash ไม่มีการสนทนาที่เทียบเท่า เพราะไม่มีไฟล์ให้ดาวน์โหลด
ตำแหน่งน้ำหนักเปิดนั้น เมื่อรวมกับราคาที่ aggressive คือเรื่องราวเชิงกลยุทธ์ทั้งหมดของการเปิดตัว (South China Morning Post, สิงหาคม 2026)
ทดสอบการแก้ไข MiniMax H3 vs Gemini Omni Flash ด้วยตัวเอง
นี่คือส่วนที่ไม่มีใครทดสอบ ทุกคน benchmarking การสร้างครั้งแรก ไม่มีใคร benchmarking การสร้างครั้งที่สอง
งานจริงไม่ใช่พรอมต์เดียว งานจริงคือคลิปที่คุณชอบอยู่แล้ว บวกกับลูกค้าที่ตอบกลับว่า "ชอบมาก เปลี่ยนป้ายเป็น 24H และผ้ากันเปื้อนของเธอเป็นสีแดงได้ไหม" ประโยคเดียวนี้คือจุดที่โมเดลทั้งสองนี้หยุดใช้แทนกันได้ และมันก็เป็นงานเดียวกับที่กระดานผู้นำ video editing วัดพอดี
ฉากนี้โหดร้ายโดยเจตนา: แผงขายก๋วยเตี๋ยวกลางคืนที่เปียกฝน แม่ค้าพูดตรงเข้าเลนส์ ป้ายทาสีมือที่มีคำอ่านได้อยู่ข้างหลังเธอ ไอน้ำจากน้ำซุป ฝนบนหลังคา หนึ่งเฟรมที่ทดสอบการซิงค์ปาก ความเสถียรของข้อความบนหน้าจอ การเคลื่อนไหวที่ลื่นไหล และเสียงรอบข้างแบบหลายชั้นพร้อมกัน
ทั้งสองโมเดลได้รับเฟรมแรกที่เหมือนกัน พรอมต์เดียวกัน และบันทึกการแก้ไขเดียวกัน ทุกการรันด้านล่างคือ 10 วินาที ซึ่งเป็นเพดานของ Gemini Omni Flash และอยู่ภายในขีดจำกัดของ H3 อย่างสบาย
ขั้นตอนที่ 1: ล็อกเฟรมแรกด้วย GPT Image 2
โมเดลทั้งสองต้องเริ่มจากภาพเดียวกัน มิฉะนั้นรอบแรกจะวัดโชคในการจัดองค์ประกอบ ไม่ใช่ตัวโมเดล เปิด GPT Image 2 playground ตั้งค่า quality เป็น high และ ratio เป็น 16:9 แล้ววางข้อความนี้:
Plain1Photoreal night street-food stall in heavy rain, shot on a 35mm lens at f/2.0. A woman in her late thirties in an indigo canvas apron stands behind a steaming noodle counter, looking straight into the lens, mid-sentence. Behind her a hand-painted tin light-box sign glows warm amber with the words "OPEN LATE" in clean bold sans-serif capitals. Rain streaks through the sodium streetlight, steam rises off the broth pot, wet asphalt reflects red and green neon from across the street. Shallow depth of field, practical lighting only, slight lens haze, natural skin texture, no text anywhere else in the frame. 16:9.

GPT Image 2 playground บน Atlas Cloud พร้อมพรอมต์แผงขายก๋วยเตี๋ยวทางซ้าย และเฟรมแรกที่สร้างในแผงเอาต์พุต
GPT Image 2 บน Atlas Cloud: พรอมต์ทางซ้าย เฟรมแรกที่ใช้ร่วมกันใน OUTPUT ราคาสำหรับขั้นตอนนี้ , $0.009

เฟรมแรกที่สร้าง: ผู้หญิงในผ้ากันเปื้อนสีครามอยู่ด้านหลังเคาน์เตอร์ก๋วยเตี๋ยวที่มีไอน้ำในตอนกลางคืนท่ามกลางสายฝน โดยมีป้าย OPEN LATE ทาสีมือเรืองแสงอยู่ด้านหลัง
อินพุตเดียวที่โมเดลทั้งสองได้รับ สังเกตสองสิ่งที่การแก้ไขจะกำหนดเป้าหมาย: ป้าย "OPEN LATE" และผ้ากันเปื้อนสีคราม สร้างด้วย openai/gpt-image-2/text-to-image
ขั้นตอนที่ 2: รอบแรกบน MiniMax H3
ไปที่ MiniMax H3 playground เลือกงาน image-to-video อัปโหลดเฟรมจากขั้นตอนที่ 1 และตั้งค่า resolution เป็น 2K, duration เป็น 10, ratio เป็น adaptive (enum image-to-video มีเพียง adaptive) พรอมต์:
Plain1The vendor looks into the lens and says, in a warm tired voice: "Broth's been on since four this morning. Sit down, it's still raining." She lifts the ladle as she speaks. Steam curls up across the frame. Rain keeps falling on the awning behind her. The camera holds still, no push, no pan. Ambient audio: rain on canvas, broth simmering, distant traffic, her voice close and dry.

MiniMax H3 image-to-video playground บน Atlas Cloud ที่เลือกความละเอียด 2K และคลิปที่เสร็จแล้วกำลังเล่นในแผงเอาต์พุต
MiniMax H3 image-to-video บน Atlas Cloud: เลือก 2K, คลิปที่เสร็จแล้วใน OUTPUT การจับภาพนี้รันที่ค่าเริ่มต้น 8 วินาทีของ playground และราคา $1.12; เวอร์ชัน 10 วินาทีที่ใช้สำหรับการเปรียบเทียบฝังอยู่ด้านล่างและราคา $1.40
MiniMax H3, รอบแรก, 2K, 10 วินาที เปิดเสียง: บทสนทนา เสียงฝน และน้ำซุปล้วนถูกสร้างขึ้นในรอบเดียวกัน ไม่ได้วางซ้อนทีหลัง
ขั้นตอนที่ 3: รอบแรกบน Gemini Omni Flash เฟรมเดียวกัน คำเดียวกัน
เปิด Gemini Omni Flash playground เลือก image-to-video อัปโหลดเฟรมจากขั้นตอนที่ 1 เดียวกัน และวางพรอมต์จากขั้นตอนที่ 2 โดยไม่เปลี่ยนตัวอักษร การตั้งค่า: resolution 720p, duration 10, aspect_ratio 16:9, thinking_level default, seed -1
สองสิ่งที่ควรสังเกตขณะที่คุณอยู่ในฟอร์มนั้น เพราะมันคือบทความแบบย่อส่วน เมนูแบบเลื่อนลง resolution มีตัวเลือกเดียวเท่านั้น ฟิลด์ duration หยุดที่ 10 ฉันไม่ได้เลือก 720p แทนที่จะเลือกสิ่งที่ดังกว่า ไม่มีอะไรอื่นให้เลือก
หมายเหตุเกี่ยวกับสิ่งที่ขาดหายไปที่นี่: ฉันไม่สามารถจับภาพหน้าจอ playground ที่รันเสร็จแล้วสำหรับขั้นตอน Gemini ใดๆ ได้ สภาพแวดล้อม staging ที่ฉันใช้จับภาพหน้าจอส่งคืน 403 PERMISSION_DENIED จากฝั่ง Google ในการพยายามทั้งสามครั้ง ดังนั้นภาพ Gemini ที่ฉันมีจึงแสดงแผง OUTPUT ที่ล้มเหลว และฉันจะไม่แต่งให้ดูเหมือนการรันที่สำเร็จ คลิปด้านล่างเป็นของจริง สร้างผ่าน production API ด้วยการตั้งค่าที่ระบุไว้ข้างต้น สองขั้นตอน H3 จับภาพได้อย่างสะอาดและภาพหน้าจอเหล่านั้นเป็นของจริง
Gemini Omni Flash, รอบแรก, 720p, 10 วินาที, อินพุตเหมือนกัน เล่นคลิปนี้ต่อจากคลิป H3 ด้านบนและตัดสินเสียงด้วยตัวคุณเอง
ขั้นตอนที่ 4: รอบสอง ส่งการแก้ไขไปยัง Gemini Omni Flash
นี่คือรอบที่สำคัญ เปลี่ยนไปใช้งาน video-edit บนหน้าโมเดล Gemini เดียวกัน อัปโหลด คลิปที่ Gemini ผลิตเองในขั้นตอนที่ 3 เป็นอินพุต video ตั้งค่า resolution 720p และ thinking_level high (คำสั่งแก้ไขสองส่วนเป็นกรณีซับซ้อนที่ตัวเลือกนี้มีไว้) วางบันทึกนี้เหมือนกับที่ลูกค้าจะส่ง:
Plain1Keep this exact shot: same camera position, same woman, same face, same rain, same lighting, same audio. Change the hand-painted sign so it reads "OPEN 24H" instead of "OPEN LATE", in the same painted style and the same amber glow. Change her apron from indigo blue to deep crimson. Change nothing else in the frame.
Gemini Omni Flash หลังจากบันทึกการแก้ไข ดูที่ป้าย จากนั้นดูผ้ากันเปื้อน จากนั้นตรวจสอบว่ามีสิ่งอื่นใดเคลื่อนไหวหรือไม่
ขั้นตอนที่ 5: รอบสอง ส่งการแก้ไขเดียวกันไปยัง MiniMax H3
นี่คือความแตกต่างเชิงโครงสร้างที่ตรงไปตรงมา และคุณควรรู้ก่อนอ่านผลลัพธ์ H3 ไม่มี endpoint video-edit เส้นทางการแก้ไขของมันคือ reference-to-video: คุณส่งคลิปต้นฉบับเป็นข้อมูลอ้างอิง และมันสร้างวิดีโอใหม่โดยมีเงื่อนไขจากข้อมูลอ้างอิงนั้น มันไม่ได้แก้ไขไฟล์ของคุณ มันกำลังสร้างไฟล์ใหม่ที่ควรจะดูเหมือนของคุณ
บนหน้า MiniMax H3 เลือกงาน reference-to-video เพิ่ม คลิปที่ H3 ผลิตในขั้นตอนที่ 2 ลงใน refers เป็นข้อมูลอ้างอิงวิดีโอ จากนั้นตั้งค่า resolution 2K, duration 10, ratio adaptive วางพรอมต์จากขั้นตอนที่ 4 โดยไม่แก้ไขใดๆ
ขั้นตอนนี้ไม่มีภาพหน้าจอ playground เช่นกัน ด้วยเหตุผลที่แตกต่างและน่าเบื่อกว่า: เบราว์เซอร์แบบไม่มีหัวที่ฉันใช้จับภาพขัดข้องสามครั้งในตัวอัปโหลดข้อมูลอ้างอิงขณะโหลดข้อมูลอ้างอิงวิดีโอ การรันเองผ่าน API โดยไม่มีปัญหา
MiniMax H3 หลังจากบันทึกการแก้ไขเดียวกัน ผ่าน reference-to-video ที่ 2K

ภาพเคียงข้างกันของรอบสอง: ผลลัพธ์ video-edit ของ Gemini Omni Flash ถัดจากผลลัพธ์ reference-to-video ของ MiniMax H3 จากบันทึกการแก้ไขเดียวกัน
รอบสองเคียงข้างกัน, GIF ไม่มีเสียง ซ้าย Gemini Omni Flash ผ่าน video-edit, ขวา MiniMax H3 ผ่าน reference-to-video ทั้งสองได้รับประโยคเดียวกันให้ทำงาน
สิ่งที่เกิดขึ้นจริงในรอบสอง ฉันคาดหวังว่า H3 จะแพ้ในรอบนี้ การสร้างใหม่แบบมีเงื่อนไขด้วยข้อมูลอ้างอิงเป็นเครื่องมือที่ทื่อกว่า endpoint แก้ไขจริง และ "สร้างคลิปใหม่ทั้งหมดและหวังว่ามันจะลงเอยที่เดิม" คือวิธีที่คุณจะได้ใบหน้าที่แตกต่าง กล้องที่ขยับ และลูกค้าที่ถามว่าเกิดอะไรขึ้นกับช็อต
นั่นไม่ใช่สิ่งที่กลับมา โมเดลทั้งสองทำงานได้สำเร็จ และทั้งคู่ก็ทำได้อย่างสะอาด
video-edit ของ Gemini ทำงานตามที่โฆษณาไว้ทุกประการ ป้ายอ่านว่า OPEN 24H ด้วยตัวอักษรทาสีมือแบบเดียวกัน กับแสงสีเหลืองอำพันเดียวกัน และการผุกร่อนบนสังกะสีเดียวกัน ผ้ากันเปื้อนเป็นสีแดงเข้ม ทุกอย่างอื่นไม่ถูกแตะต้อง: ใบหน้าเดียวกัน การแสดงออกเดียวกัน มุมทัพพีเดียวกัน รูปร่างไอน้ำเดียวกัน ฝนเดียวกัน ไฟท้ายเดียวกันในพื้นหลัง มันอ่านว่าเป็นไฟล์ต้นฉบับที่มีการแก้ไขลึกเพียงสองพิกเซล เพราะนั่นคือสิ่งที่มันเป็นโดยพื้นฐาน
reference-to-video ของ H3 ผลิตการเปลี่ยนแปลงสองอย่างเดียวกันและยึดช็อตได้ดีกว่าที่สถาปัตยกรรมแนะนำว่าควรจะเป็น ป้ายเปลี่ยน ผ้ากันเปื้อนเปลี่ยน และตลอด 10 วินาที การจัดเฟรม การเทน้ำซุปจากทัพพี ขนนกไอน้ำ และใบหน้าของเธอยังคงตรงกับคลิปในรอบแรก ถ้ามีการเลื่อนลอย ฉันไม่สามารถหาได้โดยการก้าวผ่านเฟรม
ดังนั้นรอบที่สองจึงเป็นสถิติเสมอกันครั้งที่สาม และฉันจะไม่แสร้งทำเป็นอย่างอื่นเพื่อให้เรื่องราวดูเรียบร้อยขึ้น สิ่งที่แยกเอาต์พุตทั้งสองออกไม่ใช่คุณภาพการแก้ไข แต่คือ H3 ส่งคืน 2560x1440 พร้อมแทร็กสเตอริโอ 32 kHz และ Gemini ส่งคืน 1280x720 คำสั่งเดียวกัน ความสำเร็จเดียวกัน ผลงานที่ส่งมอบต่างกัน
ข้อควรระวังที่ซื่อสัตย์ประการหนึ่งเกี่ยวกับวิธีการ: นี่คือการแก้ไขครั้งเดียวในช็อตเดียว ไม่ใช่การศึกษาที่มีการควบคุม การเปลี่ยนแปลงสองส่วนในป้ายและเสื้อผ้าเป็นการแก้ไขที่ค่อนข้างเป็นมิตร กรณีที่ยากกว่า (การลบวัตถุที่กล้องเคลื่อนผ่าน การเปลี่ยนบางสิ่งที่ตัวแบบบัง การแก้ไขสี่รอบที่ซ้อนทับกัน) คือจุดที่ endpoint แก้ไขเฉพาะควรนำหน้า และจุดที่การสร้างใหม่ควรเริ่มสั่นคลอน รันของคุณก่อนตัดสินใจ
ความแตกต่างอีกสามอย่างระหว่าง MiniMax H3 vs Gemini Omni Flash ที่ควรทดสอบ
รอบที่สองคือความแตกต่างที่เปลี่ยนการส่งมอบ อีกสามอย่างคุ้มค่ากับเวลายี่สิบนาทีของเครดิตของคุณเอง
ป้อนไฟล์เสียง reference-to-video ของ H3 รองรับคลิปเสียงสูงสุดสามคลิป ความยาว 2 ถึง 15 วินาทีต่อคลิป ตราบใดที่มีข้อมูลอ้างอิงภาพหรือวิดีโออย่างน้อยหนึ่งรายการมาด้วย ซึ่งหมายความว่าคุณสามารถส่งการบันทึกเสียงจริงและให้ตัวละครแสดงมันได้ Gemini Omni Flash ไม่มีฟิลด์อินพุตเสียงใน endpoint ใดๆ ในสี่ endpoint ดังนั้นจึงไม่สามารถรันการเปรียบเทียบนี้ได้เลย นั่นไม่ใช่การเสียคะแนนสำหรับ Google มันคือความสามารถที่ไม่มีอยู่
ขอ 21:9 enum ratio ของ reference-to-video ของ H3 มี 21:9, 16:9, 4:3, 1:1, 3:4 และ 9:16 enum aspect_ratio ของ Gemini มี 16:9 และ 9:16 หากผลงานของคุณคือลำดับไตเติ้ลจอกว้างหรือคัทโซเชียล 1:1 หนึ่งในสองโมเดลนี้ไม่ได้อยู่ในบทสนทนา
ล็อก seed และรันซ้ำ อันนี้กลับกัน Gemini เปิดเผย seed; H3 ไม่เปิดเผยใน endpoint ใดๆ หากคุณกำลังสร้างไปป์ไลน์ที่คำขอเดียวกันต้องส่งคืนเฟรมเดียวกันในวันอังคารเหมือนที่ส่งคืนในวันจันทร์ Gemini ให้คุณมีที่จับและ H3 ไม่ให้อะไรเลย สำหรับการทดสอบการถดถอย, ตัวแปรสำเนา A/B หรือฟาร์มเรนเดอร์อัตโนมัติใดๆ นั่นคือข้อได้เปรียบที่แท้จริงและมันอยู่ฝั่ง Google
การทดสอบ MiniMax H3 vs Gemini Omni Flash มีค่าใช้จ่ายเท่าไร
การทดลองทั้งหมดข้างต้น การสร้างวิดีโอสี่ครั้งและภาพหนึ่งครั้ง มีค่าใช้จ่ายประมาณ $5.51 เฟรมแรกหนึ่งเฟรมที่ $0.009, คลิปรอบแรก 10 วินาทีสองคลิปที่ $1.40 และ $1.30, คลิปรอบสอง 10 วินาทีสองคลิปที่ $1.40 ต่อคลิป
ต่อวินาที Gemini ถูกกว่า: $0.125 ถึง $0.14 เทียบกับ $0.14 คงที่ของ H3 ดังนั้นประมาณ 7 ถึง 11 เปอร์เซ็นต์น้อยกว่าขึ้นอยู่กับ endpoint ตัวเลขนั้นเป็นจริงและมันก็ไร้ประโยชน์เกือบทั้งหมดในตัวมันเอง
นี่คือเหตุผล สมมติว่าผลงานที่ส่งมอบคือโอเพนเนอร์ภาพยนตร์ 21:9 ยาว 15 วินาทีที่ 2K H3 เรนเดอร์เป็นคลิปเดียว Gemini ไม่สามารถเรนเดอร์ได้เลย: ไม่ใช่ความละเอียด ไม่ใช่ระยะเวลา ไม่ใช่อัตราส่วนภาพ คุณจะต้องต่อคลิป 10 วินาทีและ 5 วินาที 16:9 เข้าด้วยกัน ครอปเพื่อแกล้งเป็นจอกว้าง และส่ง 720p ราคาต่อวินาทีของสิ่งที่คุณส่งมอบไม่ได้ไม่ใช่การประหยัด
พลิกกลับกัน สมมติว่าผลงานที่ส่งมอบคือคัทโซเชียล 16:9 ที่จะผ่านบันทึกการแก้ไขสี่รอบและต้องกลับมาเหมือนเดิมทุกไบต์เมื่อทีมกฎหมายขอให้เรนเดอร์ใหม่ในสามสัปดาห์ video-edit ของ Gemini บวก seed ถูกสร้างขึ้นสำหรับลูปนั้นโดยเฉพาะ และมีราคาถูกกว่าต่อวินาทีในขณะที่ทำ
ตาราง D: งาน MiniMax H3 vs Gemini Omni Flash แต่ละงานควรส่งไปที่ไหน
| งานที่อยู่ตรงหน้าคุณ | ส่งไปที่ |
|---|---|
| งาน 2K | MiniMax H3 |
| ช็อตเดียวนานกว่า 10 วินาที | MiniMax H3 |
| การจัดเฟรม 21:9, 4:3, 1:1 หรือ 3:4 | MiniMax H3 |
| การป้อนแทร็กเสียงจริง | MiniMax H3 |
| การโฮสต์เองบน GPU ของคุณเอง | MiniMax H3 |
| การลงจอดบนเฟรมสุดท้ายที่เฉพาะเจาะจง | MiniMax H3 |
| การแก้ไขหลายรอบแบบสนทนา | Gemini Omni Flash |
| การรักษาส่วนที่ไม่ถูกแตะต้องของคลิป | Gemini Omni Flash |
| การเรนเดอร์ที่ทำซ้ำได้ผ่าน seed | Gemini Omni Flash |
| ฟอร์มสั้น 16:9 ธรรมดาในอัตราต่อวินาทีต่ำสุด | Gemini Omni Flash |
บทสรุปของบทความนี้คือตารางนั้น ไม่ใช่คะแนน ถ้าเกณฑ์ชี้วัดไม่สามารถแยกโมเดลทั้งสองได้มากกว่าค่าความคลาดเคลื่อนของตัวเอง เกณฑ์ชี้วัดนั้นได้บอกทุกอย่างที่มันรู้แล้ว และสเปกชีตก็เข้ามาแทนที่
สำหรับมุมมองที่กว้างขึ้นว่า H3 อยู่ตรงไหนเมื่อเทียบกับคู่แข่งรายอื่น โปรดดู การวิเคราะห์ทางเลือกของ MiniMax H3 ซึ่งครอบคลุมโมเดลที่เอาชนะมันในกระดานที่มันไม่ได้นำ
คำถามที่พบบ่อย
MiniMax H3 ดีกว่า Gemini Omni Flash หรือไม่?
การโหวตแบบไม่เห็นภาพไม่สามารถแยกพวกมันออกจากกันได้ บนกระดานผู้นำสามกระดานของ Artificial Analysis ช่องว่างคือ 5, 2 และ 9 คะแนน Elo และทุกช่องว่างอยู่ในช่วงความเชื่อมั่น ±7 ถึง ±10 เลือกตามสเปก ไม่ใช่อันดับ เพดานความละเอียด ขีดจำกัดระยะเวลา และรายการอัตราส่วนภาพจะเปลี่ยนผลงานของคุณ 5 คะแนน Elo จะไม่เปลี่ยน
ไหนถูกกว่ากัน MiniMax H3 หรือ Gemini Omni Flash?
ต่อวินาที Gemini ถูกกว่า บน Atlas Cloud ราคา $0.125 ถึง $0.14 ต่อวินาที เทียบกับ $0.14 คงที่ของ H3 โดยมีระดับนักพัฒนาที่ $0.112 ต่อวินาทีที่ H3 ไม่มีเทียบเท่า แต่ Gemini จำกัดที่ 720p, 10 วินาที และอัตราส่วนภาพสองแบบ ดังนั้นสำหรับผลงานหลายๆ อย่าง คุณไม่ได้เปรียบเทียบผลิตภัณฑ์เดียวกัน ตั้งราคาชิ้นงานที่เสร็จแล้ว ไม่ใช่วินาที
Gemini Omni Flash สามารถสร้างวิดีโอ 1080p, 2K หรือ 15 วินาทีได้หรือไม่?
ไม่ได้ พารามิเตอร์ resolution ของ API มีค่าที่ถูกต้องตามกฎหมายเพียงค่าเดียวคือ 720p และ duration รองรับ 3 ถึง 10 วินาที MiniMax H3 มี 768P หรือ 2K และ 4 ถึง 15 วินาที สิ่งเหล่านี้เป็นข้อจำกัด enum ที่อ่านจากสคีมาสดเมื่อวันที่ 6 สิงหาคม 2026 ไม่ใช่ความคิดเห็นของกองบรรณาธิการ และ Google อาจยกเลิกในภายหลัง
ฉันสามารถโฮสต์ Gemini Omni Flash เองได้เหมือนกับที่ฉันโฮสต์ MiniMax H3 ได้หรือไม่?
ไม่ได้ น้ำหนักของ H3 อยู่บน Hugging Face และทำงานในเครื่องที่ด้านสั้น 768 พิกเซล ขั้นตอน Context-IR และโมดูล Regenerate-2K ที่ผลิตเอาต์พุต 2K ไม่ได้อยู่ในการเผยแพร่และยังคงอยู่ฝั่ง API นอกจากนี้ ให้ตรวจสอบใบอนุญาต: ปัจจุบันไม่ครอบคลุมสหภาพยุโรป สหราชอาณาจักร เกาหลีใต้ หรือสหรัฐอเมริกาโดยไม่ต้องสมัครแยกต่างหาก
ฉันต้องเลือกเพียงหนึ่งเดียวหรือไม่?
ไม่ และตารางแยกตามงานด้านบนคือคำตอบที่ดีกว่า โมเดลทั้งสองอยู่เบื้องหลัง endpoint generateVideo เดียวกันบน Atlas Cloud ดังนั้นการรันทั้งสองหมายถึงลูป polling หนึ่งลูปและสตริง model ที่แตกต่างกัน ไม่ใช่การรวมสองระบบ การกำหนดเส้นทางตามผลงานดีกว่าการเดิมพันบนกระดานผู้นำที่เปลี่ยนทุกสัปดาห์






