MiniMax H3 2K vs 768P: ฉันรันพรอมต์เดียวกันสองครั้งและได้ภาพยนตร์สองเรื่องที่แตกต่างกัน

วัดเมื่อ 2026-08-05: MiniMax H3 2K เทียบกับ 768P ให้ผลลัพธ์ 1344x768 เทียบกับ 2560x1440 ที่ราคา $0.40 เทียบกับ $0.56 เหตุใดร่างราคาถูกจึงไม่ใช่ตัวอย่างของผลลัพธ์สุดท้าย และวิธีการแก้ไข

ภาพถ่ายพิมพ์สองรูปของขวด Cold Brew บนโต๊ะไม้

ภาพพิมพ์สองภาพของขวด Cold Brew ภาพเดียวกันที่วางอยู่บนเคาน์เตอร์ร้านกาแฟ ภาพหนึ่งนุ่มนวล อีกภาพคมชัด มีใบเสร็จวางอยู่ระหว่างกลาง

ภาพพิมพ์สองภาพของช็อตเดียวกัน ภาพหนึ่งนุ่ม อีกภาพคม บน MiniMax H3 ช่องว่างนั้นไม่ใช่แถบเลื่อนคุณภาพ สร้างด้วย openai/gpt-image-2/text-to-image

ผมส่งพรอมต์เดียวกันสองครั้ง สิ่งเดียวที่เปลี่ยนคือเมนูแบบเลื่อนลง: 768P แล้วก็ 2K

รอบแรกเสียค่าใช้จ่าย $0.40 และได้ผลลัพธ์กลับมาใน 130 วินาที รอบที่สองเสีย $0.56 และใช้เวลา 181 วินาที จากนั้นผมวางสองเฟรมไว้ข้างกันและรู้สึกว่ามีอะไรผิดปกติ ขวดยังอยู่ ฉลากยังอยู่ พิมพ์เล็กๆ ทุกอย่าง แต่เคาน์เตอร์เปลี่ยนจากไม้โทนอุ่นเป็นหินสีซีด มีชั้นวางของปรากฏขึ้นด้านหลังบาริสต้า หยดน้ำบนกระจกอยู่ทั่วทุกที่ และแสงเปลี่ยนสี

ผมไม่ได้ประหยัดเงินจากการได้แบบร่าง ผมถ่ายได้ฟิล์มสองแบบที่แตกต่างกัน

นี่ไม่ใช่บั๊ก นี่คือความหมายที่แท้จริงของ "2K" บน H3 และเมื่อคุณเข้าใจแล้ว คำแนะนำมาตรฐานที่ทุกคนให้ไว้ คือ "ทำแบบร่างถูกๆ แล้วค่อยทำแบบละเอียดแพง" ก็จะพังทลายลง ด้านล่างคือตัวเลขทั้งหมดจากการทดสอบนั้น พร้อมการเปลี่ยนแปลงหนึ่งอย่างที่ทำให้การทำแบบร่างถูกๆ ใช้ได้ผล

ข้อสรุปสำคัญ (ตัวเลขทั้งหมดวัดจาก Atlas Cloud, 2026-08-05)

  • 768P ให้ความละเอียด 1344x768, 2K ให้ 2560x1440 สำหรับคำขอแบบ 16:9 นั่นคือพิกเซลมากกว่า 3.6 เท่า และบิตเรตวิดีโอมากกว่า 3.6 เท่า
  • การคิดเงินคือ $0.40 เทียบกับ $0.56 สำหรับคลิปยาว 4 วินาที ดังนั้น $0.10/วินาที เทียบกับ $0.14/วินาที 768P ถูกกว่า 29% ต่อวินาที ไม่ใช่ครึ่งราคา
  • 768P กลับมา เร็วกว่า 28% สำหรับคู่ข้อความเป็นวิดีโอ (130 วินาที เทียบกับ 181 วินาที) และเร็วกว่า 17% สำหรับคู่ภาพเป็นวิดีโอ (194 วินาที เทียบกับ 234 วินาที)
  • การแปลงข้อความเป็นวิดีโอที่ 768P และ 2K ด้วยพรอมต์เดียวกันให้ ผลลัพธ์สองแบบที่แตกต่างกัน ไม่ใช่คุณภาพสองระดับของผลลัพธ์เดียวกัน แบบร่าง 768P เปล่าๆ ไม่ได้แสดงตัวอย่างผลลัพธ์ 2K สุดท้ายของคุณ
  • ล็อกเฟรมแรกด้วยภาพเป็นวิดีโอ แล้วความคลาดเคลื่อนจะหยุด ชุดเดียวกัน เฟรมเดียวกัน ตำแหน่งฉลากเดียวกัน และ 2K ใช้พิกเซลพิเศษตรงจุดที่ MiniMax บอกไว้: พิมพ์เล็กๆ
  • 768P ไม่ได้ถูกจำกัดการเข้าถึง ทั้งสองระดับมีอยู่ใน enum resolution และเลือกได้ในเมนูแบบเลื่อนลง ณ วันที่ 2026-08-05 ไม่ว่าบทความสรุปเก่าๆ จะยังพูดแบบไหน

MiniMax H3 2K vs 768P: 768P ยังอยู่ใน Closed Beta หรือไม่?

ไม่ และเรื่องนี้ควรจะเคลียร์ให้จบตั้งแต่เนิ่นๆ เพราะมันยังถูกพูดซ้ำในบทความสรุปราคาส่วนใหญ่ที่เขียนขึ้นในวันแรกๆ หลังเปิดตัว

ผมดึง schema อินพุตปัจจุบันของทั้งสาม endpoints H3 วันนี้ ฟิลด์ resolution อ่านว่า enum: ["768P", "2K"] โดยมี default: "2K" สำหรับข้อความเป็นวิดีโอ ภาพเป็นวิดีโอ และอ้างอิงเป็นวิดีโอเหมือนกัน และ duration ทำงานทุกวินาทีเต็มตั้งแต่ 4 ถึง 15 ในทั้งสามแบบ ไม่มีแฟล็ก ไม่มีเกต ไม่มีฟอร์มขาย จากนั้นผมส่งงาน 768P ไปยังสอง endpoints ที่แตกต่างกัน และทั้งสองงานเสร็จสมบูรณ์และคิดค่าใช้จ่ายในอัตราที่ต่ำกว่า ถ้าหน้าไหนบอกให้คุณติดต่อฝ่ายขายเพื่อขอ 768P หน้านั้นกำลังอธิบายสัปดาห์แรกของการเปิดตัว ไม่ใช่สัปดาห์นี้

MiniMax H3 2K vs 768P, พรอมต์เดียวกัน, เปรียบเทียบแบบเคียงข้างกัน

ซ้ายคือ 768P ขวาคือ 2K พรอมต์เหมือนกัน duration=4 เหมือนกัน ratio=16:9 เหมือนกัน ส่งต่อเนื่องไปยัง minimax/h3/text-to-video

ภาพเปรียบเทียบความละเอียดแบบเคียงข้างกันแสดงขวด Cold Brew

MiniMax H3 2K vs 768P ภาพแยกจอจากพรอมต์ข้อความเป็นวิดีโอเดียวกัน พร้อมความละเอียด ราคา และเวลาจริงที่ฝังไว้

พรอมต์เดียวกัน สองรอบ ซ้าย: 768P, 1344x768, $0.40, 130 วินาที ขวา: 2K, 2560x1440, $0.56, 181 วินาที แสดงเป็น GIF แบบไม่มีเสียง ไฟล์ที่ส่งออกทั้งสองมีเสียงสเตอริโอ 32 kHz วัดจาก Atlas Cloud, 2026-08-05

ดูสิว่าอะไรที่แตกต่างจริงๆ ไม่ใช่ความคมชัด มันคือฟิล์ม วัสดุเคาน์เตอร์ต่างกัน ของตกแต่งพื้นหลังต่างกัน ปริมาณหยดน้ำต่างกัน ความสูงของกล้องต่างกัน อุณหภูมิสีต่างกัน และฉลากอยู่คนละตำแหน่งบนขวด ไม่มีอะไรในพรอมต์ที่ขอให้สิ่งเหล่านี้เปลี่ยนแปลง

ทีนี้ส่วนที่ทุกคนคิดว่าเป็นไปในทางตรงข้าม นี่คือพื้นที่ฉลากจากทั้งสองช็อต ครอปจากไฟล์ต้นฉบับและขยายให้มีความกว้างเท่ากัน ดังนั้นครอป 768P จะถูกขยายมากกว่าครอป 2K

เปรียบเทียบความละเอียด 768P และ 2K บนฉลาก Cold Brew

เปรียบเทียบครอปฉลากระหว่างช็อต MiniMax H3 768P และ 2K ทั้งสองแสดงบรรทัดส่วนผสมขนาดเล็กที่อ่านได้

บรรทัดเล็ก "single origin ethiopia guji / 250ml / roasted 04.08.2026" ยังคงอยู่ที่ 768P มันนุ่มนวลกว่าและระยะห่างระหว่างตัวอักษรไม่แน่นอน แต่ไม่มีอะไรอ่านไม่ได้ ต้นทุนที่แท้จริงของ 768P ที่นี่ไม่ใช่ข้อความเลือนลาง แต่เป็นองค์ประกอบที่แตกต่างกัน

ดังนั้นกรอบความคิดที่ตรงไปตรงมาของ MiniMax H3 2K vs 768P ไม่ใช่ "คมชัดเทียบกับเบลอ" มันคือ "ช็อตนี้เทียบกับช็อตอื่น บวกกับการปรับแต่งรายละเอียดเพิ่มเติม"

ข้อมูลจำเพาะของ MiniMax H3 2K vs 768P ที่วัดได้

ทุกอย่างในตารางนี้มาจาก ffmpeg -i บนไฟล์ที่ส่งออก และจากฟิลด์ price ในการทำนายที่เสร็จสมบูรณ์ ไม่ใช่จากหน้าคู่มือ

วัดจากไฟล์ที่ส่งออก768P2Kอัตราส่วน
ความละเอียดที่ส่งออก (คำขอ 16:9)1344x7682560x1440พิกเซล 3.6x
บิตเรตวิดีโอ998 kb/s3,624 kb/s3.6x
ขนาดไฟล์, คลิป 4.46 วินาที620 KB2.00 MB3.3x
อัตราเฟรม24 fps24 fpsเท่ากัน
แทร็กเสียงAAC stereo, 32,000 Hz, 131 kb/sAAC stereo, 32,000 Hz, 127 kb/sเท่ากัน
ระยะเวลาคอนเทนเนอร์สำหรับ duration=44.46s4.46sเท่ากัน
เวลาจริงจากส่งถึงเสร็จ130s181s1.39x
ค่าใช้จ่ายจริง$0.40$0.561.4x
อัตราที่แท้จริง$0.10/s$0.14/sถูกกว่า 29%

เชิงอรรถสองข้อที่ทำให้ผมเสียเงินเพื่อเรียนรู้ ข้อแรก ทั้งสองระดับส่งมอบ 4.46 วินาทีสำหรับคำขอ duration=4 และทั้งสองระบบคิดเงิน 4 วินาที ดังนั้นคุณได้ 0.46 วินาทีพิเศษฟรี แต่คุณไม่สามารถวางแผนการตัดต่อรอบมันได้ ข้อสอง เสียงเหมือนกันทั้งสองระดับ ถ้าคลิปของคุณอาศัยบทสนทนาหรือการซิงค์เพลง 2K ไม่ได้ให้อะไรคุณในสิ่งที่สำคัญ

ทำไม MiniMax H3 2K vs 768P ถึงทำให้ทุกคนสับสน

เพราะ 2K บน H3 ไม่ใช่ขั้นตอนการเพิ่มความละเอียด มันคือการสร้างรุ่นที่สอง

MiniMax อธิบายกลไกโดยตรง: "สำหรับเอาต์พุต 2K ของ H3 แทนที่จะใช้โมดูลซูเปอร์เรโซลูชันเฉพาะแบบดั้งเดิม เรามีโมเดลพื้นฐาน H3 สร้างเอาต์พุตความละเอียดต่ำของตัวเองขึ้นมาใหม่ในบริบท" พวกเขายังอธิบายว่าทำไมถึงสร้างแบบนั้น: วิธีการในบริบท "ช่วยให้มันดึงบริบทมัลติโมดัลดั้งเดิมอีกครั้งเพื่อสร้างเอาต์พุตความละเอียดสูง กู้คืนรายละเอียดที่ซูเปอร์เรโซลูชันแบบดั้งเดิมสามารถ 'เดา' ได้เท่านั้น และมักจะไม่สามารถกู้คืนได้ เช่น ข้อความขนาดเล็กและรายละเอียดปลีกย่อย" (MiniMax, กรกฎาคม 2026)

อ่านอีกครั้งโดยสวมหมวกโปรดักชัน การผ่าน 2K จะกลับไปที่บริบทดั้งเดิมของคุณและสร้างใหม่อีกครั้ง เมื่อบริบทของคุณไม่มีอะไรนอกจากพรอมต์ข้อความ "สร้างอีกครั้ง" หมายถึง "ทอยลูกเต๋าอีกครั้ง" นั่นคือสิ่งที่สองช็อตของผมแสดงให้เห็น โมเดลไม่เคยถูกบอกให้สร้างเวอร์ชัน 768P ซ้ำ เพราะมันไม่เคยเห็นเวอร์ชัน 768P

สามวิธีที่สิ่งนี้สร้างปัญหาในทางปฏิบัติ:

  1. คุณสร้างแบบร่างราคาถูกที่ 768P ด้วยข้อความเป็นวิดีโอ เลือกช็อตที่ชนะ แล้วรันอีกครั้งที่ 2K คุณได้คนแปลกหน้ากลับมา พรอมต์ได้รับเกียรติ แต่ฟิล์มเป็นฟิล์มใหม่ นั่นคือการทดสอบที่ด้านบนของหน้านี้
  2. คุณคิดงบประมาณราวกับว่าถูกกว่า 29% ต่อวินาที หมายถึงถูกกว่า 29% มันไม่ใช่ เพราะช็อตสุดท้ายเป็นส่วนที่แพงของงานจริงใดๆ และการ reroll 2K ที่เสียไปหนึ่งครั้งจะลบเงินที่ประหยัดได้จากแบบร่างหลายๆ อัน
  3. คุณคิดว่ามีเส้นทางอัปเกรดราคาถูกอยู่ที่ไหนสักแห่ง ผมตรวจสอบแค็ตตาล็อกทั้งหมดบน Atlas Cloud วันนี้: 452 โมเดล, สาม endpoints H3, และไม่มี endpoint การสร้าง H3 ใหม่ในหมู่พวกมัน เมื่อมีเพียงสาม endpoints การสร้างเท่านั้นที่ถูกเปิดเผย "อัปเกรดคลิปนี้เป็น 2K" หมายถึงการ reroll หรือการใช้ตัวเพิ่มความละเอียดแยกต่างหาก ทั้งสองอย่างเสียเงิน และไม่ได้ซื้อสิ่งเดียวกัน

คุ้มที่จะบอกว่าทำไมถึงควรออกแบบระบบรอบโมเดลนี้แทนที่จะเปลี่ยน ข้อเสนอหลักในตอนเปิดตัวคือวิดีโอ "ที่ความละเอียดสูงถึง 2K, ในคลิปยาวสูงสุด 15 วินาที, พร้อมเสียงสเตอริโอแบบเนทีฟ" (DataNorth AI, สิงหาคม 2026) และคะแนนก็สนับสนุน: ปัจจุบัน H3 อยู่บนสุดของกระดาน Elo การตัดต่อวิดีโอของ Artificial Analysis ที่ 1,130 นำหน้า Gemini Omni Flash ที่ 1,122 และมากกว่า Dreamina Seedance 2.0 720p ที่ 1,037 ถึง 93 คะแนน (Artificial Analysis, สิงหาคม 2026) คุณภาพคุ้มค่าที่จะออกแบบเวิร์กโฟลว์ เวิร์กโฟลว์แค่ต้องเคารพวิธีการผลิต 2K

สี่โมเดลเบื้องหลังการทดสอบ MiniMax H3 2K vs 768P นี้ ในแท็บเดียว

การทดสอบทั้งหมดคือสี่โมเดล, คีย์ API หนึ่งอัน, บิลเดียว ผมรันบน Atlas Cloud เพราะการสลับระหว่างโมเดลรูปภาพ, สอง endpoints H3 และตัวเพิ่มความละเอียด มิฉะนั้นจะหมายถึงสามบัญชีและสามใบแจ้งหนี้ที่ต้องกระทบยอดสิ้นเดือน

งานในการทดสอบนี้โมเดลราคา ณ สิงหาคม 2026สิ่งที่ผมจ่ายจริง
ล็อกเฟรมแรกopenai/gpt-image-2/text-to-imageเริ่มต้นที่ $0.009/ภาพ (ระดับ token ด้านบน)$0.1745 สำหรับหนึ่งภาพ 2048x1152 คุณภาพสูง
แบบร่างและช็อตสุดท้าย, เฟรมที่ล็อกminimax/h3/image-to-video$0.14/s ที่ 2K, $0.10/s ที่ 768P$0.40 และ $0.56 สำหรับ 4s แต่ละอัน
คู่ควบคุมเปล่าminimax/h3/text-to-videoสองระดับเดียวกัน$0.40 และ $0.56 สำหรับ 4s แต่ละอัน
รักษาช็อต, เพิ่มพิกเซลatlascloud/video-upscaler$0.018/s ถึง 1080p, $0.024/s ถึง 2K, ขั้นต่ำ 5s$0.12 สำหรับคลิป 4.46s

สองหมายเหตุก่อนที่คุณจะคัดลอกตัวเลข endpoints H3 ทั้งหมดเผยแพร่อัตราหลักเดียวที่ $0.14/s ซึ่งเป็นระดับ 2K; อัตรา 768P จะแสดงในบิล ไม่ใช่ในรายการ ดังนั้นวัดด้วยตัวเองสักครั้ง และไม่มีสี่โมเดลนี้ที่ลดราคาอยู่ในตอนนี้ ถ้าคุณต้องการลดขั้นตอนการล็อกเฟรม openai/gpt-image-2-developer/text-to-image กำลังลด 50% ($0.004 จาก $0.009) ณ สิงหาคม 2026 และมันเป็นตระกูลเดียวกันที่ทำงานเดียวกัน

วิธีทดสอบ MiniMax H3 2K vs 768P ด้วยตัวเอง

ห้าขั้นตอน, เครดิต $2.21, และเวลาจริงประมาณ 15 นาที ทุกพรอมต์ด้านล่างคือสตริงที่ผมส่งไป

หมายเหตุสามพารามิเตอร์ก่อน เพราะแต่ละตัวอาจทำให้คุณเสียงานหนึ่งรอบโดยไม่รู้ตัว:

  • ในข้อความเป็นวิดีโอ ฟิลด์คือ ratio ไม่ใช่ aspect_ratio ค่าเริ่มต้นคือ 1:1 และ enum ไม่มีตัวเลือก adaptive ส่ง 16:9 ด้วยตัวเอง มิฉะนั้นคุณจะได้คลิปสี่เหลี่ยม ในภาพเป็นวิดีโอ enum มีแค่ adaptive เพราะเฟรมแรกของคุณเป็นตัวกำหนดรูปร่าง
  • ส่ง duration อย่างชัดเจนเสมอ แทนที่จะเชื่อถือค่าเริ่มต้นที่ระบุไว้ที่ 8 สิ่งที่คุณถูกเรียกเก็บเงินเป็นไปตามสิ่งที่ส่งมอบ ไม่ใช่สิ่งที่คุณสันนิษฐาน
  • ทุกงาน H3 มีอายุยืนกว่าเวลาไทม์เอาต์ปกติ ดังนั้นส่งแบบ async และ poll ฟิลด์ price ก็จะเติมช้าเช่นกัน: เมื่อ status เปลี่ยนเป็น completed มันมักจะยังว่างอยู่ และคุณต้อง poll id การทำนายอีกครั้งเพื่อให้ได้ตัวเลขจริง หากไม่มีการ poll ครั้งที่สอง คุณจะไม่สามารถสร้างตารางต้นทุนที่ซื่อสัตย์ได้

ขั้นตอนที่ 1: ล็อกเฟรมด้วย GPT Image 2

นี่คือขั้นตอนที่เปลี่ยนแบบร่างให้เป็นตัวอย่างแทนที่จะเป็นสลากกินแบ่ง สร้างองค์ประกอบที่เสร็จสมบูรณ์เป็นภาพนิ่ง และมันจะกลายเป็นส่วนที่เคลื่อนที่ไม่ได้ของทั้งสองรันวิดีโอ

text
1ภาพถ่ายผลิตภัณฑ์แบบมาโครของขวดกาแฟ Cold Brew สีดำด้าน ตั้งอยู่บนแผ่นหินชนวนเปียก แสงยามเช้าส่องผ่านหน้าต่างจากด้านขวา ฉลากกระดาษสีครีมห่อขวดไว้ อ่านได้ชัดเจน: ตัวพิมพ์ใหญ่หนา "NORTHBOUND COLD BREW" หนึ่งบรรทัด และด้านล่างโดยตรงเป็นตัวพิมพ์เล็ก "single origin ethiopia guji / 250ml / roasted 04.08.2026" หยดน้ำเกาะบนกระจก มีเครื่องเอสเพรสโซและบาริสต้าในเสื้อเชิ้ตยีนส์เบลอๆ อยู่ด้านหลัง ภาพยนตร์, ความชัดลึกต่ำ, เกรดเป็นกลางโทนอุ่น, เหมือนจริง, 16:9
2

การตั้งค่า: quality high, size 2048x1152 อย่าประหยัดตรงนี้ ทุกรายละเอียดที่คุณต้องการให้การผ่าน 2K ปกป้อง จะต้องมีอยู่ในเฟรมนี้ก่อน

ขวดกาแฟ Northbound Cold Brew บนเคาน์เตอร์ร้านกาแฟ

เฟรมแรกที่ล็อกไว้ สร้างด้วย GPT Image 2 ที่ 2048x1152 แสดงขวด Cold Brew และข้อความขนาดเล็กที่อ่านได้

สร้างด้วย openai/gpt-image-2/text-to-image, quality high, 2048x1152. คิดเงิน $0.1745, ได้ผลลัพธ์ใน 146 วินาที

ภาพหน้าจออินเทอร์เฟซเครื่องสร้างภาพ AI พร้อมขั้นตอนที่มีหมายเลข

พื้นที่เล่น GPT Image 2 บน Atlas Cloud พร้อมพรอมต์เฟรมที่กรอกและขวดที่สร้างในแผงเอาต์พุต

GPT Image 2 บน Atlas Cloud: ตั้งค่า quality เป็น high, 16:9, เฟรมที่ล็อกแสดงทางด้านขวา

ขั้นตอนที่ 2: สร้างแบบร่างที่ 768P

endpoint เดียวกับที่คุณจะใช้สำหรับช็อตสุดท้าย มีเพียงความละเอียดที่แตกต่างระหว่างขั้นตอนนี้กับขั้นตอนที่ 4

text
1การดอลลี่เข้าหาขวดช้าๆ แบบมาโคร หยดน้ำไหลลงบนกระจก ฉลากยังคงนิ่งและอ่านได้ชัดเจน ในพื้นหลังที่นุ่มนวล บาริสต้าเช็ดเคาน์เตอร์หนึ่งครั้ง เสียงบรรยากาศร้านกาแฟธรรมชาติ เสียงฟู่ของเครื่องเอสเพรสโซแผ่วเบา ไม่มีการสั่นของกล้อง
2

การตั้งค่าบน minimax/h3/image-to-video: first frame = เอาต์พุตขั้นตอนที่ 1 ของคุณ, resolution=768P, duration=4, ratio=adaptive

ขวดกาแฟ Northbound Cold Brew บนเคาน์เตอร์ร้านกาแฟ

คลิปแบบร่าง 768P ของ MiniMax H3 การดอลลี่เข้าหาขวด Cold Brew ช้าๆ

แบบร่าง 768P: 1344x768, คิดเงิน $0.40, ได้ผลลัพธ์ใน 194 วินาที แสดงเป็น GIF แบบไม่มีเสียง ไฟล์มีเสียงสเตอริโอ 32 kHz สังเกตรอยหยดหนักสี่เส้นที่เลอะลงบนฉลาก

อินเทอร์เฟซเครื่องสร้างวิดีโอ AI พร้อมพรอมต์และวิดีโอ Cold Brew ที่สร้าง

พื้นที่เล่น MiniMax H3 image-to-video บน Atlas Cloud พร้อมเฟรมที่ล็อกอัปโหลด พรอมต์พิมพ์ และคลิปที่เสร็จในแผงเอาต์พุต

ฟอร์ม image-to-video พร้อมเฟรมที่ล็อกโหลด Resolution และ Duration เป็นสองฟิลด์เดียวที่แยกขั้นตอนนี้ออกจากขั้นตอนที่ 4 และทั้งสองระดับอยู่ในรายการเดียวกันโดยไม่มีอะไรกั้น การจับภาพนี้ตั้งค่าเริ่มต้นเป็น 2K และ 8 วินาที ซึ่งเป็นสาเหตุที่ปุ่ม Run แสดงราคา $1.12; เปลี่ยน Resolution เป็น 768P และ Duration เป็น 4 ราคาจะลดลงเหลือ $0.40

ขั้นตอนที่ 3: ประเมินแบบร่าง MiniMax H3 2K vs 768P ในสิ่งที่ถูกต้อง

แบบร่างคือการซ้อม ไม่ใช่หลักฐาน จากคู่สองคู่ของผม นี่คือสิ่งที่มันบอกคุณได้อย่างน่าเชื่อถือและสิ่งที่มันบอกไม่ได้

เชื่อถือได้สำหรับ: การใช้ถ้อยคำพรอมต์, การเคลื่อนไหวดูสมเหตุสมผลหรือไม่, ปริมาณการเคลื่อนไหวของกล้อง, จังหวะในสี่วินาที, และเสียงพื้นหลัง ทั้งหมดนี้ถ่ายทอดออกมาได้อย่างสะอาด

อย่าเชื่อถือสำหรับ: พื้นผิวละเอียด, ตัวอักษรที่เล็กที่สุดบนผลิตภัณฑ์ของคุณ, หรือสิ่งแปลกปลอมใดๆ ที่มันสร้างขึ้น ในแบบร่าง 768P ของผม ฉลากมีรอยหยดสีน้ำตาลหนาสี่เส้นที่รัน 2K ไม่ได้สร้าง และบรรทัดส่วนผสมเล็กๆ กลายเป็นเลือนลาง ถ้าผมปฏิเสธแบบร่างนั้นเพราะดูสกปรก ผมคงปฏิเสธพรอมต์ที่ใช้ได้

นั่นคือการแบ่งงานที่แท้จริง 768P ตอบคำถาม "นี่คือช็อตที่ใช่ไหม", 2K ตอบ "นี่คือช็อตที่ส่งมอบได้ไหม"

ขั้นตอนที่ 4: เปลี่ยนฟิลด์เดียวและทำช็อตสุดท้ายที่ 2K

endpoint เดียวกัน, เฟรมแรกเดียวกัน, สตริงพรอมต์เดียวกัน เปลี่ยน resolution เป็น 2K และไม่ต้องเปลี่ยนอะไรอื่น

ขวดกาแฟ Northbound Cold Brew บนเคาน์เตอร์ร้านกาแฟ

คลิปสุดท้าย 2K ของ MiniMax H3 จากเฟรมแรกที่ล็อกเดียวกัน พร้อมฉลากสะอาดและข้อความเล็กที่อ่านได้

ช็อตสุดท้าย 2K: 2560x1440, คิดเงิน $0.56, ได้ผลลัพธ์ใน 234 วินาที แผ่นหินเดียวกัน, เครื่องเอสเพรสโซเดียวกัน, ต้นไม้เดียวกัน, บาริสต้าคนเดียวกัน, ตำแหน่งฉลากเดียวกันกับแบบร่าง

นี่คือคำตอบสำหรับคำถามที่บทความทั้งชิ้นนี้ถูกสร้างขึ้นเพื่อทดสอบ และมันเป็นไปในทางที่ดี เมื่อเฟรมแรกถูกล็อก ความคลาดเคลื่อนหยุดลง ชุด, การจัดเฟรม, ความสูงของกล้อง และตำแหน่งตัวอักษรทั้งหมดคงที่ระหว่างแบบร่าง 768P และช็อตสุดท้าย 2K ความแตกต่างจำกัดอยู่ที่รายละเอียด: การผ่าน 2K ทำความสะอาดรอยหยดที่เลอะเป็นเส้นบางๆ เส้นเดียว, แก้ไขเกรนของกระดาษ, และเปลี่ยนบรรทัดส่วนผสมเล็กๆ จากสัญญาณรบกวนกลับเป็นคำพูด นั่นคือพฤติกรรมที่ MiniMax อ้างว่าเป็นสำหรับการสร้างใหม่ในบริบท และนี่เป็นครั้งแรกในการทดสอบนี้ที่ 2K ดูเหมือนระดับคุณภาพมากกว่าการ reroll

สำหรับการเปรียบเทียบ กลุ่มควบคุม นี่คือรันข้อความเป็นวิดีโอเปล่าๆ ที่ 2K ซึ่งสร้างคนแปลกหน้าที่ด้านบนของหน้านี้ เนื้อหาพรอมต์เดียวกัน ไม่มีเฟรมแรก ดังนั้นไม่มีอะไรยึดองค์ประกอบไว้

11 คำ

พื้นที่เล่น MiniMax H3 text-to-video ที่ 2K พร้อมคลิปควบคุมที่เสร็จในแผงเอาต์พุต

MiniMax H3 text-to-video บน Atlas Cloud: ไม่มีเฟรมแรก, Resolution 2K, Aspect Ratio 16:9, และคลิปที่เสร็จในแผงเอาต์พุต ไม่มีอะไรผิดปกติกับการสร้างนี้ มันแค่ไม่ใช่ฟิล์มเดียวกับที่รัน 768P สร้าง

ขั้นตอนที่ 5: หรือข้ามการ reroll MiniMax H3 2K vs 768P แล้วเพิ่มความละเอียดแทน

บางครั้งช็อต 768P ก็เป็นช็อตที่ใช่แล้ว ผลงานมาถูกต้อง จังหวะถูกต้อง และคุณไม่ต้องการการสร้างใหม่ที่อาจออกมาต่างกัน จากนั้นอย่า reroll มัน ส่งไฟล์ตรงผ่านตัวเพิ่มความละเอียด

การตั้งค่าบน atlascloud/video-upscaler: video = URL เอาต์พุต 768P ของคุณ, target_resolution=2k อินพุตสูงสุดที่ 2K คือ 23 วินาทีและ 690 เฟรม และ fps อินพุตต้องเป็น 30 หรือต่ำกว่า ดังนั้นคลิป 24 fps ของ H3 ผ่านได้อย่างสบาย

ขวดกาแฟ Northbound Cold Brew บนเคาน์เตอร์ร้านกาแฟ

ช็อต 768P ที่ส่งผ่านตัวเพิ่มความละเอียดวิดีโอ Atlas Cloud เป็น 2K ฟุตเทจเดียวกันที่ความละเอียดสูงขึ้น

ช็อตที่เพิ่มความละเอียด: 2540x1452, คิดเงิน $0.12, ได้ผลลัพธ์ใน 40 วินาที หยดสี่เส้นเดียวกัน, ทุกอย่างเหมือนเดิม นี่คือฟิล์มเดียวกัน ไม่ใช่ฟิล์มใหม่

อินเทอร์เฟซเครื่องสร้างวิดีโอ AI แสดงอินพุตและวิดีโอเอาต์พุตที่เสร็จ

พื้นที่เล่นตัวเพิ่มความละเอียดวิดีโอ Atlas Cloud พร้อมคลิป 768P ที่โหลดและผลลัพธ์ 2K ในแผงเอาต์พุต

ตัวเพิ่มความละเอียดวิดีโอบน Atlas Cloud พร้อมคลิป H3 768P ที่โหลดและผลลัพธ์ที่เพิ่มความละเอียดกำลังเล่นทางด้านขวา การจับภาพนี้รันบนค่าเริ่มต้น 1080p ซึ่งปุ่ม Run ตั้งราคาที่ $0.09 สำหรับอะไรก็ตามที่ต่ำกว่า 5 วินาทีขั้นต่ำ เปลี่ยน Target Resolution เป็น 2k แล้วคุณจะอยู่ในระดับ $0.024/s ซึ่งเป็น $0.12 ที่ผมถูกเรียกเก็บสำหรับรันของตัวเอง

และนี่คือคำตัดสินที่ไม่มีใครควรข้าม ครอปฉลากทั้งสามจากเฟรมที่ล็อกเดียวกันที่กำลังขยายเท่ากัน

เปรียบเทียบสามแผงของฉลากขวด Cold Brew ที่ความละเอียดต่างกัน

เปรียบเทียบครอปฉลากสามทาง: 768P ดั้งเดิม, คลิปนั้นที่เพิ่มความละเอียดเป็น 2K, และ 2K ดั้งเดิม แสดงให้เห็นว่ามีเพียง 2K ดั้งเดิมที่กู้คืนข้อความขนาดเล็ก

768P ดั้งเดิม, คลิปเดียวกันที่เพิ่มความละเอียด, และ 2K ดั้งเดิม ตัวเพิ่มความละเอียดทำให้เกรนกระดาษและชื่อใหญ่คมชัดขึ้นอย่างสวยงาม และรักษาช็อตที่แน่นอน สิ่งที่มันทำไม่ได้คือใส่บรรทัดเล็กกลับคืน เพราะข้อมูลนั้นไม่เคยอยู่ในไฟล์ 768P การผ่านการสร้างใหม่สามารถทำได้ เพราะมันกลับไปที่บริบทแทนที่จะไปที่พิกเซล

ดังนั้นสองเส้นทางไม่ได้แข่งขันกัน พวกมันตอบคำถามที่แตกต่างกัน การเพิ่มความละเอียดรักษาประสิทธิภาพ การสร้างใหม่กู้คืนรายละเอียด เลือกตามสิ่งที่คลิปของคุณไม่สามารถเสียได้

รูปแบบที่ควรทดสอบกับ MiniMax H3 2K vs 768P

  • แนวตั้ง. การทดสอบ 16:9 ของผมได้ 1344x768 ดังนั้นด้านสั้นคือสิ่งที่ระดับยึด คำขอ 9:16 ควรได้ 768x1344 ด้วยตรรกะเดียวกัน แต่วัดสักครั้งก่อนที่คุณจะสร้างชุดแนวตั้งโดยสมมติ ในภาพเป็นวิดีโอ คุณกำหนดรูปร่างผ่านเฟรมแรกแทนที่จะสู้กับ enum adaptive
  • หัวพูด. นี่คือจุดที่ผมจะข้ามการสร้างแบบร่างทั้งหมดและไปที่ 2K โดยตรง ใบหน้า, ฟัน, และแนวสายตาเป็นคลาสรายละเอียดเล็กๆ ที่การผ่านการสร้างใหม่มีไว้ และแบบร่าง 768P จะให้ข้อมูลที่ผิดเกี่ยวกับทั้งสามอย่าง
  • คลิปยาว. ที่ 15 วินาที ช่องว่างขยายเป็น $1.50 เทียบกับ $2.10 และเวลาจริงก็ยืดออกตาม วางแผนคิว ไม่ใช่แค่งบประมาณ
  • ข้อความผลิตภัณฑ์และงานหลายภาษา. ตัวอักษรที่คงที่ในเฟรมของ H3 และเสียงหลายภาษาแบบเนทีฟเป็นเหตุผลที่ผู้คนเลือกใช้สำหรับบรรจุภัณฑ์เชิงพาณิชย์ตั้งแต่แรก ทั้งสองอย่างคงอยู่ที่ 768P ซึ่งทำให้ 768P เป็นระดับการส่งมอบที่ใช้งานได้จริงสำหรับครอปโซเชียล ไม่ใช่แค่ห้องซ้อม

MiniMax H3 2K vs 768P เสียค่าใช้จ่ายจริงเท่าไหร่ต่อคลิปที่ใช้งานได้

อันดับแรก สามเส้นทางสู่ผลลัพธ์ 2K, ต่อคลิป 8 วินาที, ในอัตราที่ผมถูกเรียกเก็บจริง

เส้นทางสู่คลิป 2Kอัตราที่ใช้ค่าใช้จ่ายสำหรับคลิป 8s หนึ่งอันรักษาช็อตเดียวกันกู้คืนข้อความเล็ก
ตรงไปที่ 2K$0.14/s$1.12n/aใช่
แบบร่าง 768P, แล้ว reroll 2K บนเฟรมที่ล็อก$0.10/s แล้ว $0.14/s$0.80 + $1.12 = $1.92ใช่, ถ้าเฟรมแรกถูกล็อกใช่
ช็อตสุดท้าย 768P, แล้วเพิ่มความละเอียดเป็น 2K$0.10/s แล้ว $0.024/s$0.80 + $0.192 = $0.99ใช่, ตรงเป๊ะไม่

ทีนี้ตัวเลขที่ตัดสินเดือนของคุณ ใช้ส่วนผสมที่สมจริง: แบบร่าง 4 วินาที 10 อันเพื่อหาช็อต, แล้วคลิปสุดท้าย 8 วินาที 2 อัน

ชุดของแบบร่าง 10 อัน + ช็อตสุดท้าย 2 อันแบบร่างช็อตสุดท้ายล็อกเฟรมรวม
ทุกอย่างที่ 2K10 x 4s x $0.14 = $5.602 x 8s x $0.14 = $2.24ไม่มี$7.84
แบบร่าง 768P, ช็อตสุดท้าย 2K, เฟรมที่ล็อก10 x 4s x $0.10 = $4.00$2.24$0.17$6.41 (น้อยกว่า 18%)
แบบร่าง 768P, ช็อตสุดท้าย 768P, เพิ่มความละเอียด$4.002 x ($0.80 + $0.192) = $1.98$0.17$6.15 (น้อยกว่า 22%)

อ่านแถวกลางอย่างซื่อสัตย์ การประหยัดต่อวินาทีคือ 29% แต่การประหยัดต่อชุดคือ 18% เพราะช็อตสุดท้ายของคุณยังเป็นช็อตสุดท้าย การประหยัดจะเพิ่มขึ้นใกล้ 29% เมื่อการสร้างแบบร่างครอบงำ: ที่แบบร่าง 8 วินาที 20 อันแทนที่จะเป็น 10 อันสั้น เส้นทางที่สองจะต่ำกว่าทั้งหมด 2K ประมาณ 25% และทุกเซ็นต์ของการประหยัดนั้นขึ้นอยู่กับเฟรมที่ล็อก เพราะหากไม่มีมัน แบบร่างราคาถูกทั้งสิบอันนั้นคือฟิล์มสิบเรื่องที่คุณจะไม่ส่ง

เงินปันผลที่สองคือเวลา และมันอาจสำคัญกว่า ในคู่ข้อความเป็นวิดีโอ 768P กลับมาเร็วกว่า 28% และในทั้งสองคู่ มันไม่เคยใช้เวลานานกว่าเลย สำหรับคลิป 4 วินาทีที่เวลาจริงเหล่านั้น มันคือแบบร่างประมาณ 27 ครั้งในหนึ่งชั่วโมงแทนที่จะเป็น 20 ครั้ง เมื่อคุณยังคงตามหาพรอมต์ที่ใช่ การได้สวิงเพิ่มอีกเจ็ดครั้งสำคัญกว่าเงิน $1.60 ที่คุณประหยัดได้

หมายเหตุทางกฎหมายหนึ่งข้อหากคุณวางแผนที่จะหลีกเลี่ยงทั้งหมดนี้ด้วยการโฮสต์เอง น้ำหนักเปิดบน Hugging Face คือ H3-Base ซึ่งสร้างที่ด้านสั้น 768 การผ่าน 2K อยู่ฝั่ง API ดังนั้นน้ำหนักเปิดจะให้คุณได้ระดับแบบร่างเท่านั้น ไม่ใช่ระดับช็อตสุดท้าย ใบอนุญาตชุมชนยังมีดินแดนที่ยกเว้นครอบคลุม EU, UK, เกาหลี และ US โดยมีช่องทางการอนุญาตแยกต่างหากเปิดอยู่ ดังนั้นอ่านใบอนุญาตก่อนที่คุณจะสร้างไปป์ไลน์เชิงพาณิชย์บนการเช็คเอาต์ในเครื่อง สำหรับมุมมองที่กว้างขึ้นเกี่ยวกับสิ่งที่น้ำหนักที่ปล่อยออกมารวมและไม่รวม ดู รีวิว MiniMax H3 ของเรา และ แค็ตตาล็อกโมเดลเต็ม ถ้าคุณต้องการตั้งราคา H3 เทียบกับฟิลด์วิดีโอปัจจุบันอื่นๆ

คำถามที่พบบ่อย

ใน MiniMax H3 2K vs 768P, 768P ถูกกว่าต่อคลิปจริงหรือไม่?

ใช่ ผมถูกเรียกเก็บเงิน $0.40 สำหรับคลิป 768P 4 วินาที และ $0.56 สำหรับคำขอเดียวกันที่ 2K ดังนั้น $0.10/s เทียบกับ $0.14/s ประหยัด 29% ต่อวินาที ข้อเสียคือการประหยัดจะนับก็ต่อเมื่อรันราคาถูกสอนอะไรบางอย่างเกี่ยวกับรันแพง ซึ่งต้องล็อกเฟรมแรก แบบร่างข้อความเป็นวิดีโอเปล่าๆ ที่ 768P เป็นฟิล์มที่แยกต่างหาก และเงินที่ใช้ไปกับมันไม่ใช่เงินที่ประหยัดได้

ใน MiniMax H3 2K vs 768P, 2K เป็นแค่การเพิ่มความละเอียดของเอาต์พุต 768P หรือไม่?

ไม่ MiniMax ให้โมเดลพื้นฐานสร้างเอาต์พุตความละเอียดต่ำของตัวเองขึ้นมาใหม่ในบริบท แทนที่จะรันโมดูลซูเปอร์เรโซลูชันเฉพาะ ซึ่งเป็นสาเหตุที่ 2K สามารถกู้คืนข้อความขนาดเล็กและรายละเอียดพื้นผิวที่ละเอียด ซึ่งตัวเพิ่มความละเอียดสามารถประมาณได้เท่านั้น ครอปฉลากสามทางของผมแสดงให้เห็นอย่างนั้น: คลิป 768P ที่เพิ่มความละเอียดทำให้เกรนกระดาษคมชัดขึ้น แต่ปล่อยให้บรรทัดส่วนผสมเล็กๆ เป็นสัญญาณรบกวนที่อ่านไม่ได้ ในขณะที่รัน 2K ดั้งเดิมเปลี่ยนมันกลับเป็นคำพูด

แบบร่าง MiniMax H3 768P ของฉันจะดูเหมือนช็อตสุดท้าย 2K หรือไม่?

เฉพาะเมื่อคุณล็อกเฟรมแรกเท่านั้น ในข้อความเป็นวิดีโอเปล่าๆ สองระดับให้ฉากหลังต่างกัน, ความสูงกล้องต่างกัน, หยดน้ำต่างกัน และตำแหน่งฉลากต่างกันจากพรอมต์เดียวกัน ในภาพเป็นวิดีโอด้วยเฟรมแรกที่คงที่ องค์ประกอบ, การจัดเฟรม, และตัวอักษรทั้งหมดคงที่ระหว่างระดับ และการเปลี่ยนแปลงมีเพียงรายละเอียดและพื้นผิวเท่านั้น

ฉันยังต้องติดต่อฝ่ายขายสำหรับ MiniMax H3 768P หรือไม่?

ไม่ ณ วันที่ 2026-08-05 schema ปัจจุบันบนทั้งสาม endpoints H3 แสดง resolution เป็น enum: ["768P", "2K"], พื้นที่เล่นแสดงทั้งสองในเมนูแบบเลื่อนลงเดียว และงาน 768P ของผมเสร็จสมบูรณ์และคิดค่าใช้จ่ายในอัตราที่ต่ำกว่าบนสอง endpoints ที่แตกต่างกัน บรรทัด closed-beta มาจากบทความที่เขียนในวันแรกๆ หลังเปิดตัว

ใน MiniMax H3 2K vs 768P, 2K ช้ากว่าเท่าไหร่?

ในคู่ 4 วินาทีของผม, ช้ากว่า 1.2x ถึง 1.4x: 181 วินาที เทียบกับ 130 วินาทีในข้อความเป็นวิดีโอ และ 234 วินาที เทียบกับ 194 วินาทีในภาพเป็นวิดีโอ วัดจากเวลาส่งถึงเสร็จ ในเชิงสถาปัตยกรรม 2K คือการผ่านการสร้างรุ่นที่สองบนบริบทเดียวกัน ดังนั้นคาดว่าช่องว่างสัมบูรณ์จะกว้างขึ้นในคลิปที่ยาวขึ้นแทนที่จะคงที่

ฉันสามารถอัปเกรดคลิป 768P เป็น 2K โดยไม่ต้อง reroll ได้หรือไม่?

คุณสามารถเพิ่มความละเอียดโดยไม่เปลี่ยนแปลงช็อต โดยการรันผ่านตัวเพิ่มความละเอียดวิดีโอ ซึ่งเสียค่าใช้จ่าย $0.12 สำหรับคลิป 4.46 วินาทีที่ระดับ 2K ($0.024/s โดยมีขั้นต่ำ 5 วินาที) และส่งคืนใน 40 วินาที สิ่งนั้นรักษาประสิทธิภาพแบบเฟรมต่อเฟรม สิ่งที่มันจะไม่ทำคือกู้คืนรายละเอียดที่ไม่เคยถูกบันทึก ดังนั้นถ้าจุดประสงค์ของการไปที่ 2K คือตัวอักษรขนาดเล็กที่อ่านได้ คุณต้องใช้การผ่านการสร้างใหม่ ไม่ใช่ตัวเพิ่มความละเอียด

โมเดลล่าสุด

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด