
ภาพพิมพ์สองภาพของขวดโคลด์บริวขวดเดียวกันวางบนเคาน์เตอร์ร้านกาแฟ ภาพหนึ่งเบลอ อีกภาพคมชัด มีใบเสร็จวางอยู่ระหว่างกลาง
ภาพพิมพ์สองภาพของช็อตเดียวกัน ภาพหนึ่งเบลอ อีกภาพคมชัด บน MiniMax H3 ช่องว่างนั้นไม่ใช่แถบเลื่อนคุณภาพ สร้างด้วย openai/gpt-image-2/text-to-image
ผมส่งพรอมต์เดียวกันสองครั้ง สิ่งเดียวที่เปลี่ยนคือดรอปดาวน์เดียว: 768P แล้วก็ 2K
รอบแรกเสียเงิน $0.40 และใช้เวลา 130 วินาที รอบที่สองเสียเงิน $0.56 และใช้เวลา 181 วินาที จากนั้นผมวางสองเฟรมไว้ข้างกันและรู้สึกว่ามีอะไรบางอย่างผิดปกติ ขวดยังอยู่ที่เดิม ป้ายยังอยู่ที่เดิม ตัวพิมพ์เล็กๆ ก็ยังอยู่ แต่เคาน์เตอร์เปลี่ยนจากไม้สีอบอุ่นเป็นหินสีซีด ชั้นวางของปรากฏขึ้นในพื้นหลังด้านหลังบาริสต้า หยดน้ำบนแก้วกระจายไปทั่ว และแสงก็เปลี่ยนสีไป
ผมไม่ได้ประหยัดเงินจากร่างคร่าวๆ แต่กลับถ่ายฟิล์มสองคนละแบบ
นี่ไม่ใช่ข้อบกพร่อง มันคือความหมายของ "2K" บน H3 และเมื่อคุณเข้าใจแล้ว คำแนะนำมาตรฐานที่ทุกคนให้ไว้ คือ "ร่างคร่าวๆ ราคาถูก แล้วค่อยทำ final ราคาแพง" ก็พังทลายลงอย่างเงียบๆ ด้านล่างคือตัวเลขทั้งหมดจากการทดสอบนั้น บวกกับการเปลี่ยนแปลงหนึ่งอย่างที่ทำให้การร่างคร่าวๆ ราคาถูกใช้ได้ผล
ข้อสรุปสำคัญ (ตัวเลขทั้งหมดวัดบน Atlas Cloud, 2026-08-05)
- 768P ส่งมอบ 1344x768 ส่วน 2K ส่งมอบ 2560x1440 สำหรับคำขอ 16:9 ซึ่งเท่ากับ 3.6 เท่าของพิกเซล และ 3.6 เท่าของบิตเรตวิดีโอ
- การคิดเงิน $0.40 เทียบกับ $0.56 สำหรับคลิปความยาว 4 วินาที ดังนั้น $0.10/วินาที เทียบกับ $0.14/วินาที 768P ถูกกว่า 29% ต่อวินาที ไม่ใช่ครึ่งราคา
- 768P กลับมา เร็วกว่า 28% สำหรับคู่ข้อความเป็นวิดีโอ (130s เทียบกับ 181s) และเร็วกว่า 17% สำหรับคู่ภาพเป็นวิดีโอ (194s เทียบกับ 234s)
- ข้อความเป็นวิดีโอที่ 768P และ 2K ด้วยพรอมต์เดียวกันสร้าง ช็อตที่แตกต่างกันสองช็อต ไม่ใช่คุณภาพสองระดับของช็อตเดียวกัน การร่างคร่าวๆ ที่ 768P เปล่าไม่ได้แสดงตัวอย่าง final 2K ของคุณ
- ล็อกเฟรมแรกด้วยภาพเป็นวิดีโอ แล้วการเบี่ยงเบนจะหยุด ชุดเดียวกัน การจัดเฟรมเดียวกัน ตำแหน่งป้ายเดียวกัน และ 2K ใช้พิกเซลพิเศษตรงที่ MiniMax บอกไว้: ตัวพิมพ์เล็ก
- 768P ไม่ได้ถูกจำกัดการเข้าถึง ทั้งสองระดับพร้อมใช้งานใน enum resolution และเลือกได้ในดรอปดาวน์ ณ วันที่ 2026-08-05 ไม่ว่าบทสรุปเก่าๆ จะพูดว่าอย่างไร
MiniMax H3 2K เทียบกับ 768P: 768P ยังอยู่ใน Closed Beta หรือไม่?
ไม่ และเรื่องนี้ควรจะปิดให้เร็วเพราะยังคงถูกกล่าวซ้ำในบทสรุปราคาส่วนใหญ่ที่เขียนขึ้นในช่วงไม่กี่วันหลังเปิดตัว
ผมดึง schema อินพุตสดของทั้งสาม endpoint H3 ในวันนี้ ฟิลด์ resolution อ่านว่า enum: ["768P", "2K"] โดยมี default: "2K" สำหรับข้อความเป็นวิดีโอ ภาพเป็นวิดีโอ และอ้างอิงเป็นวิดีโอเหมือนกัน และ duration ทำงานทุกวินาทีเต็มตั้งแต่ 4 ถึง 15 ในทั้งสามแบบ ไม่มีแฟล็ก ไม่มีเกต ไม่มีฟอร์มขาย จากนั้นผมส่งงาน 768P ไปยังสอง endpoint ที่แตกต่างกัน และทั้งสองงานเสร็จสมบูรณ์และคิดเงินในอัตราที่ต่ำกว่า ถ้าหน้าเว็บไหนบอกให้คุณติดต่อฝ่ายขายเพื่อใช้ 768P หน้านั้นกำลังอธิบายสัปดาห์แรกของการเปิดตัว ไม่ใช่สัปดาห์นี้
MiniMax H3 2K เทียบกับ 768P พร้อมต์เดียวกัน วางข้างกัน
ด้านซ้ายคือ 768P ด้านขวาคือ 2K พร้อมต์เดียวกัน duration=4 เหมือนกัน ratio=16:9 เหมือนกัน ส่งต่อเนื่องกันไปยัง minimax/h3/text-to-video

หน้าจอแยก MiniMax H3 2K เทียบกับ 768P จากพรอมต์ข้อความเป็นวิดีโอเดียวกัน พร้อมความละเอียด ราคา และเวลาจริงที่ฝังไว้
พรอมต์เดียวกัน สองรอบ ด้านซ้าย: 768P, 1344x768, $0.40, 130s ด้านขวา: 2K, 2560x1440, $0.56, 181s แสดงเป็น GIF เงียบ ทั้งสองไฟล์ที่ส่งมอบมีเสียงสเตอริโอ 32 kHz วัดบน Atlas Cloud, 2026-08-05
ดูว่าอะไรที่แตกต่างกันจริงๆ มันไม่ใช่ความคมชัด แต่มันคือฟิล์ม วัสดุเคาน์เตอร์ต่างกัน การตกแต่งพื้นหลังต่างกัน ปริมาณหยดน้ำต่างกัน ความสูงของกล้องต่างกัน อุณหภูมิสีต่างกัน และป้ายอยู่ที่ตำแหน่งต่างกันบนขวด ไม่มีอะไรในพรอมต์ที่ขอให้สิ่งเหล่านี้เปลี่ยนแปลง
ทีนี้ส่วนที่ทุกคนคิดว่าเป็นไปในทางตรงกันข้าม นี่คือพื้นที่ป้ายจากทั้งสองช็อต ตัดจากไฟล์ต้นฉบับและขยายให้มีความกว้างเท่ากัน ดังนั้นการครอบ 768P จึงขยายมากกว่าการครอบ 2K

เปรียบเทียบการครอบป้ายระหว่างช็อต MiniMax H3 768P และ 2K ทั้งสองแสดงบรรทัดส่วนผสมเล็กๆ ที่อ่านได้
บรรทัดเล็ก "single origin ethiopia guji / 250ml / roasted 04.08.2026" ยังคงอยู่ที่ 768P มันนุ่มกว่าและระยะห่างตัวอักษรสั่น แต่ไม่มีอะไรอ่านไม่ได้ ต้นทุนที่แท้จริงของ 768P ที่นี่ไม่ใช่ข้อความเลอะ แต่เป็นองค์ประกอบที่แตกต่างกัน
ดังนั้นการวางกรอบอย่างตรงไปตรงมาของ MiniMax H3 2K เทียบกับ 768P ไม่ใช่ "คมชัดเทียบกับเบลอ" แต่มันคือ "ช็อตนี้เทียบกับอีกช็อตหนึ่ง บวกการปรับปรุงรายละเอียดเพิ่มเติม"
สเปกชีต MiniMax H3 2K เทียบกับ 768P ที่วัดได้
ทุกอย่างในตารางนี้มาจาก ffmpeg -i บนไฟล์ที่ส่งมอบ และจากฟิลด์ price บนการทำนายที่เสร็จสมบูรณ์ ไม่ใช่จากหน้าเอกสาร
| วัดจากไฟล์ที่ส่งมอบ | 768P | 2K | อัตราส่วน |
|---|---|---|---|
| ความละเอียดที่ส่งมอบ (คำขอ 16:9) | 1344x768 | 2560x1440 | 3.6x พิกเซล |
| บิตเรตวิดีโอ | 998 kb/s | 3,624 kb/s | 3.6x |
| ขนาดไฟล์ คลิป 4.46s | 620 KB | 2.00 MB | 3.3x |
| อัตราเฟรม | 24 fps | 24 fps | เท่ากัน |
| แทร็กเสียง | AAC สเตอริโอ, 32,000 Hz, 131 kb/s | AAC สเตอริโอ, 32,000 Hz, 127 kb/s | เท่ากัน |
| ระยะเวลาคอนเทนเนอร์สำหรับ duration=4 | 4.46s | 4.46s | เท่ากัน |
| เวลาจริงจากส่งถึงเสร็จ | 130s | 181s | 1.39x |
| คิดเงินจริง | $0.40 | $0.56 | 1.4x |
| อัตราที่มีประสิทธิภาพ | $0.10/s | $0.14/s | ถูกกว่า 29% |
ต้องการเปรียบเทียบ MiniMax H3 กับโมเดลวิดีโออื่นๆ ด้วยพรอมต์เดียวกัน? การเปรียบเทียบโมเดล Atlas Cloud ทำงานแบบเคียงข้างกัน พร้อมแสดงความละเอียดและต้นทุนต่อวินาทีก่อนที่คุณจะสร้าง
เชิงอรรถสองข้อที่ทำให้ผมเสียเงินเพื่อเรียนรู้ ข้อแรก ทั้งสองระดับส่งมอบ 4.46 วินาทีสำหรับคำขอ duration=4 และทั้งสองคิดเงิน 4 วินาที ดังนั้นคุณได้ 0.46 วินาทีพิเศษฟรี แต่คุณไม่สามารถวางแผนการตัดต่อรอบมันได้ ข้อที่สอง เสียงเหมือนกันทั้งสองระดับ ถ้าคลิปของคุณอาศัยบทสนทนาหรือการซิงค์เพลง 2K ไม่ได้ให้อะไรกับสิ่งที่สำคัญ
ทำไม MiniMax H3 2K เทียบกับ 768P ถึงทำให้ทุกคนสับสน
เพราะ 2K บน H3 ไม่ใช่ขั้นตอนการเพิ่มความละเอียด แต่มันคือการสร้างรุ่นที่สอง
MiniMax อธิบายกลไกโดยตรง: "สำหรับเอาต์พุต 2K ของ H3 แทนที่จะใช้โมดูลซูเปอร์เรโซลูชันเฉพาะแบบดั้งเดิม เราให้โมเดลฐาน H3 สร้างเอาต์พุตความละเอียดต่ำของตัวเองใหม่ในบริบท" พวกเขาอธิบายว่าทำไมถึงสร้างแบบนั้น: วิธีการในบริบท "ช่วยให้มันดึงบริบทมัลติโมดอลดั้งเดิมอีกครั้งเพื่อสร้างเอาต์พุตความละเอียดสูง กู้คืนรายละเอียดที่ซูเปอร์เรโซลูชันแบบดั้งเดิมสามารถ 'เดา' ได้เท่านั้นและมักจะไม่สามารถกู้คืนได้ เช่น ข้อความขนาดเล็กและรายละเอียดปลีกย่อย" (MiniMax, กรกฎาคม 2026)
อ่านอีกครั้งด้วยมุมมองการผลิต การผ่าน 2K กลับไปที่บริบทดั้งเดิมของคุณและสร้างอีกครั้ง เมื่อบริบทของคุณไม่มีอะไรนอกจากพรอมต์ข้อความ "สร้างอีกครั้ง" หมายถึง "ทอยลูกเต๋าอีกครั้ง" นั่นคือสิ่งที่สองช็อตของผมแสดงให้เห็น โมเดลไม่เคยถูกบอกให้ทำซ้ำเวอร์ชัน 768P เพราะมันไม่เคยเห็นเวอร์ชัน 768P
สามวิธีที่สิ่งนี้กัดคุณในทางปฏิบัติ:
- คุณสร้างร่างคร่าวๆ ราคาถูกที่ 768P ด้วยข้อความเป็นวิดีโอ เลือกตัวที่ชนะ แล้วรันอีกครั้งที่ 2K คุณได้คนแปลกหน้ากลับมา พรอมต์ได้รับการเคารพ แต่ฟิล์มเป็นใหม่ นั่นคือการทดสอบที่ด้านบนของหน้านี้
- คุณจัดงบประมาณราวกับว่าถูกกว่า 29% ต่อวินาทีหมายถึงถูกกว่า 29% ไม่จริง เพราะ final เป็นส่วนที่แพงของชุดงานจริงใดๆ และการ reroll 2K ที่เสียไปหนึ่งครั้งจะลบสิ่งที่ประหยัดได้จากการร่างคร่าวๆ หลายครั้ง
- คุณคิดว่าเส้นทางอัปเกรดราคาถูกอยู่ที่ไหนสักแห่ง ผมตรวจสอบแคตตาล็อกทั้งหมดบน Atlas Cloud วันนี้: 452 โมเดล, สาม endpoint H3 และไม่มี endpoint การสร้าง H3 ใหม่ในหมู่พวกเขา ในที่ที่เปิดเผยเฉพาะ endpoint การสร้างสามแบบ "อัปเกรดคลิปนี้เป็น 2K" หมายถึงการ reroll หรือรันตัวเพิ่มความละเอียดแยกต่างหาก ทั้งสองอย่างเสียเงิน และไม่ได้ซื้อสิ่งเดียวกัน
คุ้มค่าที่จะบอกว่าทำไมถึงคุ้มค่าที่จะออกแบบวิศวกรรมรอบโมเดลนี้แทนที่จะเปลี่ยน ข้อเสนอหลักตอนเปิดตัวคือวิดีโอ "ที่ความละเอียดสูงสุด 2K ในคลิปยาวสูงสุด 15 วินาที พร้อมเสียงสเตอริโอแบบเนทีฟ" (DataNorth AI, สิงหาคม 2026) และคะแนนก็สนับสนุน: ปัจจุบัน H3 อยู่บนสุดของกระดานผู้นำ Elo การตัดต่อวิดีโอของ Artificial Analysis ที่ 1,130 นำหน้า Gemini Omni Flash ที่ 1,122 และห่างจาก Dreamina Seedance 2.0 720p ที่ 1,037 ถึง 93 คะแนน (Artificial Analysis, สิงหาคม 2026) คุณภาพคุ้มค่ากับเวิร์กโฟลว์ เวิร์กโฟลว์แค่ต้องเคารพวิธีที่ผลิต 2K
สี่โมเดลเบื้องหลังการทดสอบ MiniMax H3 2K เทียบกับ 768P นี้ ในแท็บเดียว
การทดสอบทั้งหมดคือสี่โมเดล, คีย์ API หนึ่งอัน, บิลหนึ่งใบ ผมรันบน Atlas Cloud เพราะการสลับระหว่างโมเดลรูปภาพ, สอง endpoint H3 และตัวเพิ่มความละเอียด มิฉะนั้นหมายถึงสามบัญชีและสามใบแจ้งหนี้ที่ต้องกระทบยอดสิ้นเดือน
| งานในการทดสอบนี้ | โมเดล | ราคา ณ สิงหาคม 2026 | สิ่งที่ผมจ่ายจริง |
|---|---|---|---|
| ล็อกเฟรมแรก | openai/gpt-image-2/text-to-image | ระบุจาก $0.009/ภาพ (ระดับโทเค็นที่สูงกว่า) | $0.1745 สำหรับหนึ่ง 2048x1152 ที่คุณภาพสูง |
| ร่างคร่าวๆ และ final, เฟรมล็อก | minimax/h3/image-to-video | $0.14/s ที่ 2K, $0.10/s ที่ 768P | $0.40 และ $0.56 สำหรับ 4s แต่ละอัน |
| คู่ควบคุมเปล่า | minimax/h3/text-to-video | สองระดับเดียวกัน | $0.40 และ $0.56 สำหรับ 4s แต่ละอัน |
| คงช็อตไว้ เพิ่มพิกเซล | atlascloud/video-upscaler | $0.018/s ถึง 1080p, $0.024/s ถึง 2K, ขั้นต่ำ 5s | $0.12 สำหรับคลิป 4.46s |
สองหมายเหตุก่อนที่คุณจะคัดลอกตัวเลข endpoint H3 ทั้งหมดเผยแพร่อัตราเดียวหลักที่ $0.14/s ซึ่งเป็นระดับ 2K; อัตรา 768P แสดงในบิล ไม่ใช่ในรายการ ดังนั้นวัดด้วยตัวเองสักครั้ง และไม่มีสี่โมเดลนี้ที่ลดราคาอยู่ตอนนี้ ถ้าคุณต้องการตัดขั้นตอนการล็อกเฟรม openai/gpt-image-2-developer/text-to-image กำลังลดราคา 50% ($0.004 จาก $0.009) ณ สิงหาคม 2026 และมันเป็นตระกูลเดียวกันที่ทำงานเดียวกัน
วิธีทดสอบ MiniMax H3 2K เทียบกับ 768P ด้วยตัวเอง
ห้าขั้นตอน, เครดิต $2.21, และเวลาจริงประมาณ 15 นาที ทุกพรอมต์ด้านล่างคือสตริงที่ผมส่งจริง
หมายเหตุพารามิเตอร์สามข้อก่อน เพราะแต่ละข้อสามารถทำให้คุณเสียรอบได้อย่างเงียบๆ:
- บนข้อความเป็นวิดีโอ ฟิลด์คือ
ratioไม่ใช่aspect_ratioค่าเริ่มต้นคือ1:1และ enum ไม่มีตัวเลือกadaptiveส่ง16:9เองไม่งั้นคุณจะได้คลิปสี่เหลี่ยม บนภาพเป็นวิดีโอ enum มีเพียงadaptiveเพราะเฟรมแรกของคุณเป็นตัวกำหนดรูปร่าง - ส่ง
durationอย่างชัดเจนเสมอ แทนที่จะเชื่อถือค่าเริ่มต้นที่เอกสารระบุว่า 8 สิ่งที่คุณถูกเรียกเก็บเงินเป็นไปตามสิ่งที่ส่งมอบ ไม่ใช่สิ่งที่คุณสันนิษฐาน - ทุกงาน H3 อยู่ได้นานกว่า timeout แบบอินไลน์ปกติ ดังนั้นส่งแบบ async แล้ว poll ฟิลด์
priceก็เติมทีหลังเช่นกัน: เมื่อstatusเปลี่ยนเป็นcompletedมันมักจะว่างเปล่า และคุณต้อง poll id การทำนายอีกครั้งเพื่อรับตัวเลขจริง หากไม่มี poll ครั้งที่สอง คุณจะไม่สามารถสร้างตารางต้นทุนที่ซื่อสัตย์ได้
ขั้นตอนที่ 1: ล็อกเฟรมด้วย GPT Image 2
นี่คือขั้นตอนที่เปลี่ยนร่างคร่าวๆ ให้เป็นตัวอย่างแทนลอตเตอรี่ สร้างองค์ประกอบที่เสร็จสมบูรณ์เป็นภาพนิ่ง แล้วมันจะกลายเป็นส่วนที่ไม่สามารถเคลื่อนย้ายได้ของทั้งสองรันวิดีโอ
text1Macro product photograph of a matte black cold-brew coffee bottle standing on a wet slate slab, morning window light raking across it from the right. A cream paper label wraps the bottle, sharply legible: bold uppercase title "NORTHBOUND COLD BREW" on one line, and directly beneath it in small type "single origin ethiopia guji / 250ml / roasted 04.08.2026". Condensation beads on the glass, an espresso machine and a barista in a denim shirt softly out of focus in the background. Cinematic, shallow depth of field, warm neutral grade, photoreal, 16:9. 2
การตั้งค่า: quality high, size 2048x1152 อย่าประหยัดที่นี่ ทุกรายละเอียดที่คุณต้องการให้ 2K pass ป้องกันต้องมีอยู่ในเฟรมนี้ก่อน

เฟรมแรกที่ล็อกไว้ สร้างด้วย GPT Image 2 ที่ 2048x1152 แสดงขวดโคลด์บริวและตัวพิมพ์เล็กที่อ่านได้
สร้างด้วย openai/gpt-image-2/text-to-image, quality high, 2048x1152. คิดเงิน $0.1745, กลับมาใน 146s.

GPT Image 2 playground บน Atlas Cloud พร้อมพรอมต์เฟรมที่กรอกแล้ว และขวดที่สร้างแล้วในแผงเอาต์พุต
GPT Image 2 บน Atlas Cloud: quality ตั้งเป็น high, 16:9, เฟรมที่ล็อกไว้แสดงทางด้านขวา
ขั้นตอนที่ 2: ร่างคร่าวๆ ที่ 768P
endpoint เดียวกับที่คุณจะใช้สำหรับ final มีเพียงความละเอียดที่แตกต่างกันระหว่างขั้นตอนนี้กับขั้นตอนที่ 4
text1Slow macro dolly-in on the bottle. Condensation beads slide down the glass. The label stays perfectly still and legible. In the soft background the barista wipes the counter once. Natural cafe room tone, a faint espresso machine hiss. No camera shake. 2
การตั้งค่าบน minimax/h3/image-to-video: first frame = ผลลัพธ์จากขั้นตอนที่ 1, resolution=768P, duration=4, ratio=adaptive

คลิปร่างคร่าวๆ MiniMax H3 768P, การดอลลี่เข้าแบบช้าๆ ที่ขวดโคลด์บริว
ร่างคร่าวๆ 768P: 1344x768, คิดเงิน $0.40, กลับมาใน 194s แสดงเป็น GIF เงียบ ไฟล์เองมีเสียงสเตอริโอ 32 kHz สังเกตรอยหยดหนักสี่รอยที่เลอะลงบนป้าย

MiniMax H3 image-to-video playground บน Atlas Cloud พร้อมเฟรมที่ล็อกไว้ อัปโหลดแล้ว พรอมต์พิมพ์แล้ว และคลิปที่เสร็จสมบูรณ์ในแผงเอาต์พุต
ฟอร์ม image-to-video พร้อมเฟรมที่ล็อกไว้โหลดแล้ว Resolution และ Duration เป็นสองฟิลด์เดียวที่แยกขั้นตอนนี้ออกจากขั้นตอนที่ 4 และทั้งสองระดับอยู่ในรายการเดียวกัน โดยไม่มีอะไรกีดขวางทั้งสอง ภาพนี้ถูกปล่อยไว้ที่ค่าเริ่มต้น 2K และ 8 วินาที ซึ่งเป็นสาเหตุที่ปุ่ม Run แสดง $1.12; สลับ Resolution เป็น 768P และ Duration เป็น 4 แล้วราคานั้นจะลดลงเหลือ $0.40
ขั้นตอนที่ 3: ตัดสินร่างคร่าวๆ MiniMax H3 2K เทียบกับ 768P ในสิ่งที่ถูกต้อง
ร่างคร่าวๆ คือการซ้อม ไม่ใช่หลักฐาน จากสองคู่ของผม นี่คือสิ่งที่มันบอกคุณได้อย่างน่าเชื่อถือและสิ่งที่บอกไม่ได้
เชื่อถือได้สำหรับ: ถ้อยคำพรอมต์, การเคลื่อนไหวอ่านได้หรือไม่, ปริมาณการเคลื่อนไหวของกล้อง, จังหวะตลอดสี่วินาที, และเสียงพื้นหลัง ทั้งหมดนั้นถ่ายทอดมาอย่างสะอาด
อย่าเชื่อถือสำหรับ: พื้นผิวละเอียด, ตัวพิมพ์เล็กที่สุดบนผลิตภัณฑ์ของคุณ, หรือสิ่งแปลกปลอมใดๆ ที่มันสร้างขึ้น ในร่างคร่าวๆ 768P ของผม ป้ายมีรอยหยดสีน้ำตาลหนาสี่รอยที่รัน 2K ไม่ได้สร้าง และบรรทัดส่วนผสมเล็กๆ กลายเป็นเลอะเทอะ ถ้าผมปฏิเสธร่างคร่าวๆ นั้นเพราะดูสกปรก ผมก็จะปฏิเสธพรอมต์ที่ใช้ได้
นั่นคือการแบ่งงานที่แท้จริง 768P ตอบว่า "นี่คือช็อตที่ถูกต้องหรือไม่" 2K ตอบว่า "นี่ส่งมอบได้หรือไม่"
ขั้นตอนที่ 4: เปลี่ยนฟิลด์เดียวและทำ final ที่ 2K
endpoint เดียวกัน, เฟรมแรกเดียวกัน, พรอมต์สตริงเดียวกัน เปลี่ยน resolution เป็น 2K และไม่เปลี่ยนอย่างอื่น

คลิป final MiniMax H3 2K จากเฟรมแรกที่ล็อกไว้เดียวกัน พร้อมป้ายที่สะอาดและตัวพิมพ์เล็กที่อ่านได้
final 2K: 2560x1440, คิดเงิน $0.56, กลับมาใน 234s แผ่นหินเดียวกัน, เครื่องเอสเพรสโซเดียวกัน, ต้นไม้เดียวกัน, บาริสต้าคนเดียวกัน, ตำแหน่งป้ายเดียวกันกับร่างคร่าวๆ
นี่คือคำตอบสำหรับคำถามที่บทความทั้งหมดนี้ถูกสร้างขึ้นเพื่อทดสอบ และมันเป็นไปในทางที่ดี เมื่อเฟรมแรกถูกล็อก การเบี่ยงเบนหยุดลง ชุด, การจัดเฟรม, ความสูงของกล้อง และตำแหน่งตัวพิมพ์ทั้งหมดคงที่ระหว่างร่างคร่าวๆ 768P และ final 2K ความแตกต่างจำกัดอยู่ที่รายละเอียด: 2K pass ทำความสะอาดรอยหยดที่เลอะให้เหลือเพียงรอยไหลบางเส้นเดียว, แก้ไขลายกระดาษ, และเปลี่ยนบรรทัดส่วนผสมเล็กๆ จากสัญญาณรบกวนกลับเป็นคำ นั่นคือพฤติกรรมที่ MiniMax อ้างสำหรับการสร้างใหม่ในบริบท และนี่เป็นครั้งแรกในการทดสอบนี้ที่ 2K ดูเหมือนระดับคุณภาพมากกว่าการ reroll
สำหรับการเปรียบเทียบ กลุ่มควบคุม นี่คือการรันข้อความเป็นวิดีโอเปล่าๆ ที่ 2K ซึ่งสร้างคนแปลกหน้าที่ด้านบนของหน้านี้ พรอมต์เนื้อหาเดียวกัน ไม่มีเฟรมแรก ดังนั้นไม่มีอะไรยึดองค์ประกอบไว้

MiniMax H3 text-to-video playground ที่ 2K พร้อมคลิปควบคุมที่เสร็จสมบูรณ์ในแผงเอาต์พุต
MiniMax H3 text-to-video บน Atlas Cloud: ไม่มีเฟรมแรก, Resolution 2K, Aspect Ratio 16:9, และคลิปที่เสร็จสมบูรณ์ในแผงเอาต์พุต ไม่มีอะไรผิดปกติกับการสร้างนี้ มันแค่ไม่ใช่ฟิล์มเดียวกับที่รัน 768P สร้าง
ขั้นตอนที่ 5: หรือข้ามการ reroll MiniMax H3 2K เทียบกับ 768P และเพิ่มความละเอียดแทน
บางครั้งช็อต 768P ก็คือช็อตนั้นแล้ว ประสิทธิภาพลงตัว จังหวะถูกต้อง และคุณไม่ต้องการการสร้างใหม่ที่อาจลงเอยต่างออกไป ดังนั้นอย่า reroll ผลักไฟล์นั้นผ่านตัวเพิ่มความละเอียด
การตั้งค่าบน atlascloud/video-upscaler: video = URL ผลลัพธ์ 768P ของคุณ, target_resolution=2k อินพุตสูงสุดที่ 2K คือ 23 วินาทีและ 690 เฟรม และ input fps ต้องเป็น 30 หรือต่ำกว่า ดังนั้นคลิป 24 fps ของ H3 ผ่านได้อย่างสบาย

ช็อต 768P ที่ผลักผ่าน Atlas Cloud video upscaler ถึง 2K ฟุตเทจเดียวกันที่ความละเอียดสูงขึ้น
ช็อตที่เพิ่มความละเอียด: 2540x1452, คิดเงิน $0.12, กลับมาใน 40s หยดสี่รอยเดิม ทุกอย่างเหมือนเดิม นี่คือฟิล์มเดียวกัน ไม่ใช่ฟิล์มใหม่

Atlas Cloud video upscaler playground พร้อมคลิป 768P ที่โหลดแล้ว และผลลัพธ์ 2K ในแผงเอาต์พุต
video upscaler บน Atlas Cloud พร้อมคลิป H3 768P ที่โหลดแล้ว และผลลัพธ์ที่เพิ่มความละเอียดกำลังเล่นทางด้านขวา ภาพนี้รันบนค่าเริ่มต้น 1080p ซึ่งปุ่ม Run ตั้งราคาที่ $0.09 สำหรับอะไรก็ตามที่ต่ำกว่าขั้นต่ำ 5 วินาที สลับ Target Resolution เป็น 2k แล้วคุณจะอยู่ที่ระดับ $0.024/s ซึ่งคือ $0.12 ที่ผมถูกเรียกเก็บสำหรับการรันของตัวเอง
และนี่คือคำตัดสินที่ไม่มีใครควรข้าม การครอบป้ายทั้งสามจากเฟรมล็อกเดียวกันที่กำลังขยายเท่ากัน

เปรียบเทียบการครอบป้ายสามทาง: 768P ดั้งเดิม, คลิปนั้นที่เพิ่มความละเอียดเป็น 2K, และ 2K ดั้งเดิม แสดงให้เห็นว่ามีเพียง 2K ดั้งเดิมที่กู้คืนตัวพิมพ์เล็ก
768P ดั้งเดิม, คลิปเดียวกันที่เพิ่มความละเอียด, และ 2K ดั้งเดิม ตัวเพิ่มความละเอียดทำให้ลายกระดาษและชื่อใหญ่คมชัดขึ้นอย่างสวยงาม และรักษาช็อตเดิมไว้ สิ่งที่มันทำไม่ได้คือใส่บรรทัดเล็กกลับคืน เพราะข้อมูลนั้นไม่เคยอยู่ในไฟล์ 768P การผ่านการสร้างใหม่สามารถทำได้ เพราะมันกลับไปที่บริบทแทนที่จะไปที่พิกเซล
ดังนั้นสองเส้นทางไม่ใช่คู่แข่ง พวกเขาตอบคำถามต่างกัน การเพิ่มความละเอียดรักษาประสิทธิภาพ การสร้างใหม่กู้คืนรายละเอียด เลือกตามสิ่งที่คลิปของคุณไม่สามารถเสียได้
รูปแบบที่คุ้มค่าที่จะทดสอบบน MiniMax H3 2K เทียบกับ 768P
- แนวตั้ง การทดสอบ 16:9 ของผมกลับมา 1344x768 ดังนั้นด้านสั้นคือสิ่งที่ระดับกำหนด คำขอ 9:16 ควรลงที่ 768x1344 ด้วยตรรกะเดียวกัน แต่วัดสักครั้งก่อนที่คุณจะสร้างชุดงานแนวตั้งบนสมมติฐาน บน image-to-video คุณกำหนดรูปร่างผ่านเฟรมแรกแทนที่จะสู้กับ enum
adaptive - หัวพูดคุย นี่คือที่ที่ผมจะข้ามการร่างคร่าวๆ ทั้งหมดและตรงไปที่ 2K ใบหน้า ฟัน และแนวตาเป็นคลาสรายละเอียดเล็กที่การผ่านการสร้างใหม่มีอยู่ และร่างคร่าวๆ 768P จะให้ข้อมูลผิดเกี่ยวกับทั้งสาม
- คลิปยาว ที่ 15 วินาที ช่องว่างเพิ่มขึ้นเป็น $1.50 เทียบกับ $2.10 และเวลาจริงก็ยืดออกตาม วางแผนคิว ไม่ใช่แค่งบประมาณ
- ข้อความผลิตภัณฑ์และงานหลายภาษา ตัวอักษรในเฟรมที่คงที่ของ H3 และเสียงหลายภาษาแบบเนทีฟเป็นเหตุผลที่ผู้คนเลือกใช้สำหรับบรรจุภัณฑ์เชิงพาณิชย์ตั้งแต่แรก ทั้งสองยังคงอยู่ที่ 768P ซึ่งทำให้ 768P เป็นระดับการส่งมอบที่ใช้งานได้จริงสำหรับครอปโซเชียล ไม่ใช่แค่ห้องซ้อม
MiniMax H3 2K เทียบกับ 768P แท้จริงแล้วมีต้นทุนเท่าไหร่ต่อคลิปที่ใช้งานได้
อันดับแรก สามเส้นทางสู่ผลลัพธ์ที่ส่งมอบได้ 2K ต่อคลิป 8 วินาที ในอัตราที่ผมถูกเรียกเก็บจริง
| เส้นทางสู่คลิป 2K | อัตราที่ใช้ | ต้นทุนสำหรับคลิป 8s หนึ่งคลิป | คงช็อตเดิมไว้ | กู้คืนข้อความขนาดเล็ก |
|---|---|---|---|---|
| ตรงไปที่ 2K | $0.14/s | $1.12 | n/a | ใช่ |
| ร่างคร่าวๆ 768P, แล้ว reroll 2K บนเฟรมล็อก | $0.10/s แล้ว $0.14/s | $0.80 + $1.12 = $1.92 | ใช่ ถ้าเฟรมแรกถูกล็อก | ใช่ |
| final 768P, แล้วเพิ่มความละเอียดเป็น 2K | $0.10/s แล้ว $0.024/s | $0.80 + $0.192 = $0.99 | ใช่ ตรงตามนั้น | ไม่ |
ตอนนี้ตัวเลขที่ตัดสินเดือนของคุณ ใช้ส่วนผสมที่สมจริง: ร่างคร่าวๆ 4 วินาทีสิบครั้งเพื่อหาช็อต จากนั้น final 8 วินาทีสองครั้ง
| ชุดงาน 10 ร่างคร่าวๆ + 2 final | ร่างคร่าวๆ | final | ล็อกเฟรม | รวม |
|---|---|---|---|---|
| ทุกอย่างที่ 2K | 10 x 4s x $0.14 = $5.60 | 2 x 8s x $0.14 = $2.24 | ไม่มี | $7.84 |
| ร่างคร่าวๆ 768P, final 2K, เฟรมล็อก | 10 x 4s x $0.10 = $4.00 | $2.24 | $0.17 | $6.41 (น้อยกว่า 18%) |
| ร่างคร่าวๆ 768P, final 768P, เพิ่มความละเอียด | $4.00 | 2 x ($0.80 + $0.192) = $1.98 | $0.17 | $6.15 (น้อยกว่า 22%) |
อ่านแถวกลางอย่างตรงไปตรงมา การประหยัดต่อวินาทีคือ 29% แต่การประหยัดต่อชุดงานคือ 18% เพราะ final ของคุณยังคงเป็น final การประหยัดจะเพิ่มขึ้นถึง 29% เมื่อการร่างคร่าวๆ ครอบงำ: ที่ยี่สิบร่างคร่าวๆ 8 วินาทีแทนที่จะเป็นสิบอันสั้น เส้นทางที่สองจะต่ำกว่าทั้งหมด 2K ประมาณ 25% และทุกเซ็นต์ของมันขึ้นอยู่กับเฟรมที่ล็อก เพราะหากไม่มีมัน สิบรอบราคาถูกเหล่านั้นคือสิบฟิล์มที่คุณจะไม่ส่ง
เงินปันผลที่สองคือเวลา และมันอาจสำคัญกว่า ในคู่ข้อความเป็นวิดีโอ 768P กลับมาเร็วกว่า 28% และในทั้งสองคู่ มันไม่เคยใช้เวลานานกว่าเลย ในคลิป 4 วินาทีที่เวลาจริงเหล่านั้น นั่นคือประมาณ 27 ร่างคร่าวๆ ในหนึ่งชั่วโมงแทนที่จะเป็น 20 เมื่อคุณยังคงตามหาพรอมต์ที่ถูกต้อง การสวิงเพิ่มอีกเจ็ดครั้งมีความสำคัญมากกว่า $1.60 ที่คุณประหยัดได้
หมายเหตุทางกฎหมายหนึ่งข้อหากคุณวางแผนที่จะหลีกเลี่ยงทั้งหมดนี้โดยโฮสต์เอง น้ำหนักเปิดบน Hugging Face คือ H3-Base ซึ่งสร้างที่ด้านสั้น 768 การผ่าน 2K อยู่ฝั่ง API ดังนั้นน้ำหนักเปิดจะให้คุณระดับร่างคร่าวๆ และไม่ใช่ระดับ final ใบอนุญาตชุมชนยังมีดินแดนที่ถูกแยกออกครอบคลุม EU, UK, เกาหลี และ US โดยมีช่องทางการอนุญาตแยกต่างหากเปิดไว้ ดังนั้นอ่านใบอนุญาตก่อนที่คุณจะสร้างไปป์ไลน์เชิงพาณิชย์บนเช็คเอาท์ในเครื่อง สำหรับมุมมองที่กว้างขึ้นเกี่ยวกับสิ่งที่น้ำหนักที่เผยแพร่ทำและไม่รวม ดู รีวิว MiniMax H3 และ แคตตาล็อกโมเดลเต็ม หากคุณต้องการตั้งราคา H3 เทียบกับส่วนที่เหลือของฟิลด์วิดีโอปัจจุบัน
คำถามที่พบบ่อย
ใน MiniMax H3 2K เทียบกับ 768P 768P ถูกกว่าต่อคลิปจริงหรือไม่?
ใช่ ผมถูกเรียกเก็บเงิน $0.40 สำหรับคลิป 768P ความยาว 4 วินาที และ $0.56 สำหรับคำขอเดียวกันที่ 2K ดังนั้น $0.10/s เทียบกับ $0.14/s ประหยัด 29% ต่อวินาที ข้อแม้คือการประหยัดจะนับก็ต่อเมื่อรันราคาถูกสอนบางอย่างเกี่ยวกับรันแพง ซึ่งต้องล็อกเฟรมแรก ร่างคร่าวๆ ข้อความเป็นวิดีโอเปล่าๆ ที่ 768P เป็นฟิล์มที่แยกออกมา และเงินที่ใช้ไปกับมันไม่ใช่เงินที่ประหยัดได้
ใน MiniMax H3 2K เทียบกับ 768P 2K เป็นแค่การเพิ่มความละเอียดของเอาต์พุต 768P หรือไม่?
ไม่ MiniMax ให้โมเดลฐานสร้างเอาต์พุตความละเอียดต่ำของตัวเองใหม่ในบริบทแทนที่จะรันโมดูลซูเปอร์เรโซลูชันเฉพาะ ซึ่งเป็นสาเหตุที่ 2K สามารถกู้คืนข้อความขนาดเล็กและรายละเอียดพื้นผิวที่ละเอียดซึ่งตัวเพิ่มความละเอียดสามารถประมาณได้เท่านั้น การครอบป้ายสามทางของผมแสดงให้เห็นอย่างชัดเจน: คลิป 768P ที่เพิ่มความละเอียดทำให้ลายกระดาษคมชัดขึ้น แต่ปล่อยให้บรรทัดส่วนผสมเล็กๆ เป็นสัญญาณรบกวนที่อ่านไม่ได้ ในขณะที่รัน 2K ดั้งเดิมเปลี่ยนมันกลับเป็นคำ
ร่างคร่าวๆ MiniMax H3 768P ของฉันจะดูเหมือน final 2K ของฉันหรือไม่?
เฉพาะในกรณีที่คุณล็อกเฟรมแรกเท่านั้น บนข้อความเป็นวิดีโอเปล่า สองระดับให้การตกแต่งชุดต่างกัน, ความสูงกล้องต่างกัน, หยดน้ำต่างกัน และตำแหน่งป้ายต่างกันจากพรอมต์เดียวกัน บนภาพเป็นวิดีโอที่มีเฟรมแรกคงที่ องค์ประกอบ, การจัดเฟรม และตัวพิมพ์ทั้งหมดคงที่ระหว่างระดับ และการเปลี่ยนแปลงเดียวคือในรายละเอียดและพื้นผิว
ฉันยังต้องติดต่อฝ่ายขายสำหรับ MiniMax H3 768P หรือไม่?
ไม่ ณ วันที่ 2026-08-05 schema สดบนทั้งสาม endpoint H3 แสดง resolution เป็น enum: ["768P", "2K"], playground แสดงทั้งสองในดรอปดาวน์เดียว และงาน 768P ของผมเสร็จสมบูรณ์และคิดเงินในอัตราที่ต่ำกว่าบนสอง endpoint ที่แตกต่างกัน บรรทัด closed-beta มาจากบทความที่เขียนในวันแรกหลังเปิดตัว
ใน MiniMax H3 2K เทียบกับ 768P 2K ช้ากว่าเท่าไหร่?
ในคู่ 4 วินาทีของผม 1.2x ถึง 1.4x ช้ากว่า: 181s เทียบกับ 130s บนข้อความเป็นวิดีโอ และ 234s เทียบกับ 194s บนภาพเป็นวิดีโอ วัดจากส่งถึงเสร็จ ในทางสถาปัตยกรรม 2K คือการผ่านการสร้างรุ่นที่สองบนบริบทเดียวกัน ดังนั้นคาดว่าช่องว่างสัมบูรณ์จะกว้างขึ้นบนคลิปที่ยาวขึ้น แทนที่จะคงที่
ฉันสามารถอัปเกรดคลิป 768P เป็น 2K โดยไม่ต้อง reroll ได้หรือไม่?
คุณสามารถเพิ่มความละเอียดโดยไม่ต้องแตะช็อตโดยการรันมันผ่านตัวเพิ่มความละเอียดวิดีโอ ซึ่งทำให้ผมเสียค่าใช้จ่าย $0.12 สำหรับคลิป 4.46 วินาทีที่ระดับ 2K ($0.024/s โดยมีขั้นต่ำ 5 วินาที) และกลับมาใน 40 วินาที ซึ่งรักษาประสิทธิภาพแบบเฟรมต่อเฟรม สิ่งที่มันจะไม่ทำคือกู้คืนรายละเอียดที่ไม่เคยถูกจับ ดังนั้นถ้าประเด็นของการไป 2K คือตัวพิมพ์เล็กที่อ่านได้ คุณต้องใช้การผ่านการสร้างใหม่ ไม่ใช่ตัวเพิ่มความละเอียด






