Seedance 2.5 ใช้งานได้แล้ววันนี้ — ที่แรกบน Atlas Cloud

Seedance 2.5 vs MiniMax H3: ทุกคนทดสอบ 30-Second Flex แล้ว แต่ไม่มีใครทดสอบ Shot 4

Seedance 2.5 vs MiniMax H3, ชีตตัวละครเดียวกัน, พร้อมท์เดียวกัน สเปกจริง, เวิร์กโฟลว์ละครสั้น 5 ขั้นตอนแบบคัดลอกวาง และอันไหนคงใบหน้าข้ามสี่ช็อต

MiniMax เปิดตัว H3 เมื่อวันศุกร์ ภายในยี่สิบสี่ชั่วโมง Seedance 2.5 ก็ตกถึงมือผู้คน และไทม์ไลน์ก็หดเหลือการสนทนาเดียว: สามสิบวินาที, 4K ดั้งเดิม, อินพุตอ้างอิงห้าสิบรายการ โพสต์เปิดตัวของ H3 วางอยู่ข้างใต้อย่างเงียบเชียบ โดยแทบไม่มีใครทดสอบจริงเลยสักคน

ผมเข้าใจว่าทำไม สามสิบวินาทีเป็นตัวเลขที่ยอดเยี่ยม มันเหมาะกับพาดหัวข่าว

แต่ถ้าคุณสร้างละครสั้นแนวตั้งจริง ๆ คุณจะรู้ว่าสิ่งที่ทำลายคืนของคุณไม่ใช่วินาทีที่สามสิบ มันคือช็อตที่ 4 แนวกรามของพระเอกขยับไปครึ่งเซนติเมตร ผ้าผูกคอสูญเสียรอยจับจีบไปหนึ่งทบ และผู้ชมก็ปัดออกไปก่อนที่จุดดึงดูดจะถึงจุดพีค ไม่มีใครออกจากแพลตฟอร์มเพราะคลิปสั้นไปสิบห้าวินาทีแทนที่จะเป็นสามสิบ พวกเขาออกไปเพราะผู้ชายในภาพClose-up ไม่ใช่ผู้ชายคนเดียวกับในภาพ Wide

ผมจึงข้ามการดวลสเปกไป ผมสร้าง Character Turnaround Sheet หนึ่งแผ่น, Location Board หกช่องหนึ่งแผ่น, เขียนพรอมต์ละครสั้นแนวโกธิกความยาว 15 วินาทีหนึ่งชุด และส่งแพ็คเกจที่เหมือนกันทุกประการให้กับทั้งสองฝั่ง จากนั้นผมก็จ้องไปที่ใบหน้า

ประเด็นสำคัญ

  • มีเพียง H3 เท่านั้นที่เรียกใช้งานได้ในวันนี้ — API ของ Seedance 2.5 เปิดให้บริการแล้วที่ ByteDance แต่ในแพลตฟอร์มนี้ยังเป็นหน้า Day-0 อยู่
  • สเปกแยกกันชัดเจน: Seedance 2.5 = 30 วินาทีในช็อตเดียว, 4K ดั้งเดิม, มากถึง 50 รายการอ้างอิง; H3 = 5–15 วินาที, 2K, เสียงสเตอริโอในทุกคลิป
  • ความเสถียรของตัวละครเป็นปัญหาเรื่องการจัดแพ็คเกจ — ชุดอ้างอิงที่ดีเพียงชุดเดียว ไม่ใช่โมเดลที่ใหญ่กว่า คือสิ่งที่ยึดใบหน้าไว้
  • ทั้งคู่สร้างเสียงดั้งเดิมได้; H3 ยังสามารถจับเสียงจากไฟล์เสียงอ้างอิงได้สูงสุดสามไฟล์
  • ตัดสินที่พิกเซลต่อเฟรม ไม่ใช่วินาที — ในการรันเดียวกัน H3 ส่งคืนที่ 1440p ในขณะที่ Seedance ส่งคืนที่ 720p

ผลลัพธ์ Seedance 2.5 vs MiniMax H3 ก่อนทฤษฎีใด ๆ

ก่อนทฤษฎีใด ๆ นี่คือสิ่งที่เวิร์กโฟลว์สร้างขึ้น นี่คือสี่ช็อตที่ดึงมาจากคลิปแนวตั้งความยาว 15 วินาทีที่เสร็จสมบูรณ์แล้วและเรียงต่อกัน เป็นการรันด้วย H3 Reference ของ MiniMax เองที่สร้างจาก Character Sheet และ Location Board ที่คุณจะเห็นในขั้นตอนที่ 1 และขั้นตอนที่ 2 ที่ความละเอียด 1440x2560 ดั้งเดิม การรันแพ็คเกจเดียวกันของผมเองจะอยู่ในบทช่วยสอนในภายหลัง โดยแสดงสถานะในหน้าการทดลอง

 

 

เธอเดินไปถึงประตูแกะสลัก ซึ่งเป็นแผงที่ 4 ของ Location Board ตามด้วยฉากเผชิญหน้าในทางเดิน แล้วก็Close-up แนบชิดใบหน้าของเขา ตามด้วยสองช็อต เส้นผมของเขาแสกในทางเดียวกันในโปรไฟล์และในภาพClose-up มวยผมครึ่งศีรษะถักเปียของเธอยังคงสภาพเดิมในภาพClose-up เต็มหน้า ซึ่งเป็นจุดที่โมเดลส่วนใหญ่จะสร้างใบหน้าขึ้นมาใหม่อย่างเงียบ ๆ เสื้อท่อนบนลูกไม้สีครีมยังคงคอเสื้อและข้อมือแบบเดียวกันตั้งแต่เฟรมแรกถึงเฟรมสุดท้าย

นั่นคือการทดสอบทั้งหมด ไม่ใช่สามสิบวินาที แต่เป็นสี่ช็อตและแนวกราม

เหตุใด Seedance 2.5 vs MiniMax H3 จึงออกมาในสัปดาห์เดียวกัน และเหตุใดการทดสอบความเสถียรของตัวละครส่วนใหญ่จึงไร้ประโยชน์

MiniMax เปิดตัว H3 เมื่อวันที่ 30 กรกฎาคม ซึ่งเป็นโมเดลวิดีโอ multimodal แบบวัตถุประสงค์ทั่วไปที่อ่านข้อความ รูปภาพ วิดีโอ และเสียงเป็นบริบทเดียว และส่งคืนคลิปความยาว 5 ถึง 15 วินาทีที่ความละเอียดสูงสุด 2K พร้อมเสียงสเตอริโอดั้งemble นอกจากนี้ยังสามารถแก้ไขฟุตเทจที่มีอยู่และถ่ายโอนการเคลื่อนไหวจากคลิปหนึ่งไปยังอีกคลิปหนึ่งได้ และ MiniMax กล่าวว่าน้ำหนักของโมเดลจะตามมาในอีกไม่กี่วัน (Reuters, กรกฎาคม 2026)

Seedance 2.5 เปิดตัวในกรอบเวลาเดียวกันพร้อมกับตัวเลขที่ดังกว่า: 30 วินาทีในการสร้างครั้งเดียว, 4K ดั้งเดิม, และอินพุตอ้างอิง multimodal มากถึง 50 รายการในงานเดียว (The Next Web, กรกฎาคม 2026) API ของมันอยู่ในมือของนักพัฒนาแล้ว พร้อมด้วยการแก้ไขเฉพาะจุดที่วาดส่วนหนึ่งของเฟรมใหม่ในขณะที่คงประสิทธิภาพ แสง และพฤติกรรมของกล้องไว้, Reference-to-Video ที่ยอมรับฉากกรีนสกรีนหรือโมเดล 3D สีขาว, ภาษาให้เลือกสิบเอ็ดภาษา, และโหมดวิดีโอความยาวสูงสุดที่ทดลองถึง 180 วินาที (CineD, กรกฎาคม 2026)

 

 

ช่องว่างของความสนใจเป็นส่วนที่น่าสนใจ เกือบทุกโพสต์ที่ผมหาเจอเป็นคลิปของ 2.5 ในขณะที่ตัวเลขในสนามสาธารณะบอกอีกอย่างหนึ่ง: บนกระดานผู้นำ Image-to-Video ของ Artificial Analysis, Seedance 2.0 ที่ 720p เป็นผู้นำด้วย 1,196 Elo, Gemini Omni Flash ตามมาที่ 1,195 และ MiniMax H3 อยู่อันดับสามแล้วที่ 1,185 หลังจากเปิดตัวเพียงสี่วัน Seedance 2.5 ยังไม่มีคะแนนที่นั่น (Artificial Analysis, กรกฎาคม 2026) โมเดลที่มีการพูดถึงน้อยที่สุดคือโมเดลที่มีอัตราส่วนคะแนนต่อความสนใจสูงที่สุด

ตอนนี้มาถึงส่วนที่กำหนดผลลัพธ์ของคุณจริง ๆ เพราะมันแทบไม่เกี่ยวข้องกับว่าคุณเลือกโลโก้ไหน

การทดสอบความเสถียรของตัวละครส่วนใหญ่ล้มเหลวก่อนที่โมเดลจะมีส่วนเกี่ยวข้องด้วยซ้ำ มีสี่รูปแบบความล้มเหลว และทั้งสี่รูปแบบเป็นสิ่งที่คุณต้องแก้ไข:

รูปแบบความล้มเหลวสิ่งที่คุณเห็นในผลลัพธ์วิธีการแก้ไข
ส่งข้อมูลอ้างอิงแบบหลายมุมมองเป็นไฟล์แยกกันใบหน้าในแต่ละช็อต "เกือบถูก" แต่ไม่มีสองช็อตใดตรงกันรวมมุมมองต่าง ๆ เป็นภาพเดียว จากนั้นกำหนดบทบาทในพรอมต์ ("ผู้ชายทางซ้าย", "ผู้หญิงทางขวา")
เขียนคำอธิบายตัวละครใหม่ในแต่ละช็อตเสื้อผ้าและเครื่องประดับคลาดเคลื่อนไปในแต่ละช็อตเขียนบล็อกข้อมูลประจำตัวครั้งเดียวแล้วใช้ซ้ำ คำต่อคำ; เฉพาะกล้องและการกระทำที่เปลี่ยนไปในแต่ละช็อต
ปล่อยให้แสงเปลี่ยนไปตามฉากใบหน้าถูกสร้างขึ้นใหม่ในโครงสร้างภายใต้แสงใหม่สร้าง Location Board แยกต่างหากที่ล็อกทิศทางแสง หมอก และการสะท้อนของพื้น และป้อนเป็นข้อมูลอ้างอิง
ถือว่าระยะเวลาสูงสุดเป็นตัวชี้วัดคุณภาพความคลาดเคลื่อนหนึ่งครั้งภายใน 30 วินาทีทำลายทุกสิ่งตัดให้สั้นลงจนถึงระดับที่คุณสามารถสร้างใหม่ได้ แล้วค่อยพูดถึงความยาว

ต้องการให้ Seedance 2.5 และ MiniMax H3 เจอกับพรอมต์เดียวกันด้วยตัวเองหรือไม่? พื้นที่เปรียบเทียบโมเดลของ Atlas Cloud รันทั้งสองโมเดลเคียงข้างกันในครั้งเดียว — พรอมต์และการตั้งค่าที่เหมือนกัน โดยมีค่าใช้จ่ายโดยประมาณก่อนที่คุณจะสร้าง — ดังนั้นคุณจึงสามารถตัดสินใบหน้า การเคลื่อนไหว และข้อความบนหน้าจอได้โดยไม่ต้องจองการทดสอบแยกสองครั้ง

การเปรียบเทียบโมเดล Atlas Cloud ที่กำลังรัน Seedance 2.5 และ MiniMax H3 ด้วยพรอมต์เดียวกัน โดยแสดงราคาและความละเอียดของการรันแต่ละครั้งไว้เคียงข้างกัน

Seedance 2.5 และ MiniMax H3 ด้วยพรอมต์ที่เหมือนกันในพื้นที่เปรียบเทียบโมเดลของ Atlas Cloud Seedance 2.5 ส่งคืนที่ 720p ราคา $2.42; MiniMax H3 ส่งคืนที่ 1440p ราคา $1.12 และราคาทั้งสองถูกประมาณก่อนการรัน ถ่ายภาพสดจากหน้า Model-Explorer

แถวแรกคือสิ่งที่คนส่วนใหญ่ทำผิด ส่งภาพมุมมองเดี่ยวหกภาพ โมเดลจะถือว่าพวกมันเป็นบุคคลที่มีศักยภาพหกคนแล้วเฉลี่ยพวกมัน ส่งภาพรวมที่สะอาดหนึ่งภาพ โมเดลจะถือว่าพวกมันเป็นบุคคลคนเดียวที่เห็นจากสามด้าน พิกเซลเดียวกัน ผลลัพธ์ต่างกันโดยสิ้นเชิง

 

 

สเปก Seedance 2.5 vs MiniMax H3 และสิ่งที่คุณเรียกใช้งานได้จริงในวันนี้

แยกขีดความสามารถออกจากความพร้อมใช้งาน แล้วความตึงเครียดก็ชัดเจน ในด้านขีดความสามารถดิบ Seedance 2.5 นำในด้านระยะเวลา ความละเอียดสูงสุด จำนวนข้อมูลอ้างอิง และความละเอียดในการแก้ไข ในด้านความพร้อมใช้งาน H3 คือโมเดลที่มีเอนด์พอยต์ที่ใช้งานได้สามจุดบนแพลตฟอร์มโมเดลอเนกประสงค์ในสัปดาห์นี้ หากคุณกำลังเปรียบเทียบโมเดลวิดีโอ AI สำหรับการวางแผนในปี 2026 คอลัมน์ที่สองนั้นสำคัญพอ ๆ กับคอลัมน์แรก

 MiniMax H3Seedance 2.5Seedance 2.0 Ref-to-Video (ที่ผมรัน)
ความยาวสูงสุด ต่อการสร้างหนึ่งครั้ง5 ถึง 15 วินาทีสูงสุด 30 วินาที, ไม่ต้องต่อ (โหมดเบต้าถึง 180 วินาที, ทดลอง)เมนูคลิปสั้น, ดูที่หน้าโมเดล
ความละเอียด2K ดั้งเดิม, ด้านสั้น 1440p ที่ 16:9 ถึง 9:16; มีระดับ 768p กำลังจะมา4K ดั้งเดิม, สี 10-bitสูงสุด 720p บนเอนด์พอยต์นี้
อัตราเฟรม24 fpsไม่ได้เผยแพร่แยกต่างหากไม่ได้เผยแพร่แยกต่างหาก
ข้อมูลอ้างอิง9 รูปภาพ + 3 วิดีโอ + 3 เสียง, รวม 12 ไฟล์มากถึง 50 รายการอ้างอิง multimodal9 รูปภาพ + 3 วิดีโอ + 3 เสียง
เสียงดั้งเดิมใช่, ทุกเอาต์พุต, สเตอริโอใช่, พร้อมภาษาใต้เรื่องและเสียงพากย์ 11 ภาษาใช่
ความละเอียดในการแก้ไขแก้ไขทั้งคลิปตามคำสั่ง (สลับตัวละคร, พื้นหลัง, แสง, บทสนทนา)แก้ไขระดับภูมิภาคที่วาดส่วนหนึ่งของเฟรมใหม่แก้ไขทั้งคลิปตามคำสั่ง
ความยาวพรอมต์สูงสุด7,000 ตัวอักษรไม่ได้เผยแพร่ไม่ได้เผยแพร่
เปิดน้ำหนักโมเดลประกาศว่าจะปล่อยภายในไม่กี่วันหลังเปิดตัวยังไม่ประกาศยังไม่ประกาศ
Artificial Analysis I2V Elo, 31 ก.ค. 20261,185 (อันดับ 3)ยังไม่ได้รับการจัดอันดับ1,196 (อันดับ 1, รายการ Dreamina 720p)
เรียกใช้งานได้บนแพลตฟอร์มที่ผมทดสอบใช่, 3 เอนด์พอยต์ยังไม่, หน้า Day-0ใช่

การเปิดเผยข้อมูลอย่างเต็มรูปแบบเกี่ยวกับการตั้งค่าการทดสอบ Seedance 2.5 ยังไม่เปิดให้บริการบนแพลตฟอร์มของผมเมื่อผมรันการทดสอบนี้ ดังนั้นฝั่ง Seedance จึงเป็น Seedance 2.0 Reference-to-Video ซึ่งเป็นสมาชิกของตระกูลเดียวกันที่ให้บริการอยู่ในปัจจุบันและมีระบบอ้างอิงแบบสี่โมดอลเดียวกัน ในกรณีที่ 2.5 จะเปลี่ยนคำตอบ ผมจะบอกไว้ หน้า Seedance 2.5 เป็นประกาศ Day-0 ในตอนนี้

ทุกอย่างด้านล่างนี้รันในแท็บเบราว์เซอร์เดียว ด้วยคีย์เดียว รวมสามโมเดล:

ขั้นตอนโมเดลสิ่งที่ผลิตการตั้งค่าหลักสิ่งที่กำหนดต้นทุน
1OpenAI GPT Image 2 Text-to-ImageCharacter Turnaround Sheetคุณภาพสูง, 16:9ต่อภาพ, จ่ายตามการใช้งาน, อัตราปัจจุบันที่หน้าโมเดล
2โมเดลเดียวกัน, รันครั้งที่สองLocation and Lighting Board หกแผงคุณภาพสูง, 16:9ต่อภาพ, จ่ายตามการใช้งาน
3MiniMax H3 Reference-to-Videoคลิป 9:16 พร้อมเสียงดั้งเดิม9:16, 2K, ระยะเวลา 5 สำหรับทดสอบ และ 15 สำหรับจริงวินาที x ความละเอียด, คิดราคาต่อวินาที
4Seedance 2.0 Reference-to-Videoการรันควบคุม, อินพุตเหมือนกัน9:16, ความละเอียดสูงสุดที่มี, ระยะเวลาเท่ากันวินาที x ความละเอียด, คิดราคาต่อวินาที
5H3 Reference-to-Video, ใช้อินพุตเป็นคลิปแก้ไขหนึ่งช็อตโดยไม่ต้องสร้างทุกอย่างใหม่ความละเอียดเท่ากัน, ระยะเวลาสั้นวินาที x ความละเอียด, คิดราคาต่อวินาที

H3 ยังมีรายการ text-to-video และ image-to-video หากคุณต้องการ baseline แบบข้อความล้วน หรือการควบคุมเฟรมแรกและเฟรมสุดท้ายแทน

อีกสิ่งหนึ่งที่ควรรู้ก่อนวางแผนทำแบตช์: ข้อความบนหน้าจอ ลำดับชื่อเรื่อง H3 ความยาว 15 วินาทีนี้สามารถคงเครดิตภาษาอังกฤษไว้ได้ตลอดแปดคัทแบบ Hard Cut โดยไม่มีคำสะกดผิดแม้แต่คำเดียว ซึ่งเป็นหนึ่งในสิ่งที่ยากที่สุดที่จะรักษาให้คงที่ในวิดีโอที่สร้างขึ้น

 

 

เวิร์กโฟลว์ละครสั้น Seedance 2.5 vs MiniMax H3 ทีละขั้นตอน

ห้าขั้นตอน คัดลอกพรอมต์ตามที่เขียนไว้ทุกประการ รวมถึงส่วนที่ดูไม่สวยงามด้วย ผมไม่ได้ทำความสะอาดเพื่อบทความ และคุณก็ไม่ควรทำความสะอาดเพื่อโมเดลเช่นกัน

ขั้นตอนที่ 1: สร้าง Character Sheet ด้วย GPT Image 2

สร้างชุดอ้างอิงก่อนที่จะสร้างวิดีโอใด ๆ หนึ่งภาพ, สองตัวละคร, สามมุมมองต่อตัวละคร, พื้นหลังสีขาวล้วนไร้รอยต่อ, แสงในสตูดิโอที่สม่ำเสมอ วิธีนี้จะขจัดความคลุมเครือทั้งหมดยกเว้นสิ่งเดียวที่คุณสนใจ: บุคคลนี้มีหน้าตาอย่างไร

plaintext
1A full-body character turnaround reference sheet on a pure white seamless background, two characters side by side, six figures total, even neutral studio lighting, no shadows on the floor, no text, no labels, no watermark.
2
3LEFT HALF, male lead, three views in a row: front, right profile, back. Late 20s, pale complexion, dark wavy medium-length hair, sharp jawline. Wearing a floor-length black velvet frock coat with subtle tone-on-tone embroidery on the lapels and cuffs, a black brocade waistcoat, a black silk cravat, straight black trousers, polished black leather derby shoes. Arms relaxed at his sides, neutral expression.
4
5RIGHT HALF, female lead, three views in a row: front, right profile, back. Early 20s, fair complexion, long wavy chestnut-brown hair with a half-up braided crown. Wearing a cream Victorian cotton-lace dress, long sleeves with lace cuffs, fitted bodice with small buttons, full ankle-length skirt, cream ankle-strap low-heel shoes. Arms relaxed at her sides, neutral expression.
6
7Photographic realism, consistent scale between all six figures, feet aligned on the same baseline, sharp focus edge to edge.

การตั้งค่า: โมเดล OpenAI GPT Image 2 Text-to-Image, คุณภาพสูง, อัตราส่วนภาพ 16:9, ส่วนที่เหลือเป็นค่าเริ่มต้น รวม: 11 คำ. สมบูรณ์แบบ. อินเทอร์เฟซตัวสร้างภาพ AI แสดงการป้อนพรอมต์และตัวละครที่สร้างขึ้น GPT Image 2 Text-to-Image บน Atlas Cloud, การรันเสร็จสมบูรณ์: พรอมต์ Turnaround ทางซ้าย, หกตัวละครบนแผ่นสีขาวในแผง OUTPUT

นี่คือรูปร่างเป้าหมาย หกตัวละคร หนึ่งเส้นฐาน ไม่มีอะไรในพื้นหลังให้ถกเถียง: มาดู ชุดอ้างอิงที่ขับเคลื่อนคลิปสาธิต: พระเอกในชุดกำมะหยี่สีดำ, นางเอกในชุดลูกไม้วิคตอเรียนสีครีม, สามมุมมองต่อคน, ไฟล์เดียว มุมมองด้านหน้า ด้านข้าง และด้านหลังของชุดวิคตอเรียนสีดำและสีครีม การรัน GPT Image 2 ของผมเองจากพรอมต์ในขั้นตอนที่ 1 เพื่อเปรียบเทียบกับข้อมูลอ้างอิงด้านบน

ขั้นตอนที่ 2: ล็อกสถานที่ด้วย Scene Board หกแผง

คุณยึดใบหน้าไว้ได้แล้ว แต่แสงยังคงหักหลังคุณได้ ภาพอ้างอิงที่สองจะกำหนดตำแหน่งกล้องหกตำแหน่ง ทิศทางของแสงจันทร์ ปริมาณหมอกในอากาศ และความเปียกของพื้นที่อ่านได้ คุณกำลังบอกโมเดลว่าภาพยนตร์เรื่องนี้มีชุดแสงเพียงชุดเดียว

plaintext
1A six-panel cinematic location board, 2 rows by 3 columns, thin black gutters between panels, each panel captioned in small elegant white all-caps letterspaced type at the bottom of that panel. Subject: the interior of an abandoned gothic castle at night. Cold blue moonlight, drifting low fog, wet reflective stone floor, tall stained-glass windows, iron candle sconces with small warm flames, deep desaturated blacks, heavy velvet curtains. No people in any panel.
2
3Panel 1, caption "WIDE ESTABLISHING VIEW - CORRIDOR": a long pillared corridor receding to a lit stained-glass window.
4Panel 2, caption "LOW ANGLE - MOONLIGHT ACROSS FLOOR": low camera, a shaft of moonlight raking across wet flagstones.
5Panel 3, caption "DOORWAY & STAIRCASE COMPOSITION": an arched doorway framing a curved stone staircase.
6Panel 4, caption "CLOSE DETAIL - CARVED DOOR": tight shot of a heavy carved wooden door with an iron handle.
7Panel 5, caption "WINDOW-SIDE VIEW - FOG & CURTAINS": tall window, fog rolling in, curtain edge in foreground.
8Panel 6, caption "FINAL POSTER FRAME - EMPTY HALL": symmetrical empty hall, patterned runner rug leading to the window.
9
10Photographic, cinematic, film grain, consistent colour grade across all six panels.

การตั้งค่า: โมเดลเดียวกัน, คุณภาพสูง, อัตราส่วนภาพ 16:9 บอร์ดสตoryboard หกแผงของภายในปราสาทโกธิกมืดพร้อมแสงจันทร์ Location Board ที่ขับเคลื่อนคลิปสาธิต: ภายในปราสาทโกธิกหกแบบ, เกรดสีเดียว, คำบรรยายอ่านได้ มุมกล้องภาพยนตร์หกมุมของภายในปราสาทโกธิกมืด การรัน GPT Image 2 ของผมเองจากพรอมต์บอร์ดในขั้นตอนที่ 2

ขั้นตอนที่ 3: สร้างช็อตด้วย MiniMax H3 reference-to-video

ภาพอ้างอิงสองภาพบวกกับพรอมต์หนึ่งอันที่ระบุตำแหน่งกล้องและทิศทางเสียง เสียงถูกสร้างขึ้นในรอบเดียวกัน ดังนั้นจึงไม่มีขั้นตอนแยกสำหรับเสียงพากย์หรือดนตรี เก็บระยะเวลาให้สั้นในขณะที่คุณปรับแต่ง จากนั้นเพิ่มเป็น 15 สำหรับการตัดจริง

plaintext
1Reference image 1 is the character sheet: the man on the LEFT is the male lead, the woman on the RIGHT is the female lead. Keep both identities exactly as shown: his jawline, dark wavy hair, black velvet frock coat, black brocade waistcoat and black silk cravat; her chestnut half-up braided hair and cream Victorian lace dress. Reference image 2 is the location and lighting board: match its cold blue moonlight, drifting fog, wet reflective stone floor and desaturated black tones.
2
39:16 vertical, premium live-action short-drama look, shallow depth of field, cinematic contrast, no subtitles, no on-screen text, no watermark.
4
5Shot 1: Medium close-up, camera slowly pushing in. The female lead stands in the moonlit corridor, breathing shallow, eyes fixed on something off-frame right. Fog moves past her at knee height.
6Shot 2: Hard cut. Over-the-shoulder from behind her, the male lead steps out of the dark archway into the moonlight, coat catching the light, expression cold and curious.
7Shot 3: Tight close-up on his face, half-lit by the window, then a matching close-up on hers as she refuses to look away.
8
9Audio: low sustained bass drone, distant stone echo, her unsteady breath, one heavy footfall as he steps into the light, a single soft string swell on the last cut.

การตั้งค่า: โมเดล MiniMax H3 Reference-to-Video, ความละเอียด 2K, ระยะเวลา 8 (ค่าเริ่มต้นของแถบเลื่อน; เลื่อนไปที่ 15 สำหรับการตัดจริง), อัตราส่วนภาพ Adaptive, และทั้งสองไฟล์ใน Reference Materials แผงนับเป็น 2 จาก 9 ดังนั้นคุณจึงมีพื้นที่เหลือเฟือที่จะเพิ่มเสื้อผ้าหรืออุปกรณ์ประกอบฉากในภายหลัง

เป็นที่น่าสังเกตว่าเกิดอะไรขึ้นกับอัตราส่วน ผมปล่อยให้ Aspect Ratio เป็น Adaptive และเขียนแค่ "9:16 vertical" ภายในพรอมต์เท่านั้น H3 ก็ส่งกลับแนวตั้งอยู่ดี ดังนั้นมันจึงอ่านเฟรมจากข้อความโดยไม่จำเป็นต้องใช้ฟิลด์ฟอร์ม อินเทอร์เฟซตัวสร้างวิดีโอ AI แสดงพรอมต์ข้อความและตัวอย่างวิดีโอที่เสร็จสมบูรณ์ MiniMax H3 Reference-to-Video บน Atlas Cloud, การรันเสร็จสมบูรณ์: ไฟล์อ้างอิงทั้งสองถูกโหลดเป็น 2 จาก 9, ความละเอียด 2K, และคลิปแนวตั้งที่สร้างขึ้นกำลังเล่นในแผง OUTPUT

เฟรมแรกคือนางเอกในเสื้อท่อนบนลูกไม้สีครีม ยืนอยู่ในทางเดินจากบอร์ดแผงที่ 1 มีหมอกที่ระดับเข่า และแสงจันทร์ส่องกระทบพื้นเปียกตรงตำแหน่งที่บอร์ดวางไว้ทุกประการ ภาพอ้างอิงทั้งสองให้ผลลัพธ์ตามที่ตั้งใจ

ขั้นตอนที่ 4: รันการควบคุม Seedance 2.5 vs MiniMax H3 ด้วยแพ็คเกจที่เหมือนกัน

อย่าเปลี่ยนคำสักคำ ใช้ภาพอ้างอิงสองภาพเดียวกัน พรอมต์เดียวกัน โมเดลคนละตัว ผมปล่อยค่าระยะเวลาเริ่มต้นของแต่ละหน้าไว้ตามเดิม แทนที่จะบังคับให้เท่ากัน และผมจะบอกว่าทั้งสองส่งคืนอะไรมาให้ด้านล่าง การเขียนพรอมต์ใหม่ "เพื่อ" โมเดลอื่นนั่นคือวิธีที่การเปรียบเทียบเริ่มโกหก

plaintext
1Same prompt as Step 3, verbatim. Do not re-word it for the other model.

การตั้งค่า: โมเดล Seedance 2.0 Reference-to-Video, ความละเอียด 720p, ภาพอ้างอิงสองภาพเดียวกันใน Reference Images (อีกครั้งเป็น 2 จาก 9, มีช่องแยกสำหรับวิดีโออ้างอิงสูงสุด 3 รายการ และไฟล์เสียงอ้างอิงสูงสุด 3 รายการ) ระยะเวลาปล่อยตามค่าเริ่มต้นของหน้า ซึ่งส่งคืนเป็นคลิปความยาว 10 วินาที อินเทอร์เฟซการสร้างวิดีโอ AI แสดงพรอมต์ข้อความและวิดีโอที่เสร็จสมบูรณ์ Seedance 2.0 Reference-to-Video บน Atlas Cloud, การรันเสร็จสมบูรณ์ด้วยชุดอ้างอิงและพรอมต์เดียวกันจากขั้นตอนที่ 3 และผลลัพธ์ความยาว 10 วินาทีในแผง OUTPUT

นี่คือสิ่งที่แผง OUTPUT ทั้งสองแสดงจริง ๆ และผมจะรายงานตามตรงมากกว่าที่จะเลือกผู้ชนะ

การรันทั้งสองยึดตัวละครไว้ได้ ชุดลูกไม้สีครีมเดียวกันกับคอเสื้อและข้อมือเดียวกัน ผมสีน้ำตาลเกาลัดเดียวกัน ทางเดินหมอกและแสงจันทร์เดียวกันที่ยกมาจากบอร์ด ไม่มีตัวไหนสร้างผู้หญิงคนอื่นขึ้นมา ชุดอ้างอิงทำงานนั้นได้ทั้งสองฝั่ง ซึ่งเป็นสิ่งที่ผมใส่ใจมากที่สุด

ความแตกต่างอยู่ที่รูปแบบ ไม่ใช่ใบหน้า เอนด์พอยต์ Seedance นี้ให้ 720p; H3 ให้ 2K จากอินพุตที่เหมือนกัน และการจัดเฟรมก็แตกต่าง: H3 อ่าน "9:16 vertical" โดยตรงจากข้อความพรอมต์และส่งกลับแนวตั้ง ในขณะที่การรัน Seedance ส่งกลับเป็น 16:9 เพราะหน้านั้นมีการควบคุมอัตราส่วนภาพของตัวเอง และข้อความพรอมต์เพียงอย่างเดียวไม่สามารถแทนที่ได้ หากคุณตัดต่อสำหรับ TikTok ความแตกต่างนี้จะทำให้คุณเสียเวลารันหนึ่งครั้งในครั้งแรกที่คุณลืมกรอกฟิลด์ฟอร์ม Seedance 2.5 มีแนวโน้มที่จะเปลี่ยนส่วนความละเอียดของสิ่งนี้และเพิ่มการรีโรลระดับภูมิภาค และผมจะไม่แกล้งทำเป็นว่าผมวัดค่านั้นได้

ขั้นตอนที่ 5: แก้ไขหนึ่งช็อตโดยไม่ต้องสร้างคลิปใหม่ทั้งหมด

ต้นทุนที่แท้จริงของละครสั้นไม่ใช่การสร้างครั้งแรก มันคือการแก้ไขครั้งที่เจ็ด H3 ยอมรับคลิปที่มีอยู่เป็นอินพุตและแก้ไขตามคำสั่ง โดยคงทุกสิ่งที่คุณไม่ได้พูดถึงไว้ จุดขายของ Seedance 2.5 ในที่นี้คือละเอียดกว่า: วาดส่วนหนึ่งของเฟรมใหม่ และคงประสิทธิภาพ แสง และกล้องไว้ตามเดิม

plaintext
1Using the supplied clip: keep the two characters, their wardrobe, the camera moves and the cutting rhythm exactly as they are. Change only the environment, replace the moonlit stone corridor with the same castle's ballroom, tall arched windows, a lit chandelier, and warm candlelight, and re-light both characters so their key light comes from the chandelier at frame left instead of the window. Rewrite her only spoken line to "You were never asleep, were you." Keep her performance timing on the same beats.

การตั้งค่า: MiniMax H3 Reference-to-Video โดยใช้คลิปจากขั้นตอนที่ 3 เป็นอินพุตอ้างอิง, ระยะเวลา 5, ความละเอียด 2K

 

 

เหนือกว่าการทดสอบ Seedance 2.5 vs MiniMax H3: สี่วิธีในการยกระดับชุดอ้างอิง

ตัวละครเดียวกัน ตอนต่อไป บันทึกชีทจากขั้นตอนที่ 1 เป็นสินทรัพย์ และเปลี่ยนเฉพาะรายการช็อตและบล็อกเรื่องราวในพรอมต์เท่านั้น ตัวตนมาจากไฟล์ ไม่ใช่จากความทรงจำของคุณว่าคุณใช้ถ้อยคำอย่างไรเมื่อวันอังคารที่แล้ว

 

 

กำหนดเสียงด้วย H3 รองรับไฟล์เสียงอ้างอิงสูงสุดสามไฟล์ ความยาว 2 ถึง 15 วินาทีต่อไฟล์ และต้องมาพร้อมกับอินพุตรูปภาพหรือวิดีโอ ให้ตัวอย่างเสียงของมัน แล้วตัวละครจะพูดด้วยโทนเสียงนั้น คุณจะได้ไม่ต้องเปลี่ยนนักพากย์ระหว่างตอน

 

 

บล็อกกล้องก่อนจ่ายเงินเพื่อเรนเดอร์ Reference-to-Video ของ Seedance 2.5 รองรับโมเดล 3D สีขาวและฉากกรีนสกรีน คุณจึงสามารถล็อกเฟรมบนเรขาคณิตสีเทา แล้วค่อยลงมือทำลุคสุดท้าย ตัวอย่างนี้รันบน Seedance 2.1 ซึ่งเป็นสมาชิกก่อนหน้าในตระกูล แต่รูปร่างของเวิร์กโฟลว์เหมือนกัน

 

 

แปลหนึ่งคัทหลักแทนที่จะถ่ายใหม่ การแทนที่ระดับภูมิภาคจะสลับใบหน้า ผลิตภัณฑ์ หรือภาษาพูด ในขณะที่กล้อง จังหวะเวลา และระยะเวลาการเคลื่อนไหวของปากยังคงเดิม ที่นี่ คัทความงามหลักหนึ่งคัทถูกเปลี่ยนนักแสดงและพากย์ใหม่เป็นภาษาสเปน เกาหลี และฮินดี โดยที่ห้อง การจัดเฟรม และระยะเวลาการขยับปากยังคงอยู่

 

 

และเพราะว่ามีคนถามว่าการถ่ายโอนการเคลื่อนไหวจะเป็นอย่างไรเมื่อคุณหยุดทำตัวมีเหตุผล: ชายสามคนในชุดสูท ถูกแทนที่ด้วยคาปิบาร่าสมจริงสามตัว ตามเส้นทางการเคลื่อนไหวของคลิปต้นฉบับทุกจังหวะ จนกว่าพวกมันจะซ้อนกันเป็นปิรามิด

 

 

นอกจากนี้ยังมีเวอร์ชันธรรมดาของทั้งหมดนี้ ซึ่งไม่มีใครโพสต์: โปสเตอร์静止กลายเป็นโปสเตอร์เคลื่อนไหว และเค้าโครงยังคงอยู่ เด็กผู้ชายในการ์ตูนในฮู้ดไดโนเสาร์สีชมพูกำลังเอื้อมมือไปข้างหน้าด้วยกรงเล็บยักษ์ โปสเตอร์ต้นฉบับที่静止 ป้อนให้ Reference-to-Video พร้อมคำสั่ง "คงเฟรม จานสี และเค้าโครง ทำให้ตัวอักษรเคลื่อนไหว" คุณจะได้เวอร์ชันเคลื่อนไหวของดีไซน์เดียวกัน

ภาพยนตร์สั้น Seedance 2.5 vs MiniMax H3 มีค่าใช้จ่ายเท่าไหร่

ไม่มีตัวเลข เพราะตัวเลขเคลื่อนไหว แต่โครงสร้างไม่เคลื่อนไหว ทั้งสองตระกูลคิดราคาต่อวินาที จ่ายตามการใช้งาน ไม่มีที่นั่งและไม่มีสมาชิก ซึ่งเหลือตัวแปรสามตัว: วินาที, ระดับความละเอียด, และการสร้างใหม่

ตัวแปรที่สามคือค่าใช้จ่ายทั้งหมด คลิปความยาว 15 วินาทีที่ได้ในครั้งแรกคือการเรียกเก็บเงินครั้งเดียว คลิปเดียวกันในครั้งที่เจ็ดคือเจ็ดครั้ง ดังนั้นการประหยัดเงินไม่ใช่การเลือกโมเดลที่ราคาต่อวินาทีถูกกว่า แต่คือการทำให้ชุดอ้างอิงถูกต้องก่อนที่คุณจะสร้างอะไรก็ตาม การเรียกใช้รูปภาพสองครั้งในขั้นตอนที่ 1 และขั้นตอนที่ 2 นั้นเป็นรายการที่ถูกที่สุดในไปป์ไลน์ทั้งหมด และเป็นตัวกำหนดว่าคุณจะต้องเรียกใช้วิดีโอกี่ครั้ง ให้ผลตอบแทนสูงสุดต่อค่าใช้จ่ายในห่วงโซ่ทั้งหมด อย่างเทียบไม่ติด

จากนั้นแก้ไขสัญชาตญาณเรื่องราคาต่อวินาที ชุดอ้างอิงเดียวกัน, เวลาทำงานเดียวกัน: Reference-to-Video ของ H3 ส่งคืน 1440p, เอนด์พอยต์ Reference-to-Video ของ Seedance นี้ส่งคืน 720p ต่อวินาทีเป็นหน่วยที่ผิด พิกเซลต่อเฟรม และคุณต้องจ่ายค่าผ่าน Upscale แยกต่างหากหรือไม่ นั่นคือหน่วยที่ถูกต้อง

เสียงควรอยู่ในเลขคณิตด้วย ทั้งสองฝ่ายสร้างเสียงซิงค์ดั้งเดิมในรอบเดียวกัน หากไปป์ไลน์ปัจจุบันของคุณคือโมเดลวิดีโอ บวก TTS บวกบรรณาธิการที่จัดเรียงแทร็ก สิ่งที่คุณประหยัดได้คือการเรียก API สองครั้งและเวลาของคน ๆ หนึ่งในตอนบ่าย และการประหยัดนั้นไม่ปรากฏในรายการราคาใด ๆ

โมเดลไหนสำหรับงานไหน:

งานเลือกเพราะเหตุใดข้อควรระวัง
ละครสั้นแนวตั้ง, 9:16, TikTok หรือ ReelShortMiniMax H31440p แนวตั้งพร้อมเสียงสเตอริโอ, เรียกใช้งานได้ทันที, 15 วินาทีก็เพียงพอสำหรับการดึงดูดคุณตัดที่ 15 วินาที ดังนั้นวางแผนบีตให้สอดคล้อง
ฟิล์มแบรนด์ต่อเนื่อง 30 วินาทีSeedance 2.5สร้างครั้งเดียว, ไม่ต้องต่อ, 4K ดั้งเดิมตรวจสอบความพร้อมใช้งานบนแพลตฟอร์มของคุณก่อน
แก้ไขหนึ่งช็อตภายในคัทที่ได้รับการอนุมัติSeedance 2.5การวาดใหม่ระดับภูมิภาคปล่อยให้ส่วนที่เหลือคงเดิมH3 การแก้ไขทั้งคลิปก็เพียงพอสำหรับส่วนใหญ่ในวันนี้
การตัดต่อผลิตภัณฑ์และอีคอมเมิร์ซเลือกได้ทั้งคู่คงข้อความบนหน้าจอและเครื่องหมายการค้าได้ดีตรวจสอบข้อความที่ความละเอียดที่คุณจะส่งออก
ตัวอย่างเกมหรืออินเทอร์เฟซMiniMax H3ความเสถียรของ UI และตัวอักษรที่ 2K นั้นแข็งแกร่งระยะเวลาสูงสุด 15 วินาทีสำหรับการผ่านครั้งเดียว
เวอร์ชันหลายภาษาของคัทหลักหนึ่งคัทSeedance 2.5การแทนที่ภูมิภาคบวกกับเสียงพากย์หลายภาษาคุณภาพของการแปล仍需ให้เจ้าของภาษาตรวจสอบ
ต้องการส่งงานคืนนี้MiniMax H3เอนด์พอยต์สามแห่งทำงานได้, รวมถึง Seedance 2.0 ทั้งหมดการเข้าถึง Seedance 2.5 แตกต่างกันไปตามแพลตฟอร์ม

ก่อนที่คุณจะส่งงาน MiniMax กล่าวว่าน้ำหนักของ H3 จะตามมาภายในไม่กี่วันหลังเปิดตัว และน้ำหนักที่เปิดเผยไม่ใช่สิ่งเดียวกับใบอนุญาตเชิงพาณิชย์ ดังนั้นโปรดอ่านข้อกำหนดก่อนที่คุณจะโฮสต์ด้วยตนเอง นโยบายลายน้ำและการใช้งานเชิงพาณิชย์ก็แตกต่างกันระหว่างแอปสำหรับผู้บริโภคและการเข้าถึง API ทั้งสองฝั่ง และผมไม่สามารถยืนยันอย่างใดอย่างหนึ่งจากหน้าข้อกำหนดหลักได้ในขณะที่เขียนนี้ ดังนั้นโปรดตรวจสอบข้อกำหนดของผู้ให้บริการแทนที่จะเชื่อคำพูดของผม และไม่มีสิ่งใดในใบอนุญาตโมเดลใด ๆ ที่ครอบคลุมถึงความคล้ายคลึงหรือเครื่องหมายการค้า หากบุคคลจริง แบรนด์จริง หรือทรัพย์สินทางปัญญาของผู้อื่นอยู่ในชุดอ้างอิงของคุณ นั่นเป็นคำถามทางกฎหมายที่แยกต่างหาก และข้อกำหนดของโมเดลจะไม่ตอบคำถามนั้น

ทุกโมเดลในตารางด้านบนรันด้วยคีย์เดียวกัน และ หน้าโมเดล แสดงอัตราปัจจุบันพร้อมรหัสคัดลอกและวาง รวมถึงโปรโมชั่นใด ๆ ที่อาจเกิดขึ้นกับไลน์ Seedance ในสัปดาห์นี้

คำถามที่พบบ่อย

Seedance 2.5 ดีกว่า MiniMax H3 สำหรับความเสถียรของตัวละครหรือไม่?

ในทางทฤษฎีควรจะดีกว่า ด้วยข้อมูลอ้างอิง multimodal มากถึง 50 รายการเทียบกับ 12 ไฟล์ของ H3 บวกกับการรีโรลระดับภูมิภาค แต่ ณ วันที่ 31 กรกฎาคม 2026 ยังไม่มีการทดสอบสาธารณะแบบคู่ที่ผมสามารถชี้ชัดได้ และ Seedance 2.5 ยังไม่มีอันดับในสนามประลอง ในการรันที่ผมสามารถทำได้จริง ตัวแปรที่กำหนดความเสถียรของตัวตนคือโครงสร้างของชุดอ้างอิง ไม่ใช่รุ่นของโมเดล: ด้วยคอมโพสิต Turnaround Sheet หนึ่งแผ่นบวกกับ Lighting Board หนึ่งแผ่น ทั้งสองฝ่ายยึดตัวละครไว้ได้ ทำชุดอ้างอิงให้ถูกต้องก่อนที่คุณจะเสียเวลาเลือกโมเดล

ฉันสามารถใช้ Seedance 2.5 ได้ทันที หรือต้องรอ?

API ของมันใช้งานได้ที่ ByteDance ความพร้อมใช้งานบนแพลตฟอร์มโมเดลของบุคคลที่สามนั้นไม่เท่ากัน และในแพลตฟอร์มที่ผมทดสอบนั้นยังคงเป็นประกาศ Day-0 หากคุณต้องการผลลัพธ์คืนนี้ ตัวเลือกที่เรียกใช้งานได้คือเอนด์พอยต์สามแห่งของ MiniMax H3 และไลน์ Seedance 2.0 ที่ให้บริการอยู่ทั้งหมด

MiniMax H3 สามารถสร้างวิดีโอความยาว 30 วินาทีได้จริงหรือไม่?

ไม่ สเปคคือ 5 ถึง 15 วินาทีต่อการสร้างหนึ่งครั้งที่ 24fps สิ่งที่ยาวกว่านั้นคือการต่อหรือการขยาย ซึ่งเป็นสิ่งที่แตกต่างและมีความเสี่ยงต่อความคลาดเคลื่อนต่างกัน การสร้างครั้งเดียว 30 วินาทีเป็นของ Seedance 2.5 อย่าให้ข้ออ้างทั้งสองนี้ปนกัน

ทั้งสองโมเดลสร้างเสียงได้หรือไม่ และฉันสามารถรักษาเสียงเดียวกันในหลายตอนได้หรือไม่?

ทั้งสองสร้างเสียงซิงค์ดั้งเดิมในรอบเดียวกัน และ H3 จะส่งออกสเตอริโอในทุกผลลัพธ์ สำหรับเสียงที่สอดคล้องกัน H3 รองรับไฟล์เสียงอ้างอิงสูงสุดสามไฟล์ ความยาว 2 ถึง 15 วินาทีต่อไฟล์ ซึ่งต้องส่งพร้อมกับอินพุตรูปภาพหรือวิดีโอ ไม่ใช่ส่งเดี่ยว ๆ

ฉันควรส่งภาพอ้างอิงจำนวนเท่าไหร่?

น้อยกว่าที่คุณคิด และมีโครงสร้างดีกว่าที่คุณคิด คอมโพสิตที่จัดอย่างดีหนึ่งภาพโดยทั่วไปดีกว่าภาพแยกเดี่ยวที่ไม่ได้จัดเรียงหกภาพ เพราะไฟล์แยกกันเชิญชวนให้โมเดลเฉลี่ยพวกมันเป็นบุคคลที่ไม่มีอยู่จริง ให้มันทำงานสองอย่างที่ชัดเจน: ข้อมูลตัวตนและข้อมูลแสง และอย่าใส่ตัวอย่างสไตล์ที่ขัดแย้งกัน

ฉันควรใช้โมเดลใดสำหรับละครสั้นแนวตั้งสไตล์ TikTok หรือ ReelShort?

สำหรับการส่งงานในสัปดาห์นี้ ในรูปแบบ 9:16 ที่ความละเอียดสูงพร้อมเสียงที่ผสมแล้ว: MiniMax H3 สำหรับการวางแผนฉากต่อเนื่อง 30 วินาทีที่คุณคาดว่าจะต้องรีโรลเฉพาะภูมิภาคแทนที่จะรีโรลทั้งคลิป: เตรียมพร้อมสำหรับ Seedance 2.5 และตรวจสอบว่าแพลตฟอร์มของคุณเปิดให้บริการเมื่อใด

โมเดลล่าสุด

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด