Seedance 2.0 Mini & Fast API ในราคาถูกที่สุดในโลก — ลดสูงสุดถึง 68% จากราคาทางการ

คู่มือ Prompt MiniMax H3: ฉันศึกษา Prompt ทางการ 45 ข้อ เพื่อให้คุณไม่ต้องทำเอง

คู่มือการเขียนพรอมต์ MiniMax H3 ที่รวบรวมจากตัวอย่างพรอมต์ทั้ง 45 ข้อของ MiniMax ได้แก่ โครงสร้างหกบล็อก, เทคนิค end_image, สัญญาณเสียง native audio, และการแก้ไขข้อความเสีย garbled-text

ใช้ MiniMax H3 เหมือนเป็นบทสรุปงานสั้น ๆ ไม่ใช่พรอมต์ภาพเดียว โครงสร้างที่ใช้ซ้ำได้นั้นเรียบง่าย: เชื่อมโยง asset อ้างอิงทั้งหมด ระบุแนวคิดหลัก แล้วเขียนฉากเป็นลำดับภาพและเสียงตามเวลา โดยมีกล้องเคลื่อนที่ บทสนทนา เสียงรอบข้าง ดนตรี และข้อจำกัดในบล็อกแยกกัน

คู่มือนี้จะถอดรหัสตัวอย่าง MiniMax H3 อย่างเป็นทางการจำนวน 45 ตัวอย่างให้เป็นสูตรพรอมต์ 6 ส่วน แสดงตำแหน่งที่ end_image ควรอยู่ อธิบายว่าสัญญาณเสียงพื้นเมืองเปลี่ยนผลลัพธ์อย่างไร และให้วิธีแก้ไขปัญหาข้อความที่ผิดเพี้ยนในคลิปที่สร้างขึ้น

คุณรู้วิธีสร้างพรอมต์ให้โมเดลวิดีโออยู่แล้ว "แสงแบบภาพยนตร์, ค่อย ๆ ซูมเข้า, 4K" คำศัพท์พวกนี้ใช้คุณมาสองปีแล้ว

พอคุณวางมันลงใน MiniMax H3 แล้วได้คลิป 2K ที่มาพร้อมกับซาวด์แทร็กของมันเอง ภาพดูดี จังหวะกลับไม่ดี ตัวอักษรสองตัวในชื่อเรื่องของคุณสะกดผิด เสียงที่ได้คือเสียงบรรยากาศในห้องที่โมเดลเลือกให้คุณ

โมเดลไม่ใช่ปัญหา คุณยื่นประโยคให้มัน มันต้องการตารางเวลา

ผมเลยไปอ่านตัวอย่างพรอมต์ทั้ง 45 ตัวอย่างที่ MiniMax ส่งมากับ H3 รวมถึงคลิปที่เสร็จแล้ว และแยกเฟรมออกมา พรอมต์ที่เป็นทางการไม่ใช่การบรรยายภาพ พรอมต์ที่ดีคือรายการช็อตที่มีแผ่นคิวจังหวะดนตรีแปะอยู่ด้านหลัง ด้านล่างนี้คือโครงสร้าง พารามิเตอร์ที่เปิดเผยจริงในตอนนี้ และเดโมหนึ่งชิ้นที่คุณสามารถทำซ้ำได้ภายในเวลาประมาณยี่สิบนาที

ประเด็นสำคัญ

  • พรอมต์ H3 คือ ไทม์ไลน์ ไม่ใช่คำบรรยาย ตัวอย่างที่เป็นทางการที่แข็งแกร่งที่สุดจะตัดคลิปด้วยเครื่องหมาย [0s-2s], [2s-4s] และภาพยนตร์ที่เสร็จแล้วก็จะตรงตามจังหวะทุกจังหวะ
  • เสียงและภาพออกมาจากพาสเดียวกัน ดังนั้นเสียงต้องอยู่ในเนื้อหาพรอมต์ด้วย พรอมต์ที่เป็นทางการจะให้บล็อกของตัวเอง ลงไปถึง "จังหวะเบสแจ๊สเข้าที่ 6 วินาที"
  • ข้อความที่คุณสะกดออกมาจะกลับมาชัดเจน ข้อความที่คุณไม่ได้สะกดจะกลับมาเป็นสัญญาณรบกวนรูปตัวอักษร ผมมีภาพครอบตัดจากคลิปทางการคลิปเดียวที่พิสูจน์ทั้งสองอย่างพร้อมกัน
  • image-to-video รองรับ end_image ให้เฟรมแรกและเฟรมสุดท้าย แล้วส่วนโค้งทางอารมณ์จะถูกกำหนดไว้ก่อนที่คุณจะใช้เวลาในการคำนวณแม้แต่วินาทีเดียว
  • ความยาวพรอมต์ไม่ใช่คุณธรรม พรอมต์ทางการที่สั้นใช้ได้ผลดีเมื่อภาพอ้างอิงทำงานบรรยายแทน ความยาวจะสะท้อนว่าคุณปฏิเสธที่จะมอบงานให้ภาพอ้างอิงมากแค่ไหน

สุนัข This Is Fine ยังคงอยู่ทางซ้ายและกำลังไหม้ในคลิปผลลัพธ์ MiniMax H3 10 วินาทีทางขวา

นั่นคือภาพวาดเดียวกันทั้งสองด้าน ด้านซ้ายคือแผงต้นฉบับของ KC Green ที่ไม่ถูกแตะต้อง ด้านขวาคือการเรียก image-to-video ครั้งเดียว: เฟรมแรกเข้า เฟรมสุดท้ายเข้า สิบวินาทีออกมา และเสียงไฟแตกกับเสียง "this is fine" แบน ๆ เป็นแทร็กเสียงของโมเดลเอง ไม่มีใครทำสกอร์ให้ ทุกอย่างในคู่มือนี้มีเป้าหมายเพื่อพาคุณไปถึงครึ่งหลังนั้น

พรอมต์ MiniMax H3 จริง ๆ แล้วมีลักษณะอย่างไร (ฉันอ่านทั้งหมด 45 ตัวอย่าง)

"คู่มือพรอมต์ MiniMax H3" ทุกอันที่อยู่ในหน้าแรกของการค้นหาตอนนี้เป็นสเปกชีต: 2K, 24fps, 5 ถึง 15 วินาที, เสียงพื้นเมือง นั่นคือการ์ดโมเดล ไม่ใช่พรอมต์

นี่คือของจริง นี่คือส่วนหนึ่งของพรอมต์ทางการเบื้องหลังซีเควนซ์ไตเติ้ลแนว noir ของ MiniMax ซึ่งแปลจากต้นฉบับภาษาจีน และมีความยาวประมาณหนึ่งในสามของความยาวเต็ม:

สร้างซีเควนซ์ไตเติ้ลภาพยนตร์อาชญากรรมแนวสืบสวนเบา ๆ ยาว 15 วินาที อัตราส่วน 16:9 โดยรวมสไตล์อ้างอิงจากภาษาภาพของภาพเหล่านี้: การ์ดไตเติ้ลอนิเมะญี่ปุ่นย้อนยุค, ภาพเงาคมกริบ, คอลลาจการ์ตูน, จอแยกแบบไม่สมมาตร, บล็อกสีเรขาคณิตแข็งแรง, ไตเติ้ลเครดิตภาษาอังกฤษ, ตกแต่งด้วยตัวคาตาคานะญี่ปุ่นเล็กน้อย, ความรู้สึกแจ๊ส-อาชญากรรม อารมณ์คือสืบสวน 60% แจ๊ส 40%: ลึกลับ, เท่, คล่องแคล่ว, อาชญากรรมในเมือง, ไม่ใช่สยองขวัญ, ไม่หนักหน่วง, และอย่าให้กลายเป็น MV แจ๊สสนุกสนาน

[...] เครดิตภาษาอังกฤษต้องอ่านได้ชัดเจน [...] อย่าเพิ่มภาษาจีน, อย่าสร้างข้อความที่ผิดเพี้ยน, อย่าสะกดภาษาอังกฤษผิด กฎสำหรับทั้งชิ้น: ทุกเครดิตภาษาอังกฤษและตำแหน่งงานปรากฏเพียงครั้งเดียว อย่าซ้ำตำแหน่งงาน, อย่าซ้ำชื่อ, อย่าให้คนเดียวมีหลายตำแหน่ง

การเปลี่ยนภาพต้องหลากหลาย: หน้ากากแผ่นเสียงไวนิลทรงกลม, การปัดเหมือนประตูรถแนวตั้ง, เงายาวของตัวละครกวาดผ่านหน้าจอ, การตัดเส้นสีแดง, หน้ากากตัวอักษรภาษาอังกฤษขนาดใหญ่, การจัดองค์ประกอบจอแยกใหม่, การตัดบล็อกสีแข็ง, แผงที่วางทีละบล็อก การเปลี่ยนภาพทั้งหมดลงจังหวะกับเสียงกลอง: กริ๊บ, ตื่นเต้น, คล่องแคล่ว, คอลลาจการ์ตูน ไม่มีการละลายแบบนุ่มนวล, ไม่มีการเปลี่ยนภาพแบบลื่นไหล

BGM: ดนตรีไตเติ้ลต้นฉบับยาว 15 วินาที, สืบสวน 60% แจ๊ส 40% สร้างจากโน้ตเบสที่ต่อเนื่อง, สายพิซซิคาโตที่ตึงเครียด, พัลส์ซินธ์เย็น, กลองเตะ, แปรงแจ๊สเบาบาง, เศษเบสเดิน, วลีบาริโทนแซกซ์สั้น ๆ และการจู่โจมของทองเหลืองสั้น ๆ 2 วินาทีแรกสร้างความตึงเครียดด้วยความถี่ต่ำและไฮแฮท, ที่ 3 วินาที กลองต่ำเข้ามา, ที่ 6 วินาที จังหวะเบสแจ๊สเข้าร่วม, ที่ 10 วินาที ท่อนแซกซ์/ทองเหลืองสั้นปรากฏ, 2 วินาทีสุดท้ายปิดท้ายด้วยคอร์ดที่ตึงเครียดและเสียงกลอง

ดูว่าคำศัพท์ไปอยู่ที่ไหน แทบไม่มีคำว่า "สวยงาม" หรือ "เหมือนภาพยนตร์" เลย มันไปที่ รายการเชิงลบ, รายการเปลี่ยนภาพ, และ แผ่นคิวเพลงแบบวินาทีต่อวินาที นั่นคือรูปร่างของงาน แบนเนอร์อนิเมะแนว noir พร้อมเงาร่างของบุคคลบนรถไฟใต้ดินซีเควนซ์ไตเติ้ลแนว noir ทางการของ MiniMax H3: MIDNIGHT LINE พร้อมเครดิต STARRING ที่ชัดเจน

ดูเครดิตในคลิปนั้น MIDNIGHT LINE, STARRING, MAYA CROSS, REN KATO, LENA WARD, DIRECTED BY NOAH VOSS สะกดถูกต้อง ไม่มีตำแหน่งงานซ้ำ ตัวคาตาคานะตกแต่งอยู่ตรงที่ที่ขอไว้ พรอมต์ไม่ได้พูดว่า "ทำไตเติ้ลสวยๆ" มันพูดว่าไม่ซ้ำ, ไม่สะกดผิด, ไม่มีภาษาจีน, และตั้งชื่อสุนทรียศาสตร์ห้าวิธีที่แตกต่างกัน แผงภาพยนตร์แนว noir ห้าแผงที่มีตัวละครเงาในสีน้ำเงินและส้มบอร์ดอ้างอิงสไตล์ห้าชิ้นที่ส่งให้ MiniMax H3 พร้อมกับพรอมต์ไตเติ้ลแนว noir

บอร์ดทั้งห้าชิ้นนี้ถูกส่งไปพร้อมกับข้อความ ห้าภาพบวกกับบทสรุปสั้นยาวหนึ่งชุด หนึ่งเจนเนอเรชัน นี่คือสิ่งที่งานนี้ดูในตอนนี้

และเหตุผลที่พรอมต์ 45 ตัวอย่างส่วนใหญ่สั้นก็อยู่ตรงนั้นในภาพ ตลอดทั้งชุด ค่ามัธยฐานของพรอมต์อยู่ที่ประมาณ 130 ตัวอักษรจีน แต่สองอันที่ยาวที่สุดมีความยาว 657 และ 858 ตัวอักษร อันที่สั้นนั้นสั้นเพราะบอร์ดอ้างอิงเป็นตัวรับภาระคำอธิบาย อันที่ยาวนั้นยาวเพราะไม่มีอะไรอื่นที่จะรับภาระนั้นได้

ทำไมพรอมต์ MiniMax H3 ส่วนใหญ่ถึงออกมาแบน และวิธีแก้ไขข้อความที่ผิดเพี้ยน

มีสามสิ่งที่ผิดพลาด และทั้งหมดเป็นสิ่งที่ไม่ปรากฏ มากกว่าความผิดพลาด

ไม่มีไทม์ไลน์ คุณขอเวลาสิบวินาทีและบรรยายแค่ช่วงเดียว ดังนั้นคุณจึงได้การซูมเข้าช้า ๆ ครั้งเดียวที่ยืดออกไปสิบวินาที โมเดลไม่มีอะไรจะทำในวินาทีที่เจ็ด

ไม่มีบล็อกเสียง เสียงถูกสร้างขึ้นในพาสเดียวกับภาพ ถ้าคุณไม่พูดอะไร โมเดลก็ยังส่งแทร็กให้คุณ เพียงแค่มันเลือกมาเอง

ไม่มีรายการเชิงลบ ปล่อยไว้ตามลำพัง โมเดลจะเลือกใช้การละลายแบบนุ่มนวล สร้างข้อความบนหน้าจอเพิ่มเติม และเพิ่มแถบคำบรรยายที่ไม่มีใครขอ

หลักฐานที่ชัดเจนที่สุดคือพรอมต์ UI เกมอย่างเป็นทางการ ซึ่งสร้างจากจังหวะที่ระบุเวลาหกจังหวะ: [0s-2s] เมนู, [2s-4s] แผงแขนขวา, [4s-7s] ตารางอาวุธ, [7s-8.5s] ยืนยัน, [8.5s-10s] แถบโหลด, [10s-15s] โลกโหลดเข้ามา คลิปที่เสร็จแล้วตรงทั้งหกจังหวะ ตามลำดับ ตรงเวลา เมนูเกมที่แสดงการเลือกแขน Phantom Grip หุ่นยนต์คลิป UI เกม MiniMax H3: เมนู, แผงอุปกรณ์, แถบโหลด, โหลดโลก

ตอนนี้ส่วนที่จริงใจ จากคลิปเดียวกัน ที่ความละเอียด 2560x1440 เต็ม การเปรียบเทียบข้อความ UI เกมที่อ่านได้กับข้อความ AI ที่ผิดเพี้ยนซ้าย: ข้อความที่สะกดในพรอมต์แสดงผลชัดเจน ขวา: ข้อความที่ไม่ได้สะกดแสดงผลเป็นสัญญาณรบกวนรูปตัวอักษร

ทางซ้าย ทุกสตริงที่พรอมต์พิมพ์ออกมาจริง: RIGHT ARM EQUIPMENT, PHANTOM GRIP, CHRONOS CLAW กริ๊บ ถูกต้อง เว้นวรรคเหมือนเมนูเกมจริง

ทางขวา HUD ในช็อตถนนสุดท้าย ซึ่งพรอมต์เรียกเพียงแค่ "องค์ประกอบ HUD" มันอ่านได้ว่า ETR METNO CITFEP เหนือไอคอนอุปกรณ์ ซึ่งพรอมต์ไม่ได้พูดอะไร คุณจะได้ MNALEαIN IAMG นั่นไม่ใช่บั๊กการเรนเดอร์ โมเดลกำลังวาด พื้นผิว ของภาษาอังกฤษเพราะมันไม่เคยได้รับสตริง

ดังนั้นวิธีแก้ไขไม่ใช่การตั้งค่า มันเป็นนิสัย:

ถ้าคำไหนต้องอ่านได้ ให้พิมพ์คำนั้น แล้วเพิ่มบรรทัดเชิงลบ: อย่าสะกดผิด, อย่าเพิ่มข้อความอื่น, อย่าเพิ่มคำบรรยาย

และนี่คือรูปร่างหกบล็อกที่พรอมต์ทางการที่แข็งแกร่งทุกอันมีเหมือนกัน

บล็อกสิ่งที่ใส่เข้าไปตัวอย่างจากพรอมต์ทางการข้ามไปแล้วคุณจะได้
1. ข้อตกลงสไตล์สื่อ, พื้นผิว, จานสี, ยุคสมัย, ลุคที่ต้องรักษาไว้"การ์ดไตเติ้ลอนิเมะญี่ปุ่นย้อนยุค, ภาพเงาคมกริบ, คอลลาจการ์ตูน, บล็อกสีเรขาคณิตแข็งแรง"การเรนเดอร์เงางามทั่วไปที่ลอยไปในวินาทีที่หก
2. ไทม์ไลน์ช่วงเวลาตามตัวอักษรพร้อมการกระทำในแต่ละช่วง[2s-4s] ซูมเรียบไปที่แขนขวาของเธอ แผง UI เลื่อนเข้ามาจากทางขวาแนวคิดเดียวที่ยืดออกไปตลอดระยะเวลา
3. กล้องการเคลื่อนที่ หรือการปฏิเสธการเคลื่อนที่อย่างชัดเจน"ยึดอยู่กับที่, ภาพกว้างนิ่ง, ไม่ซูมเข้า, ไม่ตัด"การดอลลี่ช้า ๆ โดยปริยายที่คุณไม่ได้ขอ
4. เสียงทุกเสียง และเมื่อมันเข้ามา"ที่ 6 วินาที จังหวะเบสแจ๊สเข้าร่วม, 2 วินาทีสุดท้ายปิดท้ายด้วยคอร์ดที่ตึงเครียด"เสียงบรรยากาศในห้องอะไรก็ได้ที่โมเดลชอบวันนี้
5. ข้อความที่สะกดออกมาสตริงตามตัวอักษร ในเครื่องหมายคำพูด"THIS IS FINE." / CONFIRM CONFIGสัญญาณรบกวนรูปตัวอักษร ดังข้างต้น
6. รายการเชิงลบการเปลี่ยนภาพ วัตถุ และความซ้ำซากที่ต้องปฏิเสธ"ไม่มีการละลายแบบนุ่มนวล, ไม่มีการเปลี่ยนภาพแบบลื่นไหล, อย่าเพิ่มภาษาจีน, อย่าซ้ำตำแหน่งงาน"การละลายแบบนุ่มนวล, ข้อความที่ถูกประดิษฐ์ขึ้น, การล่องลอยที่แปลกประหลาด

บล็อก 5 และ 6 ฟรี ไม่มีค่าใช้จ่ายเพิ่มเติมในการสร้าง และเป็นที่ที่คุณภาพส่วนใหญ่อยู่

เวิร์กโฟลว์พรอมต์ MiniMax H3: พรอมต์ของคุณอยู่ในเอนด์พอยต์ใด

คีย์เดียวกัน รูปร่าง submit-and-poll เดียวกัน สามประตู การเลือกประตูใดจะตัดสินว่าพรอมต์ของคุณยังต้องทำอะไรอีก

เอนด์พอยต์สิ่งที่คุณส่งให้สิ่งที่มันล็อกให้คุณพารามิเตอร์ที่ควรรู้ใช้เมื่อการคิดเงิน
minimax/h3/text-to-videoพรอมต์เท่านั้นไม่มีอะไร ข้อความเป็นตัวแบกทุกอย่างduration 5-10 (ค่าเริ่มต้น 8), resolution 2K, ratio ต้องตั้งอย่างชัดเจนทดสอบลุคหรือการออกแบบเสียงก่อนตัดสินใจคิดต่อวินาทีของผลลัพธ์ อัตราปัจจุบันที่หน้าโมเดล
minimax/h3/image-to-videoพรอมต์ + ภาพ (เฟรมแรก), end_image ไม่บังคับจุดเริ่มคลิป และจุดสิ้นสุด (ถ้ามี)end_image, duration 5-10 (ค่าเริ่มต้น 8), ratio ปรับตามค่าเริ่มต้นคุณมีงานศิลปะและต้องการให้มันเคลื่อนไหวโดยไม่ต้องวาดใหม่คิดต่อวินาทีของผลลัพธ์
minimax/h3/reference-to-videoพรอมต์ + refers[]เอกลักษณ์ของตัวแบบและสไตล์ ตลอดทั้งฉากที่คุณคิดขึ้นrefers[] mixed array, duration 5-15, ratio สูงถึง 21:9ตัวละครหรือผลิตภัณฑ์เดียวกัน สภาพแวดล้อมใหม่คิดต่อวินาทีของผลลัพธ์

refers[] เป็นสิ่งที่ยังไม่มีการบันทึกอย่างเพียงพอในโลก ดังนั้นนี่คือรูปร่างที่มันต้องการ:

json
1"refers": [
2  { "url": "https://.../subject.png", "type": "image" },
3  { "url": "https://.../style-board.png" },
4  { "url": "https://.../motion-ref.mp4", "type": "video" },
5  { "url": "https://.../beat.mp3",       "type": "audio" }
6]
7

สี่กฎที่จะช่วยคุณประหยัดเวลาในการสร้างที่เสียเปล่าแต่ละครั้ง:

  1. เสียงไม่สามารถอยู่เพียงลำพังได้ ต้องมีภาพหรือวิดีโออย่างน้อยหนึ่งรายการในอาร์เรย์ แทร็กจังหวะเพียงอย่างเดียวจะถูกปฏิเสธ
  2. type เป็นตัวเลือก มันถูกอนุมานจาก URL แต่ให้ระบุไว้เมื่อนามสกุลไม่ชัดเจน
  3. ขีดจำกัดมีจริง ภาพสูงสุด 9 ภาพ, วิดีโอ 3 รายการ, คลิปเสียง 3 รายการ, รวม 12 ไฟล์ โดยที่วิดีโออ้างอิงและเสียงมีความยาว 2 ถึง 15 วินาทีต่อรายการ (เอกสาร API MiniMax, กรกฎาคม 2026)
  4. ให้ทุกการอ้างอิงมีหน้าที่ในข้อความพรอมต์ นี่คือนิสัยที่ให้ประโยชน์สูงสุดในรายการนี้ พรอมต์ทางการมักเริ่มต้นด้วยประโยคเช่น "ภาพที่ 1 คือการอ้างอิงอารมณ์และสไตล์โดยรวม, ภาพที่ 2 คือการอ้างอิงตัวละครหลัก" หากไม่มีประโยคนั้น โมเดลจะต้องเดาว่าบอร์ดไหนหมายถึงอะไร ข้อความสีดำขนาดใหญ่อ่านว่า BASS HITS เหนือผู้หญิงยิ้มMV แนวดาร์กป๊อปของ MiniMax H3: ตัวอักษร CUT BACK, ONE LOOK, DETONATE ผู้หญิงสามคนในแฟชั่นกรันจ์ข้างโปสเตอร์ตัวอักษรหนาบอร์ดอ้างอิงตัวอักษรสองบอร์ดที่อยู่เบื้องหลังคลิปดาร์กป๊อป

คลิปนั้นคือข้อโต้แย้งสำหรับกฎข้อที่ 4 พรอมต์ของมันไม่เคยบรรยายรูปทรงตัวอักษรใด ๆ เลย มันพูดว่า "สไตล์การจัดวางข้อความและพื้นผิวอ้างอิงจากภาพ" และส่งมอบสองบอร์ด เลย์เอาต์มาถึงเพราะมันถูกแสดง ไม่ใช่บรรยาย

อีกหนึ่งตาราง เพราะการ์ดโมเดลและ API ปัจจุบันไม่ได้พูดสิ่งเดียวกัน และช่องว่างนั้นคือจุดที่คนเสียเวลาช่วงบ่าย

สิ่งเอกสารของ MiniMax เองสิ่งที่เอนด์พอยต์ยอมรับจริงในวันนี้สิ่งนั้นหมายถึงอะไรสำหรับพรอมต์ของคุณ
ระยะเวลา4 ถึง 15 วินาที, เฉพาะจำนวนเต็มtext-to-video และ image-to-video: 5 ถึง 10, ค่าเริ่มต้น 8. reference-to-video: 5 ถึง 15, ค่าเริ่มต้น 8รายการช็อต 15 วินาทีตอนนี้เหมาะกับ reference-to-video เท่านั้น เขียนบอร์ดที่ยาวกว่าใหม่เป็น 10
ความละเอียด2Kresolution ค่าเริ่มต้นเป็น 2K และตอนนี้ 2K เป็นค่าเดียวที่ใช้งานได้ งาน 768p จะได้ข้อความว่า MiniMax-H3 does not support resolution 768P, supported resolutions: 2K แม้ว่า 768p จะปรากฏในตารางราคาเขียนสำหรับด้านสั้น 1440px รายละเอียดที่คุณขอจะอยู่รอดจริง
อัตราส่วนภาพอัตราส่วนทั่วไปหรือปรับตามimage-to-video และ reference-to-video ค่าเริ่มต้นเป็น adaptive. Text-only ปฏิเสธ adaptive และคืนค่าชุดที่อนุญาต: 16:9, 4:3, 1:1, 3:4, 9:16, 21:9บน text-to-video ตั้งค่า ratio อย่างชัดเจน ไม่งั้นงานจะล้มเหลวในการตรวจสอบความถูกต้อง
การอ้างอิงแบบผสม9 ภาพ, 3 วิดีโอ, 3 เสียง, 12 ไฟล์, เสียงไม่เคยอยู่ตามลำพังrefers[] รับ {url, type} พร้อม image, video หรือ audio, อย่างน้อย 1 ภาพหรือวิดีโอคุณสามารถซิงค์การเคลื่อนไหวกับจังหวะที่ให้มาได้จริง ๆ คุณแค่ไม่สามารถให้เฉพาะจังหวะเท่านั้น
เสียงพื้นเมืองเสียงสเตอริโอในพาสเดียวกันทุกคลิปทางการ 9 คลิปที่ผมตรวจสอบ: 2560x1440, 24fps, AAC stereo ที่ 32kHzบล็อกเสียงไม่ใช่ของตกแต่ง มันคือครึ่งหนึ่งของสิ่งที่ต้องส่งมอบ

ทุกอย่างข้างต้นรันบน Atlas Cloud ซึ่งเอนด์พอยต์ H3 ทั้งสามอยู่เบื้องหลังคีย์เดียวและลูป submit-and-poll เดียวกัน ดังนั้นการสลับระหว่างพวกมันคือการเปลี่ยนสตริงโมเดลและไม่มีอะไรอื่น

บทช่วยสอนพรอมต์ MiniMax H3: จุดไฟเผาสุนัข This Is Fine พร้อมเสียง

นี่คือทั้งหมดตั้งแต่ต้นจนจบ มุกนี้ใช้ได้ผลเพราะสุนัขไม่ทำอะไรเลย ยืดการปฏิเสธนั้นออกไปเป็นเวลาจริงสิบวินาที เพิ่มไฟจริง และปล่อยให้สองวินาทีสุดท้ายไปที่ที่การ์ตูนต้นฉบับไปจริง ๆ แล้วมันจะตลกขึ้นและแย่ลงเล็กน้อยสำหรับคุณ คนส่วนใหญ่เคยเห็นแค่สองแผงแรกเท่านั้น

ขั้นตอนที่ 1: ดาวน์โหลดการ์ตูนต้นฉบับ อย่าให้ AI วาดใหม่

การ์ตูนมีหกแผง สองคอลัมน์สามแถว 600x887 เราต้องการแค่แผงที่ 2 และแผงที่ 6

bash
1curl -L -o gunshow-648.png https://gunshowcomic.com/comics/20130109.png
2# 600x887, 6 panels, 2 cols x 3 rows
3
4# crop panel 2 (the "THIS IS FINE." panel):  x 302-584, y 20-293
5# crop panel 6 (the melting dog):            x 302-584, y 595-868
6# upscale each 4x with Lanczos  ->  1128x1092
7

พูดให้ชัดเจน: อย่าขอให้โมเดลภาพวาด "สุนัขที่ดูเหมือน This Is Fine" การสร้างใหม่ด้วย AI จะถูกจับได้ในครึ่งวินาทีว่าปลอม และมุกนั้นตายทันที สีน้ำที่โปร่งบาง ตัวอักษรที่เขียนมือไม่เรียบ และลายกระดาษคือสัญญาทั้งหมด การขยาย 4x ด้วย Lanczos มีไว้เพราะ 282px ของต้นฉบับนั้นบางเกินไป มันให้พิกเซลจริงที่โมเดลจะยึดไว้โดยไม่ต้องประดิษฐ์อะไรเพิ่ม สองแผงของสุนัข This is Fine กำลังละลายในไฟแผงที่ 2 และแผงที่ 6 ของการ์ตูนต้นฉบับ ติดป้ายเป็นอินพุตเฟรมแรกและเฟรมสุดท้าย

ขั้นตอนที่ 2: รันบน image-to-video พร้อม end_image.

โมเดล: minimax/h3/image-to-video. การตั้งค่า: resolution 2K, image = panel 2, end_image = panel 6, ratio 1:1 เพื่อให้ตรงกับแหล่งที่มาที่เกือบเป็นสี่เหลี่ยม ตั้ง duration เป็น 10; แถบเลื่อนอยู่ที่ 8 เป็นค่าเริ่มต้น ดังนั้นลากมัน

text
1แผงเว็บคอมมิก 2D วาดด้วยมือ ถูกทำให้มีชีวิต รักษาพื้นผิวสีน้ำต้นฉบับ
2เส้นหมึกที่มองเห็นได้ ลายกระดาษที่ลงทะเบียนไม่ตรง และจานสีการ์ตูนแบน
3ในทุกเฟรม อย่าทำให้เรียบ อย่าเรนเดอร์ใหม่ใน 3D อย่าเก็บเส้นให้สะอาด
4อย่าเพิ่มวัตถุใหม่ อย่าเพิ่มข้อความใหม่
5
6[0s-3s] แทบไม่มีอะไรเคลื่อนไหว สุนัขนั่งนิ่งสนิท ถือแก้ว ตาจ้องตรงไปข้างหน้า
7มีเพียงเปลวไฟด้านหลังที่เคลื่อนไหว: ลิ้นไฟสีส้มค่อย ๆ เลียขึ้นกำแพง
8ถ่านไฟลอยขึ้นฟ้าหนึ่งเม็ด คำพูดในบอลลูนที่อ่านว่า "THIS IS FINE."
9ยังคงอยู่ตรงนั้นทุกประการ อ่านได้ชัดเจน ไม่เปลี่ยนแปลง เขียนด้วยมือ
10
11[3s-6s] สุนัขยกแก้วขึ้นและจิบเล็กน้อยอย่างสงบ บอลลูนคำพูดจางหายไปหลังจากจิบ
12ไฟสว่างขึ้น กำแพงด้านหลังเริ่มบิดเบี้ยวด้วยความร้อน หมวกของมันเริ่มมีควันที่ขอบ
13
14[6s-8.5s] ความร้อนมาถึงมัน หูของมันหย่อนลง โครงร่างของมันนิ่มลงและเริ่ม
15ไหลลงมาเหมือนสีเปียก มันยังคงไม่ขยับตา แก้วยังคงอยู่ในอุ้งเท้า
16
17[8.5s-10s] ละลายเต็มที่ ใบหน้าบิดเบี้ยว ตาข้างหนึ่งเลื่อน ฟันเผยออกในรอยยิ้ม
18ที่แข็งทื่อ ขนกลายเป็นสีแดงและส้ม มันคงท่าไว้ ค้างที่เฟรมสุดท้าย
19ครึ่งวินาทีสุดท้าย
20
21กล้อง: ยึดอยู่กับที่ ภาพกว้างนิ่งช็อตเดียว ไม่ซูมเข้า ไม่ถือกล้อง ไม่ตัด
22เฟรมไม่เคยเคลื่อนที่ นี่คือเทคต่อเนื่องเทคเดียวภายในแผงการ์ตูนแผงเดียว
23
24เสียง: เสียงบรรยากาศของไฟภายในตลอดทั้งคลิป - เสียงแตกเบา ๆ เสียงป๊อป
25ของไม้ไหม้เป็นครั้งคราว เสียงโครงสร้างดังเอี๊ยดเบา ๆ ที่ 3s เสียงแก้วเซรามิก
26กระทบฟันและเสียงกลืนเล็กน้อย เสียงผู้ชายที่สงบ แบน ไม่ทุกข์ร้อน พูดว่า:
27"This is fine." - เสียงเรียบ ไม่มีอารมณ์ ผ่อนคลายเกินไปเล็กน้อย ตั้งแต่ 6s
28เสียงแตกดังขึ้นและเสียงบรรยากาศหนาขึ้น 2 วินาทีสุดท้ายเพิ่มคลื่นซับเบส
29ความถี่ต่ำ ไม่มีดนตรี ไม่มีแทร็กเสียงหัวเราะ ไม่มีเอฟเฟกต์เสียงที่ไม่ได้อยู่ใน
30รายการนี้
31
32อย่าเพิ่มคำบรรยาย อย่าเพิ่มลายน้ำ อย่าสะกดคำใด ๆ นอกเหนือจากคำที่อยู่ในภาพ
33แล้ว อย่าเปลี่ยน "THIS IS FINE." อย่าตัดออกไป
34

พรอมต์นั้นคือตารางโครงสร้างที่มีชีวิต ย่อหน้าแรกคือข้อตกลงสไตล์ สี่ชิ้นในวงเล็บคือไทม์ไลน์ จากนั้นกล้อง จากนั้นเสียง จากนั้นรายการเชิงลบ ไม่มีอะไรในนั้นเป็นของตกแต่ง ภาพหน้าจอของเครื่องมือสร้างวิดีโอ AI ที่แสดงมีม This is fineMiniMax H3 image-to-video บน Atlas Cloud: โหลดเฟรมแรกและเฟรมสุดท้ายแล้ว 10 วินาทีที่ 2K คลิปที่เสร็จแล้วในแผงผลลัพธ์

ขั้นตอนที่ 3: อ่านผลลัพธ์เหมือนการตรวจสอบ QA

สี่การตรวจสอบ แต่ละอันทดสอบบล็อกที่แตกต่างกันของพรอมต์

  1. THIS IS FINE. ในบอลลูนยังอ่านได้และสะกดถูกต้องหรือไม่? นั่นทดสอบบล็อก 5
  2. เส้นหมึกยังอยู่รอดหรือมีอะไร "ปรับปรุง" ให้เป็น 3D ที่สะอาดหรือไม่? นั่นทดสอบบล็อก 1
  3. เสียงมีเฉพาะเสียงที่คุณระบุหรือไม่? ตรวจสอบคอนเทนเนอร์: มันควรกลับมาเป็น h264 บวก AAC stereo
  4. เฟรมสุดท้ายตรงกับท่าในแผงที่ 6 หรือไม่? นั่นทดสอบ end_image
bash
1ffprobe -v error -show_entries stream=codec_type,codec_name,width,height,r_frame_rate,channels,sample_rate \
2        -of default=noprint_wrappers=1 output.mp4
3

ของผมกลับมาที่ 1472x1440, 24fps, h264 บวก AAC stereo, 10.13 วินาที ที่น่าสังเกต: ผมขอ ratio: 1:1 และได้ 1472x1440 ดังนั้นบน image-to-video รูปร่างของเฟรมต้นฉบับชนะ จับคู่สองแผงของคุณให้เข้ากับรูปร่างที่คุณต้องการจริง ๆ สุนัขการ์ตูนพูดว่า this is fine แล้วละลายในไฟสี่เฟรมจากคลิปที่เสร็จแล้วที่ 0s, 3s, 6.5s และ 10s ตรงกับสี่ช่วงเวลาในพรอมต์

ขั้นตอนที่ 4: ย้ายสุนัขไปที่ใหม่ด้วย reference-to-video

ตัวละครเดียวกัน ห้องใหม่ โมเดล: minimax/h3/reference-to-video. การตั้งค่า: refers[] = panel 2 as image, duration 8, resolution 2K, ratio 16:9.

text
1Image 1 คือการอ้างอิงตัวละครและสไตล์ศิลปะ: รักษาลุคเว็บคอมมิก 2D วาดด้วยมือ
2นี้ให้เหมือนเดิม พื้นผิวสีน้ำเดียวกัน น้ำหนักเส้นหมึกเดียวกัน สุนัขตัวเดียวกัน
3หมวกใบเล็กใบเดียวกัน แก้วใบเดียวกัน อย่าวาดเขาใหม่ใน 3D อย่าเปลี่ยนสัดส่วนของเขา
4อย่าเก็บเส้นให้สะอาด
5
6วางเขาในห้องที่แตกต่างกันและรักษาความสงบของเขาไว้ สำนักงานโอเพนแพลนที่แคบ
7ในเวลากลางคืน หลอดไฟฟลูออเรสเซนต์กะพริบ กำแพงจอมอนิเตอร์ทั้งหมดแสดงสถานะ
8ข้อผิดพลาดสีแดง กระดาษปริ้นเตอร์ลอยลงมาผ่านเฟรม ไฟไฟฟ้าเล็ก ๆ ที่มุมห้อง
9เขานั่งบนเก้าอี้สำนักงานตรงกลางเฟรม ถือแก้วในอุ้งเท้า มองตรงไปที่กล้อง
10ผ่อนคลายอย่างสมบูรณ์
11
12กล้อง: ยึดอยู่กับที่ ภาพกว้างนิ่ง ไม่ซูมเข้า ไม่ตัด
13
14เสียง: เสียงฮัมของฟลูออเรสเซนต์ เสียงปริ้นเตอร์ครูด เสียงสัญญาณเตือนเบา ๆ
15ซ้ำทุกสองวินาที เสียงไฟฟ้าแตกไกล ๆ เสียงจิบอย่างสงบที่ 4s ไม่มีดนตรี ไม่มีเสียงพูด
16
17อย่าเพิ่มข้อความบนหน้าจอใด ๆ อย่าเพิ่มคำบรรยาย อย่าเพิ่มตัวละครอื่น ๆ
18

กฎที่ถ่ายทอดได้: refers[] เป็นตัวแบกเอกลักษณ์และสไตล์ ข้อความเป็นตัวแบกฉาก การแบ่งงานนั่นคือเคล็ดลับทั้งหมดสำหรับความสอดคล้องของตัวละคร และเป็นเหตุผลที่บรรทัดแรกของพรอมต์มีอยู่จริง ลองดู: "สุนัขการ์ตูนถือแก้วกาท่ามกลางหน้าจอสีแดงและเครื่องพิมพ์ที่กำลังไหม้สุนัขเว็บคอมมิกตัวเดียวกันย้ายไปที่สำนักงานโอเพนแพลนที่กำลังไหม้ในเวลากลางคืน สร้างโดย MiniMax H3 reference-to-video

หมวกใบเดียวกัน แก้วใบเดียวกัน น้ำหนักหมึกเดียวกัน ห้องใหม่ ภาพอ้างอิงภาพเดียวทำทั้งหมดนั้น

อีกรูปแบบพรอมต์ MiniMax H3 ที่ควรขโมยอีกสามแบบ

รูปแบบที่ 1: โปสเตอร์เคลื่อนไหว ที่เลย์เอาต์ต้องไม่ขยับ ตัวละครการ์ตูนวิ่งไปข้างหน้าบนพื้นหลังสีชมพูทึบโปสเตอร์เคลื่อนไหว MiniMax H3: เลย์เอาต์ POPUP! เคลื่อนไหวในขณะที่เฟรมและตัวอักษรยังคงล็อก เด็กชายการ์ตูนในฮู้ดสัตว์ประหลาดสีชมพูยื่นมือออกมาด้วยกรงเล็บยักษ์โปสเตอร์นิ่งต้นฉบับที่ส่งให้ MiniMax H3

พรอมต์ทั้งหมดมีสองบรรทัด: รักษากรอบสีขาวของแกลเลอรี, กรอบด้านใน, จานสีแดง-ขาว-ดำ, ความรู้สึกฟิกเกอร์ 3D และโครงสร้างเลย์เอาต์ให้ไม่เปลี่ยนแปลง และใส่เอฟเฟกต์เสียงที่คล่องแคล่วใต้การเข้ามาของข้อความ กฎ: ตั้งชื่อส่วนที่ต้องอยู่รอด "รักษาเลย์เอาต์" ไม่ใช่หมายเหตุสไตล์ มันเป็นข้อจำกัด และโมเดลปฏิบัติต่อมันเช่นนั้น

รูปแบบที่ 2: เดโมอินเทอร์เฟซ ที่คำกริยามีชัยเหนือคำคุณศัพท์ รองเท้าวิ่ง Nike ZoomX สีมิ้นต์กับพื้นรองเท้าสีชมพูเกรเดียนต์เดโมหน้า Landing Page MiniMax H3: เลื่อน, โฮเวอร์, การกลับสีบนหน้าสินค้า รองเท้าวิ่ง Nike สีฟ้าอ่อนกับเน้นสีเขียวและชมพูภาพอ้างอิงสินค้าชิ้นเดียวที่อยู่เบื้องหลังคลิปหน้า Landing Page

พรอมต์นั้นขอการเลื่อนหน้าลง, สถานะโฮเวอร์, การขยายขนาดใหญ่ และการกลับสี คำกริยาสี่คำ มันไม่เคยพูดว่า "สมัยใหม่" หรือ "เรียบหรู" ปฏิสัมพันธ์คือการกระทำ ดังนั้นจงเขียนเป็นการกระทำ ตัวเอียงขนาดใหญ่และพื้นหลังลายคาร์บอนมาจากคำคุณศัพท์ สิ่งที่ทำให้มันอ่านเหมือนหน้าจริงมาจากคำกริยา

รูปแบบที่ 3: ไลฟ์แอ็กชันผสมวาดด้วยมือ ยึดไว้ด้วยกันด้วยการปฏิเสธ ต้นกล้าเรืองแสงสีเขียวที่เคลื่อนไหวได้เติบโตในมือที่เปิดคลิป MiniMax H3 หลอมรวมฟุตเทจไลฟ์แอ็กชันในครัวกับสิ่งมีชีวิตเรืองแสงที่วาดด้วยมือ

อันนี้คือห้องครัวตอนเย็นที่ถ่ายด้วยมือถือ มีสิ่งมีชีวิตเล็ก ๆ เรืองแสงที่วาดด้วยมืออยู่ในนั้น และเหตุผลที่มันยังคงมีเสน่ห์แทนที่จะกลายเป็นหนังสั้นสยองขวัญคือรายการข้อห้าม: ไม่มีตาโต, ไม่มีปากแหว่ง, ไม่มีเขี้ยว, ไม่มีท่าทางคุกคาม, ไม่พุ่งเข้าใส่, ไม่มีตัดดำกะทันหัน, ไม่มีจั๊มสแกร์ รายการเชิงลบคือการควบคุมสไตล์หลัก ไม่ใช่แผ่นแปะ มันยังเป็นที่ที่คุณใส่รสนิยม สี่แผงแสดงผู้หญิงในอุโมงค์มืดพร้อมข้อความสี่เฟรมจากตัวอย่างภาพยนตร์วิทยาศาสตร์ทางการ: THE STARS WERE LISTENING โปสเตอร์สำหรับ The Stars Were Listening และแผ่นการออกแบบตัวละครบอร์ดอารมณ์และการอ้างอิงตัวละครที่อยู่เบื้องหลังตัวอย่าง

ตัวอย่างภาพยนตร์ด้านบนปิดลูปของทั้งสองแนวคิด พรอมต์สะกดชื่อเรื่องหนึ่งชื่อ THE STARS WERE LISTENING อย่างละเอียด: แคบมาก หนัก ตัวพิมพ์ใหญ่ทั้งหมด สีแดงเข้มผสมสนิม เม็ดเล็กน้อยและขอบฝ้าอ่อน ชื่อนั้นกลับมาตรงตามที่สั่ง บอร์ดอ้างอิงสองบอร์ดจัดการอารมณ์และตัวละครนำ ดังนั้นข้อความไม่เคยต้องบรรยายใบหน้า การแบ่งงาน ลงไปจนถึงระดับล่างสุด

การใช้พรอมต์ MiniMax H3 เหล่านี้มีค่าใช้จ่ายเท่าไร

H3 คิดเงินต่อวินาทีของวิดีโอที่สร้าง ตามความละเอียด ดังนั้นโมเดลต้นทุนจึงน่าเบื่ออย่างน่าปลื้ม: เทค 15 วินาทีมีค่าใช้จ่ายประมาณสามเทค 5 วินาที ทุกอย่างอื่นเป็นไปตามนั้น

  • ทำซ้ำที่ 5 วินาที ส่งมอบที่ 10 หรือ 15 องค์ประกอบ จานสี และการออกแบบเสียงทั้งหมดแก้ไขได้ที่ 5 วินาที ไม่มีอะไรเกี่ยวกับช็อตที่ยึดอยู่กับที่ต้องการระยะเวลาเต็มเพื่อบอกคุณว่ามันผิด
  • end_image เป็นเครื่องมือต้นทุน ไม่ใช่แค่เครื่องมือสร้างสรรค์ การรันซ้ำส่วนใหญ่เกิดขึ้นเพราะตอนจบล่องลอย การล็อกเฟรมสุดท้ายจะลบโหมดความล้มเหลวนั้นก่อนที่คุณจะจ่ายเงิน
  • รายการเชิงลบและข้อความที่สะกดออกมาฟรี พวกมันเพิ่มตัวอักษรให้พรอมต์ที่คิดเงินต่อวินาที ไม่ใช่ต่อโทเค็น ใช้มันหนัก ๆ
  • จับคู่ระยะเวลากับเอนด์พอยต์ก่อนที่คุณจะเขียน การสร้างรายการช็อต 15 วินาทีแล้วค้นพบว่าเอนด์พอยต์ของคุณจำกัดที่ 10 จะทำให้คุณต้องเขียนใหม่ ไม่ใช่แค่รันซ้ำ

สิ่งหนึ่งที่ยังไม่ควรวางแผนคือ: ตารางราคาระบุระดับ 768p ที่ถูกกว่า แต่ ณ เวลาที่เขียนนี้ งาน 768p ถูกปฏิเสธทันที และ 2K เป็นความละเอียดเดียวที่ใช้งานได้ วางงบประมาณราวกับว่าทุกวินาทีเป็นวินาที 2K อัตราต่อวินาทีปัจจุบันอยู่ที่ หน้าโมเดล ซึ่งเป็นที่ที่ระดับ 768p จะปรากฏเมื่อเปิดให้บริการ

พรอมต์ MiniMax H3, มีม และลิขสิทธิ์

สุนัขตัวนี้ไม่ใช่สาธารณสมบัติ This Is Fine มาจากเว็บคอมมิก Gunshow #648 ของ KC Green เผยแพร่เมื่อวันที่ 9 มกราคม 2013 และมีเพียงสองแผงแรกเท่านั้นที่กลายเป็นไวรัล (Know Your Meme, มกราคม 2013) Green ได้พูดต่อสาธารณะ และค่อนข้างเหนื่อยหน่าย เกี่ยวกับการได้เห็นภาพถูกนำไปใช้ซ้ำตลอดกาล รวมถึงโดยคนที่การเมืองไม่ตรงกับเขา (NPR, มกราคม 2023)

คำแนะนำนี้เป็นบทวิจารณ์และการสอน ไม่ใช่ห้องสมุดสต็อก ถ้าคุณต้องการส่งอะไรในเชิงพาณิชย์ ให้วาดเฟรมของคุณเองหรือขออนุญาตใช้เฟรมที่คุณใช้ และตรวจสอบนโยบายของคุณเองก่อนทำงานลูกค้า: H3 ใช้กฎเนื้อหากับบุคคลจริงที่รู้จักและทรัพย์สินทางปัญญาที่รู้จักกันดี และการค้นพบสิ่งนั้นกลางเส้นตายไม่สนุก

คำถามที่พบบ่อย

MiniMax H3 สร้างเสียงหรือฉันต้องเพิ่มทีหลัง?

พาสเดียวกัน ภาพและเสียงออกมาพร้อมกัน ซึ่งเป็นเหตุผลที่ต้องเขียนเสียงลงในเนื้อหาพรอมต์แทนที่จะต่อเพิ่มทีหลัง ให้บล็อก Audio: ของมันเองและระบุว่าเสียงแต่ละชนิดเข้ามาเมื่อใด ทุกคลิปทางการ 9 คลิปที่ผมตรวจสอบกลับมาเป็น AAC stereo ที่ 32kHz พร้อมกับสตรีมวิดีโอ 2560x1440, 24fps

พรอมต์ MiniMax H3 สามารถยาวได้เท่าไร?

สูงสุด 7,000 ตัวอักษร ตามเอกสารของ MiniMax ในทางปฏิบัติ ตัวอย่างทางการมีช่วงกว้าง โดยค่ามัธยฐานประมาณ 130 ตัวอักษรจีน และสองอันที่ยาวที่สุดที่ 657 และ 858 พรอมต์สั้นใช้ได้ดีเมื่อภาพอ้างอิงทำงานบรรยายแทน ถ้าคุณไม่มีภาพอ้างอิง คาดว่าจะต้องเขียนรายการช็อต

ทำไมข้อความถึงออกมาเสียในวิดีโอ MiniMax H3 ของฉัน?

เพราะคุณไม่ได้พิมพ์มัน สตริงที่ปรากฏตามตัวอักษรในพรอมต์จะแสดงผลอย่างชัดเจน อะไรก็ตามที่คุณพูดถึงอย่างกว้าง ๆ ("องค์ประกอบ HUD," "ป้ายบางอัน") กลับมาเป็นพื้นผิวรูปตัวอักษร สะกดทุกคำที่ต้องอ่านได้ แล้วเพิ่ม "อย่าสะกดผิด, อย่าเพิ่มข้อความอื่น, อย่าเพิ่มคำบรรยาย"

พรอมต์ MiniMax H3 หนึ่งอันสามารถใช้ภาพอ้างอิง วิดีโอ และคลิปเสียงได้กี่ชิ้น?

เก้าภาพ สามวิดีโอ และสามคลิปเสียง รวมสิบสองไฟล์ โดยวิดีโออ้างอิงและเสียงมีความยาวระหว่าง 2 ถึง 15 วินาทีต่อรายการ เสียงไม่สามารถเป็นข้อมูลอ้างอิงเพียงอย่างเดียว โปรดทราบว่าความสามารถของโมเดลกับสิ่งที่เอนด์พอยต์เปิดเผยเป็นสองสิ่งที่แตกต่างกัน ดังนั้นให้ตรวจสอบหน้าโมเดลสำหรับรายการอินพุตปัจจุบัน

พรอมต์ MiniMax H3 สามารถควบคุมว่าคลิปจบอย่างไร ไม่ใช่แค่เริ่มต้นอย่างไร?

ได้ บน image-to-video ผ่านพารามิเตอร์ end_image ที่ไม่บังคับ ให้เฟรมแรกและเฟรมสุดท้าย แล้วคลิปจะ interpolate ระหว่างพวกมัน เดโมข้างต้นคือสิ่งนั้น: แผงการ์ตูน 2 เข้า, แผงการ์ตูน 6 ออก รักษาอัตราส่วนภาพของภาพทั้งสองให้ใกล้เคียงกัน ไม่งั้นการเปลี่ยนภาพจะดูไม่ดี

ระยะเวลาและความละเอียดที่ฉันจะได้จริงในตอนนี้คืออะไร?

2K และเท่านั้น งาน 768p ในปัจจุบันถูกปฏิเสธด้วยข้อความ supported resolutions: 2K แม้ว่า 768p จะปรากฏในตารางราคา ระยะเวลาแตกต่างกันไปตามเอนด์พอยต์: text-to-video และ image-to-video รองรับ 5 ถึง 10 วินาที โดยค่าเริ่มต้น 8 ในขณะที่ reference-to-video รองรับ 5 ถึง 15 อีกหนึ่งข้อควรระวัง: บน text-only generation API ปฏิเสธ adaptive และต้องการ ratio ที่ชัดเจน

โมเดลล่าสุด

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด