เพียง 2 สัปดาห์เท่านั้น | รับส่วนลด 20% สำหรับ Seedream 5.0 Pro!

MiniMax H3 Prompt Guide: ฉันอ่านโพรอมต์ทางการทั้งหมด 45 ข้อ จากนั้นก็จุดไฟเผาสุนัข This Is Fine Dog

คู่มือการสร้าง prompt สำหรับ MiniMax H3 ที่รวบรวมจากตัวอย่าง prompt ทั้ง 45 ข้อของ MiniMax: โครงสร้างหกบล็อก, เทคนิค end_image, สัญญาณเสียงแบบเนทีฟ, และการแก้ไขข้อความที่เสีย

คุณรู้วิธีพรอมต์วิดีโอโมเดลอยู่แล้ว "แสงแบบภาพยนตร์, ค่อยๆ ดันเข้า, 4K" คำศัพท์พวกนั้นใช้ได้มาสองปี

แล้วคุณก็วางมันลงใน MiniMax H3 แล้วได้คลิป 2K ที่มาพร้อมกับซาวด์แทร็กของมันเอง ภาพดูดีมาก จังหวะมันเละ ตัวอักษรสองตัวในชื่อของคุณสะกดผิด เสียงเป็นบรรยากาศห้องที่โมเดลเลือกให้คุณ

โมเดลไม่ใช่ปัญหา คุณยื่นประโยคให้มัน มันต้องการตารางเวลา

ฉันเลยไปอ่านพรอมต์ตัวอย่างทั้ง 45 ตัวที่ MiniMax แถมมากับ H3 พร้อมกับคลิปที่เสร็จแล้วที่มากับมัน แล้วก็แยกเฟรมออกมา พรอมต์ทางการไม่ใช่คำอธิบาย พรอมต์ที่ดีคือรายการช็อตที่มีแผ่นคิวเพลงติดอยู่ด้านหลัง ด้านล่างคือโครงสร้าง พารามิเตอร์ที่เปิดเผยจริงๆ ในตอนนี้ และเดโมหนึ่งชิ้นที่คุณสามารถทำซ้ำได้ภายในประมาณยี่สิบนาที

ข้อควรจำสำคัญ

  • พรอมต์ H3 คือ ไทม์ไลน์, ไม่ใช่คำอธิบาย ตัวอย่างทางการที่แข็งแกร่งที่สุดจะตัดคลิปด้วยเครื่องหมาย [0s-2s], [2s-4s] และภาพยนตร์ที่เสร็จแล้วก็ตีทุกจังหวะ
  • เสียงและภาพออกมาจากพาสเดียวกัน ดังนั้นเสียงต้องอยู่ในเนื้อหาพรอมต์ พรอมต์ทางการให้บล็อกของตัวเอง ลงไปถึง "แนวเบสแจ๊สเข้ามาที่ 6 วินาที"
  • ข้อความที่คุณสะกดออกมาจะกลับมาสะอาด ข้อความที่คุณไม่ได้สะกดจะกลับมาเป็น noise ที่มีรูปร่างเหมือนตัวอักษร ฉันมีครอบเฟรมจากคลิปทางการคลิปเดียวที่พิสูจน์ทั้งสองอย่างพร้อมกัน
  • image-to-video รับ end_image ได้ ให้เฟรมแรกและเฟรมสุดท้าย แล้วส่วนโค้งทางอารมณ์ก็ถูกตรึงไว้ก่อนที่คุณจะใช้เวลาในการคำนวณแม้แต่วินาทีเดียว
  • ความยาวพรอมต์ไม่ใช่คุณธรรม พรอมต์ทางการสั้นๆ ทำงานได้ดีเมื่อมีภาพอ้างอิงที่ทำหน้าที่อธิบาย ความยาวบ่งบอกว่าคุณปฏิเสธที่จะมอบงานให้ภาพอ้างอิงมากแค่ไหน

สุนัข This Is Fine ยังอยู่ทางซ้ายและกำลังไหม้ใน 10 วินาทีของเอาต์พุต MiniMax H3 ทางขวา

นั่นคือภาพวาดเดียวกันทั้งสองด้าน ด้านซ้ายคือภาพต้นฉบับของ KC Green ที่ไม่ถูกแตะต้อง ด้านขวาคือการเรียก image-to-video หนึ่งครั้ง: ใส่เฟรมแรก, ใส่เฟรมสุดท้าย, เอาต์พุตสิบวินาที, และเสียงไฟลุกโชนและคำว่า "this is fine" แบนๆ นั้นเป็นแทร็กเสียงของโมเดลเอง ไม่มีใครทำสกอร์ให้ ทุกอย่างในคู่มือนี้มุ่งเป้าไปที่การพาคุณไปถึงครึ่งหลังนั้น

พรอมต์ MiniMax H3 จริงๆ หน้าตาเป็นยังไง (ฉันอ่านทั้ง 45 ตัว)

ทุกๆ "คู่มือพรอมต์ MiniMax H3" ที่ปัจจุบันอยู่บนหน้าแรกของผลการค้นหาคือสเปกชีต: 2K, 24fps, 5 ถึง 15 วินาที, เสียงเนทีฟ นั่นคือการ์ดโมเดล มันไม่ใช่พรอมต์

นี่คือของจริง นี่คือส่วนหนึ่งของพรอมต์ทางการที่อยู่เบื้องหลังซีเควนซ์ไตเติ้ลแนว noir ของ MiniMax ที่แปลจากต้นฉบับภาษาจีน ซึ่งมีความยาวประมาณหนึ่งในสามของความยาวเต็ม:

สร้างซีเควนซ์ไตเติ้ลภาพยนตร์อาชญากรรมแนว suspense เบาๆ ความยาว 15 วินาที อัตราส่วน 16:9 สไตล์โดยรวมอ้างอิงภาษาภาพของภาพเหล่านี้: การ์ดไตเติ้ลอนิเมะญี่ปุ่นย้อนยุค, ภาพเงาแข็งๆ, คอลลาจการ์ตูน, จอแยกแบบไม่สมมาตร, บล็อกสีเรขาคณิตแข็งแรง, เครดิตไตเติ้ลภาษาอังกฤษ, ตกแต่งด้วยคาตาคานะญี่ปุ่นเล็กน้อย, รู้สึกถึงแจ๊ส-อาชญากรรม อารมณ์เป็น suspense 60%, แจ๊ส 40%: ลึกลับ, เท่, คล่องแคล่ว, อาชญากรรมในเมือง, ไม่ใช่สยองขวัญ, ไม่หนัก, และอย่าให้มันกลายเป็น MV แจ๊สสนุกสนาน

[...] เครดิตภาษาอังกฤษต้องอ่านได้ชัดเจน [...] อย่าเพิ่มภาษาจีน, อย่าสร้างข้อความที่อ่านไม่ออก, อย่าสะกดภาษาอังกฤษผิด กฎสำหรับทั้งชิ้น: เครดิตภาษาอังกฤษและตำแหน่งงานทุกครั้งปรากฏเพียงครั้งเดียว อย่าซ้ำตำแหน่งงาน, อย่าซ้ำชื่อ, อย่าให้คนคนเดียวมีหลายตำแหน่ง

การเปลี่ยนฉากต้องหลากหลาย: มาสก์แผ่นเสียงไวนิลวงกลม, wipe ประตูรถแนวตั้ง, เงายาวของตัวละครกวาดหน้าจอ, คัทเส้นสีแดง, มาสก์ตัวอักษรภาษาอังกฤษยักษ์, การจัดองค์ประกอบจอแยกใหม่, คัทบล็อกสีแข็ง, แผงวางทีละบล็อก การเปลี่ยนฉากทั้งหมดลงบนจังหวะกลอง: กรุบกรอบ, ลุ้นระทึก, คล่องแคล่ว, คอลลาจการ์ตูน ไม่มีการละลายนุ่มนวล, ไม่มีการเปลี่ยนฉากลื่นไหล

BGM: ดนตรีไตเติ้ลต้นฉบับ 15 วินาที, suspense 60%, แจ๊ส 40% สร้างจากโทนเบสคงที่, สายพิซซิคาโตตึงเครียด, พัลส์ซินธ์เย็นๆ, กลองเตะ, แปรงแจ๊สเบาบาง, เศษเบสเดิน, วลีแซกโซโฟนบาริโทนสั้นๆ และการโจมตีทองเหลืองสั้นๆ สองวินาทีแรกสร้างความตึงเครียดด้วยความถี่ต่ำและไฮแฮท, ที่ 3 วินาทีกลองต่ำเข้า, ที่ 6 วินาทีแนวเบสแจ๊สเข้าร่วม, ที่ 10 วินาทีริฟแซก/ทองเหลืองสั้นๆ ปรากฏ, สองวินาทีสุดท้ายล็อคด้วยคอร์ดตึงเครียดและจังหวะกลอง

อ่านว่าคำต่างๆ ไปอยู่ที่ไหน แทบไม่มีคำไหนไปที่ "สวยงาม" หรือ "ภาพยนตร์" พวกเขาไปที่ รายการเชิงลบ, รายการเปลี่ยนฉาก, และ ชีทคิวเพลงแบบวินาทีต่อวินาที นั่นคือรูปร่างของงาน แบนเนอร์อนิเมะนัวร์ที่มีเงารูปคนบนรถไฟใต้ดิน MiniMax H3 ซีเควนซ์ไตเติ้ลนัวร์ทางการ: MIDNIGHT LINE พร้อมเครดิต STARRING ที่สะอาด

ดูเครดิตในคลิปนั้น MIDNIGHT LINE, STARRING, MAYA CROSS, REN KATO, LENA WARD, DIRECTED BY NOAH VOSS สะกดถูกต้อง, ไม่มีตำแหน่งงานซ้ำ, ตกแต่งคาตาคานะอยู่ที่ที่ขอให้อยู่ พรอมต์ไม่ได้บอกว่า "ทำไตเติ้ลดีๆ" มันบอกว่าไม่ซ้ำ, ไม่สะกดผิด, ไม่มีภาษาจีน, และตั้งชื่อสุนทรียภาพห้าวิธีที่แตกต่างกัน แผงอ้างอิงสไตล์นัวร์ภาพยนตร์ห้าแผงที่มีตัวละครเงาในสีน้ำเงินและส้ม บอร์ดอ้างอิงสไตล์ห้าบอร์ดที่ส่งไปให้ MiniMax H3 พร้อมกับพรอมต์ไตเติ้ลนัวร์

บอร์ดทั้งห้านั้นเข้าไปกับข้อความ ห้าภาพบวกหนึ่งสรุปสั้นๆ ยาว, หนึ่งเจเนอเรชัน นั่นคือสิ่งที่งานนี้ดูเหมือนตอนนี้

และเหตุผลที่พรอมต์จำนวนมากจาก 45 ตัวนั้นสั้นก็อยู่ในภาพนั้น ตลอดทั้งชุด ค่ามัธยฐานของพรอมต์อยู่ที่ประมาณ 130 ตัวอักษรจีน แต่สองตัวที่ยาวที่สุดยาว 657 และ 858 ตัวที่สั้นนั้นสั้นเพราะบอร์ดอ้างอิงกำลังรับคำอธิบาย ตัวที่ยาวนั้นยาวเพราะไม่มีอะไรอื่นที่จะรับมันได้

ทำไมพรอมต์ MiniMax H3 ส่วนใหญ่ออกมาแบน และวิธีแก้ไขข้อความที่อ่านไม่ออก

สามสิ่งที่ผิดพลาด และทั้งหมดคือการขาดหายไปมากกว่าความผิดพลาด

ไม่มีไทม์ไลน์ คุณขอลิบวินาทีและอธิบายช่วงเวลาหนึ่ง คุณก็จะได้การดันเข้าช้าๆ หนึ่งครั้งที่ยืดเยื้อเกินสิบวินาที โมเดลไม่มีอะไรจะทำในวินาทีที่เจ็ด

ไม่มีบล็อกเสียง เสียงถูกสร้างในพาสเดียวกับภาพ ถ้าคุณไม่พูดอะไร โมเดลก็ยังส่งแทร็กให้คุณ มันแค่เลือกอันหนึ่ง

ไม่มีรายการเชิงลบ ปล่อยไว้ตามลำพัง โมเดลจะเลือกใช้การละลายนุ่มนวล, ประดิษฐ์ข้อความบนหน้าจอเพิ่ม, และเพิ่มแถบคำบรรยายที่ไม่มีใครขอ

หลักฐานที่ชัดเจนที่สุดคือพรอมต์ UI เกมทางการ ซึ่งสร้างจากจังหวะที่ประทับเวลา 6 จังหวะ: [0s-2s] เมนู, [2s-4s] แผงแขนขวา, [4s-7s] กริดอาวุธ, [7s-8.5s] ยืนยัน, [8.5s-10s] แถบโหลด, [10s-15s] โลกโหลดเข้ามา คลิปที่เสร็จแล้วตีทั้งหก ตามลำดับ, ตรงเวลา เมนูเกมที่แสดงการเลือกแขน Phantom Grip หุ่นยนต์ คลิป UI เกม MiniMax H3: เมนู, แผงอุปกรณ์, แถบโหลด, โลกโหลด

ตอนนี้ครึ่งที่ซื่อสัตย์ จากคลิปเดียวกัน ที่ความละเอียด 2560x1440 เต็ม การเปรียบเทียบข้อความ UI เกมที่อ่านได้และข้อความ AI ที่อ่านไม่ออก ซ้าย: ข้อความที่สะกดในพรอมต์แสดงผลอย่างสะอาด ขวา: ข้อความที่ไม่ได้สะกดแสดงผลเป็น noise ที่มีรูปร่างเหมือนตัวอักษร

ทางซ้าย ทุกสตริงที่พรอมต์พิมพ์ออกมาจริง: RIGHT ARM EQUIPMENT, PHANTOM GRIP, CHRONOS CLAW กรอบ, ถูกต้อง, เคอร์นิ่งเหมือนเมนูเกมจริง

ทางขวา HUD ในช็อตถนนสุดท้าย ซึ่งพรอมต์เรียกเพียง "องค์ประกอบ HUD" มันอ่านว่า ETR METNO CITFEP เหนือไอคอนอุปกรณ์ ที่พรอมต์ไม่ได้พูดอะไร คุณจะได้ MNALEαIN IAMG นั่นไม่ใช่บั๊กการเรนเดอร์ โมเดลกำลังวาด พื้นผิว ของภาษาอังกฤษเพราะมันไม่เคยได้รับสตริง

ดังนั้นวิธีแก้ไขไม่ใช่การตั้งค่า มันเป็นนิสัย:

ถ้าคำต้องอ่านได้, ให้พิมพ์คำนั้น แล้วเพิ่มบรรทัดเชิงลบ: อย่าสะกดผิด, อย่าเพิ่มข้อความอื่น, อย่าเพิ่มคำบรรยาย

และนี่คือรูปร่างหกบล็อกที่พรอมต์ทางการที่แข็งแกร่งทุกตัวจะกลายเป็นร่วมกัน

บล็อกสิ่งที่ใส่เข้าไปตัวอย่างจากพรอมต์ทางการข้ามไปแล้วคุณจะได้
1. สัญญาสไตล์สื่อ, พื้นผิว, จานสี, ยุค, ลุคที่ต้องไม่สูญเสีย"การ์ดไตเติ้ลอนิเมะญี่ปุ่นย้อนยุค, ภาพเงาแข็งๆ, คอลลาจการ์ตูน, บล็อกสีเรขาคณิตแข็งแรง"การเรนเดอร์มันเงาทั่วไปที่ล่องลอยไปในวินาทีที่หก
2. ไทม์ไลน์ชิ้นเวลาจริงพร้อมการกระทำในแต่ละชิ้น[2s-4s] ซูมเรียบไปที่แขนขวาของเธอ แผง UI เลื่อนเข้ามาจากขวาหนึ่งไอเดียที่ยืดเยื้อตลอดระยะเวลาทั้งหมด
3. กล้องการเคลื่อนไหว หรือการปฏิเสธที่จะเคลื่อนไหวอย่างชัดเจน"ล็อค, ไวด์ช็อตนิ่ง, ไม่ดันเข้า, ไม่มีคัท"การดอลลี่ช้าๆ เริ่มต้นที่คุณไม่ได้ขอ
4. เสียงทุกเสียง, และเมื่อมันเข้ามา"ที่ 6 วินาทีแนวเบสแจ๊สเข้าร่วม, สองวินาทีสุดท้ายล็อคด้วยคอร์ดตึงเครียด"เสียงบรรยากาศห้องอะไรก็ได้ที่โมเดลชอบวันนี้
5. ข้อความ, สะกดออกมาสตริงตามตัวอักษร, ในเครื่องหมายคำพูด"THIS IS FINE." / CONFIRM CONFIGnoise ที่มีรูปร่างเหมือนตัวอักษร ดังข้างบน
6. รายการเชิงลบการเปลี่ยนฉาก, วัตถุและสิ่งที่ซ้ำซากที่จะปฏิเสธ"ไม่มีการละลายนุ่มนวล, ไม่มีการเปลี่ยนฉากลื่นไหล, อย่าเพิ่มภาษาจีน, อย่าซ้ำตำแหน่งงาน"การละลายนุ่มนวล, ข้อความที่ประดิษฐ์ขึ้น, การล่องลอยแปลกประหลาด

บล็อก 5 และ 6 นั้นฟรี ไม่มีค่าใช้จ่ายเพิ่มเติมในการสร้าง และเป็นที่ที่คุณภาพส่วนใหญ่อยู่

เวิร์กโฟลว์พรอมต์ MiniMax H3: เอนด์พอยต์ที่พรอมต์ของคุณอยู่

คีย์เดียวกัน, รูปร่าง submit-and-poll เดียวกัน, สามประตู ตัวที่คุณเลือกจะตัดสินว่าพรอมต์ของคุณยังต้องทำอะไรอีก

เอนด์พอยต์สิ่งที่คุณยื่นให้มันสิ่งที่มันล็อคให้คุณพารามิเตอร์ที่ควรรู้ใช้เมื่อการเรียกเก็บเงิน
minimax/h3/text-to-videoพรอมต์เท่านั้นไม่มีอะไร. ข้อความรับทุกอย่างduration 5-10 (default 8), resolution 2K, ratio ต้องตั้งค่าอย่างชัดเจนทดสอบลุคหรือการออกแบบเสียงก่อนที่จะ commitคิดตามวินาทีของเอาต์พุต, อัตราปัจจุบันบนหน้าโมเดล
minimax/h3/image-to-videoพรอมต์ + ภาพ (เฟรมแรก), end_image ไม่บังคับที่คลิปเริ่มต้น, และตัวเลือกว่าที่มันจะลงจอดend_image, duration 5-10 (default 8), ratio adaptive โดยค่าเริ่มต้นคุณมีงานศิลปะและคุณต้องการให้มันเคลื่อนไหวโดยไม่ต้องวาดใหม่คิดตามวินาทีของเอาต์พุต
minimax/h3/reference-to-videoพรอมต์ + refers[]เอกลักษณ์ของตัวแบบและสไตล์, ข้ามฉากที่คุณสร้างrefers[] mixed array, duration 5-15, ratio สูงถึง 21:9ตัวละครหรือผลิตภัณฑ์เดียวกัน, สภาพแวดล้อมใหม่คิดตามวินาทีของเอาต์พุต

refers[] คือตัวที่ถูกบันทึกน้อยเกินไปในโลกจริง ดังนั้นนี่คือรูปร่างที่มันต้องการ:

json
1"refers": [
2  { "url": "https://.../subject.png", "type": "image" },
3  { "url": "https://.../style-board.png" },
4  { "url": "https://.../motion-ref.mp4", "type": "video" },
5  { "url": "https://.../beat.mp3",       "type": "audio" }
6]
7

สี่กฎที่แต่ละข้อจะช่วยคุณประหยัดการสร้างที่สูญเปล่า:

  1. เสียงไม่สามารถอยู่คนเดียวได้ ต้องมีภาพหรือวิดีโออย่างน้อยหนึ่งตัวในอาร์เรย์ แทร็กบีทเพียงอย่างเดียวจะถูกปฏิเสธ
  2. type เป็นตัวเลือก มันถูกอนุมานจาก URL แต่ให้ระบุไว้เมื่อนามสกุลไม่ชัดเจน
  3. เพดานมีจริง สูงสุด 9 ภาพ, 3 วิดีโอและ 3 คลิปเสียง, รวม 12 ไฟล์ โดยวิดีโอและเสียงอ้างอิงมีความยาว 2 ถึง 15 วินาทีต่อตัว (เอกสาร MiniMax API, กรกฎาคม 2026)
  4. ให้ทุกการอ้างอิงมีงานภายในข้อความพรอมต์ นี่คือนิสัยที่มีเลเวอเรจสูงที่สุดในรายการนี้ พรอมต์ทางการเปิดด้วยบรรทัดเช่น "ภาพที่ 1 คือการอ้างอิงอารมณ์และสไตล์โดยรวม, ภาพที่ 2 คือการอ้างอิงตัวละครนำ" ถ้าไม่มีประโยคนั้น โมเดลต้องเดาว่าบอร์ดไหนหมายถึงอะไร ข้อความสีดำขนาดใหญ่อ่านว่า BASS HITS เหนือผู้หญิงยิ้ม มิวสิควิดีโอ dark-pop MiniMax H3: ตัวพิมพ์ CUT BACK, ONE LOOK, DETONATE ผู้หญิงสามคนในแฟชั่นกรันจ์ข้างโปสเตอร์ตัวพิมพ์หนา บอร์ดอ้างอิงตัวพิมพ์สองบอร์ดที่อยู่เบื้องหลังคลิป dark-pop

คลิปนั้นคือข้อโต้แย้งสำหรับกฎข้อ 4 พรอมต์ของมันไม่เคยอธิบายรูปแบบตัวอักษรตัวเดียว มันบอกว่า "รูปแบบบรรจุภัณฑ์ข้อความและพื้นผิวอ้างอิงภาพ" และส่งสองบอร์ด เลย์เอาต์มาถึงเพราะมันถูกแสดง ไม่ได้ถูกอธิบาย

อีกหนึ่งตาราง เพราะการ์ดโมเดลและ API ไม่ได้พูดสิ่งเดียวกันในปัจจุบัน และช่องว่างนั้นคือที่ที่คนเสียเวลาช่วงบ่าย

สิ่งเอกสารของ MiniMax เองสิ่งที่เอนด์พอยต์ยอมรับจริงในปัจจุบันความหมายสำหรับพรอมต์ของคุณ
ระยะเวลา4 ถึง 15 วินาที, เฉพาะจำนวนเต็มtext-to-video และ image-to-video: 5 ถึง 10, ค่าเริ่มต้น 8. reference-to-video: 5 ถึง 15, ค่าเริ่มต้น 8รายการช็อต 15 วินาทีเหมาะกับ reference-to-video เท่านั้นในตอนนี้ เขียนบอร์ดที่ยาวขึ้นใหม่เป็น 10
ความละเอียด2Kresolution ค่าเริ่มต้นเป็น 2K, และ 2K คือค่าเดียวที่รันได้ในปัจจุบัน งาน 768p จะกลับมาพร้อมข้อความ โมเดล MiniMax-H3 ไม่รองรับความละเอียด 768P, ความละเอียดที่รองรับ: 2K, แม้ว่า 768p จะปรากฏในตารางราคาเขียนสำหรับด้านสั้น 1440px รายละเอียดที่คุณขอจะอยู่รอดจริง
อัตราส่วนภาพอัตราส่วนทั่วไปหรือ adaptiveimage-to-video และ reference-to-video ค่าเริ่มต้นเป็น adaptive ข้อความอย่างเดียวปฏิเสธ adaptive และส่งคืนชุดที่อนุญาต: 16:9, 4:3, 1:1, 3:4, 9:16, 21:9บน text-to-video, ตั้งค่า ratio อย่างชัดเจนหรืองานจะล้มเหลวในการตรวจสอบ
การอ้างอิงแบบผสม9 ภาพ, 3 วิดีโอ, 3 เสียง, 12 ไฟล์, เสียงไม่เคยอยู่คนเดียวrefers[] รับ {url, type} พร้อม image, video หรือ audio, อย่างน้อยหนึ่ง image หรือ videoคุณสามารถซิงค์การเคลื่อนไหวกับบีทที่ให้มาได้จริงๆ คุณแค่ไม่สามารถให้แค่บีทเท่านั้น
เสียงเนทีฟเสียงสเตอริโอในพาสเดียวกันทุกคลิปทางการเก้าตัวที่ฉันตรวจสอบ: 2560x1440, 24fps, AAC สเตอริโอที่ 32kHzบล็อกเสียงไม่ใช่ของตกแต่ง มันคือครึ่งหนึ่งของสิ่งที่ส่งมอบ

ทุกอย่างข้างต้นรันบน Atlas Cloud ซึ่งทั้งสามเอนด์พอยต์ H3 อยู่หลังคีย์เดียวและลูป submit-and-poll เดียวกัน ดังนั้นการสลับระหว่างพวกมันคือการเปลี่ยนสตริงโมเดลและไม่มีอะไรอื่น

บทแนะนำพรอมต์ MiniMax H3: จุดไฟเผาสุนัข This Is Fine พร้อมเสียง

นี่คือทั้งหมดตั้งแต่ต้นจนจบ มุกนี้ใช้ได้เพราะสุนัขไม่ทำอะไรเลย ยืดการปฏิเสธนั้นเป็นสิบวินาทีของเวลาจริง, เพิ่มไฟจริง, และปล่อยให้สองวินาทีสุดท้ายไปที่ที่การ์ตูนต้นฉบับไปจริงๆ และมันจะตลกขึ้นและแย่ลงเล็กน้อยสำหรับคุณ คนส่วนใหญ่เคยเห็นแค่สองแผงแรกเท่านั้น

ขั้นตอนที่ 1: ดาวน์โหลดการ์ตูนต้นฉบับ อย่าให้ AI วาดใหม่

สตริปมีหกแผง สองคอลัมน์สามแถว 600x887 เราต้องการแค่แผงที่ 2 และแผงที่ 6

bash
1curl -L -o gunshow-648.png https://gunshowcomic.com/comics/20130109.png
2# 600x887, 6 panels, 2 cols x 3 rows
3
4# crop panel 2 (the "THIS IS FINE." panel):  x 302-584, y 20-293
5# crop panel 6 (the melting dog):            x 302-584, y 595-868
6# upscale each 4x with Lanczos  ->  1128x1092
7

พูดให้ชัดเจน: อย่าขอให้โมเดลภาพวาด "สุนัขที่ดูเหมือน This Is Fine" การสร้างใหม่โดย AI จะถูกจับได้ว่าเป็นของปลอมในครึ่งวินาทีและมุกจะตายทันที สีน้ำ, ตัวอักษรเขียนมือสั่นๆ และเม็ดกระดาษคือสัญญาทั้งหมด การ upscale 4x ด้วย Lanczos มีไว้เพราะแหล่ง 282px นั้นบาง มันให้พิกเซลจริงแก่โมเดลเพื่อยึดโดยไม่ต้องประดิษฐ์อะไร สองแผงของสุนัข This is Fine ที่ละลายในไฟ แผงที่ 2 และแผงที่ 6 ของการ์ตูนต้นฉบับ ติดป้ายเป็นอินพุตเฟรมแรกและภาพสิ้นสุด

ขั้นตอนที่ 2: รันบน image-to-video พร้อม end_image

โมเดล: minimax/h3/image-to-video การตั้งค่า: resolution 2K, image = แผง 2, end_image = แผง 6, ratio 1:1 เพื่อให้ตรงกับแหล่งที่มาเป็นสี่เหลี่ยมจัตุรัส ตั้งค่า duration เป็น 10; แถบเลื่อนอยู่ที่ 8 โดยค่าเริ่มต้น ให้ลากมัน

text
1ภาพวาดการ์ตูนเว็บ 2D วาดด้วยมือ, ถูกทำให้มีชีวิต. รักษาพื้นผิวสีน้ำต้นฉบับ,
2โครงสร้างเส้นหมึกที่มองเห็นได้, เม็ดกระดาษที่ลงทะเบียนไม่ตรง และจานสีการ์ตูนแบน
3ในทุกเฟรม. อย่าทำให้เรียบ, อย่าเรนเดอร์ใหม่เป็น 3D, อย่าทำความสะอาดเส้น,
4อย่าเพิ่มวัตถุใหม่, อย่าเพิ่มข้อความใหม่.
5
6[0s-3s] แทบไม่มีอะไรเคลื่อนไหว. สุนัขนั่งนิ่งสนิท, ถือแก้วไว้,
7จ้องตรงไปข้างหน้า. มีเพียงเปลวไฟด้านหลังที่เคลื่อนไหว: เลียสีส้มช้าๆ ปีน
8กำแพง, ถ่านลอยขึ้นหนึ่งชิ้น. ฟองคำพูดที่อ่านว่า "THIS IS FINE."
9อยู่ที่เดิมทุกประการ, อ่านได้เต็ม, ไม่เปลี่ยนแปลง, เขียนด้วยมือ.
10
11[3s-6s] สุนัขยกแก้วขึ้นและจิบเล็กน้อยหนึ่งครั้งอย่างสงบ. ฟองคำพูด
12จางหายไปหลังจากจิบ. ไฟสว่างขึ้น. กำแพงด้านหลังเริ่มบิดเบี้ยว
13ด้วยความร้อน. หมวกของเขาเริ่มไหม้ที่ขอบ.
14
15[6s-8.5s] ความร้อนมาถึงเขา. หูของเขาหย่อน, โครงร่างของเขาอ่อนตัวลงและเริ่ม
16ไหลลงมาเหมือนสีเปียก. เขายังคงไม่ขยับตา. แก้วยังคงอยู่ใน
17อุ้งเท้าของเขา.
18
19[8.5s-10s] ละลายเต็มที่. ใบหน้าบิดเบี้ยว, ตาข้างหนึ่งเลื่อน, ฟันเผยออกในรอยยิ้ม
20ที่ตรึง, ขนกลายเป็นสีแดงและส้ม. เขาคงท่าไว้. ค้างไว้ที่เฟรมสุดท้าย
21เป็นเวลาครึ่งวินาทีสุดท้าย.
22
23กล้อง: ล็อค, ไวด์ช็อตนิ่งเดียว, ไม่ดันเข้า, ไม่ถือด้วยมือ, ไม่มีคัท.
24เฟรมไม่เคยเคลื่อนไหว. นี่คือเทคต่อเนื่องเทคเดียวภายในแผงการ์ตูนแผงเดียว.
25
26เสียง: เสียงบรรยากาศของไฟภายในตลอด - เสียงแตกเบา, เสียงป๊อปเป็นครั้งคราวของ
27ไม้ไหม้, เสียงโครงสร้างดังเอี๊ยดเบาๆ. ที่ 3s, แก้วเซรามิกหนึ่งใบสัมผัสฟันและ
28การกลืนเล็กน้อย. เสียงผู้ชายที่สงบ, แบน, ไม่รำคาญพูดว่า: "This is fine."
29- ไร้อารมณ์, ไม่มี emotion, ผ่อนคลายเกินไปเล็กน้อย. ตั้งแต่ 6s เสียงแตกดังขึ้น
30และเสียงบรรยากาศห้องหนาขึ้น; สองวินาทีสุดท้ายเพิ่มเสียงซับเบสต่ำ. ไม่มีดนตรี,
31ไม่มีแทร็กเสียงหัวเราะ, ไม่มีเอฟเฟกต์เสียงที่ไม่ได้อยู่ในรายการนี้.
32
33อย่าเพิ่มคำบรรยาย. อย่าเพิ่มลายน้ำ. อย่าสะกดคำอื่นใดนอกจาก
34คำที่อยู่ในภาพแล้ว. อย่าเปลี่ยน "THIS IS FINE." อย่าตัดออกไป.
35

พรอมต์นั้นคือตารางโครงสร้างที่มีชีวิต ย่อหน้าแรกคือสัญญาสไตล์ สี่ชิ้นที่ถูกวงเล็บคือไทม์ไลน์ จากนั้นกล้อง, จากนั้นเสียง, จากนั้นรายการเชิงลบ ไม่มีอะไรในนั้นเป็นของตกแต่ง ภาพหน้าจอของเครื่องสร้างวิดีโอ AI ที่แสดงมีม This is fine MiniMax H3 image-to-video บน Atlas Cloud: โหลดเฟรมแรกและภาพสิ้นสุด, 10 วินาทีที่ 2K, คลิปที่เสร็จแล้วในแผงเอาต์พุต

ขั้นตอนที่ 3: อ่านเอาต์พุตเหมือนการตรวจสอบ QA

สี่การตรวจสอบ, แต่ละอันทดสอบบล็อกที่แตกต่างกันของพรอมต์

  1. THIS IS FINE. ในฟองอากาศยังอ่านได้และสะกดถูกหรือไม่? นั่นทดสอบบล็อก 5
  2. โครงสร้างเส้นอยู่รอดหรือมีบางอย่าง "ปรับปรุง" มันให้กลายเป็น 3D ที่สะอาดหรือไม่? นั่นทดสอบบล็อก 1
  3. เสียงมีเฉพาะเสียงที่คุณระบุหรือไม่? ตรวจสอบคอนเทนเนอร์: มันควรกลับมาเป็น h264 บวก AAC สเตอริโอ
  4. เฟรมสุดท้ายลงจอดที่ท่าของแผง 6 หรือไม่? นั่นทดสอบ end_image
bash
1ffprobe -v error -show_entries stream=codec_type,codec_name,width,height,r_frame_rate,channels,sample_rate \
2        -of default=noprint_wrappers=1 output.mp4
3

ของฉันกลับมาที่ 1472x1440, 24fps, h264 บวก AAC สเตอริโอ, 10.13 วินาที น่าสังเกต: ฉันขอ ratio: 1:1 และได้ 1472x1440 ดังนั้นบน image-to-video รูปร่างของเฟรมต้นฉบับชนะ จับคู่สองแผงของคุณกับรูปร่างที่คุณต้องการจริงๆ สุนัขการ์ตูนพูดว่า this is fine แล้วละลายในไฟ สี่เฟรมจากคลิปที่เสร็จแล้วที่ 0s, 3s, 6.5s และ 10s, ตรงกับสี่ชิ้นเวลาในพรอมต์

ขั้นตอนที่ 4: ย้ายสุนัขไปที่ใหม่ด้วย reference-to-video

ตัวละครเดียวกัน, ห้องใหม่. โมเดล: minimax/h3/reference-to-video การตั้งค่า: refers[] = แผง 2 เป็น image, duration 8, resolution 2K, ratio 16:9.

text
1ภาพที่ 1 คือการอ้างอิงตัวละครและสไตล์ศิลปะ: คงลุคการ์ตูนเว็บ 2D วาดด้วยมือนี้ไว้,
2พื้นผิวสีน้ำเดียวกัน, น้ำหนักโครงร่างหมึกเดียวกัน, สุนัขตัวเดียวกัน,
3หมวกใบเล็กเดียวกัน, แก้วใบเดียวกัน. อย่าวาดเขาใหม่ใน 3D, อย่าเปลี่ยน
4สัดส่วนของเขา, อย่าทำความสะอาดเส้น.
5
6วางเขาในห้องที่แตกต่างกันและคงความสงบของเขาไว้. สำนักงานเปิดโล่งคับแคบในเวลากลางคืน,
7หลอดฟลูออเรสเซนต์กะพริบ, กำแพงจอภาพทั้งหมดแสดงสถานะข้อผิดพลาดสีแดง,
8กระดาษเครื่องพิมพ์ลอยลงมาผ่านเฟรม, ไฟไหม้ไฟฟ้าเล็กๆ ที่มุม. เขานั่งในเก้าอี้สำนักงาน
9ที่กึ่งกลางเฟรม, แก้วในอุ้งเท้า, มองตรงไปที่กล้อง, ผ่อนคลายอย่างสมบูรณ์.
10
11กล้อง: ล็อค, ไวด์ช็อตนิ่ง. ไม่ดันเข้า, ไม่มีคัท.
12
13เสียง: เสียงฮัมฟลูออเรสเซนต์, เสียงเครื่องพิมพ์บด, เสียงเตือนนุ่มๆ ซ้ำทุกสอง
14วินาที, เสียงแตกไฟฟ้าระยะไกล, จิบสงบหนึ่งครั้งที่ 4s. ไม่มีดนตรี. ไม่มีเสียง.
15
16อย่าเพิ่มข้อความบนหน้าจอใดๆ. อย่าเพิ่มคำบรรยาย. อย่าเพิ่มตัวละครอื่นๆ.
17

กฎที่สามารถถ่ายโอนได้: refers[] รับเอกลักษณ์และสไตล์, ข้อความรับฉาก การแบ่งแยกนั้นคือเคล็ดลับทั้งหมดสำหรับความสม่ำเสมอของตัวละคร และเป็นเหตุผลที่บรรทัดแรกของพรอมต์มีอยู่ ลองดู: "สุนัขการ์ตูนถือแก้วกาแฟท่ามกลางหน้าจอสีแดงและเครื่องพิมพ์ที่กำลังไหม้ สุนัขการ์ตูนเว็บตัวเดียวกันย้ายไปที่สำนักงานเปิดโล่งที่กำลังไหม้ในเวลากลางคืน สร้างโดย MiniMax H3 reference-to-video

หมวกใบเดียวกัน, แก้วใบเดียวกัน, น้ำหนักหมึกเดียวกัน, ห้องใหม่ ภาพอ้างอิงภาพเดียวทำทั้งหมดนั้น

รูปแบบพรอมต์ MiniMax H3 อีกสามแบบที่ควรขโมย

รูปแบบที่ 1: โปสเตอร์เคลื่อนไหว ที่เลย์เอาต์ต้องไม่เคลื่อนไหว ตัวละครการ์ตูนวิ่งไปข้างหน้าบนพื้นหลังสีชมพูทึบ โปสเตอร์เคลื่อนไหว MiniMax H3: เลย์เอาต์ POPUP! เคลื่อนไหวในขณะที่เฟรมและตัวพิมพ์ถูกล็อค เด็กผู้ชายการ์ตูนในฮู้ดมอนสเตอร์สีชมพูยื่นออกไปด้วยกรงเล็บยักษ์ โปสเตอร์นิ่งต้นฉบับที่ส่งให้ MiniMax H3

พรอมต์ทั้งหมดคือสองบรรทัด: คงกรอบสีขาวของแกลเลอรี, กรอบด้านใน, จานสีแดง-ขาว-ดำ, ความรู้สึกฟิกเกอร์ 3D และโครงสร้างเลย์เอาต์ที่ไม่เปลี่ยนแปลง และใส่เอฟเฟกต์เสียงคล่องแคล่วภายใต้การเข้ามาของข้อความ กฎ: ตั้งชื่อส่วนที่ต้องอยู่รอด "คงเลย์เอาต์" ไม่ใช่หมายเหตุสไตล์ มันคือข้อจำกัด และโมเดลปฏิบัติต่อมันเช่นนั้น

รูปแบบที่ 2: เดโมอินเทอร์เฟซ ที่คำกริยาชนะคำคุณศัพท์ รองเท้าวิ่ง Nike ZoomX สีเขียวมิ้นต์กับพื้นรองเท้าสีชมพูเกรเดียนท์ เดโมหน้า Landing Page MiniMax H3: เลื่อน, โฮเวอร์, การกลับสีบนหน้า Product รองเท้าวิ่ง Nike สีฟ้าอ่อนกับสีเขียวและชมพู ภาพอ้างอิงผลิตภัณฑ์ภาพเดียวที่อยู่เบื้องหลังคลิปหน้า Landing Page

พรอมต์นั้นขอให้เลื่อนหน้าลง, สถานะโฮเวอร์, การขยายที่แข็งแรงและการกลับสี สี่คำกริยา มันไม่เคยพูดว่า "ทันสมัย" หรือ "เรียบหรู" ปฏิสัมพันธ์คือการกระทำ ดังนั้นเขียนมันเป็นการกระทำ ตัวเอียงขนาดใหญ่และพื้นหลังทอลายคาร์บอนมาจากคำคุณศัพท์; สิ่งที่ทำให้มันอ่านเป็นหน้าจริงมาจากคำกริยา

รูปแบบที่ 3: ไลฟ์แอคชั่นผสมวาดมือ, ยึดไว้ด้วยกันด้วยการปฏิเสธ ต้นกล้าเรืองแสงสีเขียวเคลื่อนไหวเติบโตในมือที่เปิด คลิป MiniMax H3 ที่รวมฟุตเทจครัวที่ถ่ายด้วยมือถือกับสิ่งมีชีวิตเรืองแสงวาดด้วยมือ

อันนี้คือห้องครัวยามเย็นที่ถ่ายด้วยมือถือที่มีสิ่งมีชีวิตเรืองแสงวาดมือเล็กๆ อยู่ในนั้น และเหตุผลที่มันยังคงน่ารักแทนที่จะกลายเป็นหนังสั้นสยองขวัญคือรายการข้อห้าม: ไม่มีตาโต, ไม่มีปากแหว่ง, ไม่มีเขี้ยว, ไม่มีท่าทางคุกคาม, ไม่พุ่งเข้าใส่, ไม่มีคัทดำกะทันหัน, ไม่มีจัมป์สแกร์ รายการเชิงลบคือการควบคุมสไตล์หลัก ไม่ใช่ patch นอกจากนี้ยังเป็นที่ที่คุณเข้ารหัสรสนิยม สี่แผงแสดงผู้หญิงในอุโมงค์มืดพร้อมข้อความ สี่เฟรมจากตัวอย่างภาพยนตร์ไซไฟทางการ: THE STARS WERE LISTENING โปสเตอร์สำหรับ The Stars Were Listening และแผ่นออกแบบตัวละคร บอร์ดอารมณ์และการอ้างอิงตัวละครที่อยู่เบื้องหลังตัวอย่าง

ตัวอย่างด้านบนปิดลูปทั้งสองแนวคิด พรอมต์สะกดชื่อหนึ่งชื่อ THE STARS WERE LISTENING ในรายละเอียด: แคบมาก, หนา, ตัวพิมพ์ใหญ่ทั้งหมด, สีแดงเข้มผสมสนิม, เม็ดเล็กน้อยและขอบหมอก อันนั้นกลับมาตรงตามที่สั่งทุกประการ บอร์ดอ้างอิงสองบอร์ดจัดการอารมณ์และตัวนำ ดังนั้นข้อความไม่ต้องอธิบายใบหน้า การแบ่งงาน, ลงไปจนถึงจุดสิ้นสุด

ค่าใช้จ่ายในการรันพรอมต์ MiniMax H3 เหล่านี้

H3 คิดค่าใช้จ่ายต่อวินาทีของวิดีโอที่สร้าง, ตามความละเอียด ดังนั้นโมเดลค่าใช้จ่ายนั้นน่าเบื่ออย่างน่าชื่นชม: เทค 15 วินาทีมีค่าใช้จ่ายประมาณสามเทค 5 วินาที ทุกอย่างอื่นดำเนินตามนั้น

  • ทำซ้ำที่ 5 วินาที, ส่งมอบที่ 10 หรือ 15 องค์ประกอบ, จานสีและการออกแบบเสียงทั้งหมดแก้ไขได้ที่ 5 ไม่มีอะไรเกี่ยวกับช็อตล็อคที่ต้องการระยะเวลาเต็มเพื่อบอกคุณว่ามันผิด
  • end_image เป็นเครื่องมือด้านต้นทุน ไม่ใช่แค่เครื่องมือสร้างสรรค์ การรันซ้ำส่วนใหญ่เกิดขึ้นเพราะตอนจบล่องลอย การปักหมุดเฟรมสุดท้ายจะลบโหมดความล้มเหลวนั้นก่อนที่คุณจะจ่ายเงิน
  • รายการเชิงลบและข้อความที่สะกดออกมาฟรี พวกเขาเพิ่มตัวอักษรให้กับพรอมต์ที่คิดค่าใช้จ่ายตามวินาที ไม่ใช่ token ใช้พวกมันอย่างหนัก
  • จับคู่ duration กับเอนด์พอยต์ก่อนที่คุณจะเขียน การสร้างรายการช็อต 15 วินาทีแล้วค้นพบว่าเอนด์พอยต์ของคุณจำกัดที่ 10 ทำให้คุณต้องเขียนใหม่ ไม่ใช่แค่รันใหม่

สิ่งหนึ่งที่ยังไม่ควรวางแผนรอบ ๆ: ตารางราคาแสดงระดับ 768p ที่ถูกกว่า แต่ ณ เวลาที่เขียนนี้ งาน 768p ถูกปฏิเสธทันทีและ 2K เป็นความละเอียดเดียวที่รัน งบประมาณราวกับว่าทุกวินาทีเป็นวินาที 2K อัตราต่อวินาทีปัจจุบันอยู่บน หน้าโมเดล ซึ่งเป็นที่ที่ระดับ 768p จะปรากฏขึ้นเมื่อเปิด

พรอมต์ MiniMax H3, มีมและลิขสิทธิ์

สุนัขไม่ใช่สาธารณสมบัติ This Is Fine มาจากเว็บการ์ตูน Gunshow #648 ของ KC Green ที่เผยแพร่เมื่อวันที่ 9 มกราคม 2013 และมีเพียงสองแผงแรกเท่านั้นที่กลายเป็นไวรัล (Know Your Meme, มกราคม 2013) Green ได้พูดต่อสาธารณะ และค่อนข้างเหนื่อยหน่าย เกี่ยวกับการดูภาพถูกใช้ซ้ำแล้วซ้ำอีก รวมถึงโดยคนที่เขาไม่ได้แบ่งปันการเมืองด้วย (NPR, มกราคม 2023)

คำแนะนำนี้คือความคิดเห็นและการสอน ไม่ใช่คลังสต็อก หากคุณต้องการส่งสินค้าในเชิงพาณิชย์ ให้วาดเฟรมของคุณเองหรือได้รับอนุญาตสำหรับสิ่งที่คุณใช้ และตรวจสอบนโยบายของคุณเองก่อนงานลูกค้า: H3 ใช้กฎเนื้อหากับคนจริงที่รู้จักและ IP ที่รู้จักกันดี และการค้นพบนั้นในระหว่างกำหนดเส้นตายไม่สนุก

คำถามที่พบบ่อย

MiniMax H3 สร้างเสียง หรือฉันเพิ่มทีหลัง?

พาสเดียวกัน ภาพและเสียงออกมาด้วยกัน ซึ่งเป็นเหตุผลที่ต้องเขียนเสียงลงในเนื้อหาพรอมต์แทนที่จะเพิ่มทีหลัง ให้บล็อก Audio: ของตัวเองและระบุเมื่อแต่ละเสียงเข้ามา ทุกคลิปทางการเก้าตัวที่ฉันตรวจสอบกลับมาเป็น AAC สเตอริโอที่ 32kHz พร้อมกับสตรีมวิดีโอ 2560x1440, 24fps

พรอมต์ MiniMax H3 ยาวได้เท่าไหร่?

สูงสุด 7,000 ตัวอักษร ตามเอกสารของ MiniMax ในทางปฏิบัติ ตัวอย่างทางการมีช่วงกว้าง โดยมีค่ามัธยฐานประมาณ 130 ตัวอักษรจีนและสองตัวที่ยาวที่สุดที่ 657 และ 858 พรอมต์สั้นทำงานได้ดีเมื่อมีภาพอ้างอิงที่ทำหน้าที่อธิบาย หากคุณไม่มีภาพอ้างอิง คาดว่าจะต้องเขียนรายการช็อต

ทำไมข้อความถึงออกมาเป็น noise ในวิดีโอ MiniMax H3 ของฉัน?

เพราะคุณไม่ได้พิมพ์มัน สตริงที่ปรากฏตามตัวอักษรในพรอมต์จะแสดงผลอย่างสะอาด; สิ่งที่คุณพูดถึงแบบทั่วไป ("องค์ประกอบ HUD", "ป้ายบางอัน") กลับมาเป็นพื้นผิวที่มีรูปร่างเหมือนตัวอักษร สะกดทุกคำที่ต้องอ่านได้ แล้วเพิ่ม อย่าสะกดผิด, อย่าเพิ่มข้อความอื่น, อย่าเพิ่มคำบรรยาย

พรอมต์ MiniMax H3 หนึ่งตัวสามารถใช้ภาพอ้างอิง, วิดีโอและคลิปเสียงได้กี่ตัว?

เก้าภาพ, สามวิดีโอและสามคลิปเสียง, รวมสิบสองไฟล์, โดยวิดีโอและเสียงอ้างอิงมีความยาวระหว่าง 2 ถึง 15 วินาทีต่อตัว เสียงไม่สามารถเป็นอ้างอิงเพียงอย่างเดียว โปรดทราบว่าความสามารถของโมเดลและสิ่งที่เอนด์พอยต์หนึ่งเปิดเผยนั้นเป็นสองสิ่งที่แตกต่างกัน ดังนั้นตรวจสอบหน้าโมเดลสำหรับรายการอินพุตปัจจุบัน

พรอมต์ MiniMax H3 สามารถควบคุมว่าคลิปจะจบอย่างไร ไม่ใช่แค่ว่ามันเริ่มต้นอย่างไร?

ได้ บน image-to-video ผ่านพารามิเตอร์ end_image ที่เป็นตัวเลือก ให้เฟรมแรกและเฟรมสุดท้าย แล้วคลิปจะ interpolate ระหว่างพวกมัน เดโมข้างต้นคือสิ่งนั้น: แผงการ์ตูน 2 เข้า, แผงการ์ตูน 6 ออก รักษาทั้งสองภาพให้มีอัตราส่วนภาพใกล้เคียงกันหรือการเปลี่ยนจะดูไม่ดี

ระยะเวลาและความละเอียดที่ฉันสามารถรับได้จริงในตอนนี้คืออะไร?

2K, และเท่านั้น งาน 768p ถูกปฏิเสธในปัจจุบันด้วย supported resolutions: 2K แม้ว่า 768p จะปรากฏในตารางราคา ระยะเวลาแตกต่างกันไปตามเอนด์พอยต์: text-to-video และ image-to-video รับ 5 ถึง 10 วินาทีโดยค่าเริ่มต้น 8 ในขณะที่ reference-to-video รับ 5 ถึง 15 ข้อสังเกตอีกอย่าง: ในการสร้างข้อความอย่างเดียว API ปฏิเสธ adaptive และต้องการ ratio ที่ชัดเจน

โมเดลล่าสุด

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด