Seedance 2.5 ใช้งานได้แล้ววันนี้ — ที่แรกบน Atlas Cloud

วิดีโอ ASMR MiniMax H3: ฉันผ่าผลทับทิมแก้ว จากนั้นวัดว่าระบบสเตอริโอเป็นของจริงหรือไม่

AI ASMR ส่วนใหญ่จะติดเสียงสต็อกเข้ากับวิดีโอที่ไม่มีเสียง วิดีโอ ASMR ของ MiniMax H3 เรนเดอร์เสียงสเตอริโอ 32 kHz ในครั้งเดียว ผมวัดช่องสัญญาณ พร้อมกับพรอมต์และต้นทุน

ใส่หูฟังก่อนที่จะเลื่อนไปยังคลิปด้านล่าง ในหมวดนี้มันสำคัญจริงๆ

มีดเล่มหนึ่งกำลังตัดผ่านผลทับทิมที่แกะสลักจากแก้วสีทับทิม เปลือกแตกออก เสียงร้าวแบบคริสตัล จากนั้นเมล็ดแก้วหลายสิบเมล็ดก็กลิ้งกระจายบนแผ่นหินชนวนเปียก นี่คือส่วนที่แตกต่างจากคลิป ASMR AI เกือบทั้งหมดที่คุณเลื่อนผ่านในปีนี้: ไม่มีใครเพิ่มเสียงนั้น ไม่มีคลังเสียง ไม่มีโปรแกรมตัดต่อ ไม่มีไทม์ไลน์ ภาพและเสียงออกมาจากการสร้างครั้งเดียว ในการเรียก API ครั้งเดียว

ตลอดปีที่ผ่านมา AI ASMR ดูน่าพึงพอใจแต่ฟังดูผิดแปลกไปเล็กน้อย และสาเหตุไม่ใช่ที่ภาพ มันคือขั้นตอนสุดท้ายของไปป์ไลน์ การติดเสียงเข้ากับคลิปที่ไม่มีเสียงเป็นงานที่ต้องทำด้วยมือ ทุกครั้ง หมวดหมู่เติบโตเร็วมากจนเกิดอุตสาหกรรมขนาดเล็กของเว็บไซต์สร้าง AI ASMR โดยเฉพาะขึ้นมาเพื่อทำให้การต่อเชื่อมนี้เป็นอัตโนมัติ โดยหนึ่งในนั้นโฆษณา "binaural 3D audio" บนหน้าแรกเสียด้วย ความต้องการได้รับการพิสูจน์มานานแล้ว แต่มันถูกตอบสนองด้วยการประกอบเข้าด้วยกัน

ดังนั้นผมจึงทำสิ่งนี้อย่างถูกต้อง หนึ่งเวิร์กโฟลว์ที่ทำซ้ำได้ หกคลิป จากนั้นส่วนที่ไม่มีใครในหมวดนี้เคยทำ: ผมแยกช่องสัญญาณซ้ายและขวาด้วย ffmpeg และวัดค่ามัน บางอย่างที่ผมคาดหวังกลับกลายเป็นผิด และนั่นกลายเป็นสิ่งที่มีประโยชน์ที่สุดในบทความนี้

ประเด็นสำคัญ

  • H3 เรนเดอร์ภาพ 24 fps และแทร็กเสียง AAC สเตอริโอ 32 kHz ในรอบเดียว เสียงถูกสร้างขึ้น ไม่ได้ถูกพากย์ทับทีหลัง
  • สเตอริโอเป็นสเตอริโอจริง ไม่ใช่ dual mono ที่แต่งตัวเป็นสเตอริโอ แต่ คุณไม่สามารถพรอมต์ให้แพนได้ ผมขอให้แพนจากซ้ายไปขวาอย่างชัดเจน แต่ได้ความแตกต่างแค่ 1.9 dB ซึ่งแทบไม่มีอะไร
  • ความกว้างของสเตอริโอ มาจากเนื้อหา ไม่ใช่จากคำที่คุณใช้ คลิปฝนที่ผมไม่ได้บอกทิศทางใดๆ เลย กลับมาพร้อมฟิลด์ที่กว้างจริงๆ
  • การล็อกเฟรมแรกทำให้ภาพคงที่ในทุกความละเอียด แต่ 768P และ 2K ยังคงเป็นสองเทคที่แตกต่างกัน ร่างจะแสดงตัวอย่างลักษณะภาพและสเปกเสียง ไม่ใช่การเคลื่อนไหวที่แน่นอน
  • คลิป 5 วินาทีที่ 768P คิดค่าใช้จ่าย $0.50 คลิปเดียวกันที่ 2K คิด $0.70 ทั้งบทความมีค่าใช้จ่าย $4.27

ฟังก่อน: วิดีโอ ASMR MiniMax H3 ตัดในครั้งเดียว

w7ZRR7bo3KI

ห้าวินาที, 2K, 24 fps, สเตอริโอ 32 kHz, สร้างครั้งเดียว, $0.70 เปิดเสียง: เสียงเสียดสีของคมมีดที่บาดเข้าไป, เสียงแตก, แล้วก็เมล็ด ไม่มีอะไรถูกเพิ่มทีหลัง สร้างด้วย minimax/h3/image-to-video

พรอมต์เดียว โมเดลเดียว การเรียกครั้งเดียว ทุกอย่างด้านล่างคือวิธีการสร้างคลิปนั้น ราคาเท่าไหร่ และส่วนใดของเรื่องราวทางการตลาดที่รอดเมื่อเจอกับรูปคลื่นเสียง

ทำไม AI ASMR ถึงระเบิด และทำไมส่วนใหญ่ถึงไม่ผ่านการทดสอบหูฟัง

เทรนด์นี้มีวันเกิด AI ASMR เริ่มแพร่กระจายในเดือนมิถุนายน 2025 ทันทีหลังจาก Veo 3 เปิดตัว และรูปแบบก็กลายเป็นไวรัลภายในไม่กี่วัน lava mukbang จาก @asmraiworks มียอดวิวกว่า 11.3 ล้านครั้งในหนึ่งสัปดาห์ คลิปตัดแก้วมียอด 5.3 ล้านครั้งในสิบเอ็ดวัน (Know Your Meme, 2025) สำนักข่าวนำมาเป็นเรื่องแปลกใหม่ โดยมีภาพเหนือจริงและลาวาหลอมที่กินด้วยตะเกียบเป็นตัวดึงดูดหลัก (The Express Tribune, 2025)

จากนั้นผู้คนก็ใส่หูฟัง และบรรยากาศก็เปลี่ยนไป นักเขียนของ TechRadar ดูคลิปไวรัลหลายคลิปแล้วออกมาบรรยายถึงความเทียม "ขาดความผิดพลาดและความไม่แม่นยำซึ่งเป็นลักษณะเด่นของ ASMR ที่มนุษย์สร้าง" (TechRadar, มิถุนายน 2025) แฟนๆ ที่ถูกอ้างถึงในบทความนั้นบอกว่าทริกเกอร์ tingles มีอยู่ทางเทคนิค แต่ก็ยังไม่เหมือนเดิม

มีเหตุผลทางกลไก และไม่ใช่เรื่องลึกลับ ASMR คือประเภทเนื้อหาที่ เนื้อหาคือเสียง ที่อื่นเสียงเป็นเครื่องปรุง ที่นี่เสียงคือผลิตภัณฑ์ และเวิร์กโฟลว์ที่โดดเด่นคือ:

  1. สร้างคลิปไม่มีเสียงด้วยโมเดลวิดีโอ
  2. หาเสียงจากคลังเสียง ไม่ว่าจะเป็นเสียงแตก เสียงกระทบ เสียงฝน
  3. จับคู่เสียงกับภาพในโปรแกรมตัดต่อ
  4. แพนและมิกซ์ด้วยมือถ้าคุณใส่ใจ ซึ่งแทบไม่มีใครทำเมื่อทำจำนวนมาก
  5. ส่งออก

ขั้นตอนที่ 3 คือจุดที่ล้มเหลว เสียงแตกที่เก็บไว้ซึ่งเล่นช้าไปสองเฟรมจะฟังดูปลอมก่อนที่คุณจะอธิบายได้ว่าทำไม คูณด้วยตารางการโพสต์รายวัน และข้อผิดพลาดก็ทวีคูณ เพราะการจัดตำแหน่งถูกทำใหม่โดยมนุษย์ทุกครั้ง

ช่องว่างนั้นคือเหตุผลที่มีอุตสาหกรรมขนาดย่อมของเว็บไซต์สร้าง AI ASMR เกิดขึ้น อย่างน้อยสามแห่งกำลังทำการตลาดอย่างแข็งขัน และหนึ่งในนั้นใช้ binaural 3D audio เป็นฟีเจอร์หลัก พวกเขาไม่ได้แก้ปัญหาที่ไม่มีอยู่จริง พวกเขากำลังปะรูจริง: โมเดลวิดีโอที่อยู่เบื้องหลังพวกเขาไม่ได้สร้างเสียง

ซึ่งทำให้การจัดอันดับหนึ่งรายการน่าสนใจ บนกระดานวิดีโอของ Artificial Analysis ที่ให้คะแนน พร้อมเสียง MiniMax H3 อยู่อันดับ #1 ด้วย 1,126 Elo นำหน้า Gemini Omni Flash ที่ 1,119 และห่างจาก Dreamina Seedance 2.0 ที่ 1,027 ประมาณร้อยคะแนน (Artificial Analysis, สิงหาคม 2026) บนกระดาน image-to-video ที่เสียงไม่ใช่ส่วนหนึ่งของคะแนน โมเดลหลายตัวนั้นอยู่ใกล้กันภายในไม่กี่คะแนน ช่องว่างเปิดขึ้นเมื่อเสียงมีความสำคัญ สำหรับ ASMR เสียงคือทุกสิ่ง

เวิร์กโฟลว์วิดีโอ ASMR MiniMax H3 และค่าใช้จ่ายในแต่ละขั้นตอน

สามเอนด์พอยต์ หนึ่งแท็บเบราว์เซอร์ ผมรันทุกอย่างในบทความนี้บน Atlas Cloud ดังนั้นตัวเลขทุกตัวด้านล่างมาจากบิลจริง ไม่ใช่จากอัตราที่ประกาศ

งานในบทความนี้โมเดลอัตรา
เฟรมแรกสำหรับคลิปหลักOpenAI GPT Image 2 (text-to-image)เริ่มต้น $0.009/ภาพ, คิดจริง $0.1745 ที่ high และ 2048x1152
ร่างและคลิปที่เก็บไว้MiniMax H3 Image-to-Video$0.10/วินาทีที่ 768P, $0.14/วินาทีที่ 2K
ป้อนการบันทึกจริงMiniMax H3 Reference-to-Videoสองระดับเดียวกัน
สามเทมเพลตMiniMax H3 Text-to-Videoสองระดับเดียวกัน
วิธีเก่า เฉพาะส่วนเสียงByteDance Seed Audio 1.0$0.143/นาที

รายการแสดง "From $0.1/SEC" บนเอนด์พอยต์ H3 ทั้งสาม นั่นคือราคาพื้นที่ 768P 2K คิด $0.14/วินาที และตัวเลขนั้นไม่ปรากฏที่ไหนยกเว้นในใบแจ้งหนี้ของคุณ ดังนั้นให้วางแผนตามระดับที่คุณร้องขอจริง

ตาราง 1: รอบเดียวเทียบกับไปป์ไลน์ที่ต่อกัน

 MiniMax H3, เสียงในตัวโมเดลไร้เสียงบวกเสียงทีหลัง
ขั้นตอนถึงคลิปที่เสร็จสมบูรณ์14 ถึง 5
เครื่องมือที่เกี่ยวข้อง1โมเดลวิดีโอ + คลังเสียง + โปรแกรมตัดต่อ + ส่งออก
ภาพและเสียงซิงค์กันอย่างไรรอบการสร้างเดียวกัน, ไทม์ไลน์เดียวกันคุณลากจนกว่าจะดูถูกต้อง
ใครเป็นคนมิกซ์และแพนไม่มีใคร คุณรับสิ่งที่โมเดลให้คุณ, ด้วยมือ, ต่อเสียง
เวลามนุษย์ต่อคลิปประมาณศูนย์หลังจากพรอมต์15 ถึง 40 นาที จริงๆ
ค่าใช้จ่ายคอมพิวเตอร์ต่อคลิป 5 วินาที$0.50 ที่ 768Pโมเดลวิดีโอ + $0.143/นาทีของการสร้างเสียง

ผมจงใจไม่ยกอัตราต่อวินาทีของแพลตฟอร์มวิดีโอคู่แข่ง เพราะคอมพิวเตอร์ไม่ใช่จุดที่แตกต่าง การสร้างเสียงคิด $0.143 ต่อนาที ซึ่งเป็นเพียงเศษสตางค์ ต้นทุนที่แท้จริงของไปป์ไลน์ที่ต่อกันคือเวลา 20 นาทีของมนุษย์ต่อคลิป และต้นทุนนั้นไม่ลดลงเมื่อคุณขยาย มันทวีคูณ บัญชีที่ไม่มีหน้าตาและโพสต์ทุกวันคือจุดที่ 20 นาทีต่อคลิปค่อยๆ กินโมเดลธุรกิจทั้งหมด

ข้อเสียที่ซื่อสัตย์: การต่อด้วยมือทำให้คุณควบคุมได้ คุณสามารถวางเสียงได้ทุกที่ในฟิลด์สเตอริโอและตัดให้ตรงกับเฟรม H3 ให้การซิงค์ฟรี และดังที่การวัดด้านล่างแสดง มันไม่ได้ให้การควบคุมนั้นกลับคืนมา

ตาราง 2: สามเอนด์พอยต์ H3 พารามิเตอร์ที่สำคัญจริงๆ

 image-to-videotext-to-videoreference-to-video
อินพุตหลักภาพ (เฟรมแรก)พรอมต์เท่านั้นrefers[]
ความละเอียด768P / 2K, ค่าเริ่มต้น 2Kเหมือนกันเหมือนกัน
ระยะเวลาจำนวนเต็มวินาทีใดๆ 4 ถึง 15, ค่าเริ่มต้น 8เหมือนกันเหมือนกัน
สัดส่วนกำหนดโดยเฟรมแรกต้องตั้งค่าอย่างชัดเจน, adaptive ถูกปฏิเสธกำหนดโดย references
ข้อจำกัดของ refersใช้ร่วมกับภาพไม่ได้ไม่ใช้สูงสุด 9 ภาพ, 3 วิดีโอ, 3 เสียง
เอาต์พุต 16:9 ที่ส่งมอบ1344x768 ที่ 768P, 2560x1440 ที่ 2Kเหมือนกันเหมือนกัน
แทร็กเสียงAAC สเตอริโอ 32 kHz เหนือวิดีโอ 24 fpsเหมือนกันเหมือนกัน

กับดักพารามิเตอร์สองอย่างที่ควรเขียนไว้บนมือของคุณ พารามิเตอร์คือ ratio ไม่ใช่ aspect_ratio และคีย์ที่ผิดจะทำให้มันไม่ถูกตั้งค่า ดังนั้น text-to-video จะปฏิเสธคำขอ และ image พร้อม refers ในการเรียกเดียวกันจะไม่เกิดข้อผิดพลาด: มันจะทำงานเสร็จ คิดเงินเต็มจำนวน และ silently โยนอินพุตหนึ่งในสองทิ้งไป

บทช่วยสอนวิดีโอ ASMR MiniMax H3: การตัดทับทิมแก้ว

การตัดผลไม้แก้วเป็นรูปแบบที่ทุกคนรู้จัก ดังนั้นผู้อ่านจะรู้ทันทีว่ากำลังดูอะไร แอปเปิ้ลแก้วและมะม่วงแก้วถูกทำจนเบื่อแล้ว ทับทิมดีกว่าด้วยเหตุผลเฉพาะอย่างหนึ่ง: เมื่อเปลือกแตก เมล็ดแก้วหลายร้อยเมล็ดจะหลุดออกมาและกลิ้ง ดังนั้นเสียงจึงมีระยะเวลาและโครงสร้าง แทนที่จะเป็นเสียงกระทบจุดเดียว ถ้าโมเดลกำลังปลอมเสียงของมัน การกระจายคือจุดที่มันจะเปิดโปง

ขั้นตอนที่ 1: สร้างเฟรมฐานด้วย GPT Image 2

ล็อกองค์ประกอบก่อนที่คุณจะใช้เงินกับวิดีโอ การตั้งค่า: quality: high, size: 2048x1152 (16:9), output_format: png

plaintext
1ภาพถ่ายมาโครระยะใกล้สุดของทับทิมทั้งลูกที่แกะสลักจากแก้วสีแดงทับทิมหนาทึบ วางบนแผ่นหินชนวนสีดำเปียก เปลือกแก้วหนา 8 มม. มีฟองอากาศภายในและเหลี่ยมที่บิ่นให้เห็น เมล็ดแก้วเล็กๆ นับร้อยเรืองแสงอยู่ข้างในเหมือนคริสตัลโกเมน มีดซานโตกุญี่ปุ่นขัดมันอยู่ที่ขอบซ้ายของเฟรม ปลายมีดแตะผิวแก้วเพียงเล็กน้อย แสงหลักแข็งจากด้านขวาบนสาดไปทั่วแผ่นหินและทำให้เกิดเงาสะท้อนสีแดงคมบนหินเปียก เลนส์มาโคร 100 มม., f/2.8, ระยะชัดตื้น, พื้นหลังมืดหม่น
2ไม่มีมือ, ไม่มีข้อความ, ไม่มีลายน้ำ, ไม่มีโลโก้

อินเทอร์เฟซเครื่องสร้างภาพ AI แสดงพรอมต์ข้อความและภาพที่สร้างขึ้น

สนามทดลอง GPT Image 2 บน Atlas Cloud โดยตั้งค่าคุณภาพเป็น high และขนาด 16:9 2048x1152 ทับทิมแก้วที่เรนเดอร์ในแผง OUTPUT

การรันจริง คุณภาพ high ที่ 2048x1152 และหน้าระบุ $0.1745 ซึ่งเป็นสิ่งที่ใบแจ้งหนี้บอกในภายหลังเช่นกัน

ใบมีดตัดทับทิมแก้วสีแดงโปร่งแสงบนหินสีเข้ม

เฟรมฐานที่สร้างขึ้น: ทับทิมที่แกะสลักจากแก้วทับทิมหนาบนหินชนวนสีดำเปียก มีดซานโตกุเข้ามาจากขอบซ้าย

เฟรมที่ส่งให้ H3 สร้างด้วย openai/gpt-image-2/text-to-image

ขั้นตอนที่ 2: เขียนส่วนเสียงของพรอมต์วิดีโอ ASMR MiniMax H3

คนส่วนใหญ่เขียนพรอมต์ ASMR เป็นคำอธิบายภาพโดยมีคำว่า "ASMR" ติดไว้ข้างหน้า แล้วสงสัยว่าโมเดลให้คะแนนด้วยเปียโน lo-fi ทำไม H3 ให้ความสำคัญกับคำสั่งเสียงถ้าคุณให้มัน โครงสร้างส่วนเสียงเป็นห้าช่อง:

  1. วัสดุ อะไรกำลังสร้างเสียง แก้ว, ขี้ผึ้ง, หินหลอมเหลว, น้ำบนแก้ว ระบุความหนาและความเปียก เพราะมันเปลี่ยนโทนเสียง
  2. การกระทำและรูปร่างในเวลา ไม่ใช่แค่ "ตัด" แต่ "กดลงในจังหวะต่อเนื่องช้าๆ เส้นเดียว" โมเดลใช้สิ่งนี้เพื่อวางเหตุการณ์
  3. มุมมองไมโครโฟนclose-mic, intimate, สัญญาณระยะการบันทึก สิ่งนี้กำหนดว่าเสียงรู้สึกแห้งและใกล้แค่ไหน และมันทำงานได้ดี
  4. ลำดับคำเลียนเสียง สะกดเหตุการณ์เสียงตามลำดับ: เสียงเสียดสี, แล้วแตก, แล้วกระทบเล็กๆ หลายสิบครั้ง, แล้วเงียบ นี่คือช่องที่ทำงานมากที่สุด
  5. ข้อปฏิเสธno music, no voice, no narration, no room reverb, no ambience bed หากไม่มีสิ่งเหล่านี้ H3 จะเพิ่มดนตรีประกอบอย่างช่วยเหลือ เพราะวิดีโอส่วนใหญ่ในข้อมูลฝึกมีดนตรี

ผมยังเขียนทิศทางช่องสัญญาณลงในช่อง 4 โดยขอให้เสียงแตกอยู่ในช่องซ้ายและเมล็ดกลิ้งจากซ้ายไปขวา อ่านต่อเพื่อดูว่าสิ่งนั้นผลิตอะไรจริงๆ

ขั้นตอนที่ 3: รันร่างที่ 768P

ร่างที่ 768P แทร็กเสียงเป็นสเปกเดียวกันทั้งสองระดับ ดังนั้นการตัดสินใจเชิงสร้างสรรค์ทั้งหมด ซึ่งใน ASMR คือการตัดสินใจจากการฟัง สามารถทำได้ในราคาถูก

การตั้งค่าบน minimax/h3/image-to-video: image = เอาต์พุตของขั้นตอนที่ 1, resolution: 768P, duration: 5 สัดส่วนมาจากเฟรมแรก ดังนั้นปล่อยไว้

plaintext
1ใบมีดซานโตกุเข้ามาจากซ้ายและกดลงผ่านทับทิมแก้วในจังหวะต่อเนื่องช้าๆ เส้นเดียว เคลื่อนที่จากซ้ายไปขวาทั่วเฟรม เปลือกแตกด้วยเสียงร้าวแบบคริสตัลสดใส และเมล็ดแก้วเล็กๆ กระจายลงบนหินชนวนเปียก กระจายไปทางขวา กล้องล็อก, มาโคร, เทคเดียว, ไม่มีการตัด
2
3เสียง: ASMR, ไมค์ใกล้, แนบชิด, ไม่มีดนตรี, ไม่มีเสียงพูด, ไม่มีคำบรรยาย, ไม่มีเสียงก้องในห้อง เสียงเสียดสีแก้วแห้งยาวเมื่อคมมีดบาดเข้าไป จากนั้นเสียงแตกสูงคมหนึ่งช่องซ้าย ตามด้วยเมล็ดกระทบเล็กๆ หลายสิบครั้งกลิ้งจากช่องซ้ายไปยังช่องขวาขณะกระจาย เสียงมีดขูดหินเบาๆ ตอนจบ แล้วเงียบ ไม่มีพื้นหลัง, ไม่มีฮัม, ไม่มีดนตรีพื้นหลัง

อินเทอร์เฟซเครื่องสร้างวิดีโอ AI แสดงวิดีโอทับทิมแก้ว

สนามทดลอง MiniMax H3 image-to-video บน Atlas Cloud โดยโหลดเฟรมฐาน ระยะเวลา 5 และคลิปที่เสร็จสมบูรณ์ในแผง OUTPUT

การรัน image-to-video: โหลดเฟรมแรก ระยะเวลา 5, OUTPUT เสร็จสมบูรณ์ สังเกตว่าตัวเลือก Resolution กำลังตั้งอยู่ที่ค่าเริ่มต้นของหน้าเป็น 2K เปลี่ยนเป็น 768P สำหรับร่าง ซึ่งเป็นสิ่งที่คลิปด้านล่างเรนเดอร์ที่

xkolGEKI7UI

ร่าง 768P, $0.50 ภาพนุ่มนวลกว่าคลิปหลัก สเปกเสียงเดียวกัน นี่คือเทคที่ใช้ตัดสินใจทั้งหมด

ขั้นตอนที่ 4: วัดสเตอริโอก่อนที่จะเชื่อถือ

อย่าเชื่อคำพูดของผมเกี่ยวกับเสียง และอย่าเชื่อโมเดล แยกช่องสัญญาณแล้วดู นี่คือ ffmpeg ท้องถิ่น ไม่มีการเรียก API ไม่มีค่าใช้จ่าย:

plaintext
1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \
2  -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \
3  -frames:v 1 stereo-proof.png

การเปรียบเทียบรูปคลื่นของการแยกช่องสัญญาณสเตอริโอในคลิปเสียง ASMR สองคลิป

การวิเคราะห์รูปคลื่นสี่แผงเปรียบเทียบคลิปทับทิมแก้วและคลิปฝน แสดงช่องซ้ายและขวา รวมถึงช่องด้านข้างของแต่ละคลิป

ช่องซ้ายเหนือช่องขวาสำหรับสองคลิป บวกช่องด้านข้าง (ซ้ายลบขวา) ที่เกนที่ตรงกันด้านล่าง นี่คือข้อโต้แย้งทั้งหมดในภาพเดียว

นี่คือสิ่งที่ได้กลับมา และส่วนหนึ่งไม่ใช่สิ่งที่ผมคาดหวัง

สเตอริโอเป็นจริง ช่องด้านข้างไม่ว่างเปล่าในคลิปใดๆ ที่ผมสร้าง ไฟล์ dual mono ที่แต่งตัวเป็นสเตอริโอจะไม่มีอะไรแสดงตรงนี้ อันนี้มีเนื้อหา

แต่คุณไม่สามารถพรอมต์ให้แพนได้ ผมขอเป็นตัวพิมพ์ใหญ่ให้เสียงแตกอยู่ในช่องซ้ายและเมล็ดกลิ้งจากซ้ายไปขวา วัดได้: ความสัมพันธ์ของช่องสัญญาณ 0.97, ช่องด้านข้างอยู่ต่ำกว่ากลาง 17.7 dB, และความแตกต่างระดับซ้าย-ขวาที่ใหญ่ที่สุดในหน้าต่างหนึ่งในสี่วินาทีคือ 1.9 dB นั่นไม่ใช่การแพน นั่นคือภาพที่อยู่ตรงกลางที่มีความกว้างตามธรรมชาติเล็กน้อย มีดเคลื่อนที่ผ่านเฟรม เสียงอยู่กับที่

ความกว้างมาจากเนื้อหา ไม่ใช่จากคำที่คุณใช้ คลิปฝนในส่วนถัดไป ที่ผมไม่ได้ขอทิศทางใดๆ เลย กลับมาที่ความสัมพันธ์ 0.32 โดยช่องด้านข้างอยู่ต่ำกว่ากลางเพียง 2.9 dB นั่นคือฟิลด์ที่กว้างและไม่สัมพันธ์กันอย่างแท้จริง เสียงรอบข้างแบบกระจายจะได้ความกว้างโดยอัตโนมัติ เสียงกระทบที่ไม่ต่อเนื่องจะอยู่ใกล้ศูนย์กลางไม่ว่าคุณจะเขียนอะไร

ดังนั้นข้อกล่าวอ้างที่ซื่อสัตย์สำหรับโมเดลนี้ไม่ใช่เชิงพื้นที่ มันเป็นเชิงเวลา คุณได้เสียงที่ถูกสร้างขึ้นพร้อมกับภาพและลงบนเฟรมที่มันควรจะเป็น ฟรี ตลอดไป โดยไม่ต้องมีโปรแกรมตัดต่อ ถ้ารูปแบบของคุณต้องการการแพนที่ชัดเจนจริงๆ คุณยังต้องทำเองในขั้นตอนหลัง และคุณควรหยุดเขียนชื่อช่องสัญญาณในพรอมต์เพราะมันไม่ได้ทำอะไร

ตอนนี้รันคลิปที่เก็บไว้ใหม่: เอนด์พอยต์เดียวกัน เฟรมแรกเดียวกัน พรอมต์เดียวกัน เปลี่ยนฟิลด์หนึ่งเป็น resolution: 2K อีกสิ่งหนึ่งที่ควรรู้ก่อนที่คุณจะถือว่าร่างเป็นตัวอย่าง

การเปรียบเทียบความละเอียดวิดีโอสองแบบในการตัดทับทิมแก้ว

สองแถวห้าเฟรมเปรียบเทียบการรันที่ 768P และ 2K ที่เวลาเดียวกัน เหมือนกันที่เฟรมศูนย์ และแตกต่างกันตั้งแต่ประมาณ 2.5 วินาที

เฟรมแรกเดียวกัน พรอมต์เดียวกัน ทั้งสองระดับ เฟรม 0 ตรงกันเป๊ะ เมื่อถึง 2.5 วินาที เปลือกแตกต่างกัน และสองคลิปกลายเป็นเทคที่แตกต่างกัน

การล็อกเฟรมแรกทำให้องค์ประกอบ การจัดเฟรม แสง และสีคงที่ทั้งสองระดับ ซึ่งเป็นเหตุผลว่าทำไมคุณควรใช้ image-to-video เสมอแทน text-to-video สำหรับสิ่งนี้ มันไม่ได้ให้เทคเดียวกัน การรันที่ 2K สุ่มการกระทำใหม่ ให้ถือว่าร่างเป็นตัวอย่างของลักษณะภาพและเสียง ไม่ใช่การเคลื่อนไหวที่แน่นอน

ขั้นตอนที่ 5: เพิ่มการบันทึกจริงเป็นข้อมูลอ้างอิงวิดีโอ ASMR MiniMax H3

ถ้าคุณมีเสียงที่คุณต้องการจริงๆ ส่งมันมา reference-to-video รับภาพสูงสุด 9 ภาพ วิดีโอ 3 ไฟล์ และเสียง 3 ไฟล์ และมันดึงโทนเสียงและลักษณะของห้องจากข้อมูลอ้างอิงเสียงแทนที่จะสร้างขึ้นมาใหม่ ผมใช้การบันทึกเสียงแก้วแตกที่เปิดเผยต่อสาธารณะโดย Gravity Sound จาก Wikimedia Commons (CC BY 4.0) สามเทคต่อกันเป็น 4.5 วินาที

สามกฎ และผมพบสองกฎสุดท้ายด้วยความยากลำบากหลังจากที่คำขอถูกปฏิเสธ:

  • เสียงไม่สามารถไปคนเดียวได้ เอนด์พอยต์ระบุไว้: ต้องมีภาพหรือวิดีโออย่างน้อยหนึ่งชิ้น และเสียงเพียงอย่างเดียวไม่ได้รับอนุญาต จับคู่กับเฟรม
  • ข้อมูลอ้างอิงเสียงต้องมีความยาว 2 ถึง 15 วินาที ความพยายามครั้งแรกของผมใช้คลิป 1.49 วินาทีและได้ข้อความ audio duration 1486 ms, expected [2000, 15000] ms ช่วงนั้นไม่ได้อยู่บนหน้าโมเดล
  • รูปแบบไฟล์ถูกตรวจสอบ เพย์โหลด base64 ที่ประกาศเป็น audio/mpeg ถูกปฏิเสธด้วย audio format ".mpeg" not allowed เพย์โหลด .wav ผ่านไป คำขอที่ถูกปฏิเสธจะไม่ถูกคิดเงิน แต่ก็เสียเวลารอบ

การตั้งค่า: refers: [{url: <base frame>, type: "image"}, {url: <a 2 to 15s recording>, type: "audio"}], resolution: 768P, duration: 5

plaintext
1ช็อตมาโครล็อกเดียวกัน: ใบมีดตัดทับทิมแก้วจากซ้ายไปขวาและเมล็ดกระจาย จับคู่โทนเสียง ความสว่าง และลักษณะห้องของเสียงอ้างอิง ระยะบันทึกเดียวกัน ความแห้งเดียวกัน ASMR ไมค์ใกล้, ไม่มีดนตรี, ไม่มีเสียง

อินเทอร์เฟซเครื่องสร้างวิดีโอ AI แสดงอินพุตพรอมต์และวิดีโอทับทิมที่สร้าง

สนามทดลอง MiniMax H3 reference-to-video บน Atlas Cloud โดยโหลดวัสดุอ้างอิงสองชิ้น ไฟล์เสียงในช่อง 1 และเฟรมฐานในช่อง 2

วัสดุอ้างอิงที่บรรจุไฟล์เสียงและภาพร่วมกัน ใช้ไป 2 จาก 9 วางภาพแล้วคำขอจะไม่ทำงานเลย

mY1VrOfM3cM

เทคที่อ้างอิงด้วยเสียง $0.50 ช็อตเดียวกัน โทนเสียงถูกนำโดยการบันทึกจริงแทนที่จะสร้างจากพรอมต์ เสียงอ้างอิง: Glass breaking โดย Gravity Sound, CC BY 4.0

สามเทมเพลตวิดีโอ ASMR MiniMax H3: การตัด, การเคี้ยว, ฝน

สามรูปแบบครอบคลุมสิ่งที่ทำผลงานได้ดีในหมวดนี้ส่วนใหญ่ แต่ละรูปแบบคือพรอมต์ที่พร้อมคัดลอกและวางพร้อมการตั้งค่าและคลิปที่ผลิตขึ้น จงใจไม่มีแก้ว ไม่มีสีแดง ไม่มีหินชนวนด้านล่าง: ถ้าทุกคลิปในบัญชีของคุณดูเหมือนกัน อัลกอริทึมจะถือว่ามันเป็นคลิปเดียวกัน

ตาราง 3: ห้าช่องเดียวกัน สามงานที่แตกต่างกัน

ช่องเทมเพลต 1, การตัดเทมเพลต 2, การเคี้ยวเทมเพลต 3, ฝน
วัสดุรังผึ้งหยด, ใบมีดเหล็กร้อนหินหลอมเหลวเรืองแสง, ชามหินฝนบนกระจกหน้ารถ
รูปร่างการกระทำใบมีดจมจากหน้าไปหลัง, น้ำผึ้งไหลลงตะเกียบยก, แล้วสองคำกัดไม่มีการกระทำของวัตถุ, มีเพียงหยดน้ำ
มุมมองไมโครโฟนไมค์ใกล้, แห้งมาก, ไม่มีห้องใกล้มาก, แนบชิดด้านนอกกระจก, ภายในรถอู้อี้
ลำดับเสียงเสียงขี้ผึ้งแตก, เสียงน้ำผึ้งยืด, เสียงหยดบนจานเสียงฟู่ของหินหลอม, เสียงเคี้ยวเปียก, เสียงกรุบกรอบแก้ว, เสียงหายใจออกเสียงฝนพื้นหลังสม่ำเสมอ, หยดน้ำกระทบ, เสียงยางรถดังไกล
ข้อปฏิเสธไม่มีดนตรี, ไม่มีเสียง, ไม่มีเสียงก้องห้องไม่มีคำพูด, ไม่มีดนตรี, ไม่มีคำบรรยายไม่มีดนตรี, ไม่มีฟ้าร้อง, ไม่มีเสียง, ไม่มีที่ปัดน้ำฝน

เทมเพลต 1, การตัด รังผึ้ง สีอำพันและทอง 9:16, 768P, 6 วินาที, ratio: "9:16"

plaintext
1มาโครสุด, ภาพมุมสูงล็อกของแผ่นรังผึ้งทองหนาบนจานเซรามิกสีซีด น้ำผึ้งเริ่มรวมตัวรอบๆ แล้ว ใบมีดเหล็กร้อนลดลงในขี้ผึ้งและจมผ่านจากหน้าไปหลังในกดช้าๆ ต่อเนื่องหนึ่งครั้ง หน้าตัดที่ตัดยุบและเส้นน้ำผึ้งหนายืดและหยดลงบนจาน แสงหลักอำพันอุ่นจากซ้าย, ระยะชัดตื้น, เทคเดียว, ไม่มีการตัด, ไม่มีมือในเฟรม
2
3เสียง: ASMR, ไมค์ใกล้, แห้งมาก, ไม่มีเสียงก้องห้อง, ไม่มีดนตรี, ไม่มีเสียง, ไม่มีคำบรรยาย เสียงแตกเบาๆ ของขี้ผึ้งที่แตกใต้ใบมีด, จากนั้นเสียงยืดต่ำหนาเมื่อน้ำผึ้งยาวขึ้น, แล้วหยดเปียกหนักสองหยดลงบนจานเซรามิก ไม่มีอะไรอื่น

ZsVmf9AhPnw

เทมเพลต 1, $0.60 เสียงขี้ผึ้งแตก, น้ำผึ้งยืด, หยด สร้างด้วย minimax/h3/text-to-video

เทมเพลต 2, การเคี้ยว Lava mukbang รูปแบบที่มียอดวิว 11.3 ล้านครั้งในหนึ่งสัปดาห์ 9:16, 768P, 8 วินาที, ratio: "9:16"

plaintext
1ภาพ close-up แนวตั้ง: ตะเกียบเคลือบดำคู่หนึ่งยกก้อนลาวาสีส้มเรืองแสงออกจากชามหินสีเข้มและพามันเข้าหากล้อง ออกจากเฟรมด้านล่าง ลาวาเรืองแสงในตัวเอง ฉายแสงสีส้มรอบตัวมัน ที่เหลือของห้องเกือบดำ ไอน้ำลอยขึ้นจากผิว กล้องล็อก, เทคเดียว, ไม่มีการตัด
2
3เสียง: ASMR, ไมค์ใกล้มาก, แนบชิด, ไม่มีคำพูด, ไม่มีดนตรี, ไม่มีคำบรรยาย, ไม่มีเสียงห้อง เสียงฟู่และเดือดต่ำของลาวาเมื่อถูกยก, จากนั้นเสียงเคี้ยวเปียกนุ่ม, แล้วเสียงกรุบกรอบแก้วที่สว่างขึ้นในการกัดครั้งที่สอง, แล้วหายใจออกช้าๆ พอใจหนึ่งครั้ง ไม่มีเสียงพูด

UJhEsTnKkZI

เทมเพลต 2, $0.80 เสียงฟู่, เคี้ยว, กรุบกรอบ, หายใจออก และไม่มีคำพูดสักคำ สร้างด้วย minimax/h3/text-to-video

เทมเพลต 3, ฝน หน้าต่างรถตอนกลางคืน สีฟ้าเย็นและนีออน 16:9, 768P, 10 วินาที, ratio: "16:9"

นี่เป็นเทมเพลตเดียวในสามที่ไม่มีวัตถุเคลื่อนไหว และมันสอนมากที่สุดเกี่ยวกับข้อปฏิเสธ เมื่อไม่มีอะไรเกิดขึ้นบนหน้าจอ H3 จะหาเพลงประกอบเว้นแต่คุณจะห้ามอย่างชัดเจน มันยังเป็นคลิปที่กลับมาพร้อมฟิลด์สเตอริโอกว้างที่สุด โดยไม่ต้องขอ เนื้อหาที่เน้นการนอนหลับต้องการความยาว ดังนั้นอันนี้จึงทำงานใกล้ช่วงระยะเวลาที่มีประโยชน์สูง

plaintext
1ภาพมาโครผ่านกระจกหน้ารถตอนกลางคืน ฝนตกหนักไหลลงด้านนอกกระจก หยดน้ำแต่ละหยดกระทบ, หยุด, แล้วไหลลงและรวมกัน เลยกระจกออกไป ป้ายนีออนที่ไม่ชัดแตกเป็นโบเก้สีฟ้าเย็นและม่วงแดง ไม่มีที่ปัดน้ำฝน, ไม่มีคน, ไม่มีการเคลื่อนไหวภายในรถ กล้องล็อก, เทคต่อเนื่องเดียว, ระยะชัดตื้น, ไม่มีการตัด
2
3เสียง: ASMR, ไมค์ใกล้ด้านนอกกระจก, ภายในรถอู้อี้เล็กน้อย เสียงฝนพื้นหลังสม่ำเสมอพร้อมเสียงหยดน้ำกระทบกระจกที่แยกออกจากกันอย่างชัดเจน บวกเสียงยางรถบนถนนเปียกดังไกลเบาๆ ไม่มีดนตรี, ไม่มีฟ้าร้อง, ไม่มีเสียง, ไม่มีคำบรรยาย, ไม่มีเสียงที่ปัดน้ำฝน

bUKr5V6wbdM

เทมเพลต 3, $1.00 สิบวินาทีของบรรยากาศบริสุทธิ์ ไม่มีเสียงประกอบเพราะพรอมต์ห้ามไว้ สร้างด้วย minimax/h3/text-to-video

วิดีโอ ASMR MiniMax H3 ราคาเท่าไหร่จริงๆ

นี่คือใบเสร็จสำหรับบทความนี้ ไม่ใช่การประมาณ

รายการจำนวนคิดเงิน
เฟรมฐาน GPT Image 2, คุณภาพสูง, 2048x11521$0.17
คลิปหลัก 2K, 5 วินาที, image-to-video1$0.70
ร่าง 768P, 5 วินาที, image-to-video1$0.50
reference-to-video 768P, 5 วินาที1$0.50
คลิปเทมเพลตที่ 768P, 6s + 8s + 10s3$2.40
คำขออ้างอิงที่ถูกปฏิเสธ2$0.00
ยอดรวม $4.27

คลิปที่เผยแพร่ได้หกคลิปและเฟรมฐานหนึ่งเฟรม ขยายเป็นตาราง: คลิปแนวตั้ง 8 วินาทีหนึ่งคลิปต่อวันที่ 768P ราคา $0.80 ดังนั้นประมาณ $24 ต่อเดือน สำหรับบัญชีที่ไม่มีหน้าตาและโพสต์ทุกวัน ก่อนที่คุณจะใช้เวลาสักนาทีในโปรแกรมตัดต่อ

หมายเหตุการเรียกเก็บเงินสองข้อ $0.009 ที่ระบุของ GPT Image 2 คือราคาพื้นระดับโทเค็น การเรนเดอร์คุณภาพสูง 2048x1152 อยู่ที่ $0.1745 เกือบยี่สิบเท่า ดังนั้นให้จัดงบประมาณจากระดับที่คุณใช้จริง และฟิลด์ price ของ H3 จะอัปเดตหลัง มีการหน่วงเวลา: ให้ poll จนกว่า status เป็น completed และบ่อยครั้งที่มันยังเป็น undefined Poll ID การคาดคะเนอีกครั้งหลังจากนั้นสักครู่เพื่อให้ได้ตัวเลขจริง การ poll ครั้งที่สองนั้นเป็นวิธีเดียวที่จะสร้างใบเสร็จแบบนี้ได้แทนที่จะเป็นเพียงการเดา

หมายเหตุซื่อสัตย์หนึ่งข้อเกี่ยวกับเสียง ASMR และสิทธิ์

อย่าอัปโหลดการบันทึก ASMR ของคนอื่นเป็นไฟล์เสียง refers การอ้างอิงจะถ่ายโอนโทนเสียงไปยังเอาต์พุตจริงๆ และการรันการบันทึกผ่านโมเดลไม่ได้เปลี่ยนความเป็นเจ้าของ การอ้างอิงที่ใช้ที่นี่เป็น CC BY 4.0 และให้เครดิตข้างต้น ซึ่งใช้เวลาประมาณสองนาทีในการหาแหล่ง

อย่าสร้าง ASMR รอบเสียงของบุคคลจริงที่รู้จัก เทมเพลตทุกอันในบทความนี้จงใจไม่มีเสียง ซึ่งเป็นทั้งธรรมเนียมของประเภทและเส้นทางที่ซับซ้อนน้อยที่สุด

การเรียก H3 ผ่าน API ไม่ได้รับผลกระทบจากใบอนุญาตชุมชนที่แนบมากับน้ำหนักเปิด ใบอนุญาตนั้นซึ่งครอบคลุมการโฮสต์ด้วยตนเอง ปัจจุบันยกเว้น EU, UK, เกาหลี และสหรัฐฯ และมีช่องทางการอนุญาตอย่างเป็นทางการสำหรับดินแดนเหล่านั้น ควรรู้ไว้ ไม่ต้องกังวลถ้าคุณกำลังใช้เอนด์พอยต์

วิดีโอ ASMR MiniMax H3: คำถามที่พบบ่อย

วิดีโอ ASMR MiniMax H3 สร้างเสียงของตัวเองหรือฉันต้องเพิ่มทีหลัง?

โมเดลสร้างมันขึ้นมา ภาพและเสียงออกมาจากรอบเดียวกัน: วิดีโอ 24 fps พร้อมแทร็ก AAC สเตอริโอที่ 32 kHz ในไฟล์ที่ส่งมอบ ไม่มีขั้นตอนเสียงแยก ไม่มีคลังเสียง และไม่มีงานจัดตำแหน่ง ซึ่งเป็นเหตุผลทั้งหมดที่เอนด์พอยต์นี้น่าสนใจสำหรับ ASMR โดยเฉพาะ

ฉันสามารถทำให้วิดีโอ ASMR MiniMax H3 แพนจากซ้ายไปขวาได้ไหม?

ไม่ได้โดยการขอ ผมเขียนคำสั่งช่องสัญญาณอย่างชัดเจนในพรอมต์และวัดผล: ความสัมพันธ์ระหว่างช่อง 0.97 และความแตกต่างระดับสูงสุด 1.9 dB ในหน้าต่างหนึ่งในสี่วินาที ซึ่งไม่ใช่การแพนเลย แทร็กเป็นสเตอริโอจริง และเนื้อหากระจายเช่นฝนกลับมาพร้อมฟิลด์กว้าง แต่เสียงกระทบที่ไม่ต่อเนื่องยังคงอยู่ตรงกลางไม่ว่าคำจะพูดอะไร ถ้ารูปแบบของคุณต้องการการแพนที่ชัดเจน ให้ทำในขั้นตอนหลัง

ฉันสามารถอัปโหลดการบันทึกของตัวเองเป็นข้อมูลอ้างอิงวิดีโอ ASMR MiniMax H3 ได้ไหม?

ได้ผ่าน reference-to-video ซึ่งรับข้อมูลอ้างอิงเสียงสูงสุด 3 ไฟล์ควบคู่กับภาพสูงสุด 9 ภาพและวิดีโอ 3 ไฟล์ เสียงไม่สามารถส่งคนเดียวได้ ดังนั้นจับคู่กับภาพหรือวิดีโออย่างน้อยหนึ่งชิ้น เสียงต้องมีความยาวระหว่าง 2 ถึง 15 วินาที และรูปแบบจะถูกตรวจสอบ: เพย์โหลด .wav ทำงานได้ในขณะที่ audio/mpeg ถูกปฏิเสธ คำขอที่ถูกปฏิเสธจะไม่ถูกคิดเงิน

เสียงของวิดีโอ ASMR MiniMax H3 ที่ 768P แย่กว่าที่ 2K หรือไม่?

ไม่ ทั้งสองระดับส่งมอบสเปก AAC สเตอริโอ 32 kHz เดียวกัน มีเพียงภาพที่เปลี่ยน และมันเปลี่ยนมาก: 16:9 กลับมาเป็น 1344x768 ที่ 768P เทียบกับ 2560x1440 ที่ 2K เนื่องจากการตัดสินใจเชิงสร้างสรรค์ใน ASMR คือการตัดสินใจจากการฟัง ให้ร่างที่ $0.10/วินาที และรันคลิปที่เก็บไว้ใหม่ที่ $0.14/วินาที แค่จำไว้ว่าการรัน 2K คือเทคใหม่ ไม่ใช่การอัปสเกลของร่าง

วิดีโอ ASMR MiniMax H3 ควรยาวเท่าไหร่ และสัดส่วนเท่าไหร่?

ระยะเวลารับจำนวนเต็มวินาทีใดๆ ตั้งแต่ 4 ถึง 15 คลิปตัดและเคี้ยวทำงานที่ 5 ถึง 8 วินาทีเพราะผลตอบแทนคือเหตุการณ์เดียว บรรยากาศที่เน้นการนอนหลับต้องการ 10 หรือมากกว่า สำหรับ Shorts, Reels และ TikTok ใช้ 9:16 และจำไว้ว่า text-to-video ต้องการให้ตั้งค่า ratio อย่างชัดเจนและปฏิเสธ adaptive สำหรับ image-to-video เฟรมแรกจะกำหนดรูปทรงให้คุณ

วิดีโอ ASMR MiniMax H3 หนึ่งคลิปราคาเท่าไหร่?

คลิป 5 วินาทีคิดเงิน $0.50 ที่ 768P และ $0.70 ที่ 2K คลิปแนวตั้ง 8 วินาทีที่ 768P ราคา $0.80 การโพสต์หนึ่งคลิปต่อวันคือประมาณ $24 ต่อเดือนในค่าคอมพิวเตอร์ ซึ่งเป็นตัวเลขที่ควรเปรียบเทียบกับเวลา 20 นาทีที่โปรแกรมตัดต่อจะใช้ต่อคลิปในเวิร์กโฟลว์แบบต่อกัน

ทำไมวิดีโอ ASMR MiniMax H3 ของฉันถึงมีดนตรีประกอบที่ฉันไม่ได้ขอ?

เพราะคุณไม่ได้ห้ามมัน วิดีโอส่วนใหญ่ในข้อมูลฝึกของโมเดลใดๆ มีดนตรีประกอบ ดังนั้นพฤติกรรมเริ่มต้นคือการเพิ่มหนึ่ง โดยเฉพาะเมื่อไม่มีอะไรเกิดขึ้นบนหน้าจอ ใส่ข้อปฏิเสธในส่วนเสียงของพรอมต์อย่างชัดเจน: no music, no voice, no narration, no room reverb, no ambience bed เทมเพลตบรรยากาศต้องการสิ่งนี้มากกว่าเทมเพลตที่มีการกระทำ

โมเดลล่าสุด

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด