ใส่หูฟังก่อนที่จะเลื่อนไปยังคลิปด้านล่าง ในหมวดนี้มันสำคัญจริงๆ
มีดเล่มหนึ่งกำลังตัดผ่านผลทับทิมที่แกะสลักจากแก้วสีทับทิม เปลือกแตกออก เสียงร้าวแบบคริสตัล จากนั้นเมล็ดแก้วหลายสิบเมล็ดก็กลิ้งกระจายบนแผ่นหินชนวนเปียก นี่คือส่วนที่แตกต่างจากคลิป ASMR AI เกือบทั้งหมดที่คุณเลื่อนผ่านในปีนี้: ไม่มีใครเพิ่มเสียงนั้น ไม่มีคลังเสียง ไม่มีโปรแกรมตัดต่อ ไม่มีไทม์ไลน์ ภาพและเสียงออกมาจากการสร้างครั้งเดียว ในการเรียก API ครั้งเดียว
ตลอดปีที่ผ่านมา AI ASMR ดูน่าพึงพอใจแต่ฟังดูผิดแปลกไปเล็กน้อย และสาเหตุไม่ใช่ที่ภาพ มันคือขั้นตอนสุดท้ายของไปป์ไลน์ การติดเสียงเข้ากับคลิปที่ไม่มีเสียงเป็นงานที่ต้องทำด้วยมือ ทุกครั้ง หมวดหมู่เติบโตเร็วมากจนเกิดอุตสาหกรรมขนาดเล็กของเว็บไซต์สร้าง AI ASMR โดยเฉพาะขึ้นมาเพื่อทำให้การต่อเชื่อมนี้เป็นอัตโนมัติ โดยหนึ่งในนั้นโฆษณา "binaural 3D audio" บนหน้าแรกเสียด้วย ความต้องการได้รับการพิสูจน์มานานแล้ว แต่มันถูกตอบสนองด้วยการประกอบเข้าด้วยกัน
ดังนั้นผมจึงทำสิ่งนี้อย่างถูกต้อง หนึ่งเวิร์กโฟลว์ที่ทำซ้ำได้ หกคลิป จากนั้นส่วนที่ไม่มีใครในหมวดนี้เคยทำ: ผมแยกช่องสัญญาณซ้ายและขวาด้วย ffmpeg และวัดค่ามัน บางอย่างที่ผมคาดหวังกลับกลายเป็นผิด และนั่นกลายเป็นสิ่งที่มีประโยชน์ที่สุดในบทความนี้
ประเด็นสำคัญ
- H3 เรนเดอร์ภาพ 24 fps และแทร็กเสียง AAC สเตอริโอ 32 kHz ในรอบเดียว เสียงถูกสร้างขึ้น ไม่ได้ถูกพากย์ทับทีหลัง
- สเตอริโอเป็นสเตอริโอจริง ไม่ใช่ dual mono ที่แต่งตัวเป็นสเตอริโอ แต่ คุณไม่สามารถพรอมต์ให้แพนได้ ผมขอให้แพนจากซ้ายไปขวาอย่างชัดเจน แต่ได้ความแตกต่างแค่ 1.9 dB ซึ่งแทบไม่มีอะไร
- ความกว้างของสเตอริโอ มาจากเนื้อหา ไม่ใช่จากคำที่คุณใช้ คลิปฝนที่ผมไม่ได้บอกทิศทางใดๆ เลย กลับมาพร้อมฟิลด์ที่กว้างจริงๆ
- การล็อกเฟรมแรกทำให้ภาพคงที่ในทุกความละเอียด แต่ 768P และ 2K ยังคงเป็นสองเทคที่แตกต่างกัน ร่างจะแสดงตัวอย่างลักษณะภาพและสเปกเสียง ไม่ใช่การเคลื่อนไหวที่แน่นอน
- คลิป 5 วินาทีที่ 768P คิดค่าใช้จ่าย $0.50 คลิปเดียวกันที่ 2K คิด $0.70 ทั้งบทความมีค่าใช้จ่าย $4.27
ฟังก่อน: วิดีโอ ASMR MiniMax H3 ตัดในครั้งเดียว
w7ZRR7bo3KI
ห้าวินาที, 2K, 24 fps, สเตอริโอ 32 kHz, สร้างครั้งเดียว, $0.70 เปิดเสียง: เสียงเสียดสีของคมมีดที่บาดเข้าไป, เสียงแตก, แล้วก็เมล็ด ไม่มีอะไรถูกเพิ่มทีหลัง สร้างด้วย minimax/h3/image-to-video
พรอมต์เดียว โมเดลเดียว การเรียกครั้งเดียว ทุกอย่างด้านล่างคือวิธีการสร้างคลิปนั้น ราคาเท่าไหร่ และส่วนใดของเรื่องราวทางการตลาดที่รอดเมื่อเจอกับรูปคลื่นเสียง
ทำไม AI ASMR ถึงระเบิด และทำไมส่วนใหญ่ถึงไม่ผ่านการทดสอบหูฟัง
เทรนด์นี้มีวันเกิด AI ASMR เริ่มแพร่กระจายในเดือนมิถุนายน 2025 ทันทีหลังจาก Veo 3 เปิดตัว และรูปแบบก็กลายเป็นไวรัลภายในไม่กี่วัน lava mukbang จาก @asmraiworks มียอดวิวกว่า 11.3 ล้านครั้งในหนึ่งสัปดาห์ คลิปตัดแก้วมียอด 5.3 ล้านครั้งในสิบเอ็ดวัน (Know Your Meme, 2025) สำนักข่าวนำมาเป็นเรื่องแปลกใหม่ โดยมีภาพเหนือจริงและลาวาหลอมที่กินด้วยตะเกียบเป็นตัวดึงดูดหลัก (The Express Tribune, 2025)
จากนั้นผู้คนก็ใส่หูฟัง และบรรยากาศก็เปลี่ยนไป นักเขียนของ TechRadar ดูคลิปไวรัลหลายคลิปแล้วออกมาบรรยายถึงความเทียม "ขาดความผิดพลาดและความไม่แม่นยำซึ่งเป็นลักษณะเด่นของ ASMR ที่มนุษย์สร้าง" (TechRadar, มิถุนายน 2025) แฟนๆ ที่ถูกอ้างถึงในบทความนั้นบอกว่าทริกเกอร์ tingles มีอยู่ทางเทคนิค แต่ก็ยังไม่เหมือนเดิม
มีเหตุผลทางกลไก และไม่ใช่เรื่องลึกลับ ASMR คือประเภทเนื้อหาที่ เนื้อหาคือเสียง ที่อื่นเสียงเป็นเครื่องปรุง ที่นี่เสียงคือผลิตภัณฑ์ และเวิร์กโฟลว์ที่โดดเด่นคือ:
- สร้างคลิปไม่มีเสียงด้วยโมเดลวิดีโอ
- หาเสียงจากคลังเสียง ไม่ว่าจะเป็นเสียงแตก เสียงกระทบ เสียงฝน
- จับคู่เสียงกับภาพในโปรแกรมตัดต่อ
- แพนและมิกซ์ด้วยมือถ้าคุณใส่ใจ ซึ่งแทบไม่มีใครทำเมื่อทำจำนวนมาก
- ส่งออก
ขั้นตอนที่ 3 คือจุดที่ล้มเหลว เสียงแตกที่เก็บไว้ซึ่งเล่นช้าไปสองเฟรมจะฟังดูปลอมก่อนที่คุณจะอธิบายได้ว่าทำไม คูณด้วยตารางการโพสต์รายวัน และข้อผิดพลาดก็ทวีคูณ เพราะการจัดตำแหน่งถูกทำใหม่โดยมนุษย์ทุกครั้ง
ช่องว่างนั้นคือเหตุผลที่มีอุตสาหกรรมขนาดย่อมของเว็บไซต์สร้าง AI ASMR เกิดขึ้น อย่างน้อยสามแห่งกำลังทำการตลาดอย่างแข็งขัน และหนึ่งในนั้นใช้ binaural 3D audio เป็นฟีเจอร์หลัก พวกเขาไม่ได้แก้ปัญหาที่ไม่มีอยู่จริง พวกเขากำลังปะรูจริง: โมเดลวิดีโอที่อยู่เบื้องหลังพวกเขาไม่ได้สร้างเสียง
ซึ่งทำให้การจัดอันดับหนึ่งรายการน่าสนใจ บนกระดานวิดีโอของ Artificial Analysis ที่ให้คะแนน พร้อมเสียง MiniMax H3 อยู่อันดับ #1 ด้วย 1,126 Elo นำหน้า Gemini Omni Flash ที่ 1,119 และห่างจาก Dreamina Seedance 2.0 ที่ 1,027 ประมาณร้อยคะแนน (Artificial Analysis, สิงหาคม 2026) บนกระดาน image-to-video ที่เสียงไม่ใช่ส่วนหนึ่งของคะแนน โมเดลหลายตัวนั้นอยู่ใกล้กันภายในไม่กี่คะแนน ช่องว่างเปิดขึ้นเมื่อเสียงมีความสำคัญ สำหรับ ASMR เสียงคือทุกสิ่ง
เวิร์กโฟลว์วิดีโอ ASMR MiniMax H3 และค่าใช้จ่ายในแต่ละขั้นตอน
สามเอนด์พอยต์ หนึ่งแท็บเบราว์เซอร์ ผมรันทุกอย่างในบทความนี้บน Atlas Cloud ดังนั้นตัวเลขทุกตัวด้านล่างมาจากบิลจริง ไม่ใช่จากอัตราที่ประกาศ
| งานในบทความนี้ | โมเดล | อัตรา |
|---|---|---|
| เฟรมแรกสำหรับคลิปหลัก | OpenAI GPT Image 2 (text-to-image) | เริ่มต้น $0.009/ภาพ, คิดจริง $0.1745 ที่ high และ 2048x1152 |
| ร่างและคลิปที่เก็บไว้ | MiniMax H3 Image-to-Video | $0.10/วินาทีที่ 768P, $0.14/วินาทีที่ 2K |
| ป้อนการบันทึกจริง | MiniMax H3 Reference-to-Video | สองระดับเดียวกัน |
| สามเทมเพลต | MiniMax H3 Text-to-Video | สองระดับเดียวกัน |
| วิธีเก่า เฉพาะส่วนเสียง | ByteDance Seed Audio 1.0 | $0.143/นาที |
รายการแสดง "From $0.1/SEC" บนเอนด์พอยต์ H3 ทั้งสาม นั่นคือราคาพื้นที่ 768P 2K คิด $0.14/วินาที และตัวเลขนั้นไม่ปรากฏที่ไหนยกเว้นในใบแจ้งหนี้ของคุณ ดังนั้นให้วางแผนตามระดับที่คุณร้องขอจริง
ตาราง 1: รอบเดียวเทียบกับไปป์ไลน์ที่ต่อกัน
| MiniMax H3, เสียงในตัว | โมเดลไร้เสียงบวกเสียงทีหลัง | |
|---|---|---|
| ขั้นตอนถึงคลิปที่เสร็จสมบูรณ์ | 1 | 4 ถึง 5 |
| เครื่องมือที่เกี่ยวข้อง | 1 | โมเดลวิดีโอ + คลังเสียง + โปรแกรมตัดต่อ + ส่งออก |
| ภาพและเสียงซิงค์กันอย่างไร | รอบการสร้างเดียวกัน, ไทม์ไลน์เดียวกัน | คุณลากจนกว่าจะดูถูกต้อง |
| ใครเป็นคนมิกซ์และแพน | ไม่มีใคร คุณรับสิ่งที่โมเดลให้ | คุณ, ด้วยมือ, ต่อเสียง |
| เวลามนุษย์ต่อคลิป | ประมาณศูนย์หลังจากพรอมต์ | 15 ถึง 40 นาที จริงๆ |
| ค่าใช้จ่ายคอมพิวเตอร์ต่อคลิป 5 วินาที | $0.50 ที่ 768P | โมเดลวิดีโอ + $0.143/นาทีของการสร้างเสียง |
ผมจงใจไม่ยกอัตราต่อวินาทีของแพลตฟอร์มวิดีโอคู่แข่ง เพราะคอมพิวเตอร์ไม่ใช่จุดที่แตกต่าง การสร้างเสียงคิด $0.143 ต่อนาที ซึ่งเป็นเพียงเศษสตางค์ ต้นทุนที่แท้จริงของไปป์ไลน์ที่ต่อกันคือเวลา 20 นาทีของมนุษย์ต่อคลิป และต้นทุนนั้นไม่ลดลงเมื่อคุณขยาย มันทวีคูณ บัญชีที่ไม่มีหน้าตาและโพสต์ทุกวันคือจุดที่ 20 นาทีต่อคลิปค่อยๆ กินโมเดลธุรกิจทั้งหมด
ข้อเสียที่ซื่อสัตย์: การต่อด้วยมือทำให้คุณควบคุมได้ คุณสามารถวางเสียงได้ทุกที่ในฟิลด์สเตอริโอและตัดให้ตรงกับเฟรม H3 ให้การซิงค์ฟรี และดังที่การวัดด้านล่างแสดง มันไม่ได้ให้การควบคุมนั้นกลับคืนมา
ตาราง 2: สามเอนด์พอยต์ H3 พารามิเตอร์ที่สำคัญจริงๆ
| image-to-video | text-to-video | reference-to-video | |
|---|---|---|---|
| อินพุตหลัก | ภาพ (เฟรมแรก) | พรอมต์เท่านั้น | refers[] |
| ความละเอียด | 768P / 2K, ค่าเริ่มต้น 2K | เหมือนกัน | เหมือนกัน |
| ระยะเวลา | จำนวนเต็มวินาทีใดๆ 4 ถึง 15, ค่าเริ่มต้น 8 | เหมือนกัน | เหมือนกัน |
| สัดส่วน | กำหนดโดยเฟรมแรก | ต้องตั้งค่าอย่างชัดเจน, adaptive ถูกปฏิเสธ | กำหนดโดย references |
| ข้อจำกัดของ refers | ใช้ร่วมกับภาพไม่ได้ | ไม่ใช้ | สูงสุด 9 ภาพ, 3 วิดีโอ, 3 เสียง |
| เอาต์พุต 16:9 ที่ส่งมอบ | 1344x768 ที่ 768P, 2560x1440 ที่ 2K | เหมือนกัน | เหมือนกัน |
| แทร็กเสียง | AAC สเตอริโอ 32 kHz เหนือวิดีโอ 24 fps | เหมือนกัน | เหมือนกัน |
กับดักพารามิเตอร์สองอย่างที่ควรเขียนไว้บนมือของคุณ พารามิเตอร์คือ ratio ไม่ใช่ aspect_ratio และคีย์ที่ผิดจะทำให้มันไม่ถูกตั้งค่า ดังนั้น text-to-video จะปฏิเสธคำขอ และ image พร้อม refers ในการเรียกเดียวกันจะไม่เกิดข้อผิดพลาด: มันจะทำงานเสร็จ คิดเงินเต็มจำนวน และ silently โยนอินพุตหนึ่งในสองทิ้งไป
บทช่วยสอนวิดีโอ ASMR MiniMax H3: การตัดทับทิมแก้ว
การตัดผลไม้แก้วเป็นรูปแบบที่ทุกคนรู้จัก ดังนั้นผู้อ่านจะรู้ทันทีว่ากำลังดูอะไร แอปเปิ้ลแก้วและมะม่วงแก้วถูกทำจนเบื่อแล้ว ทับทิมดีกว่าด้วยเหตุผลเฉพาะอย่างหนึ่ง: เมื่อเปลือกแตก เมล็ดแก้วหลายร้อยเมล็ดจะหลุดออกมาและกลิ้ง ดังนั้นเสียงจึงมีระยะเวลาและโครงสร้าง แทนที่จะเป็นเสียงกระทบจุดเดียว ถ้าโมเดลกำลังปลอมเสียงของมัน การกระจายคือจุดที่มันจะเปิดโปง
ขั้นตอนที่ 1: สร้างเฟรมฐานด้วย GPT Image 2
ล็อกองค์ประกอบก่อนที่คุณจะใช้เงินกับวิดีโอ การตั้งค่า: quality: high, size: 2048x1152 (16:9), output_format: png
plaintext1ภาพถ่ายมาโครระยะใกล้สุดของทับทิมทั้งลูกที่แกะสลักจากแก้วสีแดงทับทิมหนาทึบ วางบนแผ่นหินชนวนสีดำเปียก เปลือกแก้วหนา 8 มม. มีฟองอากาศภายในและเหลี่ยมที่บิ่นให้เห็น เมล็ดแก้วเล็กๆ นับร้อยเรืองแสงอยู่ข้างในเหมือนคริสตัลโกเมน มีดซานโตกุญี่ปุ่นขัดมันอยู่ที่ขอบซ้ายของเฟรม ปลายมีดแตะผิวแก้วเพียงเล็กน้อย แสงหลักแข็งจากด้านขวาบนสาดไปทั่วแผ่นหินและทำให้เกิดเงาสะท้อนสีแดงคมบนหินเปียก เลนส์มาโคร 100 มม., f/2.8, ระยะชัดตื้น, พื้นหลังมืดหม่น 2ไม่มีมือ, ไม่มีข้อความ, ไม่มีลายน้ำ, ไม่มีโลโก้

สนามทดลอง GPT Image 2 บน Atlas Cloud โดยตั้งค่าคุณภาพเป็น high และขนาด 16:9 2048x1152 ทับทิมแก้วที่เรนเดอร์ในแผง OUTPUT
การรันจริง คุณภาพ high ที่ 2048x1152 และหน้าระบุ $0.1745 ซึ่งเป็นสิ่งที่ใบแจ้งหนี้บอกในภายหลังเช่นกัน

เฟรมฐานที่สร้างขึ้น: ทับทิมที่แกะสลักจากแก้วทับทิมหนาบนหินชนวนสีดำเปียก มีดซานโตกุเข้ามาจากขอบซ้าย
เฟรมที่ส่งให้ H3 สร้างด้วย openai/gpt-image-2/text-to-image
ขั้นตอนที่ 2: เขียนส่วนเสียงของพรอมต์วิดีโอ ASMR MiniMax H3
คนส่วนใหญ่เขียนพรอมต์ ASMR เป็นคำอธิบายภาพโดยมีคำว่า "ASMR" ติดไว้ข้างหน้า แล้วสงสัยว่าโมเดลให้คะแนนด้วยเปียโน lo-fi ทำไม H3 ให้ความสำคัญกับคำสั่งเสียงถ้าคุณให้มัน โครงสร้างส่วนเสียงเป็นห้าช่อง:
- วัสดุ อะไรกำลังสร้างเสียง แก้ว, ขี้ผึ้ง, หินหลอมเหลว, น้ำบนแก้ว ระบุความหนาและความเปียก เพราะมันเปลี่ยนโทนเสียง
- การกระทำและรูปร่างในเวลา ไม่ใช่แค่ "ตัด" แต่ "กดลงในจังหวะต่อเนื่องช้าๆ เส้นเดียว" โมเดลใช้สิ่งนี้เพื่อวางเหตุการณ์
- มุมมองไมโครโฟน
close-mic,intimate, สัญญาณระยะการบันทึก สิ่งนี้กำหนดว่าเสียงรู้สึกแห้งและใกล้แค่ไหน และมันทำงานได้ดี - ลำดับคำเลียนเสียง สะกดเหตุการณ์เสียงตามลำดับ: เสียงเสียดสี, แล้วแตก, แล้วกระทบเล็กๆ หลายสิบครั้ง, แล้วเงียบ นี่คือช่องที่ทำงานมากที่สุด
- ข้อปฏิเสธ
no music, no voice, no narration, no room reverb, no ambience bedหากไม่มีสิ่งเหล่านี้ H3 จะเพิ่มดนตรีประกอบอย่างช่วยเหลือ เพราะวิดีโอส่วนใหญ่ในข้อมูลฝึกมีดนตรี
ผมยังเขียนทิศทางช่องสัญญาณลงในช่อง 4 โดยขอให้เสียงแตกอยู่ในช่องซ้ายและเมล็ดกลิ้งจากซ้ายไปขวา อ่านต่อเพื่อดูว่าสิ่งนั้นผลิตอะไรจริงๆ
ขั้นตอนที่ 3: รันร่างที่ 768P
ร่างที่ 768P แทร็กเสียงเป็นสเปกเดียวกันทั้งสองระดับ ดังนั้นการตัดสินใจเชิงสร้างสรรค์ทั้งหมด ซึ่งใน ASMR คือการตัดสินใจจากการฟัง สามารถทำได้ในราคาถูก
การตั้งค่าบน minimax/h3/image-to-video: image = เอาต์พุตของขั้นตอนที่ 1, resolution: 768P, duration: 5 สัดส่วนมาจากเฟรมแรก ดังนั้นปล่อยไว้
plaintext1ใบมีดซานโตกุเข้ามาจากซ้ายและกดลงผ่านทับทิมแก้วในจังหวะต่อเนื่องช้าๆ เส้นเดียว เคลื่อนที่จากซ้ายไปขวาทั่วเฟรม เปลือกแตกด้วยเสียงร้าวแบบคริสตัลสดใส และเมล็ดแก้วเล็กๆ กระจายลงบนหินชนวนเปียก กระจายไปทางขวา กล้องล็อก, มาโคร, เทคเดียว, ไม่มีการตัด 2 3เสียง: ASMR, ไมค์ใกล้, แนบชิด, ไม่มีดนตรี, ไม่มีเสียงพูด, ไม่มีคำบรรยาย, ไม่มีเสียงก้องในห้อง เสียงเสียดสีแก้วแห้งยาวเมื่อคมมีดบาดเข้าไป จากนั้นเสียงแตกสูงคมหนึ่งช่องซ้าย ตามด้วยเมล็ดกระทบเล็กๆ หลายสิบครั้งกลิ้งจากช่องซ้ายไปยังช่องขวาขณะกระจาย เสียงมีดขูดหินเบาๆ ตอนจบ แล้วเงียบ ไม่มีพื้นหลัง, ไม่มีฮัม, ไม่มีดนตรีพื้นหลัง

สนามทดลอง MiniMax H3 image-to-video บน Atlas Cloud โดยโหลดเฟรมฐาน ระยะเวลา 5 และคลิปที่เสร็จสมบูรณ์ในแผง OUTPUT
การรัน image-to-video: โหลดเฟรมแรก ระยะเวลา 5, OUTPUT เสร็จสมบูรณ์ สังเกตว่าตัวเลือก Resolution กำลังตั้งอยู่ที่ค่าเริ่มต้นของหน้าเป็น 2K เปลี่ยนเป็น 768P สำหรับร่าง ซึ่งเป็นสิ่งที่คลิปด้านล่างเรนเดอร์ที่
xkolGEKI7UI
ร่าง 768P, $0.50 ภาพนุ่มนวลกว่าคลิปหลัก สเปกเสียงเดียวกัน นี่คือเทคที่ใช้ตัดสินใจทั้งหมด
ขั้นตอนที่ 4: วัดสเตอริโอก่อนที่จะเชื่อถือ
อย่าเชื่อคำพูดของผมเกี่ยวกับเสียง และอย่าเชื่อโมเดล แยกช่องสัญญาณแล้วดู นี่คือ ffmpeg ท้องถิ่น ไม่มีการเรียก API ไม่มีค่าใช้จ่าย:
plaintext1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \ 2 -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \ 3 -frames:v 1 stereo-proof.png

การวิเคราะห์รูปคลื่นสี่แผงเปรียบเทียบคลิปทับทิมแก้วและคลิปฝน แสดงช่องซ้ายและขวา รวมถึงช่องด้านข้างของแต่ละคลิป
ช่องซ้ายเหนือช่องขวาสำหรับสองคลิป บวกช่องด้านข้าง (ซ้ายลบขวา) ที่เกนที่ตรงกันด้านล่าง นี่คือข้อโต้แย้งทั้งหมดในภาพเดียว
นี่คือสิ่งที่ได้กลับมา และส่วนหนึ่งไม่ใช่สิ่งที่ผมคาดหวัง
สเตอริโอเป็นจริง ช่องด้านข้างไม่ว่างเปล่าในคลิปใดๆ ที่ผมสร้าง ไฟล์ dual mono ที่แต่งตัวเป็นสเตอริโอจะไม่มีอะไรแสดงตรงนี้ อันนี้มีเนื้อหา
แต่คุณไม่สามารถพรอมต์ให้แพนได้ ผมขอเป็นตัวพิมพ์ใหญ่ให้เสียงแตกอยู่ในช่องซ้ายและเมล็ดกลิ้งจากซ้ายไปขวา วัดได้: ความสัมพันธ์ของช่องสัญญาณ 0.97, ช่องด้านข้างอยู่ต่ำกว่ากลาง 17.7 dB, และความแตกต่างระดับซ้าย-ขวาที่ใหญ่ที่สุดในหน้าต่างหนึ่งในสี่วินาทีคือ 1.9 dB นั่นไม่ใช่การแพน นั่นคือภาพที่อยู่ตรงกลางที่มีความกว้างตามธรรมชาติเล็กน้อย มีดเคลื่อนที่ผ่านเฟรม เสียงอยู่กับที่
ความกว้างมาจากเนื้อหา ไม่ใช่จากคำที่คุณใช้ คลิปฝนในส่วนถัดไป ที่ผมไม่ได้ขอทิศทางใดๆ เลย กลับมาที่ความสัมพันธ์ 0.32 โดยช่องด้านข้างอยู่ต่ำกว่ากลางเพียง 2.9 dB นั่นคือฟิลด์ที่กว้างและไม่สัมพันธ์กันอย่างแท้จริง เสียงรอบข้างแบบกระจายจะได้ความกว้างโดยอัตโนมัติ เสียงกระทบที่ไม่ต่อเนื่องจะอยู่ใกล้ศูนย์กลางไม่ว่าคุณจะเขียนอะไร
ดังนั้นข้อกล่าวอ้างที่ซื่อสัตย์สำหรับโมเดลนี้ไม่ใช่เชิงพื้นที่ มันเป็นเชิงเวลา คุณได้เสียงที่ถูกสร้างขึ้นพร้อมกับภาพและลงบนเฟรมที่มันควรจะเป็น ฟรี ตลอดไป โดยไม่ต้องมีโปรแกรมตัดต่อ ถ้ารูปแบบของคุณต้องการการแพนที่ชัดเจนจริงๆ คุณยังต้องทำเองในขั้นตอนหลัง และคุณควรหยุดเขียนชื่อช่องสัญญาณในพรอมต์เพราะมันไม่ได้ทำอะไร
ตอนนี้รันคลิปที่เก็บไว้ใหม่: เอนด์พอยต์เดียวกัน เฟรมแรกเดียวกัน พรอมต์เดียวกัน เปลี่ยนฟิลด์หนึ่งเป็น resolution: 2K อีกสิ่งหนึ่งที่ควรรู้ก่อนที่คุณจะถือว่าร่างเป็นตัวอย่าง

สองแถวห้าเฟรมเปรียบเทียบการรันที่ 768P และ 2K ที่เวลาเดียวกัน เหมือนกันที่เฟรมศูนย์ และแตกต่างกันตั้งแต่ประมาณ 2.5 วินาที
เฟรมแรกเดียวกัน พรอมต์เดียวกัน ทั้งสองระดับ เฟรม 0 ตรงกันเป๊ะ เมื่อถึง 2.5 วินาที เปลือกแตกต่างกัน และสองคลิปกลายเป็นเทคที่แตกต่างกัน
การล็อกเฟรมแรกทำให้องค์ประกอบ การจัดเฟรม แสง และสีคงที่ทั้งสองระดับ ซึ่งเป็นเหตุผลว่าทำไมคุณควรใช้ image-to-video เสมอแทน text-to-video สำหรับสิ่งนี้ มันไม่ได้ให้เทคเดียวกัน การรันที่ 2K สุ่มการกระทำใหม่ ให้ถือว่าร่างเป็นตัวอย่างของลักษณะภาพและเสียง ไม่ใช่การเคลื่อนไหวที่แน่นอน
ขั้นตอนที่ 5: เพิ่มการบันทึกจริงเป็นข้อมูลอ้างอิงวิดีโอ ASMR MiniMax H3
ถ้าคุณมีเสียงที่คุณต้องการจริงๆ ส่งมันมา reference-to-video รับภาพสูงสุด 9 ภาพ วิดีโอ 3 ไฟล์ และเสียง 3 ไฟล์ และมันดึงโทนเสียงและลักษณะของห้องจากข้อมูลอ้างอิงเสียงแทนที่จะสร้างขึ้นมาใหม่ ผมใช้การบันทึกเสียงแก้วแตกที่เปิดเผยต่อสาธารณะโดย Gravity Sound จาก Wikimedia Commons (CC BY 4.0) สามเทคต่อกันเป็น 4.5 วินาที
สามกฎ และผมพบสองกฎสุดท้ายด้วยความยากลำบากหลังจากที่คำขอถูกปฏิเสธ:
- เสียงไม่สามารถไปคนเดียวได้ เอนด์พอยต์ระบุไว้: ต้องมีภาพหรือวิดีโออย่างน้อยหนึ่งชิ้น และเสียงเพียงอย่างเดียวไม่ได้รับอนุญาต จับคู่กับเฟรม
- ข้อมูลอ้างอิงเสียงต้องมีความยาว 2 ถึง 15 วินาที ความพยายามครั้งแรกของผมใช้คลิป 1.49 วินาทีและได้ข้อความ
audio duration 1486 ms, expected [2000, 15000] msช่วงนั้นไม่ได้อยู่บนหน้าโมเดล - รูปแบบไฟล์ถูกตรวจสอบ เพย์โหลด base64 ที่ประกาศเป็น
audio/mpegถูกปฏิเสธด้วยaudio format ".mpeg" not allowedเพย์โหลด.wavผ่านไป คำขอที่ถูกปฏิเสธจะไม่ถูกคิดเงิน แต่ก็เสียเวลารอบ
การตั้งค่า: refers: [{url: <base frame>, type: "image"}, {url: <a 2 to 15s recording>, type: "audio"}], resolution: 768P, duration: 5
plaintext1ช็อตมาโครล็อกเดียวกัน: ใบมีดตัดทับทิมแก้วจากซ้ายไปขวาและเมล็ดกระจาย จับคู่โทนเสียง ความสว่าง และลักษณะห้องของเสียงอ้างอิง ระยะบันทึกเดียวกัน ความแห้งเดียวกัน ASMR ไมค์ใกล้, ไม่มีดนตรี, ไม่มีเสียง

สนามทดลอง MiniMax H3 reference-to-video บน Atlas Cloud โดยโหลดวัสดุอ้างอิงสองชิ้น ไฟล์เสียงในช่อง 1 และเฟรมฐานในช่อง 2
วัสดุอ้างอิงที่บรรจุไฟล์เสียงและภาพร่วมกัน ใช้ไป 2 จาก 9 วางภาพแล้วคำขอจะไม่ทำงานเลย
mY1VrOfM3cM
เทคที่อ้างอิงด้วยเสียง $0.50 ช็อตเดียวกัน โทนเสียงถูกนำโดยการบันทึกจริงแทนที่จะสร้างจากพรอมต์ เสียงอ้างอิง: Glass breaking โดย Gravity Sound, CC BY 4.0
สามเทมเพลตวิดีโอ ASMR MiniMax H3: การตัด, การเคี้ยว, ฝน
สามรูปแบบครอบคลุมสิ่งที่ทำผลงานได้ดีในหมวดนี้ส่วนใหญ่ แต่ละรูปแบบคือพรอมต์ที่พร้อมคัดลอกและวางพร้อมการตั้งค่าและคลิปที่ผลิตขึ้น จงใจไม่มีแก้ว ไม่มีสีแดง ไม่มีหินชนวนด้านล่าง: ถ้าทุกคลิปในบัญชีของคุณดูเหมือนกัน อัลกอริทึมจะถือว่ามันเป็นคลิปเดียวกัน
ตาราง 3: ห้าช่องเดียวกัน สามงานที่แตกต่างกัน
| ช่อง | เทมเพลต 1, การตัด | เทมเพลต 2, การเคี้ยว | เทมเพลต 3, ฝน |
|---|---|---|---|
| วัสดุ | รังผึ้งหยด, ใบมีดเหล็กร้อน | หินหลอมเหลวเรืองแสง, ชามหิน | ฝนบนกระจกหน้ารถ |
| รูปร่างการกระทำ | ใบมีดจมจากหน้าไปหลัง, น้ำผึ้งไหลลง | ตะเกียบยก, แล้วสองคำกัด | ไม่มีการกระทำของวัตถุ, มีเพียงหยดน้ำ |
| มุมมองไมโครโฟน | ไมค์ใกล้, แห้งมาก, ไม่มีห้อง | ใกล้มาก, แนบชิด | ด้านนอกกระจก, ภายในรถอู้อี้ |
| ลำดับเสียง | เสียงขี้ผึ้งแตก, เสียงน้ำผึ้งยืด, เสียงหยดบนจาน | เสียงฟู่ของหินหลอม, เสียงเคี้ยวเปียก, เสียงกรุบกรอบแก้ว, เสียงหายใจออก | เสียงฝนพื้นหลังสม่ำเสมอ, หยดน้ำกระทบ, เสียงยางรถดังไกล |
| ข้อปฏิเสธ | ไม่มีดนตรี, ไม่มีเสียง, ไม่มีเสียงก้องห้อง | ไม่มีคำพูด, ไม่มีดนตรี, ไม่มีคำบรรยาย | ไม่มีดนตรี, ไม่มีฟ้าร้อง, ไม่มีเสียง, ไม่มีที่ปัดน้ำฝน |
เทมเพลต 1, การตัด รังผึ้ง สีอำพันและทอง 9:16, 768P, 6 วินาที, ratio: "9:16"
plaintext1มาโครสุด, ภาพมุมสูงล็อกของแผ่นรังผึ้งทองหนาบนจานเซรามิกสีซีด น้ำผึ้งเริ่มรวมตัวรอบๆ แล้ว ใบมีดเหล็กร้อนลดลงในขี้ผึ้งและจมผ่านจากหน้าไปหลังในกดช้าๆ ต่อเนื่องหนึ่งครั้ง หน้าตัดที่ตัดยุบและเส้นน้ำผึ้งหนายืดและหยดลงบนจาน แสงหลักอำพันอุ่นจากซ้าย, ระยะชัดตื้น, เทคเดียว, ไม่มีการตัด, ไม่มีมือในเฟรม 2 3เสียง: ASMR, ไมค์ใกล้, แห้งมาก, ไม่มีเสียงก้องห้อง, ไม่มีดนตรี, ไม่มีเสียง, ไม่มีคำบรรยาย เสียงแตกเบาๆ ของขี้ผึ้งที่แตกใต้ใบมีด, จากนั้นเสียงยืดต่ำหนาเมื่อน้ำผึ้งยาวขึ้น, แล้วหยดเปียกหนักสองหยดลงบนจานเซรามิก ไม่มีอะไรอื่น
ZsVmf9AhPnw
เทมเพลต 1, $0.60 เสียงขี้ผึ้งแตก, น้ำผึ้งยืด, หยด สร้างด้วย minimax/h3/text-to-video
เทมเพลต 2, การเคี้ยว Lava mukbang รูปแบบที่มียอดวิว 11.3 ล้านครั้งในหนึ่งสัปดาห์ 9:16, 768P, 8 วินาที, ratio: "9:16"
plaintext1ภาพ close-up แนวตั้ง: ตะเกียบเคลือบดำคู่หนึ่งยกก้อนลาวาสีส้มเรืองแสงออกจากชามหินสีเข้มและพามันเข้าหากล้อง ออกจากเฟรมด้านล่าง ลาวาเรืองแสงในตัวเอง ฉายแสงสีส้มรอบตัวมัน ที่เหลือของห้องเกือบดำ ไอน้ำลอยขึ้นจากผิว กล้องล็อก, เทคเดียว, ไม่มีการตัด 2 3เสียง: ASMR, ไมค์ใกล้มาก, แนบชิด, ไม่มีคำพูด, ไม่มีดนตรี, ไม่มีคำบรรยาย, ไม่มีเสียงห้อง เสียงฟู่และเดือดต่ำของลาวาเมื่อถูกยก, จากนั้นเสียงเคี้ยวเปียกนุ่ม, แล้วเสียงกรุบกรอบแก้วที่สว่างขึ้นในการกัดครั้งที่สอง, แล้วหายใจออกช้าๆ พอใจหนึ่งครั้ง ไม่มีเสียงพูด
UJhEsTnKkZI
เทมเพลต 2, $0.80 เสียงฟู่, เคี้ยว, กรุบกรอบ, หายใจออก และไม่มีคำพูดสักคำ สร้างด้วย minimax/h3/text-to-video
เทมเพลต 3, ฝน หน้าต่างรถตอนกลางคืน สีฟ้าเย็นและนีออน 16:9, 768P, 10 วินาที, ratio: "16:9"
นี่เป็นเทมเพลตเดียวในสามที่ไม่มีวัตถุเคลื่อนไหว และมันสอนมากที่สุดเกี่ยวกับข้อปฏิเสธ เมื่อไม่มีอะไรเกิดขึ้นบนหน้าจอ H3 จะหาเพลงประกอบเว้นแต่คุณจะห้ามอย่างชัดเจน มันยังเป็นคลิปที่กลับมาพร้อมฟิลด์สเตอริโอกว้างที่สุด โดยไม่ต้องขอ เนื้อหาที่เน้นการนอนหลับต้องการความยาว ดังนั้นอันนี้จึงทำงานใกล้ช่วงระยะเวลาที่มีประโยชน์สูง
plaintext1ภาพมาโครผ่านกระจกหน้ารถตอนกลางคืน ฝนตกหนักไหลลงด้านนอกกระจก หยดน้ำแต่ละหยดกระทบ, หยุด, แล้วไหลลงและรวมกัน เลยกระจกออกไป ป้ายนีออนที่ไม่ชัดแตกเป็นโบเก้สีฟ้าเย็นและม่วงแดง ไม่มีที่ปัดน้ำฝน, ไม่มีคน, ไม่มีการเคลื่อนไหวภายในรถ กล้องล็อก, เทคต่อเนื่องเดียว, ระยะชัดตื้น, ไม่มีการตัด 2 3เสียง: ASMR, ไมค์ใกล้ด้านนอกกระจก, ภายในรถอู้อี้เล็กน้อย เสียงฝนพื้นหลังสม่ำเสมอพร้อมเสียงหยดน้ำกระทบกระจกที่แยกออกจากกันอย่างชัดเจน บวกเสียงยางรถบนถนนเปียกดังไกลเบาๆ ไม่มีดนตรี, ไม่มีฟ้าร้อง, ไม่มีเสียง, ไม่มีคำบรรยาย, ไม่มีเสียงที่ปัดน้ำฝน
bUKr5V6wbdM
เทมเพลต 3, $1.00 สิบวินาทีของบรรยากาศบริสุทธิ์ ไม่มีเสียงประกอบเพราะพรอมต์ห้ามไว้ สร้างด้วย minimax/h3/text-to-video
วิดีโอ ASMR MiniMax H3 ราคาเท่าไหร่จริงๆ
นี่คือใบเสร็จสำหรับบทความนี้ ไม่ใช่การประมาณ
| รายการ | จำนวน | คิดเงิน |
|---|---|---|
| เฟรมฐาน GPT Image 2, คุณภาพสูง, 2048x1152 | 1 | $0.17 |
| คลิปหลัก 2K, 5 วินาที, image-to-video | 1 | $0.70 |
| ร่าง 768P, 5 วินาที, image-to-video | 1 | $0.50 |
| reference-to-video 768P, 5 วินาที | 1 | $0.50 |
| คลิปเทมเพลตที่ 768P, 6s + 8s + 10s | 3 | $2.40 |
| คำขออ้างอิงที่ถูกปฏิเสธ | 2 | $0.00 |
| ยอดรวม | $4.27 |
คลิปที่เผยแพร่ได้หกคลิปและเฟรมฐานหนึ่งเฟรม ขยายเป็นตาราง: คลิปแนวตั้ง 8 วินาทีหนึ่งคลิปต่อวันที่ 768P ราคา $0.80 ดังนั้นประมาณ $24 ต่อเดือน สำหรับบัญชีที่ไม่มีหน้าตาและโพสต์ทุกวัน ก่อนที่คุณจะใช้เวลาสักนาทีในโปรแกรมตัดต่อ
หมายเหตุการเรียกเก็บเงินสองข้อ $0.009 ที่ระบุของ GPT Image 2 คือราคาพื้นระดับโทเค็น การเรนเดอร์คุณภาพสูง 2048x1152 อยู่ที่ $0.1745 เกือบยี่สิบเท่า ดังนั้นให้จัดงบประมาณจากระดับที่คุณใช้จริง และฟิลด์ price ของ H3 จะอัปเดตหลัง มีการหน่วงเวลา: ให้ poll จนกว่า status เป็น completed และบ่อยครั้งที่มันยังเป็น undefined Poll ID การคาดคะเนอีกครั้งหลังจากนั้นสักครู่เพื่อให้ได้ตัวเลขจริง การ poll ครั้งที่สองนั้นเป็นวิธีเดียวที่จะสร้างใบเสร็จแบบนี้ได้แทนที่จะเป็นเพียงการเดา
หมายเหตุซื่อสัตย์หนึ่งข้อเกี่ยวกับเสียง ASMR และสิทธิ์
อย่าอัปโหลดการบันทึก ASMR ของคนอื่นเป็นไฟล์เสียง refers การอ้างอิงจะถ่ายโอนโทนเสียงไปยังเอาต์พุตจริงๆ และการรันการบันทึกผ่านโมเดลไม่ได้เปลี่ยนความเป็นเจ้าของ การอ้างอิงที่ใช้ที่นี่เป็น CC BY 4.0 และให้เครดิตข้างต้น ซึ่งใช้เวลาประมาณสองนาทีในการหาแหล่ง
อย่าสร้าง ASMR รอบเสียงของบุคคลจริงที่รู้จัก เทมเพลตทุกอันในบทความนี้จงใจไม่มีเสียง ซึ่งเป็นทั้งธรรมเนียมของประเภทและเส้นทางที่ซับซ้อนน้อยที่สุด
การเรียก H3 ผ่าน API ไม่ได้รับผลกระทบจากใบอนุญาตชุมชนที่แนบมากับน้ำหนักเปิด ใบอนุญาตนั้นซึ่งครอบคลุมการโฮสต์ด้วยตนเอง ปัจจุบันยกเว้น EU, UK, เกาหลี และสหรัฐฯ และมีช่องทางการอนุญาตอย่างเป็นทางการสำหรับดินแดนเหล่านั้น ควรรู้ไว้ ไม่ต้องกังวลถ้าคุณกำลังใช้เอนด์พอยต์
วิดีโอ ASMR MiniMax H3: คำถามที่พบบ่อย
วิดีโอ ASMR MiniMax H3 สร้างเสียงของตัวเองหรือฉันต้องเพิ่มทีหลัง?
โมเดลสร้างมันขึ้นมา ภาพและเสียงออกมาจากรอบเดียวกัน: วิดีโอ 24 fps พร้อมแทร็ก AAC สเตอริโอที่ 32 kHz ในไฟล์ที่ส่งมอบ ไม่มีขั้นตอนเสียงแยก ไม่มีคลังเสียง และไม่มีงานจัดตำแหน่ง ซึ่งเป็นเหตุผลทั้งหมดที่เอนด์พอยต์นี้น่าสนใจสำหรับ ASMR โดยเฉพาะ
ฉันสามารถทำให้วิดีโอ ASMR MiniMax H3 แพนจากซ้ายไปขวาได้ไหม?
ไม่ได้โดยการขอ ผมเขียนคำสั่งช่องสัญญาณอย่างชัดเจนในพรอมต์และวัดผล: ความสัมพันธ์ระหว่างช่อง 0.97 และความแตกต่างระดับสูงสุด 1.9 dB ในหน้าต่างหนึ่งในสี่วินาที ซึ่งไม่ใช่การแพนเลย แทร็กเป็นสเตอริโอจริง และเนื้อหากระจายเช่นฝนกลับมาพร้อมฟิลด์กว้าง แต่เสียงกระทบที่ไม่ต่อเนื่องยังคงอยู่ตรงกลางไม่ว่าคำจะพูดอะไร ถ้ารูปแบบของคุณต้องการการแพนที่ชัดเจน ให้ทำในขั้นตอนหลัง
ฉันสามารถอัปโหลดการบันทึกของตัวเองเป็นข้อมูลอ้างอิงวิดีโอ ASMR MiniMax H3 ได้ไหม?
ได้ผ่าน reference-to-video ซึ่งรับข้อมูลอ้างอิงเสียงสูงสุด 3 ไฟล์ควบคู่กับภาพสูงสุด 9 ภาพและวิดีโอ 3 ไฟล์ เสียงไม่สามารถส่งคนเดียวได้ ดังนั้นจับคู่กับภาพหรือวิดีโออย่างน้อยหนึ่งชิ้น เสียงต้องมีความยาวระหว่าง 2 ถึง 15 วินาที และรูปแบบจะถูกตรวจสอบ: เพย์โหลด .wav ทำงานได้ในขณะที่ audio/mpeg ถูกปฏิเสธ คำขอที่ถูกปฏิเสธจะไม่ถูกคิดเงิน
เสียงของวิดีโอ ASMR MiniMax H3 ที่ 768P แย่กว่าที่ 2K หรือไม่?
ไม่ ทั้งสองระดับส่งมอบสเปก AAC สเตอริโอ 32 kHz เดียวกัน มีเพียงภาพที่เปลี่ยน และมันเปลี่ยนมาก: 16:9 กลับมาเป็น 1344x768 ที่ 768P เทียบกับ 2560x1440 ที่ 2K เนื่องจากการตัดสินใจเชิงสร้างสรรค์ใน ASMR คือการตัดสินใจจากการฟัง ให้ร่างที่ $0.10/วินาที และรันคลิปที่เก็บไว้ใหม่ที่ $0.14/วินาที แค่จำไว้ว่าการรัน 2K คือเทคใหม่ ไม่ใช่การอัปสเกลของร่าง
วิดีโอ ASMR MiniMax H3 ควรยาวเท่าไหร่ และสัดส่วนเท่าไหร่?
ระยะเวลารับจำนวนเต็มวินาทีใดๆ ตั้งแต่ 4 ถึง 15 คลิปตัดและเคี้ยวทำงานที่ 5 ถึง 8 วินาทีเพราะผลตอบแทนคือเหตุการณ์เดียว บรรยากาศที่เน้นการนอนหลับต้องการ 10 หรือมากกว่า สำหรับ Shorts, Reels และ TikTok ใช้ 9:16 และจำไว้ว่า text-to-video ต้องการให้ตั้งค่า ratio อย่างชัดเจนและปฏิเสธ adaptive สำหรับ image-to-video เฟรมแรกจะกำหนดรูปทรงให้คุณ
วิดีโอ ASMR MiniMax H3 หนึ่งคลิปราคาเท่าไหร่?
คลิป 5 วินาทีคิดเงิน $0.50 ที่ 768P และ $0.70 ที่ 2K คลิปแนวตั้ง 8 วินาทีที่ 768P ราคา $0.80 การโพสต์หนึ่งคลิปต่อวันคือประมาณ $24 ต่อเดือนในค่าคอมพิวเตอร์ ซึ่งเป็นตัวเลขที่ควรเปรียบเทียบกับเวลา 20 นาทีที่โปรแกรมตัดต่อจะใช้ต่อคลิปในเวิร์กโฟลว์แบบต่อกัน
ทำไมวิดีโอ ASMR MiniMax H3 ของฉันถึงมีดนตรีประกอบที่ฉันไม่ได้ขอ?
เพราะคุณไม่ได้ห้ามมัน วิดีโอส่วนใหญ่ในข้อมูลฝึกของโมเดลใดๆ มีดนตรีประกอบ ดังนั้นพฤติกรรมเริ่มต้นคือการเพิ่มหนึ่ง โดยเฉพาะเมื่อไม่มีอะไรเกิดขึ้นบนหน้าจอ ใส่ข้อปฏิเสธในส่วนเสียงของพรอมต์อย่างชัดเจน: no music, no voice, no narration, no room reverb, no ambience bed เทมเพลตบรรยากาศต้องการสิ่งนี้มากกว่าเทมเพลตที่มีการกระทำ






