ضع سماعات الرأس قبل أن تتصفح الفيديو أدناه. في هذه الفئة، الأمر مهم حقًا.
سكين يهوي عبر رمانة منحوتة من الزجاج الياقوتي. تنشق القشرة، صدع بلوري، ثم تتدحرج عشرات الحبات الزجاجية عبر لوح أردوازي رطب. إليك الجزء المختلف عن كل فيديو ASMR تقريبًا من إنتاج الذكاء الاصطناعي مررت به هذا العام: لم يضف أحد ذلك الصوت. لم تكن هناك مكتبة أصوات، ولا محرر، ولا خط زمني. الصورة والصوت خرجا من توليد واحد، في استدعاء واحد.
على مدار العام الماضي، بدا فيديو ASMR من الذكاء الاصطناعي مُرضيًا بصريًا لكن صوته كان خاطئًا بعض الشيء، ولم يكن السبب أبدًا في المرئيات. بل كان في الخطوة الأخيرة من سير العمل. لصق الصوت على مقطع صامت كان مهمة يدوية، تتم يدويًا، في كل مرة. نمت الفئة بسرعة حول تلك الفجوة لدرجة ظهور صناعة صغيرة من مواقع توليد ASMR بالذكاء الاصطناعي المخصصة لأتمتة عملية اللصق، أحدها يعلن عن "صوت ثلاثي الأبعاد بكلتا الأذنين" مباشرة على الصفحة الرئيسية. كان الطلب مثبتًا منذ زمن. لكنه كان يُلبى عبر التجميع.
لذا قمت بتشغيل الأمر بشكل صحيح. سير عمل واحد قابل للتكرار، ستة مقاطع، ثم الجزء الذي لا يفعله أحد في هذه الفئة مطلقًا: فصلت قناتي الصوت اليمنى واليسرى في ffmpeg وقستهما. بعض ما توقعته كان خاطئًا، وتبين أن ذلك هو أكثر شيء مفيد في المقال.
الخلاصات الرئيسية
- يقدم H3 صورة بمعدل 24 إطارًا في الثانية ومسار صوت استريو AAC بتردد 32 كيلوهرتز في نفس الممر. الصوت مولّد، وليس مدبلجًا لاحقًا.
- الاستريو حقيقي، وليس مزدوج القناة الأحادية مرتديًا زي استريو. لكن لا يمكنك توجيه تحريك الصوت (Pan). طلبت مسحًا صعبًا من اليسار إلى اليمين وحصلت على فرق قدره 1.9 ديسيبل، وهو لا شيء.
- عرض الاستريو يأتي من المحتوى، وليس من صياغتك. مقطع المطر، حيث لم أطلب أي اتجاه، عاد بحقل عريض حقًا.
- تثبيت الإطار الأول يبقي اللقطة عبر الدقات، لكن دقة 768P و 2K لا تزال لقطتين مختلفتين. المسودة تعطي نظرة على المظهر ومواصفات الصوت، وليس التصميم الحركي الدقيق.
- مقطع بطول 5 ثوان بدقة 768P يكلف 0.50 دولار. نفس المقطع بدقة 2K يكلف 0.70 دولار. كلفة المقال كاملًا 4.27 دولار.
استمع أولاً: فيديو ASMR من MiniMax H3، مقطع واحد في ممر واحد
w7ZRR7bo3KI
خمس ثوانٍ، 2K، 24 إطارًا في الثانية، استريو 32 كيلوهرتز، توليد واحد، 0.70 دولار. الصوت قيد التشغيل: صرير حافة السكين وهي تغوص، الصدع، ثم الحبات. لم يُضف أي منها لاحقًا. تم التوليد باستخدام minimax/h3/image-to-video.
موجه واحد. نموذج واحد. استدعاء واحد. كل ما يلي هو كيفية صنع ذلك المقطع، وما كلفه، وأي أجزاء من القصة التسويقية تصمد عند ملامستها لشكل الموجة.
لماذا انفجر AI ASMR، ولماذا يفشل معظمه في اختبار سماعات الرأس
للظاهرة عيد ميلاد. بدأ انتشار AI ASMR في يونيو 2025، مباشرة بعد إطلاق Veo 3، وتحول التنسيق إلى ظاهرة عالمية في غضون أيام. فيديو "مأكبات الحمم" من @asmraiworks حصد أكثر من 11.3 مليون مشاهدة في أسبوع؛ مقطع تقطيع زجاج حصل على 5.3 مليون في أحد عشر يومًا (Know Your Meme، 2025). التقطته غرف الأخبار كفضول، مع صور سريالية وحمم منصهرة تؤكل بعيدان الطعام تقوم بالجزء الأكبر من الجذب (The Express Tribune، 2025).
ثم وضع الناس سماعات الرأس، وتغير المزاج. كاتب TechRadar شاهد كومة من المقاطع الفيروسية وخرج يصف غشاءً من الاصطناعية، "تفتقر إلى الأخطاء وعدم الدقة التي هي السمة المميزة لـ ASMR البشري" (TechRadar، يونيو 2025). المعجبون المذكورون في تلك المقالة قالوا إن محفزات الدغدغة كانت موجودة تقنيًا وما زالت ليست نفس الشيء.
هناك سبب ميكانيكي، وهو ليس غامضًا. ASMR هي فئة المحتوى الوحيدة حيث المحتوى هو الصوت. في كل مكان آخر، الصوت هو زينة. هنا هو المنتج. وسير العمل السائد كان:
- توليد مقطع صامت بنموذج فيديو،
- البحث في مكتبة أصوات عن صدع، أو طقطقة، أو فراش مطر،
- محاذاة الصوت مع الصورة في محرر،
- التحريك اليدوي والمزج اليدوي إذا كنت تهتم، وهو ما لا يفعله أحد تقريبًا عند الإنتاج بكميات،
- التصدير.
الخطوة 3 هي حيث يموت. صدع معلب يطلق بعد إطارين يُقرأ على أنه مزيف قبل أن تشرح لماذا. اضرب ذلك بجدول نشر يومي وتتضاعف الأخطاء، لأن المحاذاة تُعاد بواسطة إنسان في كل مرة.
تلك الفجوة هي السبب وراء وجود صناعة كاملة ناشئة من مواقع توليد AI ASMR. ثلاثة على الأقل تسوق بنشاط، وأحدهم يقدم الصوت ثلاثي الأبعاد بكلتا الأذنين كميزة رئيسية. إنهم لا يحلون مشكلة وهمية. إنهم يسدون فجوة حقيقية: نماذج الفيديو الأساسية لا تنتج صوتًا.
مما يجعل انقسامًا في لوحة المتصدرين جديرًا بالنظر. على لوحة تحرير الفيديو في Artificial Analysis، تلك التي تُسجل بالصوت، يحتّل MiniMax H3 المركز الأول بـ 1,126 إيلو، متقدمًا على Gemini Omni Flash بـ 1,119 وحوالي مائة نقطة فوق Dreamina Seedance 2.0 بـ 1,027 (Artificial Analysis، أغسطس 2026). على لوحات الصورة إلى فيديو، حيث الصوت ليس جزءًا من النتيجة، توجد عدة من تلك النماذج ضمن بضع نقاط من بعضها البعض. الفجوة تفتح عندما يحسب الصوت. بالنسبة لـ ASMR، الصوت هو كل ما يحسب.
سير عمل فيديو ASMR من MiniMax H3، وتكلفة كل خطوة
ثلاث نقاط نهاية، علامة تبويب متصفح واحدة. قمت بتشغيل كل شيء في هذه المقالة على Atlas Cloud، لذا فإن كل رقم أدناه جاء من الفاتورة وليس من بطاقة الأسعار.
| الوظيفة في هذه المقالة | النموذج | السعر |
|---|---|---|
| الإطار الأول للمعرض | OpenAI GPT Image 2 (نص إلى صورة) | مسجل من $0.009/صورة، تمت الفوترة بـ $0.1745 عند الجودة العالية و 2048x1152 |
| المسودة والحافظة | MiniMax H3 صورة إلى فيديو | $0.10/ثانية عند 768P، $0.14/ثانية عند 2K |
| تغذية تسجيل حقيقي | MiniMax H3 مرجع إلى فيديو | نفس المستويين |
| القوالب الثلاثة | MiniMax H3 نص إلى فيديو | نفس المستويين |
| الطريقة القديمة، نصف الصوت فقط | ByteDance Seed Audio 1.0 | $0.143/دقيقة |
القائمة تظهر "من $0.1/ثانية" على جميع نقاط نهاية H3 الثلاثة. هذا هو الحد الأدنى لدقة 768P. دقة 2K تُفوتر بـ $0.14/ثانية وهذا الرقم لا يظهر في أي مكان إلا في فاتورتك، لذا خطط بناءً على المستوى الذي تطلبه فعليًا.
الجدول 1: ممر واحد مقابل خط الأنابيب المُجمّع.
| MiniMax H3، صوت أصلي | نموذج صامت + صوت لاحق | |
|---|---|---|
| خطوات للحصول على مقطع منتهي | 1 | 4 إلى 5 |
| الأدوات المستخدمة | 1 | نموذج فيديو + مكتبة أصوات + محرر + تصدير |
| كيف تبقى الصورة والصوت متزامنين | نفس التوليد، نفس الخط الزمني | أنت تسحبه حتى يبدو صحيحًا |
| من يقوم بالمزج والتحريك | لا أحد، تأخذ ما يعطيك النموذج | أنت، يدويًا، لكل صوت |
| الوقت البشري لكل مقطع | تقريبًا صفر بعد الموجه | 15 إلى 40 دقيقة، بصراحة |
| الحوسبة لكل مقطع 5 ثوان | $0.50 عند 768P | نموذج فيديو + $0.143/دقيقة من توليد الصوت |
أنا أتعمد عدم ذكر معدل كل ثانية لمنصة فيديو منافسة، لأن الحوسبة ليست مكان الفرق. توليد الصوت يكلف 0.143 دولار في الدقيقة، وهو قرش. التكلفة الحقيقية لخط الأنابيب المُجمّع هي 20 دقيقة من الاهتمام البشري لكل مقطع، وهذه التكلفة لا تنخفض مع التوسع. بل تتضاعف. حساب ينشر يوميًا بدون وجه هو بالضبط المكان الذي تلتهم فيه 20 دقيقة لكل مقطع نموذج العمل بأكمله بهدوء.
المقابل الصادق: التجميع اليدوي يشتري لك التحكم. يمكنك وضع صوت في أي مكان في حقل الاستريو وتقليمه للإطار. H3 يعطيك التزامن مجانًا، وكما تظهر القياسات أدناه، لا يعطيك ذلك التحكم مرة أخرى.
الجدول 2: نقاط نهاية H3 الثلاثة، المعلمات التي تهم حقًا.
| صورة إلى فيديو | نص إلى فيديو | مرجع إلى فيديو | |
|---|---|---|---|
| الإدخال الرئيسي | صورة (إطار أول) | موجه فقط | refers[] |
| الدقة | 768P / 2K، الافتراضي 2K | نفس | نفس |
| المدة | أي ثانية كاملة من 4 إلى 15، الافتراضي 8 | نفس | نفس |
| النسبة | يقررها الإطار الأول | يجب ضبطها صراحة، مرفوض إذا كان adaptative | تقررها المراجع |
| حدود refers | لا تستخدم مع الصورة | لا تستخدم | حتى 9 صور، 3 فيديوهات، 3 صوتيات |
| مخرج 16:9 | 1344x768 عند 768P، 2560x1440 عند 2K | نفس | نفس |
| المسار الصوتي | AAC استريو 32 كيلوهرتز فوق فيديو 24 إطارًا/ثانية | نفس | نفس |
مصيدة معلمتين تستحق الكتابة على يدك. المعلمة تسمى ratio، وليس aspect_ratio، والمفتاح الخاطئ يتركها غير مضبوطة لذا يرفض text-to-video الطلب. و image مع refers في نفس الاستدعاء لا يخطئ: يكتمل، ويُفوتر بالكامل، ويرمي بصمت أحد الإدخالين.
تعليمي فيديو ASMR من MiniMax H3: تقطيع رمانة زجاجية
تقطيع الفاكهة الزجاجية هو التنسيق الذي يعرفه الجميع، لذا يعرف القارئ فورًا ما ينظر إليه. التفاح الزجاجي والمانجو الزجاجي قد تم تكرارهم حتى الموت. لكن الرمانة أفضل لسبب واحد محدد: عندما تنشق القشرة، تنسكب مئات الحبات الزجاجية وتتدحرج، لذا الصوت له مدة وهيكل بدلاً من أن يكون تأثيرًا واحدًا مركزًا. إذا كان النموذج يزيف صوته، فإن التشتت هو المكان الذي يظهر فيه.
الخطوة 1: بناء الإطار الأساسي باستخدام GPT Image 2
أغلق التكوين قبل أن تنفق أي شيء على الفيديو. الإعدادات: quality: high، size: 2048x1152 (16:9)، output_format: png.
plaintext1صورة ماكرو مقربة شديدة لرمانة كاملة منحوتة بالكامل من زجاج ياقوتي سميك شفاف، 2تستريح على لوح أردوازي أسود رطب. القشرة الزجاجية سمكها 8 مم 3مع فقاعات داخلية مرئية وأوجه متكسرة؛ مئات الحبات الزجاجية الصغيرة تتوهج 4في الداخل مثل بلورات العقيق. سكين سانتوكو ياباني مصقول يقع عند الحافة اليسرى 5من الإطار، طرف النصل يلامس الجلد الزجاجي. ضوء رئيسي قاسٍ من الأعلى 6اليمين يمر عبر اللوح ويلقي انعكاسات حمراء حادة على الحجر الرطب. 7عدسة ماكرو 100 مم، f/2.8، عمق مجال ضحل، خلفية داكنة مودي. 8لا أيدي، لا نص، لا علامة مائية، لا شعار.

ملعب GPT Image 2 على Atlas Cloud مع الجودة مضبوطة على عالية والحجم 16:9 2048x1152، الرمانة الزجاجية معروضة في لوحة OUTPUT
التشغيل الحقيقي. الجودة high عند 2048x1152، والصفحة تسجل $0.1745، وهو ما قالته الفاتورة لاحقًا أيضًا.

الإطار الأساسي المُولّد: رمانة منحوتة من زجاج ياقوتي سميك على لوح أردوازي أسود رطب، سكين سانتوكو تدخل من الحافة اليسرى
الإطار الذي تم تسليمه إلى H3. تم التوليد باستخدام openai/gpt-image-2/text-to-image.
الخطوة 2: كتابة نصف الصوت لموجه فيديو ASMR من MiniMax H3
معظم الناس يكتبون موجه ASMR كوصف صورة مع كلمة "ASMR" ملصقة في المقدمة، ثم يتساءلون لماذا يسجله النموذج بموسيقى بيانو منخفضة الجودة. H3 يأخذ التوجيه الصوتي بجدية إذا أعطيته أيًا. بني نصف الصوت في خمس فتحات:
- المادة. ما الذي يصدر الصوت. زجاج، شمع، صخر منصهر، ماء على زجاج. كن محددًا بشأن السمك والرطوبة، فهما يغيران الجرس الصوتي.
- الفعل وشكله في الزمن. ليس فقط "يقطع" بل "يضغط لأسفل في حركة مستمرة بطيئة واحدة". النموذج يستخدم هذا لوضع الأحداث.
- منظور الميكروفون.
close-mic،intimate، إشارات مسافة التسجيل. هذا يحدد مدى جفاف وقرب الصوت، ويعمل بشكل جيد. - تسلسل المحاكاة الصوتية. قم بتهجئة الأحداث الصوتية بالترتيب: صرير، ثم صدع، ثم عشرات التأثيرات الصغيرة، ثم صمت. هذه هي الفتحة التي تقوم بأكبر قدر من العمل.
- النفي.
no music, no voice, no narration, no room reverb, no ambience bed. بدون هذه، سيضيف H3 موسيقى تصويرية بشكل مفيد، لأن معظم الفيديو في بيانات تدريبه يحتوي على واحدة.
أيضًا كتبت توجيهات القنوات في الفتحة 4، طالبة الصدع في القناة اليسرى والحبات تتدحرج من اليسار إلى اليمين. تابع القراءة لترى ما أنتجه ذلك فعليًا.
الخطوة 3: تشغيل المسودة بدقة 768P
مسودة بدقة 768P. المسار الصوتي هو نفس المواصفات في كلا المستويين، لذا يمكن اتخاذ الحكم الإبداعي بأكمله، والذي في ASMR هو حكم استماعي، بالسعر الرخيص.
الإعدادات على minimax/h3/image-to-video: image = ناتج الخطوة 1، resolution: 768P، duration: 5. النسبة تأتي من الإطار الأول، لذا اتركها كما هي.
plaintext1نصل السانتوكو يدخل من اليسار ويضغط لأسفل عبر الرمانة الزجاجية 2في حركة مستمرة بطيئة واحدة، متجهًا من اليسار إلى اليمين عبر الإطار. تنشق القشرة 3بصدع بلوري لامع ورذاذ من حبات زجاجية صغيرة يتساقط على اللوح الأردوازي 4الرطب، متشتتًا نحو الحافة اليمنى. الكاميرا مثبتة، ماكرو، لقطة واحدة، لا تقطيع. 5 6الصوت: ASMR، ميكروفون قريب، حميمي، لا موسيقى، لا صوت، لا سرد، لا رنين غرفة. 7صرير زجاجي جاف مستمر بينما تغوص الحافة، ثم صدع عالٍ حاد واحد مُحرك إلى القناة 8اليسرى، متبوعًا بعشرات من تأثيرات الحبات الصغيرة المتدحرجة من القناة 9اليسرى عبر إلى القناة اليمنى وهي تتشتت. خدش طفيف للنصل على الحجر في 10النهاية، ثم صمت. لا فراش أجواء، لا همهمة، لا موسيقى خلفية.

ملعب MiniMax H3 صورة إلى فيديو على Atlas Cloud مع الإطار الأساسي محملًا، المدة 5، ومقطع مكتمل في لوحة OUTPUT
تشغيل صورة إلى فيديو: الإطار الأول محمل، المدة 5، OUTPUT مكتمل. لاحظ أن اختيار الدقة جالس على الإعداد الافتراضي للصفحة وهو 2K. قم بتحويله إلى 768P للمسودات، وهو ما تم عرض المقطع أدناه به.
xkolGEKI7UI
المسودة بدقة 768P، 0.50 دولار. صورة أكثر نعومة من مقطع البطل، نفس مواصفات الصوت. هذه هي اللقطة التي يُتخذ عليها القرار بأكمله.
الخطوة 4: قياس الاستريو قبل أن تثق به
لا تأخذ كلامي عن الصوت، ولا كلام النموذج. افصل القنوات وانظر. هذا هو ffmpeg محليًا، لا استدعاء API، لا تكلفة:
plaintext1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \ 2 -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \ 3 -frames:v 1 stereo-proof.png

تحليل شكل موجة بأربع لوحات يقارن مقطع الرمانة الزجاجية ومقطع المطر، يظهر القنوات اليسرى واليمنى بالإضافة إلى القناة الجانبية لكل منهما
القناة اليسرى فوق القناة اليمنى لمقطعين، بالإضافة إلى القناة الجانبية (اليسار ناقص اليمين) عند كسب مطابق أدناه. هذه هي الحجة بأكملها في صورة واحدة.
إليك ما عاد، وجزء منه ليس ما توقعته.
الاستريو حقيقي. القناة الجانبية ليست فارغة في أي مقطع قمت بتوليده. ملف أحادي مزدوج يرتدي زي استريو سيظهر لا شيء هناك. هذا يحتوي على محتوى.
لكن لا يمكنك توجيه تحريك الصوت. طلبت، بأحرف كبيرة، الصدع في القناة اليسرى والحبات تتدحرج من اليسار إلى اليمين. المقاس: ارتباط القنوات 0.97، القناة الجانبية تجلس 17.7 ديسيبل تحت المنتصف، وأكبر فرق مستوى بين اليسار واليمين في أي نافذة ربع ثانية هو 1.9 ديسيبل. هذا ليس تحريك صوت. هذه صورة مركزية مع عرض طبيعي صغير. السكين يسافر عبر الإطار؛ الصوت يبقى في مكانه.
العرض يأتي من المحتوى، وليس من صياغتك. مقطع المطر في القسم التالي، حيث لم أطلب أي اتجاه، عاد بارتباط 0.32 مع القناة الجانبية فقط 2.9 ديسيبل تحت المنتصف. هذا حقل عريض حقًا، غير مترابط. الأجواء المنتشرة تحصل على العرض تلقائيًا. التأثيرات المنفصلة تبقى قريبة من المركز بغض النظر عن ما تكتب.
لذا الادعاء الصادق لهذا النموذج ليس مكانيًا. إنه زمني. تحصل على صوت تم توليده جنبًا إلى جنب مع الصورة ويهبط على الإطار الذي ينتمي إليه، مجانًا، إلى الأبد، بدون محرر. إذا كان تنسيقك يحتاج حقًا إلى تحريك صوتي صعب، فلا يزال عليك فعل ذلك بنفسك في مرحلة ما بعد الإنتاج، ويجب أن تتوقف عن كتابة أسماء القنوات في الموجهات لأنها لا تفعل شيئًا.
الآن أعد تشغيل الحافظة: نفس نقطة النهاية، نفس الإطار الأول، نفس الموجه، غيّر حقلًا واحدًا إلى resolution: 2K. شيء آخر يستحق المعرفة قبل أن تفترض أن المسودة هي معاينة.

صفان من خمس إطارات يقارنان تشغيل 768P و 2K في نفس الأختام الزمنية، متطابقان عند الإطار صفر ومتباعدان من حوالي 2.5 ثانية
نفس الإطار الأول، نفس الموجه، كلا المستويين. الإطار 0 يتطابق تمامًا. بحلول 2.5 ثانية تنشق القشرة بشكل مختلف ويصبح المقطعان لقطتين مختلفتين.
تثبيت الإطار الأول يحافظ على التكوين والتأطير والإضاءة واللون عبر كلا المستويين، ولهذا السبب يجب دائمًا استخدام صورة إلى فيديو بدلاً من نص إلى فيديو لهذا. لا يعطيك نفس اللقطة. تشغيل 2K يعيد دحرجة الفعل. عامل المسودة كمعاينة للمظهر والصوت، وليس للتصميم الحركي الدقيق.
الخطوة 5: إضافة تسجيل حقيقي كمرجع فيديو ASMR من MiniMax H3
إذا كان لديك صوت تريده بالفعل، سلمه. reference-to-video يقبل حتى 9 صور و 3 فيديوهات و 3 مقاطع صوتية، ويسحب الجرس الصوتي وطابع الغرفة من مرجع صوتي بدلاً من اختراعها. استخدمت تسجيلًا لكسور الزجاج من Gravity Sound من ويكيميديا كومنز (CC BY 4.0)، ثلاث لقطات مدمجة إلى 4.5 ثوانٍ.
ثلاث قواعد، وجدت الأخيرين بالطريقة الصعبة بعد رفض الطلبات:
- لا يمكن للصوت أن يذهب بمفرده. نقطة النهاية تشرح ذلك: مطلوب صورة واحدة على الأقل أو فيديو، والصوت بمفرده غير مسموح. قم بإقرانه بإطار.
- يجب أن يكون المرجع الصوتي بين 2 و 15 ثانية. محاولتي الأولى استخدمت مقطعًا بطول 1.49 ثانية وعادت بـ
audio duration 1486 ms, expected [2000, 15000] ms. هذا النطاق غير موجود على صفحة النموذج. - تنسيق الملف يتم التحقق منه. تم رفض حمولة base64 معلنة كـ
audio/mpegمعaudio format ".mpeg" not allowed. حمولة.wavمرت. الطلبات المرفوضة لا تُفوتر، لكنها تكلفك رحلة ذهابًا وإيابًا.
الإعدادات: refers: [{url: <base frame>, type: "image"}, {url: <a 2 to 15s recording>, type: "audio"}]، resolution: 768P، duration: 5.
plaintext1نفس اللقطة الماكرو المثبتة: النصل يقطع الرمانة الزجاجية من اليسار إلى اليمين 2وتتشتت الحبات. طابق الجرس الصوتي والسطوع وطابع الغرفة للصوت المرجعي، 3نفس مسافة التسجيل، نفس الجفاف. ASMR ميكروفون قريب، لا موسيقى، لا صوت.

ملعب MiniMax H3 مرجع إلى فيديو على Atlas Cloud مع مادتين مرجعيتين محملتين، ملف صوتي في الفتحة 1 والإطار الأساسي في الفتحة 2
المواد المرجعية تحمل الملف الصوتي والصورة معًا، 2 من 9 مستخدمة. أسقط الصورة ولن يعمل الطلب أبدًا.
mY1VrOfM3cM
اللقطة الموجهة بالمرجع، 0.50 دولار. نفس اللقطة، الجرس الصوتي مُوجه بواسطة تسجيل حقيقي بدلاً من اختراعه من الموجه. المرجع الصوتي: كسر زجاج بواسطة Gravity Sound، CC BY 4.0.
ثلاثة قوالب فيديو ASMR من MiniMax H3: القطع، المضغ، المطر
ثلاثة تنسيقات تغطي معظم ما يؤدي في هذه الفئة. كل واحد هو موجه كامل قابل للنسخ واللصق مع الإعدادات والمقطع الذي أنتجه. عمدًا لا زجاج، لا أحمر، لا أردواز في أي مكان أدناه: إذا كانت كل مقاطع حسابك تبدو متشابهة، تعامل الخوارزمية معها كأنها نفس المقطع.
الجدول 3: نفس الفتحات الخمسة، ثلاث وظائف مختلفة.
| الفتحة | القالب 1، القطع | القالب 2، المضغ | القالب 3، المطر |
|---|---|---|---|
| المادة | قرص عسل يقطر، نصل فولاذي ساخن | صخر منصهر متوهج، وعاء حجري | مطر على زجاج نافذة سيارة |
| شكل الفعل | النصل يغوص من الأمام إلى الخلف، العسل يسحب لأسفل | عيدان الطعام ترفع، ثم قضمتان | لا فعل موضوعي، قطرات فقط |
| منظور الميكروفون | ميكروفون قريب، جاف جدًا، لا غرفة | قريب للغاية، حميمي | خارج الزجاج، مقصورة مكتومة |
| تسلسل الصوت | طقطقة شمع، تمدد عسل، قطرة على صحن | أزيز منصهر، مضغ رطب، طقطقة زجاجية، زفير | فراش مطر ثابت، ضربات قطرات، هسهسة إطارات بعيدة |
| النفي | لا موسيقى، لا صوت، لا رنين غرفة | لا كلمات، لا موسيقى، لا سرد | لا موسيقى، لا رعد، لا صوت، لا ماسحات |
القالب 1، القطع. قرص عسل، كهرماني وذهبي، 9:16، 768P، 6 ثوانٍ، ratio: "9:16".
plaintext1ماكرو شديد، لقطة علوية مثبتة لقرص عسل سميك ذهبي على صحن سيراميك شاحب، 2عسل يتجمع حوله بالفعل. نصل فولاذي ساخن ينزل في الشمع 3ويغوص من خلاله من الأمام إلى الخلف بضغط مستمر بطيء واحد؛ تتساقط وجوه القطع 4وخيط ثقيل من العسل يتمدد ويقطر على الصحن. ضوء رئيسي كهرماني دافئ 5من اليسار، عمق مجال ضحل، لقطة واحدة، لا تقطيع، لا أيدي في الإطار. 6 7الصوت: ASMR، ميكروفون قريب، جاف جدًا، لا رنين غرفة، لا موسيقى، لا صوت، لا سرد. 8طقطقة ناعمة للشمع ينشق تحت النصل، ثم سحب شديد منخفض سميك بينما يطول 9العسل، ثم قطرتان رطبتان ثقيلتان تهبطان على الصحن السيراميكي. لا شيء آخر.
ZsVmf9AhPnw
القالب 1، 0.60 دولار. طقطقة شمع، تمدد عسل، قطرة. تم التوليد باستخدام minimax/h3/text-to-video.
القالب 2، المضغ. مأكبات الحمم، التنسيق الذي حصد 11.3 مليون مشاهدة في أسبوع، 9:16، 768P، 8 ثوانٍ، ratio: "9:16".
plaintext1لقطة قريبة عمودية: زوج من عيدان الطعام السوداء المطلية ترفع كتلة متوهجة من الحمم 2البرتقالية المنصهرة من وعاء حجري داكن وتحملها نحو الكاميرا، خارج الإطار في 3الأسفل. الحمم تضيء ذاتيًا، تلقي ضوءًا برتقاليًا على كل شيء حولها؛ 4بقية الغرفة سوداء تقريبًا. بخار يتصاعد من السطح. كاميرا مثبتة، 5لقطة واحدة، لا تقطيع. 6 7الصوت: ASMR، ميكروفون قريب للغاية، حميمي، لا كلمات، لا موسيقى، لا سرد، لا نغمة غرفة. 8أزيز منصهر وفقاعات منخفضة بينما تُرفع الحمم، ثم مضغ رطب ناعم، ثم 9طقطقة زجاجية أكثر سطوعًا عند القضمة الثانية، ثم زفير واحد بطيء راضٍ. لا كلام.
UJhEsTnKkZI
القالب 2، 0.80 دولار. أزيز، مضغ، طقطقة، زفير، وليس كلمة واحدة. تم التوليد باستخدام minimax/h3/text-to-video.
القالب 3، المطر. نافذة سيارة ليلاً، أزرق بارد ونيون، 16:9، 768P، 10 ثوانٍ، ratio: "16:9".
هذا هو الوحيد من الثلاثة بدون فعل موضوعي، وهو يعلم أكثر شيء عن النفي. مع عدم حدوث شيء على الشاشة، يمد H3 يده إلى فراش موسيقي ما لم تمنعه صراحة. إنه أيضًا المقطع الذي عاد بأوسع حقل استريو على الإطلاق، دون أن يُطلب منه. المحتوى الموجه للنوم يريد الطول، لذا هذا يعمل بالقرب من أعلى نطاق المدة المفيد.
plaintext1لقطة ماكرو من داخل نافذة سيارة ليلاً، مطر غزير يجري على 2الخارج من الزجاج. قطرات فردية تضرب، تتردد، ثم تندفع لأسفل وتندمج. 3وراء الزجاج، لافتات نيون غير واضحة تنكسر إلى بوكيه أزرق بارد وأرجواني. 4لا ماسحات، لا أشخاص، لا حركة داخل السيارة. كاميرا مثبتة، لقطة 5مستمرة واحدة، عمق مجال ضحل، لا تقطيع. 6 7الصوت: ASMR، ميكروفون قريب على الخارج من الزجاج، مقصورة مكتومة قليلاً. 8فراش مطر ثابت ومتساوي مع تأثيرات قطرات فردية منفصلة بوضوح على الزجاج، 9بالإضافة إلى هسهسة خافتة بعيدة لإطارات على طريق مبلل. لا موسيقى، لا رعد، لا صوت، 10لا سرد، لا ضوضاء ماسحات.
bUKr5V6wbdM
القالب 3، 1.00 دولار. عشر ثوانٍ من الأجواء النقية، لا موسيقى تصويرية لأن الموجه منعها. تم التوليد باستخدام minimax/h3/text-to-video.
كم يكلف فيديو ASMR من MiniMax H3 فعليًا
هذه هي الفاتورة لهذه المقالة، وليس تقديرًا.
| البند | العدد | الفوترة |
|---|---|---|
| إطار أساسي GPT Image 2، جودة عالية، 2048x1152 | 1 | $0.17 |
| حافظة 2K، 5 ثوانٍ، صورة إلى فيديو | 1 | $0.70 |
| مسودة 768P، 5 ثوانٍ، صورة إلى فيديو | 1 | $0.50 |
| مرجع إلى فيديو 768P، 5 ثوانٍ | 1 | $0.50 |
| مقاطع القالب عند 768P، 6s + 8s + 10s | 3 | $2.40 |
| طلبات مرجع مرفوضة | 2 | $0.00 |
| المجموع | $4.27 |
ستة مقاطع قابلة للنشر وإطار أساسي واحد. قم بتوسيع النطاق إلى جدول: مقطع رأسي واحد بطول 8 ثوانٍ يوميًا بدقة 768P يكلف 0.80 دولار، لذا تقريبًا 24 دولارًا شهريًا لحساب ينشر يوميًا بدون وجه، قبل أن تقضي دقيقة في محرر.
ملاحظتان للفوترة. السعر المدرج لـ GPT Image 2 البالغ 0.009 دولار هو أرضية مستوى الرمز المميز؛ عرض عالي الجودة 2048x1152 يصل إلى 0.1745 دولار، أي ما يقرب من عشرين ضعف ذلك، لذا ضع ميزانية من المستوى الذي تستخدمه فعليًا. وحقل price لـ H3 يملأ متأخرًا: استقص حتى status هو completed وغالبًا ما يظل undefined. استقص معرف التوقع مرة أخرى بعد لحظة للحصول على الرقم الحقيقي. هذا الاستقصاء الثاني هو الطريقة الوحيدة لبناء فاتورة مثل هذه بدلاً من تخمين.
ملاحظة صادقة واحدة حول حقوق ASMR الصوتية
لا تقم بتحميل تسجيل ASMR لشخص آخر كملف صوتي refers. المرجع ينقل الجرس الصوتي حقًا إلى الإخراج، وتشغيل تسجيل عبر نموذج لا يغير مالكه. المرجع المستخدم هنا هو CC BY 4.0 ومذكور أعلاه، الأمر الذي استغرق حوالي دقيقتين للحصول عليه.
لا تقم ببناء ASMR حول صوت شخص حقيقي يمكن التعرف عليه. كل قالب في هذه المقالة هو عمدًا بدون صوت، وهو كل من تقليد النوع وأقل مسار تعقيدًا.
استدعاء H3 عبر API لا يتأثر بالترخيص المجتمعي المرتبط بالأوزان المفتوحة. هذا الترخيص، الذي يغطي الاستضافة الذاتية، يستبعد حاليًا الاتحاد الأوروبي والمملكة المتحدة وكوريا والولايات المتحدة، وقناة ترخيص رسمية مفتوحة لتلك المناطق. يستحق المعرفة، لا يستحق القلق إذا كنت تضرب نقطة النهاية.
فيديو ASMR من MiniMax H3: الأسئلة الشائعة
هل يولد فيديو ASMR من MiniMax H3 صوته الخاص، أم أضيفه لاحقًا؟
النموذج يولده. الصورة والصوت يخرجا من نفس الممر: فيديو 24 إطارًا في الثانية مع مسار استريو AAC بتردد 32 كيلوهرتز في الملف المسلَّم. لا توجد خطوة صوتية منفصلة، ولا مكتبة أصوات، ولا عمل محاذاة، وهو السبب الوحيد الذي يجعل نقطة النهاية هذه مثيرة للاهتمام لـ ASMR تحديدًا.
هل يمكنني جعل فيديو ASMR من MiniMax H3 يتحرك من اليسار إلى اليمين؟
ليس عن طريق الطلب. كتبت توجيهات قنوات صريحة في الموجه وقست النتيجة: ارتباط 0.97 بين القنوات وأقصى فرق مستوى 1.9 ديسيبل في أي نافذة ربع ثانية، وهو ليس تحريكًا على الإطلاق. المسار هو استريو حقيقي والمحتوى المنتشر مثل المطر يعود بحقل عريض، لكن التأثيرات المنفصلة تبقى مركزية بغض النظر عن الصياغة. إذا كان تنسيقك يحتاج إلى تحريك صوتي صعب، افعله في مرحلة ما بعد الإنتاج.
هل يمكنني تحميل تسجيلي الخاص كمرجع فيديو ASMR من MiniMax H3؟
نعم، من خلال reference-to-video، الذي يقبل حتى 3 مراجع صوتية جنبًا إلى جنب مع حتى 9 صور و 3 فيديوهات. لا يمكن إرسال الصوت بمفرده، لذا قم بإقرانه بصورة واحدة على الأقل أو فيديو. يجب أن يكون الصوت أيضًا بين 2 و 15 ثانية، ويتم التحقق من التنسيق: حمولة .wav عملت حيث تم رفض audio/mpeg. الطلبات المرفوضة لا تُفوتر.
هل صوت فيديو ASMR من MiniMax H3 بدقة 768P أسوأ من 2K؟
لا. كلا المستويين يسلمان نفس مواصفات AAC استريو 32 كيلوهرتز. فقط الصورة تتغير، وتتغير كثيرًا: 16:9 يعود كـ 1344x768 عند 768P مقابل 2560x1440 عند 2K. بما أن الحكم الإبداعي في ASMR هو حكم استماعي، قم بالمسودة بـ 0.10 دولار/ثانية وأعد تشغيل الحافظات بـ 0.14 دولار/ثانية. فقط تذكر أن تشغيل 2K هو لقطة جديدة، وليس رفع دقة المسودة.
كم يجب أن يكون طول فيديو ASMR من MiniMax H3، وما نسبة العرض إلى الارتفاع؟
المدة تقبل أي ثانية كاملة من 4 إلى 15. مقاطع القطع والمضغ تعمل عند 5 إلى 8 ثوانٍ لأن المكافأة هي حدث واحد؛ الأجواء الموجهة للنوم تريد 10 أو أكثر. بالنسبة لـ Shorts و Reels و TikTok استخدم 9:16، وتذكر أن text-to-video يتطلب ضبط ratio صراحة ويرفض adaptive. على image-to-video، الإطار الأول يقرر الشكل نيابة عنك.
كم يكلف فيديو ASMR واحد من MiniMax H3؟
مقطع بطول 5 ثوانٍ يكلف 0.50 دولار عند 768P و 0.70 دولار عند 2K. مقطع رأسي بطول 8 ثوانٍ عند 768P يكلف 0.80 دولار. نشر واحد من هذه يوميًا هو حوالي 24 دولارًا شهريًا في الحوسبة، وهو الرقم الذي يستحق المقارنة مقابل 20 دقيقة التي سيأخذها المحرر لكل مقطع على سير العمل المُجمّع.
لماذا يخرج فيديو ASMR من MiniMax H3 الخاص بي بموسيقى خلفية لم أطلبها أبدًا؟
لأنك لم تمنعها. معظم الفيديو في بيانات تدريب أي نموذج يحتوي على فراش موسيقي، لذا السلوك الافتراضي هو إضافة واحدة، خاصة عندما لا يحدث شيء على الشاشة. ضع النفي في نصف الصوت من الموجه صراحة: no music, no voice, no narration, no room reverb, no ambience bed. القوالب المحيطة تحتاج إلى هذا أكثر من قوالب الفعل.






