Wan 3.0 Multimodal Reference menerima 20 aset, dan PDF adalah salah satunya.

Wan 3.0 referensi multimodal mengambil 20 aset dalam satu panggilan: gambar, video, audio, PDF, bahkan URL. Lihat hasil Alibaba sendiri dan alur kerja yang dapat Anda jalankan hari ini.

Pembaruan terbaru: Wan 3.0 sudah live per 24 Agustus 2026.

Anda membuat folder untuk satu iklan 15 detik. Dua gambar tokoh diam. Video dengan tone merek yang dikirim klien. Buku merek yang hanya ada sebagai PDF. Sampel suara aktor yang benar-benar Anda inginkan.

Lalu Anda membuka model video Anda dan model itu hanya meminta satu gambar.

Jadi Anda melakukan apa yang semua orang lakukan. Anda menerjemahkan folder itu menjadi prompt sepanjang 800 kata dan berdoa. Wajahnya bergeser di shot ketiga. Jaketnya berubah warna. Suaranya menjadi milik orang lain.

Omni-reference Wan 3.0 adalah pertama kalinya sebuah model video berkata: baiklah, berikan foldernya. Hingga 20 aset dalam satu panggilan, mencakup lima jenis input, disatukan dalam satu pengambilan kontinu sepanjang 30 detik.

Artikel ini melakukan tiga hal dan melewatkan sisanya. Artikel ini menguraikan apa sebenarnya 20 aset itu, menggunakan klip yang dihasilkan sendiri oleh Alibaba sebagai bukti, dan memberi Anda alur kerja yang setara yang dapat Anda jalankan hari ini, karena Wan 3.0 masih dalam beta publik di cloud milik Alibaba sendiri dan belum bisa dipanggil dari platform pihak ketiga.

Poin-poin penting

  • Referensi multimodal Wan 3.0 menerima hingga 20 aset dalam satu panggilan, mencakup gambar, video, audio, dokumen, dan halaman web langsung, serta menjaganya tetap konsisten dalam satu pengambilan sepanjang 30 detik.
  • Ini adalah model video arus utama pertama yang memperlakukan PDF, deck slide, atau URL sebagai input kreatif, bukan sesuatu yang Anda parafrasekan menjadi prompt.
  • Wan 3.0 memasuki beta publik pada 6 Agustus 2026 di Alibaba Cloud Model Studio dan Qwen Cloud sebagai wan3.0-video. Bobotnya tertutup. Siapa pun yang mengatakan sudah Apache 2.0 hanya menebak.
  • Judul 20 aset bukanlah tempat di mana ia benar-benar unggul. Model referensi-ke-video yang dapat Anda panggil sekarang sudah menerima lebih dari 20 aset. Celahnya adalah dokumen dan halaman web, bukan jumlahnya.
  • Anda dapat menguji format dua karakter, terkunci referensi, bersuara penuh secara gratis dengan generator sketsa iklan AI gratis Atlas Cloud: empat foto produk masuk, sketsa lisan 15 detik keluar, tanpa kartu. Kucing berbulu halus dan kucing hitam berlari di lorong hotel mewah

Dua kucing dikejar melalui lima set berbeda oleh Wan 3.0 tanpa penyimpangan karakter_Dua gambar referensi. Lima set yang sama sekali berbeda, dari koridor hotel hingga drum mesin cuci hingga kotak telepon merah. Tidak ada satu frame pun yang melenceng. Sumber: Buku pegangan kreator resmi Wan 3.0_ Alibaba , Agustus 2026, yang juga merupakan sumber semua klip Wan 3.0 lainnya dalam artikel ini.

Mengapa Video Multi-Referensi Gagal, dan Apa yang Diubah oleh Referensi Multimodal Wan 3.0

Model video tidak memiliki memori antar klip. Setiap generasi dimulai dari nol. Itulah seluruh masalah dalam satu kalimat.

Jadi, saat cerita Anda membutuhkan lebih dari satu shot, Anda harus menyambung. Shot satu memberi Anda wajah yang Anda sukai. Shot dua memberi Anda sepupu dari wajah itu. Shot tiga diam-diam mengubah jaket dari merah plum menjadi merah anggur, dan saat Anda menyadarinya, Anda sudah membayar untuk sebelas render.

Referensi gambar tunggal membantu, tetapi hanya mengunci satu hal. Wajah. Ia tidak dapat secara bersamaan menahan wajah, pakaian, properti, lokasi, dan suara, karena hanya ada satu slot dan lima pekerjaan.

Ada dua jalan keluar. Beri model lebih banyak slot, atau hentikan ia memulai dari awal. Wan 3.0 melakukan keduanya sekaligus, dan itulah mengapa dua fitur utama sebenarnya adalah satu fitur. Pengambilan asli 30 detik berarti tidak ada potongan bagi karakter untuk melenceng. Duapuluh aset referensi berarti setiap elemen yang harus tetap tetap mendapat slot khusus sendiri alih-alih berebut satu.

Inilah yang terjadi ketika tidak ada yang disambung. Tiga puluh detik, satu kamera kontinu, seorang anak di kereta belanja yang akhirnya tertanam di dalam papan iklan dan kemudian berjalan keluar dari bawahnya.

Sebuah 30 detik penuh dalam satu kali lewatan, tanpa potongan, dengan soundtrack yang dihasilkan dalam lewatan yang sama. Sumber: Buku pegangan kreator resmi Wan 3.0 Alibaba.

Apa Arti Sebenarnya "20 Aset" di Dalam Referensi Multimodal Wan 3.0

Dua puluh adalah angka yang menjadi berita utama. Yang penting adalah dua puluh itu tidak semuanya jenis yang sama. Omni-reference Wan 3.0 mencakup lima jenis input, dan masing-masing mengontrol sumbu keluaran yang berbeda.

Gambar mengontrol identitas. Kartu karakter, foto produk, pelat lokasi. Wan 3.0 menyebutnya konsistensi tingkat piksel, dan dalam contoh-contoh resmi Alibaba, kuncinya meluas melewati wajah ke pakaian: jubah abu-abu berlapis, rompi kulit bertali, ikat pinggang gelap semuanya bertahan dalam pertarungan tangan kosong sepanjang enam belas detik di tiga lokasi.

Pria muda berjubah tradisional Tiongkok berdiri di luar ruangan saat matahari terbenam

Dua kartu karakter menggerakkan adegan pertarungan wuxia dengan detail kostum yang dipertahankan dari bingkai ke bingkai

Dua kartu karakter ditambah satu pelat lokasi tepian alang-alang. Pakaian dan latar bertahan di setiap lemparan. Ditampilkan di sini sebagai GIF diam; file yang dikirimkan membawa campuran stereo 44,1kHz. Sumber: Buku pegangan kreator resmi Wan 3.0 Alibaba.

Audio mengontrol suara. Inilah bagian yang membuat "multimodal" lebih dari sekadar pemasaran. Anda melampirkan sampel suara per karakter, menulis baris dialog di prompt, dan dialognya kembali dengan timbre itu, dengan sinkronisasi bibir, dalam lewatan yang sama dengan gambarnya. Dua orang, dua referensi suara, satu gym.

Dua gambar subjek ditambah dua klip referensi suara terpisah, dan dialognya kembali dengan dua suara itu. Layak untuk menyalakan suara untuk yang satu ini. Sumber: Buku pegangan kreator resmi Wan 3.0 Alibaba.

Video mengontrol waktu. Video referensi tidak ada untuk ditiru. Ia ada untuk menyumbangkan ritmenya: berapa lama sebuah ketukan bertahan, bagaimana sebuah transisi bergerak. Dalam yang satu ini, lima keyframe menyediakan subjek dan video referensi menyediakan irama flip kartu horizontal di antara mereka.

Wanita mengenakan hiasan kepala tradisional Tiongkok yang rumit dan gaun bersulam biru

Lima keyframe dibalik dengan tempo yang diambil dari video referensi_Lima_ gambar keyframe untuk subjek, satu video referensi untuk ritme flip. Sumber: Buku pegangan kreator resmi Wan 3.0 Alibaba.

Dokumen dan halaman web mengontrol struktur. Ini yang benar-benar baru. Wan 3.0 menerima file dokumen dan URL langsung sebagai input kreatif, dan laporan tentang beta mencantumkan .doc, .xls, .ppt, .pdf dan .txt di antara format yang diterima (AlphaSignal, Agustus 2026). Logika yang sama sudah berfungsi dengan gambar papan cerita: satu papan masuk, enam shot keluar, dalam urutan papan itu sendiri.

Dua orang dengan payung berdiri di peron stasiun kereta yang hujan

Satu lembar papan cerita diperluas menjadi enam shot berurutan di peron stasiun kereta yang hujan

Satu lembar papan cerita sebagai referensi, enam shot dihasilkan sesuai urutannya, hingga ke catatan yang berpindah tangan di shot lima. Sumber: Buku pegangan kreator resmi Wan 3.0 Alibaba.

Bingkai pertama dan terakhir mengontrol titik akhir. Trik tertua dalam buku, masih didukung, masih cara tercepat untuk membatasi sebuah shot.

Beginilah perbandingannya dengan versi yang kebanyakan orang gunakan saat ini.

Wan 2.7 Referensi-ke-VideoWan 3.0 omni-reference
Aset referensisatu gambar per subjek, hingga 3 video, 1 klip suarahingga 20 aset total
Modalitasgambar, video, audiogambar, video, audio, dokumen, halaman web
Durasi maksimal, satu lewatan10 s30 s asli, plus durasi pintar
Audio dalam lewatan yang samayaya
Penyuntingan dan ekstensi videotidak diekspospenyuntingan berbasis instruksi dan referensi, plus ekstensi
Ketersediaanlive di API pihak ketigaAlibaba Cloud Model Studio dan beta Qwen Cloud

Ada satu aturan yang tidak ditulis di dokumentasi dan semua orang pelajari dengan susah payah: satu referensi, satu pekerjaan. Image1 mengunci wajah dan pakaian. Video1 hanya menyumbangkan gerakan. Audio1 hanya menyumbangkan timbre. Saat Anda memberikan satu aset dua pekerjaan yang bertentangan, atau mengunggah gambar referensi dengan dua orang di dalamnya, model harus menebak, dan menebak adalah persis apa yang Anda coba hentikan. Buku pegangan Alibaba juga blak-blakan tentang ini: satu subjek per gambar referensi.

Alur Kerja Referensi Multimodal Wan 3.0 yang Dapat Anda Jalankan Hari Ini

Jawaban langsung dulu. Wan 3.0 dalam beta publik di cloud milik Alibaba sendiri, dengan id model wan3.0-video (Alibaba Wan, Agustus 2026). Ia belum mendarat di platform API pihak ketiga, termasuk Atlas Cloud. Siapa pun yang menjual akses API Wan 3.0 sekarang sedang menjual kembali sesuatu yang lain.

Yang telah mendarat adalah bentuk alur kerja. Paket referensi masuk, satu panggilan, klip jadi dengan suara keluar. Ini berjalan hari ini pada model referensi-ke-video yang dapat Anda panggil di tab browser, dan begitu Anda menyusun semuanya, judul 20 aset terlihat berbeda.

ModelAset referensiModalitasDurasi maksimalAudio asliHarga per detik
Wan 3.0 (beta Alibaba, belum di Atlas)20 totalgambar, video, audio, dokumen, halaman web30 sYadilaporkan $0,05 hingga $0,20 per resolusi
Wan 2.7 Referensi-ke-Video1 gambar per subjek, 3 video, 1 klip suaragambar, video, audio10 sYa$0,10
Seedance 2.5 Referensi-ke-Video50 (30 gambar / 10 video / 10 audio)gambar, video, audio30 sYa$0,13
MiniMax H3 Referensi-ke-Videocampuran, tidak ada batas yang dinyatakangambar, video, audio15 sYa$0,10
Kling Video O3 Pro Referensi-ke-Video7 gambar, atau 4 gambar + 1 videogambar, video15 sYa$0,10
Vidu Q3-Mix Referensi-ke-Video4 gambargambar16 sYa$0,11
Veo 3.1 Referensi-ke-Video3 gambargambar8 sOpsional$0,20

Harga adalah tarif Atlas Cloud per Agustus 2026. Angka Wan 3.0 adalah yang dilaporkan untuk beta Alibaba Cloud, bukan tarif Atlas, dan Alibaba belum menerbitkan harga publik untuk model tersebut, jadi perlakukan baris itu sebagai sementara.

Baca tabel itu dua kali dan cerita sebenarnya muncul. Judul 20 aset bukanlah tempat Wan 3.0 unggul, karena Seedance 2.5 sudah menerima 50 dan menyamai 30 detik. Apa yang tidak diterima oleh model lain dalam daftar itu adalah PDF.

Untuk panduan di bawah, demo berjalan di Wan 2.7 Referensi-ke-Video, karena bentuk inputnya adalah kerabat terdekat yang masih hidup dari omni-reference: beberapa gambar subjek, video referensi opsional, dan klip suara, semuanya dipetakan ke label character1 dan character2 di dalam prompt. Tiga model, satu tab browser, tanpa instalasi lokal.

Untuk menjalankan yang dihosting saat ini, buka Wan 3.0 di Atlas Cloud dan uji prompt seperti di bawah ini sebelum Anda menerbitkan alur kerja.

Tangkapan layar prompt dan efek yang dihasilkan Wan 3.0 untuk wan-3.0-multimodal-reference

Tangkapan layar Wan 3.0 prompt-ke-hasil: serah terima merek 20 referensi.

Bangun Sendiri: Adegan Referensi Multimodal dalam Empat Langkah

Adegan: meja depan hotel pastel. Seorang petugas yang datar. Seorang pelancong yang memegang kucing ragdoll. Petugas menatap lurus ke lensa dan berkata "Kucing itu punya reservasi. Anda tidak."

Dua gambar ditambah satu klip suara, yang merupakan tiga aset referensi di dua modalitas. Itu adalah bangunan terkecil yang benar-benar multimodal, bukan hanya multi-gambar.

Langkah 1. Hasilkan gambar referensi 1, subjek yang harus Anda kunci

Gambar referensi memiliki tiga pekerjaan dan hanya tiga: satu subjek, menghadap kamera, latar belakang bersih. Segala sesuatu yang lain adalah dekorasi. Gunakan GPT Image 2 dengan kualitas high, ukuran 16:9, n=1.

Plain
1Potret studio full-body seorang petugas hotel paruh baya dengan ekspresi datar, berdiri tepat di tengah dengan latar dinding merah muda berdebu yang rata. Ia mengenakan seragam belhop double-breasted berwarna plum-ungu dengan pipa emas dan kancing kuningan, topi kotak pil bundar kecil, dan kumis tipis. Bingkai simetris sempurna, cahaya depan lembut merata, tanpa bayangan di dinding, butiran film 35mm, palet pastel redup. Hanya satu subjek, tidak ada orang lain, tidak ada teks, tidak ada logo, tidak ada properti dalam bingkai.
2

Antarmuka generator gambar AI menunjukkan langkah bernomor dan bellhop yang dihasilkan

Taman bermain GPT Image 2 di Atlas Cloud dengan potret referensi petugas yang dirender di panel keluaran

GPT Image 2 di Atlas Cloud: kualitas tinggi, 16:9, satu subjek, latar belakang datar. Ini adalah file yang menjadi character1.

Langkah 2. Hasilkan gambar referensi 2, subjek terkunci kedua

Model yang sama, pengaturan yang sama. Kontras warna antara kedua karakter sengaja dibuat, karena memberi model cara mudah untuk membedakan mereka saat berbagi bingkai.

Plain
1Potret studio full-body seorang pelancong wanita muda yang memegang kucing ragdoll berbulu halus di dadanya, berdiri tepat di tengah dengan latar dinding kuning mustard yang rata. Ia mengenakan mantel wol mustard, baret merah, dan kacamata bundar bergaya tempurung kura-kura, serta memegang koper kulit antik kecil di tangannya yang bebas. Bingkai simetris sempurna, cahaya depan lembut merata, tanpa bayangan di dinding, butiran film 35mm, palet pastel redup. Hanya satu subjek, tidak ada orang lain, tidak ada teks, tidak ada logo.
2

Langkah 3. Hasilkan referensi suara, yang merupakan bagian multimodal yang sebenarnya

Klip suara adalah yang mengubah ini dari pekerjaan multi-gambar menjadi multimodal. Slot audio Wan 2.7 menginginkan sampel pendek, kira-kira 1 hingga 10 detik, jadi jaga agar barisnya pendek. Gunakan MiniMax Speech 2.6 HD dan pilih suara pria yang rendah, datar, dan tidak terganggu.

Plain
1Selamat malam. Check in? Tentu saja. Semua orang.
2

Langkah 4. Satu panggilan, tiga referensi, satu klip jadi

Sekarang seluruh paket masuk bersama di Wan 2.7 Referensi-ke-Video. Pengaturan: resolution: 1080P, ratio: 16:9, duration: 10, yang merupakan batas model ini, prompt_extend: false, seed: -1. Muat images secara berurutan, langkah 1 terlebih dahulu, sehingga dipetakan ke character1, lalu langkah 2 sebagai character2, dan lampirkan file langkah 3 ke audio.

Plain
1Shot lebar simetris, tepat di tengah, dari meja depan lobi hotel pastel, dinding merah muda berdebu, dan rak kunci kuning mustard di belakangnya. character1 adalah petugas yang berdiri di belakang meja; character2 adalah pelancong yang berdiri di depannya, masih memegang kucing ragdoll-nya. Kamera mendorong masuk perlahan di sepanjang sumbu tengah yang sempurna dan tidak pernah miring. character1 menatap lurus ke lensa dan berkata dengan datar: "Kucing itu punya reservasi. Anda tidak." character2 berkedip sekali, menoleh perlahan ke arah kucing, lalu kembali ke meja. Kucing itu menatap langsung ke kamera tanpa bergerak. Butiran film 35mm, pencahayaan lembut merata, palet pastel redup, tanpa goyangan kamera, tanpa potongan.
2

Prompt negatif:

Plain
1goyangan tangan, potongan mendadak, teks, teks di layar, tanda air, orang tambahan, tangan cacat, perubahan wajah, pergeseran warna, keburaman gerakan
2

Tangkapan layar antarmuka generator video AI dengan input dan output

Taman bermain Wan 2.7 Referensi-ke-Video di Atlas Cloud dengan dua gambar referensi dan satu file audio dimuat dan klip jadi di panel keluaran

Wan 2.7 Referensi-ke-Video di Atlas Cloud: dua gambar referensi dan satu klip suara dilampirkan di kiri, pengambilan jadi diputar di kanan pada 1080P dan 16:9. Tangkapan ini berjalan pada durasi default model; setel ke 10 untuk versi lengkap di bawah.

Klip jadi. Kedua wajah dipertahankan, kedua pakaian dipertahankan, dan baris dialog disampaikan dengan suara kloning dari langkah 3, jadi yang ini layak diputar dengan suara.

Wanita memegang kucing di meja resepsionis hotel dengan bellhop

Kedua potret referensi di samping bingkai dari klip jadi, menunjukkan wajah dan pakaian yang sama

Referensi di kiri, bingkai dari klip yang dikirimkan di kanan. Pipa seragam, baret, kacamata, dan kucing semuanya selamat dalam perjalanan.

Variasi pada Alur Kerja Referensi Multimodal Wan 3.0

Dorong hingga 30 detik. Paket referensi yang sama berjalan di Seedance 2.5 Referensi-ke-Video dengan duration: 30, yang memberi Anda panjang yang dijanjikan Wan 3.0 tanpa menunggu beta. Ia menerima hingga 30 gambar referensi, 10 video, dan 10 klip audio, jadi paketnya punya ruang untuk bertambah. Tulis 20 detik tambahan sebagai ketukan dalam prompt, bukan sebagai suasana, atau model akan mengisi waktu.

Antarmuka generator video AI menunjukkan pengaturan input dan progres generasi

Taman bermain Seedance 2.5 Referensi-ke-Video di Atlas Cloud dengan durasi diatur ke 30 dan pengambilan panjang dirender

Seedance 2.5 Referensi-ke-Video di Atlas Cloud dengan durasi diatur ke 30 dan dua potret referensi yang sama dilampirkan, tertangkap di tengah generasi. Perhatikan chip @image1 dan @image2 dalam prompt: itu adalah cara memberi tahu Seedance referensi mana yang memainkan peran mana. Periksa harga yang dikutip pada tombol Run sebelum Anda berkomitmen, karena itu mencerminkan durasi yang akan diserahkan oleh pekerjaan.

Versi 30 detik dari adegan yang sama, paket referensi yang sama, ketukan dituliskan shot demi shot.

Tambahkan video referensi untuk gerakan saja. Lampirkan klip yang tempo Anda sukai dan katakan secara eksplisit dalam prompt, sesuatu seperti "ikuti video referensi untuk ritme pemotongan saja, abaikan subjek dan latarnya". Itulah trik di balik contoh flip kartu di atas.

Perbaiki penyimpangan dengan prompt negatif sebelum menyentuh yang positif. Perubahan wajah, pergeseran warna, dan goyangan tangan adalah tiga hal yang merusak shot terkunci referensi, dan biasanya lebih murah untuk ditekan daripada untuk dijelaskan secara berlebihan.

Coba Format Referensi Multimodal Secara Gratis

Jika Anda menginginkan bentuk ini sebelum menginginkan parameternya, Atlas Cloud meluncurkan generator sketsa iklan AI gratis minggu lalu yang menjalankan rantai yang sama tanpa semua tombol.

Anda menulis satu baris tentang produk Anda dan poin penjualannya. Ia menulis skrip komedi dua karakter untuk Anda, kait, konflik, liku, lalu merender video 15 detik dengan dialog lisan dan efek suara bawaan. Anda dapat melampirkan hingga empat foto produk nyata sebagai referensi, dan iklan tersebut mempertahankan bentuk, warna, label, dan logo mereka dari skrip hingga bingkai akhir. Enam gaya disertakan, dari meme lucu melalui plot twist dan sitkom hingga kemewahan dan hard sell, dan dialognya kembali dalam bahasa apa pun yang Anda tulis deskripsinya.

Itu adalah rantai dua karakter-plus-gambar-referensi-plus-suara yang sama dari tutorial, dikurangi penulisan prompt dan dikurangi tagihan. Yang menjadikannya cara yang layak untuk mengetahui apakah format ini cocok untuk produk Anda sebelum Anda mengeluarkan biaya untuk menyetelnya.

Untuk gambaran tentang apa yang dilakukan setumpuk gambar referensi diam untuk sebuah karya produk, ini adalah versi Wan 3.0 sendiri dari pekerjaan itu: lima gambar masuk, satu reel peluncuran keluar, setiap gambar diam menambatkan satu ketukan dari suntingan.

Tumpukan kartu putih dan hijau mint melayang animasi

Lima gambar diam referensi diperluas menjadi reel peluncuran produk bergaya Material Design_Lima gambar referensi mendorong film produk sembilan detik, masing-masing menambatkan satu ketukan dan beralih ke ketukan berikutnya. Sumber: Buku pegangan kreator resmi Wan 3.0 Alibaba._

Berapa Biaya Klip Referensi Multimodal Wan 3.0

LangkahModelHarga per unitKuantitasBiaya
1 dan 2, dua gambar referensiGPT Image 2$0,009 per gambar2$0,02
3, referensi suaraMiniMax Speech 2.6 HD$0,08 per 1K karakter49 karakter$0,00
4, pengambilan 10 detik pada 1080PWan 2.7 Referensi-ke-Video$0,15 per detik pada 1080P10 s$1,50
Total tutorialsekitar $1,52
Variasi, 30 detikSeedance 2.5 Referensi-ke-Video$0,134 per detik pada 480P30 ssekitar $4,02
Rute gratisGenerator Sketsa Iklan AI Gratisgratis1 klip, 15 s$0

Itu adalah tarif platform itu sendiri, diperiksa pada Agustus 2026 dan ditagih sesuai pemakaian. Dua hal yang menggerakkan total lebih dari yang diperkirakan orang. Resolusi adalah yang pertama: $0,10 per detik dalam tabel perbandingan adalah tarif dasar Wan 2.7, dan 1080P ditagih pada $0,15, yang merupakan asal $1,50 di atas. Yang kedua adalah Seedance mematok harga berdasarkan jumlah piksel, sehingga $0,134 per detik yang terdaftar adalah angka 480P dan pengambilan 720P lebih mahal dari yang disarankan perkalian sederhana. Sebagai referensi, tarif beta Wan 3.0 yang dilaporkan sebesar $0,20 per detik pada 1080p akan menempatkan pengambilan 30 detik penuh di sekitar $6, yang lebih dari rute Seedance pada 480P saat ini.

Catatan tentang penggunaan ini. Wan 3.0 adalah beta dan ketentuannya dapat berubah, jadi baca ulang sebelum Anda membangun pipeline di atasnya. Jika gambar referensi Anda adalah orang nyata, dapatkan izin mereka terlebih dahulu, karena referensi-ke-video adalah kemampuan yang tepat yang membuat hal itu penting. Klip contoh dalam artikel ini adalah hasil yang dihasilkan sendiri oleh Alibaba dari buku pegangan kreator publiknya, direproduksi di sini untuk komentar.

Pertanyaan yang Sering Diajukan

Berapa banyak referensi yang dapat diambil oleh referensi multimodal Wan 3.0?

Hingga 20 aset dalam satu panggilan, diambil dari gambar, video, audio, dokumen, dan halaman web. Batas praktis lebih rendah dari batas teknis. Tetapkan setiap aset tepat satu pekerjaan, satu subjek per gambar, dan Anda akan menggunakan jauh lebih sedikit dari 20 untuk sebagian besar adegan.

Bisakah Wan 3.0 benar-benar mengubah PDF atau halaman web menjadi video?

Ya, itulah bagian yang benar-benar unik. Selain teks, gambar, audio, dan video, ia menerima file dokumen dan URL langsung, dengan laporan tentang beta mencantumkan .doc, .xls, .ppt, .pdf dan .txt. Tidak ada model referensi-ke-video lain dalam tabel perbandingan di atas yang menerima dokumen sama sekali.

Apakah Wan 3.0 open source? Bisakah saya menjalankannya di ComfyUI?

Tidak, dan tidak untuk saat ini. Wan 3.0 adalah beta tertutup yang berjalan di cloud milik Alibaba sendiri. Generasi Wan sebelumnya dirilis secara terbuka, itulah mengapa ekspektasi itu ada, tetapi Alibaba belum mengonfirmasi bobot untuk 3.0. Halaman yang mengklaim rilis Apache 2.0 Wan 3.0 1.3B atau 14B tidak didukung oleh apa pun yang resmi.

Apakah Wan 3.0 tersedia melalui API pihak ketiga?

Belum, termasuk Atlas Cloud. Yang paling dekat yang dapat Anda panggil hari ini adalah Wan 2.7 Referensi-ke-Video, yang bentuk inputnya hampir persis cocok dengan omni-reference selain modalitas dokumen dan halaman web, atau Seedance 2.5 Referensi-ke-Video jika Anda membutuhkan 30 detik penuh.

Apa cara termurah untuk menguji video terkunci referensi dua karakter?

Generator sketsa iklan AI gratis yang ditautkan di atas. Empat foto referensi masuk, klip lisan dua karakter 15 detik keluar, tanpa parameter dan tanpa biaya. Jika itu cocok dengan produk dan format Anda, maka setel rantai berbayar.

Mengapa karakter saya masih melenceng meskipun dengan gambar referensi?

Tiga penyebab, berdasarkan frekuensi. Satu referensi membawa dua pekerjaan, sehingga diminta untuk memperbaiki wajah dan lokasi. Gambar referensi memiliki lebih dari satu orang atau latar belakang yang sibuk, sehingga model tidak tahu bagian mana yang harus dikunci. Atau penyimpangan adalah artefak rendering daripada kegagalan referensi, dalam hal ini masukkan perubahan wajah, pergeseran warna ke dalam prompt negatif sebelum menulis ulang apa pun.

Model Terbaru

Satu API untuk semua AI multimedia.

Jelajahi semua model