Seedance 2.5 Kini Tersedia — Hadir Pertama di Atlas Cloud

Wan 3.0 Multimodal Reference Mencakup 20 Aset, dan PDF adalah Salah Satunya.

Referensi multimodal Wan 3.0 mengambil 20 aset dalam satu panggilan: gambar, video, audio, PDF, bahkan URL. Lihat hasil Alibaba sendiri dan alur kerja yang dapat Anda jalankan hari ini.

Kamu membuat folder untuk satu iklan 15 detik. Dua gambar karakter. Satu video nada merek yang dikirim klien. Satu buku merek yang hanya ada sebagai PDF. Satu sampel suara dari aktor yang benar-benar kamu inginkan.

Lalu kamu membuka model videomu dan model itu hanya meminta satu gambar.

Jadi kamu melakukan apa yang semua orang lakukan. Kamu menerjemahkan folder itu menjadi prompt 800 kata dan berdoa. Wajahnya melenceng di shot ketiga. Jaketnya berubah warna. Suaranya menjadi milik orang lain sepenuhnya.

Omni-reference Wan 3.0 adalah pertama kalinya sebuah model video berkata: baiklah, berikan aku foldernya. Hingga 20 aset dalam satu panggilan, di lima jenis input, disatukan dalam satu take 30 detik yang berkelanjutan.

Artikel ini melakukan tiga hal dan melewatkan sisanya. Artikel ini menguraikan apa sebenarnya 20 aset itu, menggunakan klip hasil generasi Alibaba sendiri sebagai bukti, dan memberikanmu alur kerja setara yang bisa kamu jalankan hari ini, karena Wan 3.0 masih dalam beta publik di cloud milik Alibaba sendiri dan belum bisa dipanggil dari platform pihak ketiga.

Poin-poin penting

  • Referensi multimodal Wan 3.0 menerima hingga 20 aset dalam satu panggilan, mencakup gambar, video, audio, dokumen, dan halaman web langsung, dan menjaganya tetap konsisten dalam satu take 30 detik.
  • Ini adalah model video mainstream pertama yang memperlakukan PDF, deck slide, atau URL sebagai input kreatif, bukan sesuatu yang kamu parafrasekan menjadi prompt.
  • Wan 3.0 memasuki beta publik pada 6 Agustus 2026 di Alibaba Cloud Model Studio dan Qwen Cloud sebagai wan3.0-video. Bobotnya tertutup. Siapa pun yang mengatakan bahwa ini sudah Apache 2.0 sedang menebak.
  • Judul utama 20 aset bukanlah di mana model ini benar-benar unggul. Model referensi-ke-video yang bisa kamu panggil sekarang sudah menerima lebih dari 20 aset. Perbedaannya ada pada dokumen dan halaman web, bukan pada jumlahnya.
  • Kamu bisa menguji format dua karakter, terkunci referensi, bersuara penuh secara gratis dengan generator skenario iklan AI gratis Atlas Cloud: empat foto produk masuk, skenario lisan 15 detik keluar, tanpa kartu.

Dua kucing, satu berbulu lebat dan satu hitam, berlari di lorong hotel megah

Dua kucing dikejar melalui lima set berbeda oleh Wan 3.0 tanpa karakter melenceng_Dua gambar referensi. Lima set yang benar-benar berbeda, dari koridor hotel hingga drum mesin cuci hingga kotak telepon merah. Tidak ada satu frame pun yang melenceng. Sumber: Buku panduan pembuat Wan 3.0 resmi_ Alibaba , Agustus 2026, yang juga merupakan sumber semua klip Wan 3.0 lainnya di artikel ini.

Mengapa Video Multi-Referensi Gagal, dan Apa yang Diubah oleh Referensi Multimodal Wan 3.0

Model video tidak memiliki memori antar klip. Setiap generasi dimulai dari nol. Itulah inti masalahnya dalam satu kalimat.

Jadi, saat ceritamu membutuhkan lebih dari satu shot, kamu harus menyambung. Shot satu memberimu wajah yang kamu suka. Shot dua memberimu sepupu dari wajah itu. Shot tiga diam-diam mengubah jaket dari merah plum menjadi merah anggur, dan saat kamu menyadarinya, kamu sudah membayar untuk sebelas render.

Referensi gambar tunggal membantu, tetapi hanya bisa mengunci satu hal. Wajah. Ia tidak bisa secara bersamaan memegang wajah, pakaian, alat peraga, lokasi, dan suara, karena hanya ada satu slot dan lima pekerjaan.

Ada dua cara keluar. Beri model lebih banyak slot, atau hentikan model untuk memulai dari awal. Wan 3.0 melakukan keduanya sekaligus, dan itulah mengapa dua fitur utama sebenarnya adalah satu fitur. Take 30 detik asli berarti tidak ada potongan bagi karakter untuk melenceng. Dua puluh aset referensi berarti setiap elemen yang harus tetap tetap mendapat slot khusus sendiri, bukan berebut satu.

Inilah tampilannya ketika tidak ada yang disambung. Tiga puluh detik, satu kamera kontinu, seorang anak di keranjang belanja yang akhirnya tertanam di dalam papan iklan dan kemudian berjalan keluar dari bawahnya.

30 detik penuh dalam satu kali proses, tanpa potongan, dengan soundtrack yang dihasilkan dalam proses yang sama. Sumber: Buku panduan pembuat Wan 3.0 resmi Alibaba.

Apa Arti Sebenarnya "20 Aset" di Dalam Referensi Multimodal Wan 3.0

Dua puluh adalah angka yang menjadi judul utama. Yang penting adalah dua puluh itu tidak semuanya jenis yang sama. Omni-reference Wan 3.0 mencakup lima jenis input, dan masing-masing mengontrol sumbu output yang berbeda.

Gambar mengontrol identitas. Kartu karakter, foto produk, pelat lokasi. Wan 3.0 menyebutnya konsistensi tingkat piksel, dan dalam contoh Alibaba sendiri, kuncinya melampaui wajah hingga ke lemari pakaian: jubah abu-abu berlapis, rompi kulit bertali, ikat pinggang gelap di pinggang semuanya bertahan dalam pertarungan tangan kosong enam belas detik di tiga lokasi.

Pria muda berjubah tradisional Tiongkok berdiri di luar ruangan saat matahari terbenam

Dua kartu karakter menggerakkan adegan pertarungan wuxia dengan detail kostum yang dipertahankan dari bingkai ke bingkai

Dua kartu karakter ditambah satu pelat lokasi tepi sungai alang-alang. Lemari pakaian dan latar bertahan di setiap lemparan. Ditampilkan di sini sebagai GIF hening; file yang dikirimkan membawa campuran stereo 44,1kHz. Sumber: Buku panduan pembuat Wan 3.0 resmi Alibaba.

Audio mengontrol suara. Ini adalah bagian yang membuat "multimodal" lebih dari sekadar pemasaran. Kamu melampirkan sampel suara per karakter, menulis dialog di prompt, dan dialognya kembali dengan timbre itu, dengan gerakan bibir yang sinkron, dalam proses yang sama dengan gambar. Dua orang, dua referensi suara, satu gym.

Dua gambar subjek ditambah dua klip referensi suara terpisah, dan dialognya kembali dengan dua suara itu. Layak untuk menyalakan suara untuk yang satu ini. Sumber: Buku panduan pembuat Wan 3.0 resmi Alibaba.

Video mengontrol waktu. Video referensi tidak ada untuk ditiru. Ia ada untuk menyumbangkan ritmenya: berapa lama satu ketukan bertahan, bagaimana transisi bergerak. Dalam contoh ini, lima keyframe menyediakan subjek dan video referensi menyediakan irama kartu flip horizontal di antara mereka.

Wanita mengenakan hiasan kepala tradisional Tiongkok yang rumit dan gaun bordir biru

Lima keyframe dibalik dengan tempo yang diambil dari video referensi_Lima_ gambar keyframe untuk subjek, satu video referensi untuk ritme flip. Sumber: Buku panduan pembuat Wan 3.0 resmi Alibaba.

Dokumen dan halaman web mengontrol struktur. Ini adalah yang benar-benar baru. Wan 3.0 menerima file dokumen dan URL langsung sebagai input kreatif, dan laporan tentang beta tersebut mencantumkan .doc, .xls, .ppt, .pdf dan .txt di antara format yang diterima (AlphaSignal, Agustus 2026). Logika yang sama sudah berfungsi dengan gambar storyboard: satu papan masuk, enam shot keluar, dalam urutan papan itu sendiri.

Dua orang dengan payung berdiri di peron stasiun kereta yang hujan

Satu lembar storyboard diperluas menjadi enam shot berurutan di peron stasiun kereta yang hujan

Satu lembar storyboard sebagai referensi, enam shot dihasilkan dalam urutannya, hingga catatan yang berpindah tangan di shot kelima. Sumber: Buku panduan pembuat Wan 3.0 resmi Alibaba.

Frame pertama dan terakhir mengontrol titik akhir. Trik paling tua dalam buku, masih didukung, masih menjadi cara tercepat untuk membatasi sebuah shot.

Inilah perbandingannya dengan versi yang kebanyakan orang gunakan saat ini.

Wan 2.7 Referensi-ke-VideoWan 3.0 omni-reference
Aset referensisatu gambar per subjek, hingga 3 video, 1 klip suarahingga 20 aset total
Modalitasgambar, video, audiogambar, video, audio, dokumen, halaman web
Durasi maks, satu proses10 detik30 detik asli, plus durasi cerdas
Audio dalam proses yang samayaya
Pengeditan dan ekstensi videotidak terekspospengeditan berbasis instruksi dan referensi, plus ekstensi
Ketersediaantersedia di API pihak ketigaAlibaba Cloud Model Studio dan Qwen Cloud beta

Ada satu aturan yang tidak ada yang tulis di dokumentasi dan semua orang pelajari dengan susah payah: satu referensi, satu pekerjaan. Image1 mengunci wajah dan pakaian. Video1 hanya menyumbangkan gerakan. Audio1 hanya menyumbangkan timbre. Saat kamu memberikan satu aset dua pekerjaan yang bertentangan, atau mengunggah gambar referensi dengan dua orang di dalamnya, model harus menebak, dan menebak adalah persis apa yang ingin kamu hentikan. Buku panduan Alibaba juga blak-blakan tentang ini: satu subjek per gambar referensi.

Alur Kerja Referensi Multimodal Wan 3.0 yang Dapat Kamu Jalankan Hari Ini

Jawaban langsung dulu. Wan 3.0 dalam beta publik di cloud Alibaba sendiri, dengan id model wan3.0-video (Alibaba Wan, Agustus 2026). Model ini belum mendarat di platform API pihak ketiga, termasuk Atlas Cloud. Siapa pun yang menjualmu akses API Wan 3.0 sekarang sedang menjual kembali sesuatu yang lain.

Yang sudah mendarat adalah bentuk alur kerjanya. Paket referensi masuk, satu panggilan, klip jadi dengan suara keluar. Ini berjalan hari ini pada model referensi-ke-video yang bisa kamu panggil di tab browser, dan begitu kamu menyusun semuanya, judul utama 20 aset terlihat berbeda.

ModelAset referensiModalitasDurasi maksAudio asliHarga per detik
Wan 3.0 (beta Alibaba, tidak di Atlas)20 totalgambar, video, audio, dokumen, halaman web30 detikYadilaporkan $0,05 hingga $0,20 per resolusi
Wan 2.7 Referensi-ke-Video1 gambar per subjek, 3 video, 1 klip suaragambar, video, audio10 detikYa$0,10
Seedance 2.5 Referensi-ke-Video50 (30 gambar / 10 video / 10 audio)gambar, video, audio30 detikYa$0,13
MiniMax H3 Referensi-ke-Videocampuran, tanpa batas yang dinyatakangambar, video, audio15 detikYa$0,10
Kling Video O3 Pro Referensi-ke-Video7 gambar, atau 4 gambar + 1 videogambar, video15 detikYa$0,10
Vidu Q3-Mix Referensi-ke-Video4 gambargambar16 detikYa$0,11
Veo 3.1 Referensi-ke-Video3 gambargambar8 detikOpsional$0,20

Harga adalah tarif Atlas Cloud per Agustus 2026. Angka Wan 3.0 adalah yang dilaporkan untuk beta Alibaba Cloud, bukan tarif Atlas, dan Alibaba belum menerbitkan halaman harga publik untuk model tersebut, jadi perlakukan baris itu sebagai sementara.

Baca tabel itu dua kali dan cerita sebenarnya muncul. Judul utama 20 aset bukanlah di mana Wan 3.0 unggul, karena Seedance 2.5 sudah menerima 50 dan menyamai 30 detik. Apa yang tidak diterima oleh model lain dalam daftar itu adalah PDF.

Untuk panduan di bawah, demo berjalan di Wan 2.7 Referensi-ke-Video, karena bentuk inputnya adalah kerabat terdekat dari omni-reference yang masih hidup: beberapa gambar subjek, video referensi opsional, dan klip suara, semuanya dipetakan ke label character1 dan character2 di dalam prompt. Tiga model, satu tab browser, tanpa instalasi lokal.

Buat Sendiri: Adegan Referensi Multimodal dalam Empat Langkah

Adegannya: meja depan hotel pastel. Seorang resepsionis datar. Seorang pelancong yang memegang kucing ragdoll. Resepsionis menatap lurus ke lensa dan berkata "Kucing itu punya reservasi. Anda tidak."

Dua gambar ditambah satu klip suara, yang merupakan tiga aset referensi di dua modalitas. Itu adalah bangunan terkecil yang benar-benar multimodal, bukan hanya multi-gambar.

Langkah 1. Hasilkan gambar referensi 1, subjek yang harus kamu kunci

Gambar referensi memiliki tiga pekerjaan dan hanya tiga: satu subjek, menghadap kamera, latar belakang bersih. Segala sesuatu lainnya adalah dekorasi. Gunakan GPT Image 2 dengan kualitas high, ukuran 16:9, n=1.

Plain
1Potret studio full-body seorang resepsionis hotel paruh baya dengan ekspresi datar, berdiri tepat di tengah dengan latar dinding dusty-pink polos. Ia mengenakan seragam bellhop double-breasted ungu plum dengan pipa emas dan kancing kuningan, topi pillbox kecil bundar, dan kumis tipis. Bingkai yang sangat simetris, cahaya depan lembut merata, tanpa bayangan di dinding, butiran film 35mm, palet pastel yang redup. Hanya satu subjek, tidak ada orang lain, tidak ada teks, tidak ada logo, tidak ada alat peraga dalam bingkai.

Antarmuka generator gambar AI menunjukkan langkah bernomor dan bellhop yang dihasilkan

Taman bermain GPT Image 2 di Atlas Cloud dengan potret referensi resepsionis yang dirender di panel output

GPT Image 2 di Atlas Cloud: kualitas tinggi, 16:9, satu subjek, latar belakang polos. Ini adalah file yang menjadi character1.

Langkah 2. Hasilkan gambar referensi 2, subjek terkunci kedua

Model yang sama, pengaturan yang sama. Kontras warna antara kedua karakter itu disengaja, karena memberi model cara mudah untuk membedakan mereka saat berbagi bingkai.

Plain
1Potret studio full-body seorang pelancong wanita muda yang memegang kucing ragdoll berbulu lebat di dadanya, berdiri tepat di tengah dengan latar dinding mustard polos. Ia mengenakan mantel wol mustard, baret merah, dan kacamata bundar bercorak kura-kura, dan memegang koper kulit antik kecil di tangannya yang bebas. Bingkai yang sangat simetris, cahaya depan lembut merata, tanpa bayangan di dinding, butiran film 35mm, palet pastel yang redup. Hanya satu subjek, tidak ada orang lain, tidak ada teks, tidak ada logo.

Langkah 3. Hasilkan referensi suara, yang merupakan bagian multimodal yang sebenarnya

Klip suara adalah yang mengubah ini dari pekerjaan multi-gambar menjadi multimodal. Slot audio Wan 2.7 menginginkan sampel pendek, kira-kira 1 hingga 10 detik, jadi jaga agar kalimat tetap pendek. Gunakan MiniMax Speech 2.6 HD dan pilih suara pria yang rendah, datar, dan tidak terganggu.

Plain
1Selamat malam. Check in? Tentu saja. Semua orang.

Langkah 4. Satu panggilan, tiga referensi, satu klip jadi

Sekarang seluruh paket masuk bersama-sama di Wan 2.7 Referensi-ke-Video. Pengaturan: resolution: 1080P, ratio: 16:9, duration: 10, yang merupakan batas model ini, prompt_extend: false, seed: -1. Muat images secara berurutan, langkah 1 terlebih dahulu, sehingga dipetakan ke character1, lalu langkah 2 sebagai character2, dan lampirkan file langkah 3 ke audio.

Plain
1Gambar lebar yang simetris, tepat di tengah, dari meja depan lobi hotel pastel, dinding dusty-pink, dan rak kunci mustard di belakangnya. character1 adalah resepsionis yang berdiri di belakang meja; character2 adalah pelancong yang berdiri di depannya, masih memegang kucing ragdollnya. Kamera mendorong masuk perlahan di sepanjang sumbu tengah yang sempurna dan tidak pernah miring. character1 menatap lurus ke lensa dan berkata dengan datar: "Kucing itu punya reservasi. Anda tidak." character2 berkedip sekali, menoleh perlahan ke arah kucing, lalu kembali ke meja. Kucing itu menatap langsung ke kamera tanpa bergerak. Butiran film 35mm, pencahayaan lembut merata, palet pastel redup, tanpa goyangan kamera, tanpa potongan.

Negative prompt:

Plain
1goyangan genggam, potongan cepat, takarir, teks di layar, tanda air, orang tambahan, tangan cacat, perubahan wajah, pergeseran warna, keburaman gerakan

Tangkapan layar antarmuka generator video AI dengan input dan output

Taman bermain Wan 2.7 Referensi-ke-Video di Atlas Cloud dengan dua gambar referensi dan satu file audio dimuat dan klip jadi di panel output

Wan 2.7 Referensi-ke-Video di Atlas Cloud: dua gambar referensi dan satu klip suara dilampirkan di sebelah kiri, take jadi diputar di sebelah kanan pada 1080P dan 16:9. Tangkapan ini berjalan pada durasi default model; atur ke 10 untuk versi lengkap di bawah.

Klip jadi. Kedua wajah dipertahankan, kedua pakaian dipertahankan, dan dialog disampaikan dengan suara kloning dari langkah 3, jadi yang ini layak diputar dengan suara.

Wanita memegang kucing di meja resepsionis hotel dengan bellhop

Dua potret referensi di samping bingkai dari klip jadi, menunjukkan wajah dan pakaian yang sama

Referensi di kiri, bingkai dari klip jadi di kanan. Pipa seragam, baret, kacamata, dan kucing semuanya bertahan dalam perjalanan.

Variasi pada Alur Kerja Referensi Multimodal Wan 3.0

Dorong hingga 30 detik. Paket referensi yang sama berjalan di Seedance 2.5 Referensi-ke-Video dengan duration: 30, yang memberimu durasi yang dijanjikan Wan 3.0 tanpa menunggu beta. Model ini menerima hingga 30 gambar referensi, 10 video, dan 10 klip audio, jadi paketnya punya ruang untuk berkembang. Tulis 20 detik tambahan sebagai ketukan dalam prompt, bukan sebagai getaran, atau model akan mengisi.

Antarmuka generator video AI menunjukkan pengaturan input dan kemajuan generasi

Taman bermain Seedance 2.5 Referensi-ke-Video di Atlas Cloud dengan durasi diatur ke 30 dan take panjang dirender

Seedance 2.5 Referensi-ke-Video di Atlas Cloud dengan durasi diatur ke 30 dan dua potret referensi yang sama dilampirkan, tertangkap saat generasi berlangsung. Perhatikan @image1 dan @image2 chip di prompt: begitulah cara kamu memberi tahu Seedance referensi mana yang memainkan peran mana. Periksa harga yang dikutip pada tombol Run sebelum kamu berkomitmen, karena itu mencerminkan durasi yang akan dikirimkan oleh pekerjaan.

Versi 30 detik dari adegan yang sama, paket referensi yang sama, ketukan dituliskan shot demi shot.

Tambahkan video referensi hanya untuk gerakan. Lampirkan klip yang kamu sukai ritmenya dan katakan secara eksplisit dalam prompt, sesuatu seperti "ikuti video referensi hanya untuk ritme pemotongan, abaikan subjek dan latarnya". Itulah trik di balik contoh kartu flip di atas.

Perbaiki penyimpangan dengan negative prompt sebelum menyentuh yang positif. Perubahan wajah, pergeseran warna, dan goyangan genggam adalah tiga hal yang merusak shot terkunci referensi, dan biasanya lebih murah untuk ditekan daripada dijelaskan.

Coba Format Referensi Multimodal Secara Gratis

Jika kamu menginginkan bentuk ini sebelum kamu menginginkan parameternya, Atlas Cloud meluncurkan generator skenario iklan AI gratis minggu lalu yang menjalankan rantai yang sama tanpa satu pun kenop.

Kamu menulis satu baris tentang produk dan poin penjualannya. Ia menulis skrip komedi dua karakter untukmu, kait, konflik, twist, lalu merender video 15 detik dengan dialog lisan dan efek suara bawaan. Kamu dapat melampirkan hingga empat foto produk asli sebagai referensi, dan iklan tersebut mempertahankan bentuk, warna, label, dan logonya dari skrip hingga bingkai akhir. Enam gaya disertakan, dari meme lucu melalui plot twist dan sitkom hingga kemewahan dan penjualan keras, dan dialognya kembali dalam bahasa apa pun yang kamu gunakan untuk menulis deskripsi.

Itu adalah rantai dua karakter-plus-gambar-referensi-plus-suara yang sama dari tutorial, dikurangi penulisan prompt dan dikurangi tagihan. Yang menjadikannya cara yang layak untuk mencari tahu apakah format ini cocok untuk produkmu sebelum kamu menghabiskan apa pun untuk menyetelnya.

Untuk gambaran tentang apa yang dilakukan setumpuk gambar referensi diam pada sebuah karya produk, ini adalah versi Wan 3.0 sendiri dari pekerjaan itu: lima gambar masuk, satu reel peluncuran keluar, masing-masing gambar diam menjadi jangkar satu ketukan dari suntingan.

Tumpukan animasi kartu putih dan hijau mint mengambang

Lima gambar referensi diam diperluas menjadi reel peluncuran produk bergaya Material Design_Lima gambar referensi mendorong film produk sembilan detik, masing-masing menjadi jangkar satu ketukan dan beralih ke ketukan berikutnya. Sumber: Buku panduan pembuat Wan 3.0 resmi Alibaba._

Berapa Biaya Klip Referensi Multimodal Wan 3.0

LangkahModelHarga satuanKuantitasBiaya
1 dan 2, dua gambar referensiGPT Image 2$0,009 per gambar2$0,02
3, referensi suaraMiniMax Speech 2.6 HD$0,08 per 1K karakter49 karakter$0,00
4, take 10 detik di 1080PWan 2.7 Referensi-ke-Video$0,15 per detik di 1080P10 detik$1,50
Total tutorialsekitar $1,52
Variasi, 30 detikSeedance 2.5 Referensi-ke-Video$0,134 per detik di 480P30 detiksekitar $4,02
Rute gratisGenerator Skenario Iklan AI Gratisgratis1 klip, 15 detik$0

Itu adalah tarif platform itu sendiri, diperiksa pada Agustus 2026 dan ditagih sesuai pemakaian. Dua hal yang menggerakkan total lebih dari yang diharapkan orang. Resolusi adalah yang pertama: $0,10 per detik dalam tabel perbandingan adalah tarif dasar Wan 2.7, dan 1080P ditagih pada $0,15, dari mana $1,50 di atas berasal. Yang kedua adalah bahwa Seedance memberi harga berdasarkan jumlah piksel, jadi $0,134 per detik yang tercantum adalah angka 480P dan take 720P harganya lebih dari sekadar perkalian langsung. Sebagai referensi, tarif beta Wan 3.0 yang dilaporkan sebesar $0,20 per detik di 1080p akan menempatkan take 30 detik penuh di sekitar $6, yang lebih dari rute Seedance di 480P saat ini.

Catatan tentang penggunaan ini. Wan 3.0 adalah beta dan persyaratannya dapat berubah, jadi baca ulang sebelum kamu membangun pipeline di atasnya. Jika gambar referensimu adalah orang sungguhan, dapatkan izin mereka terlebih dahulu, karena referensi-ke-video adalah kemampuan yang membuat hal itu penting. Klip contoh dalam artikel ini adalah hasil generasi Alibaba sendiri dari buku panduan publiknya, direproduksi di sini untuk komentar.

Pertanyaan yang Sering Diajukan

Berapa banyak referensi yang benar-benar dapat diambil oleh referensi multimodal Wan 3.0?

Hingga 20 aset dalam satu panggilan, yang diambil dari gambar, video, audio, dokumen, dan halaman web. Batas praktis lebih rendah dari batas teknis. Tetapkan setiap aset tepat satu pekerjaan, satu subjek per gambar, dan kamu akan menggunakan jauh lebih sedikit dari 20 untuk sebagian besar adegan.

Bisakah Wan 3.0 benar-benar mengubah PDF atau halaman web menjadi video?

Ya, itulah bagian yang benar-benar unik. Selain teks, gambar, audio, dan video, ia menerima file dokumen dan URL langsung, dengan laporan tentang beta yang mencantumkan .doc, .xls, .ppt, .pdf dan .txt. Tidak ada model referensi-ke-video lain dalam tabel perbandingan di atas yang menerima dokumen sama sekali.

Apakah Wan 3.0 open source? Bisakah saya menjalankannya di ComfyUI?

Tidak, dan tidak untuk saat ini. Wan 3.0 adalah beta tertutup yang berjalan di cloud Alibaba sendiri. Generasi Wan sebelumnya dirilis secara terbuka, itulah sebabnya ekspektasi itu ada, tetapi Alibaba belum mengonfirmasi bobot untuk 3.0. Halaman yang mengklaim rilis Apache 2.0 Wan 3.0 1.3B atau 14B tidak didukung oleh apa pun yang resmi.

Apakah Wan 3.0 tersedia melalui API pihak ketiga?

Belum, termasuk Atlas Cloud. Hal terdekat yang bisa kamu panggil hari ini adalah Wan 2.7 Referensi-ke-Video, yang bentuk inputnya hampir persis sama dengan omni-reference selain modalitas dokumen dan halaman web, atau Seedance 2.5 Referensi-ke-Video jika kamu membutuhkan 30 detik penuh.

Apa cara termurah untuk menguji video dua karakter yang terkunci referensi?

Generator skenario iklan AI gratis yang ditautkan di atas. Empat foto referensi masuk, klip dua karakter lisan 15 detik keluar, tanpa parameter dan tanpa pengeluaran. Jika itu cocok untuk produk dan formatmu, maka setel rantai berbayar.

Mengapa karakterku masih melenceng meskipun dengan gambar referensi?

Tiga penyebab, dalam urutan frekuensi. Satu referensi membawa dua pekerjaan, sehingga diminta untuk memperbaiki wajah dan lokasi. Gambar referensi memiliki lebih dari satu orang atau latar belakang yang sibuk, sehingga model tidak tahu bagian mana yang harus dikunci. Atau penyimpangan itu adalah artefak rendering daripada kegagalan referensi, dalam hal ini masukkan perubahan wajah, pergeseran warna ke dalam negative prompt sebelum menulis ulang apa pun.

Model Terbaru

Satu API untuk semua AI multimedia.

Jelajahi semua model