Cập nhật mới nhất: Wan 3.0 đã chính thức ra mắt từ ngày 24 tháng 8 năm 2026.
Bạn đã xây dựng một thư mục cho một quảng cáo 15 giây. Hai ảnh tĩnh nhân vật. Một video giọng thương hiệu khách hàng gửi. Một sách hướng dẫn thương hiệu chỉ tồn tại dưới dạng PDF. Một mẫu giọng của diễn viên bạn thực sự muốn.
Sau đó bạn mở mô hình video của mình và nó chỉ yêu cầu một hình ảnh.
Vậy là bạn làm điều ai cũng làm. Bạn chuyển thư mục thành một câu lệnh 800 từ và cầu nguyện. Khuôn mặt trôi đi trong cảnh quay thứ ba. Chiếc áo khoác đổi màu. Giọng nói là của một người hoàn toàn khác.
Tham chiếu đa phương thức (omni-reference) của Wan 3.0 là lần đầu tiên một mô hình video nói: được rồi, đưa tôi cả thư mục. Lên đến 20 tài sản trong một lần gọi, trải dài năm loại đầu vào, gắn kết xuyên suốt một cảnh quay liên tục 30 giây duy nhất.
Bài viết này làm ba điều và bỏ qua phần còn lại. Nó phân tích 20 tài sản đó thực sự là gì, sử dụng các clip do chính Alibaba tạo ra làm bằng chứng, và cung cấp một quy trình tương đương bạn có thể chạy ngay hôm nay, bởi vì Wan 3.0 vẫn đang ở giai đoạn beta công khai trên đám mây của riêng Alibaba và chưa thể gọi từ các nền tảng bên thứ ba.
Những điểm chính
- Tham chiếu đa phương thức của Wan 3.0 chấp nhận lên đến 20 tài sản trong một lần gọi, bao gồm hình ảnh, video, âm thanh, tài liệu và trang web trực tiếp, và giữ chúng nhất quán xuyên suốt một cảnh quay 30 giây duy nhất.
- Đây là mô hình video chính thống đầu tiên coi một tệp PDF, một bộ trình chiếu hoặc một URL như một đầu vào sáng tạo, thay vì thứ bạn phải diễn giải thành một câu lệnh.
- Wan 3.0 bước vào giai đoạn beta công khai vào ngày 6 tháng 8 năm 2026 trên Alibaba Cloud Model Studio và Qwen Cloud với tên
wan3.0-video. Nó có trọng số đóng. Bất kỳ ai nói rằng nó đã là Apache 2.0 chỉ đang đoán mò. - Tiêu đề 20 tài sản không phải là nơi nó thực sự vượt trội. Các mô hình tham chiếu-đến-video bạn có thể gọi ngay bây giờ đã chấp nhận nhiều tài sản hơn 20. Khoảng cách là ở tài liệu và trang web, chứ không phải số lượng.
- Bạn có thể kiểm tra định dạng hai nhân vật, khóa tham chiếu, có giọng nói đầy đủ miễn phí với Trình tạo kịch bản quảng cáo AI miễn phí của Atlas Cloud: bốn ảnh sản phẩm đầu vào, một đoạn kịch 15 giây có lời thoại đầu ra, không cần thẻ.

Hai chú mèo bị đuổi qua năm bối cảnh khác nhau bởi Wan 3.0 mà không có trôi nhân vật_Hai ảnh tham chiếu. Năm bối cảnh hoàn toàn khác nhau, từ hành lang khách sạn đến lồng máy giặt đến buồng điện thoại đỏ. Không một khung hình nào bị trôi. Nguồn: Sổ tay hướng dẫn tạo nội dung Wan 3.0 chính thức của Alibaba_ Wan 3.0 creator handbook , tháng 8 năm 2026, cũng là nơi tất cả các clip Wan 3.0 khác trong bài viết này được lấy từ.
Tại sao Video Đa Tham chiếu Lại Thất bại, và Tham chiếu Đa phương thức Wan 3.0 Thay đổi Điều gì
Các mô hình video không có bộ nhớ giữa các clip. Mỗi lần tạo đều bắt đầu từ con số không. Đó là toàn bộ vấn đề trong một câu.
Vậy nên ngay khi câu chuyện của bạn cần nhiều hơn một cảnh quay, bạn đang phải ghép nối. Cảnh quay đầu tiên cho bạn một khuôn mặt bạn yêu thích. Cảnh quay thứ hai cho bạn một người anh em họ của khuôn mặt đó. Cảnh quay thứ ba lặng lẽ đổi màu áo khoác từ màu mận sang màu đỏ rượu, và đến khi bạn phát hiện ra, bạn đã trả tiền cho mười một lần render.
Tham chiếu một hình ảnh đã giúp ích, nhưng nó chỉ khóa được một thứ. Một khuôn mặt. Nó không thể đồng thời giữ một khuôn mặt, một bộ trang phục, một đạo cụ, một địa điểm và một giọng nói, bởi vì chỉ có một chỗ trống và năm nhiệm vụ.
Có hai cách thoát khỏi tình trạng này. Cho mô hình nhiều chỗ trống hơn, hoặc ngừng bắt nó bắt đầu lại. Wan 3.0 làm cả hai cùng một lúc, và đó là lý do tại sao hai tính năng chính thực sự là một tính năng duy nhất. Một cảnh quay 30 giây gốc có nghĩa là không có chỗ cắt để nhân vật trôi đi. Hai mươi tài sản tham chiếu có nghĩa là mọi yếu tố phải được giữ cố định đều có chỗ riêng thay vì phải tranh giành một chỗ.
Đây là những gì nó trông như thế nào khi không có gì bị ghép nối. Ba mươi giây, một máy quay liên tục, một đứa trẻ trong xe đẩy hàng cuối cùng bị nhúng vào bên trong một bảng quảng cáo và sau đó bước ra từ bên dưới nó.
Một đoạn 30 giây đầy đủ trong một lần, không cắt, với nhạc nền được tạo trong cùng một lần. Nguồn: Sổ tay hướng dẫn tạo nội dung Wan 3.0 chính thức của Alibaba.
"20 Tài sản" Thực sự Có nghĩa là gì Bên trong Tham chiếu Đa phương thức Wan 3.0
Hai mươi là một con số tiêu đề. Điều quan trọng là hai mươi con số này không phải tất cả đều là cùng một loại. Tham chiếu đa phương thức (omni-reference) của Wan 3.0 bao gồm năm loại đầu vào, và mỗi loại kiểm soát một trục khác nhau của đầu ra.
Hình ảnh kiểm soát danh tính. Một thẻ nhân vật, một ảnh sản phẩm, một tấm ảnh địa điểm. Wan 3.0 gọi đây là sự nhất quán cấp độ pixel, và trong các ví dụ của chính Alibaba, sự khóa này kéo dài qua cả khuôn mặt vào trang phục: chiếc áo choàng xám nhiều lớp, áo da đeo dây, thắt lưng tối màu tất cả đều tồn tại qua một trận chiến tay đôi kéo dài mười sáu giây qua ba địa điểm.

Hai thẻ nhân vật thúc đẩy một cảnh chiến đấu võ thuật với chi tiết trang phục được giữ nguyên từng khung hình
Hai thẻ nhân vật cộng với một tấm ảnh địa điểm của bờ lau sậy. Trang phục và bối cảnh giữ vững qua mọi cú ném. Được hiển thị ở đây dưới dạng GIF im lặng; tệp gốc có bản mix âm thanh nổi 44.1kHz. Nguồn: Sổ tay hướng dẫn tạo nội dung Wan 3.0 chính thức của Alibaba.
Âm thanh kiểm soát giọng nói. Đây là phần khiến "đa phương thức" trở nên có ý nghĩa hơn là tiếp thị. Bạn đính kèm một mẫu giọng cho mỗi nhân vật, viết lời thoại trong câu lệnh, và đoạn hội thoại sẽ trả về với âm sắc đó, khớp khẩu hình, trong cùng một lần với hình ảnh. Hai người, hai tham chiếu giọng nói, một phòng gym.
Hai ảnh chủ thể cộng với hai clip tham chiếu giọng nói riêng biệt, và đoạn hội thoại trả về với hai giọng đó. Đáng để bật âm thanh cho clip này. Nguồn: Sổ tay hướng dẫn tạo nội dung Wan 3.0 chính thức của Alibaba.
Video kiểm soát thời gian. Một video tham chiếu không phải để sao chép. Nó có nhiệm vụ hiến tặng nhịp điệu của nó: một nhịp kéo dài bao lâu, một chuyển tiếp di chuyển như thế nào. Trong clip này, năm khung hình chính cung cấp các chủ thể và một video tham chiếu cung cấp nhịp điệu lật thẻ ngang giữa chúng.

Năm khung hình chính được lật qua với nhịp độ lấy từ video tham chiếu_Năm_ ảnh khung hình chính cho các chủ thể, một video tham chiếu cho nhịp điệu lật. Nguồn: Sổ tay hướng dẫn tạo nội dung Wan 3.0 chính thức của Alibaba.
Tài liệu và trang web kiểm soát cấu trúc. Đây là phần thực sự mới mẻ. Wan 3.0 chấp nhận các tệp tài liệu và URL trực tiếp làm đầu vào sáng tạo, và báo cáo về bản beta liệt kê .doc, .xls, .ppt, .pdf và .txt trong số các định dạng được chấp nhận (AlphaSignal, tháng 8 năm 2026). Logic tương tự đã hoạt động với một hình ảnh bảng phân cảnh: một bảng đầu vào, sáu cảnh quay đầu ra, theo đúng thứ tự của bảng.

Một bảng phân cảnh duy nhất được mở rộng thành sáu cảnh quay liên tiếp tại sân ga mưa
Một bảng phân cảnh làm tham chiếu, sáu cảnh quay được tạo theo thứ tự của nó, cho đến chi tiết chuyền ghi chú trong cảnh quay thứ năm. Nguồn: Sổ tay hướng dẫn tạo nội dung Wan 3.0 chính thức của Alibaba.
Khung hình đầu tiên và cuối cùng kiểm soát điểm cuối. Thủ thuật lâu đời nhất trong sách, vẫn được hỗ trợ, vẫn là cách nhanh nhất để giới hạn một cảnh quay.
Dưới đây là cách nó xếp chồng lên phiên bản mà hầu hết mọi người thực sự đang sử dụng ngày nay.
| Wan 2.7 Tham chiếu-đến-Video | Wan 3.0 tham chiếu đa phương thức | |
|---|---|---|
| Tài sản tham chiếu | một hình ảnh cho mỗi chủ thể, tối đa 3 video, 1 clip giọng nói | tổng cộng lên đến 20 tài sản |
| Phương thức | hình ảnh, video, âm thanh | hình ảnh, video, âm thanh, tài liệu, trang web |
| Thời lượng tối đa, một lần | 10 giây | 30 giây gốc, cộng thêm thời lượng thông minh |
| Âm thanh trong cùng một lần | có | có |
| Chỉnh sửa và mở rộng video | không được tiếp xúc | chỉnh sửa dựa trên hướng dẫn và tham chiếu, cộng thêm mở rộng |
| Tính khả dụng | có sẵn trên API bên thứ ba | Alibaba Cloud Model Studio và Qwen Cloud beta |
Có một quy tắc không ai viết trong tài liệu và mọi người đều học một cách khó khăn: một tham chiếu, một công việc. Hình ảnh1 khóa khuôn mặt và trang phục. Video1 chỉ hiến tặng chuyển động. Âm thanh1 chỉ hiến tặng âm sắc. Khoảnh khắc bạn giao cho một tài sản duy nhất hai công việc xung đột, hoặc tải lên một hình ảnh tham chiếu có hai người trong đó, mô hình phải đoán, và đoán chính xác là điều bạn đang cố gắng ngăn chặn. Sổ tay hướng dẫn của Alibaba cũng thẳng thắn về điều này: một chủ thể cho mỗi hình ảnh tham chiếu.
Quy trình Tham chiếu Đa phương thức Wan 3.0 Bạn Có thể Chạy Ngay hôm nay
Câu trả lời thẳng thắn trước tiên. Wan 3.0 đang trong giai đoạn beta công khai trên đám mây của riêng Alibaba, với mã mô hình wan3.0-video (Alibaba Wan, tháng 8 năm 2026). Nó chưa có mặt trên các nền tảng API bên thứ ba, bao gồm cả Atlas Cloud. Bất kỳ ai đang bán cho bạn quyền truy cập API Wan 3.0 ngay bây giờ đều đang bán lại thứ khác.
Điều đã có mặt là hình dạng quy trình làm việc. Gói tham chiếu vào, một lần gọi, clip hoàn chỉnh có âm thanh ra. Điều này chạy ngay hôm nay trên các mô hình tham chiếu-đến-video mà bạn có thể gọi trong một tab trình duyệt, và một khi bạn sắp xếp tất cả chúng, tiêu đề 20 tài sản trông khác đi.
| Model | Tài sản tham chiếu | Phương thức | Thời lượng tối đa | Âm thanh gốc | Giá mỗi giây |
|---|---|---|---|---|---|
| Wan 3.0 (beta Alibaba, chưa có trên Atlas) | tổng cộng 20 | hình ảnh, video, âm thanh, tài liệu, trang web | 30 giây | Có | báo cáo $0.05 đến $0.20 tùy độ phân giải |
| Wan 2.7 Tham chiếu-đến-Video | 1 hình ảnh mỗi chủ thể, 3 video, 1 clip giọng nói | hình ảnh, video, âm thanh | 10 giây | Có | $0.10 |
| Seedance 2.5 Tham chiếu-đến-Video | 50 (30 hình ảnh / 10 video / 10 âm thanh) | hình ảnh, video, âm thanh | 30 giây | Có | $0.13 |
| MiniMax H3 Tham chiếu-đến-Video | hỗn hợp, không có giới hạn công bố | hình ảnh, video, âm thanh | 15 giây | Có | $0.10 |
| Kling Video O3 Pro Tham chiếu-đến-Video | 7 hình ảnh, hoặc 4 hình ảnh + 1 video | hình ảnh, video | 15 giây | Có | $0.10 |
| Vidu Q3-Mix Tham chiếu-đến-Video | 4 hình ảnh | hình ảnh | 16 giây | Có | $0.11 |
| Veo 3.1 Tham chiếu-đến-Video | 3 hình ảnh | hình ảnh | 8 giây | Tùy chọn | $0.20 |
Giá là tỷ giá Atlas Cloud tính đến tháng 8 năm 2026. Các con số của Wan 3.0 là những con số được báo cáo cho bản beta Alibaba Cloud, không phải tỷ giá Atlas, và Alibaba chưa công bố trang giá công khai cho mô hình này, vì vậy hãy coi hàng đó là tạm thời.
Đọc bảng đó hai lần và câu chuyện thực sự hiện ra. Tiêu đề 20 tài sản không phải là nơi Wan 3.0 vượt trội, bởi vì Seedance 2.5 đã nhận 50 và đạt được 30 giây. Những gì không có mô hình nào khác trong danh sách đó nhận được là một tệp PDF.
Đối với phần hướng dẫn bên dưới, bản demo chạy trên Wan 2.7 Tham chiếu-đến-Video, vì hình dạng đầu vào của nó gần nhất với họ hàng của tham chiếu đa phương thức: nhiều hình ảnh chủ thể, một video tham chiếu tùy chọn và một clip giọng nói, tất cả được ánh xạ tới các nhãn character1 và character2 bên trong câu lệnh. Ba mô hình, một tab trình duyệt, không cần cài đặt cục bộ.
Để chạy thử nghiệm hiện tại, hãy mở Wan 3.0 trên Atlas Cloud và kiểm tra một câu lệnh như bên dưới trước khi bạn công bố quy trình làm việc.

Ảnh chụp màn hình kết quả câu lệnh-đến-kết quả Wan 3.0: bàn giao thương hiệu với 20 tham chiếu.
Tự Xây dựng: Một Cảnh Tham chiếu Đa phương thức trong Bốn Bước
Bối cảnh: một quầy lễ tân khách sạn màu pastel. Một nhân viên trực quầy với vẻ mặt vô cảm. Một du khách ôm một con mèo ragdoll. Nhân viên trực quầy nhìn thẳng vào ống kính và nói "Con mèo có đặt phòng. Còn anh thì không."
Hai hình ảnh cộng với một clip giọng nói, đó là ba tài sản tham chiếu trên hai phương thức. Đó là bản dựng nhỏ nhất thực sự đa phương thức chứ không chỉ đa hình ảnh.
Bước 1. Tạo hình ảnh tham chiếu 1, chủ thể bạn phải khóa
Hình ảnh tham chiếu có ba công việc và chỉ có ba: một chủ thể, đối diện máy ảnh, nền sạch. Mọi thứ khác chỉ là trang trí. Sử dụng GPT Image 2 với chất lượng high, kích thước 16:9, n=1.
Plain1Chân dung toàn thân trong studio của một nhân viên trực quầy khách sạn trung niên với vẻ mặt vô cảm, đứng chính giữa trước một bức tường màu hồng phấn phẳng. Anh ta mặc đồng phục bellhop màu tím mận, hai hàng cúc, có viền vàng và cúc đồng, đội một chiếc mũ nhỏ hình tròn, và có một bộ ria mép mảnh. Khung hình đối xứng hoàn hảo, ánh sáng front mềm mại đều, không có bóng đổ trên tường, hạt phim 35mm, bảng màu pastel nhẹ nhàng. Chỉ một chủ thể, không có người khác, không có chữ, không có logo, không có đạo cụ trong khung hình. 2

Bảng điều khiển GPT Image 2 trên Atlas Cloud với chân dung tham chiếu nhân viên trực quầy được render trong bảng đầu ra
GPT Image 2 trên Atlas Cloud: chất lượng cao, 16:9, một chủ thể, nền phẳng. Đây là tệp sẽ trở thành character1.
Bước 2. Tạo hình ảnh tham chiếu 2, chủ thể bị khóa thứ hai
Cùng mô hình, cùng cài đặt. Sự tương phản màu sắc giữa hai nhân vật là có chủ đích, vì nó cho mô hình một cách dễ dàng để phân biệt chúng khi chúng chia sẻ một khung hình.
Plain1Chân dung toàn thân trong studio của một nữ du khách trẻ ôm một con mèo ragdoll xù lông trước ngực, đứng chính giữa trước một bức tường màu vàng mù tạt phẳng. Cô ấy mặc áo khoác len màu mù tạt, đội mũ nồi đỏ và đeo kính gọng đồi mồi tròn, và tay kia cầm một chiếc vali da nhỏ kiểu cổ điển. Khung hình đối xứng hoàn hảo, ánh sáng front mềm mại đều, không có bóng đổ trên tường, hạt phim 35mm, bảng màu pastel nhẹ nhàng. Chỉ một chủ thể, không có người khác, không có chữ, không có logo. 2
Bước 3. Tạo tham chiếu giọng nói, phần thực sự đa phương thức
Clip giọng nói là thứ biến việc này từ một công việc đa hình ảnh thành một công việc đa phương thức. Khe âm thanh của Wan 2.7 muốn một mẫu ngắn, khoảng 1 đến 10 giây, vì vậy hãy giữ câu ngắn. Sử dụng MiniMax Speech 2.6 HD và chọn một giọng nam thấp, phẳng, không bận tâm.
Plain1Chào buổi tối. Nhận phòng ạ? Tất nhiên rồi. Ai cũng vậy. 2
Bước 4. Một lần gọi, ba tham chiếu, một clip hoàn chỉnh
Bây giờ toàn bộ gói được đưa vào cùng nhau trên Wan 2.7 Tham chiếu-đến-Video. Cài đặt: resolution: 1080P, ratio: 16:9, duration: 10, đây là giới hạn của mô hình này, prompt_extend: false, seed: -1. Tải images theo thứ tự, bước 1 trước, để nó ánh xạ tới character1, sau đó bước 2 là character2, và đính kèm tệp bước 3 vào audio.
Plain1Cảnh quay rộng đối xứng, chính giữa, quầy lễ tân sảnh khách sạn màu pastel, tường hồng phấn và giá để chìa khóa màu vàng mù tạt phía sau. character1 là nhân viên trực quầy đứng sau quầy; character2 là du khách đứng trước quầy, vẫn ôm con mèo ragdoll. Máy quay đẩy vào chậm theo trục trung tâm hoàn hảo và không bao giờ nghiêng. character1 nhìn thẳng vào ống kính và nói một cách phẳng lặng: "Con mèo có đặt phòng. Còn anh thì không." character2 chớp mắt một lần, từ từ quay đầu về phía con mèo, rồi quay lại quầy. Con mèo nhìn thẳng vào máy ảnh mà không cử động. Hạt phim 35mm, ánh sáng mềm mại đều, bảng màu pastel nhẹ nhàng, không rung máy, không cắt. 2
Câu lệnh phủ định:
Plain1rung tay cầm, cắt nhanh, phụ đề, chữ trên màn hình, watermark, người thừa, tay biến dạng, biến dạng khuôn mặt, thay đổi màu sắc, nhòe chuyển động 2

Bảng điều khiển Wan 2.7 Tham chiếu-đến-Video trên Atlas Cloud với hai hình ảnh tham chiếu và một tệp âm thanh đã tải và clip hoàn chỉnh trong bảng đầu ra
Wan 2.7 Tham chiếu-đến-Video trên Atlas Cloud: hai hình ảnh tham chiếu và một clip giọng nói được đính kèm ở bên trái, cảnh quay hoàn chỉnh đang phát ở bên phải ở độ phân giải 1080P và 16:9. Bản chụp này chạy ở thời lượng mặc định của mô hình; hãy đặt thành 10 để có phiên bản đầy đủ bên dưới.
Clip hoàn chỉnh. Cả hai khuôn mặt được giữ, cả hai trang phục được giữ, và câu thoại được truyền tải bằng giọng nói nhân bản từ bước 3, vì vậy clip này đáng để bật âm thanh.

Hai chân dung tham chiếu bên cạnh một khung hình từ clip hoàn chỉnh, cho thấy cùng khuôn mặt và trang phục
Tham chiếu ở bên trái, một khung hình từ clip giao hàng ở bên phải. Viền đồng phục, mũ nồi, kính và mèo đều sống sót sau chuyến đi.
Các Biến thể của Quy trình Tham chiếu Đa phương thức Wan 3.0
Kéo dài lên 30 giây. Cùng một gói tham chiếu chạy trên Seedance 2.5 Tham chiếu-đến-Video với duration: 30, giúp bạn có được độ dài mà Wan 3.0 hứa hẹn mà không cần chờ đợi bản beta. Nó nhận lên đến 30 hình ảnh tham chiếu, 10 video và 10 clip âm thanh, vì vậy gói này có dư địa để phát triển. Viết thêm 20 giây dưới dạng các nhịp trong câu lệnh, chứ không phải dưới dạng cảm xúc, nếu không mô hình sẽ đệm thêm.

Bảng điều khiển Seedance 2.5 Tham chiếu-đến-Video trên Atlas Cloud với thời lượng được đặt thành 30 và cảnh quay dài được render
Seedance 2.5 Tham chiếu-đến-Video trên Atlas Cloud với thời lượng được đặt thành 30 và cùng hai chân dung tham chiếu được đính kèm, bắt gặp khi đang tạo. Lưu ý các @image1 và @image2 chips trong câu lệnh: đó là cách bạn bảo Seedance tham chiếu nào đóng vai trò nào. Kiểm tra giá được hiển thị trên nút Run trước khi cam kết, vì nó phản ánh thời lượng mà công việc thực sự sẽ gửi.
Phiên bản 30 giây của cùng một cảnh, cùng một gói tham chiếu, các nhịp được viết ra từng cảnh quay.
Thêm một video tham chiếu chỉ cho chuyển động. Đính kèm một clip có nhịp điệu bạn thích và nói rõ ràng trong câu lệnh, ví dụ "theo dõi video tham chiếu cho nhịp cắt, bỏ qua chủ thể và bối cảnh của nó". Đó là thủ thuật đằng sau ví dụ lật thẻ ở trên.
Sửa lỗi trôi bằng câu lệnh phủ định trước khi chạm vào câu lệnh tích cực. Biến dạng khuôn mặt, thay đổi màu sắc và rung tay cầm là ba yếu tố phá hỏng các cảnh quay khóa tham chiếu, và chúng thường rẻ hơn để ngăn chặn hơn là diễn tả quá mức.
Dùng thử Định dạng Tham chiếu Đa phương thức Miễn phí
Nếu bạn muốn có hình dạng của điều này trước khi bạn muốn các tham số, Atlas Cloud đã tung ra một Trình tạo kịch bản quảng cáo AI miễn phí vào tuần trước, chạy cùng một chuỗi nhưng không có nút điều chỉnh.
Bạn viết một dòng về sản phẩm của mình và các điểm bán hàng của nó. Nó viết một kịch bản hài kịch hai nhân vật cho bạn, móc, xung đột, bước ngoặt, sau đó render một video 15 giây với lời thoại và hiệu ứng âm thanh tích hợp sẵn. Bạn có thể đính kèm tối đa bốn ảnh sản phẩm thực tế làm tham chiếu, và quảng cáo giữ nguyên hình dạng, màu sắc, nhãn và logo của chúng từ kịch bản đến khung hình cuối cùng. Sáu phong cách đi kèm với nó, từ meme hài hước qua bước ngoặt bất ngờ và sitcom đến sang trọng và bán hàng mạnh mẽ, và lời thoại trả về bằng ngôn ngữ bạn đã viết mô tả.
Đó là cùng một chuỗi hai nhân vật cộng với hình ảnh tham chiếu cộng với giọng nói từ hướng dẫn, nhưng không cần viết câu lệnh và không cần thanh toán. Điều này làm cho nó trở thành một cách tốt để tìm hiểu xem định dạng này có phù hợp với sản phẩm của bạn hay không trước khi bạn bỏ tiền ra để tinh chỉnh nó.
Để có cảm nhận về việc một chồng ảnh tham chiếu tĩnh làm gì cho một đoạn giới thiệu sản phẩm, đây là phiên bản của chính Wan 3.0 cho công việc đó: năm hình ảnh đầu vào, một đoạn giới thiệu ra mắt đầu ra, mỗi ảnh tĩnh neo một nhịp của bản chỉnh sửa.

Năm ảnh tĩnh tham chiếu được mở rộng thành một đoạn giới thiệu sản phẩm theo phong cách Material Design_Năm hình ảnh tham chiếu thúc đẩy một đoạn phim sản phẩm dài chín giây, mỗi ảnh neo một nhịp và chuyển giao cho ảnh tiếp theo. Nguồn: Sổ tay hướng dẫn tạo nội dung Wan 3.0 chính thức của Alibaba._
Chi phí của một Clip Tham chiếu Đa phương thức Wan 3.0
| Bước | Mô hình | Đơn giá | Số lượng | Chi phí |
|---|---|---|---|---|
| 1 và 2, hai hình ảnh tham chiếu | GPT Image 2 | $0.009 mỗi hình ảnh | 2 | $0.02 |
| 3, tham chiếu giọng nói | MiniMax Speech 2.6 HD | $0.08 mỗi 1K ký tự | 49 ký tự | $0.00 |
| 4, cảnh quay 10 giây ở 1080P | Wan 2.7 Tham chiếu-đến-Video | $0.15 mỗi giây ở 1080P | 10 giây | $1.50 |
| Tổng hướng dẫn | khoảng $1.52 | |||
| Biến thể, 30 giây | Seedance 2.5 Tham chiếu-đến-Video | $0.134 mỗi giây ở 480P | 30 giây | khoảng $4.02 |
| Đường dẫn miễn phí | Trình tạo Kịch bản Quảng cáo AI Miễn phí | miễn phí | 1 clip, 15 giây | $0 |
Đó là tỷ giá của chính nền tảng, được kiểm tra vào tháng 8 năm 2026 và được thanh toán theo mức sử dụng. Hai điều làm thay đổi tổng chi phí nhiều hơn mọi người mong đợi. Độ phân giải là điều đầu tiên: $0.10 mỗi giây trong bảng so sánh là tỷ giá cơ bản của Wan 2.7, và 1080P tính phí $0.15, đó là nơi $1.50 ở trên đến từ. Điều thứ hai là Seedance định giá theo số lượng pixel, vì vậy $0.134 mỗi giây được liệt kê là con số 480P và một cảnh quay 720P có giá cao hơn phép nhân đơn giản. Để tham khảo, tỷ giá beta Wan 3.0 được báo cáo là $0.20 mỗi giây ở 1080p sẽ đưa một cảnh quay 30 giây đầy đủ lên khoảng $6, đắt hơn so với đường dẫn Seedance ở 480P ngày nay.
Lưu ý về việc sử dụng những thứ này. Wan 3.0 là bản beta và các điều khoản của nó có thể thay đổi, vì vậy hãy đọc lại chúng trước khi bạn xây dựng một đường ống dựa trên nó. Nếu hình ảnh tham chiếu của bạn là người thật, hãy xin phép họ trước, vì tham chiếu-đến-video chính xác là khả năng khiến điều đó trở nên quan trọng. Các clip ví dụ trong bài viết này là kết quả do chính Alibaba tạo ra từ sổ tay hướng dẫn công khai của họ, được sao chép lại ở đây để bình luận.
Câu hỏi thường gặp
Tham chiếu đa phương thức của Wan 3.0 thực sự có thể nhận bao nhiêu tham chiếu?
Lên đến 20 tài sản trong một lần gọi, lấy từ hình ảnh, video, âm thanh, tài liệu và trang web. Giới hạn thực tế thấp hơn giới hạn kỹ thuật. Gán cho mỗi tài sản đúng một công việc, một chủ thể cho mỗi hình ảnh, và bạn sẽ sử dụng ít hơn nhiều so với 20 cho hầu hết các cảnh.
Wan 3.0 thực sự có thể biến một tệp PDF hoặc một trang web thành video không?
Có, đó là phần thực sự độc đáo. Cùng với văn bản, hình ảnh, âm thanh và video, nó chấp nhận các tệp tài liệu và URL trực tiếp, với các báo cáo về bản beta liệt kê .doc, .xls, .ppt, .pdf và .txt. Không có mô hình tham chiếu-đến-video nào khác trong bảng so sánh ở trên nhận tài liệu.
Wan 3.0 có mã nguồn mở không? Tôi có thể chạy nó trong ComfyUI không?
Không, và hiện tại thì không. Wan 3.0 là bản beta đóng chạy trên đám mây của riêng Alibaba. Các thế hệ Wan trước đó đã được phát hành công khai, đó là lý do tại sao kỳ vọng tồn tại, nhưng Alibaba chưa xác nhận trọng số cho 3.0. Các trang web tuyên bố bản phát hành Apache 2.0 1.3B hoặc 14B của Wan 3.0 không được hỗ trợ bởi bất cứ điều gì chính thức.
Wan 3.0 có sẵn thông qua API bên thứ ba chưa?
Chưa, bao gồm cả Atlas Cloud. Thứ gần nhất bạn có thể gọi ngày hôm nay là Wan 2.7 Tham chiếu-đến-Video, có hình dạng đầu vào gần như khớp chính xác với tham chiếu đa phương thức ngoại trừ các phương thức tài liệu và trang web, hoặc Seedance 2.5 Tham chiếu-đến-Video nếu bạn cần đủ 30 giây.
Cách rẻ nhất để kiểm tra video hai nhân vật khóa tham chiếu là gì?
Trình tạo kịch bản quảng cáo AI miễn phí được liên kết ở trên. Bốn ảnh tham chiếu đầu vào, một clip 15 giây có lời thoại hai nhân vật đầu ra, không có tham số và không tốn phí. Nếu nó giữ được sản phẩm và định dạng của bạn, thì hãy điều chỉnh chuỗi tính phí.
Tại sao các nhân vật của tôi vẫn bị trôi mặc dù có hình ảnh tham chiếu?
Ba nguyên nhân, theo thứ tự tần suất. Một tham chiếu đang thực hiện hai công việc, vì vậy nó được yêu cầu sửa cả khuôn mặt và địa điểm. Hình ảnh tham chiếu có nhiều hơn một người hoặc nền bận rộn, vì vậy mô hình không biết phần nào để khóa. Hoặc sự trôi là một hiện tượng tạo tác render chứ không phải lỗi tham chiếu, trong trường hợp đó hãy thêm biến dạng khuôn mặt, thay đổi màu sắc vào câu lệnh phủ định trước khi viết lại bất cứ điều gì.






