Seedance 2.5 đã chính thức ra mắt — Có mặt đầu tiên trên Atlas Cloud

Wan 3.0 Multimodal Reference sử dụng 20 tài nguyên, và một tệp PDF là một trong số đó.

Wan 3.0 tham chiếu đa phương thức chấp nhận 20 tài sản trong một lần gọi: hình ảnh, video, âm thanh, PDF, thậm chí cả URL. Xem kết quả của chính Alibaba và một quy trình làm việc bạn có thể chạy ngay hôm nay.

Bạn đã tạo một thư mục cho một quảng cáo 15 giây. Hai ảnh tĩnh nhân vật. Một video giọng điệu thương hiệu mà khách hàng gửi. Một sách hướng dẫn thương hiệu chỉ tồn tại dưới dạng PDF. Một mẫu giọng nói từ diễn viên bạn thực sự muốn.

Sau đó bạn mở mô hình video của mình và nó yêu cầu một hình ảnh.

Vậy là bạn làm điều ai cũng làm. Bạn dịch thư mục đó thành một prompt 800 từ và cầu nguyện. Khuôn mặt trôi dạt trong cảnh quay thứ ba. Áo khoác đổi màu. Giọng nói là của một người hoàn toàn khác.

Omni-reference của Wan 3.0 là lần đầu tiên một mô hình video nói: được rồi, đưa tôi cái thư mục. Lên đến 20 tài sản trong một lần gọi, qua năm loại đầu vào, được giữ chặt trong một cảnh quay liên tục 30 giây.

Bài viết này làm ba việc và bỏ qua phần còn lại. Nó phân tích 20 tài sản đó thực sự là gì, nó sử dụng các clip do chính Alibaba tạo ra làm bằng chứng, và nó cung cấp cho bạn một quy trình làm việc tương đương mà bạn có thể chạy ngay hôm nay, bởi vì Wan 3.0 vẫn đang trong bản beta công khai trên đám mây của chính Alibaba và chưa thể gọi được từ các nền tảng bên thứ ba.

Những điểm chính

  • Tham chiếu đa phương thức của Wan 3.0 chấp nhận tới 20 tài sản trong một lần gọi, bao gồm hình ảnh, video, âm thanh, tài liệu và trang web trực tiếp, và giữ chúng nhất quán trong một cảnh quay 30 giây duy nhất.
  • Đây là mô hình video chính thống đầu tiên coi một tệp PDF, một bộ trình chiếu hoặc một URL như một đầu vào sáng tạo thay vì thứ gì đó bạn diễn giải thành một prompt.
  • Wan 3.0 bước vào bản beta công khai vào ngày 6 tháng 8 năm 2026 trên Alibaba Cloud Model Studio và Qwen Cloud với tên wan3.0-video. Nó có trọng số đóng. Bất kỳ ai nói với bạn rằng nó đã là Apache 2.0 đều đang phỏng đoán.
  • Con số 20 tài sản không phải là nơi nó thực sự vượt trội. Các mô hình tham chiếu-video mà bạn có thể gọi ngay bây giờ đã chấp nhận nhiều hơn 20 tài sản. Khoảng cách là tài liệu và trang web, không phải số lượng.
  • Bạn có thể thử nghiệm định dạng hai nhân vật, khóa tham chiếu, có lời thoại đầy đủ miễn phí với trình tạo kịch bản quảng cáo AI miễn phí của Atlas Cloud: bốn ảnh sản phẩm đầu vào, một kịch bản nói 15 giây đầu ra, không cần thẻ.

Hai con mèo, một con mèo lông xù và một con mèo đen, chạy dọc hành lang khách sạn lớn

Hai con mèo đuổi nhau qua năm bối cảnh khác nhau do Wan 3.0 tạo ra mà không có hiện tượng trôi nhân vật_Hai ảnh tham chiếu. Năm bối cảnh hoàn toàn khác nhau, từ hành lang khách sạn đến lồng máy giặt đến buồng điện thoại đỏ. Không có một khung hình nào bị trôi. Nguồn: Sổ tay hướng dẫn sáng tạo Wan 3.0 chính thức của Alibaba_ _ , tháng 8 năm 2026, cũng là nơi lấy tất cả các clip Wan 3.0 khác trong bài viết này.

Tại Sao Tham Chiếu Đa Video Lại Hỏng, và Wan 3.0 Tham Chiếu Đa Phương Thức Thay Đổi Điều Gì

Các mô hình video không có bộ nhớ giữa các clip. Mỗi lần sinh bắt đầu từ con số không. Đó là toàn bộ vấn đề trong một câu.

Vì vậy, ngay khi câu chuyện của bạn cần nhiều hơn một cảnh quay, bạn đang ghép nối. Cảnh một cho bạn một khuôn mặt bạn yêu thích. Cảnh hai cho bạn một người họ hàng của khuôn mặt đó. Cảnh ba lặng lẽ đổi áo khoác từ màu mận sang màu đỏ tía, và đến khi bạn nhận ra thì bạn đã trả tiền cho mười một lần render.

Tham chiếu một hình ảnh đã giúp ích, nhưng nó chỉ khóa một thứ. Một khuôn mặt. Nó không thể đồng thời giữ một khuôn mặt, một bộ trang phục, một đạo cụ, một địa điểm và một giọng nói, bởi vì chỉ có một chỗ và năm công việc.

Có hai cách thoát. Cung cấp cho mô hình nhiều chỗ hơn, hoặc ngăn nó bắt đầu lại. Wan 3.0 làm cả hai cùng một lúc, và đó là lý do tại sao hai tính năng chính thực sự là một tính năng. Một cảnh quay 30 giây gốc có nghĩa là không có chỗ cắt để nhân vật trôi dạt qua. Hai mươi tài sản tham chiếu có nghĩa là mọi yếu tố phải được giữ cố định đều có chỗ riêng thay vì tranh giành một chỗ.

Đây là những gì nó trông như thế nào khi không có gì được ghép nối. Ba mươi giây, một máy quay liên tục, một đứa trẻ trong xe đẩy hàng cuối cùng bị nhúng vào một tấm biển quảng cáo và sau đó bước ra từ bên dưới nó.

Một cảnh quay 30 giây đầy đủ trong một lần, không cắt, với nhạc nền được tạo trong cùng một lần. Nguồn: Sổ tay hướng dẫn sáng tạo Wan 3.0 chính thức của Alibaba.

"20 Tài Sản" Thực Sự Có Nghĩa Là Gì Bên Trong Tham Chiếu Đa Phương Thức Wan 3.0

Hai mươi là một con số tiêu đề. Điều quan trọng là hai mươi không phải tất cả đều là cùng một loại. Omni-reference của Wan 3.0 bao gồm năm loại đầu vào, và mỗi loại điều khiển một trục khác nhau của đầu ra.

Hình ảnh điều khiển danh tính. Một thẻ nhân vật, một ảnh chụp sản phẩm, một tấm địa điểm. Wan 3.0 gọi đây là sự nhất quán ở cấp độ pixel, và trong các ví dụ của chính Alibaba, sự khóa chặt mở rộng qua khuôn mặt vào trang phục: áo choàng xám nhiều lớp, áo da có dây đai, thắt lưng tối màu tất cả đều sống sót qua một cuộc chiến tay đôi kéo dài mười sáu giây qua ba địa điểm.

Chàng trai trẻ trong trang phục truyền thống Trung Quốc đứng ngoài trời lúc hoàng hôn

Hai thẻ nhân vật điều khiển một cảnh đánh nhau võ hiệp với các chi tiết trang phục được giữ nguyên từng khung hình

Hai thẻ nhân vật cộng với một tấm địa điểm của bờ lau sậy. Trang phục và bối cảnh được giữ nguyên qua mọi cú ném. Được hiển thị ở đây dưới dạng GIF im lặng; tệp được gửi có bản phối âm thanh nổi 44.1kHz. Nguồn: Sổ tay hướng dẫn sáng tạo Wan 3.0 chính thức của Alibaba.

Âm thanh điều khiển giọng nói. Đây là phần làm cho "đa phương thức" trở nên hơn cả tiếp thị. Bạn đính kèm một mẫu giọng nói cho mỗi nhân vật, viết lời thoại trong prompt, và đoạn hội thoại sẽ trả về với âm sắc đó, khớp môi, trong cùng một lần với hình ảnh. Hai người, hai tham chiếu giọng nói, một phòng gym.

Hai hình ảnh chủ thể cộng với hai clip tham chiếu giọng nói riêng biệt, và đoạn hội thoại trả về bằng hai giọng nói đó. Đáng để bật âm thanh cho cái này. Nguồn: Sổ tay hướng dẫn sáng tạo Wan 3.0 chính thức của Alibaba.

Video điều khiển thời gian. Một video tham chiếu không phải để sao chép. Nó là để hiến tặng nhịp điệu của nó: một nhịp giữ trong bao lâu, một chuyển tiếp di chuyển như thế nào. Trong ví dụ này, năm khung hình chính cung cấp các chủ thể và một video tham chiếu cung cấp nhịp điệu lật thẻ ngang giữa chúng.

Người phụ nữ đội mũ truyền thống Trung Quốc cầu kỳ và mặc váy thêu màu xanh

Năm khung hình chính được lật qua với nhịp điệu lấy từ video tham chiếu_Năm_ hình ảnh khung hình chính cho các chủ thể, một video tham chiếu cho nhịp lật. Nguồn: Sổ tay hướng dẫn sáng tạo Wan 3.0 chính thức của Alibaba.

Tài liệu và trang web điều khiển cấu trúc. Đây là phần thực sự mới. Wan 3.0 chấp nhận các tệp tài liệu và URL trực tiếp như đầu vào sáng tạo, và báo cáo về bản beta liệt kê .doc, .xls, .ppt, .pdf.txt trong số các định dạng được chấp nhận (AlphaSignal, tháng 8 năm 2026). Cùng một logic đã hoạt động với một hình ảnh storyboard: một bảng đầu vào, sáu cảnh quay đầu ra, theo thứ tự của bảng đó.

Hai người với ô đứng trên sân ga mưa

Một tờ storyboard duy nhất được mở rộng thành sáu cảnh quay liên tiếp tại một sân ga mưa

Một tờ storyboard làm tham chiếu, sáu cảnh quay được tạo theo thứ tự của nó, cho đến tận cảnh trao tay ghi chú trong cảnh thứ năm. Nguồn: Sổ tay hướng dẫn sáng tạo Wan 3.0 chính thức của Alibaba.

Khung hình đầu và cuối điều khiển điểm cuối. Thủ thuật lâu đời nhất, vẫn được hỗ trợ, vẫn là cách nhanh nhất để giới hạn một cảnh quay.

Đây là cách nó xếp chồng lên phiên bản mà hầu hết mọi người thực sự đang sử dụng ngày nay.

Wan 2.7 Tham chiếu-VideoWan 3.0 omni-reference
Tài sản tham chiếumột hình ảnh cho mỗi chủ thể, tối đa 3 video, 1 clip giọng nóitối đa 20 tài sản tổng cộng
Phương thứchình ảnh, video, âm thanhhình ảnh, video, âm thanh, tài liệu, trang web
Thời lượng tối đa, một lần10 s30 s gốc, cộng thêm thời lượng thông minh
Âm thanh trong cùng một lần
Chỉnh sửa và mở rộng videokhông được làm lộchỉnh sửa dựa trên hướng dẫn và tham chiếu, cộng thêm mở rộng
Khả dụnghoạt động trên các API bên thứ baAlibaba Cloud Model Studio và Qwen Cloud beta

Có một quy tắc mà không ai đưa vào tài liệu và mọi người đều học theo cách khó khăn: một tham chiếu, một công việc. Image1 khóa khuôn mặt và trang phục. Video1 chỉ hiến tặng chuyển động. Audio1 chỉ hiến tặng âm sắc. Khoảnh khắc bạn giao cho một tài sản duy nhất hai công việc xung đột, hoặc tải lên một hình ảnh tham chiếu có hai người trong đó, mô hình phải đoán, và đoán chính xác là điều bạn đang cố gắng ngăn chặn. Sổ tay hướng dẫn của Alibaba cũng thẳng thắn về điều này: một chủ thể cho mỗi hình ảnh tham chiếu.

Quy Trình Làm Việc Tham Chiếu Đa Phương Thức Wan 3.0 Bạn Có Thể Chạy Ngay Hôm Nay

Câu trả lời thẳng thắn trước tiên. Wan 3.0 đang trong bản beta công khai trên đám mây của chính Alibaba, với id mô hình wan3.0-video (Alibaba Wan, tháng 8 năm 2026). Nó chưa có mặt trên các nền tảng API bên thứ ba, bao gồm cả Atlas Cloud. Bất kỳ ai bán cho bạn quyền truy cập API Wan 3.0 ngay bây giờ đều đang bán lại thứ gì đó khác.

Điều đã có mặt là hình dạng quy trình làm việc. Gói tham chiếu vào, một lần gọi, clip hoàn chỉnh có âm thanh ra. Cái này chạy ngay hôm nay trên các mô hình tham chiếu-video mà bạn có thể gọi trong một tab trình duyệt, và một khi bạn sắp xếp tất cả, con số 20 tài sản trông khác đi.

Mô hìnhTài sản tham chiếuPhương thứcThời lượng tối đaÂm thanh gốcGiá mỗi giây
Wan 3.0 (beta Alibaba, chưa có trên Atlas)20 tổng cộnghình ảnh, video, âm thanh, tài liệu, trang web30 sbáo cáo $0.05 đến $0.20 tùy độ phân giải
Wan 2.7 Tham chiếu-Video1 hình ảnh cho mỗi chủ thể, 3 video, 1 clip giọng nóihình ảnh, video, âm thanh10 s$0.10
Seedance 2.5 Tham chiếu-Video50 (30 hình ảnh / 10 video / 10 âm thanh)hình ảnh, video, âm thanh30 s$0.13
MiniMax H3 Tham chiếu-Videohỗn hợp, không có giới hạn công bốhình ảnh, video, âm thanh15 s$0.10
Kling Video O3 Pro Tham chiếu-Video7 hình ảnh, hoặc 4 hình ảnh + 1 videohình ảnh, video15 s$0.10
Vidu Q3-Mix Tham chiếu-Video4 hình ảnhhình ảnh16 s$0.11
Veo 3.1 Tham chiếu-Video3 hình ảnhhình ảnh8 sTùy chọn$0.20

Giá là mức giá của Atlas Cloud tính đến tháng 8 năm 2026. Các con số của Wan 3.0 là những con số được báo cáo cho bản beta Alibaba Cloud, không phải mức giá của Atlas, và Alibaba chưa công bố trang giá công khai cho mô hình này, vì vậy hãy coi hàng đó là tạm thời.

Đọc bảng đó hai lần và câu chuyện thực sự hiện ra. Con số 20 tài sản không phải là nơi Wan 3.0 vượt trội, bởi vì Seedance 2.5 đã nhận 50 và khớp với 30 giây. Điều không có gì khác trong danh sách đó nhận được là một tệp PDF.

Đối với phần hướng dẫn bên dưới, bản demo chạy trên Wan 2.7 Tham chiếu-Video, vì hình dạng đầu vào của nó là họ hàng gần nhất của omni-reference: nhiều hình ảnh chủ thể, một video tham chiếu tùy chọn và một clip giọng nói, tất cả được ánh xạ tới các nhãn character1character2 bên trong prompt. Ba mô hình, một tab trình duyệt, không cần cài đặt cục bộ.

Tự Xây Dựng: Một Cảnh Tham Chiếu Đa Phương Thức Trong Bốn Bước

Cảnh: một quầy lễ tân khách sạn màu phấn. Một người gác cổng mặt lạnh. Một du khách ôm một con mèo ragdoll. Người gác cổng nhìn thẳng vào ống kính và nói "Con mèo có đặt phòng. Còn anh/chị thì không."

Hai hình ảnh cộng với một clip giọng nói, tức là ba tài sản tham chiếu qua hai phương thức. Đó là bản dựng nhỏ nhất thực sự là đa phương thức chứ không chỉ là đa hình ảnh.

Bước 1. Tạo hình ảnh tham chiếu 1, chủ thể bạn phải khóa

Hình ảnh tham chiếu có ba công việc và chỉ có ba: một chủ thể, quay mặt vào máy ảnh, nền sạch. Mọi thứ khác là trang trí. Sử dụng GPT Image 2 với chất lượng high, kích thước 16:9, n=1.

Plain
1Chân dung toàn thân studio của một người gác cổng trung niên với biểu cảm lạnh lùng, đứng chính giữa trước một bức tường màu hồng phấn phẳng. Anh ta mặc đồng phục chuông đôi màu tím mận với viền vàng và cúc đồng, đội mũ nhỏ tròn, và có ria mép mảnh. Khung hình đối xứng hoàn hảo, ánh sáng phía trước mềm mại đều, không có bóng đổ trên tường, hạt phim 35mm, bảng màu phấn nhạt. Chỉ một chủ thể, không có người khác, không có chữ, không có logo, không có đạo cụ trong khung hình.

Giao diện trình tạo hình ảnh AI hiển thị các bước được đánh số và một người gác cổng được tạo

Sân chơi GPT Image 2 trên Atlas Cloud với chân dung tham chiếu người gác cổng được render trong bảng đầu ra

GPT Image 2 trên Atlas Cloud: chất lượng cao, 16:9, một chủ thể, nền phẳng. Đây là tệp trở thành character1.

Bước 2. Tạo hình ảnh tham chiếu 2, chủ thể bị khóa thứ hai

Cùng mô hình, cùng cài đặt. Sự tương phản màu sắc giữa hai nhân vật là có chủ đích, vì nó cho mô hình một cách dễ dàng để phân biệt chúng khi chúng chia sẻ một khung hình.

Plain
1Chân dung toàn thân studio của một nữ du khách trẻ ôm một con mèo ragdoll lông xù trước ngực, đứng chính giữa trước một bức tường màu vàng mù tạt phẳng. Cô ấy mặc áo khoác len màu mù tạt, đội mũ nồi đỏ và đeo kính gọng đồi mồi tròn, và tay kia xách một chiếc vali da cổ nhỏ. Khung hình đối xứng hoàn hảo, ánh sáng phía trước mềm mại đều, không có bóng đổ trên tường, hạt phim 35mm, bảng màu phấn nhạt. Chỉ một chủ thể, không có người khác, không có chữ, không có logo.

Bước 3. Tạo tham chiếu giọng nói, phần thực sự đa phương thức

Clip giọng nói là thứ biến công việc này từ một công việc đa hình ảnh thành một công việc đa phương thức. Khe âm thanh của Wan 2.7 muốn một mẫu ngắn, khoảng 1 đến 10 giây, vì vậy hãy giữ dòng ngắn. Sử dụng MiniMax Speech 2.6 HD và chọn một giọng nam thấp, phẳng, không bận tâm.

Plain
1Chào buổi tối. Đăng ký phải không? Tất nhiên rồi. Ai cũng vậy.

Bước 4. Một lần gọi, ba tham chiếu, một clip hoàn chỉnh

Bây giờ toàn bộ gói đi vào cùng nhau trên Wan 2.7 Tham chiếu-Video. Cài đặt: resolution: 1080P, ratio: 16:9, duration: 10, đây là trần của mô hình này, prompt_extend: false, seed: -1. Tải images theo thứ tự, bước 1 trước, để nó ánh xạ tới character1, sau đó bước 2 là character2, và đính kèm tệp bước 3 vào audio.

Plain
1Cảnh rộng, đối xứng, chính giữa của quầy lễ tân khách sạn màu phấn, tường hồng phấn và giá treo chìa khóa màu vàng mù tạt phía sau. character1 là người gác cổng đứng sau quầy; character2 là du khách đứng trước quầy, vẫn ôm con mèo ragdoll của cô ấy. Máy quay đẩy vào chậm dọc theo một trục trung tâm hoàn hảo và không bao giờ nghiêng. character1 nhìn thẳng vào ống kính và nói một cách phẳng lặng: "Con mèo có đặt phòng. Còn anh/chị thì không." character2 chớp mắt một lần, từ từ quay đầu về phía con mèo, rồi quay lại quầy. Con mèo nhìn thẳng vào máy ảnh mà không nhúc nhích. Hạt phim 35mm, ánh sáng mềm mại đều, bảng màu phấn nhạt, không rung máy, không cắt.

Negative prompt:

Plain
1rung tay cầm, jump cut, phụ đề, chữ trên màn hình, watermark, người thừa, tay biến dạng, biến dạng khuôn mặt, thay đổi màu sắc, chuyển động mờ

Ảnh chụp màn hình giao diện trình tạo video AI với đầu vào và đầu ra

Sân chơi Wan 2.7 Tham chiếu-Video trên Atlas Cloud với hai hình ảnh tham chiếu và một tệp âm thanh đã tải và clip hoàn chỉnh trong bảng đầu ra

Wan 2.7 Tham chiếu-Video trên Atlas Cloud: hai hình ảnh tham chiếu và một clip giọng nói được đính kèm bên trái, cảnh quay hoàn chỉnh đang phát bên phải ở 1080P và 16:9. Bản chụp này chạy ở thời lượng mặc định của mô hình; đặt thành 10 cho phiên bản đầy đủ bên dưới.

Clip hoàn chỉnh. Cả hai khuôn mặt được giữ, cả hai trang phục được giữ, và lời thoại được truyền tải bằng giọng nói nhân bản từ bước 3, vì vậy cái này đáng để phát có âm thanh.

Người phụ nữ ôm mèo tại quầy lễ tân khách sạn với người gác cổng

Hai chân dung tham chiếu bên cạnh một khung hình từ clip hoàn chỉnh, cho thấy cùng khuôn mặt và trang phục

Tham chiếu bên trái, một khung hình từ clip đã gửi bên phải. Viền đồng phục, mũ nồi, kính và mèo đều sống sót sau chuyến đi.

Các Biến Thể của Quy Trình Làm Việc Tham Chiếu Đa Phương Thức Wan 3.0

Kéo dài lên 30 giây. Cùng một gói tham chiếu chạy trên Seedance 2.5 Tham chiếu-Video với duration: 30, giúp bạn có được độ dài mà Wan 3.0 hứa hẹn mà không cần chờ đợi bản beta. Nó nhận tối đa 30 hình ảnh tham chiếu, 10 video và 10 clip âm thanh, vì vậy gói có chỗ để phát triển. Viết 20 giây thừa dưới dạng các nhịp trong prompt, không phải dưới dạng rung cảm, nếu không mô hình sẽ đệm.

Giao diện trình tạo video AI hiển thị cài đặt đầu vào và tiến trình tạo

Sân chơi Seedance 2.5 Tham chiếu-Video trên Atlas Cloud với thời lượng đặt thành 30 và cảnh quay dài được render

Seedance 2.5 Tham chiếu-Video trên Atlas Cloud với thời lượng đặt thành 30 và cùng hai chân dung tham chiếu được đính kèm, được chụp giữa quá trình tạo. Lưu ý các chip @image1@image2 trong prompt: đó là cách bạn nói cho Seedance biết tham chiếu nào đóng vai trò nào. Kiểm tra giá được báo giá trên nút Run trước khi cam kết, vì nó phản ánh thời lượng mà công việc thực sự sẽ gửi.

Phiên bản 30 giây của cùng một cảnh, cùng một gói tham chiếu, các nhịp được viết ra từng cảnh một.

Thêm một video tham chiếu chỉ cho chuyển động. Đính kèm một clip có nhịp điệu bạn thích và nói rõ ràng trong prompt, điều gì đó như "chỉ tuân theo nhịp điệu cắt của video tham chiếu, bỏ qua các chủ thể và bối cảnh của nó". Đó là thủ thuật đằng sau ví dụ về lật thẻ ở trên.

Sửa lỗi trôi bằng negative prompt trước khi chạm vào positive prompt. Biến dạng khuôn mặt, thay đổi màu sắc và rung tay cầm là ba thứ phá hỏng các cảnh quay khóa tham chiếu, và chúng thường rẻ hơn để ngăn chặn hơn là mô tả quá nhiều.

Thử Định Dạng Tham Chiếu Đa Phương Thức Miễn Phí

Nếu bạn muốn hình dạng của cái này trước khi bạn muốn các tham số, Atlas Cloud đã phát hành một trình tạo kịch bản quảng cáo AI miễn phí tuần trước, chạy cùng một chuỗi mà không có bất kỳ núm điều chỉnh nào.

Bạn viết một dòng về sản phẩm của mình và các điểm bán hàng của nó. Nó viết một kịch bản hài hai nhân vật cho bạn, móc, xung đột, bước ngoặt, sau đó render một video 15 giây với hội thoại và hiệu ứng âm thanh được tích hợp sẵn. Bạn có thể đính kèm tối đa bốn ảnh sản phẩm thực tế làm tham chiếu, và quảng cáo giữ nguyên hình dạng, màu sắc, nhãn và logo của chúng từ kịch bản đến khung hình cuối cùng. Sáu phong cách đi kèm với nó, từ meme hài hước qua bước ngoặt cốt truyện và sitcom đến sang trọng và bán hàng cứng, và hội thoại trả về bằng bất kỳ ngôn ngữ nào bạn viết mô tả.

Đó là cùng một chuỗi hai nhân vật cộng hình ảnh tham chiếu cộng giọng nói từ hướng dẫn, trừ đi việc viết prompt và trừ đi hóa đơn. Điều này làm cho nó trở thành một cách khá tốt để tìm hiểu xem định dạng này có phù hợp với sản phẩm của bạn không trước khi bạn bỏ tiền ra để tinh chỉnh nó.

Để có cảm nhận về những gì một chồng ảnh tĩnh tham chiếu làm đối với một đoạn phim sản phẩm, đây là phiên bản của chính Wan 3.0 cho công việc đó: năm hình ảnh đầu vào, một cuộn giới thiệu sản phẩm đầu ra, mỗi ảnh tĩnh neo một nhịp của bản chỉnh sửa.

Chồng thẻ màu trắng và xanh bạc hà nổi động

Năm ảnh tĩnh tham chiếu được mở rộng thành một cuộn giới thiệu sản phẩm phong cách Material Design_Năm hình ảnh tham chiếu điều khiển một phim sản phẩm dài chín giây, mỗi hình ảnh neo một nhịp và chuyển giao cho nhịp tiếp theo. Nguồn: Sổ tay hướng dẫn sáng tạo Wan 3.0 chính thức của Alibaba._

Chi Phí Của Một Clip Tham Chiếu Đa Phương Thức Wan 3.0

BướcMô hìnhGiá đơn vịSố lượngChi phí
1 và 2, hai hình ảnh tham chiếuGPT Image 2$0.009 mỗi hình ảnh2$0.02
3, tham chiếu giọng nóiMiniMax Speech 2.6 HD$0.08 mỗi 1K ký tự49 ký tự$0.00
4, cảnh quay 10 giây ở 1080PWan 2.7 Tham chiếu-Video$0.15 mỗi giây ở 1080P10 s$1.50
Tổng hướng dẫnkhoảng $1.52
Biến thể, 30 giâySeedance 2.5 Tham chiếu-Video$0.134 mỗi giây ở 480P30 skhoảng $4.02
Đường miễn phíTrình tạo kịch bản quảng cáo AI miễn phímiễn phí1 clip, 15 s$0

Đó là mức giá của chính nền tảng, được kiểm tra vào tháng 8 năm 2026 và thanh toán theo mức sử dụng. Hai điều làm thay đổi tổng số nhiều hơn mọi người mong đợi. Độ phân giải là thứ nhất: $0.10 mỗi giây trong bảng so sánh là mức cơ bản của Wan 2.7, và 1080P tính phí $0.15, đó là nơi $1.50 ở trên đến từ. Thứ hai là Seedance tính giá theo số pixel, vì vậy $0.134 mỗi giây được liệt kê của nó là con số 480P và một cảnh quay 720P tốn nhiều hơn một phép nhân đơn giản gợi ý. Để tham khảo, mức giá beta Wan 3.0 được báo cáo là $0.20 mỗi giây ở 1080p sẽ đặt một cảnh quay 30 giây đầy đủ vào khoảng $6, cao hơn so với đường Seedance ở 480P ngày hôm nay.

Lưu ý về việc sử dụng cái này. Wan 3.0 là bản beta và các điều khoản của nó có thể thay đổi, vì vậy hãy đọc lại chúng trước khi xây dựng một đường ống trên đó. Nếu hình ảnh tham chiếu của bạn là người thật, hãy xin phép họ trước, vì tham chiếu-video chính xác là khả năng làm cho điều đó trở nên quan trọng. Các clip ví dụ trong bài viết này là các kết quả do chính Alibaba tạo ra từ sổ tay hướng dẫn công khai của họ, được sao chép ở đây để bình luận.

Câu Hỏi Thường Gặp

Tham chiếu đa phương thức của Wan 3.0 thực sự có thể nhận bao nhiêu tham chiếu?

Tối đa 20 tài sản trong một lần gọi, được lấy từ hình ảnh, video, âm thanh, tài liệu và trang web. Giới hạn thực tế thấp hơn giới hạn kỹ thuật. Gán cho mỗi tài sản chính xác một công việc, một chủ thể cho mỗi hình ảnh, và bạn sẽ sử dụng ít hơn nhiều so với 20 cho hầu hết các cảnh.

Wan 3.0 thực sự có thể biến một tệp PDF hoặc một trang web thành video không?

Có, đó là phần thực sự độc đáo. Cùng với văn bản, hình ảnh, âm thanh và video, nó chấp nhận các tệp tài liệu và URL trực tiếp, với báo cáo về bản beta liệt kê .doc, .xls, .ppt, .pdf.txt. Không có mô hình tham chiếu-video nào khác trong bảng so sánh trên chấp nhận một tài liệu nào cả.

Wan 3.0 có mã nguồn mở không? Tôi có thể chạy nó trong ComfyUI không?

Không, và không phải ngay bây giờ. Wan 3.0 là bản beta đóng chạy trên đám mây của chính Alibaba. Các thế hệ Wan trước đó đã được phát hành công khai, đó là lý do tại sao kỳ vọng tồn tại, nhưng Alibaba chưa xác nhận trọng số cho 3.0. Các trang web tuyên bố phát hành Wan 3.0 1.3B hoặc 14B Apache 2.0 không được hỗ trợ bởi bất cứ điều gì chính thức.

Wan 3.0 có sẵn thông qua các API bên thứ ba chưa?

Chưa, bao gồm cả Atlas Cloud. Thứ gần nhất bạn có thể gọi ngày hôm nay là Wan 2.7 Tham chiếu-Video, có hình dạng đầu vào khớp với omni-reference gần như chính xác ngoại trừ các phương thức tài liệu và trang web, hoặc Seedance 2.5 Tham chiếu-Video nếu bạn cần đủ 30 giây.

Cách rẻ nhất để thử nghiệm một video hai nhân vật khóa tham chiếu là gì?

Trình tạo kịch bản quảng cáo AI miễn phí được liên kết ở trên. Bốn ảnh tham chiếu đầu vào, một clip hai nhân vật có lời thoại 15 giây đầu ra, không có tham số và không tốn phí. Nếu nó giữ được sản phẩm và định dạng của bạn, thì hãy điều chỉnh chuỗi trả phí.

Tại sao các nhân vật của tôi vẫn trôi dạt ngay cả với hình ảnh tham chiếu?

Ba nguyên nhân, theo thứ tự tần suất. Một tham chiếu đang mang hai công việc, vì vậy nó được yêu cầu sửa cả khuôn mặt và địa điểm. Hình ảnh tham chiếu có nhiều hơn một người hoặc một nền bận rộn, vì vậy mô hình không biết phần nào để khóa. Hoặc sự trôi dạt là một tạo tác render chứ không phải là một lỗi tham chiếu, trong trường hợp đó, hãy đặt biến dạng khuôn mặt, thay đổi màu sắc vào negative prompt trước khi viết lại bất cứ thứ gì.

Mô hình mới nhất

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình