Seedance 2.5 đã chính thức ra mắt — Có mặt đầu tiên trên Atlas Cloud

Wan 3.0 Tính nhất quán đa cảnh: Tôi đã đếm từng cảnh cắt trong 110 clip chính thức

Wan 3.0 Multi-Shot Consistency: Tôi đã đếm tất cả 110 clip

Wan 3.0 Multi-Shot Consistency: Tôi Đếm Từng Cảnh Cắt Trong 110 Clip Chính Thức

Bạn viết kịch bản bốn cảnh quay. Cảnh 1 ra hoàn hảo: mũ rơm, vòng hạt đen, váy linen trắng, ánh sáng chuẩn xác. Cảnh 2 đến và đó là một người phụ nữ khác với một chiếc mũ khác.

Khoảng cách đó là toàn bộ lý do mọi người đang nhìn chằm chằm vào tính nhất quán đa cảnh quay của Wan 3.0, lời hứa về một prompt, sáu cảnh, ba mươi giây, cùng một nhân vật xuyên suốt.

Vì vậy, tôi đã ngừng đọc các bảng thông số kỹ thuật. Tôi tải xuống tất cả 110 file demo mà Alibaba đã công bố kèm theo sổ tay hướng dẫn sáng tạo Wan 3.0 của chính họ, chạy ffmpeg trên từng file, phân tích tất cả 64 cặp prompt, và sau đó làm điều mà không ai trong kết quả tìm kiếm đã làm: tôi đếm số lượng cảnh cắt thực tế trong các video được phân phối và so sánh chúng với số lượng cảnh mà mỗi prompt yêu cầu.

Ba phát hiện mâu thuẫn với những gì bạn sẽ đọc ở mọi nơi khác.

Phòng chỉnh màu điện ảnh với một bức tường màn hình hiển thị cùng nhân vật đội mũ rơm được giữ nhất quán qua sáu cảnh quay khác nhau, điểm tham chiếu cho tính nhất quán đa cảnh quay của Wan 3.0

Bức tường tham chiếu của một chuyên gia chỉnh màu là mô hình tinh thần trung thực cho tính nhất quán đa cảnh quay: một danh tính, sáu khung hình, được kiểm tra cạnh nhau. Được tạo bằng openai/gpt-image-2.

Những điểm chính

  • 6 cảnh là có thật nhưng không được đảm bảo: 3 trong số các prompt đa cảnh quay của chính Alibaba đạt đúng số lượng đã khai báo, 2 prompt thiếu hụt.
  • Trường hợp tệ nhất yêu cầu 4 cảnh nhưng chỉ render được 2.
  • Không có 4K. Không file chính thức nào trong số 110 file vượt quá 1080p, và chỉ có 4 file chính xác là 1920x1080.
  • Đạo cụ và máy quay trôi trước khi khuôn mặt trôi. Hãy nhìn vào mũ, không phải mắt.
  • Chưa có API Wan 3.0 công khai nào bên ngoài nền tảng của riêng Alibaba, vì vậy hướng dẫn bên dưới xây dựng lại nó trên các mô hình bạn có thể gọi ngay hôm nay.

Đây là kết quả tốt nhất, từ sổ tay hướng dẫn của chính Alibaba. Sáu cảnh được khai báo trong prompt, sáu cảnh được phân phối, cùng hai nhân vật, cùng tủ quần áo, cùng cơn mưa:

Đoạn phim hoạt hình sáu cảnh trên sân ga mưa, cùng cô gái với ô trong suốt và chàng trai với ba lô kaki được giữ nhất quán qua mọi cảnh cắt

Bản demo Wan 3.0 beta chính thức của Alibaba (clip sổ tay v013, 1280x720, 20.05s). Prompt đánh số các cảnh từ 1 đến 6; ffmpeg tìm thấy chính xác 5 cảnh cắt cứng, vì vậy tất cả 6 cảnh đều xuất hiện. Không được tạo bởi Atlas Cloud.

Tính nhất quán đa cảnh quay của Wan 3.0 thực sự là gì

Phiên bản ngắn gọn: đó là ba lời hứa riêng biệt mang một cái tên, và Alibaba đặc biệt cụ thể về ba lời hứa đó.

Trong bài viết ra mắt, Alibaba chia tính nhất quán thành nhân vật ("các đặc điểm khuôn mặt, kiểu tóc và màu tóc, hình dáng cơ thể, quần áo và phụ kiện"), đạo cụ ("xuất hiện từ nhiều góc độ, cấu trúc phần cứng, logo và chi tiết vật liệu"), và không gian ("chặn nhân vật và góc máy quay") (Alibaba Cloud, 2026). Sự phân chia ba lớp đó là tiêu chí chấm điểm cho mọi thứ bên dưới. Cùng khuôn mặt, sai vòng cổ, là không đạt.

Mô hình tạo ra tối đa 30 giây trong một lần thực hiện, ở độ phân giải 480P, 720P hoặc 1080P (Alibaba Cloud, 2026).

Bây giờ là phần mà kết quả tìm kiếm hiểu sai.

Tuyên bố phổ biến trong kết quả tìm kiếmNhững gì tài liệu chính thức thực sự cho thấy
"Tạo 4K gốc"Bài viết chính thức chỉ liệt kê 480P / 720P / 1080P. Trong số 110 file demo chính thức, không có file nào vượt quá 1080p, và chỉ có 4 file chính xác là 1920x1080. Đầu ra "1080p" phong cảnh thông thường là 1920x1072.
"Lên đến 6 cảnh quay độc lập mỗi lần tạo"Không có thông số về số lượng cảnh quay xuất hiện trong bài viết ra mắt của chính Alibaba. Theo kinh nghiệm, nó đúng: trong số 8 prompt đa cảnh quay rõ ràng trong sổ tay, cao nhất là 6, và hai trong số đó đã phân phối được 6.
"Lên đến 12 ảnh tham chiếu"Thử nghiệm thực tế báo cáo lên đến 10 ảnh cộng 5 clip video cộng 5 clip âm thanh (Curious Refuge, 2026). Bài viết của Alibaba không đưa ra con số nào cả.
"Trọng lượng mở, Apache-2.0"Các bản phát hành Wan trước đó có trọng lượng mở; Wan 3.0 được cung cấp dưới dạng dịch vụ nền tảng và chưa có trọng lượng nào xuất hiện (Curious Refuge, 2026).
"API đã ra mắt"Nó chạy trên Alibaba Cloud Model Studio. Các nền tảng suy luận của bên thứ ba chưa có nó.

Và đây là bảng mất nhiều thời gian nhất để xây dựng. Mọi con số đều là của tôi, từ phát hiện cảnh bằng ffmpeg trên file được phân phối so với số lượng cảnh được viết trong prompt ghép đôi:

Bản demo chính thứcPrompt khai báoSố cảnh cắt cứng tìm thấySố cảnh phân phốiPhán quyết
v013 sân ga mưa, hoạt hình6 cảnh56Chính xác
v055 nhật ký chó golden retriever6 cảnh, 30.0s56Chính xác
v021 quán mì và mèo con4 cảnh34Chính xác
v008 hồ rừng, 3D4 cảnh23Thiếu một
v085 phụ nữ đội mũ rơm4 cảnh12Một nửa
v041 hành lang đến ngõ huyền diệu3 đoạn, "không cắt cứng"01 cảnh quay liên tụcĐúng như yêu cầu
v045, v084, v1023/5/đa chủ thểQuá nhiều để phân giảiKhông đếm đượcCắt nhanh và nhấp nháy mực tàu đánh bại phát hiện

Đọc các hàng ở giữa một lần nữa. Ba prompt đạt đúng số lượng. Hai prompt thì không. Số lượng cảnh bạn nhập là một yêu cầu, không phải một hợp đồng.

Tại sao tính nhất quán đa cảnh quay của Wan 3.0 bị phá vỡ: 4 Chế độ thất bại

Phán quyết trước: nó hiếm khi bị phá vỡ trên khuôn mặt. Nó bị phá vỡ trên các vật thể và máy quay, và nó bị phá vỡ nặng nhất khi bạn thay đổi nhiều thứ cùng một lúc.

Đây là clip dạy tôi nhiều nhất, bởi vì nó là màn trình diễn tệ nhất trong chính bộ sưu tập của Alibaba.

GtZy2TUK4ak

Bản demo Wan 3.0 beta chính thức của Alibaba (clip sổ tay v085, 1240x742, 30.08s). Prompt viết kịch bản bốn cảnh có mã thời gian. ffmpeg tìm thấy một cảnh cắt thực sự, ở 9.3s. Cảnh 3 và 4 sụp đổ thành một cảnh quay duy nhất được giữ lại và mờ dần thành đen. Không được tạo bởi Atlas Cloud.

Chế độ thất bại 1: đạo cụ trôi trước khi khuôn mặt trôi. Trong clip đó, hãy nhìn vào cảnh quay mở đầu một mình, trước khi bất kỳ cảnh cắt nào xảy ra. Ở 0.6s, mũ boater có dải băng đen mỏng và mặt dây chuyền là đá màu xanh nước biển có nhiều mặt. Ở 9.2s, dải băng là một dải ruy băng đen rộng và mặt dây chuyền là một giọt đen bóng mịn. Khuôn mặt cô ấy ổn định trong suốt thời gian đó. Các phụ kiện thì không.

Hai khung hình từ cùng một cảnh quay chín giây liên tục, cạnh nhau, cho thấy dải băng mũ rộng ra và mặt dây chuyền thay đổi hình dạng và màu sắc

Cả hai khung hình đều đến từ cùng một cảnh quay không bị gián đoạn của bản demo v085 chính thức, cách nhau 8.6 giây, không có cảnh cắt giữa chúng. Dải băng mũ và mặt dây chuyền đều thay đổi. Đây là lớp đạo cụ thất bại trong khi lớp nhân vật vẫn giữ vững.

Đó là lý do tại sao bài kiểm tra chấp nhận thực sự hoạt động là một danh sách kiểm tra đạo cụ, không phải là một bài kiểm tra cảm xúc. Đối với nhân vật này, đó là ba món: hình dạng mũ và dải băng, vòng hạt và mặt dây chuyền, đường viền cổ váy.

Chế độ thất bại 2: các cảnh đa chủ thể giữ riêng lẻ và nhòe khi tiếp xúc. Mỗi nhân vật vẫn có thể nhận ra một mình. Đặt chúng vào khung hình cùng nhau, tương tác, và danh tính bị nhòe. Thử nghiệm độc lập cũng tìm thấy điều tương tự: "Tính nhất quán của nhân vật bắt đầu bị phá vỡ, và việc kết hợp đôi khi trông giống hiệu ứng màn hình xanh kém hơn là một môi trường được tạo tự nhiên," với đồng bộ môi được chỉ ra là điểm yếu lớn nhất (Curious Refuge, 2026).

Chế độ thất bại 3: bạn đã thay đổi bốn biến trong một dòng. Địa điểm mới cộng với góc máy quay mới cộng với ánh sáng mới cộng với trạng thái tủ quần áo mới là cách đáng tin cậy để mất danh tính. Các prompt của chính sổ tay hướng dẫn chống lại điều này bằng cách khai báo lại toàn bộ trang phục trong mọi đoạn. Trong số 64 cặp prompt, 9 cái nói rõ "giữ nguyên không đổi", 5 cái cố định vị trí máy quay, và 4 cái yêu cầu nhân vật giống hệt nhau.

Chế độ thất bại 4: 30 giây trong một lần thực hiện không phải là 30 giây của một cảnh quay. Đây là những sản phẩm khác nhau. Một công việc nhiều cảnh quay 30 giây sẽ cắt giữa các khung hình. Nếu những gì bạn muốn là một cảnh quay liên tục không bị gián đoạn, việc nối tiếp các phần tiếp theo sẽ làm giảm chất lượng: lỗi danh tính tích tụ ở mỗi lần chuyển giao, vì vậy cảnh quay đơn sạch sẽ ngắn theo bản chất.

Sổ tay hướng dẫn có chính xác một prompt làm đúng sự liền mạch, và nó đáng để sao chép cấu trúc câu:

Ba đoạn prompt được render thành một cảnh quay liên tục không bị gián đoạn, từ hành lang căn hộ qua một cánh cửa vào một con hẻm gothic đèn đóm

Bản demo Wan 3.0 beta chính thức của Alibaba (clip sổ tay v041, 720x1280, 15.04s). Ba đoạn prompt, và ffmpeg tìm thấy không có cảnh cắt cứng nào, chính xác như prompt yêu cầu. Không được tạo bởi Atlas Cloud.

Dòng chuyển giao của nó, được dịch, là thứ có thể tái sử dụng nhất trong toàn bộ sổ tay: tiếp tục liền mạch từ khung hình cuối cùng của đoạn trước; nhân vật, tủ quần áo, địa điểm và vị trí máy quay vẫn hoàn toàn giống hệt nhau; không có cảnh cắt cứng và không có chuyển tiếp cảnh đột ngột. Chỉ có một prompt trong 64 sử dụng nó. Hãy đánh cắp nó.

Quy trình làm việc đa cảnh quay nhất quán bạn có thể chạy ngay hôm nay

Câu hỏi là: bạn thực sự chạy cái này ở đâu?

Hiện tại Wan 3.0 sống trên Model Studio của riêng Alibaba. Không có nền tảng suy luận bên thứ ba nào lưu trữ nó. Trên Atlas Cloud, nó chỉ xuất hiện dưới dạng mục sắp ra mắt với không có điểm cuối trực tiếp nào, đó là tình trạng thực tế trung thực và đáng nói một cách thẳng thắn thay vì giả vờ khác đi.

Vì vậy, bạn có hai lựa chọn: chờ đợi, hoặc ngừng yêu cầu một prompt làm sáu việc.

Lựa chọn thứ hai dù sao cũng tốt hơn, và việc đếm số cảnh cắt của tôi là lập luận cho nó. Một công việc đa cảnh quay duy nhất đã cho bạn số lượng cảnh quay thiếu một nửa trong chính bộ sưu tập của Alibaba. Chia nhỏ công việc sẽ đặt lại quyền kiểm soát đó vào tay bạn:

  1. Khóa diện mạo một lần, dưới dạng một hình ảnh tĩnh.
  2. Nhân bản danh tính đó thành một keyframe cho mỗi cảnh, chỉ thay đổi một biến mỗi lần.
  3. Tạo hoạt ảnh cho từng cảnh riêng biệt với tham chiếu được khóa.
  4. Ghép nối cục bộ.

Chậm hơn để thiết lập, nhưng có thể dự đoán đáng kể hơn. Và mọi mô hình trong chuỗi đều có thể gọi được ngay hôm nay.

BướcMô hìnhVai trò trong chuỗiGiá niêm yết
1bytedance/seedream-v5.0-pro/text-to-imageKhóa diện mạo nhân vật$0.045 / ảnh
2google/nano-banana-2/editNhân bản danh tính vào keyframe của mỗi cảnh$0.08 / ảnh
3alibaba/wan-2.7/reference-to-videoTạo hoạt ảnh cho từng cảnh với tham chiếu được khóa$0.10 / giây
Thay thếalibaba/wan-2.7/text-to-videoMột prompt, nhiều cảnh (ít kiểm soát nhất)$0.10 / giây
Sửa chữaalibaba/wan-2.7/video-editSửa một đạo cụ sai mà không cần render lại$0.10 / giây

Đáng biết cho câu hỏi "mô hình tốt nhất cho tính nhất quán đa cảnh quay": tham chiếu-video là cả một danh mục bây giờ. bytedance/seedance-2.0-fast/reference-to-video chạy $0.072/s (giảm 20% so với $0.09, kể từ tháng 8 năm 2026), kwaivgi/kling-video-o3-pro/reference-to-video $0.095/s (giảm 15% so với $0.112), minimax/h3/reference-to-video $0.10/s, và google/veo3.1/reference-to-video $0.20/s. Tất cả giá đã được xác minh với danh mục trực tiếp vào ngày 21 tháng 8 năm 2026.

Một cảnh báo trước các bước: giá niêm yết là mức sàn, không phải báo giá. Độ phân giải và thời lượng làm thay đổi con số thực, vì vậy hãy đọc nút Run trước khi bạn cam kết.

Cách xây dựng tính nhất quán đa cảnh quay kiểu Wan 3.0, từng bước

Chúng tôi đang xây dựng lại chính xác bảng điểm mà mô hình của chính Alibaba đã làm hỏng: người phụ nữ đội mũ rơm, bốn cảnh quay, từ vườn đến xe hơi. Cùng kịch bản, kiểm soát từng cảnh, và lần này bạn có được bốn cảnh vì bạn đã render bốn cảnh.

Hãy bắt đầu.

Bước 1: khóa diện mạo. Một hình ảnh trở thành điểm neo danh tính cho mọi thứ ở phía sau. Tạo nó trên Seedream v5.0 Pro, 16:9, độ phân giải cao nhất mà trang cung cấp. Đặt tên rõ ràng cho ba đạo cụ kiểm tra, bởi vì đó là những thứ sẽ trôi.

plaintext
135mm film still, vintage sunlit rose garden. An elegant young woman wearing a
2natural straw boater hat with a black band, a black beaded necklace with a single
3teardrop pendant, and a white sleeveless linen dress. She stands before a wall of
4blooming pink and cream roses, one hand lightly touching the brim of her hat,
5gentle and thoughtful gaze just off camera. Soft warm natural light, dappled sun
6flare, shallow depth of field, fine film grain, medium close-up.

Giao diện Seedream v5.0 Pro trên Atlas Cloud với prompt mũ rơm đã nhập và keyframe nhân vật hoàn thành được render trong bảng đầu ra

Bước 1 hoàn thành: điểm neo danh tính cho toàn bộ chuỗi bốn cảnh quay.

Bước 2: nhân bản danh tính vào các cảnh 2 đến 4. Một keyframe cho mỗi cảnh, một lần chạy mỗi cái, sử dụng Nano Banana 2 Edit với đầu ra Bước 1 làm tham chiếu. Kỷ luật quan trọng: khai báo lại toàn bộ tủ quần áo mỗi lần, sau đó chỉ thay đổi một thứ.

Cảnh 2, bước ngoặt cảm xúc:

plaintext
1Keep the exact same woman from the reference image: identical face, identical
2natural straw boater hat with black band, identical black beaded necklace with a
3teardrop pendant, identical white sleeveless linen dress. New shot: cinematic
4close-up, she slowly lifts the straw hat off her head and lowers her chin, a faint
5wistful expression. Same rose garden background. Strictly preserve the same
6lighting, skin tone, film grain and colour grade as the reference.

Cảnh 3, cắt sang xe hơi:

plaintext
1Keep the exact same woman from the reference image: identical face, identical black
2beaded necklace with a teardrop pendant, identical white sleeveless linen dress,
3the straw boater hat now resting on her lap. New shot: back seat of a moving car,
4side profile, her hand propped against the door, gazing out a rain-beaded window,
5blurred green foliage rushing past. Overcast light with a warm interior fill,
6shallow depth of field, elegant melancholy. Strictly preserve the same face, the
7same colour grade and the same 35mm film grain as the reference.

Cảnh 4, cái nhìn cuối cùng:

plaintext
1Keep the exact same woman from the reference image: identical face, identical black
2beaded necklace with a teardrop pendant. New shot: extreme facial close-up beside
3the car window, eyes slowly closing, a calm and released expression. Raindrops
4slide down the glass in front of her, focus shifting onto the droplets, background
5falling into bokeh. Wong Kar-wai style cinematic mood, fine film grain. Strictly
6preserve the same face, the same lighting and the same colour grade as the
7reference.

Giao diện Nano Banana 2 Edit trên Atlas Cloud với keyframe Bước 1 được tải làm tham chiếu và keyframe cảnh 2 được render, danh tính và tủ quần áo được giữ nguyên

Bước 2 hoàn thành: keyframe của cảnh 2, cùng người phụ nữ, mũ bây giờ trong tay cô ấy.

Bước 3: tạo hoạt ảnh cho cảnh 1 với tham chiếu được khóa. Bây giờ mỗi cảnh trở thành video độc lập trên Wan 2.7 reference-to-video. Cài đặt: 720P, 5 giây, và thả keyframe Bước 1 vào ô Images. Kiểm tra báo giá của nút Run trước khi bạn kích hoạt.

plaintext
1Shot 1 of 4. Reference image 1 defines the character: keep the same face, the same
2natural straw boater hat with black band, the same black beaded necklace with a
3teardrop pendant and the same white sleeveless linen dress identical for the entire
4clip. 35mm film look, vintage sunlit rose garden. The woman lightly touches the
5brim of her hat as a soft breeze lifts strands of her hair; the camera pushes in
6very slowly. Warm natural light, dappled sun flare, shallow depth of field, fine
7film grain. The camera position stays stable. No hard cut and no scene change.

Giao diện Wan 2.7 reference-to-video trên Atlas Cloud với keyframe trong ô Images và clip năm giây hoàn thành đang phát trong bảng đầu ra

Bước 3 hoàn thành: clip được khóa tham chiếu được render trong bảng đầu ra.

Và đây là kết quả:

Clip năm giây được khóa tham chiếu của người phụ nữ đội mũ rơm trong vườn hoa hồng, dải băng mũ và vòng cổ giữ ổn định trong suốt

Lần chạy của chúng tôi trên Atlas Cloud, không phải bản demo của Alibaba. Được hiển thị dưới dạng GIF im lặng; file được phân phối có kèm theo track âm thanh.

Bước 4: nối tiếp các cảnh 2 đến 4, sau đó ghép nối. Lặp lại Bước 3 cho mỗi keyframe còn lại, và dán câu chuyển giao từ sổ tay hướng dẫn ở đầu mỗi prompt tiếp theo:

plaintext
1Continue seamlessly from the last frame of the previous segment. The character,
2the wardrobe, the location and the camera position stay completely identical.
3No hard cut and no abrupt scene transition.

Sau đó nối cục bộ bằng ffmpeg và chạy kiểm tra chấp nhận ba điểm: hình dạng mũ và dải băng, vòng hạt và mặt dây chuyền, và liệu sự tiến triển khung hình giữa các cảnh có thực sự có ý nghĩa hay không. Nếu chính xác một đạo cụ sai trong một cảnh, đừng render lại cảnh đó. Gửi nó qua wan-2.7/video-edit và chỉ thay đổi điều đó, mượn cách diễn đạt của sổ tay hướng dẫn: giữ nguyên các hành động, tủ quần áo và phần còn lại của khung hình.

Các biến thể: Cảnh đa chủ thể và khóa phong cách

Ba mẫu từ sổ tay hướng dẫn đáng để đánh cắp.

Thẻ nhân vật cho các cảnh đa chủ thể. Khi hai hoặc nhiều người chia sẻ khung hình, các prompt chính thức gán các thẻ nhân vật bằng chữ cái và khai báo lại toàn bộ trang phục của mỗi người trong mọi đoạn. Dài dòng, xấu, nhưng nó hoạt động tốt hơn đại từ.

Khai báo phong cách toàn cục cho tác phẩm cách điệu. Mực tàu, hoạt hình cel và các phong cách nặng khác cần được ghim phong cách một lần cho toàn bộ tác phẩm, sau đó là một bảng điểm có mã thời gian bên dưới nó.

Đoạn phim võ thuật mực tàu với kiếm sĩ trong rừng tre, phong cách được khóa trên một trận đấu năm nhịp có mã thời gian

Bản demo Wan 3.0 beta chính thức của Alibaba (clip sổ tay v084, 20.05s, đã cắt). Năm nhịp có mã thời gian dưới một khai báo phong cách mực tàu toàn cục. Các nét vẽ nhấp nháy là lý do tại sao phát hiện cảnh tự động không thể đếm được cái này. Không được tạo bởi Atlas Cloud.

Sửa chữa, đừng render lại. Một lần video-edit trên một đạo cụ sai rẻ hơn một lần render mới và không thể phá vỡ các cảnh đã đúng.

Chi phí cho một chuỗi bốn cảnh quay

Các con số cụ thể cho chuỗi được xây dựng ở trên, theo tỷ lệ niêm yết:

  • 1 điểm neo danh tính trên Seedream v5.0 Pro: $0.045
  • 3 keyframe cảnh quay trên Nano Banana 2 Edit: 3 x $0.08 = $0.24
  • 4 clip ở 5s, 720P, trên Wan 2.7 reference-to-video: 20s x $0.10 = $2.00
  • Tổng cộng: khoảng $2.29 cho một chuỗi 20 giây, bốn cảnh, danh tính được khóa

Kéo dài nó lên sáu cảnh 30 giây và dòng video trở thành $3.00, đạt khoảng $3.44 tất cả.

Hai lưu ý trung thực. Thứ nhất, giá niêm yết là mức sàn: các bậc độ phân giải và thời lượng thay đổi phí thực tế, và báo giá Run của chính giao diện là con số duy nhất ràng buộc, đó là lý do tại sao các ảnh chụp màn hình ở trên quan trọng hơn danh sách này. Thứ hai, trên chính Wan 3.0, Alibaba định giá tạo video Model Studio theo giây theo bậc độ phân giải, nhưng tôi không thể xác nhận tỷ lệ mỗi giây chính xác của Wan 3.0 từ một trang chính thức, vì vậy tôi không trích dẫn các con số mà tôi không thể xác minh.

Đáng chú ý là bạn đang mua gì với cách tiếp cận chia nhỏ công việc: không phải giá thấp hơn, mà là số lượng cảnh quay phù hợp với kịch bản của bạn. Dựa trên bằng chứng từ chính bộ sưu tập của Alibaba, đó không phải là điều mà một công việc 30 giây duy nhất có thể hứa hẹn với bạn, và nó là câu trả lời thực tế cho tính nhất quán đa cảnh quay của Wan 3.0 cho đến khi API mở ra.

Các câu hỏi thường gặp

Wan 3.0 có thể giữ nhất quán bao nhiêu cảnh quay trong một lần tạo?

Sáu, dựa trên bằng chứng hiện tại, có một lưu ý. Bài viết ra mắt của Alibaba không công bố thông số về số lượng cảnh quay. Trong số 8 prompt đa cảnh quay rõ ràng trong sổ tay chính thức của nó, cao nhất là 6, và hai trong số đó đã phân phối chính xác 6 cảnh đã được xác minh bằng cắt. Hãy coi 6 là mức trần quan sát được, không phải là sự đảm bảo.

Wan 3.0 có thực sự tạo 4K gốc không?

Không. Bài viết chính thức chỉ liệt kê 480P, 720P và 1080P. Trong số tất cả 110 file demo chính thức, không có file nào vượt quá 1080p, chỉ có 4 file chính xác là 1920x1080, và đầu ra phong cảnh phổ biến là 1920x1072. Tốc độ khung hình chia làm 24fps cho 63 file và 30fps cho 46 file.

API Wan 3.0 có sẵn không, và tôi có thể chạy nó ở đâu?

Nó chạy trên Alibaba Cloud Model Studio. Chưa có nền tảng suy luận bên thứ ba nào lưu trữ nó; Atlas Cloud liệt kê nó dưới dạng mục sắp ra mắt với không có điểm cuối trực tiếp. Nếu bạn cần đầu ra đa cảnh quay trong tuần này, chuỗi Wan 2.7 reference-to-video ở trên là giải pháp thay thế khả thi.

Tại sao nhân vật của tôi vẫn thay đổi giữa các cảnh quay ngay cả khi có ảnh tham chiếu?

Thông thường vì một prompt đã thay đổi địa điểm, góc máy quay và ánh sáng đồng thời. Chỉ thay đổi một biến mỗi cảnh, và khai báo lại toàn bộ tủ quần áo trong mọi prompt. Cũng hãy kiểm tra những thứ đúng: trong bản demo của chính Alibaba, khuôn mặt giữ ổn định trong khi dải băng mũ và mặt dây chuyền cả hai đều thay đổi trong cùng một cảnh quay không bị gián đoạn.

Trọng lượng Wan 3.0 có mã nguồn mở không?

Chưa có trọng lượng nào được phát hành. Các phiên bản Wan trước đây có thể tải xuống và chạy cục bộ, trong khi Wan 3.0 được cung cấp dưới dạng dịch vụ nền tảng lưu trữ. Bất kỳ ai trích dẫn giấy phép Apache-2.0 cho Wan 3.0 đang lặp lại điều gì đó không có nguồn chính thức đằng sau nó.

Cách nhanh nhất để có được tính nhất quán đa cảnh quay mà không có quyền truy cập Wan 3.0 là gì?

Bốn bước: khóa một hình ảnh danh tính, nhân bản nó thành một keyframe cho mỗi cảnh chỉ thay đổi một biến mỗi lần, tạo hoạt ảnh cho từng cảnh với reference-to-video, sau đó ghép nối cục bộ và kiểm tra đạo cụ của bạn. Khoảng $2.29 và khoảng nửa giờ cho một chuỗi bốn cảnh quay.


Phương pháp luận: tất cả 110 file demo và 64 cặp prompt đến từ sổ tay hướng dẫn sáng tạo Wan 3.0 chính thức của Alibaba, được lưu trữ cục bộ vào ngày 11 tháng 8 năm 2026. Siêu dữ liệu được đọc từng file bằng ffmpeg; số lượng cảnh đến từ phát hiện thay đổi cảnh của ffmpeg ở ngưỡng 0.2, được kiểm tra chéo với các khung hình được trích xuất; cấu trúc prompt được phân tích theo chương trình. Giá của Atlas Cloud được xác minh với danh mục mô hình trực tiếp vào ngày 21 tháng 8 năm 2026.

Nguồn: Alibaba Cloud (tháng 8 năm 2026); Curious Refuge (2026).

Mô hình mới nhất

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình