Seedance 2.0 Mini & Fast API với mức giá thấp nhất toàn cầu — giảm đến 68% so với giá chính thức

Seedance 2.5 vs MiniMax H3: Mọi người đã thử nghiệm 30-Second Flex. Không ai thử nghiệm Shot 4.

Seedance 2.5 vs MiniMax H3, cùng bảng nhân vật, cùng prompt. Thông số thực tế, quy trình làm phim ngắn 5 bước có thể sao chép-dán, và cái nào giữ được khuôn mặt xuyên suốt bốn cảnh quay.

MiniMax đã phát hành H3 vào thứ Sáu. Trong vòng 24 giờ, Seedance 2.5 đã vào tay người dùng, và mốc thời gian thu gọn thành một cuộc trò chuyện: ba mươi giây, 4K gốc, năm mươi đầu vào tham chiếu. Bài đăng ra mắt H3 nằm bên dưới, lặng lẽ, hầu như không ai chạy thử nghiệm thực tế trên nó.

Tôi hiểu tại sao. Ba mươi giây là một con số tuyệt vời. Nó vừa vặn trong một tiêu đề.

Nhưng nếu bạn thực sự làm phim ngắn dọc, bạn biết thứ hủy hoại đêm của bạn không phải giây thứ ba mươi. Đó là cảnh quay 4. Đường viền hàm của nam chính lệch nửa centimet, chiếc cà vạt của anh ta mất một nếp gấp, và người xem vuốt đi trước khi câu hook kịp đổ bộ. Không ai rời bỏ vì một clip dài mười lăm giây thay vì ba mươi. Họ rời bỏ vì anh chàng trong cận cảnh không phải là anh chàng trong toàn cảnh.

Vì vậy, tôi đã bỏ qua cuộc đấu thông số kỹ thuật. Tôi xây dựng một bảng xoay nhân vật, một bảng địa điểm sáu ô, viết một prompt phim ngắn Gothic 15 giây, và gửi gói giống hệt cho cả hai bên. Sau đó, tôi nhìn chằm chằm vào khuôn mặt.

Kết luận chính

  • Chỉ H3 có thể gọi được hôm nay — API của Seedance 2.5 đã ra mắt tại ByteDance, nhưng vẫn là trang Ngày-0 trên nền tảng này.
  • Thông số kỹ thuật tách biệt rõ ràng: Seedance 2.5 = 30 giây trong một lần, 4K gốc, lên tới 50 tham chiếu; H3 = 5–15 giây, 2K, âm thanh nổi trên mọi clip.
  • Độ ổn định nhân vật là một vấn đề đóng gói — một gói tham chiếu tốt, không phải mô hình lớn hơn, giữ được khuôn mặt.
  • Cả hai đều tạo âm thanh gốc; H3 còn ghim giọng nói từ tối đa ba tham chiếu âm thanh.
  • Đánh giá pixel trên mỗi khung hình, không phải giây — trên cùng một lần chạy, H3 trả về 1440p so với 720p của Seedance.

Kết quả Seedance 2.5 vs MiniMax H3, Trước Bất Kỳ Lý Thuyết Nào

Trước bất kỳ lý thuyết nào, đây là những gì quy trình tạo ra. Đây là bốn cảnh quay được lấy từ một clip dọc 15 giây hoàn chỉnh và ghép lại. Đây là lần chạy tham chiếu H3 của chính MiniMax được xây dựng từ chính xác bảng nhân vật và bảng địa điểm bạn sẽ thấy ở Bước 1 và Bước 2, ở độ phân giải gốc 1440x2560. Các lần chạy của riêng tôi với cùng gói sẽ xuất hiện sau đó, trong hướng dẫn, với trạng thái playground hiển thị.

 

 

Cô ấy đến cánh cửa chạm khắc, đó là ô 4 của bảng địa điểm, sau đó là cảnh đối đầu trong hành lang, rồi cận cảnh chặt vào anh ta, sau đó là cảnh hai người. Đường chân tóc của anh ta chia đều nhau trong cảnh nghiêng và cảnh cận. Vương miện tết nửa đầu của cô ấy sống sót qua một cận cảnh toàn khuôn mặt, chính xác là nơi hầu hết các mô hình âm thầm xây dựng lại khuôn mặt. Chiếc áo bodice ren kem giữ nguyên đường viền cổ và cổ tay áo từ khung hình đầu tiên đến khung hình cuối cùng.

Đó là toàn bộ bài kiểm tra. Không phải ba mươi giây. Bốn cảnh quay và một đường viền hàm.

Tại sao Seedance 2.5 vs MiniMax H3 Ra Mắt Cùng Một Tuần, và Tại Sao Hầu Hết Các Bài Kiểm Tra Nhân Vật Đều Vô Dụng

MiniMax phát hành H3 vào ngày 30 tháng 7, một mô hình video đa phương thức đa năng đọc văn bản, hình ảnh, video và âm thanh như một ngữ cảnh duy nhất và trả về các clip từ 5 đến 15 giây ở độ phân giải lên tới 2K với âm thanh nổi gốc. Nó cũng có thể chỉnh sửa cảnh quay hiện có và chuyển chuyển động từ clip này sang clip khác, và MiniMax cho biết trọng số sẽ được công bố trong vòng vài ngày (Reuters, tháng 7 năm 2026).

Seedance 2.5 ra mắt trong cùng khung thời gian với một con số lớn hơn: 30 giây trong một lần tạo, 4K gốc và lên tới 50 đầu vào tham chiếu đa phương thức trong một lần (The Next Web, tháng 7 năm 2026). API của nó đã có trong tay các nhà phát triển, với chỉnh sửa cục bộ vẽ lại một phần của khung hình trong khi giữ nguyên hiệu suất, ánh sáng và hành vi camera, tham chiếu đến video chấp nhận màn hình xanh hoặc bản phác thảo mô hình trắng 3D, mười một ngôn ngữ và chế độ video dài thử nghiệm đạt 180 giây (CineD, tháng 7 năm 2026).

 

 

Khoảng cách chú ý là phần thú vị. Hầu như mọi bài đăng tôi có thể tìm thấy đều là clip 2.5. Trong khi đó, các con số trên bảng xếp hạng công cộng lại nói điều khác: trên bảng xếp hạng hình ảnh sang video của Artificial Analysis, Seedance 2.0 ở 720p dẫn đầu với 1.196 Elo, Gemini Omni Flash theo sau ở 1.195, và MiniMax H3 đã đứng thứ ba ở 1.185, chỉ sau bốn ngày ra mắt. Seedance 2.5 chưa có xếp hạng nào ở đó (Artificial Analysis, tháng 7 năm 2026). Mô hình có ít tiếng ồn nhất là mô hình có tỷ lệ điểm số trên sự chú ý cao nhất.

Bây giờ là phần thực sự quyết định đầu ra của bạn, bởi vì nó hầu như không liên quan đến việc bạn chọn logo nào.

Hầu hết các bài kiểm tra tính nhất quán của nhân vật đều thất bại trước khi mô hình được tham gia. Bốn chế độ thất bại, và cả bốn đều do bạn khắc phục:

Chế độ thất bạiNhững gì bạn thấy trong đầu raCách khắc phục
Gửi tham chiếu đa góc nhìn dưới dạng các tệp riêng biệtKhuôn mặt của mỗi cảnh quay "gần đúng" và không có hai cái nào giống nhauGhép các góc nhìn thành một hình ảnh, sau đó gán vai trò trong prompt ("người đàn ông BÊN TRÁI", "người phụ nữ BÊN PHẢI")
Viết lại mô tả nhân vật cho mỗi cảnh quayTrang phục và phụ kiện trôi dạt từ cảnh này sang cảnh khácViết khối nhận dạng một lần và sử dụng lại nguyên văn; chỉ thay đổi camera và hành động cho mỗi cảnh
Để ánh sáng di chuyển theo cảnhKhuôn mặt bị xây dựng lại cấu trúc trong ánh sáng mớiXây dựng một bảng địa điểm riêng khóa hướng ánh sáng, sương mù và phản chiếu sàn, và cung cấp nó làm tham chiếu
Coi thời lượng tối đa là một thước đo chất lượngMột lần trôi dạt trong 30 giây giết chết tất cả 30Cắt đến độ chi tiết mà bạn có thể chạy lại, sau đó nói về độ dài

Bạn muốn tự mình đặt Seedance 2.5 và MiniMax H3 trước cùng một prompt? So sánh mô hình của Atlas Cloud chạy chúng cạnh nhau trong một lần — prompt và cài đặt giống hệt, với chi phí được ước tính trước khi bạn tạo — để bạn có thể đánh giá khuôn mặt, chuyển động và văn bản trên màn hình mà không cần đặt hai bài kiểm tra riêng biệt.

So sánh mô hình Atlas Cloud chạy Seedance 2.5 và MiniMax H3 trên cùng một prompt, với giá và độ phân giải của mỗi lần chạy hiển thị cạnh nhau

Seedance 2.5 và MiniMax H3 trên cùng một prompt trong phần so sánh mô hình của Atlas Cloud. Seedance 2.5 trả về 720p với giá $2,42; MiniMax H3 trả về 1440p với giá $1,12, và cả hai giá đều được ước tính trước khi chạy. Chụp trực tiếp trên model-explorer.

Hàng đầu tiên là hàng mà mọi người thường hiểu sai nhất. Gửi sáu hình ảnh một góc nhìn và mô hình coi chúng là sáu ứng viên và lấy trung bình chúng. Gửi một hình ảnh ghép sạch và nó coi chúng là một người được nhìn từ ba phía. Cùng pixel, kết quả hoàn toàn khác.

 

 

Bảng Thông Số Kỹ Thuật Seedance 2.5 vs MiniMax H3, và Những Gì Bạn Thực Sự Có Thể Gọi Hôm Nay

Tách biệt khả năng khỏi tính khả dụng và sự căng thẳng trở nên rõ ràng. Về khả năng thô, Seedance 2.5 dẫn đầu về thời lượng, trần độ phân giải, số lượng tham chiếu và độ chi tiết chỉnh sửa. Về tính khả dụng, H3 là mô hình có ba điểm cuối trực tiếp trên một nền tảng mô hình đa năng trong tuần này. Nếu bạn đang so sánh mô hình video AI để lập kế hoạch năm 2026, cột thứ hai đó quan trọng không kém cột đầu tiên.

 MiniMax H3Seedance 2.5Seedance 2.0 Ref-to-Video (những gì tôi đã chạy)
Thời lượng tối đa, một lần tạo5 đến 15 slên tới 30 s, không ghép nối (chế độ beta lên 180 s, thử nghiệm)menu clip ngắn, xem trang mô hình
Độ phân giảigốc 2K, cạnh ngắn 1440p ở 16:9 đến 9:16; một bậc 768p được liệt kê là sắp ra mắtgốc 4K, màu 10-bitlên tới 720p trên điểm cuối này
Tốc độ khung hình24 fpskhông được công bố riêngkhông được công bố riêng
Đầu vào tham chiếu9 hình ảnh + 3 video + 3 âm thanh, tổng cộng 12 tệplên tới 50 tham chiếu đa phương thức9 hình ảnh + 3 video + 3 âm thanh
Âm thanh gốccó, mọi đầu ra, âm thanh nổicó, cộng thêm 11 ngôn ngữ phụ đề và giọng nói
Độ chi tiết chỉnh sửachỉnh sửa toàn bộ clip theo hướng dẫn (đổi nhân vật, nền, ánh sáng, hội thoại)chỉnh sửa cấp vùng vẽ lại một phần khung hìnhchỉnh sửa toàn bộ clip theo hướng dẫn
Giới hạn prompt7.000 ký tựkhông được công bốkhông được công bố
Trọng số mởđã công bố trong vài ngày sau khi ra mắtchưa được công bốchưa được công bố
Elo I2V của Artificial Analysis, 31 tháng 7 năm 20261.185 (thứ 3)chưa được xếp hạng1.196 (thứ 1, mục Dreamina 720p)
Có thể gọi trên nền tảng tôi đã thử nghiệmcó, 3 điểm cuốichưa, trang Ngày-0

Công bố đầy đủ về thiết lập thử nghiệm. Seedance 2.5 chưa mở trên nền tảng của tôi khi tôi chạy thử nghiệm này, vì vậy phía Seedance là Seedance 2.0 Reference-to-Video, thành viên hiện đang được phát hành trong cùng một họ với cùng hệ thống tham chiếu bốn phương thức. Nơi 2.5 sẽ thay đổi câu trả lời, tôi sẽ nói rõ. Trang Seedance 2.5 hiện là thông báo Ngày-0.

Mọi thứ bên dưới chạy trong một tab trình duyệt, trên một khóa, tổng cộng ba mô hình:

BướcMô hìnhNhững gì nó tạo raCài đặt chínhNhững gì quyết định chi phí
1OpenAI GPT Image 2 Text-to-Imagebảng xoay nhân vậtchất lượng cao, 16:9mỗi hình ảnh, trả tiền khi sử dụng, tỷ giá hiện tại trên trang mô hình
2cùng mô hình, lần chạy thứ haibảng địa điểm và ánh sáng sáu ôchất lượng cao, 16:9mỗi hình ảnh, trả tiền khi sử dụng
3MiniMax H3 Reference-to-Videoclip 9:16 với âm thanh gốc9:16, 2K, thời lượng 5 để thử nghiệm và 15 cho bản thậtgiây x độ phân giải, tính phí mỗi giây
4Seedance 2.0 Reference-to-Videolần chạy đối chứng, đầu vào giống hệt9:16, độ phân giải cao nhất có sẵn, cùng thời lượnggiây x độ phân giải, tính phí mỗi giây
5H3 Reference-to-Video, clip làm đầu vàomột cảnh quay cố định mà không cần chạy lại mọi thứcùng độ phân giải, thời lượng ngắngiây x độ phân giải, tính phí mỗi giây

H3 cũng có mục text-to-videoimage-to-video nếu bạn muốn có đường cơ sở văn bản thuần túy hoặc điều khiển khung hình đầu tiên và cuối cùng.

Một điều nữa đáng biết trước khi bạn lên kế hoạch cho một lô: văn bản trên màn hình. Trình tự tiêu đề 15 giây H3 này giữ các chú thích tiếng Anh qua tám lần cắt cứng mà không có một lỗi chính tả nào, đây là một trong những điều khó giữ ổn định nhất trong video được tạo.

 

 

Quy Trình Phim Ngắn Seedance 2.5 vs MiniMax H3, Từng Bước Một

Năm bước. Sao chép các prompt chính xác như đã viết, bao gồm cả những phần xấu xí. Tôi đã không làm sạch chúng cho bài viết và bạn cũng không nên làm sạch chúng cho mô hình.

Bước 1: Xây dựng bảng nhân vật với GPT Image 2

Tạo gói tham chiếu trước khi bạn tạo bất kỳ video nào. Một hình ảnh, hai nhân vật, ba góc nhìn mỗi người, nền trắng tinh khiết không có đường nối, ánh sáng studio đều. Điều đó loại bỏ mọi sự mơ hồ ngoại trừ một thứ bạn quan tâm: người này trông như thế nào.

plaintext
1Một bảng tham chiếu xoay nhân vật toàn thân trên nền trắng tinh khiết không có đường nối, hai nhân vật cạnh nhau, tổng cộng sáu hình, ánh sáng studio trung tính đều, không có bóng trên sàn, không có văn bản, không có nhãn, không có hình mờ.
2
3NỬA TRÁI, nam chính, ba góc nhìn liên tiếp: mặt trước, nghiêng phải, mặt sau. Cuối 20, da trắng, tóc đen gợn sóng dài vừa phải, hàm vuông sắc nét. Mặc áo khoác dài nhung đen chạm sàn với thêu tông màu tinh tế trên ve áo và cổ tay, áo gile gấm đen, cà vạt lụa đen, quần tây đen thẳng, giày da đen bóng. Tay thả lỏng hai bên, biểu cảm trung tính.
4
5NỬA PHẢI, nữ chính, ba góc nhìn liên tiếp: mặt trước, nghiêng phải, mặt sau. Đầu 20, da trắng, tóc dài gợn sóng màu hạt dẻ với vương miện tết nửa đầu. Mặc váy ren cotton kem Victoria, tay dài với cổ tay ren, bodice vừa vặn với nút nhỏ, váy dài đến mắt cá chân, giày cao gót thấp quai mảnh màu kem. Tay thả lỏng hai bên, biểu cảm trung tính.
6
7Chân thực nhiếp ảnh, tỷ lệ nhất quán giữa tất cả sáu hình, chân thẳng hàng trên cùng một đường cơ sở, lấy nét sắc nét từ mép này sang mép kia.

Cài đặt: mô hình OpenAI GPT Image 2 Text-to-Image, Chất lượng cao, Tỷ lệ khung hình 16:9, mọi thứ khác mặc định. Tổng cộng: 11 từ. Hoàn hảo. Giao diện trình tạo hình ảnh AI hiển thị đầu vào prompt và nhân vật được tạo GPT Image 2 Text-to-Image trên Atlas Cloud, lần chạy hoàn tất: prompt xoay ở bên trái, sáu hình trên một tờ trắng trong bảng OUTPUT.

Đây là hình dạng mục tiêu. Sáu hình, một đường cơ sở, không có gì trong nền để tranh luận: Hãy Gói tham chiếu đã thúc đẩy clip demo: nam chính trong nhung đen, nữ chính trong ren kem Victoria, ba góc nhìn mỗi người, một tệp. Mặt trước, mặt nghiêng và mặt sau của trang phục Victoria đen và kem Lần chạy GPT Image 2 của riêng tôi với prompt Bước 1, để so sánh với tham chiếu ở trên.

Bước 2: Khóa địa điểm bằng bảng cảnh sáu ô

Bạn đã giữ được khuôn mặt. Ánh sáng vẫn sẽ phản bội bạn. Hình ảnh tham chiếu thứ hai xác định sáu vị trí camera, hướng của ánh trăng, bao nhiêu sương mù trong không khí và sàn ướt như thế nào. Bạn đang nói với mô hình rằng bộ phim này có chính xác một thiết lập ánh sáng.

plaintext
1Một bảng địa điểm điện ảnh sáu ô, 2 hàng nhân 3 cột, đường viền đen mỏng giữa các ô, mỗi ô có chú thích bằng chữ in hoa trắng nhỏ thanh lịch có khoảng cách ở dưới cùng của ô đó. Chủ đề: nội thất của một lâu đài Gothic bỏ hoang vào ban đêm. Ánh trăng xanh lạnh, sương mù thấp bay, sàn đá ướt phản chiếu, cửa sổ kính màu cao, đèn sắt treo tường với ngọn lửa ấm nhỏ, màu đen bão hòa sâu, rèm nhung dày. Không có người trong bất kỳ ô nào.
2
3Ô 1, chú thích "CẢNH RỘNG - HÀNH LANG": một hành lang dài có cột lùi dần về phía cửa sổ kính màu có ánh sáng.
4Ô 2, chú thích "GÓC THẤP - ÁNH TRĂNG TRÊN SÀN": camera thấp, một luồng ánh trăng chiếu xiên trên đá lát ướt.
5Ô 3, chú thích "CỬA & CẦU THANG": một ô cửa vòm đóng khung cầu thang đá cong.
6Ô 4, chú thích "CẬN CẢNH - CỬA CHẠM KHẮC": cận cảnh cửa gỗ chạm khắc nặng với tay nắm sắt.
7Ô 5, chú thích "GÓC CẠNH CỬA SỔ - SƯƠNG MÙ & RÈM": cửa sổ cao, sương mù cuộn vào, mép rèm ở tiền cảnh.
8Ô 6, chú thích "KHUNG HÌNH POSTER CUỐI - SẢNH TRỐNG": sảnh trống đối xứng, thảm chạy có hoa văn dẫn đến cửa sổ.
9
10Nhiếp ảnh, điện ảnh, hạt phim, bảng màu nhất quán trên tất cả sáu ô.

Cài đặt: cùng mô hình, Chất lượng cao, Tỷ lệ khung hình 16:9. Sáu bảng storyboard nội thất lâu đài Gothic tối tăm với ánh trăng Bảng địa điểm đã thúc đẩy clip demo: sáu nội thất lâu đài Gothic, một bảng màu, chú thích có thể đọc được. Sáu góc camera điện ảnh của nội thất lâu đài Gothic tối tăm Lần chạy GPT Image 2 của riêng tôi với prompt bảng Bước 2.

Bước 3: Tạo cảnh quay với MiniMax H3 reference-to-video

Hai hình ảnh tham chiếu cộng với một prompt mang vị trí camera và hướng âm thanh. Âm thanh được tạo ra trong cùng một lần, vì vậy không có bước giọng nói hoặc nhạc nền riêng. Giữ thời lượng ngắn trong khi bạn đang tinh chỉnh, sau đó đẩy lên 15 cho bản thật.

plaintext
1Hình ảnh tham chiếu 1 là bảng nhân vật: người đàn ông BÊN TRÁI là nam chính, người phụ nữ BÊN PHẢI là nữ chính. Giữ nguyên cả hai danh tính chính xác như được hiển thị: đường viền hàm của anh ta, tóc đen gợn sóng, áo khoác nhung đen, áo gile gấm đen và cà vạt lụa đen; tóc hạt dẻ tết nửa đầu và váy ren kem Victoria của cô ấy. Hình ảnh tham chiếu 2 là bảng địa điểm và ánh sáng: khớp với ánh trăng xanh lạnh, sương mù bay, sàn đá ướt phản chiếu và tông màu đen bão hòa thấp.
2
39:16 dọc, giao diện phim ngắn hài kịch cao cấp, độ sâu trường ảnh nông, độ tương phản điện ảnh, không có phụ đề, không có văn bản trên màn hình, không có hình mờ.
4
5Cảnh 1: Trung cận, camera từ từ đẩy vào. Nữ chính đứng trong hành lang có ánh trăng, thở nông, mắt nhìn chằm chằm vào thứ gì đó ngoài khung hình bên phải. Sương mù lướt qua cô ấy ở độ cao đầu gối.
6Cảnh 2: Cắt cứng. Qua vai từ phía sau cô ấy, nam chính bước ra khỏi vòm tối vào ánh trăng, áo khoác hứng ánh sáng, biểu cảm lạnh lùng và tò mò.
7Cảnh 3: Cận cảnh chặt trên khuôn mặt anh ta, nửa sáng bởi cửa sổ, sau đó là cận cảnh tương ứng trên khuôn mặt cô ấy khi cô ấy từ chối nhìn đi chỗ khác.
8
9Âm thanh: tiếng bass drone thấp liên tục, tiếng vang đá xa, hơi thở không đều của cô ấy, một tiếng bước chân nặng nề khi anh ta bước vào ánh sáng, một tiếng dây đàn mềm duy nhất tăng lên ở lần cắt cuối cùng.

Cài đặt: mô hình MiniMax H3 Reference-to-Video, Độ phân giải 2K, Thời lượng 8 (thanh trượt mặc định; đẩy lên 15 cho bản thật), Tỷ lệ khung hình thích ứng, và cả hai tệp trong Tài liệu tham khảo. Bảng đếm chúng là 2 trên 9, vì vậy bạn có nhiều chỗ để thêm các tấm trang phục hoặc đạo cụ sau.

Đáng chú ý những gì đã xảy ra với tỷ lệ khung hình. Tôi để Tỷ lệ khung hình ở chế độ thích ứng và chỉ viết "9:16 dọc" bên trong prompt. H3 vẫn trả về dọc, vì vậy nó đọc khung hình từ văn bản thay vì cần trường biểu mẫu. Giao diện trình tạo video AI hiển thị prompt văn bản và xem trước video đã hoàn thành MiniMax H3 Reference-to-Video trên Atlas Cloud, lần chạy hoàn tất: cả hai tệp tham chiếu được tải dưới dạng 2 trên 9, độ phân giải 2K, và clip dọc được tạo đang phát trong bảng OUTPUT.

Khung hình đầu tiên là nữ chính trong chiếc áo bodice ren kem, đứng trong hành lang từ bảng ô 1, với sương mù ở độ cao đầu gối và ánh trăng chiếu vào sàn ướt chính xác nơi bảng đặt nó. Cả hai hình ảnh tham chiếu đều hiển thị.

Bước 4: Chạy đối chứng Seedance 2.5 vs MiniMax H3 với cùng gói

Đừng thay đổi một từ nào. Cùng hai hình ảnh tham chiếu, cùng prompt, mô hình khác. Tôi để mặc định thời lượng của mỗi trang riêng thay vì buộc khớp, và tôi sẽ nói những gì mỗi cái trả về bên dưới. Viết lại prompt "cho" mô hình kia chính xác là cách các so sánh bắt đầu nói dối.

plaintext
1Cùng prompt như Bước 3, nguyên văn. Đừng viết lại nó cho mô hình kia.

Cài đặt: mô hình Seedance 2.0 Reference-to-Video, Độ phân giải 720p, cùng hai hình ảnh tham chiếu trong Hình ảnh tham chiếu (lại 2 trên 9, với các ô riêng cho tối đa 3 video tham chiếu và 3 tệp âm thanh tham chiếu). Thời lượng để mặc định của trang, trả về clip 10 giây. Giao diện tạo video AI hiển thị prompt văn bản và video đã hoàn thành Seedance 2.0 Reference-to-Video trên Atlas Cloud, lần chạy hoàn tất với cùng gói tham chiếu và prompt từ Bước 3, và kết quả 10 giây trong bảng OUTPUT.

Đây là những gì hai bảng OUTPUT thực sự hiển thị, và tôi báo cáo thẳng thắn thay vì chọn người chiến thắng.

Cả hai lần chạy đều giữ được nhân vật. Cùng váy ren kem với cùng đường viền cổ và cổ tay áo, cùng tóc hạt dẻ, cùng hành lang sương mù và ánh trăng được lấy từ bảng. Không cái nào phát minh ra một người phụ nữ khác. Gói tham chiếu đã thực hiện công việc đó ở cả hai bên, đó là phát hiện tôi quan tâm nhất.

Sự khác biệt là về hình thức, không phải khuôn mặt. Điểm cuối Seedance này cung cấp 720p; H3 cung cấp 2K từ đầu vào giống hệt. Và sự phân chia khung hình: H3 đọc "9:16 dọc" trực tiếp từ văn bản prompt và trả về dọc, trong khi lần chạy Seedance trả về 16:9 vì trang đó có điều khiển tỷ lệ khung hình riêng và văn bản prompt một mình không ghi đè lên nó. Nếu bạn đang cắt cho TikTok, sự khác biệt đó sẽ khiến bạn mất một lần chạy nếu bạn quên trường biểu mẫu. Seedance 2.5 có thể sẽ thay đổi một nửa độ phân giải và thêm các lần chạy lại cấp vùng, và tôi sẽ không giả vờ rằng tôi đã đo lường điều đó.

Bước 5: Sửa một cảnh quay mà không cần chạy lại toàn bộ clip

Chi phí thực sự của một bộ phim ngắn không phải là lần tạo đầu tiên. Đó là lần sửa thứ bảy. H3 chấp nhận một clip hiện có làm đầu vào và chỉnh sửa theo hướng dẫn, giữ nguyên những gì bạn không đề cập. Điểm bán hàng của Seedance 2.5 ở đây là tinh tế hơn: vẽ lại một vùng của khung hình và để nguyên hiệu suất, ánh sáng và camera.

plaintext
1Sử dụng clip đã cung cấp: giữ nguyên hai nhân vật, trang phục của họ, chuyển động camera và nhịp cắt chính xác như hiện tại. Chỉ thay đổi môi trường, thay thế hành lang đá có ánh trăng bằng phòng khiêu vũ của cùng lâu đài, cửa sổ vòm cao, đèn chùm sáng, và ánh nến ấm, và chiếu sáng lại cả hai nhân vật để ánh sáng chính của họ đến từ đèn chùm ở khung hình bên trái thay vì cửa sổ. Viết lại câu thoại duy nhất của cô ấy thành "Anh chưa bao giờ ngủ, phải không." Giữ nguyên nhịp điệu diễn xuất của cô ấy trên cùng các nhịp.

Cài đặt: MiniMax H3 Reference-to-Video với clip Bước 3 làm đầu vào tham chiếu, Thời lượng 5, Độ phân giải 2K.

 

 

Vượt Ra Ngoài Bài Kiểm Tra Seedance 2.5 vs MiniMax H3: Bốn Cách Để Đẩy Một Gói Tham Chiếu

Cùng nhân vật, tập tiếp theo. Lưu bảng Bước 1 như một tài sản và chỉ thay đổi danh sách cảnh quay và khối câu chuyện trong prompt. Danh tính đến từ một tệp, không phải từ trí nhớ của bạn về cách bạn diễn đạt nó vào thứ Ba tuần trước.

 

 

Ghim giọng nói nữa. H3 chấp nhận tối đa ba tham chiếu âm thanh, mỗi tham chiếu từ 2 đến 15 giây và chúng phải đi kèm với đầu vào hình ảnh hoặc video. Cung cấp cho nó một mẫu giọng nói và nhân vật nói bằng âm sắc đó, vì vậy bạn không phải thay đổi diễn viên lồng tiếng giữa các tập.

 

 

Chặn camera trước khi bạn trả tiền cho bản dựng. Reference-to-video của Seedance 2.5 chấp nhận bản phác thảo mô hình trắng 3D và màn hình xanh, vì vậy bạn có thể khóa khung hình trên hình học xám và chỉ sau đó cam kết với một giao diện hoàn chỉnh. Ví dụ này chạy trên Seedance 2.1, một thành viên trước đó của họ, nhưng hình dạng của quy trình là như nhau.

 

 

Bản địa hóa một bản cắt chính thay vì quay lại. Thay thế cấp vùng đổi khuôn mặt, sản phẩm hoặc ngôn ngữ nói trong khi camera, thời gian và thời lượng môi giữ nguyên. Ở đây, một bản cắt làm đẹp chính được đúc lại và lồng tiếng lại cho tiếng Tây Ban Nha, tiếng Hàn và tiếng Hindi, với căn phòng, khung hình và thời lượng môi được giữ nguyên.

 

 

Và bởi vì ai đó sẽ hỏi chuyển động trông như thế nào khi bạn ngừng tỉnh táo: ba người đàn ông mặc vest, được thay thế bằng ba con capybara chân thực, theo đường chuyển động của clip gốc từng nhịp cho đến khi chúng xếp chồng lên nhau thành một kim tự tháp.

 

 

Cũng có phiên bản đơn giản của tất cả điều này, phiên bản không ai đăng: một poster tĩnh trở thành poster chuyển động, và bố cục sống sót. Cậu bé hoạt hình mặc áo hoodie khủng long màu hồng với móng vuốt khổng lồ Poster nguồn tĩnh. Cung cấp nó cho reference-to-video với "giữ nguyên khung hình, bảng màu và bố cục, làm động kiểu chữ" và bạn sẽ có một phiên bản chuyển động của cùng một thiết kế.

Một Bộ Phim Ngắn Seedance 2.5 vs MiniMax H3 Thực Sự Tốn Bao Nhiêu

Không có con số nào ở đây, bởi vì các con số thay đổi và cấu trúc thì không. Cả hai họ đều tính phí mỗi giây, trả tiền khi sử dụng, không có ghế và không có đăng ký. Điều đó để lại ba biến số: giây, bậc độ phân giải và số lần chạy lại.

Cái thứ ba là toàn bộ hóa đơn. Một clip 15 giây thành công ngay lần đầu tiên là một lần tính phí. Cùng clip đó ở lần thứ bảy là bảy lần. Vì vậy, động thái tiết kiệm tiền không phải là chọn mô hình rẻ hơn mỗi giây, mà là làm đúng gói tham chiếu trước khi bạn tạo bất cứ thứ gì. Hai lần gọi hình ảnh đó ở Bước 1 và Bước 2 là dòng rẻ nhất trong toàn bộ đường ống và là dòng quyết định bạn thực hiện bao nhiêu lần gọi video. Lợi tức đầu tư cao nhất trong toàn bộ chuỗi, vượt xa.

Sau đó, sửa bản năng mỗi giây. Cùng gói tham chiếu, cùng thời gian chạy: reference-to-video của H3 trả về 1440p, điểm cuối reference-to-video Seedance này trả về 720p. Mỗi giây là đơn vị sai. Pixel trên mỗi khung hình, và liệu bạn có phải trả tiền cho một lần nâng cấp riêng biệt hay không, mới là đơn vị đúng.

Âm thanh cũng thuộc về số học. Cả hai bên đều tạo ra âm thanh đồng bộ gốc trong cùng một lần. Nếu đường ống hiện tại của bạn là mô hình video cộng với TTS cộng với một biên tập viên căn chỉnh các bản nhạc, những gì bạn tiết kiệm được là hai lần gọi API và một buổi chiều của một người, và khoản tiết kiệm đó không xuất hiện trên bất kỳ bảng giá nào.

Cái nào cho công việc nào:

Công việcChọnTại saoLưu ý
Phim ngắn dọc, 9:16, TikTok hoặc ReelShortMiniMax H31440p dọc với âm thanh nổi gốc, có thể gọi ngay, 15 giây là một hook đầy đủbạn cắt ở 15 giây, vì vậy hãy lên kế hoạch nhịp phù hợp
Một phim thương hiệu 30 giây liên tụcSeedance 2.5tạo một lần, không ghép nối, 4K gốckiểm tra tính khả dụng trên nền tảng của bạn trước
Sửa một cảnh quay bên trong một bản cắt đã được phê duyệtSeedance 2.5vẽ lại cấp vùng để phần còn lại nguyên vẹnchỉnh sửa toàn bộ clip H3 giúp bạn đạt được hầu hết mọi thứ hôm nay
Cắt giảm sản phẩm và thương mại điện tửcả haicả hai đều giữ văn bản trên màn hình và thương hiệu tốtxác minh văn bản ở độ phân giải bạn gửi
Demo trò chơi hoặc giao diệnMiniMax H3tính ổn định của UI và kiểu chữ ở 2K rất mạnhtrần 15 giây cho một lần chạy duy nhất
Phiên bản đa ngôn ngữ của một bản chínhSeedance 2.5thay thế vùng cộng với giọng nói đa ngôn ngữchất lượng bản địa hóa vẫn cần kiểm tra bản địa
Gửi hàng tối nayMiniMax H3ba điểm cuối trực tiếp, cộng với tất cả Seedance 2.0quyền truy cập Seedance 2.5 khác nhau tùy theo nền tảng

Trước khi bạn gửi hàng. MiniMax cho biết trọng số của H3 sẽ được công bố trong vòng vài ngày kể từ khi ra mắt, và trọng số mở không giống với giấy phép thương mại, vì vậy hãy đọc các điều khoản trước khi bạn tự lưu trữ. Chính sách hình mờ và sử dụng thương mại cũng khác nhau giữa các ứng dụng tiêu dùng và quyền truy cập API ở cả hai bên, và tôi không thể xác nhận một trong hai từ một trang điều khoản chính khi viết bài này, vì vậy hãy kiểm tra các điều khoản của nhà cung cấp thay vì tin lời tôi. Và không có gì trong bất kỳ giấy phép mô hình nào bao gồm chân dung hoặc nhãn hiệu. Nếu một người thật, một thương hiệu thật hoặc IP của người khác có trong gói tham chiếu của bạn, đó là một câu hỏi pháp lý riêng biệt và các điều khoản của mô hình sẽ không trả lời nó.

Mọi mô hình trong các bảng trên đều chạy trên cùng một khóa và các trang mô hình mang tỷ giá hiện tại cộng với mã sao chép, bao gồm bất kỳ chương trình khuyến mãi nào đang chạy trên dòng Seedance trong tuần này.

Câu Hỏi Thường Gặp

Seedance 2.5 có tốt hơn MiniMax H3 về tính nhất quán nhân vật không?

Trên lý thuyết, nó nên như vậy, với tối đa 50 tham chiếu đa phương thức so với 12 tệp của H3, cộng với các lần chạy lại cấp vùng. Nhưng tính đến ngày 31 tháng 7 năm 2026, không có thử nghiệm công khai nào có thể so sánh được mà tôi có thể chỉ ra, và Seedance 2.5 chưa có xếp hạng đấu trường. Trong các lần chạy tôi thực sự có thể thực hiện, biến số quyết định tính ổn định danh tính là cấu trúc gói tham chiếu, không phải thế hệ mô hình: với một bảng xoay tổng hợp cộng với một bảng ánh sáng, cả hai bên đều giữ được nhân vật. Làm đúng gói trước khi bạn dành thời gian mua sắm mô hình.

Tôi có thể sử dụng Seedance 2.5 ngay bây giờ không, hay tôi phải đợi?

API của nó đã hoạt động tại ByteDance. Tính khả dụng trên các nền tảng mô hình của bên thứ ba không đồng đều, và trên nền tảng tôi đã thử nghiệm, nó vẫn là thông báo Ngày-0. Nếu bạn cần đầu ra tối nay, các tùy chọn có thể gọi là ba điểm cuối của MiniMax H3 và toàn bộ dòng Seedance 2.0 đang được phát hành.

MiniMax H3 có thực sự tạo video 30 giây không?

Không. Thông số kỹ thuật là 5 đến 15 giây mỗi lần tạo ở 24fps. Bất cứ thứ gì dài hơn đều là mở rộng hoặc ghép nối, một thứ khác với rủi ro trôi dạt khác nhau. Lần tạo 30 giây duy nhất thuộc về Seedance 2.5. Đừng để hai tuyên bố bị nhầm lẫn.

Cả hai mô hình có tạo âm thanh không, và tôi có thể giữ một giọng nói qua các tập không?

Cả hai đều tạo ra âm thanh đồng bộ gốc trong cùng một lần, và H3 xuất ra âm thanh nổi trên mọi kết quả. Để có giọng nói nhất quán, H3 chấp nhận tối đa ba tham chiếu âm thanh từ 2 đến 15 giây mỗi cái, phải được gửi cùng với đầu vào hình ảnh hoặc video thay vì một mình.

Tôi thực sự nên gửi bao nhiêu hình ảnh tham chiếu?

Ít hơn bạn nghĩ, được cấu trúc tốt hơn bạn nghĩ. Một hình ảnh ghép tốt thường đánh bại sáu cắt rời, bởi vì các tệp riêng biệt mời mô hình lấy trung bình chúng thành một người không tồn tại. Cung cấp cho nó hai công việc rõ ràng, danh tính và ánh sáng, và không bao gồm các mẫu phong cách chiến đấu với nhau.

Tôi nên sử dụng mô hình nào cho phim ngắn dọc kiểu TikTok hoặc ReelShort?

Gửi hàng trong tuần này, ở 9:16, độ phân giải cao với âm thanh đã được trộn: MiniMax H3. Lên kế hoạch cho một cảnh liên tục 30 giây mà bạn muốn chạy lại các vùng đơn lẻ thay vì toàn bộ clip: xây dựng cho Seedance 2.5 và kiểm tra khi nền tảng của bạn mở nó.

Mô hình mới nhất

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình