Seedance 2.0 Mini & Fast API với mức giá thấp nhất toàn cầu — giảm đến 68% so với giá chính thức

MiniMax H3 vs Gemini Omni Flash: Google thắng bảng với 5 điểm. Sau đó khách hàng yêu cầu thay đổi.

MiniMax H3 và Gemini Omni Flash trên ba bảng xếp hạng, và cả ba khoảng cách đều nằm trong biên độ sai số. Vì vậy, tôi đã chạy một lần thử qua cả hai, sau đó gửi lại cùng một ghi chú sửa đổi.

Tôi đã nhìn chằm chằm vào ba bảng xếp hạng của Artificial Analysis trong mười phút để tìm ra ai thực sự chiến thắng.

Text-to-video: Gemini Omni Flash hơn 5 điểm. Image-to-video: Gemini hơn 2 điểm. Video editing: MiniMax H3 hơn 9 điểm.

Sau đó tôi nhìn vào cột khoảng tin cậy. Cộng trừ 7. Cộng trừ 9. Cộng trừ 10.

Ba bảng, ba khoảng cách, mỗi khoảng cách đều nằm trong sai số của chính nó. Trong bỏ phiếu mù, hai mô hình này là một.

Vì vậy tôi đóng các bảng xếp hạng và mở các dropdown thay vào đó. Khoảng cách đó không phải là 5 điểm. Khoảng cách đó là cả một bậc độ phân giải.

Những điểm chính

  • Cả ba khoảng cách trên Artificial Analysis (+5, +2, +9, snapshot ngày 6 tháng 8 năm 2026) đều nằm trong khoảng tin cậy ±7 đến ±10. Về chất lượng thô, đây là hòa, không phải thắng.
  • H3 xuất ra 2K, tối đa 15 giây và sáu tỷ lệ khung hình. API của Gemini Omni Flash giới hạn ở 720p, 10 giây và hai tỷ lệ khung hình. Đó là các giá trị enum, không phải ý kiến.
  • H3 chấp nhận âm thanh đầu vào. Gemini thì không. Gemini có seedthinking_level. H3 không có cái nào.
  • Gemini có endpoint video-edit chuyên dụng để biến đổi clip gốc của bạn. Đường dẫn chỉnh sửa của H3 là reference-to-video, tạo lại với clip của bạn làm tham chiếu. Chúng không phải là cùng một thao tác, và vòng hai cho thấy điều đó.
  • Chỉ một trong hai mô hình có trọng số có thể tải xuống, và nó không phải là của Google.

So sánh cạnh nhau cảnh quán ăn đêm ở các độ phân giải khác nhau

Vòng một của bài kiểm tra MiniMax H3 vs Gemini Omni Flash, cả hai mô hình đều animate cùng một khung hình đầu tiên, hiển thị cạnh nhau

Vòng một: cùng khung hình đầu, cùng prompt, cùng thời lượng. Bên trái MiniMax H3 ở 2K, bên phải Gemini Omni Flash ở 720p. Hiển thị dưới dạng GIF không âm thanh; cả hai tệp đều có âm thanh gốc và được nhúng dưới dạng video có thể phát ở phần dưới. Đây là vấn đề. Cả hai đều tốt.


Tại sao Khoảng Cách Trên Bảng Xếp Hạng MiniMax H3 vs Gemini Omni Flash Đang Bị Hiểu Sai

Hầu hết các bài viết về MiniMax H3 vs Gemini Omni Flash bạn tìm thấy đều trích dẫn một bảng xếp hạng và một mức giá. Cả hai thói quen đều dẫn đến câu trả lời sai.

Dưới đây là cả ba bảng của Artificial Analysis, với cột mà mọi người thường bỏ qua.

Bảng A: MiniMax H3 vs Gemini Omni Flash trên ba bảng xếp hạng Artificial Analysis (có âm thanh), snapshot ngày 6 tháng 8 năm 2026

Bảng xếp hạngGemini Omni FlashMiniMax H3Khoảng cáchNằm trong sai số?
Text-to-video1,243 (#1) ±7, 11,842 phiếu1,238 (#2) ±9, 6,830 phiếuGemini +5
Image-to-video1,191 (#2) ±9, 6,506 phiếu1,189 (#3) ±10, 5,545 phiếuGemini +2
Video editing1,123 (#2) ±5, 11,706 phiếu1,132 (#1) ±6, 9,128 phiếuH3 +9Có, suýt soát

MiniMax H3 là một trong hơn 30 mô hình video bạn có thể chạy cạnh nhau trên cùng một prompt trong Atlas Cloud model comparison — với chi phí mỗi giây được hiển thị trước khi bạn tạo.

Điểm Elo từ Artificial Analysis Video Arena (Artificial Analysis, tháng 8 năm 2026). Image-to-video do Dreamina Seedance 2.0 720p dẫn đầu ở 1,197, vì vậy cả hai mô hình này đều không giữ vương miện đó. Đây là điểm số bình chọn cộng đồng thay đổi và chúng di chuyển, đó chính xác là lý do tại sao khoảng cách 5 điểm không phải là phán quyết.

Dẫn trước 5 điểm với khoảng ±9 có nghĩa là thứ hạng có thể đảo chiều vào tuần sau chỉ vì nhiễu phiếu bầu. Đó không phải là "Gemini tốt hơn ở text-to-video." Đó là tung đồng xu với một bảng điểm kèm theo.

Ba điều nữa mọi người thường hiểu sai:

Cột đô-la mỗi phút không phải là số tiền bạn trả. Artificial Analysis liệt kê $6.00/phút cho Gemini và $7.80/phút cho H3. Cột đó chuẩn hóa thành chi phí của một phút video 1080p ở cài đặt mặc định. Gemini Omni Flash hoàn toàn không thể tạo 1080p. Vì vậy, con số này là ước tính mô hình, không phải hóa đơn. So sánh sản phẩm hoàn chỉnh, không phải giây.

Một bảng không phải là mô hình. H3 đứng thứ hai, thứ ba và thứ nhất trên ba bảng. Gemini đứng thứ nhất, thứ hai và thứ hai. Trích dẫn một trong hai bảng riêng lẻ và bạn có thể chứng minh bất cứ điều gì bạn đã tin.

"Omni" không có nghĩa là "ăn được mọi thứ." Đó là một cái tên hay và gây hiểu lầm. Một trong hai mô hình này nhận tệp âm thanh đầu vào. Nó không phải là mô hình có từ "omni" trong tên.

Bảng Thông Số Kỹ Thuật MiniMax H3 vs Gemini Omni Flash Mà Không Ai In

Nếu điểm Elo không thể phân biệt chúng, thì các bảng ràng buộc có thể. Tôi đã lấy lược đồ đầu vào trực tiếp của cả hai mô hình thay vì tin vào bất kỳ bài đăng ra mắt nào, và sự khác biệt không hề nhỏ.

Bảng B: Ràng buộc cứng của MiniMax H3 vs Gemini Omni Flash, đọc từ lược đồ API trực tiếp vào ngày 6 tháng 8 năm 2026

Ràng buộcMiniMax H3Gemini Omni Flash
Độ phân giải768P hoặc 2K720p, và đó là giá trị duy nhất trong enum
Thời lượng4 đến 15 giây3 đến 10 giây
Tỷ lệ khung hình21:9, 16:9, 4:3, 1:1, 3:4, 9:16Chỉ 16:9 và 9:16
Đường dẫn chỉnh sửareference-to-video (tạo lại với tham chiếu)Endpoint video-edit chuyên dụng (biến đổi nguồn)
Kiểm soát khung cuốiend_image được hỗ trợKhông có
Giới hạn tham chiếu≤9 ảnh, ≤3 video, ≤3 âm thanh, tổng 12 tệp1 đến 10 ảnh
Đầu vào âm thanhKhông
Khả năng tái tạo seedKhông
thinking_levelKhôngCó (mặc định / cao / thấp)
Trọng số mởCó, trên Hugging FaceKhông

Đọc bảng đó một cách trung thực và Gemini thắng ba hàng rõ ràng. Seed có thể tái tạo rất quan trọng nếu bạn đang xây dựng một pipeline phải render cùng một khung hình hai lần. Một endpoint video-edit thực sự là một công cụ hoàn toàn khác so với tái tạo có điều kiện tham chiếu. Và thinking_level cung cấp cho bạn một núm chất lượng mà H3 đơn giản là không có.

H3 thắng năm hàng, và đó là những hàng quyết định liệu bạn có thể giao tệp tin mà khách hàng yêu cầu hay không.

Tôi đã chạy mọi thứ bên dưới trên Atlas Cloud vì cả hai mô hình đều nằm sau cùng một endpoint /api/v1/model/generateVideo ở đó, có nghĩa là một vòng lặp polling và một header auth cho toàn bộ bài kiểm tra. Chuyển đổi mô hình chỉ là thay đổi chuỗi model. Chi tiết đó là toàn bộ lý do tại sao "sử dụng cả hai" là một câu trả lời thực tế chứ không phải là một lối thoát.

Bảng C: Chi phí của mỗi endpoint trong bài kiểm tra này, được xác minh với bảng giá trực tiếp vào ngày 6 tháng 8 năm 2026

EndpointGiáClip 10 giây trong bài kiểm tra này
openai/gpt-image-2/text-to-image$0.009 / ảnh$0.01
minimax/h3/image-to-video$0.14 / s$1.40
minimax/h3/reference-to-video$0.14 / s$1.40
google/gemini-omni-flash/image-to-video$0.13 / s$1.30
google/gemini-omni-flash/video-edit$0.14 / s$1.40
google/gemini-omni-flash/text-to-video$0.125 / skhông sử dụng
minimax/h3/text-to-video$0.14 / skhông sử dụng

Không có mô hình nào được giảm giá trong tháng này. Gemini cũng cung cấp bậc nhà phát triển rẻ hơn ($0.112/s cho text-to-video và image-to-video, $0.12/s cho reference-to-video); H3 không có bậc tương đương.

Dòng trọng số mở mà Gemini Omni Flash không thể vượt qua. Trọng số của H3 được công bố trên Hugging Face (MiniMax, tháng 8 năm 2026): một mô hình Omni Transformer dày đặc 33B luồng đơn, cùng với bộ mã hóa văn bản Qwen3-VL-32B, một VAE hình ảnh và một VAE âm thanh. Hai lưu ý quan trọng hơn kích thước tải xuống. Thứ nhất, những gì bạn tự lưu trữ chạy ở cạnh ngắn 768 pixel; giai đoạn tiền xử lý Context-IR và mô-đun Regenerate-2K không có trong bản phát hành, và đầu ra 2K đến từ hai mô-đun đó. Thứ hai, giấy phép cộng đồng hiện không bao gồm EU, Vương quốc Anh, Hàn Quốc hoặc Hoa Kỳ, và có một mẫu đơn riêng cho các vùng lãnh thổ đó. Hãy đọc kỹ trước khi bạn xây dựng sản phẩm dựa trên nó. Gemini Omni Flash không có cuộc trò chuyện tương đương, vì không có tệp nào để tải xuống.

Vị trí trọng số mở đó, cùng với mức giá cạnh tranh, là toàn bộ câu chuyện chiến lược của lần ra mắt này (South China Morning Post, tháng 8 năm 2026).

Tự Chạy Bài Kiểm Tra Chỉnh Sửa MiniMax H3 vs Gemini Omni Flash

Đây là phần mà chưa ai chạy. Mọi người đều benchmark thế hệ đầu tiên. Không ai benchmark thế hệ thứ hai.

Công việc thực tế không phải là một prompt. Công việc thực tế là một clip bạn đã thích, cộng với một khách hàng viết lại "thích quá, có thể để biển báo ghi 24H và tạp dề của cô ấy màu đỏ được không." Một câu duy nhất đó là nơi hai mô hình này không còn có thể thay thế cho nhau, và nó tình cờ là nhiệm vụ chính xác mà bảng xếp hạng video editing đo lường.

Cảnh được cố tình chọn khó: một quán mì đêm ướt mưa, người bán hàng nói thẳng vào ống kính, một tấm biển vẽ tay với chữ dễ đọc phía sau cô ấy, hơi nước bốc lên từ nước dùng, mưa trên mái hiên. Một khung hình gây căng thẳng cho khớp môi, độ ổn định của văn bản trên màn hình, chuyển động mượt mà và âm thanh xung quanh nhiều lớp cùng một lúc.

Cả hai mô hình đều nhận được cùng một khung hình đầu tiên, cùng một prompt và cùng một ghi chú chỉnh sửa. Mỗi lần chạy bên dưới đều là 10 giây, là trần của Gemini Omni Flash và nằm trong khả năng của H3.

Bước 1: Cố định khung hình đầu tiên với GPT Image 2

Cả hai mô hình phải bắt đầu từ cùng một hình ảnh, nếu không vòng một sẽ đo lường sự may mắn về bố cục chứ không phải mô hình. Mở GPT Image 2 playground, đặt chất lượng thành high và tỷ lệ thành 16:9, và dán dòng này:

Plain
1Ảnh chân thực quán ăn đường phố đêm trong mưa lớn, chụp bằng ống kính 35mm ở khẩu độ f/2.0. Một phụ nữ khoảng ba mươi cuối, mặc tạp dề vải chàm, đứng sau quầy mì bốc hơi, nhìn thẳng vào ống kính, đang nói dở. Phía sau cô ấy, một tấm biển hộp đèn thiếc vẽ tay phát sáng màu hổ phách ấm áp với dòng chữ "OPEN LATE" bằng chữ in hoa sans-serif đậm, sạch sẽ. Mưa rơi qua ánh đèn đường natri, hơi nước bốc lên từ nồi nước dùng, mặt đường ướt phản chiếu đèn neon đỏ và xanh lá từ bên kia đường. Độ sâu trường ảnh nông, chỉ dùng ánh sáng thực tế, hơi mờ ống kính, kết cấu da tự nhiên, không có văn bản nào khác trong khung hình. 16:9.

Giao diện AI tạo ảnh hiển thị prompt và hình ảnh được tạo

GPT Image 2 playground trên Atlas Cloud với prompt quán mì ở bên trái và khung hình đầu tiên được tạo trong bảng OUTPUT

GPT Image 2 trên Atlas Cloud: prompt ở bên trái, khung hình đầu tiên dùng chung ở OUTPUT. Chi phí cho bước này , $0.009.

Một phụ nữ đứng tại quán ăn đường phố bốc hơi vào ban đêm

Khung hình đầu tiên được tạo: một phụ nữ mặc tạp dề chàm đứng sau quầy mì bốc hơi vào ban đêm trong mưa, với tấm biển OPEN LATE vẽ tay phát sáng phía sau

Đầu vào duy nhất mà cả hai mô hình nhận được. Lưu ý hai thứ mà bản chỉnh sửa sẽ nhắm đến: biển "OPEN LATE" và tạp dề chàm. Được tạo bằng openai/gpt-image-2/text-to-image.

Bước 2: Vòng một trên MiniMax H3

Đi tới MiniMax H3 playground, chọn tác vụ image-to-video, tải lên khung hình từ Bước 1, và đặt resolution thành 2K, duration thành 10, ratio thành adaptive (enum image-to-video chỉ cung cấp adaptive). Prompt:

Plain
1Người bán hàng nhìn vào ống kính và nói, bằng giọng ấm áp mệt mỏi: "Nước dùng đã được nấu từ bốn giờ sáng nay rồi. Ngồi xuống đi, trời vẫn còn mưa." Cô ấy nhấc muôi lên khi nói. Hơi nước cuộn lên khắp khung hình. Mưa vẫn tiếp tục rơi trên mái hiên phía sau cô ấy. Máy quay giữ yên, không đẩy, không lia. Âm thanh xung quanh: mưa trên bạt, nước dùng sôi, tiếng xe cộ xa xa, giọng cô ấy gần và khàn.

Giao diện tạo video AI hiển thị đầu vào prompt văn bản và đầu ra video

MiniMax H3 image-to-video playground trên Atlas Cloud với độ phân giải 2K được chọn và clip hoàn thành đang phát trong bảng OUTPUT

MiniMax H3 image-to-video trên Atlas Cloud: 2K được chọn, clip hoàn thành trong OUTPUT. Bản chụp này chạy ở mặc định 8 giây của playground và có giá $1.12; phiên bản 10 giây được sử dụng để so sánh được nhúng bên dưới và có giá $1.40.

MiniMax H3, vòng một, 2K, 10 giây. Bật âm thanh: lời thoại, tiếng mưa và nước dùng đều được tạo trong cùng một lần, không phải ghép sau.

Bước 3: Vòng một trên Gemini Omni Flash, cùng khung hình, cùng lời

Mở Gemini Omni Flash playground, chọn image-to-video, tải lên cùng khung hình Bước 1, và dán prompt Bước 2 mà không thay đổi một ký tự nào. Cài đặt: resolution 720p, duration 10, aspect_ratio 16:9, thinking_level mặc định, seed -1.

Hai điều cần lưu ý khi bạn đang ở trong biểu mẫu đó, bởi vì chúng là bài viết thu nhỏ. Dropdown resolution chứa chính xác một tùy chọn. Trường duration dừng ở 10. Tôi không chọn 720p thay vì thứ gì tốt hơn; không có thứ gì khác để chọn.

Một lưu ý về những gì còn thiếu ở đây: Tôi không thể chụp ảnh màn hình playground hoàn thành cho bước Gemini nào. Môi trường staging tôi chụp ảnh màn hình đã trả về 403 PERMISSION_DENIED từ phía Google trong cả ba lần thử, vì vậy ảnh chụp Gemini duy nhất tôi có hiển thị bảng OUTPUT bị lỗi và tôi sẽ không trang trí nó như một lần chạy thành công. Các clip bên dưới là thật, được tạo thông qua API sản xuất với các cài đặt được liệt kê ở trên. Hai bước H3 đã chụp được ảnh màn hình sạch và những ảnh đó là thật.

Gemini Omni Flash, vòng một, 720p, 10 giây, đầu vào giống hệt. Phát clip này ngay sau clip H3 ở trên và tự đánh giá âm thanh.

Bước 4: Vòng hai, gửi bản chỉnh sửa cho Gemini Omni Flash

Đây là vòng quan trọng. Chuyển sang tác vụ video-edit trên cùng trang mô hình Gemini, tải lên clip mà chính Gemini đã tạo ở Bước 3 làm đầu vào video, đặt resolution 720pthinking_level cao (một hướng dẫn chỉnh sửa hai phần chính xác là trường hợp phức tạp mà núm này dành cho). Dán ghi chú này chính xác như khách hàng sẽ gửi:

Plain
1Giữ nguyên cảnh quay này: cùng vị trí máy ảnh, cùng người phụ nữ, cùng khuôn mặt, cùng mưa, cùng ánh sáng, cùng âm thanh. Thay đổi tấm biển vẽ tay để nó ghi "OPEN 24H" thay vì "OPEN LATE", với cùng phong cách vẽ và cùng ánh sáng hổ phách. Đổi tạp dề của cô ấy từ xanh chàm sang đỏ thẫm. Không thay đổi gì khác trong khung hình.

Gemini Omni Flash sau ghi chú chỉnh sửa. Nhìn vào biển báo, sau đó là tạp dề, sau đó kiểm tra xem có thứ gì khác bị thay đổi không.

Bước 5: Vòng hai, gửi bản chỉnh sửa giống hệt cho MiniMax H3

Đây là sự khác biệt cấu trúc trung thực, và bạn nên biết nó trước khi đọc kết quả. H3 không có endpoint video-edit. Đường dẫn chỉnh sửa của nó là reference-to-video: bạn đưa cho nó clip gốc làm tham chiếu và nó tạo một video mới dựa trên tham chiếu đó. Nó không chỉnh sửa tệp của bạn. Nó đang tạo một tệp mới được cho là trông giống tệp của bạn.

Trên trang MiniMax H3, chọn tác vụ reference-to-video, thêm clip mà H3 đã tạo ở Bước 2 vào refers dưới dạng tham chiếu video, sau đó đặt resolution 2K, duration 10, ratio adaptive. Dán prompt Bước 4 mà không có bất kỳ chỉnh sửa nào.

Bước này cũng không có ảnh chụp màn hình playground, vì một lý do khác và nhàm chán hơn: trình duyệt headless tôi dùng để chụp đã bị crash ba lần khi tải tham chiếu video. Bản thân lần chạy đã diễn ra qua API mà không có vấn đề gì.

MiniMax H3 sau ghi chú chỉnh sửa giống hệt, thông qua reference-to-video ở 2K.

So sánh một người phụ nữ nấu ăn tại quán ăn đêm mưa

So sánh cạnh nhau vòng hai: kết quả video-edit của Gemini Omni Flash bên cạnh kết quả reference-to-video của MiniMax H3, cả hai từ cùng một ghi chú chỉnh sửa

Vòng hai cạnh nhau, GIF không âm thanh. Bên trái Gemini Omni Flash qua video-edit, bên phải MiniMax H3 qua reference-to-video. Cả hai đều có cùng một câu để làm việc.

Điều gì thực sự xảy ra trong vòng hai. Tôi đã kỳ vọng H3 sẽ thua vòng này. Tái tạo có điều kiện tham chiếu là một công cụ thô hơn so với một endpoint chỉnh sửa thực sự, và "tạo lại toàn bộ clip và hy vọng nó rơi đúng chỗ" chính xác là cách bạn có được một khuôn mặt khác, một máy quay trôi dạt và một khách hàng hỏi chuyện gì đã xảy ra với cảnh quay.

Đó không phải là những gì đã trả về. Cả hai mô hình đều làm tốt công việc, và cả hai đều làm sạch sẽ.

video-edit của Gemini hoạt động chính xác như quảng cáo. Biển báo ghi OPEN 24H với cùng kiểu chữ vẽ tay, cùng ánh sáng hổ phách và cùng vết mòn trên thiếc. Tạp dề có màu đỏ thẫm. Mọi thứ khác đều không thay đổi: cùng khuôn mặt, cùng biểu cảm, cùng góc muôi, cùng hình dạng hơi nước, cùng mưa, cùng đèn hậu ở hậu cảnh. Nó đọc giống như tệp gốc với hai chỉnh sửa sâu ở mức pixel, bởi vì về cơ bản đó là những gì nó làm.

reference-to-video của H3 tạo ra hai thay đổi giống hệt và giữ cảnh quay tốt hơn nhiều so với kiến trúc gợi ý. Biển báo đã thay đổi, tạp dề đã thay đổi, và trong suốt 10 giây, khung hình, dòng nước dùng chảy từ muôi, chùm hơi nước và khuôn mặt cô ấy vẫn khớp với clip vòng một. Nếu có sự trôi dạt ở đây, tôi không thể tìm thấy nó khi xem từng khung hình.

Vì vậy, vòng hai là một trận hòa thống kê thứ ba, và tôi sẽ không giả vờ khác để có một câu chuyện gọn gàng hơn. Điều phân biệt hai đầu ra không phải là chất lượng chỉnh sửa. Đó là H3 trả về 2560x1440 với bản âm thanh nổi 32 kHz và Gemini trả về 1280x720. Cùng một hướng dẫn, cùng một thành công, sản phẩm khác nhau.

Một lưu ý trung thực về phương pháp: đây là một lần chỉnh sửa duy nhất trên một cảnh quay duy nhất, không phải là một nghiên cứu có kiểm soát. Thay đổi hai phần trên biển báo và quần áo là một chỉnh sửa khá nhẹ nhàng. Các trường hợp khó hơn (xóa một đối tượng mà máy quay di chuyển qua, thay đổi thứ gì đó mà chủ thể che khuất, bốn vòng ghi chú chồng lên nhau) là nơi một endpoint chỉnh sửa chuyên dụng sẽ vượt lên, và nơi tái tạo sẽ bắt đầu dao động. Hãy chạy thử nghiệm của bạn trước khi quyết định.

Ba Sự Khác Biệt MiniMax H3 vs Gemini Omni Flash Đáng Thử Nghiệm Hơn

Vòng hai là sự khác biệt thay đổi một lần giao hàng. Ba sự khác biệt nữa đáng để bạn dành hai mươi phút tín dụng của mình.

Đưa cho nó một tệp âm thanh. reference-to-video của H3 chấp nhận tối đa ba clip âm thanh, mỗi clip từ 2 đến 15 giây, miễn là có ít nhất một tham chiếu hình ảnh hoặc video đi kèm. Điều đó có nghĩa là bạn có thể đưa cho nó một bản ghi âm giọng nói thực tế và để nhân vật thực hiện nó. Gemini Omni Flash không có trường đầu vào âm thanh trên bất kỳ endpoint nào trong bốn endpoint của nó, vì vậy không thể chạy so sánh này. Đó không phải là mất điểm cho Google; đó là một khả năng đơn giản là không có.

Yêu cầu tỷ lệ 21:9. Enum ratio của H3 trong reference-to-video chứa 21:9, 16:9, 4:3, 1:1, 3:4 và 9:16. Enum aspect_ratio của Gemini chứa 16:9 và 9:16. Nếu sản phẩm của bạn là một chuỗi tiêu đề màn ảnh rộng hoặc một đoạn cắt cho mạng xã hội tỷ lệ 1:1, một trong hai mô hình này không có trong cuộc trò chuyện.

Khóa seed và chạy lại. Cái này đi theo hướng ngược lại. Gemini hiển thị seed; H3 không hiển thị nó trên bất kỳ endpoint nào. Nếu bạn đang xây dựng một pipeline mà cùng một yêu cầu phải trả về cùng các khung hình vào thứ Ba như nó đã trả về vào thứ Hai, Gemini cung cấp cho bạn một tay cầm và H3 không cung cấp gì. Đối với kiểm tra hồi quy, biến thể bản sao A/B, hoặc bất kỳ trang trại render tự động nào, đó là một lợi thế thực sự và nó thuộc về phía Google.

Chi Phí Thực Tế Của Bài Kiểm Tra MiniMax H3 vs Gemini Omni Flash

Toàn bộ thí nghiệm trên, bốn lần tạo video và một hình ảnh, có giá khoảng $5.51. Một khung hình đầu tiên với giá $0.009, hai clip vòng một 10 giây với giá $1.40 và $1.30, hai clip vòng hai 10 giây với giá $1.40 mỗi clip.

Mỗi giây, Gemini rẻ hơn: $0.125 đến $0.14 so với mức phẳng $0.14 của H3, vì vậy rẻ hơn khoảng 7 đến 11 phần trăm tùy thuộc vào endpoint. Con số đó là đúng và nó cũng gần như vô dụng một mình.

Đây là lý do tại sao. Giả sử sản phẩm là một đoạn mở đầu điện ảnh 21:9, 15 giây ở 2K. H3 render nó như một clip duy nhất. Gemini hoàn toàn không thể render nó: không phải độ phân giải, không phải thời lượng, không phải tỷ lệ khung hình. Bạn sẽ phải ghép một clip 10 giây và một clip 5 giây 16:9, cắt xén để giả mạo màn ảnh rộng, và giao hàng ở 720p. Giá mỗi giây của một thứ bạn không thể giao hàng không phải là tiết kiệm.

Lật ngược lại. Giả sử sản phẩm là một đoạn cắt cho mạng xã hội 16:9 sẽ trải qua bốn vòng ghi chú của khách hàng và phải trả về byte giống hệt khi nhóm pháp lý yêu cầu render lại trong ba tuần. video-edit cộng với seed của Gemini được xây dựng chính xác cho vòng lặp đó, và nó có giá thấp hơn mỗi giây trong khi thực hiện điều đó.

Bảng D: Công việc MiniMax H3 vs Gemini Omni Flash nào nên đi đâu

Công việc trước mặt bạnGửi đến
Giao hàng 2KMiniMax H3
Một cảnh quay duy nhất dài hơn 10 giâyMiniMax H3
Khung hình 21:9, 4:3, 1:1 hoặc 3:4MiniMax H3
Đưa vào một bản nhạc âm thanh thực tếMiniMax H3
Tự lưu trữ trên GPU của bạnMiniMax H3
Kết thúc ở một khung hình cụ thểMiniMax H3
Chỉnh sửa nhiều vòng đối thoạiGemini Omni Flash
Giữ nguyên các phần không bị thay đổi của clipGemini Omni Flash
Render có thể tái tạo qua seedGemini Omni Flash
Dạng ngắn 16:9 đơn giản với mức giá mỗi giây thấp nhấtGemini Omni Flash

Kết luận của bài viết này là bảng đó, không phải một điểm số. Nếu một benchmark không thể phân tách hai mô hình với sai số lớn hơn của chính nó, thì benchmark đã nói cho bạn biết mọi thứ nó biết, và bảng thông số kỹ thuật sẽ tiếp quản từ đó.

Để có cái nhìn rộng hơn về vị trí của H3 so với phần còn lại, bài phân tích các lựa chọn thay thế MiniMax H3 bao gồm các mô hình đánh bại nó trên các bảng mà nó không dẫn đầu.

Câu Hỏi Thường Gặp

MiniMax H3 có tốt hơn Gemini Omni Flash không?

Bỏ phiếu mù không thể phân tách chúng. Trên ba bảng xếp hạng Artificial Analysis, khoảng cách là 5, 2 và 9 điểm Elo, và mỗi khoảng cách đều nằm trong khoảng tin cậy ±7 đến ±10. Chọn dựa trên thông số kỹ thuật, không phải thứ hạng. Giới hạn độ phân giải, giới hạn thời lượng và danh sách tỷ lệ khung hình sẽ thay đổi sản phẩm của bạn; 5 điểm Elo thì không.

Cái nào rẻ hơn, MiniMax H3 hay Gemini Omni Flash?

Mỗi giây, Gemini rẻ hơn. Trên Atlas Cloud, nó có giá $0.125 đến $0.14 mỗi giây so với mức phẳng $0.14 của H3, với bậc nhà phát triển ở $0.112 mỗi giây mà H3 không có tương đương. Nhưng Gemini bị giới hạn ở 720p, 10 giây và hai tỷ lệ khung hình, vì vậy đối với nhiều sản phẩm, bạn không so sánh cùng một sản phẩm. Định giá sản phẩm hoàn chỉnh, không phải giây.

Gemini Omni Flash có thể tạo video 1080p, 2K hoặc 15 giây không?

Không. Tham số resolution API của nó có một giá trị hợp lệ, 720p, và duration chấp nhận 3 đến 10 giây. MiniMax H3 cung cấp 768P hoặc 2K và 4 đến 15 giây. Đây là các ràng buộc enum được đọc từ lược đồ trực tiếp vào ngày 6 tháng 8 năm 2026, không phải ý kiến biên tập, và Google có thể dỡ bỏ chúng sau này.

Tôi có thể tự lưu trữ Gemini Omni Flash như cách tôi có thể tự lưu trữ MiniMax H3 không?

Không. Trọng số của H3 có trên Hugging Face và chạy cục bộ ở cạnh ngắn 768 pixel. Giai đoạn Context-IR và mô-đun Regenerate-2K tạo ra đầu ra 2K không có trong bản phát hành và ở lại phía API. Cũng hãy kiểm tra giấy phép: hiện tại nó không bao gồm EU, Vương quốc Anh, Hàn Quốc hoặc Hoa Kỳ mà không có đơn đăng ký riêng.

Tôi có phải chọn chỉ một không?

Không, và bảng phân chia theo công việc ở trên là câu trả lời tốt hơn. Cả hai mô hình đều nằm sau cùng một endpoint generateVideo trên Atlas Cloud, vì vậy chạy cả hai có nghĩa là một vòng lặp polling và một chuỗi model khác, không phải hai tích hợp. Định tuyến theo sản phẩm đánh bại việc đặt cược vào một bảng xếp hạng thay đổi hàng tuần.

Mô hình mới nhất

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình