Cả mùa hè, feed của tôi chỉ lặp đi lặp lại một video. Các cầu thủ World Cup được vẽ lại thành nhân vật chính shonen. Một tên độc tài. Một thuyền trưởng cướp biển. Một người cố vấn già dặn xuất hiện trong bốn giây cuối. Hàng triệu lượt xem mỗi bài đăng, và cốt truyện cập nhật sau hầu hết mọi trận đấu.
Không ai trong số những người làm video đó viết các bài benchmark. Họ chọn một mô hình, đốt credits, và xuất bản trước quả bóng tiếp theo được đá.
Vì vậy, tôi lấy một keyframe anime và một prompt, và kiểm tra MiniMax H3 như một công cụ tạo video anime đối đầu với Veo 3.1, cả hai đều được đẩy lên cài đặt tối đa trên cùng một đầu vào.
Điều đầu tiên hỏng không phải là chất lượng hình ảnh. Đó là một dropdown. Veo 3.1 dừng ở 8 giây và chỉ cung cấp đúng hai tỷ lệ khung hình. Một cảnh quay giữ khuôn mặt, whip pan theo quả bóng, rồi để một title card đáp xuống – không thể vừa trong 8 giây. Nó không bao giờ có cơ hội thất bại về chất lượng.
Những điểm chính
durationcủa Veo 3.1 là enum[4, 6, 8]vàaspect_ratiolà enum[16:9, 9:16]. MiniMax H3 chạy bất kỳ số giây nguyên nào từ 4 đến 15 và cung cấp21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Không có 4:3 trên Veo đồng nghĩa với việc không có khung hình OVA retro, hoàn toàn không.- Model card của H3 liệt kê 11 ngôn ngữ hội thoại ổn định gốc và tiếng Nhật là một trong số đó. Âm thanh và hình ảnh được tạo cùng nhau ở âm thanh nổi 32 kHz, không phải lồng tiếng sau.
- Các gói tham chiếu không hề tương đồng: H3 nhận tối đa 9 ảnh cộng với tối đa 3 video và 3 clip âm thanh (tối đa 12 tệp). Endpoint tham chiếu của Veo 3.1 chỉ nhận 3 ảnh và ngay khi bạn sử dụng nó,
durationsẽ thu gọn chỉ còn[8]. - Hai cái bẫy âm thầm phá hỏng các bài kiểm tra: API của Veo mặc định
generate_audiolàfalsevàresolutionlà720p; cònratiocủa H3 trong text-to-video mặc định là1:1. Bỏ qua những điều đó, bạn đang so sánh một clip 720p không âm thanh với một clip vuông. - Veo 3.1 giữ lại hai thứ mà H3 hoàn toàn không có:
seedvànegative_prompt. Đối với anime 2D, điều thứ hai thực sự quan trọng và tôi sẽ chỉ ra ở đâu.
MiniMax H3 Anime Video Generator vs Veo 3.1, Cùng Một Khung Hình Đối Đầu
Một nhân vật gốc. Một keyframe. Một prompt, được sao chép y nguyên từng chữ vào cả hai mô hình. Mọi thứ khác đều được đặt tối đa ở mỗi bên.
MiniMax H3, image-to-video, 2K, 8 giây, âm thanh gốc. Hãy bật âm thanh lên: tiếng đám đông, tiếng bóng chạm đất và tiếng hét bằng tiếng Nhật được tạo trong cùng một lượt với hình ảnh. Được tạo bằng minimax/h3/image-to-video trên Atlas Cloud.
Veo 3.1, image-to-video, 1080p, 8 giây, generateaudio được bật thủ công, cùng với negativeprompt giữ cho nét vẽ phẳng. Cùng một khung hình đầu tiên, cùng một câu chữ. Được tạo bằng google/veo3.1/image-to-video trên Atlas Cloud.
Cả hai đều vẽ rất đẹp. Cảnh quay rộng về cú sút của Veo, với các đường tác động vẽ tay và hiệu ứng âm thanh manga lơ lửng trên không, thực sự rất đáng yêu. Đó là điểm khởi đầu trung thực, và đó là lý do phần còn lại của bài viết này nói về các tham số và khả năng làm theo hướng dẫn, chứ không phải về cảm nhận.
Tại Sao Hầu Hết Các Bài Kiểm Tra MiniMax H3 Anime Video Generator vs Veo 3.1 Đều Sai
Hai điều đã xảy ra cùng lúc vào mùa hè này.
Anime trở thành định dạng phổ biến nhất trong video AI. World Cup 2026 được viết lại thành một giải đấu shonen, với các cầu thủ được đóng vai là một tên độc tài, một thuyền trưởng cướp biển, một tướng hải quân và một người cố vấn, và các cốt truyện "phát triển sau hầu hết mọi trận đấu" trên TikTok, Instagram, X và YouTube (Complex, tháng 7 năm 2026).
Và MiniMax H3 được phát hành với trọng số mở. Luồng ComfyUI ngày 0 đã đạt 330 điểm và 95 bình luận, với mọi người đăng các con số thực tế tại chỗ trong vòng vài giờ (Hacker News, tháng 8 năm 2026).
Kết hợp những điều đó lại, bạn sẽ mong đợi một loạt các so sánh anime. Hầu như không có, bởi vì hầu hết các bài kiểm tra đều được xây dựng sai theo một trong bốn cách.
Chúng so sánh hình ảnh, chứ không phải ràng buộc. Các cảnh quay anime là về thời gian. Một whip pan vào title card là một vấn đề về thời lượng trước khi nó trở thành vấn đề về kết xuất.
Chúng quên rằng API của Veo mặc định là im lặng. Trên API, generate_audio là false và resolution là 720p. Rất nhiều bài đăng "Veo không có âm thanh trong anime" chỉ là ai đó chưa bao giờ bật một boolean.
Chúng quên rằng text-to-video của H3 mặc định là vuông. ratio mặc định là 1:1, không phải 16:9. Chạy một prompt anime t2v mà không đặt nó, bạn sẽ nhận được một clip vuông và một kết luận bối rối.
Chúng kiểm tra với các prompt photoreal. "Cinematic, volumetric light, shallow depth of field" chính xác là từ vựng kéo mô hình 2D về phía bóng đổ 3D. Chế độ thất bại trong anime không phải là mờ. Đó là nhựa.
Ba cài đặt quyết định một bài kiểm tra anime trước khi bạn nhấn chạy
Trước bất cứ điều gì khác, hãy đặt những thứ này ở cả hai bên nếu không so sánh sẽ vô hiệu.
| Cài đặt | MiniMax H3 | Veo 3.1 | Điều gì xảy ra nếu bạn bỏ qua |
|---|---|---|---|
| Âm thanh | Được tạo cùng với hình ảnh, luôn bật | generate_audio mặc định là false | Veo trả về một clip im lặng và trông tệ hơn thực tế |
| Hình dạng khung | ratio mặc định là 1:1 trên text-to-video | aspect_ratio mặc định là 16:9 | H3 đưa cho bạn một cảnh anime vuông không thể dùng được |
| Độ phân giải | mặc định là 2K | mặc định là 720p | Bạn so sánh 2K với 720p và gọi đó là khoảng cách chất lượng |
Thông Số Kỹ Thuật MiniMax H3 vs Veo 3.1 Anime: Độ Dài, Tỷ Lệ, Âm Thanh, Tham Chiếu
Tôi đã lấy các schema đầu vào trực tiếp của cả hai mô hình thay vì tin tưởng vào bất kỳ bài đăng ra mắt nào. Mọi giá trị dưới đây đều là enum bạn có thể tự đọc trên các trang mô hình, không phải ấn tượng.
Bảng 1: MiniMax H3 vs Veo 3.1, các tham số quyết định một cảnh quay anime
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| Thời lượng | 4 đến 15, mọi số giây nguyên (mặc định 8) | 4, 6, 8 (mặc định 8) |
| Tỷ lệ khung hình | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| Mặc định tỷ lệ (text-to-video) | 1:01 | 16:09 |
| Độ phân giải | 768P, 2K (mặc định 2K) | 720p, 1080p, 4k (mặc định 720p) |
| Âm thanh | Được tạo đồng thời, âm thanh nổi 32 kHz | generate_audio, mặc định false |
| Ngôn ngữ hội thoại gốc | 11 ngôn ngữ ổn định, bao gồm tiếng Nhật | Không được công bố dưới dạng danh sách ổn định |
| Gói tham chiếu | tối đa 9 ảnh, 3 video, 3 clip âm thanh, tổng 12 tệp | 3 ảnh |
| Thời lượng khi dùng tham chiếu | vẫn là 4 đến 15 | thu gọn chỉ còn 8 |
| seed | không có | có |
| negative_prompt | không có | có |
| Trọng số | có thể tải về | đóng |
Thời lượng, tỷ lệ, độ phân giải, âm thanh và giới hạn tham chiếu được đọc từ các schema trực tiếp trên các trang MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video và Veo 3.1 reference-to-video. Giới hạn 9 ảnh và 12 tệp tham chiếu cùng danh sách 11 ngôn ngữ hội thoại đến từ model card MiniMax H3 (Hugging Face, tháng 8 năm 2026).
Bây giờ là bảng xếp hạng, bởi vì chúng nói lên điều gì đó khác so với thông số kỹ thuật và cả hai đều quan trọng.
Bảng 2: Elo bình chọn cộng đồng và giá mỗi phút, ảnh chụp ngày 7 tháng 8 năm 2026
| Model | Text-to-video (có âm thanh) | Image-to-video (có âm thanh) | $/phút |
|---|---|---|---|
| Gemini Omni Flash | 1,244 (#1) ±7 | 1,191 (#2) ±9 | $6.00 |
| MiniMax H3 | 1,238 (#2) ±9 | 1,190 (#3) ±10 | $7.80 |
| Dreamina Seedance 2.0 720p | 1,224 (#3) ±6 | 1,198 (#1) ±7 | $9.07 |
| Kling 3.0 1080p (Pro) | 1,111 (#7) ±6 | không nằm trong top 10 | $20.16 |
| Veo 3.1 | 1,093 (#11) ±7 | 1,085 (#10) ±7 | $24.00 |
| Veo 3.1 Fast | 1,091 (#14) ±6 | không nằm trong top 10 | $9.00 |
| Veo 3.1 Lite | 1,089 (#15) ±7 | không nằm trong top 10 | $4.80 |
Số liệu Elo và giá từ Artificial Analysis Video Arena (Artificial Analysis, tháng 8 năm 2026). Đây là các phiếu bầu cộng đồng đang diễn ra và chúng thay đổi. Cột $/phút là ước tính mô hình được chuẩn hóa, không phải hóa đơn của bạn.
Khoảng cách Elo 145 điểm là lớn, nhưng đó là phiếu bầu đa năng, không phải phiếu bầu dành riêng cho anime. Và đây là phần tôi phải nói thẳng: MiniMax không tiếp thị H3 như một mô hình anime. Phản hồi nội bộ tuyến đầu liệt kê phim, hoạt hình và chính kịch truyện tranh là những lĩnh vực mà H3 không nhắm tới. Vì vậy, câu hỏi thú vị không phải là "cái nào là mô hình anime". Đó là lý do tại sao mô hình không bán mình là anime vẫn thắng trong cảnh quay, và nơi Google vẫn giành chiến thắng ở vòng đấu.
Một lưu ý thực tế trước khi hướng dẫn. Mọi mô hình bên dưới đều chạy thông qua cùng một bảng điều khiển và cùng một API key, đó là lý do duy nhất khiến các tham số có thể so sánh được. Cùng một hàng đợi, cùng một xác thực, một hóa đơn. Nếu bạn thiết lập GPT Image 2 trên một dịch vụ và Veo trên một dịch vụ khác, một nửa sự khác biệt bạn tìm thấy sẽ là do đường ống chứ không phải do mô hình.
Xây Dựng Cảnh Quay: MiniMax H3 vs Veo 3.1, Từng Bước Một
Một ví dụ chạy duy nhất, từ đầu đến cuối. "Last Whistle": một tiền đạo tuổi teen gốc, tóc đỏ, áo số 9 trắng và xanh nước biển, đèn sân vận động, một whip pan vào cú sút, và một title card tiếng Nhật phải đáp xuống trong hai giây cuối và giữ vững.
Không có cầu thủ thực, không có nhân vật chính thức, không có IP anime hiện có. Chỉ phong cách và sự kính trọng. Sẽ giải thích thêm lý do sau.
Bước 1: Thiết kế keyframe anime với GPT Image 2
Keyframe mang theo hướng dẫn nghệ thuật để mô hình video không phải tự sáng tạo ra nó. Lưu ý khoảng trống âm ở một phần ba bên trái: nó có chủ đích. Title card sẽ được viết ở đó bởi mô hình video, và đó là bài kiểm tra độ ổn định của văn bản.
Plain1A single frame from a modern shonen sports anime. Cel-shaded 2D animation, hand-inked 2line art with consistent line weight, flat colour fills, hard-edged graphic shadows, 3absolutely no 3D shading and no photoreal skin. Close-up on an original teenage striker: 4messy dark-red hair, white-and-navy kit with the number 9, sweat and grass streaks across 5one cheek, eyes wide with exhausted determination, mouth open mid-shout. Behind him, 6stadium floodlights blaze into a wall of blurred crowd colour; radial speed lines burst 7from the centre of frame; one blade of grass hangs frozen in the air. Saturated palette, 8deep cyan shadows, warm orange rim light. 16:9 composition, the character framed right of 9centre, clean negative space on the left third. No text anywhere in the image.
Cài đặt: model openai/gpt-image-2/text-to-image, quality high, kích thước 16:9 (2048x1152). Không gì thêm.

GPT Image 2 playground trên Atlas Cloud với prompt keyframe Last Whistle và khung hình anime hoàn chỉnh trong bảng đầu ra
GPT Image 2 trên Atlas Cloud: chất lượng đặt ở high, keyframe hoàn chỉnh ở bên phải.

Keyframe anime cơ sở: một tiền đạo tóc đỏ gốc đang hét giữa đèn sân vận động, tô màu cel với màu phẳng và đường tốc độ
Keyframe mà cả hai mô hình đều nhận được. Màu phẳng, bóng cứng và một phần ba bên trái trống chờ title card.
Bước 2: MiniMax H3 image-to-video, mọi thứ tối đa
Cùng một hình ảnh đầu vào, đầu ra 2K. Tôi giữ H3 ở 8 giây ở đây chỉ để khớp với giới hạn của Veo. Đó không phải là giới hạn của H3 và Bước 4 sẽ tháo giới hạn.
Plain1Cel-shaded 2D anime, hand-inked line weight, flat colour, no 3D shading. Hold on the 2striker's face for one beat, then a violent whip pan follows the ball as he strikes it, 3the pan smearing the frame into streaked sakuga motion trails. One frame of total silence 4at impact. Over the final two seconds, bold white Japanese title lettering reading 5ラストホイッスル punches onto the left third of frame and holds rock-steady, no warping, 6no flicker, no drift. The striker shouts one line in Japanese: 「まだ終わってない!」 7Audio: stadium roar swelling, a single sharp ball-strike impact, a low taiko hit under the 8title card.
Cài đặt: model minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (image-to-video lấy hình dạng khung từ ảnh đầu vào của bạn), image = đầu ra của Bước 1.
Một cảnh báo nếu bạn chuyển sang text-to-video: hãy viết ratio: 16:9 một cách rõ ràng. Mặc định là 1:1 và nó sẽ sẵn sàng đưa cho bạn một cảnh anime vuông.

MiniMax H3 image-to-video playground trên Atlas Cloud với prompt Last Whistle, keyframe đã tải và clip hoàn chỉnh trong bảng đầu ra
MiniMax H3 image-to-video trên Atlas Cloud: keyframe Bước 1 được tải ở bên trái, clip hoàn chỉnh đang phát ở bên phải.
Bước 3: Veo 3.1 image-to-video, âm thanh được bật thủ công
Prompt giống hệt, từng chữ một. Thay đổi một tính từ là nó không còn là so sánh nữa. Điều thay đổi là trường bổ sung mà Veo cung cấp và H3 không có.
negative_prompt, mà đối với anime 2D là điều khiển hữu ích nhất trong danh sách này:
Plain13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur 2soup, warped lettering, gibberish text, extra fingers, subtitle bar
Cài đặt: model google/veo3.1/image-to-video, resolution: 1080p (thay đổi nó, mặc định là 720p), duration: 8 (đây là giới hạn), aspect_ratio: 16:9, generate_audio: true (API mặc định là false, đây là cái bẫy clip im lặng), seed: 20260807, image = cùng đầu ra Bước 1.

Veo 3.1 image-to-video playground trên Atlas Cloud hiển thị generate audio được bật, keyframe anime đã tải và clip hoàn chỉnh trong bảng đầu ra
Veo 3.1 image-to-video trên Atlas Cloud, với Generate Audio được bật và clip hoàn chỉnh ở bên phải.
Bước 4: Chấm điểm trên năm tiêu chí dành riêng cho anime
Không cần tạo gì thêm. Chỉ cần nhìn vào những thứ mà anime thực sự hỏng. Cả hai clip đều được nhúng gần đầu bài viết này, vì vậy bạn có thể tự chấm điểm thay vì tin lời tôi.

Cạnh nhau của khung hình cuối từ cả hai clip, MiniMax H3 bên trái với chữ tiêu đề tiếng Nhật rõ ràng, Veo 3.1 bên phải với các ký tự dọc khó đọc
Khung hình cuối của mỗi clip. Bên trái, H3 đã viết ラストホイッスル, tất cả tám ký tự katakana đúng và rất ổn định. Bên phải, Veo 3.1 đã viết ba ký tự không phải từ được yêu cầu và không tạo thành một từ.
Title card là nơi vòng đấu được quyết định, và nó không hề cân bằng. H3 đã hiển thị chính xác katakana được yêu cầu, sắc nét và ổn định, trên nền một pan mờ của khung thành. Veo 3.1 tạo ra một chồng dọc ba ký tự không phải là từ được yêu cầu cũng không phải là một từ. Trên cùng một khung hình, nó cũng làm nhân vật biến mất khỏi ống kính và để nền trượt về phía một bức ảnh sân vận động bán photoreal, mặc dù photorealistic skin và 3D render nằm trong negative prompt.
Bảng 3: năm tiêu chí quyết định một cảnh anime, từ hai lần chạy này
| Tiêu chí | MiniMax H3 | Veo 3.1 |
|---|---|---|
| Tính liên tục của nhân vật từ keyframe | Giữ nguyên khuôn mặt, tóc và áo đấu trong suốt 8 giây | Vẽ lại nhân vật trong một cảnh rộng mới, đúng mẫu nhưng là một bản vẽ khác |
| Độ dày nét và tô màu cel phẳng | Giữ vững, không trôi về 3D | Giữ vững ở cảnh vừa, trôi về tấm ảnh sân vận động về cuối |
| Title card tiếng Nhật | ラストホイッスル được hiển thị chính xác và giữ vững | Ba ký tự, không phải từ được yêu cầu, không phải một từ |
| Bản âm thanh được gửi | Âm thanh nổi 32 kHz, chính xác như model card đã nêu | Âm thanh nổi 48 kHz, chỉ có vì tôi tự đặt generate_audio |
| Whip pan và sakuga smear | Thực hiện như một pan mờ vào title | Được thay thế bằng một cut cứng đến một bố cục mới |
Hàng cuối cùng là lời chỉ trích công khai lớn nhất về H3 cho đến nay, đó chính xác là lý do tôi viết nó vào cả hai prompt. Trong luồng ComfyUI ngày 0, người dùng fwip phàn nàn rằng ngay cả các demo prompt chính thức cũng bị bỏ qua: "a violent WHIP PAN off the rooftop that SMEARS the floating words away with it, motion-streaked. And the video just didn't do any of that transition at all, it just replaced it with a cut."
Trong lần chạy này, chính Veo đã đổi pan thành cut, và H3 đã làm mờ. Mỗi bên một lần không phải là một phán quyết, và tôi sẽ không khẳng định điều ngược lại. Nhưng điều đó có nghĩa là lời chỉ trích không dành riêng cho H3: whip pan là hướng dẫn kém đáng tin cậy nhất trong toàn bộ bài kiểm tra này ở cả hai bên. Nếu storyboard của bạn phụ thuộc vào một cái, hãy xây dựng storyboard xung quanh nó thay vì xuyên qua nó.
Bước 5: Cảnh OVA retro 4:3 mà Veo 3.1 về cấu trúc không thể xuất ra
Đây không phải là sở thích chất lượng. Đó là một bức tường. Enum aspect_ratio của Veo có hai giá trị và không có giá trị nào là 4:3, và enum duration của nó không có 12. Vẻ ngoài OVA thập niên 90 đơn giản là không thể tiếp cận được.
Plain1A 1990s OVA anime cut, 4:3 full-frame. Hand-painted background art with visible brush 2texture, cel-paint characters with thick uneven ink lines, heavy halation glow around the 3floodlights, 16mm film grain and faint gate weave. The same red-haired striker in a 4white-and-navy number 9 kit walks off a rain-soaked pitch as the crowd noise fades to a 5single ringing tone. Camera pushes in slowly on his face. He says quietly in Japanese: 6「次は、勝つ」. Retro palette: muted teal, dusty amber, deep maroon shadows. Audio: 7distant rain, a lone analogue synth pad, one reverb-heavy whistle in the far distance.
Cài đặt: model minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Hãy đặt tỷ lệ đó bằng tay, nhớ mặc định.

MiniMax H3 text-to-video playground trên Atlas Cloud với prompt OVA đã nhập và clip retro hoàn chỉnh trong bảng đầu ra
MiniMax H3 text-to-video trên Atlas Cloud, prompt OVA đã nhập, clip hoàn thành. Xin tiết lộ đầy đủ: lần chạy cụ thể này đã để Aspect Ratio ở 16:9 và Duration ở 8, vì vậy những gì bạn thấy ở bên phải là phiên bản ngắn màn hình rộng. Cảnh 4:3 dài mười hai giây bên dưới đến từ lệnh gọi API với ratio: 4:3 và duration: 12 được đặt rõ ràng.

Cảnh OVA retro 4:3: cùng một tiền đạo bước ra khỏi sân đẫm mưa theo phong cách anime thập niên 90
H3 text-to-video, 4:3, 12 giây. Tệp được gửi về có kích thước 1920x1440, chính xác là 4:3 đến từng pixel, với bản âm thanh nổi 32 kHz. Được hiển thị ở đây dưới dạng GIF im lặng với tốc độ khung hình giảm để giữ cho trang nhẹ. Được tạo bằng minimax/h3/text-to-video trên Atlas Cloud.
Bước 6: Chín ảnh tham chiếu, một nhân vật, bốn cảnh quay
Tính nhất quán của nhân vật xuyên suốt các cảnh quay là vấn đề khó khăn nhất trong anime AI, và nó được giải quyết bằng khối lượng tham chiếu. Xây dựng gói trước: chạy lại prompt Bước 1 với các khung hình được thay đổi cho mặt trước, ba phần tư, toàn bộ hồ sơ, mặt sau, cười, nghiến răng, toàn thân, chi tiết áo đấu và chi tiết giày. Chín ảnh, tổng cộng khoảng tám xu.

Bốn góc của cùng một nhân vật tiền đạo gốc được tạo dưới dạng gói tham chiếu, được sắp xếp trong lưới hai x hai
Bốn trong số chín góc tham chiếu. H3 chấp nhận tối đa chín ảnh trong một gói tham chiếu, cộng với tham chiếu video và âm thanh.
Plain1Cel-shaded 2D anime, consistent hand-inked line weight, flat colour, no 3D shading. Keep 2the referenced striker's face, hair silhouette and number 9 kit identical across every cut. 3Four cuts in one continuous take: (1) low-angle push-in on his boots hitting the turf, 4(2) whip-pan up to a tight close-up of his eyes, (3) wide shot of him sprinting past three 5defenders drawn as blurred silhouettes, (4) freeze on a mid-air header, speed lines 6exploding outward. Audio: crowd roar, breath, boot-on-turf impacts, one taiko hit on the 7freeze.
Cài đặt: model minimax/h3/reference-to-video, refers = ảnh của bạn với type: image, resolution: 2K, duration: 8 hoặc cao hơn, ratio: adaptive hoặc 16:9.
Tương đương với Veo 3.1 không thể chạy ở các cài đặt này và bạn không cần thử để biết lý do. Endpoint tham chiếu của nó chấp nhận tối đa ba ảnh và việc chọn endpoint đó sẽ thu gọn duration xuống chỉ còn một giá trị hợp lệ là 8. Một gói chín ảnh và một cảnh quay 10 giây đều nằm ngoài phạm vi.

MiniMax H3 reference-to-video playground trên Atlas Cloud hiển thị bộ đếm tham chiếu ở bốn trên chín và cảnh quay đầu tiên trong bảng đầu ra
MiniMax H3 reference-to-video trên Atlas Cloud. Bộ đếm hiển thị Reference Materials (4/9) với MAX:9 bên dưới, đây là giới hạn trong giao diện chứ không phải tuyên bố từ bảng thông số kỹ thuật. Đầu ra là cảnh quay đầu tiên, push-in góc thấp vào đôi giày.
Bốn Lần Chạy MiniMax H3 Anime Video Generator Khác Đáng Để Thử
Cảnh quay Last Whistle chỉ kiểm tra bốn điểm khác biệt. Bốn cảnh này kiểm tra phần còn lại. Tất cả đều chạy trên H3; các ghi chú cho biết những cảnh nào Veo 3.1 có thể sánh được.
- Trận đấu sakuga siêu rộng,
21:9, 10 giây. Veo hoàn toàn không thể xuất 21:9.
Plain1Cel-shaded 2D anime action, thick tapered ink lines, flat colour, hard-edged shadows, 2no 3D shading. Two original masked duelists on a windswept temple roof at dusk. Blade 3clash, the frame shudders, both fighters break apart in a burst of hand-drawn impact 4frames and radial speed lines. Camera: low-angle push-in, then a lateral track, then a 5snap to a wide silhouette against the orange sky. Audio: two sharp metal clashes, cloth 6snap, a low taiko hit on the final freeze, no music.
- Cảnh AMV khớp nhịp, reference-to-video với tham chiếu âm thanh. H3 nhận tối đa ba clip âm thanh làm đầu vào tham chiếu. Veo 3.1 không có đầu vào âm thanh nào cả, chỉ có đầu ra âm thanh.
Plain1Cel-shaded 2D anime montage cut to the referenced audio track. Five short beats: rain on 2a window, a hand tightening a bandage, a city skyline flashing past a train window, a 3sprint start, a freeze on an outstretched hand. Every cut lands exactly on a downbeat of 4the referenced audio. Flat colour, thick ink lines, high-contrast night palette of deep 5indigo and neon magenta.
- Cảnh hội thoại tiếng Nhật hai dòng, 12 giây. Đây là bài kiểm tra căng thẳng về khớp môi và 12 giây đã nằm ngoài phạm vi của Veo.
Plain1Cel-shaded 2D anime, flat colour, no 3D shading. Two original characters on a rooftop at 2golden hour, shot reverse shot. First says in Japanese:「本当に行くの?」. The second 3answers, half-smiling, in Japanese:「もう決めた」. Mouths match every syllable. Warm rim 4light, long shadows, gentle wind in hair. Audio: two distinct Japanese voices, distant 5traffic, one cicada.
- Short shonen dọc,
9:16, 8 giây. Cả hai mô hình đều có thể làm dọc, vì vậy đây là nơi duy nhất để thực sự A/B chúng thay vì giả định.
Plain1Cel-shaded 2D anime, vertical composition. An original teenage runner bursts through a 2paper banner in slow-motion, then the frame snaps back to full speed as she accelerates 3down a stadium straight. Speed lines, flat colour, hard shadows, bold graphic sky. 4Camera: low-angle follow shot, then a whip up to her face. Audio: banner tear, crowd 5surge, one breath held then released.
Nếu bạn muốn ngữ pháp prompt đằng sau những điều này, hướng dẫn prompt MiniMax H3 sẽ đi sâu hơn về cách H3 phân tích cú pháp các hướng dẫn về máy ảnh và âm thanh hơn tôi có thể ở đây.
Chi Phí Cho Một Đoạn Mở Đầu Anime 60 Giây Trên MiniMax H3 vs Veo 3.1
Một OP anime tiêu chuẩn dài khoảng 90 giây. Tạm gọi là tám cảnh quay 8 giây, 64 giây video hoàn chỉnh, cộng với một keyframe cho mỗi cảnh quay với giá $0,009 mỗi cái.
Có một sự khác biệt về giá thực tế mà bạn nên biết thay vì để tôi che đậy. Danh mục Atlas Cloud liệt kê MiniMax H3 ở mức $0,10 mỗi giây cố định, trong khi readme của mô hình phân tích nó thành $0,14/s ở 2K và $0,10/s ở 768P. Veo 3.1 được liệt kê ở mức $0,20 mỗi giây, trong khi readme của nó tách biệt $0,40/s có âm thanh và $0,20/s không có.
Các nút chạy trong ảnh chụp màn hình của tôi giải quyết vấn đề này. H3 reference-to-video, 8 giây ở 2K, báo giá Run $1,12, chính xác là $0,14 mỗi giây. Veo 3.1 image-to-video, 8 giây ở 1080p với âm thanh bật, báo giá Run $3,2, chính xác là $0,40 mỗi giây. Vì vậy, tỷ lệ readme là tỷ lệ được tính phí, và tiêu đề danh mục là bậc đầu vào. Dù sao tôi cũng đã hiển thị cả hai số liệu dưới đây. Đây là giá niêm yết tính đến tháng 8 năm 2026.
Bảng 4: tám cảnh quay 8 giây, bao gồm keyframe
| Thiết lập | Chi phí video (tỷ lệ danh mục) | Chi phí video (tỷ lệ readme) | Keyframe | Tổng phạm vi |
|---|---|---|---|---|
| MiniMax H3, 2K | $6,40 | $8,96 | $0,07 | $6,47 đến $9,03 |
| MiniMax H3, 768P | $6,40 | $6,40 | $0,07 | $6,47 |
| Veo 3.1, 1080p có âm thanh | $12,80 | $25,60 | $0,07 | $12,87 đến $25,67 |
| Veo 3.1 Lite, 720p | $3,20 | $3,20 | $0,07 | $3,27 |
Giá được lấy từ các trang mô hình Atlas Cloud được liên kết trong Bảng 1, tháng 8 năm 2026. Không có mô hình nào trong số bốn mô hình này đang được giảm giá ngay bây giờ.
Hai điều mà bảng đó không bao gồm, và cả hai đều ảnh hưởng nặng nề hơn tỷ lệ mỗi giây.
Chạy lại. Không ai xuất bản lần chạy đầu tiên của một cảnh anime. Bất kể số nhân bạn giả định, hãy áp dụng nó cho cả hai cột và khoảng cách sẽ mở rộng theo cùng một tỷ lệ.
Thời gian thực tế, và điều này đi theo hướng ngược lại. Được tính từ đầu đến cuối vào ngày 7 tháng 8 năm 2026: H3 ở 2K trong 8 giây mất 447 giây, khoảng 7,5 phút. H3 text-to-video ở 2K trong 12 giây mất 334 giây. Veo 3.1 ở 1080p trong 8 giây có âm thanh mất 152 giây, dưới ba phút. Veo nhanh hơn khoảng ba lần để có lần chạy đầu tiên ở đây và nếu bạn đang lặp lại một cảnh quay lúc 2 giờ sáng, điều đó có giá trị thực tế. Hàng đợi thay đổi, vì vậy hãy coi những điều này như một ảnh chụp nhanh của một buổi chiều chứ không phải thông số kỹ thuật. Nhưng bất kỳ ai trích dẫn "2 đến 3 phút" cho H3 ở 2K là đang trích dẫn một readme, không phải một hàng đợi. Phân tích 2K so với 768P đề cập đến khi nào bậc cao hơn đáng giá thêm vài phút.
Phong Cách Anime, Sự Kính Trọng và Những Gì Bạn Thực Sự Có Thể Xuất Bản
Mọi thứ trong bài viết này đều là phong cách và sự kính trọng. Một nhân vật gốc, một bộ áo đấu gốc, một tiêu đề gốc. Không có nhân vật anime chính thức nào được tạo hoặc yêu cầu, và không có tên hoặc hình ảnh của cầu thủ bóng đá thực nào được sử dụng. Xu hướng World Cup được tham chiếu như một định dạng, bởi vì đó là những gì nó hữu ích.
Sự khác biệt đó không phải là trang trí. Nếu bạn đang sản xuất nội dung theo phong cách anime vì mục đích thương mại, "theo phong cách OVA thập niên 90" và "nhân vật cụ thể này từ chương trình cụ thể này" là những đối tượng pháp lý khác nhau và chỉ một trong số chúng là một công việc kinh doanh.
Về trọng số mở: H3 thực sự có thể tải xuống được và mọi người đã chạy nó vào ngày đầu tiên. Một người bình luận báo cáo mất 10 phút cho một clip 480p dài 10 giây trên 4070 Ti Super với 16GB, và những người khác đăng 3 phút trên 5080 và 68 giây trên RTX 6000 Pro. Nhưng tự lưu trữ chạy ở cạnh ngắn 768; các giai đoạn Context-IR và Regenerate-2K tạo ra 2K vẫn ở phía API.
Giấy phép có một điểm hạn chế thực tế. Giấy phép cộng đồng hiện không bao gồm EU, Vương quốc Anh, Hàn Quốc hoặc Hoa Kỳ, với lý do các khu vực "hiện đang phát triển hoặc thực thi các quy định liên quan đến AI". Một kênh yêu cầu cấp phép chính thức đang mở, mà một người bình luận HN đã tóm tắt là "bạn chỉ cần hứa danh dự rằng bạn sẽ không làm disney tức giận và họ sẽ gửi cho bạn giấy phép". Hài hước, và cũng chính xác là bước tuân thủ mà bạn không thể bỏ qua nếu bạn ở một trong bốn lãnh thổ đó. Bài viết về trọng số mở có danh sách lãnh thổ đầy đủ.
Câu Hỏi Thường Gặp
MiniMax H3 có phải là một công cụ tạo video anime tốt so với Veo 3.1 không?
Đối với hầu hết các công việc anime, H3, và chủ yếu vì những lý do không liên quan đến kết xuất. Nó chạy từ 4 đến 15 giây so với 4, 6 hoặc 8 của Veo, nó cung cấp sáu tỷ lệ khung hình bao gồm 4:3 và 21:9 so với hai của Veo, nó liệt kê tiếng Nhật trong số 11 ngôn ngữ hội thoại ổn định gốc và nó nhận chín ảnh tham chiếu so với ba của Veo. Veo 3.1 thắng trong một tình huống cụ thể: khi bạn cần seed cho các lần chụp lại có thể tái tạo, hoặc negative_prompt để ngăn cảnh quay trôi về bóng đổ kết xuất 3D. H3 không có tham số nào. Nếu đường ống của bạn phụ thuộc vào một trong hai, đó là một lý do chính đáng để ở lại.
Veo 3.1 có thể tạo anime ở định dạng 4:3 hoặc clip 15 giây không?
Không, và không phải vì lý do phong cách. Enum aspect_ratio của Veo 3.1 chứa chính xác 16:9 và 9:16, và enum duration của nó chứa chính xác 4, 6 và 8. Không có giá trị 4:3 để chọn và không có cách nào để yêu cầu 12 hoặc 15 giây. Nếu tham chiếu của bạn là một anime TV hoặc OVA thập niên 90, khung hình nằm ngoài tầm với trên Veo và có sẵn trên H3.
Tại sao clip anime Veo 3.1 của tôi lại im lặng?
Bởi vì generate_audio mặc định là false trên API. Công tắc trong playground thường đã được bật, vì vậy điều này chỉ ảnh hưởng đến những người gọi API trực tiếp. Hãy đặt generate_audio: true một cách rõ ràng. Trong khi bạn ở đó, hãy đặt resolution nữa, vì nó mặc định là 720p thay vì 1080p hoặc 4k mà bạn có thể đã định.
MiniMax H3 có xử lý hội thoại tiếng Nhật và khớp môi cho anime không?
Có. Model card liệt kê 11 ngôn ngữ hỗ trợ hội thoại ổn định: tiếng Ả Rập, tiếng Trung, tiếng Anh, tiếng Pháp, tiếng Đức, tiếng Ý, tiếng Nhật, tiếng Hàn, tiếng Bồ Đào Nha, tiếng Nga và tiếng Tây Ban Nha. Âm thanh được tạo đồng thời với hình ảnh ở âm thanh nổi 32 kHz thay vì lồng tiếng sau, đó là lý do tại sao thời gian môi giữ được toàn bộ dòng thay vì chỉ một vài âm tiết đầu tiên. Hãy viết dòng tiếng Nhật trực tiếp vào prompt bằng tiếng Nhật.
Tôi có thể sử dụng bao nhiêu ảnh tham chiếu để giữ cho một nhân vật anime nhất quán?
MiniMax H3 chấp nhận tối đa 9 ảnh, tối đa 3 video và tối đa 3 clip âm thanh, với giới hạn cứng là 12 tệp trên tất cả các loại. Endpoint reference-to-video của Veo 3.1 chấp nhận 1 đến 3 ảnh và việc chọn nó sẽ thu gọn duration xuống chỉ còn 8 là giá trị hợp lệ duy nhất. Đối với một nhân vật anime định kỳ trong một loạt, sự khác biệt đó là toàn bộ trò chơi.
MiniMax H3 có trọng số mở, vậy tôi có thể chạy đường ống anime của mình cục bộ miễn phí không?
Bạn có thể tải xuống và chạy nó, với ba lưu ý. Suy luận tự lưu trữ chạy ở cạnh ngắn 768 và các giai đoạn Context-IR và Regenerate-2K tạo ra đầu ra 2K vẫn ở phía API. Tốc độ cục bộ thực tế rất khác nhau tùy theo card: khoảng 10 phút cho một clip 480p dài 10 giây trên 4070 Ti Super, khoảng 3 phút trên 5080, khoảng 68 giây trên RTX 6000 Pro, theo luồng ComfyUI ngày 0. Và giấy phép cộng đồng hiện không bao gồm EU, Vương quốc Anh, Hàn Quốc hoặc Hoa Kỳ, vì vậy nếu bạn ở một trong những khu vực đó, bạn cần giấy phép chính thức trước khi sử dụng thương mại.






