Hero background 1Hero background 2Hero background 3

Gemini Omni 1.1 Flash Multimodal Video

Gemini Omni 1.1 Flash là dòng mô hình video đa phương thức nguyên bản của Google DeepMind, phục vụ các quy trình sản xuất linh hoạt. Chỉnh sửa cảnh quay hiện có bằng hướng dẫn văn bản, duy trì tính nhất quán hình ảnh với tối đa 10 ảnh tham chiếu và 3 đoạn video, hoặc kéo dài một cảnh thành các phân đoạn có thể nối tiếp, tối đa 40 giây. Truy cập mọi quy trình trên Atlas Cloud với một API key tương thích với OpenAI, mức giá trả theo mức sử dụng và khả dụng ngay từ ngày đầu tiên. Bắt đầu xây dựng ngay hôm nay.

Gemini Omni 1.1 Flash do Google phát triển. Atlas Cloud (vận hành bởi Atlas Cloud AI LLC) cung cấp quyền truy cập vào mô hình này và không sở hữu mô hình. Mọi thương hiệu đều thuộc về chủ sở hữu tương ứng.

Khám phá Mô hình Hàng đầu

Atlas Cloud cung cấp cho bạn các mô hình sáng tạo tiên tiến nhất trong ngành.

So sánh các chế độ video của Gemini Omni 1.1 Flash

So sánh năm endpoint Gemini Omni 1.1 Flash theo quy trình nhập, khả năng đầu ra và trường hợp sử dụng trong sản xuất.

Phương thứcMô tả
Gemini Omni 1.1 Flash Video Extend APITiếp tục một clip hiện có bằng phần mở rộng khớp liền mạch, kéo dài từ 3 đến 10 giây và giữ nguyên âm thanh gốc. Nối nhiều phần mở rộng để tạo một cảnh quay video nhất quán với tổng thời lượng lên đến 40 giây.
Gemini Omni 1.1 Flash Video Edit APICần chỉnh sửa cảnh quay hiện có mà không phải dựng lại toàn bộ bối cảnh? Sử dụng hướng dẫn bằng văn bản để thêm, xóa, thay thế hoặc thay đổi phong cách các thành phần video với âm thanh gốc, đồng thời bảo toàn những nội dung không được đề cập trong prompt.
Gemini Omni 1.1 Flash Reference-to-Video APICung cấp prompt văn bản cùng tối đa 10 ảnh tham chiếu và 3 clip video tham chiếu để tạo video điện ảnh với âm thanh gốc. Endpoint này phù hợp với các dự án yêu cầu nhân vật, sản phẩm hoặc định hướng nghệ thuật nhất quán giữa các lần tạo.
Gemini Omni 1.1 Flash Image-to-Video APIBiến một ảnh tĩnh thành clip điện ảnh có âm thanh theo hướng dẫn của prompt văn bản. Một khung hình cuối tùy chọn cho phép kiểm soát chính xác điểm bắt đầu và kết thúc của cảnh quay được tạo.
Gemini Omni 1.1 Flash Text-to-Video APIBắt đầu từ một prompt văn bản, endpoint này tạo video điện ảnh với âm thanh gốc được đồng bộ. Điều chỉnh thời lượng, tỷ lệ khung hình và độ phân giải đầu ra, từ bản nháp 360p nhanh đến kết quả 4K.

Bộ công cụ video Gemini Omni 1.1 Flash

Gemini Omni 1.1 Flash kết hợp khả năng tạo video, âm thanh gốc, duy trì tính nhất quán dựa trên hình ảnh tham chiếu, kiểm soát khung hình chính xác, chỉnh sửa bằng câu lệnh và mở rộng theo chuỗi trong một quy trình linh hoạt trên Atlas Cloud.

Âm thanh gốc cho mọi câu lệnh

Bắt đầu bằng một câu lệnh văn bản và tạo một đoạn phim mang phong cách điện ảnh với âm thanh gốc đồng bộ. Gemini Omni 1.1 Flash cho phép bạn kiểm soát thời lượng, tỷ lệ khung hình và độ phân giải đầu ra, từ bản nháp 360p đến 4K. Mô tả chuyển động, hướng máy quay, lời thoại, âm nhạc và không gian âm thanh trong một yêu cầu duy nhất. Quy trình này phù hợp với trailer, video mạng xã hội và các nhịp truyện cần được phát triển đồng thời cả hình ảnh lẫn âm thanh.

Mở rộng cảnh bằng Gemini Omni 1.1 Flash

Tiếp tục một đoạn video hiện có bằng một phân đoạn dài từ 3 đến 10 giây được ghép nối liền mạch, sau đó liên kết nhiều lần mở rộng để đạt tối đa 40 giây. Mô hình duy trì ngữ cảnh hình ảnh và âm thanh gốc, giúp hành động mới hòa vào cùng một cảnh quay. Tạo các màn hé lộ dài hơn, cảnh rượt đuổi hoặc câu chuyện sản phẩm mà không phải khởi động lại chuỗi mỗi khi mạch truyện cần thêm không gian.

Duy trì tính nhất quán hình ảnh với nội dung tham chiếu

Cung cấp một câu lệnh văn bản cùng tối đa 10 hình ảnh tham chiếu và 3 đoạn video tham chiếu để định hướng một lần tạo nội dung nhất quán với âm thanh gốc. Hình ảnh có thể làm điểm neo cho nhân vật, sản phẩm, địa điểm hoặc định hướng nghệ thuật, trong khi video tham chiếu định hướng chuyển động và cách xử lý cảnh quay. Sử dụng phương thức này khi nhận diện và ngôn ngữ hình ảnh nhất quán giữa các tài sản của chiến dịch, các cảnh theo tập hoặc nội dung thương hiệu là yếu tố quan trọng.

Kiểm soát khung hình đầu và cuối

Xác định hình ảnh mở đầu, sau đó tùy chọn cung cấp khung hình cuối để kiểm soát điểm kết thúc của cảnh quay. Gemini Omni 1.1 Flash biến ảnh tĩnh thành một đoạn phim mang phong cách điện ảnh với âm thanh gốc và nội suy chuyển động hướng đến điểm kết thúc được cung cấp. Cấu trúc bắt đầu và kết thúc này phù hợp với màn giới thiệu sản phẩm, chuyển cảnh liền mạch, match cut và các chuyển động máy quay được lên kế hoạch, cần kết thúc ở một bố cục chính xác.

Chỉnh sửa mà không cần dựng lại cảnh quay

Thay đổi một video hiện có bằng câu lệnh văn bản trực tiếp mà vẫn giữ nguyên mọi nội dung không được đề cập trong câu lệnh. Thêm, xóa, thay thế hoặc thay đổi phong cách của các thành phần, đồng thời giữ lại âm thanh gốc trong kết quả chỉnh sửa. Khi một bản quay tốt chỉ cần bổ sung đối tượng, môi trường hoặc cách xử lý hình ảnh mới, quy trình tập trung này bảo toàn phần việc còn lại và tránh phải dựng lại cảnh từ đầu.

Gemini Omni 1.1 Flash trên một API

Chuyển đổi giữa các tác vụ văn bản sang video, hình ảnh sang video, tạo nội dung từ tham chiếu, chỉnh sửa và mở rộng thông qua Atlas Cloud với một API key duy nhất. Cơ chế thanh toán theo mức sử dụng minh bạch giúp việc thử nghiệm tách biệt khỏi các gói đăng ký hoặc cam kết tối thiểu. Nhà phát triển có thể dựng bản nháp ở 360p và yêu cầu đầu ra lên đến 4K khi cần độ chi tiết cuối cùng. Lộ trình hợp nhất này giúp dễ dàng bổ sung toàn bộ dòng mô hình vào quy trình sản xuất.

Cuộc đối đầu video với một prompt duy nhất: Gemini Omni 1.1 Flash

Xem Gemini Omni 1.1 Flash, Seedance 2.5 và Gemini Omni Flash phiên bản trước diễn giải cùng hai prompt điện ảnh như thế nào.

Prompt

Một phim viễn tưởng siêu ngắn dài 8–10 giây, lấy bối cảnh bên trong xưởng thổi thủy tinh thủ công ám khói: bắt đầu bằng cú đẩy macro cực cận vào một khối thủy tinh nóng chảy đỏ rực đang quay nhanh ở đầu ống thổi, bề mặt nhớt liên tục gấp nếp, phát sáng và khúc xạ ánh lửa lò khi một nghệ nhân bằng đất sét không ngừng xoay ống; máy quay bay sát quanh cẳng tay đang chuyển động của nghệ nhân trong khi kìm kim loại gõ theo nhịp và kẹp khối thủy tinh nóng chảy—không cắt cảnh, khối vật chất rực sáng kéo dài, nguội dần và liền mạch biến thành một chú chim ruồi thủy tinh trong suốt với trái tim rực lửa. Whip-pan vào một cảnh tracking tốc độ cao khi chim ruồi vỗ đôi cánh kết tinh, lao qua những lọ bột màu đang mở và cuốn các dải bột xanh lam màu đuôi công cùng màu magenta hỗn loạn lên không trung; mỗi nhịp cánh làm các hạt bụi va chạm, xoáy tròn và lấp lánh xuyên qua bóng dáng khúc xạ của nó. Chim nghiêng gấp về phía một bong bóng thủy tinh lơ lửng và mổ trúng nó đúng vào tiếng nhạc cuối cùng; cắt sang góc nhìn từ trên xuống đầy kịch tính khi bong bóng vỡ tung ra ngoài, những mảnh vỡ mỏng như dao liên tục biến hình thành các cánh hoa mềm, bán trong suốt xoắn ốc khắp xưởng. Stop-motion đất sét tinh tế kết hợp với chất liệu thủy tinh nghệ thuật phát sáng, bán trong suốt; các khiếm khuyết thủ công giàu tính xúc giác, phản chiếu và khúc xạ thuyết phục, ảnh hưởng caustic, hiệu ứng rung nhiệt, biến dạng thủy tinh và vật lý hạt chân thực; ánh sáng lò màu cam-đỏ là nguồn sáng chính, ánh trăng viền màu cyan lạnh, bảng màu đen-vàng sâu ở phần mở đầu bùng nổ thành xanh lam đuôi công và magenta bão hòa ở cao trào. Chuyển động máy quay nhanh, mượt và liền mạch, tính nhất quán cao theo thời gian và giữa các nhân vật, không có khoảng dừng hay đoạn slow-motion chèn vào. Âm thanh: tiếng lò gầm vang, tiếng thủy tinh xoay ngân đều, tiếng kim loại gõ nhịp đồng bộ với từng lần kẹp và từng nhịp cánh, tiếng bột màu xào xạc lao đi, tiếng ngân pha lê sắc gọn khi va chạm và màn kết thúc tươi sáng với dòng âm thanh thủy tinh chuyển thành cánh hoa; không màn hình, giao diện, dashboard, thanh tiến trình, biểu đồ, phụ đề, logo hay văn bản. Tỷ lệ khung hình 16:9.

Generated with Gemini Omni 1.1 Flash Text-to-Video on Atlas Cloud

Generated with Seedance 2.5 Text-to-Video on Atlas Cloud

Generated with Gemini Omni Flash Text-to-Video on Atlas Cloud

Prompt

Một phân cảnh phim tài liệu macro về thiên nhiên siêu chân thực dài 8–10 giây bên trong hang hồ thủy triều đầy đá khi thủy triều xuống: một chú bạch tuộc dừa màu cam san hô rực rỡ ứng biến chơi bộ gõ, cả tám xúc tu nhất quán về mặt giải phẫu chuyển động độc lập nhưng tự nhiên khi các giác hút gõ vào vỏ sò ánh ngọc trai, vỏ nhím biển rỗng và thủy tinh biển nhẵn trong một nhịp điệu ngày càng dày; thể hiện chính xác biến dạng, tiếp xúc, độ nảy và trọng lượng của vật thể. Bắt đầu bằng cảnh tracking macro ngang theo đường mặt nước, lướt bên cạnh chú bạch tuộc khi những giọt nước lấp lánh trên làn da có kết cấu và mỗi cú va chạm tạo ra những gợn sóng nhỏ trong làn nước biển cyan lạnh; cắt sang góc máy cực thấp nhanh chóng luồn giữa các xúc tu và nhạc cụ đang chuyển động, vẫn duy trì sự liên tục rõ ràng của các chi và hiệu ứng che khuất chân thực. Một chú cua ẩn sĩ bất ngờ bò vào, chộp lấy chiếc vỏ dẫn nhịp rồi bỏ chạy; whip-pan vào màn rượt đuổi nhanh và tinh nghịch khi bạch tuộc bật lên rồi trườn qua lớp đá trơn gồ ghề, các xúc tu bám, nhả và đẩy với ma sát thuyết phục trong khi chân cua lách cách trên những viên sỏi. Ngay trước khi một đợt sóng tràn vào nhấn chìm hang, bạch tuộc chộp lại chiếc vỏ, đặt chắc xuống và giáng một cú đánh cuối đầy dứt khoát; nhanh chóng nâng máy quay lên cảnh toàn từ trên xuống khi sóng bùng quanh chú bạch tuộc và bọt nước tỏa ra tạo thành bố cục gần như hình tròn hoàn hảo. Caustic dưới nước chuyển động từ ánh nắng bị vỡ, làn nước xanh teal lạnh tương phản với chủ thể cam san hô, tia nước kết tinh, bong bóng, cát lơ lửng, phản chiếu trên đá ướt, độ sâu trường ảnh macro nông, HDR điện ảnh, kết cấu tự nhiên sắc nét như dao cạo, chuyển động liên tục mượt mà, chuyển cảnh máy quay tốc độ cao không dùng slow-motion. Chỉ âm thanh diegetic, đồng bộ hoàn hảo: tiếng vỏ sò gõ rõ ràng, tiếng vỏ nhím biển rỗng va đập, tiếng thủy tinh lanh canh sáng, tiếng giác hút nhả ra, tiếng càng và chân cua ẩn sĩ cào trên đá, tiếng sóng dâng, rồi cú đánh cuối và tiếng sóng vỗ ập xuống khớp chính xác với nhịp điệu; không nhạc, không thuyết minh, không văn bản, không phụ đề, không logo, không giao diện, không dashboard, không biểu đồ, không thanh tiến trình, không chia đôi màn hình, không thêm xúc tu, không xúc tu dính liền hoặc trùng lặp, không giải phẫu méo mó, không vật thể lơ lửng, không xuyên vật thể hay lỗi vật lý tiếp xúc, không chuyển động cao su, không nhấp nháy theo thời gian, không jump cut, không vị trí vỏ sò thiếu nhất quán, không phong cách hoạt hình. Phim tài liệu macro động vật hoang dã điện ảnh siêu chân thực, tỷ lệ khung hình 16:9.

Generated with Gemini Omni 1.1 Flash Text-to-Video on Atlas Cloud

Generated with Seedance 2.5 Text-to-Video on Atlas Cloud

Generated with Gemini Omni Flash Text-to-Video on Atlas Cloud

Từ bản tóm tắt đến các cảnh hoàn chỉnh với Gemini Omni 1.1 Flash

Gemini Omni 1.1 Flash biến bản tóm tắt, ảnh tĩnh, phương tiện tham chiếu và clip hiện có thành video chiến dịch, câu chuyện nhân vật nhất quán, hiệu ứng chuyển cảnh có kiểm soát, cảnh mở rộng và nội dung mạng xã hội sẵn sàng sản xuất với âm thanh gốc.

Mở rộng câu chuyện bằng Gemini Omni 1.1 Flash

Các clip hiện có được nối tiếp liền mạch thêm từ ba đến mười giây, và chuỗi mở rộng có thể đạt tới bốn mươi giây. Nhà làm phim và đội ngũ nội dung dài kỳ có thể phát triển các cú máy đơn nhất quán mà không phải dựng lại từng cảnh.

Chỉnh sửa chiến dịch chính xác

Cần thay đổi sản phẩm, bối cảnh hoặc phong cách hình ảnh? Áp dụng chỉnh sửa bằng hướng dẫn văn bản trong khi giữ nguyên các thành phần không được đề cập, giúp đội ngũ marketing tạo các biến thể có mục tiêu mà không phải dựng lại clip nguồn từ đầu mỗi lần.

Thế giới thương hiệu với Gemini Omni 1.1 Flash

Với tối đa mười ảnh tham chiếu và ba clip video, mô hình có thể duy trì nhất quán nhân vật, sản phẩm hoặc định hướng nghệ thuật qua nhiều lần tạo. Các studio thương hiệu có được những cảnh ra mắt liên kết với bản sắc hình ảnh nhất quán hơn.

Chuyển cảnh giữa các keyframe có kiểm soát

Bắt đầu từ một ảnh tĩnh và tùy chọn cung cấp frame cuối, cho phép mô hình tạo chuyển động điện ảnh giữa hai bố cục. Nhà thiết kế có được quyền kiểm soát chính xác phần mở đầu và kết thúc cho các cảnh hé lộ, vòng lặp và chuyển cảnh.

Sản xuất video mạng xã hội bằng prompt

Một bản tóm tắt văn bản duy nhất trở thành clip điện ảnh với âm thanh gốc được đồng bộ, trong khi thời lượng, tỷ lệ khung hình và độ phân giải đầu ra vẫn có thể lựa chọn. Nhà sáng tạo có thể định hình quảng cáo và câu chuyện mạng xã hội cho nhiều định dạng xuất bản khác nhau.

Tiền kỳ trực quan với Gemini Omni 1.1 Flash

Khi thử nghiệm một cảnh quay, hãy tạo nguyên mẫu ở 360p, so sánh các hướng triển vọng và nâng những ý tưởng được chọn lên đầu ra 4K. Đạo diễn và nhà phát triển sáng tạo có thể kiểm chứng chuyển động, khuôn hình, âm thanh và nhịp độ trước khi sản xuất chính thức.

Gemini Omni 1.1 Flash đang ở đâu trong lĩnh vực tạo video

So sánh Gemini Omni 1.1 Flash với các mô hình text-to-video hàng đầu về thời lượng clip, độ phân giải tối đa, hỗ trợ âm thanh gốc và tốc độ khung hình đầu ra.

Mô hìnhThời lượng đầu raĐộ phân giải tối đaÂm thanh gốcTốc độ khung hình
Gemini Omni 1.1 Flash Text-to-Video3–10 giây4K√24 FPS
MiniMax H3 Text-to-Video4–15 giây2K√24 FPS
Wan-3.0 Text-to-video2–30 giây1080P√30 FPS

Cách Sử Dụng Gemini Omni 1.1 Flash trên Atlas Cloud

Bắt đầu trong vài phút — làm theo các bước đơn giản sau để tích hợp và triển khai mô hình qua nền tảng Atlas Cloud.

Tạo Tài Khoản Atlas Cloud

Đăng ký tại atlascloud.ai và hoàn tất xác minh. Người dùng mới nhận được tín dụng miễn phí để khám phá nền tảng và thử nghiệm mô hình.

Tại sao Sử dụng Gemini Omni 1.1 Flash trên Atlas Cloud

Sự kết hợp của các mô hình tiên tiến của Gemini Omni 1.1 Flash với nền tảng được tăng tốc GPU của Atlas Cloud mang lại hiệu suất, khả năng mở rộng và trải nghiệm nhà phát triển độc đáo.

Hiệu suất và Tính linh hoạt

Độ Trễ Thấp:
Suy luận được tối ưu hóa GPU cho suy luận thời gian thực.

API Thống nhất:
Chạy Gemini Omni 1.1 Flash, GPT, Gemini và DeepSeek với một tích hợp duy nhất.

Giá cả Minh bạch:
Thanh toán dựa trên token có thể dự đoán với tùy chọn serverless.

Doanh nghiệp và Mở rộng

Trải nghiệm Nhà phát triển:
SDK, phân tích, công cụ tinh chỉnh và mẫu.

Độ tin cậy:
99,99% khả dụng, RBAC và ghi nhật ký sẵn sàng cho tuân thủ.

Bảo mật và Tuân thủ:
SOC 2 Type II, tuân thủ HIPAA, chủ quyền dữ liệu tại Hoa Kỳ.

Giải đáp câu hỏi về API Gemini Omni 1.1 Flash

Gemini Omni 1.1 Flash là mô hình tạo và chỉnh sửa video đa phương thức gốc do Google DeepMind phát triển. Trên Atlas Cloud, mô hình hỗ trợ năm quy trình chuyên biệt, bao gồm tạo video, sáng tạo có hướng dẫn bằng nội dung tham chiếu, chỉnh sửa và mở rộng video. Video đầu ra có thể bao gồm âm thanh gốc được đồng bộ.

Mô hình có thể tạo video từ văn bản, làm ảnh tĩnh chuyển động, tuân theo nội dung tham chiếu trực quan, chỉnh sửa một đoạn video hiện có dựa trên chỉ dẫn bằng văn bản hoặc tiếp tục một cảnh. Image to Video cũng có thể nội suy hướng đến khung hình cuối được cung cấp để kiểm soát chuyển cảnh.

Tạo khóa API Atlas Cloud và chọn endpoint phù hợp với quy trình của bạn. Gửi prompt cùng mọi hình ảnh, video hoặc nội dung tham chiếu nguồn bắt buộc theo schema tham số của endpoint đó. Hãy bắt đầu bằng một cảnh quay được mô tả rõ ràng, sau đó tinh chỉnh đầu vào sau khi xem xét kết quả.

Chọn Text to Video để tạo video dựa trên prompt và Image to Video khi muốn làm ảnh tĩnh chuyển động. Reference to Video giúp định hướng nhận diện hoặc phong cách nghệ thuật, trong khi Video Edit thay đổi cảnh quay hiện có và Video Extend tiếp tục một cảnh quay đã được thiết lập.

Text to Video cung cấp các tùy chọn về thời lượng, tỷ lệ khung hình và độ phân giải đầu ra từ 360p đến 4K. Image to Video tiếp nhận một hình ảnh bắt đầu và có thể sử dụng khung hình cuối tùy chọn. Reference to Video hỗ trợ tối đa 10 hình ảnh tham chiếu và 3 đoạn video tham chiếu.

Có, cả năm quy trình Atlas Cloud đều được thiết kế để tạo video với âm thanh gốc được đồng bộ. Khi âm thanh quan trọng đối với cảnh quay, hãy mô tả rõ lời thoại, âm thanh môi trường, nhạc hoặc hiệu ứng âm thanh mong muốn trong prompt.

Atlas Cloud cung cấp quyền truy cập với hình thức tính phí theo mức sử dụng. Giá cơ bản tiêu chuẩn là $0.041 cho Text to Video, Reference to Video, Video Edit và Video Extend, trong khi Image to Video có giá cơ bản tiêu chuẩn là $0.043. Đây là mức giá backend tiêu chuẩn, không phải mức giá khuyến mãi tạm thời.

Mỗi lần mở rộng có thể thêm từ 3 đến 10 giây và có thể nối tiếp nhiều lần cho đến khi một cảnh quay liền mạch đạt tổng thời lượng 40 giây. Mô hình sử dụng đoạn video hiện có làm ngữ cảnh, đồng thời tiếp tục cả hình ảnh lẫn âm thanh gốc.

Sử dụng Reference to Video với các nội dung tham chiếu rõ ràng và tương thích, bao gồm tối đa 10 hình ảnh và 3 đoạn video. Khi tạo chuyển động cho hình ảnh, hãy cung cấp một khung hình bắt đầu chất lượng cùng khung hình cuối tùy chọn nếu cần kiểm soát điểm kết thúc. Đầu ra tạo sinh vẫn có thể bị lệch, vì vậy hãy kiểm tra nhận diện, ánh sáng, chuyển động và âm thanh sau mỗi lần tạo hoặc mở rộng.

Google mô tả 1080p và 4K là các tùy chọn đầu ra nâng cấp, thay vì độ phân giải tạo sinh gốc. Hãy sử dụng 360p cho các vòng lặp thử nghiệm, sau đó chọn độ phân giải cao hơn khi bố cục và chuyển động đáp ứng yêu cầu của bạn.

Khám phá Thêm Dòng

Seedance 2.5

Seedance 2.5 API hiện đã có mặt trên Atlas Cloud! Cung cấp cho các nhà phát triển mô hình video mới nhất của ByteDance. Nó tạo ra tối đa 30 giây video gốc chỉ trong một lần xử lý từ văn bản, một hình ảnh duy nhất hoặc tối đa 50 tài liệu tham khảo đa phương thức, với âm thanh được đồng bộ hóa và văn bản đa ngôn ngữ trong khung hình. Trên Atlas Cloud, bạn có thể truy cập thông qua một khóa duy nhất, với tính nhất quán của chủ thể và vật lý được cải thiện giúp giữ cho các cảnh quay dài luôn mạch lạc.

Xem Dòng

Wan 3.0

Wan 3.0 API là thế hệ tiếp theo trong hệ sinh thái video Wan của Alibaba, được xây dựng để đưa khả năng tạo video dài, kiểm soát đa tham chiếu và chất lượng nghe nhìn lên những tầm cao mới. Atlas Cloud đã lưu trữ Wan 2.7, 2.6 và 2.5, và Wan 3.0 hoạt động trên cùng một khóa hợp nhất mà không cần thiết lập riêng. Bắt đầu xây dựng ngay hôm nay. Cuộn xuống phần trưng bày để xem những gì Wan 3.0 có thể tạo ra.

Xem Dòng

MiniMax H3

MiniMax H3 là dòng video đa phương thức của MiniMax, hỗ trợ sáng tạo từ văn bản, hình ảnh và nội dung tham chiếu. Trên các route được hỗ trợ, sản phẩm duy trì chủ thể từ nội dung tham chiếu, cung cấp các tỷ lệ khung hình linh hoạt và kết hợp âm thanh được tạo với hình ảnh thông qua H3 Developer, với hồ sơ đầu ra được lựa chọn theo endpoint. Atlas Cloud hợp nhất dòng sản phẩm này dưới một khóa tương thích với OpenAI, cùng mức giá trả theo nhu cầu minh bạch bắt đầu từ mức tiêu chuẩn $0.038 mỗi giây. Hãy bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Seedream 5.0 Pro

Seedream 5.0 Pro API cung cấp cho các nhà phát triển mô hình chỉnh sửa hình ảnh có thể kiểm soát của ByteDance trên Atlas Cloud. Nó đặt các chỉnh sửa một cách chính xác bằng các điểm neo và tọa độ, tách hình ảnh thành các lớp có thể chỉnh sửa, kết hợp nhiều tham chiếu và khớp màu sắc cũng như vật liệu chính xác, với văn bản đa ngôn ngữ ở độ phân giải 2K và 3K. Trên Atlas Cloud, bạn có thể truy cập nó chỉ bằng một khóa!

Xem Dòng

Seedance 2.0

Seedance 2.0 là mô hình video phục vụ môi trường production của ByteDance, giúp tạo cảnh quay chính xác. Biến prompt thành video, tạo chuyển động cho hình ảnh khung hình đầu tiên với tùy chọn hướng dẫn bằng khung hình cuối, hoặc định hình kết quả bằng media tham chiếu và tùy chọn tìm kiếm web. Atlas Cloud hợp nhất các quy trình này trong một API duy nhất, với mức giá pay-as-you-go minh bạch và một key tương thích với OpenAI. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

GPT Image 2.5

Dòng gpt-image-2.5 của OpenAI mang đến cho nhà phát triển lựa chọn giữa Flare và Sunburst cho các quy trình xử lý ảnh trong môi trường production. Kết xuất ở độ phân giải tùy ý lên đến 3840x2160 và chọn một trong năm cấp chất lượng, bao gồm xhigh và max, để đáp ứng các yêu cầu đầu ra cụ thể. Atlas Cloud cung cấp dịch vụ suy luận REST sẵn sàng sử dụng, không cần khởi động nguội, với mức giá tiêu chuẩn từ $0.004 cho mỗi lần tạo. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

GPT Image 2

GPT Image 2 API cung cấp cho các nhà phát triển quyền truy cập vào mô hình hình ảnh mới nhất của OpenAI, phiên bản kế nhiệm của GPT Image 1.5. Mô hình này tạo và chỉnh sửa hình ảnh với khả năng hiển thị văn bản chính xác trên các chữ viết Latinh và CJK, cùng với bố cục mạnh mẽ cho áp phích, mockup và đồ họa thông tin. Trên Atlas Cloud, bạn có thể truy cập nó thông qua một API thống nhất cùng với hơn 300 mô hình khác, với tín dụng miễn phí, 99,99% thời gian hoạt động và không yêu cầu xác minh tổ chức OpenAI.

Xem Dòng

Gemini Omni Flash

Gemini Omni là dòng video đa phương thức nguyên bản của Google DeepMind, phục vụ việc tạo và chỉnh sửa video theo hướng dẫn từ prompt. Tạo video từ văn bản, tạo chuyển động cho ảnh tĩnh hoặc chỉnh sửa cảnh quay hiện có bằng các tham chiếu hình ảnh tùy chọn, đồng thời bảo toàn nội dung không bị tác động. Các tùy chọn linh hoạt về độ phân giải, tỷ lệ khung hình và thời lượng đáp ứng nhiều quy trình sản xuất khác nhau. Atlas Cloud hợp nhất quyền truy cập với mức giá trả theo mức sử dụng minh bạch. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Grok Imagine

Grok Imagine API của xAI cung cấp các mô hình hình ảnh, video và lời nói, từ Image 2.0 đến Video 1.5 và xAI TTS v1. Render 1K hoặc 2K hình tĩnh trên 14 tỷ lệ khung hình, tạo cảnh 15 giây video 1080p, điều hướng các shot bằng tối đa 7 hình ảnh tham chiếu, hoặc cung cấp lời tường thuật bằng 20 ngôn ngữ. Atlas Cloud chạy mọi chế độ trên một endpoint, có giá theo mô hình trả tiền khi sử dụng từ $0.02 mỗi hình ảnh và $0.05 mỗi giây. Bắt đầu xây dựng hôm nay.

Xem Dòng

Google

Các mô hình sáng tạo mạnh mẽ nhất của Google hiện đều có sẵn trên Atlas Cloud. Veo 3.1 cung cấp khả năng tạo video đậm chất điện ảnh, Nano Banana 2 hỗ trợ tạo hình ảnh có độ chân thực cao, và Gemini mang trí tuệ đa phương thức vào mọi quy trình làm việc. Truy cập toàn bộ bộ mô hình Google thông qua một API key duy nhất với tính khả dụng Day-0 và mức giá dùng bao nhiêu trả bấy nhiêu (pay-as-you-go).

Xem Dòng

Seedance 2.0 Mini

Seedance 2.0 Mini mang khả năng tạo video đa phương thức của ByteDance vào các quy trình làm việc nơi tốc độ và chi phí là quan trọng nhất. Nó cung cấp các khả năng cốt lõi của Seedance 2.0 với mức tiêu thụ tài nguyên nhẹ hơn — tạo nhanh hơn, chi phí mỗi video thấp hơn và tích hợp API giống như bạn đã sử dụng. Đối với các nhóm chạy các quy trình (pipeline) khối lượng lớn hoặc tạo nguyên mẫu ở quy mô lớn, Mini là lựa chọn mặc định thiết thực.

Xem Dòng

ByteDance

Từ tạo video điện ảnh đến kiến tạo hình ảnh có độ trung thực cao, các mô hình mạnh mẽ nhất của ByteDance hiện đã có mặt trên Atlas Cloud. Chạy Seedance và Seedream ở quy mô lớn với mức giá suy luận thấp nhất và không có chi phí quản lý cơ sở hạ tầng.

Xem Dòng

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình