Seedance 2.0 Mini & Fast API với mức giá thấp nhất toàn cầu — giảm đến 68% so với giá chính thức

Conversational Video Editing with gemini omni API

Gemini Omni API mang dòng Gemini Omni Flash đa phương thức nguyên bản của Google DeepMind, bao gồm Gemini Omni 1.1 Flash, đến với các nhà phát triển. Tạo video điện ảnh với âm thanh gốc được đồng bộ, tạo chuyển động cho ảnh tĩnh với khả năng kiểm soát chính xác khung hình bắt đầu và kết thúc, hoặc chỉnh sửa cảnh quay hiện có bằng các hướng dẫn văn bản mà vẫn bảo toàn nội dung không được thay đổi. Atlas Cloud cung cấp một khóa tương thích với OpenAI, quyền truy cập hợp nhất và mức giá trả theo mức sử dụng minh bạch. Bắt đầu xây dựng ngay hôm nay.

Gemini Omni Flash do Google phát triển. Atlas Cloud (vận hành bởi Atlas Cloud AI LLC) cung cấp quyền truy cập vào mô hình này và không sở hữu mô hình. Mọi thương hiệu đều thuộc về chủ sở hữu tương ứng.

Khám phá Mô hình Hàng đầu

Atlas Cloud cung cấp cho bạn các mô hình sáng tạo tiên tiến nhất trong ngành.

Hướng dẫn các API Endpoint Gemini Omni cho quy trình làm việc video

So sánh các route văn bản, hình ảnh, tham chiếu, chỉnh sửa và mở rộng trên Gemini Omni Flash và Gemini Omni 1.1 Flash trước khi chọn endpoint phù hợp.

Phương thứcMô tả
Gemini Omni Flash Reference-to-Video API (R2V)Kết hợp prompt văn bản với từ một đến năm ảnh tham chiếu để tạo video điện ảnh kèm âm thanh gốc. Chủ thể, bối cảnh và phong cách nhất quán khiến endpoint này phù hợp với các phân cảnh thương hiệu và nhân vật xuất hiện định kỳ.
Gemini Omni Flash Image-to-Video API (I2V)Bắt đầu từ một ảnh tĩnh và prompt văn bản, endpoint này tạo video điện ảnh có âm thanh, đồng thời bảo toàn chủ thể và bố cục nguồn. Dùng endpoint này để tạo chuyển động cho ảnh sản phẩm, ảnh chân dung hoặc các ý tưởng hình ảnh.
Gemini Omni Flash Video Edit APICung cấp một video có sẵn cùng chỉ dẫn văn bản và ảnh tham chiếu tùy chọn để áp dụng các thay đổi nhất quán với bối cảnh và âm thanh gốc. Phần cảnh quay không được tác động vẫn được giữ nguyên, hỗ trợ chỉnh sửa hậu kỳ có trọng tâm và cập nhật hình ảnh.
Gemini Omni Flash Text-to-Video API (T2V)Chỉ từ một prompt văn bản, endpoint này tạo video điện ảnh với âm thanh gốc đồng bộ và chuyển động dựa trên các nguyên tắc vật lý. Khả năng tạo nội dung nhanh, có thể kiểm soát phù hợp cho trực quan hóa ý tưởng, phát triển câu chuyện và tạo nguyên mẫu video nhanh.
Gemini Omni Flash Reference-to-Video Developer APISử dụng prompt văn bản và ảnh tham chiếu để biến đổi các đoạn video có sẵn thông qua chuyển phong cách, chỉnh sửa bối cảnh hoặc chèn nhân vật. Developer endpoint này phù hợp với các công cụ sáng tạo cần tạo các biến thể có định hướng từ cảnh quay được cung cấp.
Gemini Omni Flash Image-to-Video Developer APIKhi nhận diện hình ảnh là yếu tố quan trọng, hãy kết hợp prompt văn bản với tối đa bảy ảnh tham chiếu để tạo video nhất quán về chủ thể. Quy trình này hỗ trợ nhân vật xuất hiện định kỳ, hình ảnh danh mục sản phẩm và các tài sản chiến dịch đồng bộ.
Gemini Omni Flash Text-to-Video Developer APIChọn prompt văn bản, độ phân giải, tỷ lệ khung hình và thời lượng để tạo video điện ảnh có thể kiểm soát. Các tùy chọn đầu ra linh hoạt giúp developer chuẩn bị nội dung theo từng nền tảng, thử nghiệm các hướng sáng tạo và xây dựng quy trình tạo nội dung tự động.
Gemini Omni 1.1 Flash Video Extend APITiếp nối một đoạn clip có sẵn bằng phần mở rộng khớp liền mạch, kéo dài từ ba đến mười giây và giữ lại âm thanh gốc. Có thể nối nhiều phần mở rộng để tạo một cảnh quay nhất quán dài tối đa bốn mươi giây cho các phân cảnh dài hơn hoặc hành động liên tục.
Gemini Omni 1.1 Flash Video Edit APIYêu cầu thêm, xóa, thay thế hoặc thay đổi phong cách bằng cách cung cấp cho endpoint một video có sẵn cùng chỉ dẫn văn bản. Endpoint giữ nguyên nội dung không được đề cập và âm thanh gốc, cho phép chỉnh sửa chính xác mà không cần dựng lại toàn bộ bối cảnh.
Gemini Omni 1.1 Flash Reference-to-Video API (R2V)Cung cấp prompt văn bản cùng tối đa mười ảnh tham chiếu và ba đoạn video tham chiếu để tạo video điện ảnh kèm âm thanh gốc. Tính nhất quán của nhân vật, sản phẩm và định hướng nghệ thuật hỗ trợ nội dung dạng chuỗi và các chiến dịch phối hợp.
Gemini Omni 1.1 Flash Image-to-Video API (I2V)Tạo chuyển động cho ảnh tĩnh thành một đoạn clip điện ảnh có âm thanh gốc, được định hướng bằng văn bản. Khung hình cuối tùy chọn giúp kiểm soát chính xác phần kết của cảnh quay, khiến endpoint này hữu ích cho các chuyển cảnh được lên kế hoạch và màn ra mắt sản phẩm.
Gemini Omni 1.1 Flash Text-to-Video API (T2V)Biến một prompt văn bản thành đoạn clip điện ảnh với âm thanh gốc đồng bộ, đồng thời kiểm soát thời lượng, tỷ lệ khung hình và độ phân giải. Đầu ra từ bản nháp 360p đến bản phân phối độ phân giải cao 4K hỗ trợ xem trước nhanh và triển khai chất lượng cao từ cùng một endpoint.

Tạo video bằng hội thoại với Gemini Omni Flash API

Mọi yêu cầu gửi đến Gemini Omni Flash API đều có thể nhận bất kỳ tổ hợp nào của văn bản, hình ảnh, video và âm thanh, tạo âm thanh đồng bộ, mô phỏng vật lý thế giới thực và tinh chỉnh kết quả qua hội thoại.

Biên tập bằng hội thoại

Biên tập bằng hội thoại

Tinh chỉnh một đoạn clip bằng ngôn ngữ tự nhiên; Gemini Omni Flash API sẽ áp dụng thay đổi mà vẫn giữ nguyên phần còn lại của cảnh. Interactions API có khả năng duy trì trạng thái sẽ ghi nhớ từng lượt trao đổi, để các chỉnh sửa tiếp nối lẫn nhau.

Đầu vào đa phương thức nguyên bản

Đầu vào đa phương thức nguyên bản

Gemini Omni Flash API chấp nhận mọi tổ hợp văn bản, hình ảnh, video và âm thanh trong một prompt duy nhất. Kiểu đầu vào linh hoạt này cho phép bạn bắt đầu quá trình tạo từ bất kỳ tư liệu nguồn nào sẵn có.

Âm thanh đồng bộ trong một lượt suy luận

Âm thanh đồng bộ trong một lượt suy luận

Âm thanh được tạo cùng hình ảnh trong một lượt suy luận, vì vậy lời thoại, hiệu ứng và âm thanh môi trường luôn khớp với hành động. Gemini Omni Flash API không cần thêm bước xử lý âm thanh riêng sau đó.

Mô hình hóa thế giới

Mô hình hóa thế giới

Dựa trên mô hình vật lý thế giới thực, Gemini Omni Flash API tạo ra hình ảnh phản chiếu, trọng lực, ánh sáng và thời tiết chân thực. Các cảnh vẫn nhất quán về mặt hình ảnh thay vì xuất hiện lỗi, ngay cả trong những cảnh quay chuyển động mạnh.

Tham chiếu đa phương thức

Tham chiếu đa phương thức

Hướng dẫn quá trình tạo bằng tối đa 7 hình ảnh tham chiếu và 3 đoạn video ngắn; Gemini Omni Flash API sẽ giữ cho chủ thể, phong cách và bối cảnh nhất quán. Điều này giúp duy trì nhận dạng ổn định qua các lần chỉnh sửa và cảnh quay.

Gemini Omni so với các mô hình khác – Một prompt

Cùng một prompt được Gemini Omni và các mô hình video hàng đầu khác tạo ra: đa cảnh quay và phim quảng cáo cao cấp

Prompt

Tạo một video liên tục gồm 3 cảnh: Cảnh 1: Người phụ nữ đứng dưới ánh đèn neon trên một con phố mưa ở Tokyo. Mặt đường ướt phản chiếu ánh sáng, độ sâu trường ảnh mang tính điện ảnh, máy quay chuyển động cầm tay. Cảnh 2: Máy quay từ từ chuyển sang một khuôn hình cận hơn. Cô ấy nói khẽ, đồng bộ với giọng nói được cung cấp, chuyển động môi khớp hoàn hảo. Giao thông phía sau vẫn tiếp diễn liền mạch. Cảnh 3: Cô ấy bước vào một ga tàu điện ngầm. Môi trường vẫn nhất quán về ánh sáng, thời tiết và không khí. Máy quay đi theo cô từ phía sau, duy trì tính nhất quán về nhận diện. Ràng buộc: - Duy trì nhận diện khuôn mặt giống hệt nhau trong tất cả các cảnh - Duy trì tính liên tục của ánh sáng (mưa, phản chiếu neon) - Đảm bảo tính chân thực vật lý (tương tác với mưa, bề mặt ướt) - Đảm bảo đồng bộ nghe nhìn với giọng nói đầu vào - Không đặt lại cảnh giữa các lần chuyển tiếp; duy trì trạng thái thế giới liên tục Phong cách: chủ nghĩa hiện thực điện ảnh cao cấp, hạt phim, ống kính anamorphic, độ sâu trường ảnh nông, phong cách phim 4K

Gemini Omni

Wan 2.7

Kling v3.0

Prompt

Tạo một video liên tục gồm 4 cảnh: Cảnh 1: Một robot nhỏ màu trắng ngồi bất động trên bàn gỗ trong một căn hộ tối vào lúc nửa đêm. Ánh trăng chiếu vào qua cửa sổ. Mắt robot từ từ sáng lên và một tiếng ù cơ khí khe khẽ bắt đầu vang lên. Cảnh 2: Robot cẩn thận trèo xuống khỏi bàn. Những bàn chân kim loại nhỏ tạo ra tiếng lách cách nhẹ trên sàn gỗ. Máy quay bám theo ở góc thấp, giữ cho kích thước và hình dáng của robot nhất quán. Cảnh 3: Robot bước vào bếp. Phản chiếu từ cánh cửa tủ lạnh và sàn lát gạch phản ứng tự nhiên theo chuyển động của nó. Ánh trăng và bầu không khí tĩnh lặng về đêm từ cảnh trước tiếp tục được duy trì. Cảnh 4: Robot dừng lại gần cửa sổ và nhìn ra ánh đèn thành phố. Máy quay từ từ tiến gần từ phía sau, bảo toàn tính nhất quán về nhận diện, vật liệu, tỷ lệ, ánh sáng và âm thanh của robot. Yêu cầu: - Duy trì chính xác cùng một thiết kế robot trong tất cả các cảnh - Bảo toàn một bố cục căn hộ liên tục, không đặt lại cảnh - Giữ ánh sáng nhất quán giữa các phòng - Đồng bộ tiếng bước chân và tiếng ù cơ khí với chuyển động của robot - Sử dụng phản chiếu, bóng đổ và tương tác giữa các vật thể chân thực về mặt vật lý - Chuyển tiếp mượt mà giữa các cảnh, như thể đang quay một thế giới liên tục duy nhất Phong cách: chủ nghĩa hiện thực điện ảnh, không khí khoa học viễn tưởng tĩnh lặng, ánh trăng dịu nhẹ, vật liệu chi tiết, chuyển động máy quay chân thực, độ sâu trường ảnh nông, phong cách phim quảng cáo cao cấp

Gemini Omni

Kling V3.0

Pixverse v6

Từ ảnh chụp sản phẩm đến bản dựng hoàn chỉnh với Gemini Omni API

Bao quát các chiến dịch sản phẩm, chỉnh sửa qua hội thoại, chuyển tiếp có kiểm soát, mở rộng liền mạch, thế giới thương hiệu nhất quán và các công cụ sáng tạo tích hợp, Gemini Omni API hỗ trợ quy trình sản xuất từ khung hình đầu tiên đến bản dựng cuối cùng.

Chiến dịch sản phẩm với Gemini Omni API

Biến ảnh tĩnh sản phẩm thành chuyển động điện ảnh với âm thanh gốc được đồng bộ, đồng thời có thể tùy chọn xác định khung hình cuối. Các đội ngũ marketing có thể biến ảnh đã được phê duyệt thành teaser ra mắt, quảng cáo mạng xã hội và video giới thiệu sản phẩm chỉn chu.

Hậu kỳ qua hội thoại

Mô tả nội dung cần thêm, xóa, thay thế hoặc tái định hình phong cách, rồi model sẽ cập nhật cảnh quay hiện có trong khi giữ nguyên mọi thành phần không được đề cập trong prompt. Biên tập viên có thể tạo các phiên bản xử lý thay thế và đáp ứng yêu cầu chỉnh sửa của khách hàng mà không phải dựng lại những cảnh đã được phê duyệt.

Chuyển tiếp giữa khung hình đầu và cuối

Thiết lập hình ảnh bắt đầu và khung hình cuối do bạn cung cấp, sau đó để Gemini Omni 1.1 Flash tạo chuyển động giữa hai khung hình. Nhà thiết kế có được các hiệu ứng chuyển tiếp có kiểm soát, màn ra mắt sản phẩm và những biến đổi hình ảnh cho tài sản chiến dịch.

Mở rộng câu chuyện liền mạch với Gemini Omni API

Tiếp nối một clip hiện có bằng một đoạn dài 3 đến 10 giây được khớp liền mạch, cho phép nối nhiều phần mở rộng thành một chuỗi nhất quán. Nhà làm phim và người kể chuyện có thể phát triển các cảnh quay dài hơn mà vẫn duy trì tính liên tục về chuyển động, âm thanh và hình ảnh.

Tính liên tục của nhân vật và thương hiệu

Kết hợp prompt với tối đa 10 ảnh tham chiếu và 3 clip video để định hướng nhân vật, sản phẩm hoặc phong cách nghệ thuật. Các studio có thể duy trì những chủ thể dễ nhận diện và tính thẩm mỹ thương hiệu nhất quán trong các cảnh quay chiến dịch và nội dung nhiều tập.

Ứng dụng sáng tạo được hỗ trợ bởi Gemini Omni API

Tích hợp tính năng tạo văn bản, tạo chuyển động cho hình ảnh, tạo nội dung từ ảnh tham chiếu, chỉnh sửa video và mở rộng clip thông qua một API duy nhất. Các nền tảng dành cho nhà sáng tạo có thể cung cấp không gian làm việc sản xuất liên kết mà không cần lắp ghép các pipeline video và âm thanh riêng biệt.

So sánh các mô hình tham chiếu trong tài liệu API Gemini Omni

So sánh các mô hình video tham chiếu của API Gemini Omni, bao gồm Gemini Omni 1.1 Flash, với các lựa chọn hàng đầu theo đầu vào được hỗ trợ, dung lượng tham chiếu, khả năng tạo âm thanh và mức giá tiêu chuẩn.

Mô hìnhĐầu vào được chấp nhậnDung lượng tham chiếuTạo âm thanhGiá tiêu chuẩn
Gemini Omni 1.1 Flash Reference-to-VideoVăn bản, hình ảnh, đoạn videoTối đa 10 hình ảnh và 3 đoạn video$0.041/sec
Gemini Omni Flash Reference-to-VideoVăn bản, hình ảnhTừ 1 đến 5 hình ảnh$0.135/sec
Seedance 2.0 Reference-to-VideoVăn bản, hình ảnh, video, âm thanhTối đa 9 hình ảnh, 3 video và 3 đoạn âm thanh$0.112/sec
Wan-2.7 Reference-to-videoVăn bản, hình ảnh, video, âm thanhTối đa 5 hình ảnh và video kết hợp, kèm giọng nói tùy chọn của chủ thể$0.10/sec
Grok Imagine Video v1.5 Reference-to-VideoVăn bản, hình ảnh, giọng nói cài sẵnTối đa 7 hình ảnh và 3 giọng nói cài sẵn$0.08/sec

Cách Sử Dụng Gemini Omni Flash trên Atlas Cloud

Bắt đầu trong vài phút — làm theo các bước đơn giản sau để tích hợp và triển khai mô hình qua nền tảng Atlas Cloud.

Tạo Tài Khoản Atlas Cloud

Đăng ký tại atlascloud.ai và hoàn tất xác minh. Người dùng mới nhận được tín dụng miễn phí để khám phá nền tảng và thử nghiệm mô hình.

Tại sao Sử dụng Gemini Omni Flash trên Atlas Cloud

Sự kết hợp của các mô hình tiên tiến của Gemini Omni Flash với nền tảng được tăng tốc GPU của Atlas Cloud mang lại hiệu suất, khả năng mở rộng và trải nghiệm nhà phát triển độc đáo.

Hiệu suất và Tính linh hoạt

Độ Trễ Thấp:
Suy luận được tối ưu hóa GPU cho suy luận thời gian thực.

API Thống nhất:
Chạy Gemini Omni Flash, GPT, Gemini và DeepSeek với một tích hợp duy nhất.

Giá cả Minh bạch:
Thanh toán dựa trên token có thể dự đoán với tùy chọn serverless.

Doanh nghiệp và Mở rộng

Trải nghiệm Nhà phát triển:
SDK, phân tích, công cụ tinh chỉnh và mẫu.

Độ tin cậy:
99,99% khả dụng, RBAC và ghi nhật ký sẵn sàng cho tuân thủ.

Bảo mật và Tuân thủ:
SOC 2 Type II, tuân thủ HIPAA, chủ quyền dữ liệu tại Hoa Kỳ.

Các câu hỏi về Gemini Omni API dành cho nhà phát triển video

Gemini Omni API cung cấp cho các nhà phát triển quyền truy cập vào dòng công cụ tạo và chỉnh sửa video đa phương thức nguyên bản của Google DeepMind thông qua Atlas Cloud. Tùy endpoint được chọn, API có thể tạo video từ văn bản hoặc hình ảnh, sử dụng phương tiện tham chiếu, chỉnh sửa cảnh quay hiện có và tạo âm thanh nguyên bản đồng bộ.

Gemini Omni 1.1 Flash bổ sung tính năng mở rộng video, nội suy khung hình đầu và cuối, các độ phân giải đầu ra từ 360p đến 4K, cùng khả năng định hướng bằng phương tiện tham chiếu được mở rộng. Biến thể mở rộng thêm 3 đến 10 giây cho mỗi yêu cầu và có thể nối chuỗi để tạo video liền mạch dài tối đa 40 giây.

Hãy tạo tài khoản Atlas Cloud, lưu API key ở phía máy chủ và chọn endpoint mô hình phù hợp với quy trình của bạn. Atlas Cloud cung cấp một key tương thích với OpenAI, còn schema được công bố của từng endpoint xác định prompt, đầu vào phương tiện và các cài đặt tạo nội dung bắt buộc.

Chọn text to video khi bắt đầu từ prompt, image to video khi tạo chuyển động cho ảnh tĩnh hoặc reference to video khi cần định hướng về danh tính và phong cách. Dùng video edit để chỉnh sửa cảnh quay hiện có và endpoint mở rộng video của Gemini Omni 1.1 Flash để tiếp tục một cảnh.

Giới hạn phương tiện tham chiếu thay đổi tùy endpoint và phiên bản mô hình. Gemini Omni 1.1 Flash Reference to Video chấp nhận tối đa 10 ảnh tham chiếu và 3 đoạn video tham chiếu, trong khi các endpoint trước đó có giới hạn khác; vì vậy, hãy kiểm tra schema của endpoint đã chọn trước khi gửi phương tiện.

Gemini Omni 1.1 Flash hỗ trợ đầu ra dài từ 3 đến 10 giây ở 24 FPS, với các tùy chọn độ phân giải 360p, 720p, 1080p nâng cấp và 4K nâng cấp. Các tỷ lệ khung hình được hỗ trợ là 16:9 và 9:16, mặc dù các tùy chọn điều khiển khả dụng có thể khác nhau tùy endpoint Atlas Cloud.

Có. Biến thể video edit tuân theo hướng dẫn bằng văn bản để thêm, xóa, thay thế hoặc thay đổi phong cách của các thành phần, đồng thời giữ nguyên những phần cảnh quay không được prompt đề cập. Để thực hiện các thay đổi lặp, hãy dùng hướng dẫn tập trung và ngữ cảnh tương tác được quy trình đã chọn hỗ trợ.

Để tiếp tục một cảnh, hãy cung cấp một đoạn clip hiện có cho endpoint mở rộng video của Gemini Omni 1.1 Flash và yêu cầu thêm 3 đến 10 giây. Có thể nối chuỗi các đoạn mở rộng với tổng thời lượng tối đa 40 giây, trong khi biến thể image to video có thể nội suy giữa khung hình đầu và cuối được cung cấp.

Mức giá tiêu chuẩn của Atlas Cloud cho Gemini Omni 1.1 Flash là $0.041 mỗi giây đối với text to video, reference to video, chỉnh sửa video và mở rộng video, trong khi image to video có giá $0.043 mỗi giây. Các endpoint Gemini Omni Flash trước đó có giá khởi điểm $0.112 mỗi giây, tính phí theo mức sử dụng và không yêu cầu đăng ký thuê bao.

Mọi video được tạo đều bao gồm watermark SynthID ẩn, có thể được phát hiện bằng lập trình. Bộ lọc an toàn áp dụng cho cả prompt và đầu ra được tạo, trong khi thời gian xử lý thay đổi tùy thời lượng, độ phân giải và tải của dịch vụ. Các tùy chọn điều khiển riêng cho negative prompt, system instruction, temperature, top_p và stop sequence không được hỗ trợ, vì vậy hãy đưa các nội dung cần loại trừ vào prompt chính.

Khám phá Thêm Dòng

Seedance 2.5

Seedance 2.5 API hiện đã có mặt trên Atlas Cloud! Cung cấp cho các nhà phát triển mô hình video mới nhất của ByteDance. Nó tạo ra tối đa 30 giây video gốc chỉ trong một lần xử lý từ văn bản, một hình ảnh duy nhất hoặc tối đa 50 tài liệu tham khảo đa phương thức, với âm thanh được đồng bộ hóa và văn bản đa ngôn ngữ trong khung hình. Trên Atlas Cloud, bạn có thể truy cập thông qua một khóa duy nhất, với tính nhất quán của chủ thể và vật lý được cải thiện giúp giữ cho các cảnh quay dài luôn mạch lạc.

Xem Dòng

Wan 3.0

Wan 3.0 API là thế hệ tiếp theo trong hệ sinh thái video Wan của Alibaba, được xây dựng để đưa khả năng tạo video dài, kiểm soát đa tham chiếu và chất lượng nghe nhìn lên những tầm cao mới. Atlas Cloud đã lưu trữ Wan 2.7, 2.6 và 2.5, và Wan 3.0 hoạt động trên cùng một khóa hợp nhất mà không cần thiết lập riêng. Bắt đầu xây dựng ngay hôm nay. Cuộn xuống phần trưng bày để xem những gì Wan 3.0 có thể tạo ra.

Xem Dòng

MiniMax H3

MiniMax H3 là dòng mô hình video của MiniMax dành cho việc tạo video từ văn bản, hình ảnh và ảnh tham chiếu. Tạo các đoạn clip dài 5 đến 15 giây, định hướng chuyển động bằng khung hình cuối tùy chọn, giữ lại chủ thể từ ảnh tham chiếu hoặc chọn H3 Developer khi âm thanh được tạo phù hợp với quy trình làm việc. Atlas Cloud tích hợp H3, H3 Fast, H3 Max và H3 Developer vào một quy trình API duy nhất, với mức giá tiêu chuẩn từ $0.038 mỗi giây. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Seedream 5.0 Pro

Seedream 5.0 Pro API cung cấp cho các nhà phát triển mô hình chỉnh sửa hình ảnh có thể kiểm soát của ByteDance trên Atlas Cloud. Nó đặt các chỉnh sửa một cách chính xác bằng các điểm neo và tọa độ, tách hình ảnh thành các lớp có thể chỉnh sửa, kết hợp nhiều tham chiếu và khớp màu sắc cũng như vật liệu chính xác, với văn bản đa ngôn ngữ ở độ phân giải 2K và 3K. Trên Atlas Cloud, bạn có thể truy cập nó chỉ bằng một khóa!

Xem Dòng

Seedance 2.0

Seedance 2.0 API cung cấp cho bạn quyền truy cập cấp sản xuất vào mô hình video đa phương thức của ByteDance — đầu vào bốn phương thức (văn bản, hình ảnh, video, âm thanh) và hệ thống "Universal Reference" hàng đầu trong ngành giúp khóa bố cục, chuyển động của camera và hành động của nhân vật trên các cảnh quay. Tích hợp quyền kiểm soát cấp độ đạo diễn bằng một lệnh gọi API, mức giá cố định $0,09/giây, cấp khóa tức thì và không có danh sách chờ — được hỗ trợ bởi thời gian hoạt động và sự tuân thủ cấp doanh nghiệp. Seedance 2.0 Native 4K hiện đã ra mắt!

Xem Dòng

GPT Image 2.5

Dòng gpt-image-2.5 của OpenAI mang đến cho nhà phát triển lựa chọn giữa Flare và Sunburst cho các quy trình xử lý ảnh trong môi trường production. Kết xuất ở độ phân giải tùy ý lên đến 3840x2160 và chọn một trong năm cấp chất lượng, bao gồm xhigh và max, để đáp ứng các yêu cầu đầu ra cụ thể. Atlas Cloud cung cấp dịch vụ suy luận REST sẵn sàng sử dụng, không cần khởi động nguội, với mức giá tiêu chuẩn từ $0.004 cho mỗi lần tạo. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

GPT Image 2

GPT Image 2 API cung cấp cho các nhà phát triển quyền truy cập vào mô hình hình ảnh mới nhất của OpenAI, phiên bản kế nhiệm của GPT Image 1.5. Mô hình này tạo và chỉnh sửa hình ảnh với khả năng hiển thị văn bản chính xác trên các chữ viết Latinh và CJK, cùng với bố cục mạnh mẽ cho áp phích, mockup và đồ họa thông tin. Trên Atlas Cloud, bạn có thể truy cập nó thông qua một API thống nhất cùng với hơn 300 mô hình khác, với tín dụng miễn phí, 99,99% thời gian hoạt động và không yêu cầu xác minh tổ chức OpenAI.

Xem Dòng

Gemini Omni Flash

Gemini Omni API mang dòng Gemini Omni Flash đa phương thức nguyên bản của Google DeepMind, bao gồm Gemini Omni 1.1 Flash, đến với các nhà phát triển. Tạo video điện ảnh với âm thanh gốc được đồng bộ, tạo chuyển động cho ảnh tĩnh với khả năng kiểm soát chính xác khung hình bắt đầu và kết thúc, hoặc chỉnh sửa cảnh quay hiện có bằng các hướng dẫn văn bản mà vẫn bảo toàn nội dung không được thay đổi. Atlas Cloud cung cấp một khóa tương thích với OpenAI, quyền truy cập hợp nhất và mức giá trả theo mức sử dụng minh bạch. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Grok Imagine

Grok Imagine API của xAI cung cấp các mô hình hình ảnh, video và lời nói, từ Image 2.0 đến Video 1.5 và xAI TTS v1. Render 1K hoặc 2K hình tĩnh trên 14 tỷ lệ khung hình, tạo cảnh 15 giây video 1080p, điều hướng các shot bằng tối đa 7 hình ảnh tham chiếu, hoặc cung cấp lời tường thuật bằng 20 ngôn ngữ. Atlas Cloud chạy mọi chế độ trên một endpoint, có giá theo mô hình trả tiền khi sử dụng từ $0.02 mỗi hình ảnh và $0.05 mỗi giây. Bắt đầu xây dựng hôm nay.

Xem Dòng

Google

Các mô hình sáng tạo mạnh mẽ nhất của Google hiện đều có sẵn trên Atlas Cloud. Veo 3.1 cung cấp khả năng tạo video đậm chất điện ảnh, Nano Banana 2 hỗ trợ tạo hình ảnh có độ chân thực cao, và Gemini mang trí tuệ đa phương thức vào mọi quy trình làm việc. Truy cập toàn bộ bộ mô hình Google thông qua một API key duy nhất với tính khả dụng Day-0 và mức giá dùng bao nhiêu trả bấy nhiêu (pay-as-you-go).

Xem Dòng

Seedance 2.0 Mini

Seedance 2.0 Mini mang khả năng tạo video đa phương thức của ByteDance vào các quy trình làm việc nơi tốc độ và chi phí là quan trọng nhất. Nó cung cấp các khả năng cốt lõi của Seedance 2.0 với mức tiêu thụ tài nguyên nhẹ hơn — tạo nhanh hơn, chi phí mỗi video thấp hơn và tích hợp API giống như bạn đã sử dụng. Đối với các nhóm chạy các quy trình (pipeline) khối lượng lớn hoặc tạo nguyên mẫu ở quy mô lớn, Mini là lựa chọn mặc định thiết thực.

Xem Dòng

ByteDance

Từ tạo video điện ảnh đến kiến tạo hình ảnh có độ trung thực cao, các mô hình mạnh mẽ nhất của ByteDance hiện đã có mặt trên Atlas Cloud. Chạy Seedance và Seedream ở quy mô lớn với mức giá suy luận thấp nhất và không có chi phí quản lý cơ sở hạ tầng.

Xem Dòng

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình