Seedance 2.0 Mini & Fast API với mức giá thấp nhất toàn cầu — giảm đến 68% so với giá chính thức
Grok Imagine Video 1.5 Motion Prompting

Grok Imagine Video 1.5 Motion Prompting

Grok Imagine Video 1.5 là dòng sản phẩm tạo video của xAI dành cho các nhà phát triển cần kiểm soát chuyển động từ prompt và đầu vào hình ảnh. Tạo chuyển động cho khung hình bắt đầu bằng hướng dẫn chuyển động bằng ngôn ngữ tự nhiên, chọn 480p hoặc 720p cho các quy trình tham chiếu, đồng thời thêm giọng nói tham chiếu tùy chọn để định hướng kết quả. Truy cập các chế độ được hỗ trợ thông qua một khóa Atlas Cloud tương thích với OpenAI, với mức giá minh bạch theo lượng sử dụng. Bắt đầu xây dựng ngay hôm nay.

Grok Imagine Video 1.5 do xAI phát triển. Atlas Cloud (vận hành bởi Atlas Cloud AI LLC) cung cấp quyền truy cập vào mô hình này và không sở hữu mô hình. Mọi thương hiệu đều thuộc về chủ sở hữu tương ứng.

So sánh các phương thức đầu vào của Grok Imagine Video 1.5

Khám phá sáu endpoint biến văn bản, khung hình mở đầu hoặc tài nguyên tham chiếu thành video trong quy trình dành cho nhà phát triển và quy trình tiêu chuẩn.

Phương thứcMô tả
Grok Imagine Video 1.5 Developer Reference-to-Video APIBiến 1 đến 7 hình ảnh tham chiếu và một giọng nói tham chiếu tùy chọn thành video với âm thanh đồng bộ tự nhiên. Video đầu ra có thể dài tối đa 15 giây ở độ phân giải 480p hoặc 720p. Endpoint này phù hợp với các cảnh được định hướng bằng hình ảnh tham chiếu và những ý tưởng hình ảnh cần nhiều ảnh nguồn.
Grok Imagine Video 1.5 Reference-to-Video APIDựa trên 1 đến 7 hình ảnh tham chiếu, endpoint này tạo video với âm thanh đồng bộ tự nhiên và cũng có thể nhận giọng nói tham chiếu tùy chọn. Endpoint hỗ trợ thời lượng tối đa 15 giây ở độ phân giải 480p hoặc 720p. Hãy chọn endpoint này cho việc sản xuất video từ nhiều tài nguyên tham chiếu và các chuỗi cảnh được định hướng bằng giọng nói.
Grok Imagine Video 1.5 Developer Text-to-Video APIChỉ cần một prompt văn bản để tạo video với âm thanh đồng bộ tự nhiên thông qua endpoint dành cho nhà phát triển này. Tạo các đoạn video dài tối đa 15 giây ở độ phân giải 480p, 720p hoặc 1080p. Endpoint phù hợp với các ý tưởng dựa trên prompt, storyboard và quy trình sản xuất video ngắn.
Grok Imagine Video 1.5 Text-to-Video APITạo video trực tiếp từ prompt văn bản, đồng thời tạo âm thanh đồng bộ một cách tự nhiên. Các tùy chọn đầu ra gồm 480p, 720p và 1080p, với thời lượng tối đa 15 giây. Sử dụng endpoint này cho các cảnh theo kịch bản, ý tưởng chiến dịch hoặc tài nguyên video dành cho mạng xã hội.
Grok Imagine Video 1.5 Developer Image-to-Video APIBắt đầu từ một hình ảnh, endpoint dành cho nhà phát triển này áp dụng các chỉ dẫn chuyển động bằng ngôn ngữ tự nhiên để tạo video hoạt họa. Các tùy chọn độ phân giải gồm 480p, 720p và 1080p. Endpoint phù hợp để tạo chuyển động cho tác phẩm nghệ thuật, hình ảnh sản phẩm và khung hình mở đầu đã chuẩn bị sẵn.
Grok Imagine Video 1.5 Image-to-Video APITạo chuyển động cho hình ảnh khung hình mở đầu bằng cách mô tả chuyển động mong muốn bằng ngôn ngữ tự nhiên. Video kết quả có thể được tạo ở độ phân giải 480p, 720p hoặc 1080p. Quy trình này hỗ trợ nghiên cứu chuyển động, kể chuyện bằng hình ảnh và sản xuất nội dung sáng tạo lấy hình ảnh làm trọng tâm.

Bên trong công cụ sáng tạo Grok Imagine Video 1.5

Grok Imagine Video 1.5 kết hợp quy trình làm việc với văn bản, hình ảnh khởi đầu và 1 đến 7 hình ảnh tham chiếu, cùng âm thanh được đồng bộ tự nhiên, đầu ra lên đến 1080p và các clip dài tối đa 15 giây ở chế độ văn bản hoặc tham chiếu, trong khi Atlas Cloud cung cấp một API duy nhất với mức giá trả theo mức sử dụng minh bạch.

Grok Imagine Video 1.5 từ văn bản

Bắt đầu bằng một prompt văn bản và tạo các clip dài tối đa 15 giây ở 480p, 720p hoặc 1080p. Âm thanh được đồng bộ tự nhiên được tạo cùng video trong cùng một lần sinh. Định hình hoàn toàn cảnh quay và hành động bằng chỉ dẫn văn bản khi không có hình ảnh nguồn. Quy trình này phù hợp với phim ý tưởng, thử nghiệm điện ảnh và các pipeline nội dung được điều khiển bằng prompt.

Chuyển động từ hình ảnh

Một khung hình khởi đầu duy nhất có thể trở thành một chuỗi chuyển động thông qua các prompt chuyển động bằng ngôn ngữ tự nhiên. Chọn đầu ra 480p, 720p hoặc 1080p, trong đó hình ảnh thiết lập bố cục mở đầu. Mô tả chuyển động của chủ thể và cảnh quay trong prompt, sau đó để model tạo chuyển động tiếp nối từ điểm neo hình ảnh đó. Quy trình này phù hợp với cảnh quay sản phẩm, khoảnh khắc nhân vật và ảnh tĩnh được art direct cần thêm chuyển động.

Định hướng tham chiếu với Grok Imagine Video 1.5

Định hướng Grok Imagine Video 1.5 bằng 1 đến 7 hình ảnh tham chiếu và một giọng nói tham chiếu tùy chọn. Chế độ tham chiếu tạo các clip dài tối đa 15 giây ở 480p hoặc 720p, cùng âm thanh được đồng bộ tự nhiên. Sử dụng các đầu vào này để hướng cảnh được tạo đến một định hướng hình ảnh đã xác lập. Quy trình này phù hợp với các chiến dịch và câu chuyện được xây dựng từ những tham chiếu sáng tạo có sẵn.

Âm thanh được đồng bộ tự nhiên

Video và âm thanh được tạo cùng nhau, vì vậy mỗi clip có thể bao gồm âm thanh được đồng bộ tự nhiên mà không cần một bước xử lý âm thanh riêng. Xây dựng cảnh xoay quanh những hành động có thể nhìn thấy, với thời điểm được nhấn mạnh bằng track âm thanh đi kèm. Với những khoảnh khắc đòi hỏi sự đồng bộ, quy trình sinh kết hợp này rút ngắn khoảng chuyển giao giữa việc tạo hình ảnh và sản xuất âm thanh. Tính năng này đặc biệt hữu ích cho các cảnh quay giàu tính trình diễn và không khí.

Mạch truyện 15 giây

Kéo dài một nhịp hình ảnh hoàn chỉnh xuyên suốt các clip văn bản hoặc tham chiếu dài tối đa 15 giây thay vì dừng lại ở một vòng lặp ngắn. Thời lượng này hỗ trợ phần mở đầu, chuyển động và điểm nhấn rõ ràng trong một chuỗi được tạo duy nhất. Kết hợp khoảng thời gian đó với các góc máy thay đổi và hành động liên tục để tạo ra một khoảnh khắc phát triển đầy đủ hơn. Độ dài này phù hợp với quảng cáo ngắn, các đoạn hé lộ mang tính tự sự và cảnh video mạng xã hội.

Một API, 6 endpoint

Chuyển đổi giữa việc sinh video từ văn bản, hình ảnh khởi đầu và hình ảnh tham chiếu thông qua một Atlas Cloud API duy nhất, với mức giá trả theo mức sử dụng minh bạch. Chọn quy trình phù hợp với từng asset thay vì ép mọi ý tưởng đi qua một loại đầu vào duy nhất. Cùng một tích hợp này cung cấp cho developer quyền truy cập vào cả 6 endpoint Grok Imagine Video v1.5 được liệt kê, bao gồm các route Standard và Developer. Điều này đơn giản hóa việc thử nghiệm và lập kế hoạch sản xuất cho nhiều loại tác vụ video khác nhau.

Grok Imagine Video 1.5 trong cuộc đối đầu mô hình với cùng một prompt

Xem cách Grok Imagine Video 1.5 và hai lựa chọn thay thế từ Atlas Cloud diễn giải các prompt giống hệt nhau trong những cảnh hành động điện ảnh và kỳ ảo cách điệu.

Prompt

Một bộ phim kỳ ảo Baroque dưới nước dài 9-second, quay one-take duy nhất, lấy bối cảnh bên trong một nhà hát opera bỏ hoang đã ngập hoàn toàn: một nữ thợ lặn tự do duyên dáng với mái tóc tung bay và chiếc mặt nạ ngọc trai phát sáng truy đuổi một con bạch tuộc đỏ san hô rực rỡ đang mang theo chiếc chìa khóa bằng đồng được chạm khắc cầu kỳ, len qua những tấm rèm nhung trôi dạt. Mở đầu từ bên trong sàn sân khấu nứt vỡ bằng một cú máy góc thấp hướng lên đầy kịch tính khi cô xoay người rồi lao đầu qua khe nứt; chuyển sang cú máy bám ngang cận cảnh khi cô luồn qua những hàng ghế nhà hát đổ nghiêng, mái tóc và trang phục phản ứng tự nhiên với dòng nước trong lúc rèm cửa phồng lên và bong bóng trôi qua những mái vòm xếp lớp; sau đó máy quay vòng quanh cô rồi nâng dần lên khi áp lực nước giật tung một chiếc đèn chùm pha lê phía trên. Ở cao trào, cô xoay ngang người vào khoảnh khắc cuối cùng để tránh chiếc đèn chùm rơi xuống, các tinh thể va vào nhau và văng tứ phía một cách chân thực, trong khi con bạch tuộc khéo léo bắt lấy chiếc chìa khóa đang rơi bằng những xúc tu cuộn phức tạp, dừng lại với vẻ nghi lễ trang nghiêm rồi đặt nó trở lại bàn tay đang mở của cô. Chuyển động chất lỏng liên tục, mở đầu–truy đuổi–kết quả rõ ràng, nhân vật và mặt nạ ngọc trai nhất quán, thể hiện chính xác về mặt vật lý lực cản của nước, lực nổi, vải, tóc, bong bóng, biến dạng xúc tu, va chạm và tránh va chạm. Những tia sáng cyan lạnh từ các giếng trời vỡ xuyên qua khán phòng tối chìm dưới nước; đỏ san hô là màu duy nhất có độ bão hòa cao, dẫn mắt qua các lớp mái vòm sâu, rèm cửa, mảnh vỡ lơ lửng và bong bóng. Nhiếp ảnh điện ảnh dưới nước chân thực như ảnh chụp với lớp kết cấu sơn dầu tinh tế, vẻ tráng lệ Baroque thanh lịch, hiệu ứng caustic thể tích, độ chi tiết cao, không chữ, không giao diện, không cắt cảnh giả dạng khung hình tĩnh. Âm thanh nhập vai: tiếng ù trầm bị nghẹt dưới nước, dòng chảy ào ạt, tiếng vải phấp phới, bong bóng, tiếng pha lê va đập và nhịp orchestral căng thẳng dần lắng lại thành một nốt harp mảnh mai khi chiếc chìa khóa được trao trả. Tỷ lệ khung hình 16:9.

Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud

Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud

Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud

Prompt

Một quảng cáo hài hành động phi lý dài 9-second, lấy bối cảnh bên trong một tiệm cắt tóc thập niên 1950s được chăm chút tỉ mỉ vào lúc bình minh. Một chú chó chăn cừu Old English Sheepdog già nua, lông xù và cau có, phủ đầy bọt xà phòng trắng dày, lao xuyên qua cửa rồi chạy băng qua tiệm trong khi vung vẩy bọt khắp nơi; người thợ cắt tóc giật mình nhảy lên một chiếc ghế xoay và cưỡi nó đuổi theo, nhanh tay tỉa bộ lông bay tung của chú chó, mỗi tiếng kéo lách cách sắc gọn được đồng bộ chính xác với nhịp trống jazz mạnh mẽ. Mở đầu bằng cú máy bám sát mặt đất ở độ cao cực thấp, chạy đua bên cạnh những bàn chân ướt khi chúng trượt trên nền gạch caro đen trắng bóng loáng, bắn những giọt nước và tia bọt chân thực về phía ống kính; whip-pan hướng lên thành cú máy bám vòng tròn tốc độ cao, sử dụng ba chiếc gương lớn để liên tục cho thấy và duy trì vị trí thay đổi của chú chó và người thợ qua những hình phản chiếu phức tạp, chính xác; sau đó thực hiện cú dolly-in nhanh khi những mảnh lông cuối cùng đang bay lơ lửng rơi xuống, xoáy tròn rồi đáp hoàn hảo lên đầu chú chó, tạo thành một kiểu tóc pompadour cao đến lố bịch. Chú chó dừng lại, đắc ý tạo dáng trong một nhịp anh hùng kéo dài one-second như bị đóng băng, rồi bất ngờ hắt hơi, phun tung một đám bọt và lông đầy bùng nổ khi bản jazz kết thúc bằng một tiếng rimshot sắc gọn gây cười. Đèn tungsten thực dụng ấm áp cắt qua làn sương buổi sáng màu teal lạnh bên ngoài cửa sổ; bảng màu cổ điển phong phú gồm burgundy, kem, đồng thau đánh bóng và gỗ tối; kỹ thuật quay quảng cáo live-action cao cấp, vũ đạo tốc độ cao liên tục và liền mạch, nhân vật cùng tính liên tục không gian nhất quán, thể hiện chính xác về mặt vật lý bộ lông ướt, bọt xà phòng, lông rụng, phản chiếu, chuyển động xoay của ghế, quán tính và va chạm, chi tiết chân thực giàu tính xúc giác, chuyển động sắc nét rõ ràng, không slow motion, không các cảnh thiết lập trống, không màn hình, không giao diện phần mềm, không dashboard, không thanh tiến trình, không biểu đồ, không phụ đề, không văn bản giải thích, không logo, không watermark, tỷ lệ khung hình 16:9.

Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud

Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud

Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud

Grok Imagine Video 1.5 trong toàn bộ quy trình sáng tạo

Grok Imagine Video 1.5 biến prompt, khung hình nguồn và tối đa 7 ảnh tham chiếu thành các video ngắn có âm thanh đồng bộ cho chiến dịch, giới thiệu sản phẩm, câu chuyện nhân vật, nội dung mạng xã hội và tạo mẫu hình ảnh nhanh.

Video giới thiệu sản phẩm với Grok Imagine Video 1.5

Tạo chuyển động cho ảnh tĩnh sản phẩm bằng prompt chuyển động ngôn ngữ tự nhiên và âm thanh đồng bộ. Tạo các đoạn video giới thiệu ngắn cho cửa hàng trực tuyến, trang chiến dịch, tài sản ra mắt hoặc vị trí quảng cáo trên mạng xã hội với độ phân giải lên đến 1080p.

Câu chuyện nhân vật theo hướng dẫn bằng ảnh tham chiếu

Định hướng một cảnh với từ 1 đến 7 ảnh tham chiếu nhân vật và giọng nói tham chiếu tùy chọn. Thiết lập này hỗ trợ sự xuất hiện lặp lại của dàn nhân vật, các khoảnh khắc hội thoại và những đoạn phim kể chuyện ngắn với âm thanh đồng bộ gốc.

Ý tưởng chiến dịch bắt đầu từ prompt

Bắt đầu từ một prompt văn bản để tạo video hoàn chỉnh với âm thanh đồng bộ gốc. Các đội ngũ marketing có thể khám phá ý tưởng chiến dịch, video truyền tải không khí và teaser ra mắt mà không cần chuẩn bị ảnh nguồn.

Đoạn video mạng xã hội với Grok Imagine Video 1.5

Biến một khung hình bắt đầu duy nhất thành chuyển động bằng chỉ dẫn ngôn ngữ tự nhiên với độ phân giải lên đến 1080p. Tạo các tài sản chiến dịch ngắn gọn cho bảng tin, trang ra mắt, thông báo sự kiện, cập nhật sản phẩm và bài đăng do nhà sáng tạo thực hiện.

Tạo chuyển động cho khung hình storyboard

Thổi sức sống vào khung hình storyboard đã được phê duyệt bằng chuyển động điều khiển qua prompt, đồng thời giữ khung hình đó làm ảnh bắt đầu. Đạo diễn và nhà thiết kế có thể tạo các cảnh previz ngắn với âm thanh đồng bộ để xem xét.

Chiến dịch thương hiệu với Grok Imagine Video 1.5

Kết hợp góc nhìn sản phẩm, chân dung nhân vật, chi tiết trang phục và ảnh tham chiếu bối cảnh từ tối đa 7 ảnh. Các đội ngũ thương hiệu có thể chỉ đạo những cảnh quảng bá ngắn với âm thanh đồng bộ, đồng thời neo mỗi yêu cầu vào các tài sản hình ảnh được cung cấp.

Grok Imagine Video 1.5 trong lĩnh vực video đa phương thức

So sánh Grok Imagine Video 1.5 với các model reference-to-video hàng đầu về các loại đầu vào được chấp nhận, độ dài clip, độ phân giải, âm thanh đồng bộ và mức giá tiêu chuẩn theo giây.

ModelLoại đầu vàoĐộ dài clipĐộ phân giải tối đaÂm thanh gốcGiá tiêu chuẩn
Grok Imagine Video v1.5Văn bản, Hình ảnh, Hình ảnh tham chiếu, Giọng nóiTối đa 15 giây1080p√$0.08/giây
Seedance 2.0 Reference-to-VideoVăn bản, Hình ảnh, Video, Âm thanh4 đến 15 giây4K√$0.112/giây
MiniMax H3 Reference-to-VideoVăn bản, Hình ảnh, Video, Âm thanh4 đến 15 giây2K√$0.038/giây
Wan-2.7 Reference-to-videoVăn bản, Hình ảnh, Video, Âm thanh2 đến 10 giây1080p√$0.10/giây

Cách Sử Dụng Grok Imagine Video 1.5 trên Atlas Cloud

Bắt đầu trong vài phút — làm theo các bước đơn giản sau để tích hợp và triển khai mô hình qua nền tảng Atlas Cloud.

Tạo Tài Khoản Atlas Cloud

Đăng ký tại atlascloud.ai và hoàn tất xác minh. Người dùng mới nhận được tín dụng miễn phí để khám phá nền tảng và thử nghiệm mô hình.

Tại sao Sử dụng Grok Imagine Video 1.5 trên Atlas Cloud

Sự kết hợp của các mô hình tiên tiến của Grok Imagine Video 1.5 với nền tảng được tăng tốc GPU của Atlas Cloud mang lại hiệu suất, khả năng mở rộng và trải nghiệm nhà phát triển độc đáo.

Hiệu suất và Tính linh hoạt

Độ Trễ Thấp:
Suy luận được tối ưu hóa GPU cho suy luận thời gian thực.

API Thống nhất:
Chạy Grok Imagine Video 1.5, GPT, Gemini và DeepSeek với một tích hợp duy nhất.

Giá cả Minh bạch:
Thanh toán dựa trên token có thể dự đoán với tùy chọn serverless.

Doanh nghiệp và Mở rộng

Trải nghiệm Nhà phát triển:
SDK, phân tích, công cụ tinh chỉnh và mẫu.

Độ tin cậy:
99,99% khả dụng, RBAC và ghi nhật ký sẵn sàng cho tuân thủ.

Bảo mật và Tuân thủ:
SOC 2 Type II, tuân thủ HIPAA, chủ quyền dữ liệu tại Hoa Kỳ.

Câu hỏi thường gặp về API Grok Imagine Video 1.5

Grok Imagine Video 1.5 là dòng mô hình tạo video của xAI, dùng để tạo các đoạn video từ văn bản, một ảnh đầu vào hoặc nhiều ảnh tham chiếu. Thông qua Atlas Cloud, các nhà phát triển có thể truy cập các endpoint riêng cho từng chế độ tạo.

Có 3 chế độ: text-to-video, image-to-video và reference-to-video. Chọn text để tạo một cảnh từ đầu, image để tạo chuyển động cho khung hình bắt đầu hoặc reference để định hướng chủ thể, vật thể và phong cách bằng nhiều ảnh.

Tạo khóa API Atlas Cloud và gửi yêu cầu đã xác thực đến endpoint tạo video cùng model ID phù hợp. Sử dụng task ID được trả về để kiểm tra trạng thái tạo và lấy URL video hoàn tất.

Text-to-video yêu cầu prompt bằng ngôn ngữ tự nhiên, còn image-to-video bổ sung một ảnh khung hình bắt đầu. Reference-to-video chấp nhận một prompt và từ 1 đến 7 ảnh tham chiếu, cùng các voice ID preset tùy chọn cho đoạn hội thoại được tạo.

Các schema Atlas Cloud hiện có hỗ trợ đoạn video dài từ 1 đến 15 giây. Text-to-video và image-to-video cung cấp đầu ra 480p, 720p hoặc 1080p, trong khi reference-to-video hỗ trợ 480p hoặc 720p.

Có. Text-to-video tạo âm thanh đồng bộ gốc từ prompt, còn reference-to-video có thể kết hợp âm thanh được tạo với voice preset tùy chọn cho đoạn hội thoại.

Atlas Cloud niêm yết mức giá cơ bản tiêu chuẩn là $0.08 cho mỗi endpoint thuộc trang dòng mô hình này. Hãy xem chi tiết thanh toán hiện tại của endpoint đã chọn trước khi triển khai, vì bản ghi giá được cung cấp không nêu rõ đơn vị tính phí.

Cung cấp từ 1 đến 7 ảnh thông qua endpoint reference-to-video. Xác định các tài nguyên cụ thể trong prompt bằng những thẻ như <IMAGE_0> và <IMAGE_1> để mô hình liên kết từng ảnh tham chiếu với chủ thể hoặc thành phần cảnh tương ứng.

Các schema Atlas Cloud hiện có không bao gồm tham số riêng cho khung hình cuối. Image-to-video sử dụng một ảnh làm khung hình bắt đầu, còn reference-to-video sử dụng từ 1 đến 7 ảnh để định hướng hình ảnh, chứ không đảm bảo đó là khung hình đầu và cuối.

Chọn reference-to-video khi cần nhiều ảnh cùng định hướng con người, vật thể hoặc phong cách hình ảnh trong một cảnh mới. Sử dụng image-to-video khi một ảnh có sẵn cần trở thành khung hình mở đầu và chuyển động của ảnh tuân theo prompt bằng ngôn ngữ tự nhiên.

Khám phá Thêm Dòng

Seedance 2.5

Seedance 2.5 API hiện đã có mặt trên Atlas Cloud! Cung cấp cho các nhà phát triển mô hình video mới nhất của ByteDance. Nó tạo ra tối đa 30 giây video gốc chỉ trong một lần xử lý từ văn bản, một hình ảnh duy nhất hoặc tối đa 50 tài liệu tham khảo đa phương thức, với âm thanh được đồng bộ hóa và văn bản đa ngôn ngữ trong khung hình. Trên Atlas Cloud, bạn có thể truy cập thông qua một khóa duy nhất, với tính nhất quán của chủ thể và vật lý được cải thiện giúp giữ cho các cảnh quay dài luôn mạch lạc.

Xem Dòng

Wan 3.0

Wan 3.0 API là thế hệ tiếp theo trong hệ sinh thái video Wan của Alibaba, được xây dựng để đưa khả năng tạo video dài, kiểm soát đa tham chiếu và chất lượng nghe nhìn lên những tầm cao mới. Atlas Cloud đã lưu trữ Wan 2.7, 2.6 và 2.5, và Wan 3.0 hoạt động trên cùng một khóa hợp nhất mà không cần thiết lập riêng. Bắt đầu xây dựng ngay hôm nay. Cuộn xuống phần trưng bày để xem những gì Wan 3.0 có thể tạo ra.

Xem Dòng

MiniMax H3

MiniMax H3 là dòng video đa phương thức của MiniMax, hỗ trợ sáng tạo từ văn bản, hình ảnh và nội dung tham chiếu. Trên các route được hỗ trợ, sản phẩm duy trì chủ thể từ nội dung tham chiếu, cung cấp các tỷ lệ khung hình linh hoạt và kết hợp âm thanh được tạo với hình ảnh thông qua H3 Developer, với hồ sơ đầu ra được lựa chọn theo endpoint. Atlas Cloud hợp nhất dòng sản phẩm này dưới một khóa tương thích với OpenAI, cùng mức giá trả theo nhu cầu minh bạch bắt đầu từ mức tiêu chuẩn $0.038 mỗi giây. Hãy bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Seedream 5.0 Pro

Seedream 5.0 Pro API cung cấp cho các nhà phát triển mô hình chỉnh sửa hình ảnh có thể kiểm soát của ByteDance trên Atlas Cloud. Nó đặt các chỉnh sửa một cách chính xác bằng các điểm neo và tọa độ, tách hình ảnh thành các lớp có thể chỉnh sửa, kết hợp nhiều tham chiếu và khớp màu sắc cũng như vật liệu chính xác, với văn bản đa ngôn ngữ ở độ phân giải 2K và 3K. Trên Atlas Cloud, bạn có thể truy cập nó chỉ bằng một khóa!

Xem Dòng

Seedance 2.0

Seedance 2.0 là mô hình video phục vụ môi trường production của ByteDance, giúp tạo cảnh quay chính xác. Biến prompt thành video, tạo chuyển động cho hình ảnh khung hình đầu tiên với tùy chọn hướng dẫn bằng khung hình cuối, hoặc định hình kết quả bằng media tham chiếu và tùy chọn tìm kiếm web. Atlas Cloud hợp nhất các quy trình này trong một API duy nhất, với mức giá pay-as-you-go minh bạch và một key tương thích với OpenAI. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

GPT Image 2.5

Dòng gpt-image-2.5 của OpenAI mang đến cho nhà phát triển lựa chọn giữa Flare và Sunburst cho các quy trình xử lý ảnh trong môi trường production. Kết xuất ở độ phân giải tùy ý lên đến 3840x2160 và chọn một trong năm cấp chất lượng, bao gồm xhigh và max, để đáp ứng các yêu cầu đầu ra cụ thể. Atlas Cloud cung cấp dịch vụ suy luận REST sẵn sàng sử dụng, không cần khởi động nguội, với mức giá tiêu chuẩn từ $0.004 cho mỗi lần tạo. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

GPT Image 2

GPT Image 2 API cung cấp cho các nhà phát triển quyền truy cập vào mô hình hình ảnh mới nhất của OpenAI, phiên bản kế nhiệm của GPT Image 1.5. Mô hình này tạo và chỉnh sửa hình ảnh với khả năng hiển thị văn bản chính xác trên các chữ viết Latinh và CJK, cùng với bố cục mạnh mẽ cho áp phích, mockup và đồ họa thông tin. Trên Atlas Cloud, bạn có thể truy cập nó thông qua một API thống nhất cùng với hơn 300 mô hình khác, với tín dụng miễn phí, 99,99% thời gian hoạt động và không yêu cầu xác minh tổ chức OpenAI.

Xem Dòng

Gemini Omni Flash

Gemini Omni API mang dòng Gemini Omni Flash đa phương thức nguyên bản của Google DeepMind, bao gồm Gemini Omni 1.1 Flash, đến với các nhà phát triển. Tạo video điện ảnh với âm thanh gốc được đồng bộ, tạo chuyển động cho ảnh tĩnh với khả năng kiểm soát chính xác khung hình bắt đầu và kết thúc, hoặc chỉnh sửa cảnh quay hiện có bằng các hướng dẫn văn bản mà vẫn bảo toàn nội dung không được thay đổi. Atlas Cloud cung cấp một khóa tương thích với OpenAI, quyền truy cập hợp nhất và mức giá trả theo mức sử dụng minh bạch. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Grok Imagine

Grok Imagine API của xAI cung cấp các mô hình hình ảnh, video và lời nói, từ Image 2.0 đến Video 1.5 và xAI TTS v1. Render 1K hoặc 2K hình tĩnh trên 14 tỷ lệ khung hình, tạo cảnh 15 giây video 1080p, điều hướng các shot bằng tối đa 7 hình ảnh tham chiếu, hoặc cung cấp lời tường thuật bằng 20 ngôn ngữ. Atlas Cloud chạy mọi chế độ trên một endpoint, có giá theo mô hình trả tiền khi sử dụng từ $0.02 mỗi hình ảnh và $0.05 mỗi giây. Bắt đầu xây dựng hôm nay.

Xem Dòng

Google

Các mô hình sáng tạo mạnh mẽ nhất của Google hiện đều có sẵn trên Atlas Cloud. Veo 3.1 cung cấp khả năng tạo video đậm chất điện ảnh, Nano Banana 2 hỗ trợ tạo hình ảnh có độ chân thực cao, và Gemini mang trí tuệ đa phương thức vào mọi quy trình làm việc. Truy cập toàn bộ bộ mô hình Google thông qua một API key duy nhất với tính khả dụng Day-0 và mức giá dùng bao nhiêu trả bấy nhiêu (pay-as-you-go).

Xem Dòng

Seedance 2.0 Mini

Seedance 2.0 Mini mang khả năng tạo video đa phương thức của ByteDance vào các quy trình làm việc nơi tốc độ và chi phí là quan trọng nhất. Nó cung cấp các khả năng cốt lõi của Seedance 2.0 với mức tiêu thụ tài nguyên nhẹ hơn — tạo nhanh hơn, chi phí mỗi video thấp hơn và tích hợp API giống như bạn đã sử dụng. Đối với các nhóm chạy các quy trình (pipeline) khối lượng lớn hoặc tạo nguyên mẫu ở quy mô lớn, Mini là lựa chọn mặc định thiết thực.

Xem Dòng

ByteDance

Từ tạo video điện ảnh đến kiến tạo hình ảnh có độ trung thực cao, các mô hình mạnh mẽ nhất của ByteDance hiện đã có mặt trên Atlas Cloud. Chạy Seedance và Seedream ở quy mô lớn với mức giá suy luận thấp nhất và không có chi phí quản lý cơ sở hạ tầng.

Xem Dòng

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình