Seedance 2.0 Mini & Fast API với mức giá thấp nhất toàn cầu — giảm đến 68% so với giá chính thức
Grok Imagine Video with Reference Guidance

Grok Imagine Video with Reference Guidance

Grok Imagine Video cung cấp cho các nhà phát triển quyền truy cập vào dòng sản phẩm video của xAI để tạo, tạo chuyển động, kéo dài và chỉnh sửa các đoạn video. Tạo video dài từ 1 đến 15 giây từ lời nhắc, định hướng nhân vật, vật thể hoặc phong cách bằng tối đa bảy hình ảnh tham chiếu, và làm việc ở độ phân giải 480p hoặc 720p. Atlas Cloud tập hợp các khả năng này thông qua các endpoint tương thích với OpenAI, cùng mức giá minh bạch theo mức sử dụng. Bắt đầu xây dựng ngay hôm nay.

Grok Imagine Video do xAI phát triển. Atlas Cloud (vận hành bởi Atlas Cloud AI LLC) cung cấp quyền truy cập vào mô hình này và không sở hữu mô hình. Mọi thương hiệu đều thuộc về chủ sở hữu tương ứng.

So sánh các chế độ và quy trình Grok Imagine Video

Chọn endpoint Grok Imagine Video phù hợp với tài sản nguồn, mục tiêu chuyển đổi và quy trình sản xuất của bạn.

Phương thứcMô tả
Grok Imagine Video T2V API (Text To Video)Chuyển các prompt bằng ngôn ngữ tự nhiên thành video dài từ 1 đến 15 giây ở độ phân giải 480p hoặc 720p. Endpoint này phù hợp để trực quan hóa ý tưởng, tạo clip mạng xã hội và dựng cảnh không cần phương tiện nguồn.
Grok Imagine Video I2V API (Image To Video)Bắt đầu từ một hình ảnh được cung cấp, endpoint này áp dụng các prompt chuyển động bằng ngôn ngữ tự nhiên để tạo video ở độ phân giải 480p hoặc 720p. Sử dụng endpoint để tạo hiệu ứng chuyển động cho tác phẩm nghệ thuật, hình ảnh sản phẩm, khung hình nhân vật hoặc hình ảnh chiến dịch.
Grok Imagine Video R2V API (Reference To Video)Hướng dẫn quá trình tạo video bằng 1 đến 7 hình ảnh tham chiếu đại diện cho người, vật thể hoặc phong cách hình ảnh. Đầu ra có thể dài tối đa 10 giây ở độ phân giải 480p hoặc 720p, hỗ trợ quy trình sáng tạo dựa trên hình ảnh tham chiếu.
Grok Imagine Video Extend API (Video Extension)Tiếp tục một tệp MP4 hiện có dài từ 2 đến 15 giây bằng phần mở rộng theo prompt, kéo dài thêm từ 2 đến 10 giây. Đầu ra giữ nguyên định dạng đầu vào và được giới hạn ở 720p, giúp endpoint này phù hợp để kéo dài các cảnh quay đã có.
Grok Imagine Video Edit API (Video Editing)Cung cấp tệp MP4 và hướng dẫn bằng ngôn ngữ tự nhiên để chỉnh sửa nội dung hình ảnh trong khi vẫn giữ nguyên thời lượng nguồn. Đầu ra được giới hạn ở 8,7 giây, phù hợp với các chỉnh sửa có mục tiêu và phép biến đổi dựa trên prompt đối với các đoạn phim ngắn.

Video Grok Imagine cho mọi giai đoạn sáng tạo

Grok Imagine Video biến prompt, ảnh tĩnh, hình ảnh tham chiếu và các tệp MP4 hiện có thành những hướng triển khai thiết thực cho clip mạng xã hội, hình ảnh sản phẩm, câu chuyện thương hiệu, chuỗi video dài hơn, chỉnh sửa có mục tiêu và công cụ dành cho nhà sáng tạo.

Clip mạng xã hội với Grok Imagine Video

Grok Imagine Video chuyển các prompt bằng ngôn ngữ tự nhiên thành những clip ngắn 480p hoặc 720p. Sử dụng để tạo teaser mạng xã hội, ý tưởng chiến dịch và bản nháp hình ảnh nhanh mà không cần chuẩn bị cảnh quay nguồn trước.

Tạo chuyển động cho ảnh tĩnh sản phẩm

Bắt đầu từ một hình ảnh sản phẩm, endpoint chuyển ảnh thành video bổ sung chuyển động được điều khiển bằng prompt ở 480p hoặc 720p. Các thương hiệu có thể biến ảnh tĩnh trong catalog thành video giới thiệu sản phẩm, nội dung ra mắt và hình ảnh cho sàn thương mại điện tử.

Câu chuyện thương hiệu định hướng bằng hình ảnh tham chiếu

Với một đến bảy hình ảnh, reference to video đưa con người, vật thể hoặc phong cách vào một clip mới. Các nhóm sáng tạo có thể phát triển câu chuyện thương hiệu, ý tưởng nhân vật và bối cảnh sản phẩm dựa trên những hình ảnh được cung cấp.

Mở rộng câu chuyện với Grok Imagine Video

Tiếp nối một tệp MP4 hiện có bằng phần mở rộng từ hai đến mười giây được điều khiển bằng prompt, đồng thời giữ nguyên độ phân giải đầu vào tối đa 720p. Tính năng này hỗ trợ các nhịp storyboard dài hơn, chuyển cảnh theo tập và chuỗi cảnh tiếp nối từ những cảnh quay đã được phê duyệt.

Chỉnh sửa video bằng ngôn ngữ tự nhiên

Chỉnh sửa một tệp MP4 bằng hướng dẫn ngôn ngữ tự nhiên trong khi giữ nguyên thời lượng nguồn, với đầu ra tối đa 8.7 giây. Các nhóm có thể tạo diện mạo thay thế, biến thể chiến dịch bản địa hóa hoặc cách xử lý hình ảnh được điều chỉnh.

Xây dựng với Grok Imagine Video

Xây dựng các công cụ video điều khiển bằng prompt dựa trên năm chế độ của Grok Imagine Video để tạo video, tạo chuyển động, sử dụng hình ảnh tham chiếu, mở rộng và chỉnh sửa. Nhà phát triển có thể phục vụ quy trình làm việc của nhà sáng tạo từ một họ sản phẩm, đồng thời lựa chọn đầu ra 480p hoặc 720p.

Vị thế của Grok Imagine Video giữa các mô hình video

So sánh quy trình làm việc của Grok Imagine Video với một số lựa chọn thay thế của Atlas Cloud về phương thức đầu vào, độ dài clip, độ phân giải tối đa và mức giá tiêu chuẩn.

Mô hìnhQuy trình đầu vàoĐộ dài clip hoặc phân đoạnĐộ phân giải tối đaGiá tiêu chuẩn
Grok Imagine Video Text-to-VideoPrompt văn bản1–15s720p$0.05/sec
Grok Imagine Video Image-to-VideoẢnh bắt đầu + prompt văn bản1–15s720p$0.05/sec
Grok Imagine Video Reference-to-Video1–7 ảnh tham chiếu + prompt văn bản1–10s720p$0.05/sec
Grok Imagine Video ExtendMP4 dài 2–15s + prompt văn bảnMở rộng 2–10sKhớp với đầu vào, tối đa 720p$0.07/sec
Grok Imagine Video EditMP4 + hướng dẫn bằng văn bảnKhớp với đầu vào, tối đa 8.7s-$0.07/input sec
MiniMax H3 Text-to-VideoPrompt văn bản4–15s2K$0.038/sec
Seedance 2.0 Image-to-VideoẢnh bắt đầu + văn bản, tùy chọn khung hình cuối4–15s4K gốc$0.112/sec
Vidu Q3-Mix Reference to Video1–4 ảnh tham chiếu + prompt văn bản1–16sSR 1440p, gốc tối đa 1080p$0.125/run
Wan-2.7 Video-editVideo nguồn + văn bản, tùy chọn hình ảnh hoặc âm thanh-1080p$0.10/run

Cách Sử Dụng Grok Imagine Video trên Atlas Cloud

Bắt đầu trong vài phút — làm theo các bước đơn giản sau để tích hợp và triển khai mô hình qua nền tảng Atlas Cloud.

Tạo Tài Khoản Atlas Cloud

Đăng ký tại atlascloud.ai và hoàn tất xác minh. Người dùng mới nhận được tín dụng miễn phí để khám phá nền tảng và thử nghiệm mô hình.

Tại sao Sử dụng Grok Imagine Video trên Atlas Cloud

Sự kết hợp của các mô hình tiên tiến của Grok Imagine Video với nền tảng được tăng tốc GPU của Atlas Cloud mang lại hiệu suất, khả năng mở rộng và trải nghiệm nhà phát triển độc đáo.

Hiệu suất và Tính linh hoạt

Độ Trễ Thấp:
Suy luận được tối ưu hóa GPU cho suy luận thời gian thực.

API Thống nhất:
Chạy Grok Imagine Video, GPT, Gemini và DeepSeek với một tích hợp duy nhất.

Giá cả Minh bạch:
Thanh toán dựa trên token có thể dự đoán với tùy chọn serverless.

Doanh nghiệp và Mở rộng

Trải nghiệm Nhà phát triển:
SDK, phân tích, công cụ tinh chỉnh và mẫu.

Độ tin cậy:
99,99% khả dụng, RBAC và ghi nhật ký sẵn sàng cho tuân thủ.

Bảo mật và Tuân thủ:
SOC 2 Type II, tuân thủ HIPAA, chủ quyền dữ liệu tại Hoa Kỳ.

Các câu hỏi và câu trả lời về Grok Imagine Video API

Grok Imagine Video là dòng mô hình tạo video của xAI, dùng để tạo, tạo chuyển động, kéo dài và chỉnh sửa các clip ngắn. Atlas Cloud cung cấp các endpoint API riêng cho quy trình chuyển văn bản thành video, hình ảnh thành video, hình ảnh tham chiếu thành video, kéo dài và chỉnh sửa video.

Grok Imagine Video có thể tạo clip từ văn bản, tạo chuyển động cho một hình ảnh ban đầu hoặc sử dụng tối đa bảy hình ảnh tham chiếu để định hướng người, vật thể và phong cách. Các endpoint riêng biệt có thể tiếp tục một clip hiện có hoặc chỉnh sửa tệp MP4 bằng hướng dẫn ngôn ngữ tự nhiên.

Tạo khóa API Atlas Cloud và gửi yêu cầu POST có xác thực đến /api/v1/model/generateVideo. Chỉ định ID mô hình bắt buộc, prompt và mọi dữ liệu hình ảnh hoặc video mà route đó yêu cầu. Phản hồi bao gồm ID yêu cầu, trạng thái và các trường đầu ra.

Chọn text-to-video khi cảnh bắt đầu từ một prompt hoặc image-to-video khi hình ảnh được cung cấp phải trở thành khung hình đầu tiên. Reference-to-video cung cấp khả năng định hướng rộng hơn từ nhiều hình ảnh, trong khi extend-video và edit-video hoạt động trên các tệp MP4 hiện có.

Text-to-video và image-to-video hỗ trợ các clip dài từ 1 đến 15 giây ở độ phân giải 480p hoặc 720p. Reference-to-video hỗ trợ từ 1 đến 10 giây ở cùng các độ phân giải, với các tỷ lệ khung hình phổ biến gồm 16:9, 9:16, 1:1, 4:3, 3:4, 3:2 và 2:3. Các route mở rộng và chỉnh sửa có những giới hạn đầu vào riêng.

Có. xAI mô tả tính năng tạo âm thanh gốc là một phần của quy trình video Grok Imagine, cho phép tạo âm thanh và hình ảnh cùng lúc. Các schema được Atlas Cloud công bố cho những route này không cung cấp tùy chọn bật/tắt âm thanh riêng.

Cung cấp từ một đến bảy URL hình ảnh HTTPS công khai hoặc URI dữ liệu base64 thông qua endpoint reference-to-video. Các thẻ như <IMAGE_0> có thể liên kết từng hình ảnh tham chiếu với người, vật thể hoặc phong cách được mô tả trong prompt. Route này trả về các clip dài tối đa 10 giây ở độ phân giải 480p hoặc 720p.

Sử dụng extend-video với tệp MP4 dài từ 2 đến 15 giây và yêu cầu thêm từ 2 đến 10 giây hành động được điều khiển bằng prompt. Để thực hiện các thay đổi cụ thể, edit-video chấp nhận tệp MP4 không dài quá 8.7 giây và giữ nguyên thời lượng của tệp. Cả hai route đều giới hạn độ phân giải đầu ra ở mức 720p.

Mức giá tiêu chuẩn của Atlas Cloud là $0.05 mỗi giây cho text-to-video, image-to-video và reference-to-video. Extend-video và edit-video áp dụng mức giá tiêu chuẩn $0.07 mỗi giây. Chỉnh sửa được tính phí theo thời lượng video đầu vào vì đầu ra giữ nguyên thời lượng đó.

Trước tiên, hãy xác nhận endpoint đã chọn phù hợp với loại dữ liệu đầu vào và mọi prompt, URL hình ảnh hoặc URL video bắt buộc đều đã được cung cấp. Kiểm tra các giới hạn riêng của route về thời lượng, độ phân giải, tỷ lệ khung hình, số lượng hình ảnh tham chiếu và tệp MP4 trước khi gửi lại. Nếu yêu cầu thành công nhưng cảnh tạo ra không chính xác, hãy viết lại prompt với mô tả rõ ràng về chuyển động của chủ thể, chuyển động máy quay, nhịp độ và các chi tiết hình ảnh.

Khám phá Thêm Dòng

Seedance 2.5

Seedance 2.5 API hiện đã có mặt trên Atlas Cloud! Cung cấp cho các nhà phát triển mô hình video mới nhất của ByteDance. Nó tạo ra tối đa 30 giây video gốc chỉ trong một lần xử lý từ văn bản, một hình ảnh duy nhất hoặc tối đa 50 tài liệu tham khảo đa phương thức, với âm thanh được đồng bộ hóa và văn bản đa ngôn ngữ trong khung hình. Trên Atlas Cloud, bạn có thể truy cập thông qua một khóa duy nhất, với tính nhất quán của chủ thể và vật lý được cải thiện giúp giữ cho các cảnh quay dài luôn mạch lạc.

Xem Dòng

Wan 3.0

Wan 3.0 API là thế hệ tiếp theo trong hệ sinh thái video Wan của Alibaba, được xây dựng để đưa khả năng tạo video dài, kiểm soát đa tham chiếu và chất lượng nghe nhìn lên những tầm cao mới. Atlas Cloud đã lưu trữ Wan 2.7, 2.6 và 2.5, và Wan 3.0 hoạt động trên cùng một khóa hợp nhất mà không cần thiết lập riêng. Bắt đầu xây dựng ngay hôm nay. Cuộn xuống phần trưng bày để xem những gì Wan 3.0 có thể tạo ra.

Xem Dòng

MiniMax H3

MiniMax H3 là dòng video đa phương thức của MiniMax, hỗ trợ sáng tạo từ văn bản, hình ảnh và nội dung tham chiếu. Trên các route được hỗ trợ, sản phẩm duy trì chủ thể từ nội dung tham chiếu, cung cấp các tỷ lệ khung hình linh hoạt và kết hợp âm thanh được tạo với hình ảnh thông qua H3 Developer, với hồ sơ đầu ra được lựa chọn theo endpoint. Atlas Cloud hợp nhất dòng sản phẩm này dưới một khóa tương thích với OpenAI, cùng mức giá trả theo nhu cầu minh bạch bắt đầu từ mức tiêu chuẩn $0.038 mỗi giây. Hãy bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Seedream 5.0 Pro

Seedream 5.0 Pro API cung cấp cho các nhà phát triển mô hình chỉnh sửa hình ảnh có thể kiểm soát của ByteDance trên Atlas Cloud. Nó đặt các chỉnh sửa một cách chính xác bằng các điểm neo và tọa độ, tách hình ảnh thành các lớp có thể chỉnh sửa, kết hợp nhiều tham chiếu và khớp màu sắc cũng như vật liệu chính xác, với văn bản đa ngôn ngữ ở độ phân giải 2K và 3K. Trên Atlas Cloud, bạn có thể truy cập nó chỉ bằng một khóa!

Xem Dòng

Seedance 2.0

Seedance 2.0 là mô hình video phục vụ môi trường production của ByteDance, giúp tạo cảnh quay chính xác. Biến prompt thành video, tạo chuyển động cho hình ảnh khung hình đầu tiên với tùy chọn hướng dẫn bằng khung hình cuối, hoặc định hình kết quả bằng media tham chiếu và tùy chọn tìm kiếm web. Atlas Cloud hợp nhất các quy trình này trong một API duy nhất, với mức giá pay-as-you-go minh bạch và một key tương thích với OpenAI. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

GPT Image 2.5

Dòng gpt-image-2.5 của OpenAI mang đến cho nhà phát triển lựa chọn giữa Flare và Sunburst cho các quy trình xử lý ảnh trong môi trường production. Kết xuất ở độ phân giải tùy ý lên đến 3840x2160 và chọn một trong năm cấp chất lượng, bao gồm xhigh và max, để đáp ứng các yêu cầu đầu ra cụ thể. Atlas Cloud cung cấp dịch vụ suy luận REST sẵn sàng sử dụng, không cần khởi động nguội, với mức giá tiêu chuẩn từ $0.004 cho mỗi lần tạo. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

GPT Image 2

GPT Image 2 API cung cấp cho các nhà phát triển quyền truy cập vào mô hình hình ảnh mới nhất của OpenAI, phiên bản kế nhiệm của GPT Image 1.5. Mô hình này tạo và chỉnh sửa hình ảnh với khả năng hiển thị văn bản chính xác trên các chữ viết Latinh và CJK, cùng với bố cục mạnh mẽ cho áp phích, mockup và đồ họa thông tin. Trên Atlas Cloud, bạn có thể truy cập nó thông qua một API thống nhất cùng với hơn 300 mô hình khác, với tín dụng miễn phí, 99,99% thời gian hoạt động và không yêu cầu xác minh tổ chức OpenAI.

Xem Dòng

Gemini Omni Flash

Gemini Omni API mang dòng Gemini Omni Flash đa phương thức nguyên bản của Google DeepMind, bao gồm Gemini Omni 1.1 Flash, đến với các nhà phát triển. Tạo video điện ảnh với âm thanh gốc được đồng bộ, tạo chuyển động cho ảnh tĩnh với khả năng kiểm soát chính xác khung hình bắt đầu và kết thúc, hoặc chỉnh sửa cảnh quay hiện có bằng các hướng dẫn văn bản mà vẫn bảo toàn nội dung không được thay đổi. Atlas Cloud cung cấp một khóa tương thích với OpenAI, quyền truy cập hợp nhất và mức giá trả theo mức sử dụng minh bạch. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Grok Imagine

Grok Imagine API của xAI cung cấp các mô hình hình ảnh, video và lời nói, từ Image 2.0 đến Video 1.5 và xAI TTS v1. Render 1K hoặc 2K hình tĩnh trên 14 tỷ lệ khung hình, tạo cảnh 15 giây video 1080p, điều hướng các shot bằng tối đa 7 hình ảnh tham chiếu, hoặc cung cấp lời tường thuật bằng 20 ngôn ngữ. Atlas Cloud chạy mọi chế độ trên một endpoint, có giá theo mô hình trả tiền khi sử dụng từ $0.02 mỗi hình ảnh và $0.05 mỗi giây. Bắt đầu xây dựng hôm nay.

Xem Dòng

Google

Các mô hình sáng tạo mạnh mẽ nhất của Google hiện đều có sẵn trên Atlas Cloud. Veo 3.1 cung cấp khả năng tạo video đậm chất điện ảnh, Nano Banana 2 hỗ trợ tạo hình ảnh có độ chân thực cao, và Gemini mang trí tuệ đa phương thức vào mọi quy trình làm việc. Truy cập toàn bộ bộ mô hình Google thông qua một API key duy nhất với tính khả dụng Day-0 và mức giá dùng bao nhiêu trả bấy nhiêu (pay-as-you-go).

Xem Dòng

Seedance 2.0 Mini

Seedance 2.0 Mini mang khả năng tạo video đa phương thức của ByteDance vào các quy trình làm việc nơi tốc độ và chi phí là quan trọng nhất. Nó cung cấp các khả năng cốt lõi của Seedance 2.0 với mức tiêu thụ tài nguyên nhẹ hơn — tạo nhanh hơn, chi phí mỗi video thấp hơn và tích hợp API giống như bạn đã sử dụng. Đối với các nhóm chạy các quy trình (pipeline) khối lượng lớn hoặc tạo nguyên mẫu ở quy mô lớn, Mini là lựa chọn mặc định thiết thực.

Xem Dòng

ByteDance

Từ tạo video điện ảnh đến kiến tạo hình ảnh có độ trung thực cao, các mô hình mạnh mẽ nhất của ByteDance hiện đã có mặt trên Atlas Cloud. Chạy Seedance và Seedream ở quy mô lớn với mức giá suy luận thấp nhất và không có chi phí quản lý cơ sở hạ tầng.

Xem Dòng

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình