MiniMax H3 Developer hiện đã ra mắt — Giảm giá 60%, chỉ từ $0,02 mỗi giây
Hero background 1Hero background 2Hero background 3
Grok Imagine API for 15 Second Video

Grok Imagine API for 15 Second Video

Grok Imagine API của xAI cung cấp các mô hình hình ảnh, video và lời nói, từ Image 2.0 đến Video 1.5 và xAI TTS v1. Render 1K hoặc 2K hình tĩnh trên 14 tỷ lệ khung hình, tạo cảnh 15 giây video 1080p, điều hướng các shot bằng tối đa 7 hình ảnh tham chiếu, hoặc cung cấp lời tường thuật bằng 20 ngôn ngữ. Atlas Cloud chạy mọi chế độ trên một endpoint, có giá theo mô hình trả tiền khi sử dụng từ $0.02 mỗi hình ảnh và $0.05 mỗi giây. Bắt đầu xây dựng hôm nay.

Grok Imagine do xAI phát triển. Atlas Cloud (vận hành bởi Atlas Cloud AI LLC) cung cấp quyền truy cập vào mô hình này và không sở hữu mô hình. Mọi thương hiệu đều thuộc về chủ sở hữu tương ứng.

Khám phá Mô hình Hàng đầu

Atlas Cloud cung cấp cho bạn các mô hình sáng tạo tiên tiến nhất trong ngành.

Mọi Điểm Cuối API Grok Imagine, từ Hình Tĩnh đến Âm Thanh

Chọn mô hình API Grok Imagine phù hợp dựa trên loại đầu vào, độ dài đầu ra, độ phân giải và giá của mỗi lần gọi.

Phương ThứcMô Tả
Grok Imagine Image 2.0 T2I API (Text to Image)Viết một lời nhắc tối đa 8,000 ký tự, điểm cuối này trả về từ một đến bốn hình ảnh ở độ phân giải 1K hoặc 2K. Bạn có thể chọn chất lượng thấp hoặc trung bình để cân bằng nỗ lực kết xuất so với thời gian hoàn thành, với giá $0.04 mỗi hình ảnh. Nó phù hợp cho khám phá khái niệm, nội dung sáng tạo cho mạng xã hội và sản xuất hình ảnh hàng loạt.
Grok Imagine Image 2.0 Edit API (Image to Image)Cung cấp cho điểm cuối tối đa ba hình ảnh tham chiếu với hướng dẫn bằng ngôn ngữ tự nhiên, và nhận kết quả chỉnh sửa ở độ phân giải 1K hoặc 2K theo tỷ lệ khung hình bạn đặt hoặc tự động. Các mức chất lượng thấp và trung bình tương tự áp dụng, và mỗi hình ảnh chi phí $0.04. Tạo kiểu lại sản phẩm, hoán đổi nền và biến thể thiết kế nhanh chóng đều chạy qua một lần gọi.
Grok Imagine Image Quality T2I API (Text to Image)Nơi chi tiết tinh tế quan trọng, điểm cuối này chuyển đổi lời nhắc văn bản thành hình ảnh tĩnh sáng bóng ở 1K hoặc 2K và trả về tối đa bốn biến thể mỗi yêu cầu với giá $0.05 mỗi hình ảnh. Tỷ lệ khung hình bao gồm các định dạng vuông, dọc, ngang và siêu rộng. Sử dụng nó cho hình ảnh chính, nội dung quảng cáo sáng tạo và kết xuất sản phẩm cấp thương hiệu.
Grok Imagine Image Quality Edit API (Image to Image)Nhập từ một đến tám hình ảnh nguồn với hướng dẫn chỉnh sửa và nhận các phiên bản sửa đổi ở 1K hoặc 2K với giá $0.05 mỗi hình ảnh. Các tham chiếu hình ảnh đa được xử lý nội tuyến như <IMAGE_0> và <IMAGE_1>, vì vậy các chủ đề và kiểu dáng có thể được kết hợp trong một hướng dẫn duy nhất. Làm mới chiến dịch, chuyển đổi kiểu dáng và chỉnh sửa tổng hợp là những công việc thông thường.
Grok Imagine Image T2I API (Text to Image)Điểm cuối văn bản sang hình ảnh gốc duy trì đầu ra 1K và 2K và phân nhóm bốn hình ảnh với giá hình ảnh thấp nhất trong họ, $0.02 mỗi hình ảnh. Điều đó làm cho nó là lựa chọn mặc định thực tế cho các quy trình khối lượng cao, tạo hình thu nhỏ và kiểm tra lời nhắc nhanh chóng.
Grok Imagine Image Edit API (Image to Image)Cần chỉnh sửa nhẹ theo quy mô? Điểm cuối này chấp nhận từ một đến tám hình ảnh với hướng dẫn văn bản và trả về tối đa bốn kết quả chỉnh sửa ở 1K hoặc 2K với giá $0.02 mỗi hình ảnh. Dọn dẹp danh mục, biến thể theo mùa và các vòng thiết kế lặp lại giữ chi phí thấp.
Grok Imagine Video v1.5 T2V API (Text to Video)Chỉ một lời nhắc tạo ra từ một đến mười lăm giây video với âm thanh được đồng bộ hóa ở 480p, 720p hoặc 1080p, trên bảy tỷ lệ khung hình. Hóa đơn là $0.08 mỗi giây đầu ra. Trailer, quảng cáo mạng xã hội và cảnh tường thuật cần âm thanh được tích hợp sẵn là những trường hợp sử dụng tốt nhất.
Grok Imagine Video v1.5 I2V API (Image to Video)Cung cấp khung hình bắt đầu và lời nhắc chuyển động, và v1.5 sẽ tạo hoạt hình trong tối đa mười lăm giây ở độ phân giải lên đến 1080p với âm thanh được tạo trong cùng một lần xử lý. Chi phí là $0.08 mỗi giây. Xoay sản phẩm, hoạt hình chân dung và hoạt hình từ tĩnh cho chiến dịch đều phù hợp ở đây.
Grok Imagine Video v1.5 R2V API (Reference to Video)Từ một đến bảy hình ảnh tham chiếu hướng dẫn các nhân vật, đối tượng và kiểu dáng trên màn hình, trong khi tối đa ba giọng nói được chọn từ 26 cài đặt sẵn điều khiển âm thanh nói. Đầu ra đạt mười lăm giây ở 480p hoặc 720p với giá $0.08 mỗi giây. Kể chuyện với nhân vật nhất quán, dùng thử ảo và linh vật thương hiệu được hưởng lợi nhiều nhất.
Grok Imagine Video T2V API (Text to Video)Lời nhắc văn bản trở thành clip từ một đến mười lăm giây ở 480p hoặc 720p, với bảy tỷ lệ khung hình bao gồm định dạng ngang, vuông và dọc. Ở mức $0.05 mỗi giây, nó là lựa chọn giá trị cho nội dung mạng xã hội và bảng khái niệm nhanh chóng.
Grok Imagine Video I2V API (Image to Video)Đặt một hình tĩnh làm khung đầu tiên, mô tả chuyển động bạn muốn, và đoạn clip kéo dài đến mười lăm giây ở 480p hoặc 720p. Giá duy trì ở $0.05 mỗi giây, điều này giữ cho hoạt hình hàng loạt các ảnh sản phẩm và chân dung vẫn giá cả phải chăng.
Grok Imagine Video R2V API (Reference to Video)Từ một đến bảy hình ảnh tham chiếu định hình ai và cái gì xuất hiện trên màn hình mà không cần cố định khung hình mở. Clip chạy tới mười giây ở 480p hoặc 720p và chi phí $0.05 mỗi giây. Sử dụng nó khi danh tính và kiểu dáng phải giữ nhất quán từ cảnh này sang cảnh khác.
Grok Imagine Video Extend API (Video Extension)Một video mp4 hiện có từ hai đến mười lăm giây có thể được tiếp tục thêm hai đến mười giây, hướng dẫn bởi một lời nhắc xác định điều gì xảy ra tiếp theo. Đầu ra khớp với video nguồn và được giới hạn ở 720p, tính hóa đơn ở $0.07 mỗi giây. Nó hữu ích để kéo dài một đoạn ngắn đến độ dài quảng cáo được yêu cầu.
Grok Imagine Video Edit API (Video to Video)Hướng dẫn bằng ngôn ngữ tự nhiên viết lại một video mp4 hiện có trong khi cảnh gốc, chuyển động và khung hình vẫn giữ nguyên. Đầu ra giữ thời lượng nguồn, giới hạn ở 8.7 giây, và hóa đơn theo video đầu vào ở $0.07 mỗi giây. Bổ sung đạo cụ, thay đổi trang phục và tạo kiểu lại xảy ra mà không cần quay lại.
xAI TTS v1 API (Text to Speech)Tối đa 15,000 ký tự văn bản trở thành lời nói tự nhiên với độ trễ dưới một giây trên 20 ngôn ngữ, với phát hiện ngôn ngữ tự động có sẵn. Cung cấp có thể điều chỉnh: tốc độ phát lại từ 0.7x đến 1.5x, codec bao gồm mp3, wav và pcm, và tốc độ lấy mẫu tối đa 48 kHz. Lời thoại ngoài hình, lời nhắc IVR và lời tường thuật trong ứng dụng là những trường hợp sử dụng lý tưởng.

Các tính năng chính của Grok Imagine API

Khám phá những gì Grok Imagine API mang lại, từ tạo hình ảnh 2K với văn bản đa ngôn ngữ đến video đa phương thức với âm thanh đồng bộ gốc và các chế độ sáng tạo.

Kết xuất độ phân giải siêu cao bằng API chất lượng hình ảnh Grok Imagine

Kết xuất độ phân giải siêu cao bằng API chất lượng hình ảnh Grok Imagine

Grok Imagine Image Quality API cung cấp khả năng tạo hình ảnh ở độ phân giải lên đến 2K với các chi tiết sắc nét trên mọi kết quả đầu ra. Bằng cách giữ nguyên các kết cấu mịn và bố cục phức tạp ở quy mô lớn, người dùng có thể tạo ra các hình ảnh trực quan vẫn giữ được độ sắc nét ngay cả khi hiển thị ở các định dạng cực lớn. Đây là giải pháp tối ưu cho hình ảnh hero, sản phẩm sáng tạo quảng cáo và bản kết xuất sản phẩm cấp độ thương hiệu.

Kết Xuất Văn Bản Đa Ngôn Ngữ

Kết Xuất Văn Bản Đa Ngôn Ngữ

Grok Imagine Image Quality API cung cấp khả năng kết xuất văn bản tốt nhất trong phân khúc trên nhiều ngôn ngữ trực tiếp trong các hình ảnh được tạo. Bằng cách tái tạo chính xác kiểu chữ, hệ thống chữ viết và ký tự trong bất kỳ ngôn ngữ nào, người dùng có thể nhúng bản sao dễ đọc vào hình ảnh của họ mà không cần chỉnh sửa hậu kỳ thủ công. Đây là giải pháp tối ưu cho các ấn phẩm quảng cáo, chiến dịch tiếp thị bản địa hóa và hình ảnh mang đẳng cấp thương hiệu.

Tạo Ảnh Chân Thực

Tạo Ảnh Chân Thực

Grok Imagine API tạo ra các đầu ra có độ chân thực như ảnh chụp, nổi bật với ánh sáng tự nhiên, kết cấu phong phú và đặc tính vật lý đáng tin cậy trong từng khung cảnh. Bằng cách mô phỏng quang học và hành vi vật liệu của thế giới thực, người dùng có thể tạo ra những hình ảnh không thể phân biệt được về mặt thị giác so với nhiếp ảnh chuyên nghiệp. Đây là giải pháp tối ưu cho kết xuất sản phẩm, hình ảnh chính và hình ảnh thương hiệu cao cấp.

Kiểm Soát Prompt Chính Xác và Chỉnh Sửa Dựa Trên Tham Chiếu

Kiểm Soát Prompt Chính Xác và Chỉnh Sửa Dựa Trên Tham Chiếu

Grok Imagine Image Quality API hỗ trợ tuân thủ prompt chặt chẽ hơn cùng với tính năng chỉnh sửa hình ảnh nâng cao được thúc đẩy bởi dữ liệu đầu vào tham chiếu. Bằng cách diễn giải các hướng dẫn chi tiết và khớp các tín hiệu phong cách từ các bản tham chiếu được tải lên, người dùng có thể tinh chỉnh và thay đổi phong cách hình ảnh với độ chính xác tuyệt đối. Đây là giải pháp tối ưu cho các sản phẩm sáng tạo quảng cáo, bản kết xuất sản phẩm và hình ảnh chất lượng chuẩn thương hiệu nhất quán.

Tạo Âm thanh và Video Nguyên bản

Tạo Âm thanh và Video Nguyên bản

Tự động tạo nhạc, hiệu ứng âm thanh và đoạn hội thoại đồng bộ với từng clip, nhờ đó âm thanh và chuyển động luôn ăn khớp với nhau chỉ trong một lần xử lý. Các clip không cần thực hiện riêng bước xử lý âm thanh và ở trong trạng thái sẵn sàng sử dụng ngay.

Tạo video đa phương thức

Tạo video đa phương thức

Nó bao gồm chuyển văn bản thành video, hình ảnh thành video, tham chiếu thành video và chỉnh sửa video trong một bộ công cụ duy nhất. Bạn có thể chuyển đổi giữa các tác vụ tạo và chỉnh sửa mà không cần thay đổi mô hình hay công cụ tích hợp.

Kiểm soát chuyển động và tính nhất quán

Kiểm soát chuyển động và tính nhất quán

Grok Imagine Video API tạo ra chuyển động tự nhiên với hiệu ứng vật lý ổn định và chủ thể nhất quán qua các khung hình. Điều này làm giảm hiện tượng nhấp nháy và nhiễu ảnh trong các video clip dài hơn, giữ cho các nhân vật và cảnh quay mạch lạc từ đầu đến cuối.

Một Prompt, Ba Model: Grok Imagine API Side by Side

Mỗi hàng chạy cùng một prompt qua Grok Imagine API và hai model đối thủ trên Atlas Cloud, giúp đánh giá chuyển động, đồng bộ âm thanh, chi tiết và typography trên cùng điều kiện.

Prompt

Cảnh chợ đêm điện ảnh hành động thực tế, khoảng 10 giây. Mở đầu bằng góc quay thấp di chuyển dọc theo các quầy hàng bốc khói, một đầu bếp trẻ mặc áo ba lỗ ướt sũng quăng mì, ngọn lửa bùng lên từ chảo và soi sáng khuôn mặt anh ta màu cam. Camera whip pan sang phải vào cận cảnh thu nhỏ tôm đang áp chảo và cuộn trong dầu, giọt dầu bắn tung tóe, sau đó kéo lùi và cần lên phía trên quầy khi anh ta bắt lại chảo quay và chan mì ra đĩa trong một chuyển động liên tục. Chút cuối: một con mèo chợ lông xù nhảy lên quầy, vồ lấy một con tôm và lao vào đám đông trong khi đầu bếp quay lại cười, camera chuyển sang chạy tay nhanh theo sau con mèo. Vỉa hè ướt phản chiếu ánh đèn lồng đỏ, hơi nước bốc lên, độ sâu trường ảnh nông, phong cách phim tài liệu thô với hạt phim mịn. Âm thanh: tiếng bếp ga rú, tiếng dầu sôi sùng sục, tiếng trò chuyện và xoong chảo leng keng ở chợ, một nhịp trống tăng dần trúng đúng vào cú nhảy của con mèo. Tỷ lệ khung hình 16:9.

Generated with Grok Imagine Video v1.5 on Atlas Cloud

Generated with Veo3.1 on Atlas Cloud

Generated with Grok Imagine Video on Atlas Cloud

Prompt

Extreme macro photograph shot at tabletop level, camera lens resting flat on the wooden desk surface at the eye height of a 1:64 scale figure, looking horizontally across a miniature modeling workbench in the exact instant the illusion of scale becomes real. In the mid-ground, a wave of blue-tinted epoxy resin has been frozen mid-curl, its surface just misted with a water sprayer so genuine droplets bead and cling to the glossy resin; three tiny hand-painted surfers in bright orange swim trunks ride down the face of the frozen wave, one crouched low with an arm dragging through the resin, and a spray of real water beads flings off the wave's lip, caught sharp in mid-air with tiny burst highlights on every droplet edge. Behind them, softly out of focus, the hand of a young woman modelmaker hovers in the air holding fine steel tweezers, suspended and enormous like a giant who has wandered into the world she built; only the lower half of her face is visible at the top of the frame, the corner of her mouth curved into a small delighted smile, all of it dissolved into creamy bokeh. Late-afternoon hard sunlight cuts through venetian blinds, painting a row of crisp diagonal light bars and clean shadows across the bare wood and over the resin sea, striping the surfers' shoulders. A single dropped, out-of-focus miniature part — a stray plastic sprue fragment — sits in the extreme foreground as a blurred occluding layer at the lower left, separating planes; strips of blue masking tape edge the resin sea, and negative space is left on the right side for the hovering tweezers. Complementary orange-and-blue palette: cool blue resin and blue tape against warm orange trunks, grounded by the warm honey tone of the oak desk. Shot on 100mm f/2.8 macro lens, ultra-shallow depth of field with buttery focus falloff, telephoto compression from an ultra-low camera position, visible fine film grain, true photographic realism, no illustration, no CGI look. Wide 16:9 aspect ratio, full-bleed horizontal composition.

Generated with Grok Imagine Image 2.0 on Atlas Cloud

Generated with Grok Imagine Image 2.0 on Atlas Cloud

Generated with Seedream v5.0 Pro on Atlas Cloud

Generated with Seedream v5.0 Pro on Atlas Cloud

Generated with Grok Imagine Image Quality on Atlas Cloud

Generated with Grok Imagine Image Quality on Atlas Cloud

Bạn có thể làm gì với các mô hình Grok Imagine

Khám phá những gì bạn có thể xây dựng với Grok Imagine API, từ hình ảnh thương hiệu chân thực như ảnh chụp và áp phích quảng cáo đa ngôn ngữ đến video trưng bày sản phẩm, hoạt ảnh chân dung và chỉnh sửa dựa trên tham chiếu.

Hình ảnh thương hiệu siêu chân thực

Grok Imagine Image Quality API cho phép các nhà sáng tạo và nhà phát triển tạo ra hình ảnh quang học chân thực (photorealistic) với ánh sáng tự nhiên, kết cấu phong phú và hiệu ứng vật lý đáng tin cậy. Lý tưởng cho các nhóm tiếp thị và studio thiết kế theo đuổi chất lượng đầu ra cấp studio, API kết xuất độ phân giải 2K sắc nét và chi tiết vật liệu sống động — hỗ trợ hình ảnh chính (hero images), quảng cáo sáng tạo và kết xuất sản phẩm cao cấp.

Thiết kế Áp phích và Quảng cáo Đa ngôn ngữ

Đối với nội dung sáng tạo được phân phối trên toàn cầu, Grok Imagine Image Quality API tạo ra các hình ảnh với khả năng kết xuất văn bản tốt nhất trong phân khúc, kiểu chữ đa ngôn ngữ chính xác và tích hợp ký tự gọn gàng trực tiếp vào tác phẩm nghệ thuật. Trường hợp sử dụng này phù hợp với các công ty quảng cáo, chuyên gia bản địa hóa và nhà thiết kế thương hiệu sản xuất hình ảnh yêu cầu văn bản dễ đọc, đúng thương hiệu được nhúng vào hình ảnh cuối cùng.

Chỉnh sửa hình ảnh dựa trên tham chiếu

Grok Imagine Image Quality API trao quyền cho các nhà thiết kế tinh chỉnh và thay đổi phong cách các hình ảnh hiện có thông qua việc tuân thủ lời nhắc chặt chẽ hơn, đầu vào dựa trên tài liệu tham khảo và kiểm soát bố cục chính xác. Lý tưởng cho các quy trình sản xuất sáng tạo lặp đi lặp lại và tính nhất quán của thương hiệu, API này duy trì sự mạch lạc về phong cách qua các lần chỉnh sửa—hỗ trợ tinh chỉnh khái niệm, biến thể thiết kế và các sản phẩm hoàn thiện cuối cùng cho các chiến dịch thương mại.

Trình Diễn Sản Phẩm Điện Ảnh

Grok Imagine Video Text-to-Video API cho phép các nhà sáng tạo và nhà phát triển tạo ra các chuỗi video điện ảnh từ một lời nhắc văn bản duy nhất, hoàn chỉnh với âm thanh gốc và độ phân giải lên đến 720p. Lý tưởng cho các nhóm tiếp thị và studio nội dung theo đuổi đầu ra video sẵn sàng cho sản xuất, API hiển thị chuyển động động, di chuyển máy ảnh tự nhiên và âm thanh đồng bộ—hỗ trợ các chiến dịch thương hiệu, nội dung truyền thông xã hội và các câu chuyện quảng cáo nhập vai.

Hoạt ảnh Chân dung và Sản phẩm

Dành cho các nhà sáng tạo muốn thổi hồn vào các hình ảnh tĩnh, API Image-to-Video của Grok Imagine Video sẽ chuyển đổi ảnh tĩnh thành các đoạn video mượt mà, chân thực với khung hình đầu tiên được giữ nguyên từ hình ảnh gốc. Trường hợp sử dụng này phù hợp với các thương hiệu thương mại điện tử, nghệ sĩ kỹ thuật số và đội ngũ quảng cáo chuyên sản xuất các video trưng bày sản phẩm hoạt hình, hoạt ảnh chân dung và nội dung làm bừng sáng khung cảnh, đòi hỏi sự liền mạch về mặt hình ảnh từ tài sản gốc.

Chỉnh sửa video không phá hủy

Đối với các nhóm hậu kỳ và các công ty sáng tạo yêu cầu sửa đổi chính xác, có mục tiêu đối với cảnh quay hiện có, Grok Imagine Video Edit API áp dụng các lệnh bằng ngôn ngữ tự nhiên vào một video hiện có trong khi vẫn giữ nguyên cảnh, chuyển động và bố cục ban đầu. Trường hợp sử dụng này phù hợp với các nhà biên tập video, nhà sản xuất tiếp thị và các nhóm thương hiệu đang tinh chỉnh cảnh quay chiến dịch—cho phép thêm đạo cụ, thay đổi trang phục và tạo kiểu lại hình ảnh mà không làm phá vỡ cấu trúc video cơ bản.

So sánh Mô hình

Xem các mô hình từ các nhà cung cấp khác nhau so sánh như thế nào — so sánh hiệu suất, giá cả và điểm mạnh độc đáo để đưa ra quyết định sáng suốt.

Mô hìnhGiới hạn Ảnh tham chiếuSố lượng Đầu raĐộ phân giảiTỷ lệ Khung hình
Chất lượng Hình ảnh Grok Imagine81~42K, 1KTự động, 1:1, 3:2, 2:3, 3:4, 4:3, 9:16, 16:9, 9:19.5, 19.5:9, 9:20, 20:9, 1:2, 2:1
Nano Banana 21414K, 2K, 1K1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9
Nano Banana Pro1014K, 2K, 1K1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9
Seedream 5.0 Lite141~152K~4K+1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9
Qwen-Image31~6512P~2KChiều rộng[512, 2048]px, Chiều cao[512, 2048]px

Cách Sử Dụng Grok Imagine trên Atlas Cloud

Bắt đầu trong vài phút — làm theo các bước đơn giản sau để tích hợp và triển khai mô hình qua nền tảng Atlas Cloud.

Tạo Tài Khoản Atlas Cloud

Đăng ký tại atlascloud.ai và hoàn tất xác minh. Người dùng mới nhận được tín dụng miễn phí để khám phá nền tảng và thử nghiệm mô hình.

Tại sao Sử dụng Grok Imagine trên Atlas Cloud

Sự kết hợp của các mô hình tiên tiến của Grok Imagine với nền tảng được tăng tốc GPU của Atlas Cloud mang lại hiệu suất, khả năng mở rộng và trải nghiệm nhà phát triển độc đáo.

Hiệu suất và Tính linh hoạt

Độ Trễ Thấp:
Suy luận được tối ưu hóa GPU cho suy luận thời gian thực.

API Thống nhất:
Chạy Grok Imagine, GPT, Gemini và DeepSeek với một tích hợp duy nhất.

Giá cả Minh bạch:
Thanh toán dựa trên token có thể dự đoán với tùy chọn serverless.

Doanh nghiệp và Mở rộng

Trải nghiệm Nhà phát triển:
SDK, phân tích, công cụ tinh chỉnh và mẫu.

Độ tin cậy:
99,99% khả dụng, RBAC và ghi nhật ký sẵn sàng cho tuân thủ.

Bảo mật và Tuân thủ:
SOC 2 Type II, tuân thủ HIPAA, chủ quyền dữ liệu tại Hoa Kỳ.

Các câu hỏi nhà phát triển thường hỏi về Grok Imagine API

Grok Imagine API là điểm truy cập thống nhất của Atlas Cloud cho bộ generative stack Grok Imagine của xAI, bao gồm tạo ảnh, chỉnh sửa ảnh, video và giọng nói. Một API key duy nhất truy cập mọi chế độ, bao gồm các model mới nhất Grok Imagine Image 2.0 Text-to-Image và Grok Imagine Image 2.0 Edit phát hành ngày 7 tháng 8 năm 2026. Thanh toán theo trả trước cho mỗi lần tạo thành công, nghĩa là bạn trả tiền theo mỗi request mà không cần đăng ký gói.

Ba model tạo ảnh song song: Grok Imagine Image giá $0.02 mỗi ảnh, Grok Imagine Image Quality giá $0.05, và Grok Imagine Image 2.0 từ $0.04, mỗi model đều có endpoint chỉnh sửa riêng. Video chạy qua Grok Imagine Video giá $0.05/giây và Grok Imagine Video v1.5 giá $0.08/giây, đi kèm endpoint mở rộng và chỉnh sửa. xAI TTS v1 hoàn thiện bộ sản phẩm với hơn 80 giọng nói trên 20 ngôn ngữ.

Image 2.0 bố trí typography và layout như một designer, nên các thành phần dày đặc và chữ nhỏ vẫn rõ ràng thay vì bị nhòe thành texture. Model cũng cung cấp tier chất lượng có thể chọn, cho phép bạn đánh đổi thời gian render với độ trung thực trên cùng prompt, điều mà các model Image và Image Quality trước đó không có. Cả hai variant Text-to-Image và Edit đều chia sẻ tính năng này.

Bảng giá tính theo mỗi lần tạo thành công, không có chi phí tối thiểu. Grok Imagine Image 2.0 giá $0.04 mỗi ảnh ở chất lượng thấp và 1K, $0.06 ở chất lượng thấp với 2K hoặc chất lượng trung bình với 1K, và $0.08 ở chất lượng trung bình với 2K, trong khi mỗi ảnh đầu vào trên endpoint Edit thêm $0.01. Với các model ảnh khác, Grok Imagine Image giá $0.02 mỗi ảnh và Grok Imagine Image Quality giá $0.05, video bắt đầu từ $0.05/giây.

Tạo API key Atlas Cloud, sau đó gửi prompt và model id như xai/grok-imagine-image-2.0/text-to-image đến endpoint tạo ảnh. Quá trình render là bất đồng bộ, nên request trả về một request id mà bạn sẽ polling trên prediction endpoint cho đến khi status chuyển từ processing sang completed. Vì mọi model Grok Imagine đều theo cùng pattern, việc thêm video hoặc giọng nói sau này chỉ cần thay đổi một chuỗi. Bắt đầu phát triển ngay hôm nay.

Đầu ra render ở 1K (1024x1024) hoặc 2K (2048x2048) trên 14 tỷ lệ khung hình, từ vuông 1:1 và widescreen 16:9 đến dọc 9:20 và ultrawide 20:9 dạng banner. Một request có thể trả về tối đa bốn ảnh, và prompt có thể dài đến 8.000 ký tự. Trên endpoint Edit, aspect ratio mặc định là auto và theo ảnh đầu vào đầu tiên của bạn trừ khi bạn đặt rõ ràng.

Tối đa ba ảnh nguồn mỗi request, cung cấp dưới dạng public URL hoặc base64 data URI. Khi truyền nhiều hơn một, hãy trích dẫn chúng trong prompt dưới dạng <IMAGE_0>, <IMAGE_1>, và <IMAGE_2> để model biết mỗi chỉ thị áp dụng cho asset nào. Mỗi ảnh đầu vào thêm $0.01 vào request, và bạn có thể yêu cầu từ một đến bốn biến thể chỉnh sửa cùng lúc.

Có. Grok Imagine Video v1.5 tạo âm thanh native, đồng bộ trong cùng một lần chạy với hình ảnh, nên nhạc, hiệu ứng âm thanh và thoại khớp với chuyển động thay vì cần pipeline thứ hai. Chế độ reference-to-video của nó chấp nhận giọng tham chiếu tùy chọn cùng với một đến bảy ảnh tham chiếu. Đoạn clip dài tối đa 15 giây, đạt 1080p trên text-to-video và image-to-video.

Chọn Image 2.0 khi khung hình chứa typography, layout, hoặc chi tiết đa phần cần giữ nguyên, và khi bạn muốn kiểm soát trực tiếp sự đánh đổi giữa tốc độ và độ trung thực. Grok Imagine Image Quality giữ mức giá cố định đơn giản $0.05 mỗi ảnh với cùng đầu ra 1K và 2K và 14 tỷ lệ khung hình. Nếu khối lượng quan trọng hơn chữ tinh tế, Grok Imagine Image gốc giá $0.02 mỗi ảnh vẫn là lựa chọn kinh tế nhất.

Medium là tier chất lượng mặc định và mất khoảng 84 giây ở 1K vì nó nhắm đến đầu ra tốt nhất của model. Đặt chất lượng thành low giảm xuống còn khoảng 10 giây, nhanh gấp 8 lần, với giá $0.04 thay vì $0.06 cho ảnh 1K. Soạn thảo và lặp lại ở chất lượng low, sau đó chạy lại chỉ những prompt thắng ở medium và 2K khi composition đã ổn định.

Khám phá Thêm Dòng

Seedance 2.5

Seedance 2.5 API hiện đã có mặt trên Atlas Cloud! Cung cấp cho các nhà phát triển mô hình video mới nhất của ByteDance. Nó tạo ra tối đa 30 giây video gốc chỉ trong một lần xử lý từ văn bản, một hình ảnh duy nhất hoặc tối đa 50 tài liệu tham khảo đa phương thức, với âm thanh được đồng bộ hóa và văn bản đa ngôn ngữ trong khung hình. Trên Atlas Cloud, bạn có thể truy cập thông qua một khóa duy nhất, với tính nhất quán của chủ thể và vật lý được cải thiện giúp giữ cho các cảnh quay dài luôn mạch lạc.

Xem Dòng

Wan 3.0

Wan 3.0 API là thế hệ tiếp theo trong hệ sinh thái video Wan của Alibaba, được xây dựng để đưa khả năng tạo video dài, kiểm soát đa tham chiếu và chất lượng nghe nhìn lên những tầm cao mới. Atlas Cloud đã lưu trữ Wan 2.7, 2.6 và 2.5, và Wan 3.0 hoạt động trên cùng một khóa hợp nhất mà không cần thiết lập riêng. Bắt đầu xây dựng ngay hôm nay. Cuộn xuống phần trưng bày để xem những gì Wan 3.0 có thể tạo ra.

Xem Dòng

MiniMax H3

API MiniMax H3 mở quyền truy cập vào mô hình video đa phương thức đa dụng của MiniMax, có thể đọc văn bản, hình ảnh, video và âm thanh như một ngữ cảnh duy nhất thay vì xử lý từng tác vụ riêng lẻ. Các clip có thời lượng từ 5 đến 15 giây ở 24 FPS, hỗ trợ nhiều tỷ lệ khung hình từ 21:9 đến 9:16; chỉ với một prompt, bạn có thể hoán đổi nhân vật, thay nền, viết lại hội thoại hoặc sao chép giọng nói từ một clip tham chiếu. Atlas Cloud cung cấp toàn bộ khả năng này thông qua một endpoint tương thích OpenAI. Hãy bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Seedream 5.0 Pro

Seedream 5.0 Pro API cung cấp cho các nhà phát triển mô hình chỉnh sửa hình ảnh có thể kiểm soát của ByteDance trên Atlas Cloud. Nó đặt các chỉnh sửa một cách chính xác bằng các điểm neo và tọa độ, tách hình ảnh thành các lớp có thể chỉnh sửa, kết hợp nhiều tham chiếu và khớp màu sắc cũng như vật liệu chính xác, với văn bản đa ngôn ngữ ở độ phân giải 2K và 3K. Trên Atlas Cloud, bạn có thể truy cập nó chỉ bằng một khóa!

Xem Dòng

Seedance 2.0

Seedance 2.0 API cung cấp cho bạn quyền truy cập cấp sản xuất vào mô hình video đa phương thức của ByteDance — đầu vào bốn phương thức (văn bản, hình ảnh, video, âm thanh) và hệ thống "Universal Reference" hàng đầu trong ngành giúp khóa bố cục, chuyển động của camera và hành động của nhân vật trên các cảnh quay. Tích hợp quyền kiểm soát cấp độ đạo diễn bằng một lệnh gọi API, mức giá cố định $0,09/giây, cấp khóa tức thì và không có danh sách chờ — được hỗ trợ bởi thời gian hoạt động và sự tuân thủ cấp doanh nghiệp. Seedance 2.0 Native 4K hiện đã ra mắt!

Xem Dòng

GPT Image 2

GPT Image 2 API cung cấp cho các nhà phát triển quyền truy cập vào mô hình hình ảnh mới nhất của OpenAI, phiên bản kế nhiệm của GPT Image 1.5. Mô hình này tạo và chỉnh sửa hình ảnh với khả năng hiển thị văn bản chính xác trên các chữ viết Latinh và CJK, cùng với bố cục mạnh mẽ cho áp phích, mockup và đồ họa thông tin. Trên Atlas Cloud, bạn có thể truy cập nó thông qua một API thống nhất cùng với hơn 300 mô hình khác, với tín dụng miễn phí, 99,99% thời gian hoạt động và không yêu cầu xác minh tổ chức OpenAI.

Xem Dòng

Gemini Omni Flash

Gemini Omni API đưa mô hình tạo và chỉnh sửa video đa phương thức của Google DeepMind, được giới thiệu tại Google I/O 2026, vào stack của bạn. Gemini Omni kết hợp công cụ suy luận của Gemini với media tạo sinh, chấp nhận mọi tổ hợp văn bản, hình ảnh, video và âm thanh để tạo ra kết quả nhất quán, dựa trên nền tảng tri thức. Tinh chỉnh kết quả qua hội thoại tự nhiên — hoán đổi vật thể, viết lại cảnh quay và thay đổi phong cách, trong khi vật lý, nhân vật và tính liên tục vẫn được giữ nguyên. Atlas Cloud cung cấp trọn bộ dòng Gemini Omni Flash — chuyển văn bản thành video, chuyển hình ảnh thành video với tối đa 7 hình ảnh tham chiếu, và chuyển tham chiếu thành video — thông qua một API hợp nhất với mức giá minh bạch tính theo giây từ $0.112 và không cần đăng ký thuê bao. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Grok Imagine

Grok Imagine API của xAI cung cấp các mô hình hình ảnh, video và lời nói, từ Image 2.0 đến Video 1.5 và xAI TTS v1. Render 1K hoặc 2K hình tĩnh trên 14 tỷ lệ khung hình, tạo cảnh 15 giây video 1080p, điều hướng các shot bằng tối đa 7 hình ảnh tham chiếu, hoặc cung cấp lời tường thuật bằng 20 ngôn ngữ. Atlas Cloud chạy mọi chế độ trên một endpoint, có giá theo mô hình trả tiền khi sử dụng từ $0.02 mỗi hình ảnh và $0.05 mỗi giây. Bắt đầu xây dựng hôm nay.

Xem Dòng

Google

Các mô hình sáng tạo mạnh mẽ nhất của Google hiện đều có sẵn trên Atlas Cloud. Veo 3.1 cung cấp khả năng tạo video đậm chất điện ảnh, Nano Banana 2 hỗ trợ tạo hình ảnh có độ chân thực cao, và Gemini mang trí tuệ đa phương thức vào mọi quy trình làm việc. Truy cập toàn bộ bộ mô hình Google thông qua một API key duy nhất với tính khả dụng Day-0 và mức giá dùng bao nhiêu trả bấy nhiêu (pay-as-you-go).

Xem Dòng

Seedance 2.0 Mini

Seedance 2.0 Mini mang khả năng tạo video đa phương thức của ByteDance vào các quy trình làm việc nơi tốc độ và chi phí là quan trọng nhất. Nó cung cấp các khả năng cốt lõi của Seedance 2.0 với mức tiêu thụ tài nguyên nhẹ hơn — tạo nhanh hơn, chi phí mỗi video thấp hơn và tích hợp API giống như bạn đã sử dụng. Đối với các nhóm chạy các quy trình (pipeline) khối lượng lớn hoặc tạo nguyên mẫu ở quy mô lớn, Mini là lựa chọn mặc định thiết thực.

Xem Dòng

ByteDance

Từ tạo video điện ảnh đến kiến tạo hình ảnh có độ trung thực cao, các mô hình mạnh mẽ nhất của ByteDance hiện đã có mặt trên Atlas Cloud. Chạy Seedance và Seedream ở quy mô lớn với mức giá suy luận thấp nhất và không có chi phí quản lý cơ sở hạ tầng.

Xem Dòng

Alibaba

Atlas Cloud tập hợp toàn bộ dòng mô hình của Alibaba dưới một API duy nhất: Qwen cho các tác vụ ngôn ngữ và hình ảnh, Wan để tạo video với độ phân giải lên đến 1080p. Truy cập mọi mô hình theo hình thức dùng đến đâu trả tiền đến đó (pay-as-you-go) mà không cần đăng ký gói. Alibaba API có sẵn thông qua một URL cơ sở (base URL) duy nhất bằng cách sử dụng ứng dụng khách tương thích với OpenAI hiện có của bạn.

Xem Dòng

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình