CHỈ TRONG HAI TUẦN | GIẢM 20% cho Seedream 5.0 Pro!

Baidu Models on Atlas Cloud | ERNIE

Atlas Cloud lưu trữ ERNIE Image và ERNIE Image Turbo dưới dạng Baidu API, cả hai đều thanh toán theo mức sử dụng. Mỗi mô hình đều dẫn đầu mã nguồn mở về kết xuất văn bản bằng tiếng Anh và tiếng Trung.

AI Image Models by Baidu

Tạo ra những hình ảnh ấn tượng, sẵn sàng cho sản xuất từ prompt và ảnh tham chiếu bằng các mô hình AI tạo ảnh tiên tiến nhất trên Atlas Cloud.

Xem tất cả mô hình

Baidu Models API Pricing Details

Compare standard vs. our pricing across every Baidu model.

ModelStandard Price (USD)Our Price (USD)Discount
Baidu ERNIE Image Turbo Text-to-image
Start fromFree
View

Explore models from other providers

Instantly explore and experiment with 400+ production-ready models in the Atlas Playground. Start customizing with one click.

Các trường hợp sử dụng Baidu API mà bạn có thể xây dựng trên Atlas Cloud

ERNIE Image được xây dựng cho các quy trình làm việc nơi văn bản phải hiển thị rõ ràng và có thể đọc được bên trong hình ảnh được tạo ra. Các nhóm sử dụng nó để sản xuất tài sản song ngữ, bố cục có cấu trúc và nội dung sáng tạo nhiều văn bản ở quy mô lớn mà không cần đến nhóm thiết kế.

Tạo Áp Phích Tiếp Thị Song Ngữ

Các nhóm tiếp thị sử dụng ERNIE Image để tạo áp phích chiến dịch với văn bản tiếng Anh và tiếng Trung rõ ràng chỉ trong một lệnh gọi API duy nhất, nhắm mục tiêu đến cả hai thị trường từ cùng một cấu trúc prompt. Mô hình kết xuất cả hai ngôn ngữ với độ chính xác trên 0,96, do đó, tiêu đề và nội dung sao chép luôn rõ nét mà không cần chỉnh sửa hậu kỳ. Mức giá thanh toán theo mức sử dụng của Atlas Cloud giúp việc tạo hàng tá biến thể cho mỗi chiến dịch trở nên thiết thực mà không tốn chi phí thiết kế cho từng nội dung.

Bao Bì Sản Phẩm Cho Các Thương Hiệu Xuyên Thị Trường

Các thương hiệu tiến vào thị trường Trung Quốc sử dụng ERNIE Image để tạo các bản mô phỏng nhãn sản phẩm và bao bì với văn bản song ngữ chính xác trước khi cam kết sản xuất in ấn. Mô hình này xử lý chữ Hán giản thể, chữ Hán phồn thể và tiếng Anh trong cùng một bố cục, bao gồm cả văn bản nhỏ trên nhãn và danh sách thành phần. Ở độ phân giải đầu ra 1024×1024, các bản mô phỏng đạt chất lượng sản xuất đủ để sử dụng trong quá trình phê duyệt của khách hàng và nộp hồ sơ quy định.

Sản xuất truyện tranh và bố cục đa khung hình

Các nhà xuất bản và studio nội dung sử dụng ERNIE Image để tạo các khung truyện tranh với bong bóng thoại, hộp chú thích và văn bản khung hình chính xác bằng tiếng Trung hoặc tiếng Anh. Mô hình đạt điểm trên 0,96 trên LongTextBench dành riêng cho loại đầu ra văn bản trong hình ảnh có cấu trúc này. ERNIE Image Turbo trên Atlas Cloud là miễn phí, giúp cho việc phác thảo khung hình số lượng lớn không tốn phí trong giai đoạn lặp lại.

Tạo Infographic Tự Động

Các nhóm dữ liệu xây dựng các pipeline chuyển đổi dữ liệu có cấu trúc thành hình ảnh đồ họa thông tin có gắn nhãn bằng cách sử dụng độ chính xác trong việc kết xuất văn bản của ERNIE Image. Nhãn biểu đồ, hộp chú thích và tiêu đề phần được kết xuất chính xác bằng cả hai ngôn ngữ chỉ từ một prompt duy nhất, loại bỏ bước thiết kế thủ công giữa đầu ra dữ liệu và hình ảnh trực quan. Prompt Enhancer tích hợp sẽ tự động viết lại các mô tả dữ liệu ngắn gọn thành các hướng dẫn bố cục chi tiết.

Sáng tạo quảng cáo bản địa hóa trên quy mô lớn

Các nhóm tiếp thị hiệu suất tạo ra các nội dung quảng cáo được bản địa hóa cho thị trường nói tiếng Trung và tiếng Anh từ cùng một bản tóm tắt chiến dịch, sử dụng khả năng hỗ trợ song ngữ của ERNIE Image để tạo ra cả hai biến thể ngôn ngữ trong một quy trình duy nhất. Mỗi sản phẩm sáng tạo đều đi kèm với văn bản trong hình ảnh chính xác, loại bỏ nhu cầu chỉnh sửa hoặc sắp chữ lại các hình ảnh đã tạo. Bậc Turbo miễn phí trên Atlas Cloud giúp giữ chi phí thử nghiệm ở mức 0 trong khi các nhóm đánh giá xem nên mở rộng quy mô biến thể sáng tạo nào.

Tạo văn bản cho Mockup UI

Các nhóm sản phẩm và thiết kế sử dụng ERNIE Image để tạo ảnh chụp màn hình mockup UI với văn bản giữ chỗ chân thực, được hiển thị chính xác bằng tiếng Anh hoặc tiếng Trung. Mô hình xử lý các nhãn nút, văn bản điều hướng, trường biểu mẫu và văn bản hộp thoại với độ trung thực cao, giúp các mockup có thể sử dụng ngay trong các bài thuyết trình mà không cần chỉnh sửa thủ công các lớp văn bản. Điều này rút ngắn thời gian từ khái niệm wireframe đến hình ảnh hoàn thiện sẵn sàng cho các bên liên quan từ vài giờ xuống còn vài phút.

Biến tm nhìn doanh nghip ca bn thành hin thc vi Atlas Cloud AI.

Liên hệ kinh doanh

Câu hỏi thường gặp về Baidu

ERNIE Image đạt điểm trên 0,96 trên LongTextBench cho việc kết xuất văn bản tiếng Trung, mức cao nhất trong số các mô hình chuyển văn bản thành hình ảnh có trọng số mở (open-weight). Hầu hết các mô hình mã nguồn mở cạnh tranh đều đạt điểm dưới 0,3 trong các tình huống văn bản tiếng Trung, khiến chúng trở nên không đáng tin cậy đối với bất kỳ quy trình làm việc nào yêu cầu tiếng Trung dễ đọc bên trong các hình ảnh được tạo ra. ERNIE Image là sự lựa chọn thiết thực nếu văn bản tiếng Trung chính xác trong đầu ra là một yêu cầu bắt buộc.

Có. ERNIE Image xử lý cả hai loại văn bản trong một lệnh gọi tạo duy nhất, duy trì độ chính xác cao cho từng loại một cách độc lập. Điều này rất hữu ích cho các áp phích song ngữ, bao bì và tài liệu tiếp thị cần cả hai ngôn ngữ có thể đọc được trong cùng một bố cục. Điểm số LongTextBench cho cả tiếng Anh và tiếng Trung đều ở mức trên 0,96.

ERNIE Image bao gồm một Prompt Enhancer hạng nhẹ giúp tự động viết lại các prompt đầu vào ngắn thành các mô tả phong phú và có cấu trúc hơn trước khi chuyển chúng đến mô hình khuếch tán (diffusion model). Điều này có nghĩa là bạn có thể gửi các prompt ngắn gọn và nhận được kết quả đầu ra chi tiết, chính xác hơn mà không cần đến kỹ thuật prompt engineering chuyên sâu. Prompt Enhancer chạy như một phần của quy trình tạo trên mỗi lệnh gọi API.

ERNIE Image Turbo sử dụng DMD (Diffusion Model Distillation) và học tăng cường để nén quá trình suy luận từ 50 bước xuống còn 8 bước, mang lại tốc độ cải thiện hơn 6 lần. Turbo được cung cấp miễn phí trên Atlas Cloud và phù hợp cho việc lặp lại nhanh chóng cũng như tạo bản nháp. Mô hình tiêu chuẩn hoạt động ở chất lượng tối đa cho các tài sản sản xuất cuối cùng như áp phích thương mại và đồ họa biên tập.

Có. ERNIE Image được phát hành theo giấy phép Apache 2.0, cho phép sử dụng thương mại, sửa đổi và phân phối. Các hình ảnh được tạo ra có thể được sử dụng trong quảng cáo, bao bì, ấn phẩm và các ứng dụng thương mại khác. Vui lòng xem toàn bộ điều khoản giấy phép tại kho lưu trữ GitHub của ERNIE Image để biết các điều kiện cụ thể.

Khám phá Thêm Dòng

Seedance 2.0

Seedance 2.0 API cung cấp cho bạn quyền truy cập cấp sản xuất vào mô hình video đa phương thức của ByteDance — đầu vào bốn phương thức (văn bản, hình ảnh, video, âm thanh) và hệ thống "Universal Reference" hàng đầu trong ngành giúp khóa bố cục, chuyển động của camera và hành động của nhân vật trên các cảnh quay. Tích hợp quyền kiểm soát cấp độ đạo diễn bằng một lệnh gọi API, mức giá cố định $0,09/giây, cấp khóa tức thì và không có danh sách chờ — được hỗ trợ bởi thời gian hoạt động và sự tuân thủ cấp doanh nghiệp. Seedance 2.0 Native 4K hiện đã ra mắt!

Xem Dòng

Grok Imagine

Grok Imagine API cung cấp cho các nhà phát triển khả năng tạo hình ảnh, video và âm thanh của xAI trong một bộ công cụ duy nhất. API này tạo ra hình ảnh độ phân giải lên đến 2K với khả năng hiển thị văn bản đa ngôn ngữ, cộng với video lên đến 15 giây với âm thanh gốc, được đồng bộ hóa và chỉnh sửa dựa trên tham chiếu. Trên Atlas Cloud, một khóa duy nhất có thể chạy mọi chế độ Grok Imagine, do đó bạn có thể chuyển đổi giữa hình ảnh, video và âm thanh mà không cần thiết lập riêng biệt, với mức giá từ 0,02 USD cho mỗi hình ảnh và 0,05 USD mỗi giây.

Xem Dòng

Gemini Omni Flash

Gemini Omni API đưa mô hình tạo và chỉnh sửa video đa phương thức của Google DeepMind, được giới thiệu tại Google I/O 2026, vào stack của bạn. Gemini Omni kết hợp công cụ suy luận của Gemini với media tạo sinh, chấp nhận mọi tổ hợp văn bản, hình ảnh, video và âm thanh để tạo ra kết quả nhất quán, dựa trên nền tảng tri thức. Tinh chỉnh kết quả qua hội thoại tự nhiên — hoán đổi vật thể, viết lại cảnh quay và thay đổi phong cách, trong khi vật lý, nhân vật và tính liên tục vẫn được giữ nguyên. Atlas Cloud cung cấp trọn bộ dòng Gemini Omni Flash — chuyển văn bản thành video, chuyển hình ảnh thành video với tối đa 7 hình ảnh tham chiếu, và chuyển tham chiếu thành video — thông qua một API hợp nhất với mức giá minh bạch tính theo giây từ $0.112 và không cần đăng ký thuê bao. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

GPT Image 2

GPT Image 2 API cung cấp cho các nhà phát triển quyền truy cập vào mô hình hình ảnh mới nhất của OpenAI, phiên bản kế nhiệm của GPT Image 1.5. Mô hình này tạo và chỉnh sửa hình ảnh với khả năng hiển thị văn bản chính xác trên các chữ viết Latinh và CJK, cùng với bố cục mạnh mẽ cho áp phích, mockup và đồ họa thông tin. Trên Atlas Cloud, bạn có thể truy cập nó thông qua một API thống nhất cùng với hơn 300 mô hình khác, với tín dụng miễn phí, 99,99% thời gian hoạt động và không yêu cầu xác minh tổ chức OpenAI.

Xem Dòng

Google

Các mô hình sáng tạo mạnh mẽ nhất của Google hiện đều có sẵn trên Atlas Cloud. Veo 3.1 cung cấp khả năng tạo video đậm chất điện ảnh, Nano Banana 2 hỗ trợ tạo hình ảnh có độ chân thực cao, và Gemini mang trí tuệ đa phương thức vào mọi quy trình làm việc. Truy cập toàn bộ bộ mô hình Google thông qua một API key duy nhất với tính khả dụng Day-0 và mức giá dùng bao nhiêu trả bấy nhiêu (pay-as-you-go).

Xem Dòng

Seedance 2.0 Mini

Seedance 2.0 Mini mang khả năng tạo video đa phương thức của ByteDance vào các quy trình làm việc nơi tốc độ và chi phí là quan trọng nhất. Nó cung cấp các khả năng cốt lõi của Seedance 2.0 với mức tiêu thụ tài nguyên nhẹ hơn — tạo nhanh hơn, chi phí mỗi video thấp hơn và tích hợp API giống như bạn đã sử dụng. Đối với các nhóm chạy các quy trình (pipeline) khối lượng lớn hoặc tạo nguyên mẫu ở quy mô lớn, Mini là lựa chọn mặc định thiết thực.

Xem Dòng

ByteDance

Từ tạo video điện ảnh đến kiến tạo hình ảnh có độ trung thực cao, các mô hình mạnh mẽ nhất của ByteDance hiện đã có mặt trên Atlas Cloud. Chạy Seedance và Seedream ở quy mô lớn với mức giá suy luận thấp nhất và không có chi phí quản lý cơ sở hạ tầng.

Xem Dòng

Alibaba

Atlas Cloud tập hợp toàn bộ dòng mô hình của Alibaba dưới một API duy nhất: Qwen cho các tác vụ ngôn ngữ và hình ảnh, Wan để tạo video với độ phân giải lên đến 1080p. Truy cập mọi mô hình theo hình thức dùng đến đâu trả tiền đến đó (pay-as-you-go) mà không cần đăng ký gói. Alibaba API có sẵn thông qua một URL cơ sở (base URL) duy nhất bằng cách sử dụng ứng dụng khách tương thích với OpenAI hiện có của bạn.

Xem Dòng

OpenAI

Atlas Cloud cấp cho bạn quyền truy cập vào toàn bộ danh mục OpenAI API, từ GPT Image 2 để tạo hình ảnh đến Sora 2 cho video. Mọi mô hình đều có sẵn theo hình thức dùng đến đâu trả tiền đến đó (pay-as-you-go) mà không cần cam kết hàng tháng. Tích hợp dễ dàng chỉ bằng cách thay đổi một base URL thông qua API tương thích với OpenAI.

Xem Dòng

xAI

Xây dựng các pipeline hình ảnh và video hoàn chỉnh bằng xAI API trên Atlas Cloud. Tạo ở độ phân giải 2K, chỉnh sửa bằng hình ảnh tham chiếu và tạo hoạt ảnh từ hình ảnh thành các clip đồng bộ với âm thanh.

Xem Dòng

Kwaivgi

Kwaivgi API với mức giá thấp hơn 15% so với giá tiêu chuẩn. Atlas Cloud cung cấp quyền truy cập Day-0 cho các bản phát hành Kling mới với mức giá dùng trả theo mức sử dụng (pay-as-you-go) và không giới hạn số lượng người dùng. Một tài khoản, một khóa, mọi mô hình Kling từ cấp tiêu chuẩn đến cấp master.

Xem Dòng

Seedream 5.0 Pro

Seedream 5.0 Pro API cung cấp cho các nhà phát triển mô hình chỉnh sửa hình ảnh có thể kiểm soát của ByteDance trên Atlas Cloud. Nó đặt các chỉnh sửa một cách chính xác bằng các điểm neo và tọa độ, tách hình ảnh thành các lớp có thể chỉnh sửa, kết hợp nhiều tham chiếu và khớp màu sắc cũng như vật liệu chính xác, với văn bản đa ngôn ngữ ở độ phân giải 2K và 3K. Trên Atlas Cloud, bạn có thể truy cập nó chỉ bằng một khóa!

Xem Dòng

Bài viết đề xuất

Hướng dẫn, bài hướng dẫn và cập nhật sản phẩm giúp bạn khai thác tối đa Atlas Cloud.