


Qwen Image 3.0 pro là dòng sản phẩm tạo và chỉnh sửa hình ảnh của Qwen dành cho các nhà phát triển xây dựng quy trình xử lý hình ảnh trong môi trường production. Sản phẩm tạo được hình ảnh lên đến 2048×2048, tự động viết lại prompt, lựa chọn độ phân giải dựa trên ý định trong prompt và tuân theo các hướng dẫn chỉnh sửa bằng ngôn ngữ tự nhiên, đồng thời bảo toàn đặc điểm khuôn mặt và danh tính. Truy cập cả hai model thông qua Atlas Cloud bằng một khóa tương thích với OpenAI, với mức giá tiêu chuẩn trả theo lượt sử dụng là $0.04 mỗi lần gọi. Bắt đầu xây dựng ngay hôm nay.
Qwen Image 3.0 Pro do Alibaba phát triển. Atlas Cloud (vận hành bởi Atlas Cloud AI LLC) cung cấp quyền truy cập vào mô hình này và không sở hữu mô hình. Mọi thương hiệu đều thuộc về chủ sở hữu tương ứng.
Atlas Cloud cung cấp cho bạn các mô hình sáng tạo tiên tiến nhất trong ngành.
So sánh các endpoint chuyển văn bản thành hình ảnh và chỉnh sửa dựa trên ảnh tham chiếu hiện có cho Qwen Image 3.0 pro.
| Phương thức | Mô tả |
|---|---|
| Qwen Image 3.0 Pro API (Text to Image) | Chuyển prompt văn bản thành hình ảnh với độ phân giải lên đến 2048×2048, hỗ trợ tự động viết lại prompt và lựa chọn độ phân giải theo prompt. Khả năng hiển thị văn bản phức tạp mạnh mẽ cùng mức độ tuân thủ prompt chính xác giúp tạo poster, hình ảnh sản phẩm, tranh minh họa và các tài sản yêu cầu bố cục chặt chẽ khác. |
| Qwen Image 3.0 Pro API (Image Editing) | Cung cấp từ một đến ba ảnh tham chiếu cùng hướng dẫn bằng ngôn ngữ tự nhiên để tạo ảnh đã chỉnh sửa. Các chi tiết quan trọng như đặc điểm khuôn mặt và danh tính được bảo toàn trong khi áp dụng các thay đổi được yêu cầu, khiến endpoint này phù hợp cho việc tinh chỉnh ảnh chân dung, tạo biến thể hình ảnh và cập nhật tài sản có kiểm soát. |
Qwen Image 3.0 pro kết hợp khả năng hiển thị văn bản phức tạp, tuân thủ prompt chính xác, tạo ảnh lên đến 2048 × 2048, tự động viết lại prompt và chỉnh sửa bảo toàn danh tính từ một đến ba ảnh tham chiếu thông qua API hợp nhất tính phí theo mức sử dụng của Atlas Cloud.

Qwen Image 3.0 pro tuân thủ các prompt chi tiết đồng thời xử lý việc hiển thị văn bản phức tạp bằng tiếng Anh và tiếng Trung. Mô hình có thể sắp xếp các bố cục sáng tạo dày đặc mà không tách phần chữ khỏi bối cảnh. Chỉ cần chỉ định nội dung, thứ bậc, bố cục và phong cách hình ảnh trong một yêu cầu, sau đó rà soát tên và số liệu trước khi xuất bản. Điều này khiến mô hình phù hợp cho banner, đồ họa biên tập, ý tưởng bao bì và các tác phẩm giàu thông tin.

Tạo ảnh ở độ phân giải lên đến 2048 × 2048 khi cần texture tinh tế và chi tiết dễ đọc. Tính năng chọn kích thước dựa trên prompt có thể tự động chọn độ phân giải đầu ra, trong khi kích thước cụ thể cho phép bạn nhắm đến một canvas xác định. Từ ảnh chụp sản phẩm đến chân dung biên tập, ngân sách pixel bổ sung hỗ trợ kiểm tra kỹ hơn, cắt ảnh linh hoạt ở các bước tiếp theo và tạo tài sản sản xuất hoàn thiện.

Các prompt ngắn có thể được tự động mở rộng trước khi tạo ảnh; tính năng viết lại được bật mặc định. Trên text generation endpoint, chế độ Direct thực hiện viết lại qua một lượt, còn chế độ Agent sử dụng quy trình tác tử để làm phong phú bản mô tả yêu cầu. Hãy bật tính năng viết lại khi khám phá ý tưởng hoặc tắt tính năng này khi câu chữ chính xác và chỉ dẫn được kiểm soát chặt chẽ quan trọng hơn trong môi trường production.

Đưa từ một đến ba ảnh tham chiếu vào một lần chỉnh sửa và mô tả thay đổi bằng ngôn ngữ tự nhiên. Mô hình có thể sử dụng các nguồn này để định hướng chủ thể, bối cảnh hoặc hình ảnh, đồng thời bảo toàn những đặc điểm khuôn mặt và danh tính chính. Bạn có thể yêu cầu môi trường, phong cách hoặc bố cục mới mà không cần dựng lại chủ thể đã được phê duyệt từ đầu. Tính năng này phù hợp cho các biến thể chiến dịch, duy trì tính nhất quán của nhân vật và các cảnh sản phẩm dựa trên ảnh tham chiếu.

Cần thực hiện các thử nghiệm có thể lặp lại? Hãy đặt seed cố định từ 0 đến 2147483647, thêm negative prompt và yêu cầu tối đa bốn đầu ra trong một lần gọi tạo ảnh. Những tùy chọn này giúp dễ dàng so sánh các phiên bản prompt, loại bỏ nội dung không mong muốn và đánh giá một nhóm nhỏ lựa chọn trong các điều kiện nhất quán. Hãy dùng chúng cho việc kiểm thử sáng tạo có cấu trúc thay vì phỏng đoán cho từng lần.
Xem cách Qwen Image 3.0 pro, một đối thủ hàng đầu bên ngoài, và phiên bản tiền nhiệm cùng dòng diễn giải những prompt giống hệt nhau qua thiết kế giàu yếu tố typography và nhiếp ảnh phóng sự.
Tại một khu chợ gia vị nhộn nhịp vào chính ngọ, ghi lại khoảnh khắc quyết định đầy hài hước khi một người bán hàng trẻ tung một bao tải vải bố thô đựng nghệ tây lên không trung, đúng lúc một chú chim bồ câu bị nhòe do chuyển động va sượt vào đống nghệ, tạo ra một đám mây bột vàng rực lơ lửng khắp khung cảnh; những khách hàng giật mình phản ứng tự nhiên và hài hước, trong đó một người rõ ràng dùng cả hai tay che chắn cho vài quả lựu đỏ bóng loáng, còn người khác đồng thời ôm các gói gia vị bằng giấy đã gấp trước ngực, với mọi cánh tay, bàn tay, ngón tay, vật thể và tương tác đều đúng về giải phẫu, tách biệt và dễ nhận biết. Lồng khu chợ qua những dãy vòm đá xếp lớp để tạo bố cục khung trong khung mạnh mẽ, sử dụng góc nhìn hơi cao theo góc nghiêng kiểu Dutch; các khối ớt đỏ thẫm, bát gốm màu chàm đậm và đống nghệ vàng rực lặp lại, tạo nên bảng màu cơ bản có kỷ luật, chỉ gồm đỏ, vàng và xanh lam. Ánh sáng bầu trời giữa trưa định hướng mạnh đổ những bóng hình học sắc nét lên các sạp hàng, gương mặt và nền đá lát đã mòn. Giữ nguyên cảm giác chân thực khi chạm vào từng hạt bột bay trong không khí, sợi vải bố đan, sợi nghệ tây mỏng như giấy, đống gia vị phủ bụi, cân đồng nện thủ công, đồ gốm tráng men, vân gỗ phong hóa, gói giấy nhăn, làn da trẻ tự nhiên và lớp hạt phim analog tinh tế. Bao gồm một biển hiệu cửa hàng rộng nằm ngang, vẽ thủ công, ghi chính xác “SPICE, SUN & SURPRISE” bằng các chữ lớn, hoàn toàn dễ đọc, cùng một số bảng giá viết tay riêng biệt ghi chính xác “SAFFRON 12”, “TURMERIC 4”, “CHILIES 6” và “POMEGRANATES 3”, tất cả đều được viết đúng chính tả, tạo hình sạch sẽ và hòa nhập tự nhiên vào sạp hàng. Nhiếp ảnh phóng sự kiểu tạp chí du lịch thập niên 1970, hơi ấm chân thật của con người, chủ nghĩa hiện thực tiết chế, ống kính môi trường 28mm, lấy nét sâu theo nhiều lớp với mép tiền cảnh bị che khuất nhẹ, chuyển động hơi nhòe của chim bồ câu, gương mặt và bàn tay sắc nét, phơi sáng chân thực, không tạo dáng, không tái hiện quá bóng bẩy, không mang vẻ HDR, không làm da nhựa, không màu đục, không phát sáng quá mức, không ánh sáng sử thi giả tưởng, không bảng màu cầu vồng lộn xộn, không bàn tay dị dạng, không ngón tay thừa, không người bị nhân đôi, không chữ lỗi, không viền, không mockup, tỷ lệ khung hình ngang rộng 16:9, tràn lề toàn khung.

Generated with Qwen Image 3.0 Pro Text-to-Image on Atlas Cloud

Generated with Seedream v5.0 Pro Text-to-Image on Atlas Cloud

Generated with Qwen Image 3.0 Text-to-Image on Atlas Cloud
Ảnh phóng sự điện ảnh bên trong một tiệm giặt tự phục vụ vào đêm mưa, ghi lại khoảnh khắc quyết định khi một máy giặt cửa trước bất ngờ phun ra một dòng bọt trắng khổng lồ; một phụ nữ trẻ mặc áo mưa vàng rực bật cười tự nhiên khi hứng phần bọt tràn bằng chậu giặt nhựa đỏ, hai tay cô nắm vành chậu một cách tự nhiên với các ngón tay đúng về giải phẫu, trong khi người bạn đứng bên ngoài lớp kính mờ hơi nước và rõ ràng dùng ngón tay viết chính xác dòng chữ đảo ngược như trong gương “LAST WASH 11:30”, có thể đọc được từ bên trong tiệm giặt; đúng lúc đó, một chiếc tất ướt đập vào rồi dính trên mặt kính. Những hàng cửa máy giặt hình tròn tạo nên hình học lặp lại mạnh mẽ và các đường dẫn thị giác rõ nét đi sâu vào không gian, trong khi những lớp phản chiếu trên cửa sổ cho thấy cả hành động vui nhộn bên trong lẫn con phố neon ướt mưa bên ngoài, hình thành một câu chuyện kép mạch lạc. Ánh đèn huỳnh quang trắng lạnh định hướng từ trần nhà khắc họa các đường nét và đường viền sắc gọn trên gương mặt, áo mưa, bàn tay, bọt và chrome; ánh neon màu magenta tiết chế xuyên qua cửa sổ và phản chiếu trong các vũng nước trên mặt đường, với bảng màu ba sắc có kỷ luật gồm xanh cyan, vàng rực và magenta. Giọt nước chân thực trên kính, bong bóng trong mờ, vải dệt ẩm, kim loại xước, gioăng cao su cửa máy, hơi nước ngưng tụ, phản chiếu trên vũng nước, chuyển động nhòe tinh tế trong lớp bọt đang bay, hạt phim high-ISO nhẹ, kết cấu làn da trẻ tự nhiên, biểu cảm ngẫu hứng, các phản chiếu và bề mặt trong suốt phức tạp nhưng nhất quán về không gian. Phóng sự môi trường ở tầm mắt, ống kính 35mm, độ sâu trường ảnh vừa phải, chủ nghĩa hiện thực điện ảnh, những khiếm khuyết tinh tế, không tạo dáng dàn dựng, không tái hiện quá bóng bẩy, không mang vẻ HDR, không làm da nhựa, không màu đục, không phát sáng quá mức, không ánh sáng sử thi rẻ tiền, tỷ lệ khung hình ngang rộng 16:9, tràn lề toàn khung.

Generated with Qwen Image 3.0 Pro Text-to-Image on Atlas Cloud

Generated with Seedream v5.0 Pro Text-to-Image on Atlas Cloud

Generated with Qwen Image 3.0 Text-to-Image on Atlas Cloud
Qwen Image 3.0 Pro hỗ trợ thiết kế đồ họa chiến dịch, hình ảnh sản phẩm, ý tưởng giao diện, storyboard và chỉnh sửa bảo toàn danh tính nhờ khả năng tuân thủ prompt chính xác, kết xuất văn bản phức tạp, đầu ra lên đến 2048×2048 và hỗ trợ từ một đến ba hình ảnh tham chiếu.
Biến các prompt yêu cầu cao thành áp phích, banner và đồ họa mạng xã hội cho chiến dịch nhờ thế mạnh của Qwen trong việc kết xuất văn bản phức tạp và tuân thủ prompt chính xác. Tạo tài sản thương hiệu với kích thước lên đến 2048×2048 cho các đợt ra mắt, sự kiện và chương trình khuyến mãi.
Tạo cảnh sản phẩm từ văn bản, trong đó tính năng tự động viết lại prompt sẽ mở rộng các ý tưởng sơ lược, còn tính năng chọn kích thước theo prompt sẽ xác định khung vẽ phù hợp. Kết quả đáp ứng nhu cầu tạo ảnh danh mục, quảng bá thương mại điện tử và thử nghiệm ý tưởng nhanh cho các nhóm nhỏ.
Bảo toàn đặc điểm khuôn mặt và danh tính trong khi thay đổi trang phục, bối cảnh, ánh sáng hoặc phong cách hình ảnh thông qua các yêu cầu chỉnh sửa bằng ngôn ngữ tự nhiên. Studio chân dung và ứng dụng dành cho nhà sáng tạo có thể tạo ra các biến thể chiến dịch dễ nhận diện từ một đến ba hình ảnh tham chiếu.
Cần hình ảnh giàu thông tin từ các chỉ dẫn chi tiết? Hãy sử dụng khả năng tuân thủ prompt chính xác và kết xuất văn bản phức tạp để phác thảo ý tưởng giao diện, sơ đồ giáo dục, nội dung giải thích có chú thích và đồ họa thuyết trình cho các nhóm sản phẩm hoặc đào tạo.
Đưa tối đa ba hình ảnh tham chiếu vào một yêu cầu chỉnh sửa duy nhất, sau đó điều hướng các thay đổi bằng ngôn ngữ tự nhiên trong khi vẫn giữ nguyên những chi tiết quan trọng. Cách này phù hợp với ảnh ghép, biến thể hàng hóa và quy trình sáng tạo xoay quanh nhân vật.
Phác thảo các cảnh liên tiếp từ những prompt được viết cẩn thận, trong đó khả năng tuân thủ prompt giúp mỗi khung hình bám sát chủ thể, bối cảnh và định hướng hình ảnh được yêu cầu. Nhà làm phim, agency và đội ngũ phát triển game có thể biến những ý tưởng ban đầu thành các khung storyboard.
So sánh Qwen Image 3.0 pro với các endpoint Seedream và Nano Banana theo quy trình, kích thước đầu ra tối đa, khả năng tham chiếu, công cụ prompt và giá tiêu chuẩn của Atlas Cloud.
| Mô hình | Quy trình | Kích thước đầu ra tối đa | Số hình ảnh tham chiếu tối đa | Công cụ prompt | Giá tiêu chuẩn |
|---|---|---|---|---|---|
| Qwen Image 3.0 Pro Chuyển văn bản thành hình ảnh | Chuyển văn bản thành hình ảnh | 2048×2048 | - | Tự động viết lại prompt | $0.04/hình ảnh |
| Qwen Image 3.0 Pro Chỉnh sửa | Chỉnh sửa hình ảnh | 1440×1440 | 3 | Tự động viết lại prompt | $0.04/hình ảnh |
| Seedream v5.0 Pro Chuyển văn bản thành hình ảnh | Chuyển văn bản thành hình ảnh | Lên đến 4.19 MP | - | Suy luận và tối ưu hóa prompt | $0.045/hình ảnh |
| Seedream v5.0 Pro Chỉnh sửa | Chỉnh sửa hình ảnh | Lên đến 4.19 MP | 10 | Suy luận và tối ưu hóa prompt | $0.045/hình ảnh |
| Nano Banana 2 Chuyển văn bản thành hình ảnh | Chuyển văn bản thành hình ảnh | 4K | - | Suy luận và grounding tìm kiếm | $0.08/hình ảnh |
| Nano Banana 2 Chỉnh sửa | Chỉnh sửa hình ảnh | 4K | 14 | Suy luận và grounding tìm kiếm | $0.08/hình ảnh |
Bắt đầu trong vài phút — làm theo các bước đơn giản sau để tích hợp và triển khai mô hình qua nền tảng Atlas Cloud.
Đăng ký tại atlascloud.ai và hoàn tất xác minh. Người dùng mới nhận được tín dụng miễn phí để khám phá nền tảng và thử nghiệm mô hình.
Sự kết hợp của các mô hình tiên tiến của Qwen Image 3.0 Pro với nền tảng được tăng tốc GPU của Atlas Cloud mang lại hiệu suất, khả năng mở rộng và trải nghiệm nhà phát triển độc đáo.
Độ Trễ Thấp:
Suy luận được tối ưu hóa GPU cho suy luận thời gian thực.
API Thống nhất:
Chạy Qwen Image 3.0 Pro, GPT, Gemini và DeepSeek với một tích hợp duy nhất.
Giá cả Minh bạch:
Thanh toán dựa trên token có thể dự đoán với tùy chọn serverless.
Trải nghiệm Nhà phát triển:
SDK, phân tích, công cụ tinh chỉnh và mẫu.
Độ tin cậy:
99,99% khả dụng, RBAC và ghi nhật ký sẵn sàng cho tuân thủ.
Bảo mật và Tuân thủ:
SOC 2 Type II, tuân thủ HIPAA, chủ quyền dữ liệu tại Hoa Kỳ.
Qwen Image 3.0 Pro là mô hình tạo và chỉnh sửa hình ảnh của Alibaba, dùng để tạo hình ảnh từ văn bản hoặc chỉnh sửa hình ảnh hiện có bằng hướng dẫn ngôn ngữ tự nhiên. Trên Atlas Cloud, mô hình hỗ trợ đầu ra lên đến 2048×2048 và chỉnh sửa với từ một đến ba ảnh tham chiếu.
Bạn có thể dùng mô hình để tạo hình ảnh đòi hỏi khả năng tuân thủ prompt chi tiết, kết xuất văn bản phức tạp hoặc đầu ra có độ phân giải cao. Trong quy trình chỉnh sửa, hướng dẫn bằng ngôn ngữ tự nhiên có thể thay đổi hình ảnh mà vẫn giữ lại các chi tiết quan trọng như đặc điểm khuôn mặt và danh tính.
Chọn route text-to-image hoặc edit, sau đó gọi mô hình thông qua API tương thích OpenAI của Atlas Cloud bằng model ID tương ứng. Khi xây dựng và xác thực request, hãy xem schema tham số được liên kết trong Playground là nguồn thông tin chuẩn.
Chọn qwen-image-3.0-pro/text-to-image khi tạo hình ảnh từ prompt, hoặc qwen-image-3.0-pro/edit khi chỉnh sửa ảnh tham chiếu. Hai route này có schema Playground riêng, vì vậy hãy sử dụng schema tương ứng với workflow đã chọn.
Tính năng tạo ảnh text-to-image hỗ trợ độ phân giải lên đến 2048×2048. Khi không chọn độ phân giải thủ công, mô hình có thể dựa vào prompt để xác định độ phân giải phù hợp.
Cung cấp từ một đến ba ảnh tham chiếu cùng với hướng dẫn chỉnh sửa bằng ngôn ngữ tự nhiên. Mô hình edit sử dụng các đầu vào này để áp dụng những thay đổi được yêu cầu, đồng thời giữ lại các chi tiết hình ảnh quan trọng, bao gồm đặc điểm khuôn mặt và danh tính.
Có. Mô hình text-to-image tích hợp tính năng tự động viết lại prompt cùng với khả năng lựa chọn độ phân giải dựa trên prompt. Hãy đối chiếu đầu ra với hướng dẫn ban đầu khi cách diễn đạt chính xác, bố cục hoặc văn bản được chèn trong ảnh là yếu tố quan trọng.
Atlas Cloud niêm yết mức giá cơ bản tiêu chuẩn là $0.04 cho mỗi hình ảnh đối với cả model text-to-image và edit. Hình thức thanh toán là pay-as-you-go, cho phép nhà phát triển sử dụng một trong hai workflow mà không cần cam kết đăng ký gói thuê bao.
Cả hai phiên bản đều hỗ trợ tạo ảnh text-to-image và chỉnh sửa hình ảnh. Tổng quan chính thức của Alibaba mô tả model tiêu chuẩn là phiên bản cân bằng giữa chất lượng và tốc độ, nhưng các nguồn đã được xác minh và xem xét ở đây không cung cấp so sánh định lượng với Pro. Hãy chạy các prompt đại diện trên cả hai phiên bản trước khi chọn cấu hình mặc định cho môi trường production.
Bắt đầu với một ảnh tham chiếu rõ nét và nêu rõ những đặc điểm khuôn mặt hoặc chi tiết nhận diện nào phải được giữ nguyên. Endpoint edit chấp nhận tối đa ba ảnh tham chiếu và được thiết kế để bảo toàn các chi tiết đó. Nếu hiện tượng sai lệch vẫn tiếp diễn, hãy đơn giản hóa biến đổi được yêu cầu và đánh giá một lần tạo ảnh khác.
Hướng dẫn, bài hướng dẫn và cập nhật sản phẩm giúp bạn khai thác tối đa Atlas Cloud.