Seedance 2.5 đã chính thức ra mắt — Có mặt đầu tiên trên Atlas Cloud
Hero background 1Hero background 2Hero background 3
ElevenLabs v3 API: The Most Expressive Voice AI

ElevenLabs v3 API: The Most Expressive Voice AI

ElevenLabs v3 API mang đến mô hình chuyển văn bản thành giọng nói giàu biểu cảm nhất của ElevenLabs, tạo ra giọng nói tự nhiên truyền tải cảm xúc chân thực. Các thẻ âm thanh nội tuyến như [whispers], [laughs] và [excited] định hình cách thể hiện và sắc thái, trong khi hội thoại nhiều người nói kết hợp nhiều giọng nói thành một cuộc trò chuyện liền mạch. Atlas Cloud cung cấp mô hình này thông qua một endpoint duy nhất tương thích với OpenAI, với mức giá pay-as-you-go minh bạch và quyền truy cập Day-0, sẵn sàng tiếp cận khán giả toàn cầu ngay hôm nay.

Khám phá Mô hình Hàng đầu

Atlas Cloud cung cấp cho bạn các mô hình sáng tạo tiên tiến nhất trong ngành.

ElevenLabs v3 API: Toàn bộ endpoint, đầu vào và đầu ra âm thanh được lập bản đồ

Cái nhìn theo từng modality về dữ liệu mà ElevenLabs v3 API nhận vào và phần giọng nói mà API trả về.

ModalityMô tả
ElevenLabs v3 Text-to-Speech API (Text To Audio)Chuyển đổi tối đa 5,000 ký tự văn bản thành âm thanh giọng nói chất lượng studio, sử dụng thư viện 21 giọng nói gồm Bella, Roger, Sarah và Charlie. Các giọng nói đa ngôn ngữ có thể đọc mọi ngôn ngữ được hỗ trợ, trong khi mức kiểm soát độ ổn định từ 0 đến 1 và tùy chọn bắt buộc dùng ngôn ngữ theo ISO 639-1 giúp giữ giọng điệu và cách phát âm nhất quán giữa các lần thu. Phù hợp khi sản xuất sách nói, bản lồng tiếng, voiceover cho nhân vật hoặc tác nhân thoại hội thoại, tất cả được tính phí minh bạch theo mô hình trả theo mức sử dụng.

Bên trong ElevenLabs v3 API: Giọng nói bạn có thể chỉ đạo

Từ thẻ âm thanh nội tuyến và 21 giọng có thể phân vai đến hơn 70 ngôn ngữ và khả năng kiểm soát độ ổn định chính xác, ElevenLabs v3 API biến kịch bản thuần văn bản thành những phần trình diễn được chỉ đạo, chất lượng phòng thu, thông qua một endpoint trả tiền theo mức sử dụng.

Thẻ âm thanh nội tuyến điều khiển ElevenLabs v3 API

Định hình cách thể hiện theo thời gian thực bằng cách đặt thẻ âm thanh nội tuyến trực tiếp trong kịch bản của bạn. Model đọc các gợi ý đặt trong ngoặc vuông cho cảm xúc như [sad] và [excited], cách trình diễn như [whispers] và [shouts], cũng như phản ứng như [laughs] và [sighs]. Bạn có thể kết hợp nhiều thẻ trong một câu, và giọng nói sẽ điều chỉnh sắc thái, nhịp độ và ngữ điệu mà không cần thu lại. Điều này biến phần lời phẳng thành một màn trình diễn có chỉ đạo cho diễn xuất nhân vật và lời dẫn giàu biểu cảm.

Dàn 21 giọng nói khác biệt

Dàn 21 giọng nói khác biệt

Phân vai bất kỳ nhân vật nào từ thư viện gồm 21 giọng nói khác biệt, bao gồm Bella, Roger, Sarah, George, Callum và Matilda. Mỗi giọng có âm sắc và cá tính riêng, và bạn chọn một giọng cho mỗi request thông qua một tham số voice duy nhất. Vì mọi giọng đều được tối ưu theo ngôn ngữ, bạn có thể giữ một danh tính xuyên suốt cả dự án hoặc chuyển đổi người nói để xây dựng một dàn nhân vật đầy đủ. Tính năng này phù hợp với sách nói, lồng tiếng và trợ lý mang thương hiệu cần một chất giọng dễ nhận diện.

Nói với thế giới bằng hơn 70 ngôn ngữ

Nói với thế giới bằng hơn 70 ngôn ngữ

Cần tiếp cận khán giả toàn cầu? Model hỗ trợ hơn 70 ngôn ngữ, từ English và Mandarin đến Hindi, Arabic, Spanish, French, German và Japanese. Truyền mã ngôn ngữ ISO 639-1 để áp dụng cách phát âm, và cùng một giọng sẽ điều chỉnh giọng điệu vùng miền cũng như cách thể hiện cho từng ngôn ngữ đích. Một kịch bản có thể trở thành nhiều phiên bản bản địa hóa, lý tưởng cho ra mắt quốc tế, e-learning và hỗ trợ khách hàng đa ngôn ngữ.

Điều chỉnh độ biểu cảm bằng kiểm soát độ ổn định

Điều chỉnh độ biểu cảm bằng kiểm soát độ ổn định

Tinh chỉnh mức độ biểu cảm hoặc nhất quán của giọng nói bằng một tham số kiểm soát độ ổn định duy nhất có giá trị từ 0 đến 1. Giá trị thấp mở ra biến hóa kịch tính và dao động cảm xúc, trong khi giá trị cao giữ cách thể hiện ổn định, dễ dự đoán trong các phiên dài. Vì thiết lập này là một tham số số đơn giản, bạn có thể tinh chỉnh theo từng request để khớp với tâm trạng của từng cảnh. Thuyết minh tài liệu thường phù hợp với mức cao, còn nhân vật hoạt hình phát huy tốt ở mức thấp.

Lời dẫn chất lượng phòng thu trên ElevenLabs v3 API

Tạo tối đa 5.000 ký tự lời nói chất lượng phòng thu trong một request, với tùy chọn chuẩn hóa văn bản để đọc số, ngày tháng và tiền tệ theo cách tự nhiên như con người. Kết quả được trả về qua một endpoint tương thích OpenAI duy nhất, tính phí trả theo mức sử dụng ở mức $0.10 cho mỗi 1.000 ký tự, kèm quyền truy cập Day-0. Các đoạn dài được render trong một lượt, nhờ đó podcast, lời dẫn dài và voiceover video vẫn mạch lạc từ đầu đến cuối.

Một prompt, ba giọng nói: ElevenLabs v3 API so với Seed Audio và xAI TTS

Đưa cùng một kịch bản giàu biểu cảm vào ElevenLabs v3 API và hai mô hình giọng nói Atlas Cloud khác, rồi xem từng phổ âm tiết lộ cách chúng xử lý cảm xúc, nhịp độ và lối thể hiện khác nhau ra sao.

Prompt

[whisper] Tối nay tôi vốn không định nói điều này. [pause] Tôi đã giữ lá thư trong túi suốt ba năm, vì sợ ý nghĩa của nó. [excited] Nhưng rồi tôi thấy bạn đứng đó, và mọi thứ bỗng khớp lại, cuối cùng cũng trở nên rõ ràng! [pause] [warm] Vậy nên đây là tôi, lần đầu tiên dám can đảm. Cảm ơn bạn vì đã chờ đợi, và cảm ơn vì chưa bao giờ buông tay.

Generated with ElevenLabs v3 Text-to-Speech on Atlas Cloud

Generated with xAI TTS v1 on Atlas Cloud

Prompt

[excited] Thưa quý vị, chào mừng đến với trận đấu cuối cùng của mùa giải! [pause] Hai nhà vô địch, một đấu trường, và cả đám đông đang nín thở. [whisper] Nghe kìa... có thể nghe thấy cả tiếng kim rơi. [pause] [dramatic] Rồi tiếng còi vang lên, ánh đèn tràn ngập sân đấu, và lịch sử bắt đầu tự viết nên ngay trước mắt bạn.

Generated with ElevenLabs v3 Text-to-Speech on Atlas Cloud

Generated with Seed Audio 1.0 on Atlas Cloud

Generated with xAI TTS v1 on Atlas Cloud

Từ sách nói đến tác tử giọng nói với ElevenLabs v3 API

Các đội ngũ chọn ElevenLabs v3 API để tường thuật sách nói, lồng tiếng cho cảnh nhiều nhân vật, sản xuất podcast, vận hành tác tử hội thoại, bản địa hóa sang hơn 70 ngôn ngữ và hỗ trợ các công cụ trợ năng, tất cả chỉ với một khóa Atlas Cloud duy nhất.

Tường thuật sách nói sống động

Lối kể chuyện dài vẫn giữ được cảm xúc truyền tải và nhịp điệu xuyên suốt từng chương, với các thẻ âm thanh nội tuyến định hình tiếng thì thầm, tiếng thở dài và sự chuyển đổi sắc thái giọng. Các nhà xuất bản và tác giả độc lập có thể tạo sách nói chất lượng phòng thu mà không cần đặt lịch thu âm.

Cảnh nhiều nhân vật với ElevenLabs v3 API

Viết cảnh cho nhiều người nói và để ElevenLabs v3 API xử lý lượt thoại, phần ngắt lời và các giọng nói chồng lấp chỉ trong một lần chạy. Các studio game và đội ngũ tiểu thuyết tương tác có thể lồng tiếng cho toàn bộ dàn nhân vật mà không cần thuê riêng từng diễn viên.

Sản xuất podcast và lồng tiếng

Các tập podcast, đoạn đọc quảng cáo và phần mở đầu được tạo trực tiếp từ kịch bản, với ngữ điệu sống động và khoảng ngừng tự nhiên nghe như được thu âm thay vì tổng hợp. Nhà sáng tạo có thể xuất bản âm thanh hoàn thiện nhanh hơn bất kỳ phòng thu nào cho phép.

Tác tử giọng nói hội thoại trên ElevenLabs v3 API

Cần một tác tử giọng nói phản ứng bằng cảm xúc thay vì đọc đều đều? ElevenLabs v3 API hỗ trợ các đường dây chăm sóc khách hàng và trợ lý bằng giọng nói phản hồi linh hoạt, nhận biết ngữ cảnh và thích ứng với từng câu trả lời.

Bản địa hóa sang hơn 70 ngôn ngữ

Khi một kịch bản cần tiếp cận khán giả toàn cầu, hãy tạo nội dung đó bằng hơn 70 ngôn ngữ trong khi vẫn giữ nguyên cảm xúc và ý định ban đầu. Các đội ngũ bản địa hóa có thể phát hành khóa học, quảng cáo và ứng dụng đa ngôn ngữ từ một văn bản nguồn duy nhất.

Công cụ trợ năng và đọc với ElevenLabs v3 API

Chuyển bài viết, tài liệu và nội dung sản phẩm thành âm thanh lời nói rõ ràng thông qua ElevenLabs v3 API, với cách phát âm và nhịp độ luôn dễ theo dõi. Các ứng dụng chú trọng trợ năng mang đến cho người đọc một lựa chọn tự nhiên thay cho văn bản trên màn hình.

So sánh ElevenLabs v3 API với các mô hình giọng nói khác trên Atlas Cloud

Xem ElevenLabs v3 API so sánh như thế nào với các mô hình chuyển văn bản thành giọng nói khác trên Atlas Cloud về giá, phạm vi ngôn ngữ, nhân bản giọng nói và khả năng điều khiển biểu cảm.

Mô hìnhNhà cung cấpGiá (mỗi 1K ký tự)Ngôn ngữNhân bản giọng nóiThẻ âm thanh nội tuyến
ElevenLabs v3 Text-to-SpeechElevenLabs$0.1070+
Seed Audio 1.0ByteDance$0.015Đa ngôn ngữ-
xAI TTS v1xAI$0.01520+-

Cách Sử Dụng ElevenLabs trên Atlas Cloud

Bắt đầu trong vài phút — làm theo các bước đơn giản sau để tích hợp và triển khai mô hình qua nền tảng Atlas Cloud.

Tạo Tài Khoản Atlas Cloud

Đăng ký tại atlascloud.ai và hoàn tất xác minh. Người dùng mới nhận được tín dụng miễn phí để khám phá nền tảng và thử nghiệm mô hình.

Tại sao Sử dụng ElevenLabs trên Atlas Cloud

Sự kết hợp của các mô hình tiên tiến của ElevenLabs với nền tảng được tăng tốc GPU của Atlas Cloud mang lại hiệu suất, khả năng mở rộng và trải nghiệm nhà phát triển độc đáo.

Hiệu suất và Tính linh hoạt

Độ Trễ Thấp:
Suy luận được tối ưu hóa GPU cho suy luận thời gian thực.

API Thống nhất:
Chạy ElevenLabs, GPT, Gemini và DeepSeek với một tích hợp duy nhất.

Giá cả Minh bạch:
Thanh toán dựa trên token có thể dự đoán với tùy chọn serverless.

Doanh nghiệp và Mở rộng

Trải nghiệm Nhà phát triển:
SDK, phân tích, công cụ tinh chỉnh và mẫu.

Độ tin cậy:
99,99% khả dụng, RBAC và ghi nhật ký sẵn sàng cho tuân thủ.

Bảo mật và Tuân thủ:
SOC 2 Type II, tuân thủ HIPAA, chủ quyền dữ liệu tại Hoa Kỳ.

ElevenLabs v3 API: Câu hỏi thường gặp

ElevenLabs v3 API cho phép nhà phát triển truy cập Eleven v3 theo cách lập trình, đây là mô hình text-to-speech giàu biểu cảm nhất của ElevenLabs. API này chuyển văn bản thành giọng nói chất lượng phòng thu, giàu cảm xúc trên hơn 70 ngôn ngữ, với các thẻ âm thanh inline để kiểm soát tinh chỉnh sắc thái và cách thể hiện. Trên Atlas Cloud, API chạy thông qua một khóa tương thích OpenAI duy nhất với mức giá pay-as-you-go minh bạch.

Eleven v3 được xây dựng để ưu tiên chiều sâu cảm xúc và khả năng hiểu ngữ cảnh thay vì tốc độ thuần túy. Mô hình đọc các thẻ âm thanh inline như [whispers], [excited] và [sighs] để định hình phần thể hiện, đồng thời xử lý hội thoại nhiều người nói với chuyển tiếp tự nhiên giữa các nhân vật. Trọng tâm đó khiến mô hình đặc biệt phù hợp với lối kể chuyện kịch tính, xoay quanh nhân vật, nơi sắc thái quan trọng hơn độ trễ tính bằng mili giây.

Eleven v3 hỗ trợ hơn 70 ngôn ngữ, phạm vi bao phủ rộng nhất trong các mô hình giọng nói của ElevenLabs. Phạm vi này bao gồm các ngôn ngữ được dùng rộng rãi như English, Spanish, Mandarin Chinese, Hindi, Arabic, French, German, Japanese và Korean. Bạn có thể điều hướng cảm xúc và sắc thái trong từng ngôn ngữ bằng cùng cú pháp thẻ âm thanh.

Thẻ âm thanh là các gợi ý được đặt trong dấu ngoặc vuông và chèn trực tiếp vào văn bản, để mô hình đọc như chỉ dẫn về cách thể hiện. Chúng có thể là chỉ dẫn cảm xúc như [excited] hoặc [whispers], cho đến các phản ứng phi ngôn ngữ như [sighs], [laughs] và [clapping]. Hãy đặt chúng inline ở bất cứ nơi nào bạn muốn cách thể hiện thay đổi, mô hình sẽ tự điều chỉnh mà không cần cấu hình riêng.

Đăng ký, tạo một API key và trỏ yêu cầu của bạn đến endpoint ElevenLabs v3 bằng định dạng tương thích OpenAI. Bạn có thể thử prompt và thẻ âm thanh trong playground trên trình duyệt trước khi tích hợp lệnh gọi vào sản phẩm. Thanh toán theo pay-as-you-go, nên bạn chỉ bị tính phí cho phần âm thanh thực sự tạo ra. Hãy bắt đầu xây dựng ngay hôm nay.

Có. Bên cạnh text-to-speech tiêu chuẩn, v3 hỗ trợ tính năng Text to Dialogue để kết xuất các cuộc trò chuyện tự nhiên giữa nhiều người nói chỉ trong một lượt. Endpoint tự động xử lý chuyển tiếp giữa người nói, thay đổi cảm xúc và các đoạn ngắt lời, phù hợp với audio drama, cảnh trong game và hội thoại có lời dẫn.

Eleven v3 chấp nhận tối đa 5,000 ký tự trong một yêu cầu, tương đương khoảng năm phút âm thanh được tạo. Khi kịch bản dài hơn, hãy chia thành các yêu cầu liên tiếp và ghép các đoạn âm thanh trả về lại với nhau. Giữ mỗi yêu cầu trong giới hạn cũng giúp bạn quản lý nhịp độ và thử lại một cách gọn gàng.

Không. Eleven v3 ưu tiên chất lượng hơn tốc độ, nên không cung cấp streaming WebSocket thời gian thực như ElevenLabs Flash. Phần tính toán nặng hơn phía sau dải cảm xúc của mô hình làm tăng độ trễ, vì vậy mô hình phù hợp nhất với nội dung dựng sẵn như audiobook, lồng tiếng và voiceover thay vì voice agent trực tiếp.

Atlas Cloud định giá mô hình theo cơ chế pay-as-you-go minh bạch, nên bạn được tính phí theo từng lệnh gọi, không cần đăng ký thuê bao hay cam kết tối thiểu. Chi phí tăng theo lượng âm thanh bạn tạo, giúp các thử nghiệm nhỏ vẫn rẻ và khối lượng công việc lớn dễ dự đoán. Hãy bắt đầu ngay hôm nay.

Khám phá Thêm Dòng

Seedance 2.5

Seedance 2.5 API hiện đã có mặt trên Atlas Cloud! Cung cấp cho các nhà phát triển mô hình video mới nhất của ByteDance. Nó tạo ra tối đa 30 giây video gốc chỉ trong một lần xử lý từ văn bản, một hình ảnh duy nhất hoặc tối đa 50 tài liệu tham khảo đa phương thức, với âm thanh được đồng bộ hóa và văn bản đa ngôn ngữ trong khung hình. Trên Atlas Cloud, bạn có thể truy cập thông qua một khóa duy nhất, với tính nhất quán của chủ thể và vật lý được cải thiện giúp giữ cho các cảnh quay dài luôn mạch lạc.

Xem Dòng

MiniMax H3

API MiniMax H3 mở quyền truy cập vào mô hình video đa phương thức đa dụng của MiniMax, có thể đọc văn bản, hình ảnh, video và âm thanh như một ngữ cảnh duy nhất thay vì xử lý từng tác vụ riêng lẻ. Các clip có thời lượng từ 5 đến 15 giây ở 24 FPS, hỗ trợ nhiều tỷ lệ khung hình từ 21:9 đến 9:16; chỉ với một prompt, bạn có thể hoán đổi nhân vật, thay nền, viết lại hội thoại hoặc sao chép giọng nói từ một clip tham chiếu. Atlas Cloud cung cấp toàn bộ khả năng này thông qua một endpoint tương thích OpenAI. Hãy bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Seedream 5.0 Pro

Seedream 5.0 Pro API cung cấp cho các nhà phát triển mô hình chỉnh sửa hình ảnh có thể kiểm soát của ByteDance trên Atlas Cloud. Nó đặt các chỉnh sửa một cách chính xác bằng các điểm neo và tọa độ, tách hình ảnh thành các lớp có thể chỉnh sửa, kết hợp nhiều tham chiếu và khớp màu sắc cũng như vật liệu chính xác, với văn bản đa ngôn ngữ ở độ phân giải 2K và 3K. Trên Atlas Cloud, bạn có thể truy cập nó chỉ bằng một khóa!

Xem Dòng

Seedance 2.0

Seedance 2.0 API cung cấp cho bạn quyền truy cập cấp sản xuất vào mô hình video đa phương thức của ByteDance — đầu vào bốn phương thức (văn bản, hình ảnh, video, âm thanh) và hệ thống "Universal Reference" hàng đầu trong ngành giúp khóa bố cục, chuyển động của camera và hành động của nhân vật trên các cảnh quay. Tích hợp quyền kiểm soát cấp độ đạo diễn bằng một lệnh gọi API, mức giá cố định $0,09/giây, cấp khóa tức thì và không có danh sách chờ — được hỗ trợ bởi thời gian hoạt động và sự tuân thủ cấp doanh nghiệp. Seedance 2.0 Native 4K hiện đã ra mắt!

Xem Dòng

GPT Image 2

GPT Image 2 API cung cấp cho các nhà phát triển quyền truy cập vào mô hình hình ảnh mới nhất của OpenAI, phiên bản kế nhiệm của GPT Image 1.5. Mô hình này tạo và chỉnh sửa hình ảnh với khả năng hiển thị văn bản chính xác trên các chữ viết Latinh và CJK, cùng với bố cục mạnh mẽ cho áp phích, mockup và đồ họa thông tin. Trên Atlas Cloud, bạn có thể truy cập nó thông qua một API thống nhất cùng với hơn 300 mô hình khác, với tín dụng miễn phí, 99,99% thời gian hoạt động và không yêu cầu xác minh tổ chức OpenAI.

Xem Dòng

Gemini Omni Flash

Gemini Omni API đưa mô hình tạo và chỉnh sửa video đa phương thức của Google DeepMind, được giới thiệu tại Google I/O 2026, vào stack của bạn. Gemini Omni kết hợp công cụ suy luận của Gemini với media tạo sinh, chấp nhận mọi tổ hợp văn bản, hình ảnh, video và âm thanh để tạo ra kết quả nhất quán, dựa trên nền tảng tri thức. Tinh chỉnh kết quả qua hội thoại tự nhiên — hoán đổi vật thể, viết lại cảnh quay và thay đổi phong cách, trong khi vật lý, nhân vật và tính liên tục vẫn được giữ nguyên. Atlas Cloud cung cấp trọn bộ dòng Gemini Omni Flash — chuyển văn bản thành video, chuyển hình ảnh thành video với tối đa 7 hình ảnh tham chiếu, và chuyển tham chiếu thành video — thông qua một API hợp nhất với mức giá minh bạch tính theo giây từ $0.112 và không cần đăng ký thuê bao. Bắt đầu xây dựng ngay hôm nay.

Xem Dòng

Grok Imagine

Grok Imagine API cung cấp cho các nhà phát triển khả năng tạo hình ảnh, video và âm thanh của xAI trong một bộ công cụ duy nhất. API này tạo ra hình ảnh độ phân giải lên đến 2K với khả năng hiển thị văn bản đa ngôn ngữ, cộng với video lên đến 15 giây với âm thanh gốc, được đồng bộ hóa và chỉnh sửa dựa trên tham chiếu. Trên Atlas Cloud, một khóa duy nhất có thể chạy mọi chế độ Grok Imagine, do đó bạn có thể chuyển đổi giữa hình ảnh, video và âm thanh mà không cần thiết lập riêng biệt, với mức giá từ 0,02 USD cho mỗi hình ảnh và 0,05 USD mỗi giây.

Xem Dòng

Google

Các mô hình sáng tạo mạnh mẽ nhất của Google hiện đều có sẵn trên Atlas Cloud. Veo 3.1 cung cấp khả năng tạo video đậm chất điện ảnh, Nano Banana 2 hỗ trợ tạo hình ảnh có độ chân thực cao, và Gemini mang trí tuệ đa phương thức vào mọi quy trình làm việc. Truy cập toàn bộ bộ mô hình Google thông qua một API key duy nhất với tính khả dụng Day-0 và mức giá dùng bao nhiêu trả bấy nhiêu (pay-as-you-go).

Xem Dòng

Seedance 2.0 Mini

Seedance 2.0 Mini mang khả năng tạo video đa phương thức của ByteDance vào các quy trình làm việc nơi tốc độ và chi phí là quan trọng nhất. Nó cung cấp các khả năng cốt lõi của Seedance 2.0 với mức tiêu thụ tài nguyên nhẹ hơn — tạo nhanh hơn, chi phí mỗi video thấp hơn và tích hợp API giống như bạn đã sử dụng. Đối với các nhóm chạy các quy trình (pipeline) khối lượng lớn hoặc tạo nguyên mẫu ở quy mô lớn, Mini là lựa chọn mặc định thiết thực.

Xem Dòng

ByteDance

Từ tạo video điện ảnh đến kiến tạo hình ảnh có độ trung thực cao, các mô hình mạnh mẽ nhất của ByteDance hiện đã có mặt trên Atlas Cloud. Chạy Seedance và Seedream ở quy mô lớn với mức giá suy luận thấp nhất và không có chi phí quản lý cơ sở hạ tầng.

Xem Dòng

Alibaba

Atlas Cloud tập hợp toàn bộ dòng mô hình của Alibaba dưới một API duy nhất: Qwen cho các tác vụ ngôn ngữ và hình ảnh, Wan để tạo video với độ phân giải lên đến 1080p. Truy cập mọi mô hình theo hình thức dùng đến đâu trả tiền đến đó (pay-as-you-go) mà không cần đăng ký gói. Alibaba API có sẵn thông qua một URL cơ sở (base URL) duy nhất bằng cách sử dụng ứng dụng khách tương thích với OpenAI hiện có của bạn.

Xem Dòng

OpenAI

Atlas Cloud cấp cho bạn quyền truy cập vào toàn bộ danh mục OpenAI API, từ GPT Image 2 để tạo hình ảnh đến Sora 2 cho video. Mọi mô hình đều có sẵn theo hình thức dùng đến đâu trả tiền đến đó (pay-as-you-go) mà không cần cam kết hàng tháng. Tích hợp dễ dàng chỉ bằng cách thay đổi một base URL thông qua API tương thích với OpenAI.

Xem Dòng

Một API cho mọi AI đa phương tiện.

Khám phá tất cả mô hình