API Gemini Omni menghadirkan keluarga Gemini Omni Flash multimodal native dari Google DeepMind, termasuk Gemini Omni 1.1 Flash, bagi para developer. Buat video sinematik dengan audio native yang tersinkronisasi, animasikan gambar diam dengan kontrol presisi atas frame awal dan akhir, atau revisi rekaman yang ada melalui pengeditan berbasis teks yang mempertahankan konten yang tidak diubah. Atlas Cloud menyediakan satu kunci yang kompatibel dengan OpenAI, akses terpadu, dan harga transparan bayar sesuai pemakaian. Mulai membangun hari ini.
Gemini Omni Flash dikembangkan oleh Google. Atlas Cloud (dioperasikan oleh Atlas Cloud AI LLC) menyediakan akses ke model ini dan tidak memilikinya. Semua merek dagang adalah milik pemiliknya masing-masing.
Atlas Cloud menyediakan model kreatif terdepan dan terbaru di industri untuk Anda.
Bandingkan rute teks, gambar, referensi, pengeditan, dan ekstensi di Gemini Omni Flash serta Gemini Omni 1.1 Flash sebelum memilih endpoint yang tepat.
| Modalitas | Deskripsi |
|---|---|
| Gemini Omni Flash Reference-to-Video API (R2V) | Gabungkan prompt teks dengan 1 hingga 5 gambar referensi untuk menghasilkan video sinematik dengan suara bawaan. Subjek, adegan, dan gaya yang konsisten membuat endpoint ini cocok untuk rangkaian bermerek dan karakter yang muncul berulang kali. |
| Gemini Omni Flash Image-to-Video API (I2V) | Berawal dari gambar diam dan prompt teks, endpoint ini membuat video sinematik dengan suara sekaligus mempertahankan subjek dan komposisi sumber. Gunakan untuk menganimasikan foto produk, potret, atau konsep visual. |
| Gemini Omni Flash Video Edit API | Berikan instruksi teks dan gambar referensi opsional pada video yang sudah ada untuk menerapkan perubahan yang konsisten dengan adegan, lengkap dengan audio bawaan. Rekaman yang tidak disentuh tetap dipertahankan, sehingga mendukung revisi pascaproduksi dan pembaruan visual yang terarah. |
| Gemini Omni Flash Text-to-Video API (T2V) | Hanya dari prompt teks, endpoint ini menghasilkan video sinematik dengan audio bawaan yang tersinkronisasi dan gerakan berbasis fisika. Generasi yang dapat dikontrol dan berkecepatan tinggi ini cocok untuk visualisasi konsep, pengembangan cerita, dan pembuatan prototipe video secara cepat. |
| Gemini Omni Flash Reference-to-Video Developer API | Gunakan prompt teks dan gambar referensi untuk mengubah klip video yang sudah ada melalui transfer gaya, pengeditan adegan, atau penyisipan karakter. Endpoint developer ini cocok untuk alat kreatif yang memerlukan variasi terarah dari rekaman yang disediakan. |
| Gemini Omni Flash Image-to-Video Developer API | Saat identitas visual menjadi hal penting, gabungkan prompt teks dengan hingga 7 gambar referensi untuk menghasilkan video dengan subjek yang konsisten. Alur kerja ini mendukung karakter berulang, visual katalog, dan aset kampanye yang kohesif. |
| Gemini Omni Flash Text-to-Video Developer API | Pilih prompt teks, resolusi, rasio aspek, dan durasi untuk membuat video sinematik yang dapat dikontrol. Pengaturan output yang fleksibel membantu developer menyiapkan konten khusus platform, menguji arah kreatif, dan membangun alur kerja generasi otomatis. |
| Gemini Omni 1.1 Flash Video Extend API | Lanjutkan klip yang sudah ada dengan ekstensi yang menyatu mulus, berdurasi 3 hingga 10 detik, dan tetap mempertahankan audio bawaan. Rangkaikan beberapa ekstensi untuk membangun satu shot yang koheren hingga 40 detik untuk adegan yang lebih panjang atau aksi berkelanjutan. |
| Gemini Omni 1.1 Flash Video Edit API | Minta penambahan, penghapusan, penggantian, atau perubahan gaya dengan memberikan video yang sudah ada dan instruksi teks kepada endpoint. Konten yang tidak disebutkan serta audio bawaan tetap dipertahankan, sehingga memungkinkan revisi presisi tanpa membangun ulang seluruh adegan. |
| Gemini Omni 1.1 Flash Reference-to-Video API (R2V) | Berikan prompt teks dengan hingga 10 gambar referensi dan 3 klip video referensi untuk menghasilkan video sinematik dengan suara bawaan. Konsistensi karakter, produk, dan arahan artistik mendukung konten berseri serta kampanye yang terkoordinasi. |
| Gemini Omni 1.1 Flash Image-to-Video API (I2V) | Animasikan gambar diam menjadi klip sinematik dengan suara bawaan, dipandu oleh teks. Frame terakhir opsional memberikan kontrol presisi atas akhir shot, sehingga endpoint ini berguna untuk transisi yang telah direncanakan dan pengungkapan produk. |
| Gemini Omni 1.1 Flash Text-to-Video API (T2V) | Ubah satu prompt teks menjadi klip sinematik dengan audio bawaan yang tersinkronisasi, sambil mengontrol durasi, rasio aspek, dan resolusi. Output mulai dari draf 360p hingga 4K mendukung pratinjau cepat dan pengiriman beresolusi lebih tinggi dari satu endpoint. |
Setiap permintaan Gemini Omni Flash API dapat menerima kombinasi teks, gambar, video, dan audio apa pun, menghasilkan suara yang tersinkronisasi, memodelkan fisika dunia nyata, serta menyempurnakan hasil melalui percakapan.

Sempurnakan klip menggunakan bahasa alami, dan Gemini Omni Flash API akan menerapkan perubahan sambil mempertahankan bagian adegan lainnya. Interactions API yang stateful mengingat setiap giliran percakapan, sehingga setiap pengeditan dapat dibangun di atas pengeditan sebelumnya.

Gemini Omni Flash API menerima kombinasi teks, gambar, video, dan audio apa pun dalam satu prompt. Input apa pun dari sumber apa pun ini memungkinkan Anda memulai generasi dari materi sumber yang sudah dimiliki.

Suara dihasilkan bersamaan dengan gambar dalam satu inference pass, sehingga dialog, efek suara, dan ambience tetap selaras dengan aksi. Gemini Omni Flash API tidak memerlukan langkah audio terpisah setelahnya.

Berlandaskan model fisika dunia nyata, Gemini Omni Flash API menghasilkan pantulan, gravitasi, pencahayaan, dan cuaca yang meyakinkan. Adegan tetap utuh secara visual tanpa berubah menjadi artefak, bahkan dalam shot yang dinamis.

Arahkan generasi menggunakan hingga tujuh gambar referensi dan tiga klip video pendek, sementara Gemini Omni Flash API menjaga konsistensi subjek, gaya, dan adegan. Fitur ini mempertahankan identitas secara konsisten di berbagai pengeditan dan shot.
Prompt yang sama, dibuat oleh Gemini Omni dan model video terkemuka lainnya: Multi-shot dan film komersial kelas atas
Buat video kontinu dengan 3 adegan: Adegan 1: Wanita tersebut berdiri di bawah lampu neon di jalanan Tokyo yang diguyur hujan. Pantulan terlihat di permukaan jalan yang basah, dengan kedalaman bidang sinematik dan pergerakan kamera handheld. Adegan 2: Kamera perlahan beralih ke pengambilan gambar yang lebih dekat. Ia berbicara dengan lembut, selaras dengan suara yang diberikan, dengan gerakan bibir yang benar-benar sesuai. Lalu lintas di latar belakang terus berlangsung secara mulus. Adegan 3: Ia memasuki stasiun kereta bawah tanah. Lingkungan tetap konsisten dalam pencahayaan, cuaca, dan suasana. Kamera mengikutinya dari belakang dengan mempertahankan konsistensi identitas. Batasan: - Pertahankan identitas wajah yang sama persis di semua adegan - Pertahankan kesinambungan pencahayaan (hujan, pantulan neon) - Pastikan realisme fisik (interaksi dengan hujan, permukaan basah) - Pastikan sinkronisasi audio-visual dengan input suara - Jangan mengatur ulang adegan saat transisi; pertahankan keadaan dunia yang kontinu Gaya: realisme sinematik kelas atas, butiran film, lensa anamorfik, kedalaman bidang yang dangkal, tampilan film 4K
Gemini Omni
Wan 2.7
Kling v3.0
Buat video kontinu dengan 4 adegan: Adegan 1: Robot putih kecil duduk tanpa bergerak di atas meja kayu dalam apartemen yang remang-remang pada tengah malam. Cahaya bulan masuk melalui jendela. Mata robot perlahan menyala, disertai dengungan mekanis yang samar. Adegan 2: Robot tersebut turun dari meja dengan hati-hati. Kaki logam kecilnya mengeluarkan bunyi klik lembut di lantai kayu. Kamera mengikuti dari sudut rendah, dengan mempertahankan ukuran dan bentuk robot secara konsisten. Adegan 3: Robot berjalan memasuki dapur. Pantulan dari pintu kulkas dan lantai berubin merespons pergerakannya secara alami. Cahaya bulan dan suasana malam yang hening dari adegan sebelumnya terus berlanjut. Adegan 4: Robot berhenti di dekat jendela dan memandang lampu-lampu kota di luar. Kamera perlahan mendekat dari belakang, dengan mempertahankan konsistensi identitas, material, skala, pencahayaan, dan suara robot. Persyaratan: - Pertahankan desain robot yang sama persis di semua adegan - Pertahankan satu tata letak apartemen yang kontinu, tanpa mengatur ulang adegan - Jaga pencahayaan tetap konsisten dari satu ruangan ke ruangan lainnya - Selaraskan langkah kaki dan dengungan mekanis dengan gerakan robot - Gunakan pantulan, bayangan, dan interaksi objek yang realistis secara fisik - Buat transisi antarscena yang mulus, seolah-olah satu dunia kontinu sedang direkam Gaya: realisme sinematik, suasana sci-fi yang hening, cahaya bulan yang lembut, material yang mendetail, pergerakan kamera yang realistis, kedalaman bidang yang dangkal, tampilan film komersial kelas atas
Gemini Omni
Kling V3.0
Pixverse v6
Mencakup kampanye produk, revisi percakapan, transisi terkontrol, perluasan yang koheren, dunia merek yang konsisten, dan alat kreatif terintegrasi, Gemini Omni API mendukung proses produksi dari frame pertama hingga hasil akhir.
Ubah gambar diam produk menjadi gerakan sinematik dengan audio bawaan yang tersinkronisasi, dengan opsi untuk menentukan frame akhir. Tim pemasaran dapat mengubah foto yang telah disetujui menjadi teaser peluncuran, iklan media sosial, dan video pengungkapan produk yang apik.
Jelaskan penambahan, penghapusan, penggantian, atau perubahan gaya, lalu model akan memperbarui rekaman yang ada sambil mempertahankan semua hal yang tidak disentuh oleh prompt. Editor dapat menghasilkan versi kreatif alternatif dan revisi klien tanpa membangun ulang adegan yang telah disetujui.
Tetapkan gambar awal dan frame terakhir yang disediakan, lalu biarkan Gemini Omni 1.1 Flash membuat gerakan di antaranya. Desainer mendapatkan transisi terkontrol, pengungkapan produk, dan transformasi visual untuk aset kampanye.
Lanjutkan klip yang ada dengan segmen berdurasi tiga hingga sepuluh detik yang tersambung mulus, lalu rangkai ekstensi menjadi satu urutan yang koheren. Pembuat film dan pencerita dapat mengembangkan shot yang lebih panjang sambil mempertahankan kesinambungan gerakan, suara, dan visual.
Gabungkan prompt dengan hingga sepuluh gambar referensi dan tiga klip video untuk mengarahkan karakter, produk, atau arahan artistik. Studio dapat mempertahankan subjek yang mudah dikenali dan estetika merek di seluruh pengambilan gambar kampanye dan konten episodik.
Sematkan pembuatan teks, animasi gambar, pembuatan dari referensi, pengeditan video, dan ekstensi klip dalam satu integrasi API. Platform kreator dapat menawarkan ruang kerja produksi terpadu tanpa harus merakit alur kerja video dan audio secara terpisah.
Bandingkan model video referensi Gemini Omni API, termasuk Gemini Omni 1.1 Flash, dengan alternatif unggulan berdasarkan input yang didukung, kapasitas referensi, pembuatan audio, dan harga standar.
| Model | Input yang Diterima | Kapasitas Referensi | Pembuatan Audio | Harga Standar |
|---|---|---|---|---|
| Gemini Omni 1.1 Flash Reference-to-Video | Teks, gambar, klip video | Hingga 10 gambar dan 3 klip video | √ | $0.041/sec |
| Gemini Omni Flash Reference-to-Video | Teks, gambar | 1 hingga 5 gambar | √ | $0.135/sec |
| Seedance 2.0 Reference-to-Video | Teks, gambar, video, audio | Hingga 9 gambar, 3 video, dan 3 klip audio | √ | $0.112/sec |
| Wan-2.7 Reference-to-video | Teks, gambar, video, audio | Hingga total 5 gambar dan video, dengan suara subjek opsional | √ | $0.10/sec |
| Grok Imagine Video v1.5 Reference-to-Video | Teks, gambar, suara prasetel | Hingga 7 gambar dan 3 suara prasetel | √ | $0.08/sec |
Mulai dalam hitungan menit — ikuti langkah-langkah sederhana berikut untuk mengintegrasikan dan men-deploy model melalui platform Atlas Cloud.
Daftar di atlascloud.ai dan selesaikan verifikasi. Pengguna baru mendapatkan kredit gratis untuk menjelajahi platform dan menguji model.
Gabungkan model Gemini Omni Flash canggih dengan platform akselerasi GPU Atlas Cloud untuk performa, skalabilitas, dan pengalaman pengembangan yang tak tertandingi.
Latensi Rendah:
Inferensi yang dioptimalkan GPU untuk respons real-time.
API Terpadu:
Satu integrasi untuk Gemini Omni Flash, GPT, Gemini, dan DeepSeek.
Harga Transparan:
Billing per token, mendukung mode Serverless.
Pengalaman Developer:
SDK, analitik data, alat fine-tuning, dan template tersedia lengkap.
Keandalan:
Ketersediaan 99.99%, kontrol izin RBAC, logging kepatuhan.
Keamanan & Kepatuhan:
Sertifikasi SOC 2 Type II, kepatuhan HIPAA, kedaulatan data AS.
Gemini Omni API memberi developer akses ke keluarga pembuatan dan pengeditan video multimodal native dari Google DeepMind melalui Atlas Cloud. Bergantung pada endpoint yang dipilih, API ini dapat membuat video dari teks atau gambar, menggunakan media referensi, mengedit rekaman yang sudah ada, serta menghasilkan audio native yang tersinkronisasi.
Gemini Omni 1.1 Flash menambahkan ekstensi video, interpolasi frame pertama dan terakhir, resolusi output dari 360p hingga 4K, serta panduan referensi yang diperluas. Varian ekstensi menambahkan 3 hingga 10 detik per request dan dapat dirangkai untuk membuat video koheren berdurasi hingga 40 detik.
Buat akun Atlas Cloud, simpan API key Anda di server, lalu pilih endpoint model yang sesuai dengan alur kerja Anda. Atlas Cloud menyediakan satu key yang kompatibel dengan OpenAI, sementara schema yang dipublikasikan untuk setiap endpoint menentukan prompt, input media, dan pengaturan pembuatan yang diperlukan.
Pilih text to video jika memulai dari prompt, image to video jika menganimasikan gambar diam, atau reference to video jika panduan identitas dan gaya menjadi penting. Gunakan video edit untuk memodifikasi rekaman yang sudah ada dan endpoint Gemini Omni 1.1 Flash video extend untuk melanjutkan sebuah adegan.
Batas media berbeda-beda menurut endpoint dan versi model. Gemini Omni 1.1 Flash Reference to Video menerima hingga 10 gambar referensi dan 3 klip video referensi, sedangkan endpoint sebelumnya mendukung batas yang berbeda. Karena itu, periksa schema endpoint yang dipilih sebelum mengirimkan media.
Gemini Omni 1.1 Flash mendukung output berdurasi 3 hingga 10 detik pada 24 FPS, dengan pilihan resolusi 360p, 720p, 1080p yang diperbesar, dan 4K yang diperbesar. Rasio aspek yang didukung adalah 16:9 dan 9:16, meskipun kontrol yang tersedia dapat berbeda menurut endpoint Atlas Cloud.
Ya. Varian video edit mengikuti instruksi teks untuk menambahkan, menghapus, mengganti, atau mengubah gaya elemen, sembari mempertahankan bagian rekaman yang tidak disebutkan dalam prompt. Untuk perubahan iteratif, gunakan instruksi yang terfokus dan konteks interaksi yang didukung oleh alur kerja yang dipilih.
Untuk melanjutkan sebuah adegan, berikan klip yang sudah ada ke endpoint Gemini Omni 1.1 Flash video extend dan minta tambahan 3 hingga 10 detik. Ekstensi dapat dirangkai hingga total 40 detik, sedangkan varian image to video dapat melakukan interpolasi antara frame pertama dan terakhir yang diberikan.
Harga standar Atlas Cloud untuk Gemini Omni 1.1 Flash adalah $0.041 per detik untuk text to video, reference to video, video editing, dan video extension, sedangkan image to video dikenai biaya $0.043 per detik. Endpoint Gemini Omni Flash sebelumnya mulai dari $0.112 per detik dengan penagihan berdasarkan penggunaan dan tanpa memerlukan subscription.
Setiap video yang dihasilkan menyertakan watermark SynthID tak terlihat yang dapat dideteksi secara terprogram. Filter keamanan diterapkan pada prompt dan output yang dihasilkan, sementara waktu pemrosesan bergantung pada durasi, resolusi, dan beban layanan. Kontrol khusus untuk negative prompt, system instruction, temperature, top_p, dan stop sequence tidak didukung, jadi cantumkan pengecualian dalam prompt utama.
Panduan, tutorial, dan pembaruan produk untuk membantu Anda memaksimalkan Atlas Cloud.