Seedance 2.0 Mini & Fast API dengan harga terendah di dunia — diskon hingga 68% dari harga resmi

Bagaimana Lindy Memangkas Biaya Inferensi Agennya hingga 90% di Atlas Cloud

Lindy memindahkan karyawan AI-nya ke DeepSeek v4 Flash di Atlas Cloud dan memangkas biaya inferensi agen hingga 90%. Lihat bagaimana prompt caching mempertahankan penghematan tersebut pada skala 10x.

Bagaimana Lindy Memangkas Biaya Inferensi Agennya hingga 90% di Atlas Cloud

Lindy membangun karyawan AI. Ia memindahkan armadanya ke model open weights yang dilayani oleh Atlas Cloud, memangkas biaya inferensi sekitar 90%, dan melakukannya tanpa mengorbankan kualitas produk.

~90% biaya inferensi lebih rendah · 60% token input dilayani dari cache · 3.000+ permintaan per menit yang stabil · Pertumbuhan trafik 10x+ tanpa pembangunan ulang · 24 model dari 11 lab dalam satu kunci

Lindy menjalankan salah satu beban kerja agen paling berat di produksi, dan berjalan di Atlas Cloud. Inilah yang berubah:

  • Karena Atlas memberi harga diskon untuk panggilan berulang, Lindy dapat menjalankan agen yang memeriksa ulang pekerjaan mereka alih-alih menebak. Enam dari sepuluh token input yang dikirim berasaskan cache, sehingga prefiks yang dibaca ulang oleh agen puluhan kali dalam satu tugas hampir tidak memakan biaya.
  • Karena Atlas menyediakan kapasitas yang dibutuhkan, Lindy mampu menumbuhkan volume lebih dari sepuluh kali lipat dengan mengirim lebih banyak trafik, bukan dengan membangun ulang apa pun, dan Atlas mampu mempertahankan 3.000+ permintaan per menit selama satu jam berturut-turut.
  • Karena Atlas menghadirkan seluruh katalog dalam satu kunci, Lindy dapat beralih ke model baru dalam satu sore. Mereka telah menjalankan 24 model dari 11 lab melalui satu integrasi tunggal.
  • Karena Atlas melayani itu melalui kontrak bernama yang tersertifikasi SOC 2, Lindy dapat menempatkan model open-weight di depan data pelanggan mereka dengan tetap bisa mempertanggungjawabkan siapa yang menjalankannya.

Angka 90% adalah judul utama Lindy. Alasan angka itu bertahan, dan alasan migrasi berikutnya akan lebih mudah dari yang ini, adalah platform yang mendasarinya.

Bagi Lindy, biaya adalah inti bisnis

Lindy membangun AI employee. Seorang Lindy Teammate bergabung dengan perusahaan seperti layaknya karyawan baru: ia menerima permintaan di Slack, terhubung ke alat yang sudah dipakai tim, ikut dalam rapat, dan menyimpan pelajaran agar permintaan berikutnya bisa dimulai dari titik yang lebih maju. Tidak ada yang menulis otomatisasi; mereka cukup mendelegasikan, dan agen yang mengerjakan tugasnya.

Desain seperti itu menciptakan tagihan infrastruktur yang signifikan. AI employee yang membaca thread, memeriksa kalender, mencari data, dan menyusun balasan telah membuat puluhan panggilan model sebelum sebuah kata pun dilihat. Dan karena Teammate melayani seluruh tim, volume ikut bertambah seiring jumlah karyawan. Pada skala ini, harga model di balik produk menentukan kelangsungan bisnis.

[PUBLIC] "Harga Lindy hanya masuk akal jika inferensi terus terjangkau."

— Bruno Škvorc, Staff Software Engineer, Lindy

Jadi Lindy melakukan hal yang dikehendaki matematika keuangan. Ia memindahkan sebagian besar trafik agen terkelolanya dari Claude, Sonnet, dan Gemini ke DeepSeek v4 Flash yang berjalan di Atlas Cloud, dan biaya inferensi pada rute-rute yang dimigrasi turun sekitar 90%. Mengganti nama model hanya butuh satu sore. Kunci untuk mempertahankan perbedaan itu—di volume produksi, tanpa produk menurun kualitasnya—adalah alasan mereka memilih Atlas Cloud.

Mengapa angka 90% bertahan: panggilan ke-11 hampir gratis

Jika dihitung per token, agen akan membayar penuh untuk prefiks yang sama puluhan kali dalam satu tugas, dan tagihan bertambah besar seiring kegelisahan berpikirnya. Pajak inilah yang menjaga produk agen tetap dangkal: satu kali pembacaan, bukan tiga, karena yang ketiga harganya sama dengan yang pertama. Itu juga sebabnya penggantian model secara naif menghemat lebih sedikit dari yang terilap di kertas, karena prefiks yang diulang itu , diam-diam kembali mengalir ke dalam tagihan.

Atlas membebaskan pajak dari tempat paling berat. Enam dari sepuluh token input Lindy dianggap dikenal, bukan diproses ulang, dengan tarif yang dikontrak berdasarkan volume nyatanya, sehingga prefiks yang mendominasi setiap panggilan agen hampir gratis. Itu yang mengubah pergantian model menjadi angka 90% yang kokoh, bukan angka yang terkikis saat volume naik. Dan itu yang memungkinkan agen di Atlas berjalan tiga kali pembacaan, sementara agen yang sama berjalan satu kali jika dihitung per token.

![](https://atlascloud.sg.larksuite.com/space/api/box/stream/download/asynccode/?code=YzQwNWQyZWRiMTc2ODkxZDBhZDAyZWNkYjg2NWVkODBfb0RweDlHT0JLbta3sWNUZDR0QlZ0QlZ0QlZ0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VnR0VkENC:\n- FERG: The full path has been encoded with base64url, but we need to preserve the same URL as source: it's as given. So keep exact URL.

[PROPOSED — your call] "Beban kerja agen banyak memakai konteks yang sama untuk banyak panggilan. Caching dari Atlas membuat kami tidak perlu bayar full price untuk konteks yang sama setiap kali, dan itu adalah bagian besar kenapa penghematan tetap bertahan saat skalanya naik."

— Ian McGregor, Head of Engineering, Lindy

Kapasitas yang sudah siap sebelum Lindy membutuhkannya

Trafik agen tidak punya jam tenang di malam hari atau hari rilis yang bisa dijadwal di awal. Pekerjaan datang saat tim sedang bekerja, dan tidak berhenti saat Anda melakukan scaling. Yang penting bukan lonjakan yang bisa ditahan buffer, tapi level yang bisa dipertahankan oleh penyedia. Lindy menumbuhkan volume mereka lebih dari sepuluh kali lipat dengan mengirim lebih banyak trafik, bukan dengan bangunan ulang, dan Atlas mampu mempertahankan 3.000+ permintaan per menit untuk satu jam. Kapasitas selalu lebih awal dari beban kerja, sehingga scaling menjadi keputusan bisnis, bukan proyek infrastruktur.

Dukungan yang menghasilkan produk, bukan sekadar tiket

Di skala ini, perbedaan antar provider bukanlah pada dasbor, melainkan siapa yang merespons ketika ada yang terlihat salah. Para insinyur Lindy dan para insinyur inferensi Atlas berbagi satu channel, dan jawaban datang di hari yang sama dari orang yang bisa mengambil tindakan. Sebagian jawaban itu menjadi bagian dari perubahan produk: Lindy meminta fitur untuk mengalihkan kepandaian akun tim, saat itu Atlas belum mendukungnya, lalu itu dirilis, dengan insinyur Atlas yang memindahkan akun itu sendiri.

Provider yang punya wajah yang bisa disebut

Migrasi ke model open-weight menghilangkan pihak yang pernah bertanggung jawab atas cara model dijalankan. Pertanyaan yang dulu diputuskan oleh brand lab kini diarahkan ke provider: siapa yang menyajikan model ini, dalam kontrol apa, dan apa yang terjadi dengan data yang lewat. Atlas menjawab pertanyaan itu dengan nama, bukan dengan router, melalui kontrak yang tersertifikasi SOC 2, dengan data klien yang tidak disimpan atau digunakan untuk melatih. Ini jauh lebih penting bagi AI employee daripada produk chat, karena seorang Teammate membaca thread Slack, kalender, dan sejarah perusahaan tempat ia bekerja. Pertanyaan infrastruktur berada tepat di bawah pertanyaan kepercayaan pelanggan, dan Atlas adalah jawaban untuk dua-duanya.

Tidak terkunci pada DeepSeek, juga tidak terkunci pada apa pun

Migrasi ini mengikat Lindy pada strategi, bukan pada model tertentu . DeepSeek v4 Flash memenangkan beban kerja yang diuji , dan terus bertahan selama itu masih harga terbaik dengan kualitas yang memadai. Pemenang berikutnya mungkin datang dari lab lain di bawah lisensi yang berbeda, dan karena Atlas Cloud menyediakan akses ke semua model dalam satu API, mencoba saja hanya butuh satu sore, bukan siklus pengadaan. Kebebasan untuk selalu menjalankan model terbaik melalui Atlas Cloud memberi benar benar likuiditas operasional Lindy.

Jika Anda menjalankan agen di marketplace, pindahkan mereka

Lindy menjalani jalur ini sendiri. Mereka pertama kali mengenal DeepSeek di OpenRouter, dan run model itu melalui evaluasi di sana, dan membuktikan bahwa model tersebut layak untuk dimigrasi. Di saat pengujian yang sama, mereka juga menemukan hal yang menentukan tempat produksi berjalan.

[PUBLIC] "Kami juga menguji model yang sama pada provider inferensi yang berbeda. Karena itu menjengkelkan. Ternyata provider itu berpengaruh. Model dengan nama yang sama bisa memberikan hasil yang berbeda-beda tergantung siapa yang menyajikannya."

— Bruno Škvorc, Staff Software Engineer, Lindy

Marketplace dibuat untuk membantu Anda memilih , bukan untuk menjalankan produk Anda. Kirim trafik produksi melalui router, ia akan diteruskan ke provider mana pun yang punya kapasitas kosong, sehingga Anda tidak bisa memilih siapa yang menyajani model Anda dan tidak bisa melihat siapa yang sebenarnya. Bobot yang sama pada mesin yang berbeda bisa mengembalikan hasil yang berbeda, karena perbedaan kuantisasi atau jalan pintas pada stack penyedia, dan angka-angka itu mencapai pengguna Anda sebelum para developer melihat di dasbor. Setiap hop router secara senyap menggeser kualitas produk yang dibayar para pelanggan Anda. Itu reputasi Anda, diputuskan oleh koin yang tidak pernah Anda lempar.

Jadi Lindy tidak menjalankan produksi di OpenRouter. Saat trafik mulai berjalan langsung, trafik tersebut langsung ke kontrak langsung dengan Atlas: satu stack, tetap sama untuk setiap permintaan, dioptimalkan untuk model dan dipegang oleh kontrak, dengan dukungan caching dan kapasitas yang dibutuhkan beban kerja agen produksi, dan semua katalog ada di kunci yang sama. Jika agen Anda sudah berproduksi dan masih berjalan via router, Anda mengirimkan produk yang tidak bisa Anda kendilkan, dan Anda akan sulit mengetahuinya hingga pelanggan berkomentar. Pindahkan mereka seperti yang dilakukan Lindy.

Bicarakan tentang beban kerja Anda pada kami, dan kami akan memberi tahu Anda berapa besar biaya yang seharusnya, atau browse seluruh katalog.

Tentang Lindy

Lindy membangun AI employees. Lindy Teammate, yang diluncurkan pada Agustus 2026, bekerja di beberapa lokal dengan tim manusia: ia menerima permintaan di Slack, terhubung ke alat yang sudah dijalankan perusahaan, bergabung dalam rapat, dan mengumpulkan konteks tim agar setiap permintaan dimulai dari posisi yang lebih maju. Alih-alih meminta orang untuk membangun dan memelihara automasi, Lindy meminta mereka hanya mendelegasikan. Lindy didirikan oleh Flo Crivello dan bermarkas di San Francisco.

Tentang Atlas Cloud

Atlas Cloud adalah platform inferensi AI modal sekaligus: 400+ model untuk video, gambar, bahasa, dan audio. Akses dapat melalui satu API key, satu endpoint, dan satu akun penagihan, dan kompatibel dengan API OpenAI untuk model bahasa. Sudah tersertifikasi SOC 2.

Model Terbaru

Satu API untuk semua AI multimedia.

Jelajahi semua model