Lindy membangun karyawan AI. Ia memindahkan armadanya ke model open weights yang dilayani oleh Atlas Cloud, memangkas biaya inferensi sekitar 90%, dan melakukannya tanpa mengorbankan kualitas produk.
~90% biaya inferensi lebih rendah · 60% token input dilayani dari cache · 3.000+ permintaan per menit yang stabil · Pertumbuhan trafik 10x+ tanpa pembangunan ulang · 24 model dari 11 lab dalam satu kunci
Lindy menjalankan salah satu beban kerja agen paling berat di produksi, dan berjalan di Atlas Cloud. Inilah yang berubah:
- Karena Atlas memberi harga diskon untuk panggilan berulang, Lindy dapat menjalankan agen yang memeriksa ulang pekerjaan mereka alih-alih menebak. Enam dari sepuluh token input yang dikirim berasaskan cache, sehingga prefiks yang dibaca ulang oleh agen puluhan kali dalam satu tugas hampir tidak memakan biaya.
- Karena Atlas menyediakan kapasitas yang dibutuhkan, Lindy mampu menumbuhkan volume lebih dari sepuluh kali lipat dengan mengirim lebih banyak trafik, bukan dengan membangun ulang apa pun, dan Atlas mampu mempertahankan 3.000+ permintaan per menit selama satu jam berturut-turut.
- Karena Atlas menghadirkan seluruh katalog dalam satu kunci, Lindy dapat beralih ke model baru dalam satu sore. Mereka telah menjalankan 24 model dari 11 lab melalui satu integrasi tunggal.
- Karena Atlas melayani itu melalui kontrak bernama yang tersertifikasi SOC 2, Lindy dapat menempatkan model open-weight di depan data pelanggan mereka dengan tetap bisa mempertanggungjawabkan siapa yang menjalankannya.
Angka 90% adalah judul utama Lindy. Alasan angka itu bertahan, dan alasan migrasi berikutnya akan lebih mudah dari yang ini, adalah platform yang mendasarinya.
Bagi Lindy, biaya adalah inti bisnis
Lindy membangun AI employee. Seorang Lindy Teammate bergabung dengan perusahaan seperti layaknya karyawan baru: ia menerima permintaan di Slack, terhubung ke alat yang sudah dipakai tim, ikut dalam rapat, dan menyimpan pelajaran agar permintaan berikutnya bisa dimulai dari titik yang lebih maju. Tidak ada yang menulis otomatisasi; mereka cukup mendelegasikan, dan agen yang mengerjakan tugasnya.
Desain seperti itu menciptakan tagihan infrastruktur yang signifikan. AI employee yang membaca thread, memeriksa kalender, mencari data, dan menyusun balasan telah membuat puluhan panggilan model sebelum sebuah kata pun dilihat. Dan karena Teammate melayani seluruh tim, volume ikut bertambah seiring jumlah karyawan. Pada skala ini, harga model di balik produk menentukan kelangsungan bisnis.
[PUBLIC] "Harga Lindy hanya masuk akal jika inferensi terus terjangkau."
— Bruno Škvorc, Staff Software Engineer, Lindy
Jadi Lindy melakukan hal yang dikehendaki matematika keuangan. Ia memindahkan sebagian besar trafik agen terkelolanya dari Claude, Sonnet, dan Gemini ke DeepSeek v4 Flash yang berjalan di Atlas Cloud, dan biaya inferensi pada rute-rute yang dimigrasi turun sekitar 90%. Mengganti nama model hanya butuh satu sore. Kunci untuk mempertahankan perbedaan itu—di volume produksi, tanpa produk menurun kualitasnya—adalah alasan mereka memilih Atlas Cloud.
Mengapa angka 90% bertahan: panggilan ke-11 hampir gratis
Jika dihitung per token, agen akan membayar penuh untuk prefiks yang sama puluhan kali dalam satu tugas, dan tagihan bertambah besar seiring kegelisahan berpikirnya. Pajak inilah yang menjaga produk agen tetap dangkal: satu kali pembacaan, bukan tiga, karena yang ketiga harganya sama dengan yang pertama. Itu juga sebabnya penggantian model secara naif menghemat lebih sedikit dari yang terilap di kertas, karena prefiks yang diulang itu , diam-diam kembali mengalir ke dalam tagihan.
Atlas membebaskan pajak dari tempat paling berat. Enam dari sepuluh token input Lindy dianggap dikenal, bukan diproses ulang, dengan tarif yang dikontrak berdasarkan volume nyatanya, sehingga prefiks yang mendominasi setiap panggilan agen hampir gratis. Itu yang mengubah pergantian model menjadi angka 90% yang kokoh, bukan angka yang terkikis saat volume naik. Dan itu yang memungkinkan agen di Atlas berjalan tiga kali pembacaan, sementara agen yang sama berjalan satu kali jika dihitung per token.







