Lindy bouwde de AI-medewerker. Het verplaatste de vloot naar open weights geserveerd door Atlas Cloud, verlaagde de inference-rekening met ongeveer 90%, en deed dat zonder een slechter product te leveren._
~90% lagere inference-kosten · 60% van de inputtokens uit cache · 3.000+ verzoeken per minuut volgehouden · 10x+ verkeersgroei, niets herbouwd · 24 modellen van 11 labs op één key
Lindy draait een van de meest veeleisende agent-workloads in productie, en het draait op Atlas Cloud. Dit is wat dat veranderde:
- Omdat Atlas de herhaalde aanroep tegen cachetarieven factureert, draait Lindy agents die hun werk controleren in plaats van te gissen. Zes van elke tien inputtokens die het verstuurt, worden uit cache geserveerd, waardoor het prefix dat een agent een dozijn keer per taak herleest bijna niets kost.
- Omdat Atlas capaciteit levert voor de workload, zag Lindy zijn volume meer dan vertienvoudigen door meer verkeer te sturen, niet door iets te herbouwen, en Atlas houdt meer dan 3.000 verzoeken per minuut een uur lang vol.
- Omdat Atlas de hele catalogus op één key beschikbaar stelt, kan Lindy in een middag overstappen naar een nieuw model. Het heeft 24 modellen van 11 labs via één integratie laten draaien.
- Omdat Atlas het serveert op een contract op naam, SOC 2-gecertificeerd, kan Lindy een open-weights-model voor de gegevens van zijn klanten plaatsen en instaan voor wie het draait.
De 90% is de headline van Lindy. De reden dat die standhoudt, en de reden dat de volgende migratie makkelijker zal zijn dan deze, is het platform eronder.
Voor Lindy is de rekening de business
Lindy bouwt AI-medewerkers. Een Lindy Teammate komt bij een bedrijf zoals een nieuwe medewerker: het neemt verzoeken aan in Slack, verbindt zich met de tools die het team al gebruikt, zit in vergaderingen en onthoudt wat het leert, zodat het volgende verzoek verder begint dan het vorige. Niemand schrijft een automatisering; ze delegeren, en de agent doet het werk.
Dat ontwerp betekent een stevige infrastructuurfactuur. Een AI-medewerker die een thread leest, een agenda checkt, een record opzoekt en een antwoord opstelt, heeft een dozijn modelaanroepen gedaan voordat iemand een woord ziet, en omdat een Teammate een heel team bedient, groeit het volume met het aantal medewerkers. In die vorm bepaalt de prijs van het model achter het product de levensvatbaarheid van het bedrijf.
[PUBLIC] "Lindy's prijsstelling werkt alleen als inference steeds goedkoper wordt."
— Bruno Škvorc, Staff Software Engineer, Lindy
Dus Lindy deed wat de financiële rekensom eist. Het verplaatste het grootste deel van het verkeer van zijn beheerde agents van Claude, Sonnet en Gemini naar DeepSeek v4 Flash dat op Atlas Cloud draait, en de inference-kosten op de gemigreerde routes daalden met ongeveer 90%. Het veranderen van de modelnaam kostte een middag. Dat het standhoudt, op productievolume, zonder dat het product slechter wordt, is waarom ze voor Atlas Cloud kozen.
Waarom de 90% standhoudt: de elfde aanroep is bijna gratis
Afgerekend per token betaalt een agent de volledige prijs voor hetzelfde prefix een dozijn keer per taak, en de rekening groeit met hoe zorgvuldig het denkt. Die belasting is wat agentproducten ondiep houdt: één keer doorlopen in plaats van drie keer, omdat de derde keer net zoveel kost als de eerste. Het is ook de reden waarom een naïeve modelwissel minder bespaart dan de stickerprijs suggereert, omdat het herhaalde prefix de rekening stilletjes weer aanvult.
Atlas verwijdert de belasting waar die het zwaarst is. Zes van elke tien inputtokens van Lindy worden herkend in plaats van opnieuw verwerkt, tegen een tarief dat is gecontracteerd op basis van het werkelijke volume, waardoor het prefix dat elke agentaanroep domineert bijna gratis is. Dat is wat een modelwissel omzet in een duurzame 90% in plaats van een getal dat uitholt naarmate het gebruik stijgt, en het is wat een agent op Atlas drie keer laat doorlopen waar dezelfde agent, afgerekend per token, maar één keer zou doorlopen.
[PROPOSED — your call] "Agent-workloads hergebruiken veel context over veel modelaanroepen. Atlas' caching betekent dat we niet elke keer de volledige prijs voor diezelfde context betalen, en dat is een groot deel van de reden waarom de besparingen op schaal standhielden.."
— Ian McGregor, Head of Engineering, Lindy
Capaciteit die er was voordat Lindy het nodig had
Agentverkeer heeft geen rustig nachtelijk venster en geen lanceringsdag om op te plannen. Werk komt binnen terwijl teams werken en stopt niet terwijl je schaalt. Wat telt is niet de piek die een buffer kan opvangen, maar het tempo dat een provider kan vasthouden. Lindy zag zijn volume meer dan vertienvoudigen door meer verkeer te sturen, niet door iets te herbouwen, en Atlas hield meer dan 3.000 verzoeken per minuut een uur lang vol. De capaciteit lag voor op de workload, dus schalen was een zakelijke beslissing en nooit een infrastructuurproject.
Support die product oplevert, geen tickets
Op dit volume is het verschil tussen providers minder het dashboard dan wie antwoordt wanneer er iets verkeerd uitziet. Lindy's engineers en Atlas' inference-engineers delen een kanaal, en antwoorden komen dezelfde dag terug van mensen die ermee aan de slag kunnen. Sommige van die antwoorden worden productwijzigingen: Lindy vroeg om een manier om het eigendom van een teamaccount over te dragen, Atlas ondersteunde dat destijds niet, en het werd opgeleverd, waarbij Atlas' engineers het account zelf overhevelden.
Een provider die je kunt noemen
Overstappen naar een open-weights-model verwijdert de partij die vroeger verantwoording aflegde over hoe het model werd gedraaid. De vragen die het merk van een lab vroeger beantwoordde, richten zich nu op de provider: wie serveert dit, onder welke controles, en wat gebeurt er met de gegevens die erdoorheen gaan. Atlas beantwoordt die op naam in plaats van via een router, op een SOC 2-gecertificeerd contract, waarbij klantgegevens noch worden opgeslagen noch worden gebruikt voor training. Dat telt zwaarder voor een AI-medewerker dan voor een chatproduct, omdat een Teammate de Slack-threads, agenda's en records leest van het bedrijf waarvoor het werkt. De infrastructuurvraag ligt direct onder de klantvertrouwensvraag, en Atlas is het antwoord op beide.
Niet vastgeklonken aan DeepSeek, aan niets vastgeklonken
De migratie verbond Lindy aan een strategie, niet aan een model. DeepSeek v4 Flash won de workloads waarop het werd getest en behoudt de positie zolang het de beste prijs is bij voldoende kwaliteit. De volgende winnaar komt uit een ander lab onder een andere licentie, en omdat Atlas Cloud toegang biedt tot alle modellen via één API, kost uitproberen een middag in plaats van een inkoopprocedure. Op één testdag stuurde Lindy 47 verzoeken door twaalf modellen die het nooit eerder had gebruikt, verspreid over zeven labs en drie modaliteiten, allemaal op de key die het al had. Drie werden productieworkloads. De vrijheid om altijd het beste model te draaien via Atlas Cloud geeft Lindy echte operationele wendbaarheid.
Als je agents op een marketplace draait, verplaats ze dan
Lindy bewandelde precies dit pad. Het ontmoette DeepSeek voor het eerst op OpenRouter, draaide het model daar door zijn evals en bewees dat een migratie de moeite waard was. In diezelfde test ontdekte het datgene dat bepaalde waar productie zou draaien.
[PUBLIC] "We hebben hetzelfde model ook getest op verschillende inference-providers. Tot ons ongenoegen deed de provider ertoe. Hetzelfde nominale model kon verschillend scoren, afhankelijk van wie het serveerde."
— Bruno Škvorc, Staff Software Engineer, Lindy
Een marketplace is gebouwd om je te helpen winkelen, niet om je product te draaien. Stuur productieverkeer door een router en het gaat naar de eerste de beste provider met vrije capaciteit, dus je kiest niet wie je model serveert en je kunt niet zien wie dat deed. Dezelfde weights op verschillende machines leveren verschillende resultaten op, door quantisatie of een shortcut in iemands serving-stack, en die resultaten bereiken je gebruikers voordat ze je dashboard bereiken. Elke routerhop gooit stilletjes opnieuw met de kwaliteit van het product waar je klanten voor betalen. Je kunt het niet debuggen, omdat je niet kunt zien wie de aanroep serveerde. Je kunt het niet repareren, omdat je geen volledige controle over de routing hebt. Dat is jouw reputatie, beslist door een munt die jij nooit mag opgooien.
Dus Lindy draaide geen productie op OpenRouter. Toen het verkeer live ging, ging het naar een direct contract met Atlas: één serving-stack, dezelfde bij elke aanvraag, afgestemd op het model en gehouden aan een contract, met de caching en capaciteit die een live agent-workload nodig heeft en de volledige catalogus op dezelfde key. Als je agents in productie zijn en nog steeds via een router draaien, lever je een product dat je niet stabiel kunt houden, en je zult het pas weten als een klant het ontdekt. Verplaats ze, zoals Lindy deed.
Praat met ons over je workload en we vertellen je wat het zou moeten kosten, of blader door de catalogus.
Over Lindy
Lindy bouwt AI-medewerkers. Lindy Teammate, gelanceerd in augustus 2026, werkt naast een menselijk team: het neemt verzoeken aan in Slack, verbindt zich met de tools die een bedrijf al gebruikt, doet mee aan vergaderingen en bouwt de context van het team op, zodat elk verzoek verder begint dan het vorige. In plaats van mensen te vragen automatiseringen te bouwen en te onderhouden, vraagt Lindy hen te delegeren. Lindy is opgericht door Flo Crivello en is gevestigd in San Francisco.
Over Atlas Cloud
Atlas Cloud is een uniform full-modal AI-inferenceplatform: 400+ modellen voor video, beeld, taal en audio, via één API-key, één endpoint en één facturatieaccount, OpenAI-compatibel voor taalmodellen. SOC 2-gecertificeerd.







