Seedance 2.0 Mini & Fast API ai prezzi più bassi al mondo — fino al 68% di sconto sul prezzo ufficiale

Come Lindy ha ridotto i costi di inferenza degli agenti del 90% su Atlas Cloud

Lindy ha trasferito i suoi dipendenti AI su DeepSeek v4 Flash su Atlas Cloud e ha ridotto i costi di inferenza degli agenti del 90%. Scopri come il caching dei prompt ha mantenuto i risparmi su scala 10x.

Come Lindy ha ridotto i costi di inferenza degli agenti del 90% su Atlas Cloud

Lindy ha creato l'impiegato AI. Ha spostato la flotta su pesi aperti serviti da Atlas Cloud, tagliando la bolletta dell'inferenza di circa il 90%, e senza consegnare un prodotto peggiore.

Costo di inferenza ~90% inferiore · 60% dei token di input serviti dalla cache · 3.000+ richieste al minuto sostenute · crescita del traffico 10x+ senza ricostruire nulla · 24 modelli da 11 laboratori con una sola chiave

Lindy gestisce uno dei carichi di lavoro per agenti più impegnativi in produzione, e funziona su Atlas Cloud. Ecco cosa è cambiato:

  • Poiché Atlas applica la tariffa di cache alle chiamate ripetute, Lindy esegue agenti che controllano il proprio lavoro invece di indovinare. Sei di ogni dieci token di input inviati sono serviti dalla cache, quindi il prefisso che un agente rilegge una dozzina di volte per attività costa quasi nulla.
  • Poiché Atlas predispone le risorse per il carico di lavoro, Lindy ha aumentato il proprio volume di oltre dieci volte inviando più traffico, senza ricostruire nulla, e Atlas regge oltre 3.000 richieste al minuto per un'ora di fila.
  • Poiché Atlas gestisce l'intero catalogo con una sola chiave, Lindy può passare a un nuovo modello in un pomeriggio. Ha eseguito 24 modelli di 11 laboratori attraverso una singola integrazione.
  • Poiché Atlas fornisce il servizio con un contratto nominativo e certificato SOC 2, Lindy può mettere un modello a pesi aperti davanti ai dati dei propri clienti e rispondere di chi lo esegue.

Il 90% è il dato principale di Lindy. Il motivo per cui tiene, e il motivo per cui la prossima migrazione sarà più facile di questa, è la piattaforma sottostante.

Per Lindy, la bolletta è il business

Lindy crea impiegati AI. Un Lindy Teammate entra in un'azienda come farebbe una nuova risorsa: riceve richieste in Slack, si collega agli strumenti che il team già utilizza, partecipa alle riunioni e conserva ciò che apprende così la richiesta successiva parte da un punto più avanzato rispetto alla precedente. Nessuno scrive un'automazione; delegano, e l'agente fa il lavoro.

Questo design comporta una bolletta infrastrutturale pesante. Un impiegato AI che legge una conversazione, controlla un calendario, cerca un record e abbozza una risposta ha già effettuato una dozzina di chiamate al modello prima che qualcuno veda una parola, e poiché un Teammate serve un intero team, il volume cresce con il numero di dipendenti. Con questa struttura, il prezzo del modello dietro al prodotto determina la sostenibilità del business.

[PUBLIC] "Il pricing di Lindy funziona solo se l'inferenza continua a costare meno."

— Bruno Škvorc, Staff Software Engineer, Lindy

Quindi Lindy ha fatto ciò che la matematica finanziaria richiede. Ha spostato la maggior parte del traffico dei suoi agenti gestiti da Claude, Sonnet e Gemini a DeepSeek v4 Flash in esecuzione su Atlas Cloud, e i costi di inferenza sulle rotte migrate sono scesi di circa il 90%. Cambiare il nome del modello ha richiesto un pomeriggio. Riuscire a mantenerlo, a volumi di produzione, senza peggiorare il prodotto, è il motivo per cui hanno scelto Atlas Cloud.

Perché il 90% regge: l'undicesima chiamata è quasi gratuita

Con un prezzo basato sul token, un agente paga l'intera tariffa per lo stesso prefisso una dozzina di volte per attività, e la bolletta cresce con l'accuratezza del suo ragionamento. Questa tassa è ciò che mantiene superficiali i prodotti per agenti: una passata invece di tre, perché la terza costa quanto la prima. È anche il motivo per cui un semplice cambio di modello fa risparmiare meno di quanto promesso, poiché il prefisso ripetuto ricarica silenziosamente la bolletta.

Atlas elimina la tassa dove è più pesante. Sei di ogni dieci token di input di Lindy vengono riconosciuti invece che rielaborati, a una tariffa concordata in base al volume reale, quindi il prefisso che domina ogni chiamata dell'agente è quasi gratuito. Questo è ciò che trasforma un cambio di modello in un 90% durevole, e non in una cifra che si erode con l'aumentare dell'utilizzo, e che consente a un agente su Atlas di eseguire tre passate dove lo stesso agente, pagato a token, ne eseguirebbe una.

[PROPOSED — your call] "Agent workloads riutilizzano molto contesto in molte chiamate ai modelli. La cache di Atlas significa che non paghiamo il prezzo pieno per quello stesso contesto ogni volta, ed è una parte importante del motivo per cui i risparmi hanno retto su larga scala.."

— Ian McGregor, Head of Engineering, Lindy

Capacità che c'era già prima che Lindy ne avesse bisogno

Il traffico degli agenti non ha una finestra notturna tranquilla né un giorno di lancio da pianificare. Il lavoro arriva mentre i team lavorano e non si ferma mentre si scala. Ciò che conta non è il picco che un buffer può assorbire, ma la velocità che un provider può sostenere. Lindy ha aumentato il proprio volume di oltre dieci volte inviando più traffico, senza ricostruire nulla, e Atlas ha retto oltre 3.000 richieste al minuto per un'ora di fila. La capacità era davanti al carico di lavoro, quindi scalare è stata una decisione di business e mai un progetto infrastrutturale.

Un supporto che produce prodotto, non ticket

A questo volume, la differenza tra i provider sta meno nella dashboard e più in chi risponde quando qualcosa sembra sbagliato. Gli ingegneri di Lindy e gli ingegneri di inferenza di Atlas condividono un canale, e le risposte arrivano lo stesso giorno da persone che possono agire in base a esse. Alcune di quelle risposte diventano modifiche al prodotto: Lindy ha chiesto un modo per trasferire la proprietà di un account team, Atlas all'epoca non lo supportava, e la funzione è stata rilasciata, con gli ingegneri di Atlas che hanno spostato direttamente l'account.

Un provider che puoi nominare

Passare a un modello a pesi aperti elimina la controparte che prima rispondeva di come veniva eseguito il modello. Le domande che una volta il marchio di un laboratorio risolveva ora puntano al provider: chi serve questo modello, sotto quali controlli, e cosa succede ai dati che lo attraversano. Atlas risponde a queste domande con un nome, non con un router, su un contratto certificato SOC 2, con i dati dei clienti né memorizzati né usati per l'addestramento. Questo è più importante per un impiegato AI che per un prodotto di chat, perché un Teammate legge thread Slack, calendari e archivi dell'azienda per cui lavora. La questione infrastrutturale sta direttamente sotto la questione della fiducia dei clienti, e Atlas è la risposta a entrambe.

Non bloccati su DeepSeek, bloccati su nulla

La migrazione ha impegnato Lindy a una strategia, non a un modello. DeepSeek v4 Flash ha vinto sui carichi di lavoro su cui è stato testato e manterrà la posizione finché sarà il miglior prezzo a qualità adeguata. Il prossimo vincitore arriverà da un laboratorio diverso con una licenza diversa, e poiché Atlas Cloud fornisce accesso a tutti i modelli con una sola API, provarlo costa un pomeriggio, non un ciclo di approvvigionamento. In un giorno di test, Lindy ha eseguito 47 richieste attraverso dodici modelli che non aveva mai usato prima, su sette laboratori e tre modalità, tutto con la chiave che aveva già. Tre sono diventati carichi di lavoro in produzione. La libertà di eseguire sempre il modello migliore tramite Atlas Cloud dà a Lindy una vera fluidità operativa del business.

Se hai agenti su un marketplace, spostali

Lindy ha percorso esattamente questo cammino. Ha incontrato DeepSeek su OpenRouter, ci ha fatto girare il modello attraverso le sue eval, e ha dimostrato che valeva la pena migrare. Negli stessi test ha trovato la cosa che ha deciso dove sarebbe girata la produzione.

[PUBLIC] "Abbiamo anche testato lo stesso modello su diversi provider di inferenza. Fastidiosamente, il provider contava. Lo stesso modello nominale poteva ottenere punteggi diversi a seconda di chi lo serviva."

— Bruno Škvorc, Staff Software Engineer, Lindy

Un marketplace è costruito per aiutarti a fare acquisti, non per far girare il tuo prodotto. Se invii il traffico di produzione attraverso un router, questo va a qualunque provider abbia capacità disponibile, quindi non scegli tu chi serve il tuo modello e non puoi nemmeno vedere chi lo ha servito. Gli stessi pesi su macchine diverse producono numeri diversi, per via della quantizzazione o di una scorciatoia nello stack di servizio di qualcuno, e quei numeri arrivano ai tuoi utenti prima che alla tua dashboard. Ogni salto del router cambia silenziosamente la qualità del prodotto per cui i tuoi clienti stanno pagando. Non puoi fare debugging, perché non puoi vedere chi ha servito la chiamata. Non puoi correggerlo, perché non hai il controllo completo del routing. È la tua reputazione, decisa da una moneta che non potrai mai lanciare.

Quindi Lindy non ha fatto girare la produzione su OpenRouter. Quando il traffico è andato live, è passato su un contratto diretto con Atlas: uno stack di servizio unico, sempre lo stesso per ogni richiesta, ottimizzato per il modello e vincolato a un contratto, con la cache e la capacità di cui un carico di lavoro agente live ha bisogno, e l'intero catalogo sulla stessa chiave. Se i tuoi agenti sono in produzione e girano ancora attraverso un router, stai consegnando un prodotto che non puoi mantenere stabile, e non lo saprai finché non lo scoprirà un cliente. Spostali, come ha fatto Lindy.

Parlaci del tuo carico di lavoro e ti diremo quanto dovrebbe costare, oppure sfoglia il catalogo.

Chi è Lindy

Lindy crea impiegati AI. Lindy Teammate, lanciato ad agosto 2026, lavora al fianco di un team umano: riceve richieste in Slack, si collega agli strumenti che un'azienda già utilizza, partecipa alle riunioni e costruisce il contesto del team così che ogni richiesta parta da un punto più avanzato rispetto alla precedente. Invece di chiedere alle persone di creare e mantenere automazioni, Lindy chiede loro di delegare. Lindy è stata fondata da Flo Crivello e ha sede a San Francisco.

Chi è Atlas Cloud

Atlas Cloud è una piattaforma unificata di inferenza AI multimodale: oltre 400 modelli tra video, immagine, linguaggio e audio, con una sola chiave API, un solo endpoint e un solo account di fatturazione, compatibile con OpenAI per i modelli linguistici. Certificato SOC 2.

Modelli recenti

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli