Seedance 2.0 Mini & Fast API aux prix les plus bas au monde — jusqu'à 68 % de réduction sur le tarif officiel

Comment Lindy a réduit ses coûts d'inférence d'agents de 90 % sur Atlas Cloud

Lindy a déplacé ses employés IA vers DeepSeek v4 Flash sur Atlas Cloud et a réduit les coûts d'inférence des agents de 90%. Voyez comment le prompt caching a maintenu les économies à une échelle de 10x.

Comment Lindy a réduit ses coûts d'inférence d'agents de 90 % sur Atlas Cloud

Lindy a créé l’employé IA. Elle a déplacé sa flotte vers des poids ouverts servis par Atlas Cloud, a réduit sa facture d’inférence d’environ 90 %, et l’a fait sans livrer un produit de moindre qualité._

~90 % de coût d’inférence en moins · 60 % des tokens d’entrée servis depuis le cache · plus de 3 000 requêtes par minute en continu · croissance du trafic de plus de 10x, rien reconstruit · 24 modèles de 11 laboratoires sur une seule clé

Lindy exécute en production l’une des charges de travail d’agents les plus exigeantes, et elle tourne sur Atlas Cloud. Voici ce que cela a changé :

  • Parce qu’Atlas facture l’appel répété au tarif du cache, Lindy fait tourner des agents qui vérifient leur travail au lieu de deviner. Six de ses dix tokens d’entrée sont servis depuis le cache, si bien que le préfixe qu’un agent relit une douzaine de fois par tâche ne coûte presque rien.
  • Parce qu’Atlas dimensionne les ressources pour la charge de travail, Lindy a multiplié son volume par plus de dix en envoyant plus de trafic, sans rien reconstruire, et Atlas maintient plus de 3 000 requêtes par minute pendant une heure d’affilée.
  • Parce qu’Atlas porte tout le catalogue sur une seule clé, Lindy peut changer de modèle en un après-midi. Elle a fait passer 24 modèles de 11 laboratoires par une seule intégration.
  • Parce qu’Atlas le sert dans le cadre d’un contrat nommé et certifié SOC 2, Lindy peut placer un modèle à poids ouverts devant les données de ses clients et se porter garante de qui l’exécute.

Les 90 % sont le chiffre phare de Lindy. La raison pour laquelle ils tiennent, et pour laquelle la prochaine migration sera plus facile que celle-ci, c’est la plateforme sous-jacente.

Pour Lindy, la facture, c’est le business

Lindy crée des employés IA. Un Lindy Teammate rejoint une entreprise comme le ferait une nouvelle recrue : il reçoit des demandes dans Slack, se connecte aux outils que l’équipe utilise déjà, assiste aux réunions et mémorise ce qu’il apprend pour que la demande suivante parte de plus loin que la précédente. Personne n’écrit d’automatisation ; ils délèguent, et l’agent fait le travail.

Cette conception impose une facture d’infrastructure lourde. Un employé IA qui lit un fil de discussion, vérifie un calendrier, consulte un enregistrement et rédige une réponse a déjà effectué une douzaine d’appels de modèles avant que quiconque ne voie un mot, et comme un Teammate sert toute une équipe, le volume augmente avec l’effectif. Dans cette configuration, le prix du modèle derrière le produit détermine la viabilité de l’entreprise.

[PUBLIC] "La tarification de Lindy ne fonctionne que si l’inférence continue de devenir moins chère."

— Bruno Škvorc, Ingénieur logiciel principal, Lindy

Lindy a donc fait ce que les calculs financiers imposent. Elle a transféré l’essentiel de son trafic d’agents gérés de Claude, Sonnet et Gemini vers DeepSeek v4 Flash, exécuté sur Atlas Cloud, et les coûts d’inférence sur les routes migrées ont chuté d’environ 90 %. Changer le nom du modèle a pris un après-midi. Le faire tenir, en volume de production, sans que le produit ne se dégrade, c’est pourquoi ils ont choisi Atlas Cloud.

Pourquoi les 90 % tiennent : le onzième appel est presque gratuit

Facturé au token, un agent paie le tarif plein pour le même préfixe une douzaine de fois par tâche, et la facture augmente avec la rigueur de sa réflexion. Cette taxe est ce qui maintient les produits d’agents à un niveau superficiel : un passage au lieu de trois, car le troisième coûte autant que le premier. C’est aussi pourquoi un simple changement de modèle économise moins que ce que l’annonce promet, car le préfixe répété remplit silencieusement la facture.

Atlas supprime la taxe là où elle est la plus lourde. Six des dix tokens d’entrée de Lindy sont reconnus plutôt que retraités, à un tarif contracté sur son volume réel, si bien que le préfixe qui domine chaque appel d’agent est presque gratuit. C’est ce qui transforme un changement de modèle en 90 % durables plutôt qu’en un chiffre qui s’érode à mesure que l’utilisation augmente, et c’est ce qui permet à un agent sur Atlas de faire trois passages là où le même agent, facturé au token, n’en ferait qu’un.

[PROPOSÉ — à vous de voir] "Agent workloads réutilisent beaucoup de contexte sur de nombreux appels de modèles. La mise en cache d’Atlas signifie que nous ne payons pas le prix plein pour ce même contexte à chaque fois, ce qui explique en grande partie pourquoi les économies ont tenu à l’échelle.."

— Ian McGregor, Directeur de l’ingénierie, Lindy

Une capacité disponible avant que Lindy n’en ait besoin

Le trafic des agents n’a ni fenêtre nocturne calme, ni jour de lancement à planifier. Le travail arrive pendant que les équipes travaillent et ne s’arrête pas pendant que vous montez en charge. Ce qui compte n’est pas le pic qu’un tampon peut absorber, mais le débit qu’un fournisseur peut maintenir. Lindy a multiplié son volume par plus de dix en envoyant plus de trafic, sans rien reconstruire, et Atlas a maintenu plus de 3 000 requêtes par minute pendant une heure d’affilée. La capacité était en avance sur la charge de travail, donc passer à l’échelle a été une décision commerciale, jamais un projet d’infrastructure.

Un support qui livre du produit, pas des tickets

À ce volume, la différence entre les fournisseurs tient moins au tableau de bord qu’à celui qui répond quand quelque chose semble anormal. Les ingénieurs de Lindy et les ingénieurs d’inférence d’Atlas partagent un canal, et les réponses reviennent le jour même de personnes capables d’agir. Certaines de ces réponses deviennent des évolutions produit : Lindy a demandé un moyen de transférer la propriété d’un compte d’équipe, Atlas ne le prenait pas en charge à l’époque, et la fonctionnalité a été livrée, les ingénieurs d’Atlas ayant eux-mêmes déplacé le compte.

Un fournisseur que vous pouvez nommer

Passer à un modèle à poids ouverts supprime l’entité qui répondait de la manière dont le modèle était exécuté. Les questions que la marque d’un laboratoire tranchait autrefois se tournent désormais vers le fournisseur : qui sert ce modèle, sous quels contrôles, et qu’advient-il des données qui le traversent. Atlas y répond par son nom plutôt que par un routeur, dans le cadre d’un contrat certifié SOC 2, sans stocker ni utiliser les données clients pour l’entraînement. Cela importe plus pour un employé IA que pour un produit de chat, car un Teammate lit les fils Slack, les calendriers et les enregistrements de l’entreprise pour laquelle il travaille. La question d’infrastructure se trouve directement sous la question de confiance client, et Atlas est la réponse aux deux.

Pas verrouillé à DeepSeek, verrouillé à rien

La migration a engagé Lindy dans une stratégie, pas dans un modèle. DeepSeek v4 Flash a remporté les charges de travail sur lesquelles il a été testé et conserve sa position tant qu’il offre le meilleur prix pour une qualité adéquate. Le prochain gagnant viendra d’un autre laboratoire sous une autre licence, et comme Atlas Cloud donne accès à tous les modèles via une seule API, l’essayer coûte un après-midi plutôt qu’un cycle d’approvisionnement. En une journée de test, Lindy a envoyé 47 requêtes via douze modèles qu’elle n’avait jamais utilisés, issus de sept laboratoires et trois modalités, le tout avec la clé qu’elle possédait déjà. Trois sont devenus des charges de travail de production. La liberté d’exécuter toujours le meilleur modèle via Atlas Cloud donne à Lindy une véritable fluidité opérationnelle.

Si vous exécutez des agents sur une marketplace, déplacez-les

Lindy a suivi exactement ce chemin. Elle a d’abord rencontré DeepSeek sur OpenRouter, y a fait passer le modèle à ses évaluations, et a prouvé qu’une migration en valait la peine. Dans ces mêmes tests, elle a découvert ce qui a décidé de l’endroit où la production tournerait.

[PUBLIC] "Nous avons aussi testé le même modèle sur différents fournisseurs d’inférence. Fâcheusement, le fournisseur avait son importance. Le même modèle nominal pouvait obtenir des scores différents selon qui le servait."

— Bruno Škvorc, Ingénieur logiciel principal, Lindy

Une marketplace est conçue pour vous aider à acheter, pas pour faire tourner votre produit. Envoyez le trafic de production via un routeur, et il part vers le fournisseur qui a de la capacité disponible ; vous ne choisissez donc pas qui sert votre modèle et vous ne pouvez pas voir qui l’a fait. Les mêmes poids sur différentes machines renvoient des chiffres différents, à cause de la quantification ou d’un raccourci dans la pile de service de quelqu’un, et ces chiffres parviennent à vos utilisateurs avant d’arriver à votre tableau de bord. Chaque saut de routeur relance silencieusement la qualité du produit que vos clients paient. Vous ne pouvez pas le déboguer, car vous ne voyez pas qui a servi l’appel. Vous ne pouvez pas le corriger, car vous n’avez pas le contrôle total du routage. C’est votre réputation, décidée par une pièce que vous n’avez jamais la chance de lancer.

Lindy n’a donc pas fait tourner sa production sur OpenRouter. Quand le trafic est passé en production, il a été mis sur un contrat direct avec Atlas : une seule pile de service, la même pour chaque requête, réglée pour le modèle et soumise à un contrat, avec la mise en cache et la capacité dont une charge de travail d’agent en conditions réelles a besoin, et le catalogue complet sur la même clé. Si vos agents sont en production et passent encore par un routeur, vous livrez un produit que vous ne pouvez pas stabiliser, et vous ne le saurez pas avant qu’un client ne s’en aperçoive. Déplacez-les, comme Lindy l’a fait.

Parlez-nous de votre charge de travail et nous vous dirons ce qu’elle devrait coûter, ou parcourez le catalogue.

À propos de Lindy

Lindy crée des employés IA. Lindy Teammate, lancé en août 2026, travaille aux côtés d’une équipe humaine : il reçoit des demandes dans Slack, se connecte aux outils qu’une entreprise utilise déjà, participe aux réunions et enrichit le contexte de l’équipe pour que chaque demande parte de plus loin que la précédente. Au lieu de demander aux gens de créer et de maintenir des automatisations, Lindy leur demande de déléguer. Lindy a été fondée par Flo Crivello et est basée à San Francisco.

À propos d’Atlas Cloud

Atlas Cloud est une plateforme d’inférence IA unifiée et multimodale : plus de 400 modèles vidéo, image, langage et audio, via une seule clé API, un seul endpoint et un seul compte de facturation, compatible OpenAI pour les modèles de langage. Certifiée SOC 2.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles