Seedance 2.0 Mini & Fast API com os preços mais baixos do mundo — até 68% de desconto no preço oficial

Como a Lindy Reduziu Seus Custos de Inferência de Agentes em 90% na Atlas Cloud

Lindy mudou seus funcionários de IA para o DeepSeek v4 Flash na Atlas Cloud e reduziu os custos de inferência dos agentes em 90%. Veja como o cache de prompt manteve as economias em escala de 10x.

Como a Lindy Reduziu Seus Custos de Inferência de Agentes em 90% na Atlas Cloud

Lindy construiu o funcionário de IA. Ela moveu a frota para pesos abertos servidos pela Atlas Cloud, reduzindo sua conta de inferência em cerca de 90%, e fez isso sem entregar um produto pior.

~90% menor custo de inferência · 60% dos tokens de entrada servidos do cache · 3.000+ solicitações por minuto sustentadas · crescimento de tráfego de 10x+, sem reconstrução · 24 modelos de 11 laboratórios em uma chave

A Lindy executa uma das cargas de trabalho de agente mais exigentes em produção, e ela roda na Atlas Cloud. Veja o que isso mudou:

  • Porque a Atlas precifica a chamada repetida a tarifas de cache, a Lindy executa agentes que verificam seu trabalho em vez de adivinhar. Seis de cada dez tokens de entrada enviados são servidos do cache, então o prefixo que um agente relê uma dúzia de vezes por tarefa custa quase nada.
  • Porque a Atlas provisiona para a carga de trabalho, a Lindy cresceu seu volume mais de dez vezes enviando mais tráfego, sem reconstruir nada, e a Atlas sustenta mais de 3.000 solicitações por minuto por uma hora seguida.
  • Porque a Atlas carrega todo o catálogo em uma chave, a Lindy pode trocar para um novo modelo em uma tarde. Ela já rodou 24 modelos de 11 laboratórios através de uma única integração.
  • Porque a Atlas a atende em um contrato nomeado e certificado SOC 2, a Lindy pode colocar um modelo de pesos abertos diante dos dados de seus clientes e responder por quem o está executando.

Os 90% são o destaque da Lindy. A razão pela qual isso se sustenta, e pela qual a próxima migração será mais fácil do que esta, é a plataforma por baixo.

Para a Lindy, a conta é o negócio

A Lindy cria funcionários de IA. Um Lindy Teammate entra em uma empresa como um novo contratado: ele recebe solicitações no Slack, conecta-se às ferramentas que o time já usa, participa de reuniões e guarda o que aprende para que a próxima solicitação comece de um ponto mais adiantado que a anterior. Ninguém escreve uma automação; eles delegam, e o agente faz o trabalho.

Esse design impõe uma conta de infraestrutura pesada. Um funcionário de IA que lê um tópico, verifica um calendário, consulta um registro e redige uma resposta fez uma dúzia de chamadas de modelo antes que alguém veja uma palavra, e como um Teammate atende um time inteiro, o volume cresce com o número de funcionários. Nesse formato, o preço do modelo por trás do produto determina a viabilidade do negócio.

[PÚBLICO] "O preço da Lindy só funciona se a inferência continuar ficando mais barata."

— Bruno Škvorc, Staff Software Engineer, Lindy

Então a Lindy fez o que a matemática financeira exige. Ela moveu a maior parte do tráfego de agentes gerenciados do Claude, Sonnet e Gemini para o DeepSeek v4 Flash rodando na Atlas Cloud, e os custos de inferência nas rotas migradas caíram cerca de 90%. Trocar o nome do modelo levou uma tarde. Fazer isso se sustentar, em volume de produção, sem que o produto piorasse, é o motivo pelo qual escolheram a Atlas Cloud.

Por que os 90% se sustentam: a décima primeira chamada é quase gratuita

Com preço por token, um agente paga o valor integral pelo mesmo prefixo uma dúzia de vezes por tarefa, e a conta cresce conforme o cuidado com que ele pensa. Esse imposto é o que mantém os produtos de agente superficiais: uma passada em vez de três, porque a terceira custa tanto quanto a primeira. É também por isso que uma simples troca de modelo economiza menos do que o rótulo sugere, já que o prefixo repetido reabastece silenciosamente a conta.

A Atlas remove esse imposto onde ele é mais pesado. Seis de cada dez tokens de entrada da Lindy são reconhecidos em vez de reprocessados, a uma tarifa contratada com base no volume real, então o prefixo que domina toda chamada de agente fica quase gratuito. É isso que transforma uma troca de modelo em um 90% duradouro, em vez de um número que se desgasta conforme o uso aumenta, e é isso que permite a um agente na Atlas executar três passadas onde o mesmo agente, com preço por token, executaria uma.

[PROPOSTO — você decide] "As cargas de trabalho de agente reutilizam muito contexto em várias chamadas de modelo. O cache da Atlas significa que não pagamos o preço total por esse mesmo contexto toda vez, o que é uma grande parte do motivo pelo qual as economias se mantiveram em escala."

— Ian McGregor, Head of Engineering, Lindy

Capacidade que já estava lá antes de a Lindy precisar

O tráfego de agentes não tem janela noturna tranquila nem dia de lançamento para planejar. O trabalho chega enquanto os times estão trabalhando e não para enquanto você escala. O que importa não é o pico que um buffer pode absorver, mas a taxa que um provedor consegue sustentar. A Lindy cresceu seu volume mais de dez vezes enviando mais tráfego, sem reconstruir nada, e a Atlas sustentou mais de 3.000 solicitações por minuto por uma hora seguida. A capacidade estava à frente da carga de trabalho, então escalar foi uma decisão de negócio e nunca um projeto de infraestrutura.

Suporte que entrega produto, não tickets

Nesse volume, a diferença entre provedores é menos o painel e mais quem responde quando algo parece errado. Os engenheiros da Lindy e os engenheiros de inferência da Atlas compartilham um canal, e as respostas voltam no mesmo dia, de pessoas que podem agir com base nelas. Algumas dessas respostas viram mudanças de produto: a Lindy pediu uma forma de transferir a propriedade de uma conta de time, a Atlas não suportava isso na época, e foi lançado, com os engenheiros da Atlas movendo a conta eles mesmos.

Um provedor que você pode nomear

Mover para um modelo de pesos abertos remove a parte que costumava responder por como o modelo era executado. As perguntas que a marca de um laboratório costumava resolver agora apontam para o provedor: quem está servindo isso, sob quais controles, e o que acontece com os dados que passam por ele. A Atlas responde a isso pelo nome, não pelo roteador, em um contrato com certificação SOC 2, com dados do cliente nem armazenados nem usados para treinamento. Isso importa mais para um funcionário de IA do que para um produto de chat, porque um Teammate lê os tópicos do Slack, os calendários e os registros da empresa em que trabalha. A questão de infraestrutura fica diretamente abaixo da questão de confiança do cliente, e a Atlas é a resposta para ambas.

Não preso à DeepSeek, preso a nada

A migração comprometeu a Lindy com uma estratégia, não com um modelo. O DeepSeek v4 Flash venceu as cargas de trabalho em que foi testado e mantém a posição enquanto for o melhor preço com qualidade adequada. O próximo vencedor virá de um laboratório diferente, sob uma licença diferente, e como a Atlas Cloud oferece acesso a todos os modelos em uma única API, experimentá-lo custa uma tarde, em vez de um ciclo de aquisição. Em um dia de testes, a Lindy executou 47 solicitações por doze modelos que nunca havia usado, em sete laboratórios e três modalidades, tudo na chave que já tinha. Três viraram cargas de trabalho em produção. A liberdade de sempre executar o melhor modelo pela Atlas Cloud dá à Lindy uma verdadeira fluidez operacional de negócio.

Se você está executando agentes em um marketplace, migre-os

A Lindy percorreu exatamente esse caminho. Ela conheceu o DeepSeek no OpenRouter, rodou o modelo em suas avaliações lá e provou que valia a pena migrar. Nesse mesmo teste, encontrou a coisa que decidiu onde a produção rodaria.

[PÚBLICO] "Também testamos o mesmo modelo em diferentes provedores de inferência. Irritantemente, o provedor importava. O mesmo modelo nominal podia pontuar diferente dependendo de quem o servia."

— Bruno Škvorc, Staff Software Engineer, Lindy

Um marketplace é feito para ajudar você a comprar, não para executar seu produto. Envie tráfego de produção por um roteador e ele vai para qualquer provedor com capacidade ociosa, então você não escolhe quem serve seu modelo e não consegue ver quem serviu. Os mesmos pesos em máquinas diferentes retornam números diferentes, por causa de quantização ou de um atalho na pilha de servimento de alguém, e esses números chegam aos seus usuários antes de chegarem ao seu painel. Cada salto do roteador re-sorteia silenciosamente a qualidade do produto pelo qual seus clientes estão pagando. Você não consegue depurar, porque não vê quem atendeu a chamada. Você não consegue corrigir, porque não tem controle total do roteamento. Essa é a sua reputação, decidida por uma moeda que você nunca tem a chance de lançar.

Então a Lindy não rodou produção no OpenRouter. Quando o tráfego foi ao ar, ele foi para um contrato direto com a Atlas: uma única pilha de servimento, a mesma para cada solicitação, ajustada para o modelo e mantida por contrato, com o cache e a capacidade que uma carga de trabalho de agente ao vivo precisa e o catálogo completo na mesma chave. Se seus agentes estão em produção e ainda rodando por um roteador, você está entregando um produto que não consegue manter estável, e só vai saber disso quando um cliente descobrir. Migre-os, como a Lindy fez.

Fale conosco sobre sua carga de trabalho e diremos quanto deve custar, ou veja o catálogo.

Sobre a Lindy

A Lindy cria funcionários de IA. O Lindy Teammate, lançado em agosto de 2026, trabalha ao lado de um time humano: recebe solicitações no Slack, conecta-se às ferramentas que uma empresa já usa, participa de reuniões e acumula o contexto do time para que cada solicitação comece de um ponto mais adiantado que a anterior. Em vez de pedir que as pessoas criem e mantenham automações, a Lindy pede que elas deleguem. A Lindy foi fundada por Flo Crivello e fica em São Francisco.

Sobre a Atlas Cloud

A Atlas Cloud é uma plataforma unificada de inferência de IA multimodal: mais de 400 modelos entre vídeo, imagem, linguagem e áudio, por meio de uma chave de API, um endpoint e uma conta de cobrança, compatível com OpenAI para modelos de linguagem. Certificada SOC 2.

Modelos recentes

Uma API para toda a IA de mídia.

Explorar Todos os Modelos