Seedance 2.0 Mini & Fast API w najniższych cenach na świecie — do 68% zniżki od oficjalnej ceny

Jak Lindy obniżyło koszty wnioskowania agentów o 90% na Atlas Cloud

Lindy przeniosło swoich pracowników AI na DeepSeek v4 Flash w Atlas Cloud i obniżyło koszty wnioskowania agentów o 90%. Zobacz, jak buforowanie promptów utrzymało oszczędności przy 10-krotnej skali.

Jak Lindy obniżyło koszty wnioskowania agentów o 90% na Atlas Cloud

Lindy zbudowała pracownika AI. Przeniosła flotę na otwarte wagi serwowane przez Atlas Cloud_, obcięła rachunek za wnioskowanie o około 90% i zrobiła to bez wypuszczenia gorszego produktu.

~90% niższy koszt wnioskowania · 60% tokenów wejściowych serwowanych z cache · 3 000+ żądań na minutę utrzymywanych · 10x+ wzrost ruchu bez przebudowy · 24 modele z 11 laboratoriów na jednym kluczu

Lindy prowadzi jedno z najbardziej wymagających obciążeń agentowych w produkcji i działa na Atlas Cloud. Oto, co to zmieniło:

  • Ponieważ Atlas wycenia powtórne wywołanie według stawek cache, Lindy uruchamia agentów, którzy sprawdzają swoją pracę, zamiast zgadywać. Sześć na dziesięć tokenów wejściowych wysyłanych przez Lindy jest serwowanych z cache, więc prefiks, który agent odczytuje kilkanaście razy w trakcie zadania, kosztuje prawie nic.
  • Ponieważ Atlas zapewnia zasoby pod obciążenie, Lindy zwiększyła swój wolumen ponad dziesięciokrotnie, wysyłając więcej ruchu, a nie przebudowując niczego, a Atlas utrzymuje ponad 3 000 żądań na minutę przez godzinę bez przerwy.
  • Ponieważ Atlas udostępnia cały katalog na jednym kluczu, Lindy może w jedno popołudnie przełączyć się na nowy model. Przez jedną integrację przepuściła 24 modele z 11 laboratoriów.
  • Ponieważ Atlas świadczy usługę na imiennej umowie z certyfikatem SOC 2, Lindy może umieścić model o otwartych wagach przed danymi swoich klientów i odpowiadać za to, kto go uruchamia.

90% to główne osiągnięcie Lindy. Powód, dla którego ta liczba się utrzymuje, oraz powód, dla którego następna migracja będzie łatwiejsza niż ta, to platforma pod spodem.

Dla Lindy rachunek to sedno biznesu

Lindy tworzy pracowników AI. Lindy Teammate dołącza do firmy jak nowy pracownik: przyjmuje prośby na Slacku, łączy się z narzędziami, z których zespół już korzysta, uczestniczy w spotkaniach i zapamiętuje to, czego się uczy, dzięki czemu kolejna prośba zaczyna się w bardziej zaawansowanym punkcie niż poprzednia. Nikt nie pisze automatyzacji; ludzie delegują zadania, a agent wykonuje pracę.

Taka konstrukcja ustala twardy rachunek za infrastrukturę. Pracownik AI, który czyta wątek, sprawdza kalendarz, wyszukuje rekord i przygotowuje odpowiedź, wykona kilkanaście wywołań modelu, zanim ktokolwiek zobaczy choćby słowo. A ponieważ Teammate obsługuje cały zespół, wolumen rośnie wraz z liczbą pracowników. Przy takim kształcie cena modelu stojącego za produktem decyduje o opłacalności biznesu.

[PUBLICZNE] „Cennik Lindy działa tylko wtedy, gdy wnioskowanie stale tanieje.”

— Bruno Škvorc, Staff Software Engineer, Lindy

Więc Lindy zrobiła to, czego wymaga finansowa matematyka. Przeniosła większość ruchu swoich zarządzanych agentów z Claude, Sonnet i Gemini na DeepSeek v4 Flash działający na Atlas Cloud, a koszty wnioskowania na przeniesionych trasach spadły o około 90%. Zmiana nazwy modelu zajęła jedno popołudnie. To, że udało się to utrzymać przy wolumenie produkcyjnym, bez pogorszenia produktu, jest powodem, dla którego wybrali Atlas Cloud.

Dlaczego 90% się utrzymuje: jedenaste wywołanie jest prawie darmowe

Przy wycenie za token agent płaci pełną stawkę za ten sam prefiks kilkanaście razy w trakcie zadania, a rachunek rośnie wraz z tym, jak starannie myśli. Ten podatek sprawia, że produkty agentowe są płytkie: jedno przejście zamiast trzech, bo trzecie kosztuje tyle samo co pierwsze. To także powód, dla którego naiwna zamiana modelu oszczędza mniej, niż sugerowałaby metka, bo powtarzany prefiks po cichu odbudowuje rachunek.

Atlas usuwa ten podatek tam, gdzie jest największy. Sześć na dziesięć tokenów wejściowych Lindy jest rozpoznawanych, a nie przetwarzanych ponownie, po stawce skontraktowanej w oparciu o jej rzeczywisty wolumen, dzięki czemu prefiks, który dominuje w każdym wywołaniu agenta, jest niemal darmowy. To właśnie zamienia zmianę modelu w trwałe 90% — a nie liczbę, która maleje w miarę wzrostu użycia — i to pozwala agentowi na Atlasie wykonać trzy przejścia tam, gdzie ten sam agent, rozliczany za token, wykonałby jedno.

[PROPONOWANE — Twoja decyzja] „Obciążenia agentowe wykorzystują dużo kontekstu w wielu wywołaniach modeli. Cache w Atlasie sprawia, że nie płacimy pełnej ceny za ten sam kontekst za każdym razem, co w dużej mierze wyjaśnia, dlaczego oszczędności utrzymały się w skali..”_

— Ian McGregor, Head of Engineering, Lindy

Przepustowość, która była gotowa, zanim Lindy jej potrzebowała

Ruch agentów nie ma cichego okna nocnego ani dnia premiery, pod który można planować. Praca pojawia się, gdy zespoły pracują, i nie kończy się, gdy skalujesz. Liczy się nie skok, który bufor może pochłonąć, ale przepustowość, którą dostawca jest w stanie utrzymać. Lindy zwiększyła swój wolumen ponad dziesięciokrotnie, wysyłając więcej ruchu, a nie przebudowując niczego, a Atlas utrzymał ponad 3 000 żądań na minutę przez godzinę bez przerwy. Przepustowość wyprzedzała obciążenie, więc skalowanie było decyzją biznesową, a nigdy projektem infrastrukturalnym.

Wsparcie, które dostarcza produkt, a nie zgłoszenia

Przy takim wolumenie różnica między dostawcami polega mniej na panelu, a bardziej na tym, kto odpowiada, gdy coś wygląda nie tak. Inżynierowie Lindy i inżynierowie wnioskowania z Atlas mają wspólny kanał, a odpowiedzi wracają tego samego dnia od osób, które mogą podejmować działania. Część tych odpowiedzi staje się zmianami w produkcie: Lindy poprosiła o możliwość przeniesienia własności konta zespołu, Atlas wówczas tego nie obsługiwał, ale funkcja została wdrożona, a inżynierowie Atlasa sami przenieśli konto.

Dostawca, którego możesz podać z nazwy

Przejście na model o otwartych wagach usuwa podmiot, który wcześniej odpowiadał za sposób uruchamiania modelu. Pytania, które niegdyś rozstrzygała marka laboratorium, teraz kierują się do dostawcy: kto to obsługuje, pod jakimi kontrolami i co dzieje się z przechodzącymi danymi. Atlas odpowiada na nie z nazwy, a nie przez router, w ramach umowy certyfikowanej SOC 2, a dane klientów nie są ani przechowywane, ani wykorzystywane do trenowania. To ma większe znaczenie dla pracownika AI niż dla produktu czatowego, ponieważ Teammate czyta wątki na Slacku, kalendarze i rekordy firmy, dla której pracuje. Kwestia infrastruktury leży bezpośrednio pod kwestią zaufania klienta i Atlas jest odpowiedzią na obie.

Bez uzależnienia od DeepSeek, bez uzależnienia od niczego

Migracja zobowiązała Lindy do strategii, a nie do modelu. DeepSeek v4 Flash wygrał na obciążeniach, na których go testowano, i utrzyma tę pozycję tak długo, jak długo będzie najlepszą ceną przy odpowiedniej jakości. Następny zwycięzca przyjdzie z innego laboratorium i na innej licencji, a ponieważ Atlas Cloud udostępnia wszystkie modele przez jedno API, przetestowanie go zajmuje popołudnie, a nie cykl zakupowy. W ciągu jednego dnia testów Lindy przepuściła 47 żądań przez dwanaście modeli, których nigdy wcześniej nie używała, z siedmiu laboratoriów i trzech modalności, wszystko na kluczu, który już miała. Trzy z nich stały się obciążeniami produkcyjnymi. Wolność, by zawsze uruchamiać najlepszy model przez Atlas Cloud, daje Lindy prawdziwą elastyczność operacyjną biznesu.

Jeśli uruchamiasz agentów na marketplace, przenieś ich

Lindy przeszła dokładnie tę samą drogę. Najpierw poznała DeepSeek na OpenRouter, przepuściła model przez swoje ewaluacje i udowodniła, że migracja ma sens. W tych samych testach znalazła rzecz, która przesądziła o tym, gdzie będzie działać produkcja.

[PUBLICZNE] „Przetestowaliśmy też ten sam model u różnych dostawców wnioskowania. Co irytujące, dostawca miał znaczenie. Ten sam nominalny model mógł uzyskiwać różne wyniki w zależności od tego, kto go serwował.”

— Bruno Škvorc, Staff Software Engineer, Lindy

Marketplace zbudowano po to, by pomóc ci kupować, a nie prowadzić twój produkt. Gdy wysyłasz ruch produkcyjny przez router, trafia on do dostawcy, który ma akurat wolne zasoby, więc nie wybierasz, kto serwuje twój model, i nie możesz zobaczyć, kto to zrobił. Te same wagi na różnych maszynach dają różne wyniki — z powodu kwantyzacji lub uproszczenia w czyimś stosie serwującym — a te wyniki trafiają do twoich użytkowników, zanim dotrą do twojego panelu. Każdy przeskok przez router po cichu rzuca kośćmi o jakość produktu, za który płacą twoi klienci. Nie możesz tego debugować, bo nie widzisz, kto obsłużył wywołanie. Nie możesz tego naprawić, bo nie masz pełnej kontroli nad routingiem. To twoja reputacja, o której decyduje rzut monetą, której nigdy nie rzucasz.

Dlatego Lindy nie prowadziła produkcji na OpenRouter. Gdy ruch wystartował, trafił na bezpośrednią umowę z Atlasem: jeden stos serwujący, ten sam dla każdego żądania, dostrojony do modelu i objęty umową, z cache i przepustowością, których potrzebuje działające obciążenie agentowe, oraz pełnym katalogiem na tym samym kluczu. Jeśli twoi agenci są w produkcji i nadal działają przez router, wysyłasz produkt, którego nie jesteś w stanie utrzymać w ryzach, i nie dowiesz się o tym, dopóki nie dowie się klient. Przenieś ich tak, jak zrobiła to Lindy.

Porozmawiaj z nami o swoim obciążeniu a powiemy ci, ile powinno kosztować, lub przeglądaj katalog.

O Lindy

Lindy tworzy pracowników AI. Lindy Teammate, wprowadzony w sierpniu 2026 roku, pracuje obok ludzkiego zespołu: przyjmuje prośby na Slacku, łączy się z narzędziami, z których firma już korzysta, uczestniczy w spotkaniach i buduje kontekst zespołu, dzięki czemu każda prośba zaczyna się w bardziej zaawansowanym punkcie niż poprzednia. Zamiast prosić ludzi o tworzenie i utrzymywanie automatyzacji, Lindy prosi ich o delegowanie. Lindy została założona przez Flo Crivello i ma siedzibę w San Francisco.

O Atlas Cloud

Atlas Cloud to zunifikowana, w pełni multimodalna platforma wnioskowania AI: ponad 400 modeli dla wideo, obrazu, języka i audio, przez jeden klucz API, jeden endpoint i jedno konto rozliczeniowe. Modele językowe są zgodne z OpenAI. Certyfikat SOC 2.

Najnowsze modele

Jedno API do całej multimedialnej AI.

Przeglądaj wszystkie modele