Lindy AI 직원을 만들었습니다. 플릿을 오픈 가중치로 옮겼는데, 해당 오픈 가중치는 Atlas Cloud가 서빙하며, 추론 비용을 약 90% 줄였고, 더 나쁜 제품을 출시하지도 않았습니다._
추론 비용 약 90% 절감 · 입력 토큰의 60% 캐시에서 처리 · 분당 3,000+ 요청 유지 · 트래픽 10배 이상 성장, 재구축 없음 · 하나의 키로 11개 연구소의 24개 모델
Lindy는 프로덕션에서 가장 까다로운 에이전트 워크로드 중 하나를 운영하며, 이를 Atlas Cloud에서 실행합니다. 그로 인해 달라진 점은 다음과 같습니다:
- Atlas가 반복 호출을 캐시 요금으로 청구하기 때문에, Lindy는 추측하는 대신 작업을 확인하는 에이전트를 실행합니다. Lindy가 보내는 입력 토큰 10개 중 6개가 캐시에서 제공되므로, 에이전트가 작업당 수십 번 다시 읽는 프리픽스 비용은 거의 들지 않습니다.
- Atlas가 워크로드에 맞게 프로비저닝하기 때문에, Lindy는 재구축 없이 트래픽을 늘리는 것만으로 볼륨을 10배 이상 성장시켰고, Atlas는 한 번에 1시간 동안 분당 3,000건 이상의 요청을 유지합니다.
- Atlas가 하나의 키로 전체 카탈로그를 제공하기 때문에, Lindy는 오후에 새 모델로 전환할 수 있습니다. Lindy는 단일 통합으로 11개 연구소의 24개 모델을 실행해 왔습니다.
- Atlas가 명시된 SOC 2 인증 계약으로 서비스를 제공하기 때문에, Lindy는 고객 데이터 앞에 오픈 가중치 모델을 배치하고 서비스를 실행하는 주체에 대해 책임질 수 있습니다.
90%는 Lindy의 핵심 성과입니다. 이 수치가 유지되는 이유와 다음 마이그레이션이 이번보다 더 쉬울 이유는 그 아래에 있는 플랫폼입니다.
Lindy에게 비용은 곧 사업이다
Lindy는 AI 직원을 만듭니다. Lindy Teammate는 새 직원이 입사하는 것처럼 회사에 합류합니다. Slack에서 요청을 받고, 팀이 이미 사용하는 도구에 연결되며, 회의에 참석하고, 학습한 내용을 유지하여 다음 요청이 이전보다 더 진전된 상태에서 시작됩니다. 누구도 자동화를 작성하지 않습니다. 그들은 위임하고, 에이전트가 작업을 수행합니다.
이러한 설계는 높은 인프라 비용을 요구합니다. 스레드를 읽고, 캘린더를 확인하고, 기록을 조회하고, 답변을 작성하는 AI 직원은 누구도 한 글자를 보기 전에 수십 번의 모델 호출을 수행합니다. 또한 Teammate는 팀 전체를 대상으로 하므로 볼륨은 인원수에 따라 늘어납니다. 이런 구조에서 제품 뒤에 있는 모델의 가격은 사업의 지속 가능성을 결정합니다.
[PUBLIC] "Lindy의 가격 정책은 추론 비용이 계속 저렴해져야만 성립합니다."
— Bruno Škvorc, Lindy 스태프 소프트웨어 엔지니어
그래서 Lindy는 재무 계산이 요구하는 일을 했습니다. 관리되는 에이전트 트래픽의 대부분을 Claude, Sonnet, Gemini에서 Atlas Cloud에서 실행되는 DeepSeek v4 Flash로 옮겼고, 마이그레이션된 경로의 추론 비용은 약 90% 하락했습니다. 모델 이름을 바꾸는 데는 오후 하나가 걸렸습니다. 프로덕션 볼륨에서, 제품 품질 저하 없이 그 비용 절감을 유지하는 것, 그것이 Atlas Cloud를 선택한 이유입니다.
90%가 유지되는 이유: 열한 번째 호출은 거의 공짜다
토큰 단위로 과금되는 방식에서 에이전트는 작업당 같은 프리픽스를 수십 번 풀 요금으로 지불하며, 생각을 많이 할수록 비용이 증가합니다. 이 부담이 에이전트 제품을 얕게 만듭니다. 세 번이 아니라 한 번만 통과시키는 이유는 세 번째도 첫 번째만큼 비용이 들기 때문입니다. 또한 반복되는 프리픽스가 조용히 비용을 다시 채우기 때문에, 단순한 모델 교체가 표면적으로 보이는 것만큼 절감되지 않는 이유이기도 합니다.
Atlas는 부담이 가장 큰 곳에서 그 세금을 제거합니다. Lindy의 입력 토큰 10개 중 6개는 재처리되지 않고 인식되며, 실제 볼륨에 맞게 계약된 요율로 제공됩니다. 따라서 모든 에이전트 호출을 지배하는 프리픽스는 거의 공짜에 가깝습니다. 이것이 모델 전환을 사용량이 늘어나면 줄어드는 수치가 아닌 지속 가능한 90%로 만들어 주며, 토큰 단위 과금에서는 한 번만 실행할 에이전트가 Atlas에서는 세 번 실행할 수 있게 해줍니다.
[PROPOSED — your call] "에이전트 워크로드는 여러 모델 호출에서 많은 컨텍스트를 재사용합니다. Atlas의 캐싱 덕분에 매번 동일한 컨텍스트에 대해 풀 요금을 지불하지 않아도 되며, 이것이 규모가 커져도 비용 절감 효과가 유지된 큰 이유입니다."
Lindy가 필요로 하기 전에 이미 준비되어 있던 용량
에이전트 트래픽에는 한적한 심야 시간대나 계획할 수 있는 출시일이 없습니다. 작업은 팀이 일하는 동안 도착하며, 확장하는 동안에도 멈추지 않습니다. 중요한 것은 버퍼가 흡수할 수 있는 스파이크가 아니라 프로바이더가 유지할 수 있는 처리율입니다. Lindy는 재구축 없이 트래픽을 더 보내는 것만으로 볼륨을 10배 이상 성장시켰고, Atlas는 한 번에 1시간 동안 분당 3,000건 이상의 요청을 유지했습니다. 용량이 워크로드보다 앞서 있었기 때문에 스케일링은 인프라 프로젝트가 아닌 비즈니스 결정이었습니다.
티켓이 아닌 제품을 출시하는 지원
이 정도 볼륨에서 프로바이더 간의 차이는 대시보드보다 무엇인가 잘못됐을 때 누가 응답하는지에 있습니다. Lindy 엔지니어와 Atlas 인퍼런스 엔지니어는 채널을 공유하며, 문제를 해결할 수 있는 사람들이 당일에 답변을 줍니다. 그런 답변 중 일부는 제품 변경으로 이어집니다. Lindy가 팀 계정 소유권 이전 방법을 요청했을 때 Atlas는 당시 지원하지 않았지만, Atlas 엔지니어들이 직접 계정을 옮기면서 기능이 출시되었습니다.
이름을 밝힐 수 있는 프로바이더
오픈 가중치 모델로 전환하면 모델이 어떻게 운영되었는지에 대해 책임을 지던 주체가 사라집니다. 한때 랩의 브랜드가 해결해 주던 질문이 이제 프로바이더를 향합니다. 누가 서빙하는지, 어떤 통제 아래 있는지, 통과하는 데이터는 어떻게 되는지. Atlas는 라우터가 아닌 이름으로 이에 답하며, SOC 2 인증 계약 하에 고객 데이터를 저장하지도, 학습에 사용하지도 않습니다. 이는 채팅 제품보다 AI 직원에게 더 중요합니다. Teammate는 근무하는 회사의 Slack 스레드, 캘린더, 기록을 읽기 때문입니다. 인프라 문제는 고객 신뢰 문제 바로 아래에 있으며, Atlas는 둘 다에 대한 답입니다.
DeepSeek에 묶이지 않음, 그 무엇에도 묶이지 않음
이번 마이그레이션은 Lindy를 특정 모델이 아니라 전략에 묶어 두었습니다. DeepSeek v4 Flash는 테스트한 워크로드에서 승리했으며, 적정 품질에서 최고의 가격을 제공하는 한 그 자리를 유지합니다. 다음 승자는 다른 라이선스를 가진 다른 랩에서 나올 것입니다. Atlas Cloud가 하나의 API로 모든 모델에 대한 접근을 제공하므로, 이를 시도하는 데는 조달 주기가 아니라 오후 하나면 충분합니다. 하루 테스트에서 Lindy는 이전에 사용해 본 적 없는 12개 모델, 7개 랩, 3개 모달리티에 걸쳐 47개의 요청을 이미 보유한 키로 실행했습니다. 그중 3개가 프로덕션 워크로드가 되었습니다. Atlas Cloud를 통해 항상 최고의 모델을 실행할 수 있는 자유는 Lindy에게 진정한 운영 비즈니스 유연성을 제공합니다.
마켓플레이스에서 에이전트를 운영하고 있다면, 옮기세요
Lindy는 정확히 이 경로를 걸었습니다. 처음에는 OpenRouter에서 DeepSeek를 만나 그곳에서 모델을 평가했고, 마이그레이션할 가치가 있음을 입증했습니다. 같은 테스트에서 프로덕션을 어디에서 운영할지 결정한 사실도 발견했습니다.
[PUBLIC] "우리는 같은 모델을 다른 인퍼런스 프로바이더에서도 테스트했습니다. 짜증나게도 프로바이더가 중요했습니다. 같은 명목의 모델이라도 누가 서빙하느냐에 따라 점수가 달라질 수 있었습니다."
— Bruno Škvorc, Lindy 스태프 소프트웨어 엔지니어
마켓플레이스는 제품을 운영하라고 만들어진 곳이 아니라 쇼핑을 돕기 위해 만들어진 곳입니다. 프로덕션 트래픽을 라우터로 보내면 여유 용량이 있는 프로바이더로 전달되므로, 누가 모델을 서빙할지 선택하지도, 누가 서빙했는지 확인하지도 못합니다. 서로 다른 머신의 같은 가중치는 양자화 또는 누군가의 서빙 스택의 지름길로 인해 다른 결과를 반환하며, 그 결과는 대시보드에 도달하기 전에 사용자에게 먼저 도달합니다. 라우터 홉 하나하나는 고객이 비용을 지불하는 제품의 품질을 조용히 다시 굴립니다. 누가 호출을 서빙했는지 볼 수 없으니 디버깅할 수 없습니다. 라우팅을 완전히 제어할 수 없으니 고칠 수도 없습니다. 그것은 당신이 결코 던질 수 없는 동전으로 결정되는 당신의 평판입니다.
그래서 Lindy는 OpenRouter에서 프로덕션을 운영하지 않았습니다. 트래픽이 라이브로 전환될 때 Atlas와의 직접 계약으로 이동했습니다. 모든 요청에 동일한 하나의 서빙 스택, 모델에 맞게 튜닝되고 계약에 따라 유지되며, 라이브 에이전트 워크로드에 필요한 캐싱과 용량, 그리고 같은 키로 제공되는 전체 카탈로그를 갖췄습니다. 에이전트가 프로덕션에서 아직 라우터를 통해 실행되고 있다면, 안정적으로 유지할 수 없는 제품을 출시하고 있는 것이며, 고객이 알기 전까지는 알지 못할 것입니다. Lindy가 한 것처럼 옮기세요.
워크로드에 대해 문의하세요 그러면 비용이 얼마인지 알려드리겠습니다. 또는 카탈로그를 둘러보세요.
Lindy 소개
Lindy는 AI 직원을 만듭니다. 2026년 8월에 출시된 Lindy Teammate는 사람 팀과 함께 일합니다. Slack에서 요청을 받고, 회사가 이미 사용하는 도구에 연결되며, 회의에 참석하고, 팀의 컨텍스트를 쌓아 매 요청이 이전보다 더 진전된 상태에서 시작되도록 합니다. Lindy는 사람들에게 자동화를 만들고 유지하라고 요청하는 대신 위임하라고 요청합니다. Lindy는 Flo Crivello가 설립했으며 샌프란시스코에 본사를 두고 있습니다.
Atlas Cloud 소개
Atlas Cloud는 통합 풀모달 AI 인퍼런스 플랫폼입니다. 비디오, 이미지, 언어, 오디오를 아우르는 400개 이상의 모델을 하나의 API 키, 하나의 엔드포인트, 하나의 결제 계정으로 제공하며, 언어 모델은 OpenAI 호환이 가능합니다. SOC 2 인증을 받았습니다.







