Lindy đã tạo ra nhân viên AI. Họ chuyển toàn bộ hệ thống sang các mô hình open-weight do Atlas Cloud phục vụ, cắt giảm khoảng 90% chi phí inference, mà không làm sản phẩm trở nên tồi tệ hơn.
~90% chi phí inference thấp hơn · 60% input tokens được phục vụ từ cache · Duy trì hơn 3.000 requests mỗi phút · Tăng trưởng traffic gấp 10 lần, không cần xây lại gì · 24 mô hình từ 11 phòng lab trên một key
Lindy vận hành một trong những khối lượng công việc agent khắc nghiệt nhất trong môi trường production, và nó chạy trên Atlas Cloud. Đây là những gì đã thay đổi:
- Vì Atlas tính phí dựa trên cache rate cho các lệnh gọi lặp lại, Lindy vận hành các agent có thể dò lại công việc của mình thay vì đoán mò. Sáu trong mười input tokens nó gửi được phục vụ từ cache, nên phần tiền tố mà một agent đọc lại hàng tá lần mỗi tác vụ gần như chẳng tốn kém gì.
- Vì Atlas cấp phát theo khối lượng công việc, Lindy tăng trưởng khối lượng hơn gấp mười lần bằng cách gửi thêm traffic chứ không phải xây lại bất cứ thứ gì, và Atlas duy trì hơn 3.000 requests mỗi phút trong suốt một giờ liền.
- Vì Atlas giữ toàn bộ danh mục mô hình trên một key, Lindy có thể chuyển sang một mô hình mới chỉ trong một buổi chiều. Họ đã đưa 24 mô hình từ 11 phòng lab chạy qua một tích hợp duy nhất.
- Vì Atlas phục vụ hợp đồng SOC 2 Certified có danh tính rõ ràng, Lindy có thể đặt một mô hình open-weight trước dữ liệu của khách hàng và chịu trách nhiệm về người vận hành.
Con số 90% là điểm nhấn của Lindy. Lý do nó giữ vững, và lý do cuộc di chuyển tiếp theo sẽ dễ hơn lần này, chính là nền tảng nằm phía dưới.
Với Lindy, chi phí chính là vấn đề kinh doanh
Lindy tạo ra nhân viên AI. Một Lindy Teammate gia nhập công ty giống như một nhân viên mới: nó nhận yêu cầu trong Slack, kết nối với các công cụ đội ngũ đang dùng, tham dự các cuộc họp, và lưu lại những gì nó học được để yêu cầu tiếp theo bắt đầu tại điểm tiến xa hơn lần trước. Không ai viết một quy trình tự động; họ giao phó, và agent làm phần khối lượng.
Cách thiết kế đó đặt ra một hóa đơn hạ tầng đầy thử thách. Một nhân viên AI đọc một chuỗi tin nhắn, kiểm tra lịch làm việc, xem kỷ lục dữ liệu và soạn một câu phản hồi đã phải gọi mô hình 12 lần trước khi ai thấy được một từ, và vì một Teammate phục vụ cả một nhóm nên khối lượng tăng theo số nhân viên. Với hình dạng đó, giá của mô hình đằng sau sản phẩm quyết định tính khả thi của công việc kinh doanh.
[PUBLIC] "Pricing của Lindy chỉ có hiệu quả khi inference ngày càng rẻ hơn."
— Bruno Škvorc, Kỹ sư phần mềm cao cấp, Lindy
Vậy nên Lindy làm những món việc mà toán tài chính đòi. Họ chuyển hầu hết traffic agent được quản lý từ Claude, Sonnet và Gemini sang DeepSeek v4 Flash chạy trên Atlas Cloud, và chi phí inference trên các tuyến đã di chuyển giảm khoảng 90%. Thay đổi tên mô hình chỉ mất một buổi chiều. Để nó giữ vững, với khối lượt production đầy đủ, mà không khiến sản phẩm trở nên tệ hơn, là lý do họ lựa chọn Atlas Cloud.
Vì sao 90% giữ vững: lần gọi thứ mười mình gần như miễn phí
Nếu tính theo token, một agent trả toàn bộ chi phí cho cùng một phần tiền tố hàng tá lần mỗi tác vụ, và hóa đơn chỉ tăng theo mức độ kỹ lưỡng khi nó suy nghĩ. Cái thuế đó là thứ khiến các sản phẩm agent nông cạn: một lần xử lý thay vì ba, vì lần thứ ba tốn như lần đầu. Nó cũng là lý do một van chuyển mô hình đơn giản tiết những gì mình họ dạt trên giấy còn ít hơn: phần tiền tố lặp lại cứ lặng lẽ làm đầy hóa đơn.
Atlas gỡ bỏ khoản thuế ở nơi nặng nhất. Sáu trong mỗi mười tokens đầu vào của Lindy được nhận dạng thay vì xử lý lại, với mức giá cam kết theo khối lượng việc thực tế, nên phần tiền như thống trị các agent đều gần như miễn phí. Đó là điều biến một đổi mô hình thành con số 90% bền vững thay vì một con số bị bào mòn khi lượt sử dụng tăng, và nó giúp một agent trên Atlas chạy ba lần xử lý trong khi cùng agent đó, nếu tính theo token, chỉ chạy một lần.
[ĐỀ XUẤT — quyết của bạn] "Khối việc của agent tái sử dụng rất nhiều ngữ cảnh trong nhiều lần gọi mô hình. Caching của Atlas đồng nghĩa chúng tôi không phải trả đủ giá cho cùng ngữ cảnh đó mỗi lượt, và đó là một phần lớn lý do khoản tiết tiết kiệm giữ vững ở quy mô lớn."
— Ian McGregor, Trưởng bộ phận Kỹ thuật, Lindy
Công suất luôn sẵn trong trước khi Lindy cần
Traffic của agent không có khoảng lặng đêm khuya hay một ngày ra mắt để lên kế hoạch trước. Công việc đến khi nhóm đang làm và không dừng lại khi bạn mở rộng quy mô. Điều quan trọng không phải là đỉnh mà buffer hấp thụ được, mà là công suất mà nhà cung cấp giữ vững được. Lindy tăng trưởng khối lượng hơn mười lần nhờ gửi thêm nhiều traffic, không phải xây lại gì, và Atlas giữ vững hơn 3.000 yêu cầu mỗi phút trong suốt một giờ. Năng suất luôn đi trước khối lượng công việc, nên mở rộng quy mô là một quyết định kinh doanh và không bao giờ là một dự án hạ tầng.
Vì sao 90% giữ vững: lần gọi thứ mười một gần như miễn phí
Tính theo token, agent phải trả một khoản lệ phí đầy đủ cho cùng một phần tiền tố mười mấy lần mỗi tác vụ, và chi phí chỉ tăng lên khi mức cẩn thận tăng. Loại thuế này giữ cho các sản phẩm agent vẫn còn nông cạn: một lượt xử lý thay cho ba lượt, vì lượt thứ ba tốn kém như lượt đầu. Khi một thay mô hình đơn giản cũng tốn ít hơn so với mức cả khi công tác đều. Nó là lý do, khi thay mô hình mà không đúng cách, tiền tiết bé hơn con số quảng cá.
Atlas tách bỏ thuế nơi nặng nhất. Sáu trong mỗi mười token đầu vào Lindy phải được nhận dạng lại, không phải được xử lý lại, theo hợp đồng đã định mức theo khối lượng thật, vì nên phần tiền tố chiếm phần lớn mỗi lần gọi agent là gần như miễn phí. Điều đó giúp chuyển mô hình thành mức 90% bền vững thay vì giảm dần theo mức sử dụng, và nó giúp AI agent trên Atlas chạy gấp ba so với một agent khi tính theo token.
[PROPOSED — tùy thuộc bạn]"Agent workloads reuse a lot of context across many model calls. Atlas’s caching means we don’t pay full price for that same context every time, which is a big part of why the savings held up at scale_. Khối công việc Agent sử dụng lại lượng context lớn trong nhiều cuộc gọi model. Việc caching của Atlas khiến chúng tôi không phải trả nguyên giá cho cùng context đó mỗi lần, một phần lớn lý do mức tiết kiệm vẫn bền khi mở rộng"_
— Ian McGregor, Giám đốc kỹ thuật, Lindy
Năng lực hạ tầng sẵn sàng trước khi Lindy cần đến
Traffic agent không có khoảng thời gian nghỉ lúc đêm khuya, cũng chưa có bất kỳ chiến dịch phóng nà ra. Công việc đến trong khi nhóm làm việc và không dừng lại trong bạn mở rộng. Vấn đề không phải cú nhảy mà buffer có thể hấp thụ mà là tốc độ mà nhà cung cấp có thể duy trì. Lindy tăng bội cấp lên gấp mười nhờ tăng traffic thay vì xây lại gì cả, và Atlas giữ vững trên 3.000 yêu cầu/phút trong suốt nhiều giờ liền. Năng lực sẵn sàng đã đi trước khối lượng, vậy việc mở rộng là quyết định kinh doanh, chứ không cần dựng dự án hạ tầng nào.
Hỗ trợ vận hành sản phẩm, không trao vé hỗ trợ
Ở quy mô này, nhà cung cấp khác nhau hơn chất lượng hỗ trợ ở ai trả lời khi có vẻ có hiện gì đó. Kỹ sư của Lindy và kỹ sư inference a của Atlas phải có kênh trực tiếp, và câu trả lời đến cùng ngày từ người có quyền hành động. Một số lời đó trở thành thay đổi sản phẩm: Lindy triệu yêu cầu cách chuyển quyền sở hữu tài khoản nhóm, Atlas chưa có vào thời đó, và họ đã triển khai, Với kỹ sư Atlas tự tay di chuyển tài khoản.
Một nhà cung cấp có thể xác định
Việc chuyển sang mô hình open-weight làm mất đi đơn vị chịu trách nhiệm trước đây khi vấn đề phát sinh. Những câu hỏi trước được giải quyết bằng thương hiệu của phòng lab giờ chỉ về phía nhà cung cấp: ai đang phục này, dưới kiểm soát, phải làm sao với các dữ liệu đi qua. Atlas trả lời bằng đúng tên người vận hành thay vì định cu через thiêñi: bằng hợp đồng được SOC 2 chứng nhận, không lưu trữ cũng là không sử dụng dữ liệu client để huấn luyện. Điều này quan trọng các với một sản phẩm nhiều nhân an viên AI hơn một ứng dụng chat vì một Teammate đọc các chuỗi Slack, lịch, và bản ghi của công ty mà nó đang làm việc. Câu hỏi hạ tầng nằm ngay dưới câu hỏi niềm tin khách hàng, và Atlas là câu trả lời cho cả hai.
Không bị khóa vào DeepSeek, khóa với gì cả
Việc di trú gắn bó Lindy với một chiến giải pháp thuật, không phải một mô hình. DeepSeek v4 Flash thắng ở nhiệm mềm trong kiểm tra và giữ vị trí này miễn là nó có chi phí tốt nhất với chất lượng chấp nhận. Người chiến thắng tiếp theo có thể đến từ một phòng boZ khác với giấy phép khác, và vì Atlas Cloud cung cấp tất cả mô hình trên một API, thử nghiệm chỉ mất một buổi chiều chứ không phải cả chuỗi đấu thầu. Trong một ngày thử, Lindy đã chạy 47 yêu cầu vào 12 mô hình chưa từng ai trong trong bảy phòng và ba dạng trạng thái, tất cả nằm trên key nhóm đã có. Ba trong số đó trở thành khối cơ sở sản xuất production. Chắc luôn có một lựa chọn tốt nhất vận hành qua Atlas Cloud mang lại cho Lindy khả năng linh hoạt vận hành thực chất.
Nếu bạn đang chạy agent một trung chợ marketplace, hãy di dời chúng
Lindy đi đúng con đường này. Lần gặp DeepSeek đầu trên OpenRouter, chạy mô hình vào phần kiểm tra evaluation tại đó và chứng minh phù hợp di trải. Trong cùng lần thử đó họ cũng tìm ra điều đã quyết
[PUBLIC] "Chúng tôi cũng test cùng model trên những nhà cung cấp inference khác nhau. Vui vì provider quan trọng thật. Cái model trên giấy khó đó có thể khác biệt kết quả tùy vào ai phục vụ."
— Bruno Škcorc, Staff Software Engineer, Lindy.
Một marketplace xây ra để giúp bạn mua sắm, không phải để giúp bạn chạy sản phẩm. Gửi sản lượng production qua proxy và nó sẽ đến bất kỳ đơn vị nào có thừa công suất, bạn vậy được ai chạy mô hình. Cùng một bộ tham số trên các máy khác nhau cho các con số khác nhau, do lỗi tool định lượng hay shortcut trong một pilot stack nào đó, và những con số đóđó tới người dùng trước cả khi tới dashboard bạn. Mỗi bước nhảy của router tự âm thầm thay đổi chất lượng sản phẩm khách hàng đang trả tiền. Bạn không thể nào debug, vì không biết ai được gọi. Bạn không thể sửa, vì bạn không kiểm soát routing. Uy tín của bạn nằm ở một đồng xu mà bạn chưa bao gola tung.
Vậy nên Lindy không chạy production trên OpenRouter. Khi chạy sản, nó chuyển sang hợp đồng trực tiếp Atlas: một serving stack, luôn luôn giống nhau mỗi request, chỉnh và giữ theo hợp đồ, caching và capacity phù hợp workload trực tiếp, and catalog nguyên tại một key. Nếu agent trong production đang chạy qa proxy router, bạn đang giao một sản phẩm bạn không kiểm soát ổn định, và bạn không nhận ra trước khi khách hàng nhận ra. Hãy chuyển họ, như Lindy đã làm.
Nói chuyện với chúng tôi về workload của bạn và chúng tôi sẽ cho biết mức chi phấp nên là, hoặc duyệt qua catalog.
Về Lindy
Lindy tạo ra nhân viên AI. Lindy Teammate, 2 ra một vào tháng 8/2026, làm việc chung tay với đội ngũ con người: nhận yêu cầu trong Slack, kết nối với những công cụ công ty đã dùng, tham gia các cuộc hội, và xây dựng dần ngữ cảnh của đội rủ từ yêu cầu mới được đặt tiếp tục từ chỗ lần trước. Thay vì bảo người tự xây và bảo trì các quy trình tự động, Lyndy mời họ giao phó. Lindy được thành lập bởi Flo Crivello và có trụ sочь tại San Francisco.
Về Atlas Cloud
Atlas Cloud là nền tảng suy diễn đa phương thức (full-modal) hợp nhất: hơn 400 mô hình trên video, hình ảnh, ngôn ngữ văn bản, và âm thanh, thông qua mộ key API, và mộ tài khoản thanh toán, tương thstyle OpenAI cho các mô hình ngôn ngữ. Chứng nhận.







