Seedance 2.0 Mini & Fast API a los precios más bajos del mundo: hasta un 68 % de descuento sobre el precio oficial

Cómo Lindy redujo sus costos de inferencia de agentes en un 90% en Atlas Cloud

Lindy trasladó a sus empleados de IA a DeepSeek v4 Flash en Atlas Cloud y redujo los costos de inferencia de agentes en un 90%. Vea cómo el almacenamiento en caché de indicaciones mantuvo los ahorros a escala 10x.

Cómo Lindy redujo sus costos de inferencia de agentes en un 90% en Atlas Cloud

Lindy creó el empleado de IA. Movió la flota a modelos de pesos abiertos servidos por Atlas Cloud , redujo su factura de inferencia en aproximadamente un 90% y lo hizo sin lanzar un producto peor.

~90% menos de costo de inferencia · 60% de los tokens de entrada servidos desde caché · más de 3,000 solicitudes por minuto sostenidas · crecimiento de tráfico de 10x+ · 24 modelos de 11 laboratorios con una sola clave

Lindy ejecuta una de las cargas de trabajo de agentes más exigentes en producción, y corre en Atlas Cloud. Esto es lo que cambió:

  • Como Atlas cobra la llamada repetida a tarifa de caché, Lindy ejecuta agentes que revisan su trabajo en lugar de adivinar. Seis de cada diez tokens de entrada que envía se sirven desde caché, por lo que el prefijo que un agente relee una docena de veces por tarea cuesta casi nada.
  • Como Atlas aprovisiona según la carga de trabajo, Lindy multiplicó su volumen por más de diez enviando más tráfico, sin reconstruir nada, y Atlas mantiene más de 3,000 solicitudes por minuto durante una hora seguida.
  • Como Atlas tiene todo el catálogo bajo una sola clave, Lindy puede cambiar a un modelo nuevo en una tarde. Ha ejecutado 24 modelos de 11 laboratorios mediante una única integración.
  • Como Atlas lo sirve bajo un contrato nominativo y certificado SOC 2, Lindy puede poner un modelo de pesos abiertos frente a los datos de sus clientes y responder por quién lo ejecuta.

El 90% es el titular de Lindy. La razón por la que se mantiene, y por la que la próxima migración será más fácil que esta, es la plataforma subyacente.

Para Lindy, la factura es el negocio

Lindy crea empleados de IA. Un Lindy Teammate se incorpora a una empresa como lo haría un nuevo contratado: recibe solicitudes en Slack, se conecta a las herramientas que el equipo ya usa, asiste a reuniones y conserva lo que aprende para que la siguiente solicitud empiece más avanzada que la anterior. Nadie escribe una automatización; delegan, y el agente hace el trabajo.

Ese diseño genera una factura de infraestructura dura. Un empleado de IA que lee un hilo, consulta un calendario, busca un registro y redacta una respuesta ya ha hecho una docena de llamadas al modelo antes de que nadie vea una palabra, y como un Teammate sirve a todo un equipo, el volumen crece con la plantilla. Con esa forma, el precio del modelo detrás del producto determina la viabilidad del negocio.

[PÚBLICO] "El precio de Lindy solo funciona si la inferencia sigue abaratándose."

— Bruno Škvorc, Staff Software Engineer, Lindy

Entonces Lindy hizo lo que exigen las matemáticas financieras. Movió la mayor parte de su tráfico de agentes gestionados de Claude, Sonnet y Gemini a DeepSeek v4 Flash ejecutado en Atlas Cloud, y los costos de inferencia en las rutas migradas cayeron alrededor de un 90%. Cambiar el nombre del modelo tomó una tarde. Conseguir que se mantuviera, a volumen de producción, sin que el producto empeorara, es la razón por la que eligieron Atlas Cloud.

Por qué se mantiene el 90%: la undécima llamada es casi gratis

Con el precio por token, un agente paga tarifa completa por el mismo prefijo una docena de veces por tarea, y la factura crece con lo cuidadosamente que piensa. Ese impuesto es lo que mantiene superficiales a los productos de agentes: una pasada en lugar de tres, porque la tercera cuesta tanto como la primera. También es la razón por la que un cambio de modelo ingenuo ahorra menos de lo que sugiere la etiqueta, ya que el prefijo repetido rellena silenciosamente la factura.

Atlas elimina el impuesto donde más pesa. Seis de cada diez tokens de entrada de Lindy se reconocen en lugar de reprocesarse, a una tarifa contratada según su volumen real, por lo que el prefijo que domina cada llamada de agente es casi gratis. Eso es lo que convierte un cambio de modelo en un 90% duradero, en lugar de un número que se erosiona a medida que sube el uso, y es lo que permite que un agente en Atlas haga tres pasadas cuando el mismo agente, con precio por token, haría una.

[PROPUESTO — tú decides] _"Las cargas de trabajo de agentes reutilizan mucho contexto entre muchas llamadas al modelo. El caché de Atlas significa que no pagamos el precio completo por ese mismo contexto cada vez, lo cual es una gran parte de por qué los ahorros se mantuvieron a escala."

— Ian McGregor, Director de Ingeniería, Lindy

Capacidad que ya estaba allí antes de que Lindy la necesitara

El tráfico de agentes no tiene una ventana nocturna tranquila ni un día de lanzamiento para planificarse. El trabajo llega mientras los equipos trabajan y no se detiene mientras escalas. Lo importante no es el pico que un búfer puede absorber, sino la tasa que un proveedor puede mantener. Lindy multiplicó su volumen por más de diez enviando más tráfico, sin reconstruir nada, y Atlas mantuvo más de 3,000 solicitudes por minuto durante una hora seguida. La capacidad estaba por delante de la carga de trabajo, por lo que escalar fue una decisión de negocio y nunca un proyecto de infraestructura.

Soporte que entrega producto, no tickets

A este volumen, la diferencia entre proveedores es menos el panel de control que quién responde cuando algo parece mal. Los ingenieros de Lindy y los ingenieros de inferencia de Atlas comparten un canal, y las respuestas llegan el mismo día de parte de personas que pueden actuar sobre ellas. Algunas de esas respuestas se convierten en cambios de producto: Lindy pidió una forma de transferir la propiedad de una cuenta de equipo, Atlas no lo soportaba en ese momento, y se implementó, con los ingenieros de Atlas transfiriendo la cuenta ellos mismos.

Un proveedor que puedes nombrar

Migrar a un modelo de pesos abiertos elimina a la parte que solía responder por cómo se ejecutaba el modelo. Las preguntas que la marca de un laboratorio solía resolver ahora apuntan al proveedor: quién sirve esto, bajo qué controles y qué pasa con los datos que lo atraviesan. Atlas responde esas preguntas por nombre, no por enrutador, en un contrato certificado SOC 2, con los datos del cliente ni almacenados ni usados para entrenamiento. Eso importa más para un empleado de IA que para un producto de chat, porque un Teammate lee los hilos de Slack, los calendarios y los registros de la empresa para la que trabaja. La pregunta de infraestructura está directamente bajo la pregunta de confianza del cliente, y Atlas es la respuesta a ambas.

No atado a DeepSeek, atado a nada

La migración comprometió a Lindy con una estrategia, no con un modelo. DeepSeek v4 Flash ganó las cargas de trabajo en las que se probó y mantiene la posición mientras sea el mejor precio con la calidad adecuada. El próximo ganador vendrá de un laboratorio diferente bajo una licencia diferente, y como Atlas Cloud proporciona acceso a todos los modelos con una sola API, probarlo cuesta una tarde, no un ciclo de adquisición. En un día de pruebas, Lindy ejecutó 47 solicitudes a través de doce modelos que nunca había usado, en siete laboratorios y tres modalidades, todo con la clave que ya tenía. Tres se convirtieron en cargas de trabajo de producción. La libertad de ejecutar siempre el mejor modelo a través de Atlas Cloud le da a Lindy una verdadera fluidez operativa del negocio.

Si ejecutas agentes en un marketplace, muévelos

Lindy recorrió exactamente este camino. Primero conoció DeepSeek en OpenRouter, ejecutó el modelo en sus evaluaciones allí y demostró que valía la pena migrar. En esas mismas pruebas encontró lo que decidió dónde se ejecutaría la producción.

[PÚBLICO] "También probamos el mismo modelo en diferentes proveedores de inferencia. Molestamente, el proveedor importaba. El mismo modelo nominal podía obtener puntuaciones diferentes según quién lo sirviera."

— Bruno Škvorc, Staff Software Engineer, Lindy

Un marketplace está hecho para ayudarte a comprar, no para ejecutar tu producto. Si envías tráfico de producción a través de un enrutador, este va al proveedor que tenga capacidad disponible, por lo que no eliges quién sirve tu modelo y no puedes ver quién lo hizo. Los mismos pesos en diferentes máquinas devuelven números diferentes, por cuantización o por un atajo en la pila de servicio de alguien, y esos números llegan a tus usuarios antes de llegar a tu panel. Cada salto de enrutador vuelve a sortear silenciosamente la calidad del producto por el que tus clientes pagan. No puedes depurarlo, porque no puedes ver quién sirvió la llamada. No puedes arreglarlo, porque no tienes control total del enrutamiento. Esa es tu reputación, decidida por una moneda que nunca llegas a lanzar.

Así que Lindy no ejecutó producción en OpenRouter. Cuando el tráfico se puso en marcha, pasó a un contrato directo con Atlas: una sola pila de servicio, la misma para cada solicitud, ajustada para el modelo y sujeta a un contrato, con el caché y la capacidad que necesita una carga de trabajo de agente en vivo y el catálogo completo con la misma clave. Si tus agentes están en producción y aún pasan por un enrutador, estás lanzando un producto que no puedes mantener estable, y no lo sabrás hasta que un cliente lo sepa. Muévelos, como hizo Lindy.

Háblanos de tu carga de trabajo y te diremos cuánto debería costar, o explora el catálogo.

Acerca de Lindy

Lindy crea empleados de IA. Lindy Teammate, lanzado en agosto de 2026, trabaja junto a un equipo humano: recibe solicitudes en Slack, se conecta a las herramientas que la empresa ya usa, se une a reuniones y acumula el contexto del equipo para que cada solicitud empiece más avanzada que la anterior. En lugar de pedir a las personas que construyan y mantengan automatizaciones, Lindy les pide que deleguen. Lindy fue fundada por Flo Crivello y tiene su sede en San Francisco.

Acerca de Atlas Cloud

Atlas Cloud es una plataforma unificada de inferencia de IA multimodal: más de 400 modelos en video, imagen, lenguaje y audio, a través de una sola clave de API, un solo endpoint y una sola cuenta de facturación, compatible con OpenAI para modelos de lenguaje. Certificada SOC 2.

Modelos recientes

Una sola API para toda la IA multimedia.

Explorar Todos los Modelos