Seedance 2.0 Mini & Fast APIを世界最安値で — 公式価格から最大68%オフ

LindyがAtlas Cloudでエージェント推論コストを90%削減した方法

LindyはAI社員をAtlas Cloud上のDeepSeek v4 Flashに移行し、エージェント推論コストを90%削減しました。プロンプトキャッシュが10倍のスケールで削減効果を維持した方法をご覧ください。

LindyがAtlas Cloudでエージェント推論コストを90%削減した方法

Lindy はAI社員を開発した。そのエージェント群を、 Atlas Cloudが提供するオープンウェイトモデルへ移行し、推論コストを約90%削減した。製品の品質を落とすことなく、それを成し遂げた。

推論コスト約90%削減 · 入力トークンの60%をキャッシュから配信 · 毎分3,000件以上のリクエストを安定的に処理 · トラフィック10倍超の成長、再構築なし · 11のラボの24モデルを1つのキーで運用

Lindyは、本番環境で最も要求の厳しいエージェントワークロードの1つを運用しており、それはAtlas Cloud上で動いている。 その結果、変わったことは次のとおりだ。

  • Atlasが繰り返しの呼び出しをキャッシュレートで提供するため、 Lindyは推測するのではなく自分の作業を検証するエージェントを実行できる。送信する入力トークンの10件中6件はキャッシュから配信され、エージェントが1つのタスクで十数回読み返すプレフィックスはほぼ無料になる。
  • Atlasがワークロードに応じたキャパシティを用意するため、 Lindyは何も再構築せず、トラフィックを増やすだけでボリュームを10倍以上に拡大できた。Atlasは毎分3,000件以上のリクエストを1時間にわたり維持している。
  • Atlasが全カタログを1つのキーで提供するため、 Lindyは半日で新しいモデルに切り替えられる。単一のインテグレーションを通じて、11のラボの24モデルを実行してきた。
  • Atlasが名義入りのSOC 2認証契約で提供するため、 Lindyは顧客データの前にオープンウェイトモデルを置き、誰が運用しているのかに責任を持てる。

90%という数字はLindyの見出しだ。その数字が持続する理由、そして次回の移行が今回より簡単になる理由は、それを支えるプラットフォームにある。

Lindyにとって、コストこそがビジネスそのもの

LindyはAI社員を開発している。Lindy Teammateは、新入社員と同じように企業に加わる。Slackでリクエストを受け取り、チームがすでに使っているツールに接続し、会議に参加し、学んだことを保持して、次のリクエストが前回よりも先の状態から始められるようにする。誰も自動化を書かない。人々は委任するだけで、エージェントがその仕事を遂行する。

この設計は、重いインフラコストを課す。スレッドを読み、カレンダーを確認し、レコードを調べ、返信を下書きするAI社員は、誰かが一言でも目にする前に、十数回のモデル呼び出しを行っている。Teammateはチーム全体にサービスを提供するため、トラフィック量は従業員数とともに増える。そうした構造では、製品の背後にあるモデルの価格がビジネスの存続可能性を左右する。

[パブリック] "Lindyの料金体系が成立するのは、推論コストが下がり続ける場合だけだ。" — Bruno Škvorc、Lindy スタッフソフトウェアエンジニア

そこでLindyは、財務上の計算が要求することを実行した。マネージドエージェントのトラフィックの大部分をClaude、Sonnet、Geminiから、Atlas Cloud上で稼働するDeepSeek v4 Flashへ移行し、移行したルートの推論コストは約90%低下した。モデル名の変更は半日で済んだ。本番ボリュームで、製品の品質を落とさずに、その削減を持続できたこと。それがAtlas Cloudを選んだ理由だ。

90%削減が持続する理由:11回目の呼び出しはほぼ無料

トークン単位の課金では、エージェントは1つのタスクにつき、同じプレフィックスに対して十数回、全額を支払うことになる。そのコストは、エージェントがどれだけ入念に考えるかに応じて膨らむ。この税金こそが、エージェント製品を浅いものにしている原因だ。つまり、3回のパスではなく1回のパスで済ませるのだ。なぜなら、3回目のコストが1回目と同じだからだ。また、これは単純なモデル交換が、謳い文句ほど削減効果を生まない理由でもある。繰り返されるプレフィックスが、静かにコストを積み上げていくからだ。

Atlasは、この税金が最も重くのしかかる部分を取り除く。Lindyの入力トークンの10件中6件は、再処理ではなく認識され、 実際の利用量に応じて契約されたレートで提供される。そのため、あらゆるエージェント呼び出しの大半を占めるプレフィックスはほぼ無料になる。これこそが、モデル交換を、利用が増えるにつれて目減りする数字ではなく、持続的な90%削減にしている。トークン課金なら1回しか実行しないエージェントが、Atlas上では3回のパスを実行できるのも、このためだ。

[提案中 — ご判断ください] "エージェントのワークロードは、多数のモデル呼び出しにわたって大量のコンテキストを再利用する。Atlasのキャッシングにより、同じコンテキストに毎回全額を支払う必要はない。削減効果がスケールしても維持された大きな理由はそこにある。." — Ian McGregor、Lindy エンジニアリング責任者

Lindyが必要とする前に用意されていたキャパシティ

エージェントのトラフィックには、夜間の静かな時間帯も、計画を立てるためのローンチ日もない。仕事はチームが稼働している間に到着し、スケールしている間も止まらない。重要なのは、バッファで吸収できるスパイクではなく、プロバイダーが維持できるレートだ。Lindyは何も再構築せず、トラフィックを増やすだけでボリュームを10倍以上に拡大した。Atlasは毎分3,000件以上のリクエストを1時間にわたり処理し続けた。キャパシティがワークロードに先んじて用意されていたため、スケーリングはビジネス上の決定であり、インフラプロジェクトになることは一度もなかった。

チケットではなく製品を届けるサポート

この規模になると、プロバイダー間の違いはダッシュボードよりも、何かおかしいときに誰が答えてくれるかにある。LindyのエンジニアとAtlasの推論エンジニアは同じチャンネルを共有しており、対応できる人物から当日中に回答が返ってくる。その回答の一部は製品の変更にまで発展する。Lindyがチームアカウントの所有権移転方法を要望したとき、当時Atlasはその機能をサポートしていなかったが、Atlasのエンジニアが自らアカウントを移行し、機能がリリースされた。

名前を明かせるプロバイダー

オープンウェイトモデルへの移行は、これまでモデルの運用方法について説明責任を負っていた当事者をなくす。かつてはラボのブランドが解決していた疑問が、今度はプロバイダーに向けられる。誰が提供しているのか、どのような管理下にあるのか、通過するデータはどうなるのか。Atlasはこれらの問いに、ルーターではなく名義で答える。 SOC 2認証済みの契約に基づき、クライアントのデータを保存もせず、トレーニングにも使用しない。これはチャット製品以上にAI社員にとって重要だ。Teammateは、自分が働く企業のSlackスレッド、カレンダー、レコードを読むからだ。インフラの問いは、顧客の信頼の問いのすぐ下に位置しており、Atlasはその両方への答えだ。

DeepSeekに縛られない、何にも縛られない

この移行によってLindyがコミットしたのは、モデルではなく戦略だ。DeepSeek v4 Flashは、テストされたワークロードで勝利し、適切な品質で最良の価格であり続ける限り、その座を維持する。次の勝者は、異なるラボから、異なるライセンスのもとで登場するだろう。Atlas Cloudはすべてのモデルに1つのAPIでアクセスできるため、試すのにかかるのは調達サイクルではなく半日だ。テストの1日で、Lindyはそれまで使ったことのなかった12のモデルに対して47件のリクエストを実行した。7つのラボ、3つのモダリティにわたり、すべて既存のキーで行った。そのうち3つが本番ワークロードになった。常に最良のモデルをAtlas Cloud経由で実行できる自由こそ、Lindyに真のビジネス流動性をもたらす。

マーケットプレイスでエージェントを運用しているなら、移行せよ

Lindyはまさにこの道を歩んだ。まずOpenRouterでDeepSeekに出会い、そこでモデルを評価にかけ、移行する価値があることを証明した。そしてその同じテストの中で、本番環境をどこで運用するかを決める決定的な要素を見つけた。

[パブリック] "同じモデルを異なる推論プロバイダーでもテストした。やっかいなことに、プロバイダーは重要だった。同じ名目のモデルでも、誰が提供するかによってスコアが異なることがあった。" — Bruno Škvorc、Lindy スタッフソフトウェアエンジニア

マーケットプレイスは、製品を運用するためではなく、選定を支援するために作られている。本番トラフィックをルーターに通すと、それは空きキャパシティのあるプロバイダーに振り分けられる。つまり、誰がモデルを提供するかを選ぶことも、誰が提供したかを確認することもできない。同じウェイトでも、マシンが異なれば、量子化や誰かのサービングスタックの手抜き実装によって、異なる数値が返ってくる。そしてその数値は、ダッシュボードに届くより先にユーザーに届く。ルーターを経由するたびに、顧客がお金を払っている製品の品質は、静かに再抽選される。誰がその呼び出しを処理したのか見えないため、デバッグできない。ルーティングを完全に制御できないため、修正もできない。それはあなたの評判であり、あなたが投げる機会すら与えられないコインで決まる。

だからLindyは本番をOpenRouterでは運用しなかった。トラフィックの本番稼働が始まったとき、それはAtlasとの直接契約に乗った。単一のサービングスタック。すべてのリクエストに同じものを使い、モデルに合わせてチューニングされ、契約に縛られている。本番稼働中のエージェントワークロードに必要なキャッシングとキャパシティ、そして同じキー上の全カタログを備えている。もしあなたのエージェントが本番稼働していて、まだルーター経由で運用しているなら、あなたは安定させることができない製品を出荷していることになる。そして、顧客が気づくまで、あなたはそれに気づかないだろう。Lindyがそうしたように、移行せよ。

あなたのワークロードについてご相談 いただければ、適正なコストをご案内します。または カタログを見る

Lindyについて

LindyはAI社員を開発している。2026年8月にローンチされたLindy Teammateは、人間のチームと共に働く。Slackでリクエストを受け取り、企業がすでに運用しているツールに接続し、会議に参加し、チームのコンテキストを蓄積することで、すべてのリクエストが前回よりも先の状態から始められるようにする。自動化の構築と維持を人に求めるのではなく、Lindyは委任を求める。LindyはFlo Crivelloによって設立され、サンフランシスコを拠点としている。

Atlas Cloudについて

Atlas Cloudは、統合型フルモーダルAI推論プラットフォームだ。動画、画像、言語、音声にわたる400以上のモデルを、1つのAPIキー、1つのエンドポイント、1つの請求アカウントで利用できる。言語モデルはOpenAI互換。SOC 2認証を取得済み。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索