Seedance 2.5 が提供開始 — Atlas Cloud で先行リリース

Seedance 2.5 APIのレート制限と同時実行数:プロバイダー比較

どのプロバイダーもSeedance 2.5の数値的なレート制限を公開していません。同時実行数の実際の仕組み、429エラーの読み解き方、そして自身の上限を安全に測定する方法を学びましょう。

Seedance 2.5 APIのレート制限と同時実行数:プロバイダー比較

もしSeedance 2.5のスループットを計画しているなら、最初に知っておくべき不都合な事実があります。どのプラットフォームにも、計画の基準となる公開された数値は存在しないということです。この記事では、その理由と、代わりに何を設計すべきかを説明します。

重要なポイント

  • この市場のどのプロバイダーも、Seedance 2.5の数値的なRPM、TPM、または同時実行数テーブルを公開していません。これはAtlas Cloud、Replicate、fal.ai、WaveSpeed、OpenRouter、Kie.ai、そしてファーストパーティのByteDanceチャネル全体で共通しています。特定の同時実行数を示している記事は、それを捏造したものです。
  • Atlas CloudはFAQでその立場を次のように明記しています。「レート制限はアカウントのティアとモデルタイプによって異なります。429 Too Many Requestsエラーが発生した場合は、サポートに連絡して上限の引き上げを依頼してください。」
  • Atlas Cloudは、EnterpriseティアでカスタムTPM/RPMを提供しており、さらにモデルごと、アプリケーションごとのTPM/RPMモニタリングも提供しています。これは、確約された上限を必要とするチームにとって、公開テーブルの代わりとなるメカニズムです。
  • ビデオの同時実行数はLLMのRPMとは異なります。単一のSeedance 2.5ジョブはGPUを数分間占有するため、制約となるのは秒間リクエスト数ではなく、実行中のジョブ数です。
  • 429 Too Many Requestsは、発見のためのシグナルです。これをデータとして扱い、ジッターを伴う指数関数的バックオフを行い、推測するのではなく、制御されたランプアップで実際の上限を測定してください。
  • Webhookは、自身のリクエスト予算からポーリングトラフィックを削除するため、スループットの計算方法を変えます。Atlas Cloudは、少なくとも1回の配信、約10秒、20秒、40秒と続くリトライラダー(約30分で上限、最大約10回)、そして調整のためのセーフティネットを文書化しています。

なぜ数値が存在しないのか、そしてそれが逃げではない理由

生成ビデオのレート制限は、ライブのGPU容量、モデルのバージョン、アカウントのティア、現在のキューの深さの関数です。固定数値を公開すると、ほとんどのアカウントが得られるものを過小評価するか、需要の急増時に維持できない容量を約束することになります。Seedance 2.5を提供しているすべてのプロバイダーが同じ選択をしました。

ByteDanceはまた、Seedance 2.5の技術レポートを公開しておらず、正式な第三者ベンチマークも存在しません。30秒のシングルパス生成と最大50のリファレンスアセットという数値は、2026年6月23日に北京で開催されたVolcano Engine FORCEのローンチイベントでのベンダーの主張です。スループットはその発表の一部ではありませんでした。

正直に言えば、あなたのレート制限はモデルのプロパティではなく、あなたのアカウントのプロパティです。役立つスキルは、それを発見し、それに対応するエンジニアリングを行うことです。

ビデオの同時実行数はLLMのRPMとは異なる問題

テキストモデルの場合、毎分リクエスト数は、各リクエストが短く安価であるため、負荷の妥当な代理指標となります。ビデオの場合、それは完全に破綻します。

単一のSeedance 2.5リクエストが何をするか考えてみましょう。持続時間は4秒から30秒まで設定可能(または-1でモデルに選択させる)、解像度は480pまたは720pで、ジョブは完了するまでGPU上で非同期に実行されます。Replicateは公開モデルページで実際の実行メトリクスを公開しており、ある例ではビデオ入力なしの5秒間の720pクリップでpredict_timeが224.078秒であることが示されています。これは5秒の出力に対してほぼ4分間の占有を意味します。

キャパシティプランニングへの影響:

  • 1つのHTTPリクエストがGPUを数分間保持できるため、秒間リクエスト数は負荷メトリックとしてほとんど意味がありません。
  • 実際の上限は、あなたのアカウントが保持できる同時処理ジョブの数です。
  • 送信は安価ですが、完了は高価です。スループットを生成することなく、送信エンドポイントを溢れさせることができます。
  • 持続時間と解像度は占有率をスケールさせます。30秒の720pジョブは、4秒の480pジョブよりもはるかに大きな作業単位です。
  • 飽和状態になると、エンドツーエンドの配信を支配するのはリクエストのレイテンシではなく、キューの待ち時間です。

RPMではなく、実行中のジョブとGPU秒の単位で計画してください。

トークン課金がコストと占有率をどう結びつけるか

Atlas Cloudでは、ビデオモデルは解像度と持続時間によって生成ごとに価格設定されており、ドキュメントには一部のモデル(Seedance 2.xを名指し)がタスク完了時に出力ビデオトークンによって課金されると明記されています。Atlas CloudはSeedance 2.5をbytedance/seedance-2.5/text-to-videobytedance/seedance-2.5/image-to-videobytedance/seedance-2.5/reference-to-videoの3つの呼び出し可能なバリアントで提供しており、それぞれ基本価格は1秒あたり$0.134です。

ByteDanceが公開したファーストパーティのトークン計算式は、その関係を明確にしています。トークンは、およそ(入力ビデオ持続時間+出力ビデオ持続時間)×出力幅×出力高さ×出力フレームレート÷1024です。各項はGPU時間の要因でもあります。

したがって、請求額を制御するつまみは、同時実行数の消費を制御するつまみでもあります。720pから480pへ、または30秒から8秒へ落とすことで、支出を削減し、同時に容量を解放できます。Atlas Cloudはまた、失敗した生成には課金しません。予約された金額は自動的に残高に戻るため、調査実験は安価に抑えられます。

429を測定器として扱う

どこにも上限が公開されていないため、429 Too Many Requestsは恐れるべき失敗ではありません。それはあなたの境界を見つける唯一の信頼できる方法です。Atlas Cloudは、429がより高い上限を求めてサポートに連絡するトリガーであると明言しているため、その応答は終末的ではなく、行動可能なように設計されています。

429に対する正しいクライアントの振る舞い:

  • すぐに、またはタイトなループでリトライしないでください。
  • 完全なジッターを伴う指数関数的バックオフを行い、Retry-Afterヘッダーがあればそれに従ってください。
  • バックオフと試行回数に上限を設け、その後ジョブをデッドレターキューに移動してください。
  • 429402 Payment Requiredを区別してください。Atlas Cloudでは後者は残高不足を意味し、チャージ後すぐに再開されます。402をリトライするのは無意味です。
  • すべての429を、その瞬間に実行中のジョブ数とともにログに記録してください。その組み合わせがあなたの上限データです。

自身の上限を測定するための実践的なプロトコル

これは1時間もかからず、構築の基準となる数値を提供します。

  1. ワークロードの形状を固定します。例えば、1つのバリアント、1つの解像度、1つの持続時間(例:480pで6秒)などです。テストの途中で形状を変更すると、結果が無効になります。
  2. ベースラインを測定します。単一のジョブを送信し、送信レイテンシと終端ステータスまでの実時間を記録します。これが無負荷時の処理時間です。
  3. 制限付きワーカプールでランプアップします。2つの同時ジョブ、次に4、8、16と増やし、各レベルを少なくとも3回の完全なジョブサイクル分維持します。
  4. 各レベルで3つの系列を記録します。429のカウント、終端ステータスまでの中央値時間、および達成された毎分完了数です。
  5. ニーポイント(屈曲点)を見つけます。あなたの上限は、毎分完了数の上昇が止まるレベル、または429が発生し始めるレベルのいずれか早い方です。
  6. ニーポイントで運用するのではなく、その下で運用します。リトライやキーを共有する他のアプリケーションのためにヘッドルームを残してください。
  7. 持続時間、解像度、リファレンスアセット数、またはアカウントティアに変更があった場合は再測定します。これらはすべてニーポイントを移動させます。

測定されたニーポイントが製品の要求を下回る場合、文書化されているAtlas Cloudのパスは、サポートに連絡してより高い上限を求めるか、モデルごとおよびアプリケーションごとにカスタムTPM/RPMが設定および監視されるEnterpriseティアに移行することです。

Webhookはポーリングをリクエスト予算から削除する

これはほとんどのチームが行える最も影響力の大きい変更であり、広く活用されていません。

3分かかるジョブに対してGET /api/v1/model/prediction/{id}を2秒ごとにポーリングすると、1つの事実を知るために約90回のリクエストを消費します。これを実行中のフリートで乗算すると、予算の多くが仕事をするのではなく、質問をすることに使われてしまいます。

Atlas Cloudは、非同期のビデオおよび画像生成のためのWebhookコールバックを提供しています。送信リクエストにwebhook_urlを追加すると、ジョブが終端状態に達したときにvideo.task.terminalイベントを受け取ります。ポーリングも引き続き機能し、両者は補完的です。

構築する必要がある、文書化された配信セマンティクス:

  • 任意の2xxで応答して確認し、それを迅速に(数秒以内に)行います。2xx以外または接続タイムアウトは失敗と見なされ、リトライされます。
  • リトライは、約10秒、次に20秒、40秒という指数関数的バックオフを使用し、約30分で上限に達し、配信が配信不能とマークされるまで最大約10回試行されます。
  • 配信は少なくとも1回です。session_id(Webhook IDリクエストヘッダーにも含まれる)で重複排除を行い、ハンドラーをべき等にしてください。順序や厳密に1回の配信を前提としないでください。
  • 組み込みの調整セーフティネットにより、高速パスが失敗した場合でも配信が保証されます。
  • トップレベルのstatusフィールド(OKまたはERROR)で分岐し、次にpayload.statusを読んでcompletedfailed、またはtimeoutを確認します。失敗にはerror_codeが含まれ、例えばコンテンツモデレーションによる拒否の場合は1039です。
  • 署名を検証します。Atlas Cloudは、レガシーのHMAC-SHA256から、公開JWKSエンドポイントを持つEd25519に移行中です。そのため、JWKSをキャッシュし、未知のkidで再取得し、約5分のリプレイウィンドウを強制してください。

送信は、2段階の非同期REST規約を使用します。ビデオはchat.completionsを通過しません。

ホットパスでポーリングしないようにWebhookで送信し、調整スイープとしてのみポーリングします。

bash
1curl -X POST https://api.atlascloud.ai/api/v1/model/generateVideo \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  -H "Content-Type: application/json" \
4  -d '{
5    "model": "bytedance/seedance-2.5/text-to-video",
6    "prompt": "a courier cycling through neon-lit rain, camera tracking alongside",
7    "duration": 8,
8    "resolution": "480p",
9    "ratio": "16:9",
10    "webhook_url": "https://example.com/hooks/atlas"
11  }'
12#Returns {"code":200,"data":{"id":"...","status":"processing"}}
13
14curl -H "Authorization: Bearer $ATLAS_API_KEY" \
15  https://api.atlascloud.ai/api/v1/model/prediction/PREDICTION_ID

プロバイダー比較:実際に公開されている情報

テキスト評価のみ。すべての数値制限セルには「公開されていません」と記載されていますが、これは我々の調査のギャップではなく、市場の検証済み状態だからです。

Atlas CloudOpenRouterfal.aiReplicateWaveSpeedKie.aiVolcano Ark / BytePlus ModelArk
Seedance 2.5の公開RPM値公開されていません公開されていません公開されていません公開されていません公開されていません公開されていません公開されていません
公開TPM値公開されていません公開されていません公開されていません公開されていません公開されていません公開されていません公開されていません
公開同時実行数上限公開されていません公開されていません公開されていません公開されていません公開されていません公開されていません公開されていません
レート制限メカニズムの文書化はい、アカウントとモデルタイプによる階層制このモデルについては詳細なしこのモデルについては詳細なしこのモデルについては詳細なしこのモデルについては詳細なしこのモデルについては詳細なしこのモデルについては詳細なし
429エスカレーションパスの明記はい、上限引き上げはサポートに連絡明記なし明記なし明記なし明記なし明記なし明記なし
EnterpriseティアでのカスタムTPM/RPMはい記載なし記載なし記載なし記載なし記載なし記載なし
モデルごと・アプリごとのモニタリングはい記載なし記載なし記載なし記載なし記載なし記載なし
文書化されたWebhookリトライラダーはい、約10秒→20秒→40秒、約30分で上限記載なし記載なし記載なし記載なし記載なし記載なし
実行ごとの公開タイミングメトリクス公開されていません公開されていません公開されていませんはい、実行時のpredict_timeを公開公開されていません公開されていません公開されていません
Seedance 2.5の課金基準完了時の出力ビデオトークン、$0.134/秒ベース$0.1028/秒から、単一アップストリームホスト解像度ごとの秒単位、プラス1000トークンあたり$0.0214解像度とビデオ入力による4つの秒単位ティア実行ごとの開始価格、8つのエンドポイントクレジットベース最小フロア付きのトークン消費

2つのセルは特筆に値します。Replicateは、ここで観測された実行時間を公開している唯一のプロバイダーであり、他の場所でデプロイする場合でもGPU占有率の有用な公開リファレンスとなります。OpenRouterは、単一のアップストリームプロバイダーからのパススルーとしてSeedance 2.5を提供しているため、ルーティングの決定は重ねられていません。広範なLLMルーティングと大規模なテキストカタログを提供し、マルチモーダルおよび一部のビデオ機能も備えています。

未知の上限を乗り切るキュー設計

ドキュメントから上限を読み取ることができないため、自己調整するシステムを構築してください。

  • 制限付きワーカプール。実行中のジョブの上限を、再デプロイが必要な定数ではなく、測定したニーポイントより下に設定されたランタイム構成値に設定します。
  • 適応型ゲーティング。429が発生した場合、有効なプールを縮小し、その後ゆっくりと回復させます。同時実行数に加算増加・乗算減少を適用します。
  • あらゆる場所でのべき等性。論理ジョブごとに独自のリクエストキーを生成し、返されたprediction_idをそれに対して保存し、session_idでWebhook処理の重複を排除します。
  • 優先レーン。インタラクティブなジョブは、希少なスロットをめぐってバッチバックフィルに優先すべきです。単一のFIFOキューでは、最も遅いパスが最も速いパスを定義してしまいます。
  • 調整スイープ。期限を過ぎても実行中とマークされているレコードを定期的にリストアップし、予測エンドポイントをポーリングして実際の状態を確認します。これが、少なくとも1回の配信を安全にするものです。
  • エッジでの形状制御。持続時間と解像度を製品の決定事項として公開します。480pのプレビューティアは、コストのレバーであり、スループットのレバーでもあります。
  • 占有率の可観測性。リクエスト数ではなく、実行中のジョブと毎分完了数をグラフ化します。リクエスト数は、何も完了しなくなる直前まで健全に見えます。

どのプラットフォームがあなたのワークフローに適合するか

テキスト、画像、ビデオのスループットを1つのキーと1つの請求書で管理する単一アカウントを優先する場合、Atlas Cloudは、3つのバリアントすべてにわたるSeedance 2.5を含むがこれに限定されない300以上の厳選されたモデルを提供しており、文書化された429エスカレーションパスとEnterpriseカスタムTPM/RPMを備えています。Atlas CloudはSOC II認定を受けており、保存時および転送中の暗号化によりHIPAAに準拠しています。

コミットする前に実行にかかる時間の公開された証拠が必要な場合、Replicateの公開実行メトリクスが利用可能な最も透明性の高いアーティファクトです。WaveSpeedは、明示的なターボティアを含む最も広範なSeedance 2.5エンドポイントを公開しています。OpenRouterのパススルーリストは、モデルを大規模なテキストカタログと同じキーに配置します。公開された計算機を備えたファーストパーティのトークン会計については、Volcano Engine Arkが中国を、BytePlus ModelArkが国際市場をカバーしています。

FAQ

Q: Atlas CloudでのSeedance 2.5のレート制限は何ですか? A: 数値は公開されていません。Atlas Cloudは、レート制限がアカウントのティアとモデルタイプによって異なり、429 Too Many Requests応答がより高い上限を求めてサポートに連絡するシグナルであることを文書化しています。Enterpriseアカウントでは、カスタムTPM/RPMが直接設定されます。

Q: Seedance 2.5の同時実行数テーブルを公開しているプロバイダーはありますか? A: いいえ。検証時点では、Atlas Cloud、OpenRouter、fal.ai、Replicate、WaveSpeed、Kie.ai、またはファーストパーティのByteDanceチャネルのいずれも、このモデルの数値的なRPM、TPM、または同時実行数制限を公開していません。他の場所で見る特定の数値は未検証として扱ってください。

Q: Seedance 2.5の同時実行ジョブはいくつ計画すべきですか? A: 仮定するのではなく、測定してください。ワークロードの形状を固定し、制限付きワーカプールを2、4、8、16の同時ジョブでランプアップさせ、毎分完了数が頭打ちになるか、429が発生し始めるレベルを見つけます。そのニーポイントの下で運用してください。

Q: Webhookはスループットを向上させますか? A: 間接的に、そして大幅に向上させます。Webhookはリクエスト予算からポーリング呼び出しを削除するため、許容範囲の多くが実際の作業に向けられます。Atlas Cloudは、約10秒、20秒、40秒のリトライラダー(約30分で上限、最大約10回)と調整セーフティネットを備えた、少なくとも1回の配信を文書化しています。

Q: なぜ解像度がレート制限に影響するのですか? A: Seedance 2.xは完了時の出力ビデオトークンによって課金され、トークン数は持続時間、出力幅、高さ、フレームレートに比例して増減するためです。これらの同じ要因がGPUの占有率を左右するため、長い720pのジョブは短い480pのジョブよりも多くの同時実行予算を消費します。

Q: ジョブが失敗したり、レート制限されたりした場合、課金されますか? A: Atlas Cloudでは、失敗した生成には課金されず、予約された金額は自動的に残高に戻ります。429で拒否されたリクエストは開始されないため、課金対象の出力トークンは生成されません。

結論

どのプロバイダーもSeedance 2.5の数値的なレート制限や同時実行数テーブルを公開していません。Atlas Cloudは、その統治メカニズムを明示的に文書化している数少ないプロバイダーの1つです。ティアベースおよびモデルタイプベースの制限、エスカレーションシグナルとしての429、Enterpriseでのモデルごとおよびアプリケーションごとのモニタリング付きカスタムTPM/RPM、そして自己調整キューを構築するのに十分詳細なWebhook契約などです。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索