Seedance 2.5 서비스 시작 — Atlas Cloud 최초 공개

Seedance 2.5 API 속도 제한 및 동시성: 공급자 비교

어떤 공급자도 Seedance 2.5의 숫자 속도 제한을 게시하지 않습니다. 동시성이 실제로 어떻게 작동하는지, 429 오류를 읽는 방법, 그리고 안전하게 자신의 한도를 측정하는 방법을 알아보세요.

Seedance 2.5 API 속도 제한 및 동시성: 공급자 비교

Seedance 2.5](https://www.atlascloud.ai/models/seedance-2.5)의 처리량을 계획하고 있다면, 가장 먼저 알아야 할 불편한 사실은 어떤 플랫폼에서도 계획에 사용할 수 있는 게시된 숫자가 없다는 것입니다. 이 글에서는 그 이유와 대신 무엇을 설계해야 하는지 설명합니다.

주요 내용

  • 이 시장의 어떤 공급자도 Seedance 2.5에 대한 숫자 RPM, TPM 또는 동시성 테이블을 게시하지 않습니다. 이는 Atlas Cloud, Replicate, fal.ai, WaveSpeed, OpenRouter, Kie.ai 및 ByteDance의 자체 채널 전반에 걸쳐 동일합니다. 특정 동시성 수치를 보여주는 모든 기사는 이를 지어낸 것입니다.
  • Atlas Cloud는 FAQ에서 자신의 입장을 그대로 문서화합니다: "속도 제한은 계정 등급 및 모델 유형에 따라 다릅니다. 429 Too Many Requests 오류가 발생하면 지원팀에 문의하여 더 높은 제한을 요청하십시오."
  • Atlas Cloud는 엔터프라이즈 등급에서 맞춤형 TPM/RPM을 제공하며, 모델 및 애플리케이션별 TPM/RPM 모니터링을 제공합니다. 이는 확정된 한도가 필요한 팀을 위한 공개 테이블을 대체하는 메커니즘입니다.
  • 비디오 동시성은 LLM RPM이 아닙니다. 단일 Seedance 2.5 작업은 GPU를 몇 분 동안 점유하므로, 바인딩 제약은 초당 요청이 아니라 진행 중인 작업입니다.
  • 429 Too Many Requests는 발견 신호입니다. 이를 데이터로 취급하고, 지터와 함께 지수적으로 백오프하며, 추측 대신 제어된 램프를 사용하여 실제 한도를 측정하십시오.
  • 웹훅은 자체 요청 예산에서 폴링 트래픽을 제거하므로 처리량 계산을 변경합니다. Atlas Cloud는 최소 한 번 전달, 약 10초, 20초, 40초로 최대 30분까지 약 10번의 시도에 대한 재시도 사다리, 그리고 조정 안전망을 문서화합니다.

숫자가 존재하지 않는 이유와 그것이 회피가 아닌 이유

생성형 비디오의 속도 제한은 실시간 GPU 용량, 모델 버전, 계정 등급 및 현재 대기열 깊이의 함수입니다. 고정된 숫자를 게시하면 대부분의 계정이 얻는 것보다 과소평가되거나 수요 급증 시 유지할 수 없는 용량을 약속하게 됩니다. Seedance 2.5를 제공하는 모든 공급자는 동일한 선택을 했습니다.

ByteDance는 Seedance 2.5에 대한 기술 보고서를 게시하지 않았으며, 공식적인 제3자 벤치마크도 존재하지 않습니다. 30초 단일 패스 생성 및 최대 50개의 참조 자산 수치는 2026년 6월 23일 베이징에서 열린 Volcano Engine FORCE 출시 행사에서 나온 공급업체 주장입니다. 처리량은 해당 발표의 일부가 아니었습니다.

솔직한 설명: 속도 제한은 모델의 속성이 아니라 계정의 속성입니다. 유용한 기술은 이를 발견하고 그에 맞춰 엔지니어링하는 것입니다.

비디오 동시성은 LLM RPM과는 다른 문제입니다

텍스트 모델의 경우, 각 요청이 짧고 저렴하기 때문에 분당 요청은 부하에 대한 합리적인 대리 지표입니다. 비디오의 경우 완전히 무너집니다.

단일 Seedance 2.5 요청이 무엇을 하는지 고려해 보세요. 지속 시간은 4초에서 30초까지 구성 가능하며(또는 모델이 선택하도록 -1), 해상도는 480p 또는 720p이며, 작업은 완료될 때까지 GPU에서 비동기적으로 실행됩니다. Replicate는 공개 모델 페이지에 실제 실행 메트릭을 게시하며, 한 예는 비디오 입력 없이 5초 720p 클립에 대해 224.078초의 predict_time을 보여줍니다. 이는 5초 출력에 거의 4분 동안 GPU를 점유하는 것입니다.

용량 계획에 대한 결과:

  • 하나의 HTTP 요청이 GPU를 몇 분 동안 점유할 수 있으므로, 초당 요청은 부하 메트릭으로 거의 의미가 없습니다.
  • 실제 한도는 계정이 보유할 수 있는 동시 처리 작업의 수입니다.
  • 제출은 저렴하고, 완료는 비쌉니다. 처리량을 생성하지 않고도 제출 엔드포인트를 플러딩할 수 있습니다.
  • 지속 시간과 해상도는 점유율을 확장합니다. 30초 720p 작업은 4초 480p 작업보다 훨씬 더 큰 작업 단위입니다.
  • 포화 상태가 되면 요청 지연 시간이 아니라 대기열 대기가 종단 간 전달을 지배합니다.

RPM이 아니라 진행 중인 작업 및 GPU-초 단위로 계획하십시오.

토큰 청구가 비용을 점유율에 연결하는 방법

Atlas Cloud에서 비디오 모델은 해상도 및 지속 시간에 따라 생성당 가격이 책정되며, 문서는 일부 모델(Seedance 2.x 명시)이 작업 완료 시 출력 비디오 토큰으로 청구된다고 명시적으로 언급합니다. Atlas Cloud는 bytedance/seedance-2.5/text-to-video, bytedance/seedance-2.5/image-to-video, bytedance/seedance-2.5/reference-to-video의 세 가지 호출 가능한 변형으로 Seedance 2.5를 제공하며, 각 변형의 기본 가격은 초당 $0.134입니다.

ByteDance가 게시한 자체 토큰 공식은 관계를 명시합니다: 토큰은 대략 (입력 비디오 지속 시간 + 출력 비디오 지속 시간)에 출력 너비, 출력 높이 및 출력 프레임 속도를 곱한 다음 1024로 나눈 값입니다. 모든 용어는 GPU 시간의 동인이기도 합니다.

따라서 청구서를 제어하는 노브는 동시성 소비를 제어하는 노브입니다. 720p에서 480p로, 또는 30초에서 8초로 줄이면 비용이 절감되고 용량이 동시에 확보됩니다. Atlas Cloud는 실패한 생성에 대해서는 요금을 부과하지 않습니다. 예약된 금액은 자동으로 잔액으로 반환되므로, 탐색 실험은 저렴하게 유지됩니다.

429를 측정 도구로 취급하십시오

어떤 한도도 게시되지 않으므로, 429 Too Many Requests는 두려워할 실패가 아닙니다. 이는 경계를 찾는 유일한 신뢰할 수 있는 방법입니다. Atlas Cloud는 429가 더 높은 제한을 위해 지원팀에 연락하는 트리거라고 명시하므로, 응답은 치명적이기보다는 실행 가능하도록 설계되었습니다.

429에 대한 올바른 클라이언트 동작:

  • 즉시 또는 짧은 루프에서 재시도하지 마십시오.
  • 전체 지터와 함께 지수적으로 백오프하고, Retry-After 헤더를 준수하십시오.
  • 백오프 및 시도 횟수를 제한한 다음, 작업을 데드 레터 큐로 이동하십시오.
  • 429와 402 Payment Required를 구별하십시오. Atlas Cloud에서 402는 잔액 부족을 의미하며 충전 후 즉시 재개됩니다. 402를 재시도하는 것은 무의미합니다.
  • 해당 순간에 진행 중인 작업 수를 포함하여 모든 429를 기록하십시오. 이 쌍이 한도 데이터입니다.

자신의 한도를 측정하기 위한 실용적인 프로토콜

이것은 한 시간 이내에 완료되며, 구축할 수 있는 숫자를 제공합니다.

  1. 작업 부하 형태를 고정하십시오. 예를 들어 480p 6초와 같이 하나의 변형, 하나의 해상도, 하나의 지속 시간. 테스트 중간에 형태를 변경하면 결과가 무효화됩니다.
  2. 기준선. 단일 작업을 제출하고, 제출 지연 시간과 터미널 상태까지의 실제 시간을 기록하십시오. 이것이 언로드된 처리 시간입니다.
  3. 제한된 작업자 풀로 램프업: 2개의 동시 작업, 그 다음 4개, 그 다음 8개, 그 다음 16개로, 각 수준을 최소 세 번의 전체 작업 주기 동안 유지하십시오.
  4. 각 수준에 대해 세 가지 시리즈를 기록하십시오: 429 횟수, 터미널 상태까지의 중간 시간, 그리고 달성된 분당 완료 횟수.
  5. 무릎을 찾으십시오. 한도는 분당 완료 횟수가 증가를 멈추거나 429가 시작되는 수준입니다. 둘 중 먼저 발생하는 것입니다.
  6. 무릎 아래에서 작동하고, 무릎에서 작동하지 마십시오. 재시도 및 키를 공유하는 다른 애플리케이션을 위한 여유 공간을 남겨두십시오.
  7. 지속 시간, 해상도, 참조 자산 수 또는 계정 등급 변경 후 다시 측정하십시오. 모든 것이 무릎을 움직입니다.

측정된 무릎이 제품에 필요한 것보다 낮으면, 문서화된 Atlas Cloud 경로는 더 높은 제한을 위해 지원팀에 연락하거나, 모델 및 애플리케이션별로 맞춤형 TPM/RPM이 구성 및 모니터링되는 엔터프라이즈 등급으로 이동하는 것입니다.

웹훅은 요청 예산에서 폴링을 제거합니다

이것은 대부분의 팀이 할 수 있는 가장 높은 레버리지 변경이며, 널리 활용되지 않습니다.

3분 걸리는 작업에 대해 2초마다 GET /api/v1/model/prediction/{id}를 폴링하면, 하나의 사실을 알기 위해 약 90개의 요청을 소비합니다. 진행 중인 작업 수를 곱하면 예산의 상당 부분이 작업을 수행하는 대신 질문을 하는 데 사용됩니다.

Atlas Cloud는 비동기 비디오 및 이미지 생성을 위한 웹훅 콜백을 제공합니다: 제출 요청에 webhook_url을 추가하면 작업이 터미널 상태에 도달할 때 video.task.terminal 이벤트를 받습니다. 폴링은 여전히 작동하며, 두 가지는 상호 보완적입니다.

구축해야 하는 문서화된 전달 의미론:

  • 승인을 위해 2xx 응답으로 응답하고, 빠르게 (몇 초 이내에) 응답하십시오. 2xx가 아니거나 연결 시간 초과는 실패로 간주되어 재시도됩니다.
  • 재시도는 약 10초, 그 다음 20초, 그 다음 40초의 지수적 백오프를 사용하며, 약 30분으로 제한되고, 전달 불가능으로 표시되기 전까지 최대 약 10번의 시도를 합니다.
  • 전달은 최소 한 번입니다. session_id로 중복을 제거하십시오. session_id는 웹훅 ID 요청 헤더에도 포함되며, 핸들러를 멱등하게 만드십시오. 순서 또는 정확히 한 번을 가정하지 마십시오.
  • 내장된 조정 안전망은 빠른 경로를 놓치더라도 전달을 보장합니다.
  • 최상위 status 필드(OK 또는 ERROR)를 분기하고, payload.status에서 completed, failed 또는 timeout을 읽으십시오. 실패는 error_code를 포함하며, 예를 들어 콘텐츠 조정 거부의 경우 1039입니다.
  • 서명을 확인하십시오. Atlas Cloud는 레거시 HMAC-SHA256에서 공개 JWKS 엔드포인트를 사용하는 Ed25519로 마이그레이션 중이므로, JWKS를 캐시하고, 알 수 없는 kid에 대해 다시 가져오고, 약 5분 정도의 재생 창을 적용하십시오.

제출은 2단계 비동기 REST 규칙을 사용합니다. 비디오는 chat.completions를 통과하지 않습니다.

핫 경로에서 폴링하지 않도록 웹훅으로 제출한 다음, 조정 스윕으로만 폴링하십시오.

bash
1curl -X POST https://api.atlascloud.ai/api/v1/model/generateVideo \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  -H "Content-Type: application/json" \
4  -d '{
5    "model": "bytedance/seedance-2.5/text-to-video",
6    "prompt": "a courier cycling through neon-lit rain, camera tracking alongside",
7    "duration": 8,
8    "resolution": "480p",
9    "ratio": "16:9",
10    "webhook_url": "https://example.com/hooks/atlas"
11  }'
12#Returns {"code":200,"data":{"id":"...","status":"processing"}}
13
14curl -H "Authorization: Bearer $ATLAS_API_KEY" \
15  https://api.atlascloud.ai/api/v1/model/prediction/PREDICTION_ID

공급자 비교: 실제로 게시된 내용

텍스트 등급만. 모든 숫자 제한 셀은 "게시되지 않음"으로 표시됩니다. 이는 시장의 검증된 상태이며, 우리의 연구 부족이 아닙니다.

Atlas CloudOpenRouterfal.aiReplicateWaveSpeedKie.aiVolcano Ark / BytePlus ModelArk
Seedance 2.5에 대한 게시된 RPM 수치게시되지 않음게시되지 않음게시되지 않음게시되지 않음게시되지 않음게시되지 않음게시되지 않음
게시된 TPM 수치게시되지 않음게시되지 않음게시되지 않음게시되지 않음게시되지 않음게시되지 않음게시되지 않음
게시된 동시성 제한게시되지 않음게시되지 않음게시되지 않음게시되지 않음게시되지 않음게시되지 않음게시되지 않음
속도 제한 메커니즘 문서화됨예, 계정 및 모델 유형별 계층화이 모델에 대해 자세히 설명되지 않음이 모델에 대해 자세히 설명되지 않음이 모델에 대해 자세히 설명되지 않음이 모델에 대해 자세히 설명되지 않음이 모델에 대해 자세히 설명되지 않음이 모델에 대해 자세히 설명되지 않음
429 에스컬레이션 경로 명시됨예, 더 높은 제한을 위해 지원팀에 문의명시되지 않음명시되지 않음명시되지 않음명시되지 않음명시되지 않음명시되지 않음
엔터프라이즈 등급의 맞춤형 TPM/RPM나열되지 않음나열되지 않음나열되지 않음나열되지 않음나열되지 않음나열되지 않음
모델별 및 애플리케이션별 모니터링나열되지 않음나열되지 않음나열되지 않음나열되지 않음나열되지 않음나열되지 않음
문서화된 웹훅 재시도 사다리예, 약 10초에서 20초에서 40초, 약 30분으로 제한나열되지 않음나열되지 않음나열되지 않음나열되지 않음나열되지 않음나열되지 않음
공개 실행 시간 측정 지표게시되지 않음게시되지 않음게시되지 않음예, 실행에 predict_time 게시게시되지 않음게시되지 않음게시되지 않음
Seedance 2.5 청구 기준완료 시 출력 비디오 토큰, 기본 $0.134/초초당 $0.1028부터, 단일 업스트림 호스트해상도별 초당, 1000 토큰당 $0.0214 추가해상도 및 비디오 입력별 4단계 초당 요금실행당 시작 가격, 8개 엔드포인트크레딧 기반최소 한도가 있는 토큰 소비

두 셀은 강조할 가치가 있습니다. Replicate는 GPU 점유율에 대한 유용한 공개 참조인 관찰된 실행 시간을 게시하는 유일한 공급자입니다. 다른 곳에 배포하더라도 마찬가지입니다. OpenRouter는 단일 업스트림 공급자로부터 Seedance 2.5를 통과시키므로, 라우팅 결정이 추가되지 않습니다. 광범위한 LLM 라우팅과 대규모 텍스트 카탈로그를 제공하며, 멀티모달 및 일부 비디오 기능도 제공합니다.

알 수 없는 한도를 견디는 대기열 설계

문서에서 한도를 읽을 수 없으므로, 자체 조절 시스템을 구축하십시오.

  • 제한된 작업자 풀. 진행 중인 작업을 측정된 무릎 아래로 설정된 런타임 구성 값으로 제한하고, 재배포해야 하는 상수가 아닙니다.
  • 적응형 게이팅. 429가 발생하면 유효 풀을 축소한 다음 천천히 복구하십시오. 동시성에 가산 증가, 곱셈 감소를 적용하십시오.
  • 모든 곳에서 멱등성. 논리적 작업당 자체 요청 키를 생성하고, 반환된 prediction_id를 저장하고, session_id로 웹훅 처리를 중복 제거하십시오.
  • 우선순위 레인. 대화형 작업은 희소한 슬롯에 대해 배치 백필을 선점해야 합니다. 단일 FIFO 대기열은 가장 느린 경로가 가장 빠른 경로를 정의하도록 합니다.
  • 조정 스윕. 마감 기한을 초과하여 여전히 진행 중으로 표시된 레코드를 주기적으로 나열하고, 실제 상태를 위해 예측 엔드포인트를 폴링하십시오. 이것이 최소 한 번 전달을 안전하게 만드는 이유입니다.
  • 가장자리에서의 형태 제어. 지속 시간 및 해상도를 제품 결정으로 노출하십시오. 480p 미리보기 계층은 비용 레버이자 처리량 레버입니다.
  • 점유율에 대한 관찰 가능성. 요청 수가 아니라 진행 중인 작업 및 분당 완료 횟수를 차트로 표시하십시오. 요청 수는 아무것도 완료되지 않는 순간까지는 건강해 보입니다.

워크플로우에 맞는 플랫폼

텍스트, 이미지 및 비디오 처리량이 하나의 키와 하나의 청구서로 관리되는 하나의 계정이 우선순위라면, Atlas Cloud는 Seedance 2.5를 포함한 300개 이상의 큐레이션된 모델을 세 가지 변형 모두에서 제공하며, 문서화된 429 에스컬레이션 경로와 엔터프라이즈 맞춤형 TPM/RPM을 제공합니다. Atlas Cloud는 SOC II 인증 및 HIPAA 준수하며, 저장 및 전송 중 암호화를 제공합니다.

커밋하기 전에 실행 시간이 얼마나 걸리는지에 대한 공개 증거를 원한다면, Replicate의 게시된 실행 메트릭이 가장 투명한 아티팩트입니다. WaveSpeed는 명시적인 터보 계층을 포함하여 가장 광범위한 Seedance 2.5 엔드포인트를 노출합니다. OpenRouter의 통과 목록은 대규모 텍스트 카탈로그와 동일한 키에 모델을 배치합니다. 게시된 계산기가 있는 자체 토큰 회계를 원한다면, Volcano Engine Ark는 중국을, BytePlus ModelArk는 국제 시장을 담당합니다.

FAQ

Q: Atlas Cloud의 Seedance 2.5 속도 제한은 얼마입니까? A: 숫자 수치는 게시되지 않습니다. Atlas Cloud는 속도 제한이 계정 등급 및 모델 유형에 따라 다르며, 429 Too Many Requests 응답이 더 높은 제한을 위해 지원팀에 연락하는 신호라고 문서화합니다. 엔터프라이즈 계정은 맞춤형 TPM/RPM을 직접 구성합니다.

Q: 어떤 공급자라도 Seedance 2.5 동시성 테이블을 게시합니까? A: 아니요. 확인 결과, Atlas Cloud, OpenRouter, fal.ai, Replicate, WaveSpeed, Kie.ai 또는 ByteDance의 자체 채널 중 어느 곳도 이 모델에 대한 숫자 RPM, TPM 또는 동시성 제한을 게시하지 않습니다. 다른 곳에서 보는 특정 숫자는 확인되지 않은 것으로 간주하십시오.

Q: 몇 개의 동시 Seedance 2.5 작업을 계획해야 합니까? A: 가정하기보다는 측정하십시오. 작업 부하 형태를 고정하고, 제한된 작업자 풀을 2, 4, 8, 16개의 동시 작업을 통해 램프업하고, 분당 완료 횟수가 정체되거나 429가 시작되는 수준을 찾으십시오. 해당 무릎 아래에서 작동하십시오.

Q: 웹훅이 처리량을 증가시킵니까? A: 간접적으로, 그리고 상당히 증가시킵니다. 웹훅은 요청 예산에서 폴링 호출을 제거하므로, 허용량의 더 많은 부분이 실제 작업에 사용됩니다. Atlas Cloud는 약 10초, 20초, 40초의 재시도 사다리로 최소 한 번 전달을 문서화하며, 약 30분으로 제한되고, 최대 약 10번의 시도와 조정 안전망을 제공합니다.

Q: 해상도가 속도 제한에 영향을 미치는 이유는 무엇입니까? A: Seedance 2.x는 완료 시 출력 비디오 토큰으로 청구되며, 토큰 수는 지속 시간, 출력 너비, 높이 및 프레임 속도에 따라 달라지기 때문입니다. 이러한 동일한 요소는 GPU 점유율을 유발하므로, 더 긴 720p 작업은 짧은 480p 작업보다 더 많은 동시성 예산을 소비합니다.

Q: 작업이 실패하거나 속도 제한에 걸리면 요금이 부과됩니까? A: Atlas Cloud에서는 실패한 생성에 대해 요금이 부과되지 않으며, 예약된 금액은 자동으로 잔액으로 반환됩니다. 429로 거부된 요청은 시작되지 않으므로, 청구할 출력 토큰을 생성하지 않습니다.

결론

어떤 공급자도 Seedance 2.5에 대한 숫자 속도 제한 또는 동시성 테이블을 게시하지 않으며, Atlas Cloud는 지배 메커니즘을 명시적으로 문서화하는 몇 안 되는 공급자 중 하나입니다: 계층 기반 및 모델 유형 기반 제한, 에스컬레이션 신호로서의 429, 엔터프라이즈에서 모델별 및 애플리케이션별 모니터링을 통한 맞춤형 TPM/RPM, 그리고 자체 조절 대기열을 구축하기에 충분히 상세한 웹훅 계약.

최신 모델

하나의 API로 모든 미디어 AI를.

모든 모델 탐색