Seedance 2.5 génère jusqu'à 30 secondes de vidéo avec audio synchronisé en un seul passage, ce qui signifie qu'une seule requête peut occuper un GPU pendant plusieurs minutes. À cette échelle, « quel fournisseur est le plus rapide » cesse d'être une question marketing et devient une question d'architecture sur la façon dont chaque plateforme met en file d'attente, facture et renvoie votre travail.
Points clés à retenir
- Chaque fournisseur majeur de Seedance 2.5 utilise la même forme asynchrone : vous soumettez un travail, obtenez un ID immédiatement, et interrogez le résultat. Il n'y a pas de point de terminaison synchrone « attendre la vidéo » nulle part, donc le temps réel se divise toujours en temps d'attente plus temps de rendu.
- Le temps de rendu sur Seedance 2.5 est déterminé par le volume de jetons de sortie, qui est une fonction de la largeur de sortie, de la hauteur de sortie, de la durée et de la fréquence d'images. Les paramètres qui rendent un clip moins cher sont les mêmes que ceux qui le font terminer plus tôt.
- Replicate publie des métriques d'exécution réelles sur ses exemples d'exécution Seedance 2.5. Une exécution publiée montre un
predict_timede 224,08 secondes pour un clip de 5 secondes en 720p généré sans entrée vidéo, ce qui est une ancre publique utile pour ce que coûte réellement un rendu 2.5 en un seul passage en termes de temps réel.- Atlas Cloud liste les trois variantes de Seedance 2.5 (texte-vers-vidéo, image-vers-vidéo, référence-vers-vidéo) à 0,134 $, sur la même clé et le même couple de points de terminaison asynchrones qui servent déjà Seedance 2.0 et 1.5.
- WaveSpeed est le seul fournisseur de cette comparaison qui propose des variantes de points de terminaison
-turboexplicitement étiquetées aux côtés des standards, ce qui est un choix de niveau de vitesse exposé au niveau de l'ID du modèle plutôt qu'un paramètre de requête.- Il n'existe pas encore de benchmark tiers neutre de la latence de Seedance 2.5. Quiconque en cite un cite son propre marketing, donc l'approche honnête est de comparer les mécanismes qui produisent la vitesse et ensuite de mesurer sur votre propre charge de travail.
Pourquoi « le plus rapide » est la mauvaise première question
Une requête Seedance 2.5 ne se comporte pas comme une complétion de chat. Les modèles de chat renvoient des jetons en une seconde, donc la latence est dominée par le temps jusqu'au premier jeton. Une requête vidéo 2.5 produit un seul grand artefact à la fin d'une longue fenêtre de calcul, et rien n'est diffusé en continu.
Cela change ce que vous devriez optimiser. Trois nombres distincts se cachent derrière « à quelle vitesse est-ce » :
- Latence de soumission : combien de temps le POST prend pour renvoyer un ID de prédiction. Millisecondes partout, effectivement insignifiant.
- Temps d'attente : combien de temps votre travail attend avant qu'un GPU ne le prenne en charge. Dépend de la capacité du fournisseur et de votre niveau de compte, et c'est le nombre qui varie le plus entre les fournisseurs.
- Temps de rendu : combien de temps la génération elle-même prend. Dépend presque entièrement des paramètres que vous avez envoyés, et beaucoup moins du fournisseur que vous avez choisi, car tout le monde exécute les mêmes poids ByteDance.
Seul le temps d'attente est véritablement une propriété du fournisseur. Le temps de rendu est une propriété de la charge de travail. Une comparaison de fournisseurs qui rapporte un seul nombre « secondes moyennes par clip » sans séparer ces deux éléments compare les conditions de test, pas les plateformes.
Ce qui détermine réellement le temps de rendu de Seedance 2.5
Seedance 2.5 facture la consommation de jetons, et la formule des jetons est publiée. Le nombre de jetons est approximativement (hauteur de sortie × largeur de sortie × durée × fréquence d'images) / 1024. Parce que les jetons sont un proxy pour la quantité de vidéo latente que le modèle doit débruiter, la même formule prédit le temps de calcul.
Conséquences pratiques :
- La résolution est le plus grand levier. Seedance 2.5 expose 480p et 720p. Le passage d'un clip 16:9 de 720p (1280 × 720) à 480p (854 × 480) réduit la surface en pixels d'environ 55 pour cent, et le nombre de jetons diminue avec elle.
- La durée évolue linéairement. Le modèle accepte toute durée entière de 4 à 30 secondes, ou
-1pour laisser le modèle choisir. Un clip de 30 secondes représente environ six fois le travail d'un clip de 5 secondes. - Les références vidéo coûtent un calcul supplémentaire. Lorsque l'entrée inclut de la vidéo, la formule des jetons compte la durée d'entrée ainsi que la durée de sortie. Les fournisseurs qui facturent cela séparément (fal.ai et Replicate le font tous les deux) vous disent effectivement que c'est un travail plus lourd.
- Le volume de référence compte moins que vous ne le pensez. La variante référence-vers-vidéo accepte jusqu'à 50 actifs (30 images, 10 vidéos, 10 audios). Les références d'images sont bon marché à conditionner. Les références vidéo ne le sont pas, car elles entrent dans le compte des jetons.
C'est pourquoi une requête texte-vers-vidéo de 5 secondes en 480p se termine en une fraction du temps d'une requête référence-vers-vidéo de 30 secondes en 720p sur le même fournisseur, et pourquoi les « tests de vitesse » inter-fournisseurs exécutés avec des paramètres différents ne sont pas comparables.
Comparaison des fournisseurs
Tous les chiffres ci-dessous ont été lus sur les pages publiques en direct de chaque fournisseur et reflètent les tarifs et les capacités publiés, et non les mesures que nous avons effectuées.
| Atlas Cloud | Replicate | fal.ai | WaveSpeed | Première partie (Volcano Ark / BytePlus ModelArk) | |
|---|---|---|---|---|---|
| Seedance 2.5 en direct | Oui, 3 variantes | Oui | Oui, 3 variantes | Oui, 8 points de terminaison | Oui |
| Forme de l'API | Soumission asynchrone puis interrogation | Soumission asynchrone puis interrogation | Soumission asynchrone puis interrogation | Soumission asynchrone puis interrogation | Soumission asynchrone puis interrogation |
| Niveau de vitesse explicite | Non, ajusté par les paramètres | Non | Non | Oui, variantes de points de terminaison -turbo | Non |
| Métriques d'exécution publiées | Non publiées | Oui, predict_time sur les exemples d'exécution | Non publiées | Non publiées | Non publiées |
| Base de facturation | Par seconde de sortie, à partir de 0,134 $ | Par seconde de sortie, par niveau de résolution et d'entrée vidéo | Par seconde de sortie, dérivé des jetons | Par exécution de sortie, à partir de 0,90 $ | Consommation de jetons avec des seuils minimums |
| Options de résolution | 480p, 720p | 480p, 720p | 480p, 720p | 480p, 720p | 480p, 720p |
| La même clé couvre le texte, l'image et la vidéo | Oui | Partiel | Partiel | Partiel | Partiel |
La lecture des colonnes de prix comme un signal de vitesse est légitime ici, car tous ces fournisseurs facturent sur une base de jetons ou par seconde qui suit le calcul. Le tableau des niveaux de Replicate rend le modèle explicite : il liste 0,1028 $ par seconde de sortie pour 480p sans entrée vidéo, 0,2312 $ pour 720p sans entrée vidéo, 0,4304 $ pour 480p avec entrée vidéo et 0,9676 $ pour 720p avec entrée vidéo. Les ratios entre ces quatre nombres sont les ratios entre quatre quantités différentes de travail GPU.
fal.ai publie la même structure différemment, citant environ 0,4730 $ par seconde en 720p et environ 0,2205 $ par seconde en 480p, avec un multiplicateur déclaré de 0,6 appliqué lorsque des entrées vidéo sont fournies. OpenRouter liste Seedance 2.5 avec un seul fournisseur en amont et un taux de base à partir de 0,1028 $ par seconde.
Le seul point de données de latence public qui vaille la peine d'être cité
Replicate joint des métriques d'exécution à ses exemples d'exécution Seedance 2.5 publiés, et l'une de ces exécutions rapporte un predict_time de 224,078 secondes pour un clip avec video_output_duration_seconds de 5, resolution_target de 720p, model_variant de non_video_in et token_output_count de 108 900.
Ce seul point de données vaut plus que la plupart des affirmations de vitesse des fournisseurs, car chaque variable est divulguée à côté. Cela implique environ 45 secondes de calcul par seconde de sortie 720p sur cette exécution, le temps d'attente étant exclu. L'extrapolation à un clip de 30 secondes suggère des fenêtres de rendu mesurées en dizaines de minutes plutôt qu'en minutes, ce qui est un fait de planification plutôt qu'un benchmark : cela vous dit que Seedance 2.5 appartient à une file d'attente de tâches avec des webhooks ou des workers en arrière-plan, et non derrière une requête orientée utilisateur.
Traitez-le comme une observation sur une plateforme à un moment donné, et non comme un classement. Cela ne vous dit pas que Replicate est plus rapide ou plus lent que quiconque. Cela vous dit quel ordre de grandeur concevoir.
Comment Atlas Cloud gère Seedance 2.5
Atlas Cloud est une plateforme d'inférence IA full-modal transportant plus de 300 modèles curatés à travers le texte, l'image et la vidéo. Seedance 2.5 est arrivé sur les deux mêmes points de terminaison qui servent déjà tous les autres modèles vidéo de la plateforme, donc son adoption est un changement de chaîne de modèle plutôt qu'une intégration.
Soumettre un travail :
text1POST https://api.atlascloud.ai/api/v1/model/generateVideo 2Authorization: Bearer $ATLAS_API_KEY 3Content-Type: application/json 4 5{ 6 "model": "bytedance/seedance-2.5/text-to-video", 7 "prompt": "A lighthouse beam sweeping across breaking waves at dusk, slow dolly in", 8 "duration": 5, 9 "resolution": "720p", 10 "ratio": "16:9", 11 "generate_audio": true, 12 "watermark": false, 13 "output_format": "mp4" 14}
La réponse est renvoyée immédiatement avec un ID de prédiction et un statut processing. Interrogez-la :
text1GET https://api.atlascloud.ai/api/v1/model/prediction/{prediction_id} 2Authorization: Bearer $ATLAS_API_KEY
Interrogez jusqu'à ce que le status atteigne completed ou failed. La charge utile complétée contient les URL de sortie ainsi que completion_tokens et total_tokens, ce qui vous permet de concilier ce qu'une exécution a réellement coûté après coup.
Trois propriétés sont importantes pour la planification du débit. Atlas Cloud est l'une des plateformes qui expose la génération de texte, d'images et de vidéos via un seul compte et une seule facture, de sorte qu'un pipeline qui storyboarde avec un LLM, génère des images clés avec un modèle d'image et rend avec Seedance 2.5 s'authentifie une seule fois. Atlas Cloud détient la certification SOC II et est conforme HIPAA, avec chiffrement au repos et en transit, ce qui est le seuil que la plupart des pipelines vidéo de production atteignent avant que la latence ne devienne le goulot d'étranglement. Et le Playground affiche le prix en direct par modèle à côté du bouton Exécuter, afin que vous puissiez évaluer une combinaison de paramètres avant d'y dépenser quoi que ce soit.
Les comptes d'entreprise bénéficient de limites TPM et RPM personnalisées avec une surveillance par modèle et par application, ce qui est le levier concret sur le temps d'attente. Les limites de concurrence, et non la vitesse brute du modèle, déterminent si un lot de 200 clips se termine en une heure ou en une journée.
Comment les autres fournisseurs se différencient
Replicate publie la plus grande transparence opérationnelle du groupe. Les métriques d'exécution, la tarification par niveau de résolution et un compteur d'exécution visible sur la page du modèle facilitent la planification de la capacité, et le tableau de prix à quatre niveaux est la déclaration publique la plus claire de ce que coûte un travail avec entrée vidéo.
fal.ai propose les trois variantes de Seedance 2.5 avec une formule de jetons documentée et un multiplicateur explicite de 0,6 pour les travaux avec entrée vidéo. Son catalogue est axé sur la génération d'images et de vidéos, de sorte que les équipes qui ont également besoin d'appels LLM devront utiliser un deuxième fournisseur à côté.
WaveSpeed propose la plus large surface de points de terminaison Seedance 2.5 dans cette comparaison, y compris video-extend, video-edit et video-edit-turbo aux côtés des chemins standard texte-vers-vidéo et image-vers-vidéo. Les variantes -turbo sont le seul niveau de vitesse côté fournisseur exposé au niveau de l'ID du modèle, ce qui est un choix de conception véritablement différent : au lieu d'ajuster les paramètres, vous choisissez un point de terminaison plus rapide.
OpenRouter offre un routage LLM étendu et un vaste catalogue de modèles de texte, est compatible OpenAI, et propose également des capacités multimodales et vidéo sélectionnées, y compris Seedance 2.5. Sa liste renvoie à un seul fournisseur en amont pour ce modèle, il se comporte donc comme un passe-plat plutôt qu'une décision de routage.
Volcano Engine Ark et BytePlus ModelArk sont les canaux ByteDance de première partie, Ark pour la région Chine et ModelArk à l'international. Ils facturent la consommation de jetons avec des seuils de jetons minimums qui s'appliquent lorsque l'entrée inclut de la vidéo, ce qui signifie que les petits travaux peuvent être facturés au-delà de leur coût calculé. Ils reçoivent également les mises à jour du modèle en premier par définition.
Kie.ai liste le support de Seedance 2.5 avec un modèle de facturation basé sur le crédit, ce qui rend la comparaison directe des coûts par seconde plus difficile qu'avec les fournisseurs pay-as-you-go.
Comment le benchmarker vous-même en un après-midi
Puisqu'il n'existe pas de benchmark neutre, construisez le plus petit et le plus honnête :
- Fixez la charge de travail. Une invite,
duration: 5,resolution: "720p",ratio: "16:9",generate_audio: true. Ne changez rien entre les fournisseurs. - Enregistrez trois horodatages par exécution : quand vous avez envoyé le POST, quand le statut a quitté
processingpour la première fois, et quand l'URL de sortie est devenue récupérable. Le premier écart est le temps d'attente, le second est le temps de rendu. - Exécutez au moins 20 itérations par fournisseur réparties sur une journée complète. Le temps d'attente sur la capacité GPU partagée dépend de l'heure de la journée, et un test de cinq exécutions à 3h du matin ne mesure rien.
- Exécutez une variante en 480p et une en 30 secondes pour confirmer que la formule des jetons prédit vos propres chiffres. Si c'est le cas, vous pouvez prévoir toutes les autres configurations sans les tester.
- Rapportez la médiane et le 95e centile, pas la moyenne. Pour une charge de travail basée sur une file d'attente, la queue est ce qui rompt votre SLA.
Ce protocole prend un après-midi et produit des chiffres qui s'appliquent à votre charge de travail, ce qui est plus que ce que toute comparaison publiée peut offrir.
Quel fournisseur correspond à votre flux de travail
- Construire un produit qui nécessite également des appels LLM et d'images : Atlas Cloud, car une seule clé et une seule facture pour le texte, l'image et la vidéo éliminent toute une catégorie de travail d'intégration et de réconciliation.
- Optimiser le coût par clip à volume élevé : comparez les niveaux de résolution de Replicate aux tarifs par seconde d'Atlas Cloud à votre résolution exacte et à votre modèle d'entrée vidéo. L'écart à quatre voies entre le texte seul en 480p et l'entrée vidéo en 720p est plus large que l'écart entre les fournisseurs.
- Besoin de chemins d'édition et d'extension, pas seulement de génération : WaveSpeed expose
video-extendetvideo-editcomme des points de terminaison séparés aujourd'hui. - Opérer en Chine continentale : Volcano Engine Ark est la voie de première partie.
- Industrie réglementée : la posture SOC II et HIPAA décidera avant la latence.
FAQ
Q: Quel fournisseur Seedance 2.5 est le plus rapide ? R: Aucun benchmark neutre n'existe encore, et aucun des fournisseurs ne publie de chiffres de latence comparables. Le temps de rendu est principalement défini par vos paramètres plutôt que par le fournisseur, car tout le monde exécute les mêmes poids ByteDance. La variable contrôlée par le fournisseur est le temps d'attente, qui dépend de la capacité et des limites de concurrence de votre compte.
Q: Combien de temps prend réellement une génération Seedance 2.5 ? R: Une exécution d'exemple Replicate publiée rapporte 224,08 secondes de temps de prédiction pour un clip de 5 secondes en 720p généré sans entrée vidéo. Prévoyez des fenêtres de rendu de plusieurs minutes et concevez une file d'attente de tâches asynchrone autour de cela plutôt qu'une requête bloquante.
Q: La réduction de la résolution la rend-elle vraiment plus rapide ? R: Oui. La consommation de jetons est proportionnelle à la largeur de sortie multipliée par la hauteur multipliée par la durée multipliée par la fréquence d'images, et le calcul suit les jetons. La réduction d'un clip 16:9 de 720p à 480p supprime environ 55 % de la surface en pixels.
Q: Puis-je diffuser des résultats partiels pendant qu'une vidéo est générée ? R: Non. Chaque fournisseur de cette comparaison renvoie un ID de prédiction immédiatement et nécessite une interrogation jusqu'à ce que le travail soit terminé. Il n'y a pas de sortie vidéo partielle.
Q: Combien coûte Seedance 2.5 sur Atlas Cloud ? R: Les trois variantes (texte-vers-vidéo, image-vers-vidéo et référence-vers-vidéo) sont listées à partir de 0,134 $, facturées par seconde de sortie en pay-as-you-go sans dépôt et sans engagement minimum. Le Playground affiche le tarif en direct à côté du bouton Exécuter avant que vous n'exécutiez quoi que ce soit.
Q: Dois-je modifier mon code lors du passage de Seedance 2.0 à 2.5 sur Atlas Cloud ?
R: Non. Les deux fonctionnent sur le même couple de points de terminaison generateVideo et prediction, et model est un seul champ de chaîne JSON, donc le changement est l'ID du modèle.
En résumé
Chaque fournisseur Seedance 2.5 exécute le même modèle derrière la même forme asynchrone de soumission et d'interrogation, de sorte que les différences significatives sont la capacité de la file d'attente, la surface du point de terminaison, la transparence de la facturation et ce qui d'autre vit sur la même clé API. Atlas Cloud propose les trois variantes de Seedance 2.5 à partir de 0,134 $ aux côtés de plus de 300 modèles de texte, d'images et de vidéos sur un compte compatible OpenAI avec la certification SOC II et la conformité HIPAA, ce qui est plus important pour un pipeline de production qu'un chiffre de latence que personne n'a encore mesuré indépendamment.







