Seedance 2.0 Mini & Fast APIを世界最安値で — 公式価格から最大68%オフ

Wan 3.0 vs Seedance 2.5 Native 30s: 両方とも30秒と言うが、本当に1080pなのは1つだけ

Wan 3.0 vs Seedance 2.5 ネイティブ30秒、Alibaba自身のデモプロンプトと照らし合わせて検証:実際の1080pピクセルをレンダリングするのはどれか、アップスケールするのはどれか、そして今日実行できるのはどれか。

西部のシーンとストーリーボードが並んだ2台のモニター

最新情報: Wan 3.0 が 2026 年 8 月 24 日より一般公開中。

2台の編集モニターが並んで、同じ砂漠のガソリンスタンドのショットを再生している。一方のモニターの下には途切れのない30秒のタイムライン、もう一方のモニターの下には2つのセグメントに分割されたタイムラインがある。

20秒目、燃料ノズルからみずみずしい緑の草が噴き出す。水滴がついたまま。馬は気持ちよさそうに目を細める。店員のつまようじが口から落ちる。

このジョークが成立するのは、1つの連続した30秒のショットの中だけだ。8秒のクリップを4つつなぎ合わせると、馬の毛並みが変わり、サングラスの形が変わり、空の色味が一段暖かくなり、パンチラインは継ぎ目の中で消え去る。

だからこそ、Wan 3.0 と Seedance 2.5 が同じ時期に、ネイティブ30秒、ワンパス、継ぎ足しなしと謳って登場した時、それはベンチマークの話で終わらなくなった。AIビデオモデルが初めて、1つのテイクの中で「導入」「展開」「オチ」を保持できる瞬間になったのだ。

私はスペックを分解し、アリババ自身が公開しているデモファイルと照らし合わせて検証した。そして、この件について書いている誰もまだ印刷していない事実を見つけた。両方のモデルが30秒と主張しているが、その30秒の根底にある解像度は全く同じ製品ではないのだ。

重要なポイント

  1. 両方のモデルが本当にシングルパスで30秒を生成する。その部分はマーケティングではない。Wan 3.0 は2~30秒をスマート期間オプションでカバーし、Seedance 2.5 は4~30秒をカバーする。
  2. 30秒でネイティブ1080pをレンダリングするのは Wan 3.0 のみ。Seedance 2.5 はネイティブでは480pと720pのみ生成する。その1080p、1440p、4Kオプションは、720pソースを生成後にアップスケールしたものであり、同社のAPIドキュメントには4Kティアは「ネイティブ4K生成ではない」と明記されている。
  3. Seedance 2.5 は参照量で勝る:最大30枚の画像に加え、10本の動画、10個の音声ファイル、合計50個。Wan 3.0 のクリエイターハンドブックは参照を20個に制限している。
  4. Wan 3.0 には他にない入力方法がある:.doc、.xls、.ppt、.pdf、.txt ファイル、そしてライブWebページを直接クリエイティブ参照として読み込める。
  5. 実際に今日、Alibaba 以外で実行可能なのは片方だけ。Wan 3.0 は Alibaba Cloud Model Studio と Qwen Cloud でパブリックベータ提供中で、サードパーティAPIアクセスはまだ展開中。Seedance 2.5 は Atlas Cloud で30秒の期間コントロールと共に稼働中。
  6. 30秒のストーリー構造を、1秒たりともお金を払う前に試したい? Atlas Cloud の無料AI広告スキットジェネレーター は、1回無料で実行できる:15秒の完成したスポット、音声ダイアログと効果音付き、透かしなしダウンロード。

アリババ公式のWan 3.0デモ、Tongyi Wan 3.0クリエイターハンドブックより。ワンテイク、カットなし、30.07秒。ffprobeで測定:1920x1072、24fps、AACステレオ音声内蔵。29秒目の尻尾の振りとつまようじが地面に落ちる音に注目。比較・解説目的の参考資料として使用。

Wan 3.0 vs Seedance 2.5 ネイティブ30秒:今月実際に変わったこと

長い間、15秒が壁だった。Wan 2.7 はそこで止まる。Seedance 2.0 もそこで止まった。この1年間にフィードで見かけた「1分間のAI映画」は、全て4~8個のクリップをNLEで貼り合わせ、カラーリストが継ぎ目を隠すためのパスをかけたものだった。

その壁を、同じ数週間のうちに2つのものが打ち破った。アリババは2026年8月6日にWan 3.0のパブリックベータを公開し、ネイティブ30秒生成とマルチモーダル参照入力を実現した(AlphaSignal、2026年8月)。ByteDance は Seedance を2.5で15秒から30秒に倍増し、クリップの継ぎ足しやそれに伴う視覚的なドリフトを減らす方法として明確に位置づけた。

ここで「ネイティブ」が重要なのは、特定の技術的な意味があるからだ。つまり、1つの潜在シーケンスに対する1回のフォワードパスであり、最後のフレームを拡張してクリップAの最終フレームからクリップBを開始する方式ではない。拡張方式では、キャラクターのジャケットの襟がショット間で静かに形を変えてしまう。ネイティブパスでは30秒全体が同じコンテキスト内にあるため、馬は同じ馬のままなのだ。

ガソリンスタンドのデモは、そのテストとして最も明確だ。構造は4つのビート:0~8秒は何も起こらない、8~16秒で何か奇妙なことが起こる、16~24秒でオチ、24~30秒で退場。ジョークは20秒目で決まる。つまり、馬、サングラス、ティール&オレンジのグレーディング、そして無表情で固定されたカメラがすべて、最初の19秒間無傷で生き残って初めて成立する。継ぎ足しではこれができない。編集者が下手だからではなく、クリップBはクリップAを見たことがないからだ。

Wan 3.0 vs Seedance 2.5 ネイティブ30秒:映像が実際に崩れる箇所

30秒は15秒の2倍だ。ドリフトのリスクは2倍ではない。それ以上に悪化し、別の障害モードに移行する。

継ぎ足しワークフローの障害はクリップ間にあった。ネイティブ30秒の障害はクリップ内部で発生する。Seedance 2.5 のショートフィルム制作における実機レビューでは、デコヒーレンスとモーフィングが「キャラクターモデルの視覚的なスパイクや不安定性」として現れ、高速アクションシーンに集中し、これらのアーティファクトはアップスケーリングでは除去できないと特に指摘されている(MindStudio、2026年8月)。これは、720pでレンダリングして後から4Kにアップスケールする予定の人にとって重要な部分だ。アップスケーラーはモーフィングを鮮明にするだけで、除去はしない。

同じ制作では、撮影比が3.2対1と記録されている。2分22秒の最終作品を編集するために、約450秒の生生成を行った。ロングテイクの作業は、すべてのジョブが出荷されるレンダリングキューではなく、カバレッジを考慮した撮影のように計画すること。

その制作からのさらに2つの発見は、そのまま盗む価値がある。システムは最大50個の参照を受け付けるが、映像全体のビジュアルアイデンティティは3枚の参照画像(キャラクターポートレート2枚、ロケーション参照1枚)に依存していた。また、ボイスキャスティングにおいて、「American」と書くと意図しないイギリス訛りが修正されたが、「American English」と書くと修正されなかった。これは「English」という単語が発話をイギリス英語に引き戻すためだ。

30秒を生き残るプロンプト構造は、アリババが自社のハンドブックで使用しているものだ。明示的なタイムスタンプ付きビート。雰囲気の段落ではない。0-8s、8-16s、16-24s、24-30s と書き、各ブロックに独自のカメラ動作と独自のイベントを与え、最後にクリップ全体をカバーする1つの音声ラインで終える。この正確な骨格を以下のステップ4で見ることができる。なぜなら、私はアリババの構造を維持し、翻訳しただけだからだ。

現在ホストされている実行については、Atlas Cloud 上の Wan 3.0 を開き、以下のようなプロンプトをワークフローを公開する前にテストすること。

Wan 3.0 プロンプトと生成効果のスクリーンショット(wan-30-vs-seedance-25-native-30s 用)

Wan 3.0 vs Seedance 2.5 ネイティブ30秒:スペック、価格、今日実行可能なもの

ここからが正直な現状であり、2つのモデルが比較可能な製品ではなくなる部分だ。

解像度の行は2回読んでほしい。それがこの記事の全てだからだ。Atlas Cloud 自身の Seedance 2.5 Text-to-Video API ドキュメントには、720p-esr は480pソースを拡張し、1080p-esr、1440p-esr、4k-esr はすべて720pソースを拡張し、4Kオプションは2160ピクセルの短辺を提供するが「ネイティブ4K生成ではない」と明記されている。つまり、4Kとラベル付けされた30秒のSeedanceクリップは、実際の詳細度は720pをリサンプリングしたものだ。対照的に、Wan 3.0 の価格表にはストレートな1080pティアが1秒あたり$0.20で存在し、アリババ自身が公開した30秒のデモファイルは1920x1072と測定されている。

この制約の利点:テスト全体が1つのブラウザタブで、3つのモデル上で、ローカルセットアップなしで実行できる。

このテストでの役割モデルリスト価格
オープニングフレームGPT Image 2 Text-to-Image1枚あたり$0.009から
ネイティブ30秒実行Seedance 2.5 Text-to-Video1秒あたり$0.134から

リスト価格は2026年8月のAtlas Cloudモデルページで確認。最低価格とみなし、見積もりではない。これらのモデルはすべて、実際にリクエストした内容に応じて課金され、[実行]ボタンをクリックする前に正確な設定に対する価格を表示する。このテストでは、ボタンは品質高、2048x1152のGPT Image 2フレーム1枚に対して$0.1745、5秒のSeedance 2.5ジョブ(720p、16:9)に対して$1.514799を提示した。これはリスト価格の$0.134ではなく、1秒あたり約$0.30に相当する。リスト価格は480pのレートだ。カタログではなく、ボタンを確認すること。Seedance 2.5 は、50参照の上限を活用したい場合、同じ1秒あたり$0.134のリファレンス・トゥ・ビデオエンドポイントも提供している。

Seedance 2.5 でこのネイティブ30秒テストを再現する方法

5ステップ、3モデル、すべてブラウザ内。プロンプトはそのままコピーすること。

ステップ1:タイムスタンプ付き30秒の骨格を固定する

まだ何も実行しない。最初に構造を読むこと。これが30秒が持続するかどうかを決める部分だからだ。

この記事の冒頭にあるWan 3.0ガソリンスタンドデモは、4つのラベル付きブロックで構成され、固定カメラの方針が冒頭に一度だけ宣言されている:穏やかな客観的観察、固定されたミディアムワイド、不条理なビートでのみ突然の極端なクローズアップ。すべてのイベントは時間範囲に固定されている。音声は最後に1行、30秒全体をカバーする。

以下が空の骨格だ。これを埋めれば、ネイティブ30秒モデルが実際に追跡できるプロンプトになる:

Plain
130秒の[ジャンル]、[場所]が舞台。[視覚スタイル、グレード、彩度]。カメラ言語:[方針]、[例外]で区切る。
2
30-8秒:[セットアップ、ワイド、普通の世界を確立、地平線上の異常を導入]
4
58-16秒:[異常が行動する、依然として普通として扱われる、1つのPOVまたはリアクションインサート]
6
716-24秒:[オチ、対象そのものの極端なクローズアップ、ハードカットでリアクションの顔へ]
8
924-30秒:[退場、ジョークを締める小さな物理的アクション]
10
11音声:[アンビエンス、3~4つの特定のダイジェティックサウンド、最後の1つの小さな音]。音楽なし、ダイアログなし、画面上のテキストなし。

アリババの参照ファイルの測定可能なスペックは、私の数値を確認したい人のために:30.07秒、1920x1072、24fps、AACステレオ。これがSeedance実行が比較される基準だ。

ステップ2:オープニングフレームを生成する

15秒と30秒の実行が同じ世界から始まるように、固定された視覚的アンカーが必要だ。GPT Image 2 Text-to-Image を開く。

設定: 品質 high、アスペクト比 16:9、1枚の画像。

Plain
1寂れたルート66風のガソリンスタンドを、明るい砂漠に収めた、広くて静止したエスタブリッシングショット。レトロな黄・オレンジ・青の建物、ペンキはかすかに日焼けしている。前面に色あせたビンテージの赤い燃料ポンプ。隣に小さなコンビニがあり、ドアのそばに色あせたコーラの自動販売機。前景にひび割れたオレンジ色の乾いた大地、遠くに暖かいテラコッタの山々、雲ひとつない鮮やかなシアン色の空。油まみれの青いツナギと特大の黒いサングラスをかけたガソリンスタンドの店員が、ドアのそばの椅子で半分眠そうにだらけている、口に爪楊枝。厳格な明るいティール&オレンジのカラーグレーディング、高彩度、高輝度、シネマティックフォトリアル、固定カメラ、16:9。

AI画像生成器のスクリーンショット、プロンプトと出力画像

Atlas Cloud 上の GPT Image 2 プレイグラウンド、品質を high、16:9 に設定、出力パネルに生成されたルート66ガソリンスタンドのエスタブリッシングショット

Atlas Cloud 上の GPT Image 2:品質 high、16:9、1枚の画像。このフレームに対して [実行] ボタンは $0.1745 と表示された。これは2048x1152の高品質レンダリングの実際のコストだ。モデルページの $0.009 は最低価格である。

ビンテージのルート66砂漠ガソリンスタンドの外で休む男性

GPT Image 2 で生成されたルート66ガソリンスタンドのエスタブリッシングフレーム、ティールの空とオレンジのひび割れた大地、ドアのそばでうたた寝する店員

オープニングフレーム。これがステップ3の入力であり、ステップ4の視覚的なターゲットである。openai/gpt-image-2 で生成。

ステップ3:15秒の壁にぶつかる

設定: 最初のフレーム = ステップ2の出力、duration を最大の 15 にドラッグ、解像度 1080P。

Plain
1固定されたワイドショットが続く。つばの広い帽子をかぶったカウガールが、本物の馬に乗って地平線から歩いてやってくる。うたた寝していた店員が蹄の音で目を覚まし、サングラスを押し上げ、背筋を伸ばして座り、爪楊枝を噛みながら、無関心な様子。彼女はきれいに馬から降り、馬をまっすぐビンテージの燃料ポンプに連れて行く。明るいティール&オレンジのグレード、高彩度、フォトリアル、穏やかな観察的なカメラ、カットなし。

ドロップダウンは15で止まる。これがこのステップのポイントの全てだ。あなたのパンチラインは20秒目に予定されているが、このパイプラインは20秒目に一度に到達できない。そこに到達するには、最後のフレームから2番目のクリップを生成する必要がある。そしてその瞬間、馬は新しい馬になる。

AIビデオ生成器のインターフェース、入力と出力のスクリーンショット

ステップ4:フルネイティブ30秒パスを実行する

Seedance 2.5 Text-to-Video を開く。

設定: duration = 30、resolution = 720p、ratio = 16:9、generate_audio = オン、output_format = mp4、透かしオフ。

1080p-esr ではなく、意図的に720pを選ぶこと。720pがこのモデルの本当の上限なので、これはアップスケーラーとの比較ではなく、同一条件でのピクセル比較となる。

以下のプロンプトは、アリババ自身のガソリンスタンドデモのプロンプトを、Wan 3.0 クリエイターハンドブックから忠実に翻訳し、何もない状態に再構築したものだ。同じビート、同じタイミング、同じカメラ方針、同じ音声リスト。

Plain
130秒の不条理な無表情コメディ短編。明るい砂漠の中の、日焼けしたルート66風のガソリンスタンドが舞台。フォトリアル、厳格な明るいティール&オレンジのグレーディング、高彩度・高輝度。不条理な出来事が、完全に普通で、ほとんど美しい世界で起こる。カメラ言語:穏やかで客観的な観察、主に固定されたミディアムワイドとスローな横方向のドリフト、感情的な誘導はなし。不条理なビートでは突然の極端なクローズアップで区切る。
2
30-8秒:ワイド、固定。シアンの空、舞い散る砂埃。レトロな黄・オレンジ・青の建物が道路脇にぽつんと立っている。油まみれの青いツナギと巨大な黒いサングラスをかけた店員が椅子でうたた寝、口に爪楊枝。風の音だけ。地平線に、カウガールが本物の馬に乗って歩いて現れる。ミディアムにカット:蹄の音で彼が目を覚まし、サングラスを押し上げ、座って、その二人連れを「また道を尋ねに来た奴か」と読む。
4
58-16秒:彼女は何も言わない。彼女はきれいに馬から降り、馬をまっすぐ古い燃料ポンプに連れて行く。馬はまるで以前もやったことがあるかのように、何気なく頭をポンプの隣に置く。彼のサングラスの後ろからの短い魚眼風のPOV、女性と馬はさらに奇妙に見える。クローズ:彼の眉がひそまり、サングラスを外し、叫ぼうとする。スローモーションのクローズアップ:サングラスが外れると同時に、彼女は燃料ノズルを馬の口に向け、引き金を引く。
6
716-24秒:ノズルの極端なクローズアップ。出てくるのはガソリンではなく、みずみずしい明るい緑の草の噴流、まだ水滴がついている。店員の顔の極端なクローズアップにハードカット、固まっている:目は大きく見開かれ、口はわずかに開き、爪楊枝は噛んだまま忘れられている。ミディアム:馬は幸せそうに食べ、気持ちよさそうに目を細め、そして満足げに力強く尻尾を1回振る。その舞い上がった砂埃が、まだ呆然としている店員の顔にまともにかかる。
8
924-30秒:草の「満タン」。彼女はノズルをポンプに戻し、ポケットから小銭を探り出し、店のドアに歩いて行き、カウンターの上のブリキ缶にチャリンと落とす。彼女は石像のように固まった店員を一瞥する。帽子のつばの下から、彼女の口元がわずかに上がる。彼女は再び馬に乗り、砂埃の跡を残して走り去る。カメラはゆっくりと彼に押していく:同じ凍りついた姿勢、顔は砂埃で覆われ、サングラスはまだ手に握りしめられ、そして最後に爪楊枝が口から小さなカチッという音を立てて落ちる。
10
11音声:ずっと乾いた砂漠の風、蹄の音、ポンプハンドルの機械的なガチャンという音、湿った草が噴き出す音、尻尾の振る音、ブリキ缶の中の硬貨の音、そして爪楊枝が地面に落ちる小さなカチッという音。音楽なし、ダイアログなし、画面上のテキストなし。

無駄な請求を避けるための1つの警告。これはステップ3と同じ罠だ:duration スライダーを30にドラッグすること。数値ボックスに30と入力しないこと。 ボックスは30を表示しても、スライダーは5秒のデフォルトのままである可能性がある。そして [実行] ボタンは5秒分の価格を表示する。クリックする前に見積もりを確認すること。720p、16:9の場合、5秒のジョブは $1.514799 と表示される。したがって、実際の30秒のパスはその約6倍になる。

このステップには完成した実行のスクリーンショットはない。3回の自動キャプチャ試行すべてが、スライダーのデフォルト(5秒)を送信してしまい、30秒とラベル付けされた5秒のクリップを表示する代わりに、キャプチャは省略した。上記のプロンプトと設定は、そのまま貼り付けて設定するための正確な内容である。

ステップ5:ドリフトを正直に読む

以下は、その正確なプロンプトに対する Seedance 2.5 側の出力だ。ネイティブ30秒、720p、16:9、音声オンで生成。

Seedance 2.5、同じWan 3.0ガソリンスタンドのプロンプトをそのままコピー:ネイティブ30秒で1世代、1280x720、24fps、音声内蔵。同じ4ビート、カウガールと馬の到着、燃料ノズルギャグ、店員の認知的不協和のクローズアップ。冒頭のWan 3.0クリップと並べて、同一条件で比較。

2つのクリップを並べて、5つの特定の項目を確認すること。「どちらが見た目が良いか」は確認しない。それは好みの議論であり、午後を無駄にする。

  1. 毛並みと衣装の同一性。 29秒目の馬は6秒目と同じ色か? サングラスは外して手に戻した後も同じ形か?
  2. グレードの安定性。 2秒目と28秒目の空をサンプリングする。ティール&オレンジのグレーディングは、長時間の生成で暖色側にドリフトすることが予想以上に多い。
  3. 20秒目の物理的なビート。 燃料ノズルから草が出るのは物理的なリクエストだ。それは弧を描いて重みを持って落ちるか、それともテクスチャとしてフェードインするか?
  4. カメラの規律。 プロンプトは固定と指定している。カメラが要求されていないプッシュインを何回発明するか数えること。これは長時間生成で最も一般的な失敗である:モデルが予定されたイベントを使い果たし、動きで時間を埋める。
  5. 高速モーションのモーフィング。 尻尾の振りと砂埃の舞いは、クリップ内で最も速い動きだ。MindStudioの制作ノートによると、これはまさにデコヒーレンスが集中する場所であり、アップスケールでは修正できない場所である。

これら5つをスコアリングし、雰囲気はスコアリングしない。それがクライアントに説明できる比較だ。

Wan 3.0 vs Seedance 2.5 ネイティブ30秒のマッチドプロンプト3つ

1つのデモは逸話に過ぎない。以下は、同じハンドブックからのさらに3つの公式Wan 3.0 30秒ファイルであり、それぞれが30秒問題の別の部分をストレステストしている。海の怪物とダークファンタジーのモノローグについては、Seedance 2.5 側も同じプロンプトでネイティブ30秒で生成され、各直後に埋め込まれているので、私の言葉を信じずに両方を視聴できる。

プロンプトストレステストする内容Wan 3.0 公式ファイル、測定値Seedance 2.5 側、同じプロンプト
海の怪物ディザスターフィルム10のスクリプト化されたショットとオーケストラスコアを30秒以内に1920x1072、24fps、30.07s、AAC30秒で生成、以下に埋め込み。Seedanceのコンテンツフィルターを通すために、1つのIP名とボートのブランドテキストを削除。ストーリーボードはそれ以外同一
ダークファンタジー英語モノローグネイティブ英語の声とリップシンクを、ゆっくりとした連続したプッシュで1280x720、24fps、30.05s、AACプロンプトをそのまま30秒で生成、以下に埋め込み
2Dスポーツアニメ、2行プロンプトほとんど指示なしで30秒を埋められるか1280x720、24fps、30.05s、AACここでは生成せず、時間経過にわたる構造を読むためのWanのみのフレームグリッドとして表示
ウィップパンコメディ短編(除外)8つのウィップパンと8つの感情ビートをカットなしで1280x720、24fps、30.04s、AAC未実行:ダイアログの密度が中国語特有であり、英語に書き換えると公平な同一条件比較にならない

公式Wan 3.0デモ:10のスクリプト化されたショットとフルオーケストラの盛り上がりを、1つの30秒パス内で、1920x1072で。これがネイティブ1080pの最も強力な主張である。なぜなら、水の量と生物の濡れた皮膚のディテールは、720pのアップスケールが発明するものであって、解像するものではないからだ。Alibaba Tongyi クリエイターハンドブック、比較・解説目的で使用。

Seedance 2.5、同じ10ショットのディザスタープロンプトをネイティブ30秒、音声オンで。嵐に揺れる漁船、恐怖に震える甲板員、うねるうねり、そして稲光の中、深海のリヴァイアサンが水面を破る。1つのIP参照と船体のブランドテキストは、Seedanceのコンテンツフィルターを通すために削除。ストーリーボードはそれ以外同一であり、これが上記のWan 3.0クリップとの公平な同一条件比較となる。

公式Wan 3.0デモ、音声オン。ネイティブ英語の悪役のダイアログ、「虚空には十分だ」、1つのスローな上向きのティルトでカットなしに届けられる。これは英語圏のチームがテストすべきクリップだ。なぜなら、声、リップシンク、30秒の連続カメラムーブがすべて同時に保持されなければならないからだ。

Seedance 2.5、同じダークファンタジーのプロンプトをそのままコピー、ネイティブ30秒、音声オン。同じ紫色の瞳の悪役、星のルーンの紋章、彼の開いた手のひらに形成される影の星雲、2つの英語の台詞。リップシンクと単一の連続プッシュが、Wan 3.0側と同様に30秒全体にわたって保持されるかどうかを確認すること。

このマッチドSeedance 2.5側を実行する場合、2つの英語の台詞をそのままにし、制作ノートのアクセントの癖を覚えておくこと:「American English」ではなく「American」と書くこと。「English」という単語は発話をイギリス英語の読み方に引き戻す。

3つ目は静かな驚きだ。アリババのハンドブックにある2Dスポーツアニメのプロンプトは2行だけだ。タイムスタンプもショットリストもなく、ただボクサーがヘビーバッグを打っている、疲れて、痛んでいる、というもの。これから30秒を生成するのは、モデルが独自の構造を発明できるかどうかの真のテストだ。以下に、その実行時間全体にわたってサンプリングしたものを示す:

疲れたボクサーがパンチングバッグでトレーニングする4つのアニメパネル

公式Wan 3.0 2Dスポーツアニメデモからの4フレーム、約1秒、10秒、20秒、29秒でサンプリング。30秒全体にわたるボクサーのデザインとジムの背景を示す。

公式Wan 3.0 2Dスポーツアニメデモからの4フレーム、約1秒、10秒、20秒、29秒でサンプリング。同じキャラクターデザイン、同じタンクトップ、同じヘビーバッグ、同じロッカーの列。プロンプトが要求しなかったワイドからクローズアップへの変化を伴う。クリップではなく静止画グリッド。なぜなら、ここでの比較はモーションではなく、1つのファイル内の時間経過にわたるものだからだ。

実用的な読み方:2行のプロンプトで、モデルは独自のカバレッジを発明し、固定されたワイドから汗と疲労のクローズアップに移動し、その間キャラクターデザインを維持した。それが良いニュースだ。トレードオフは、いつ何が起こるかの制御を放棄したことだ。特定の秒に特定のビートを決める必要があるなら、タイムスタンプを書くこと。

どちらかにお金を払う前に、ネイティブ30秒のストーリーテリングを無料でテストする

Seedance 2.5 での30秒720p実行は、実際の解像度をカタログの最低価格ではなく価格設定すると、約$9と見積もられる。Wan 3.0 の価格表での30秒1080p実行は$6.00だ。どちらも制作基準では高くないが、3.2対1の撮影比では、1クリップを買うのではなく、3~4クリップを買うことになる。

何かを費やす前に、より安価な質問に答える価値がある:私の脚本は実際に1つの連続したショットとして持ちこたえるか? ほとんどの30秒の失敗はモデルの失敗ではない。構造の失敗だ。3つのビートを2つ分のスペースに詰め込んだり、26秒目に書かれたオチに対して8秒から20秒を何も持たせなかったりする。

Atlas Cloud の無料AI広告スキットジェネレーターは、その質問に無料で答えてくれる。1つの製品説明と最大4枚の製品写真(各8MB未満)を入力し、6つのスタイル(面白いミーム、プロットツイスト、シチュエーションコメディ、心温まる、高級、ハードセール)から1つ選ぶと、まず2人のキャラクターの脚本を生成する。3秒のフック、対立、ツイストを含む。そして、その脚本に基づいてすべてのショットを構築する。キャラクターは台詞を声に出して話し、効果音はビデオにレンダリングされる。

正直な制限:15秒(30秒ではない)、ログインが必要、1回の無料生成後はクレジットを追加する必要がある。しかし、フック、対立、ツイストを含む15秒で、3つのビートが呼吸できるかどうかがわかる。構造がそこで機能すれば、同じビートを取り、ステップ1の 0-8秒 / 8-16秒 / 16-24秒 / 24-30秒 の骨格に引き伸ばし、実際のネイティブ30秒パスに9ドルを費やすのだ。

ネイティブ30秒クリップの実際のコスト:Wan 3.0 vs Seedance 2.5

セットアップレート期間1クリップ
Wan 3.0、1080pネイティブ(Alibaba Cloudのみ)$0.20 / 秒30秒$6.00
Wan 3.0、720pネイティブ(Alibaba Cloudのみ)$0.10 / 秒30秒$3.00
Wan 3.0、480pネイティブ(Alibaba Cloudのみ)$0.05 / 秒30秒$1.50
Seedance 2.5、720pネイティブ、Atlas Cloud上720pで測定 $0.30 / 秒、リスト価格 $0.134 から30秒約 $9.09
GPT Image 2 オープニングフレーム、品質 high、2048x1152リスト価格 1枚あたり $0.009 から1枚見積もり $0.1745

実際に決める比較:Wan 3.0 の720pは Seedance 2.5 の720pよりも1秒あたり安く、1080pでは2つのうち実際のピクセルを販売している唯一のものだ。Seedance 2.5 の答えは、50の参照スロット、すぐに利用可能な状態、そして今日の午後には出荷できる動作するAPIである。

これらのネイティブ30秒クリップのソースとライセンスに関する注意事項

この記事のすべてのWan 3.0クリップとすべてのWan 3.0プロンプトは、Alibaba が公開配布している Tongyi Wan 3.0 クリエイターハンドブックからのものであり、比較・解説目的でここに複製され、クレジットを明記し、未改変、透かし除去なしで掲載されている。Seedance 2.5 の出力の商用利用は ByteDance および Volcengine の利用規約に従う。API の課金とデータ処理は Atlas Cloud 側の独自の規約に従う。このテストでは、実際の人物の肖像はどこにも複製されていない。クライアントワークを出荷する場合は、ブログの要約ではなく、呼び出す特定のエンドポイントのモデル利用規約を読むこと。

よくある質問

Wan 3.0 のネイティブ30秒は本当に1パスなのか、それともクリップをつなぎ合わせたものか?

1パス。Wan 3.0 は2~30秒を1回の生成で生成し、スマート期間オプションにより、クリップが30秒全体を必要としないと判断することもできる。これは、最初のクリップの最終フレームから2番目のクリップをシードし、継ぎ目でアイデンティティがドリフトするラストフレーム拡張とは異なる。

30秒で本当に1080pなのは、Wan 3.0 と Seedance 2.5 のどちらか?

Wan 3.0。価格表にネイティブ1080pティアがあり、Alibaba 自身の30秒デモファイルは1920x1072と測定されている。Seedance 2.5 はネイティブでは480pと720pのみ生成。その1080p、1440p、4Kオプションは720pソースの拡張であり、APIドキュメントでは4Kティアを「ネイティブ4K生成ではない」と説明している。

25秒目で映像はまだ崩れるか?

崩れる可能性はあるが、障害の形状は変わった。クリップ間の目に見える継ぎ目ではなく、ショット内でのモーフィングとデコヒーレンスが発生し、高速モーションのパッセージに集中し、アップスケーリングでは除去されない。文書化されたSeedance 2.5のショートフィルム制作では3.2対1の撮影比が報告されているので、カバレッジを考慮してロングテイクを計画すること。

どちらのモデルがより多くの参照素材を受け入れるか?

Seedance 2.5 が大幅に多い:30枚の画像に加え、10本の動画、10個の音声ファイル、合計50個。参照動画と参照音声はそれぞれリクエストあたり合計30秒に制限される。Wan 3.0 のハンドブックは参照を20個に制限しているが、.pdf、.ppt、.xls、.doc、.txt ファイルおよびライブWebページをクリエイティブ入力として受け入れる唯一のモデルである。

Wan 3.0 はオープンウェイトを公開するか?

公式の確約はない。2026年8月のパブリックベータの時点では、Wan 3.0 のウェイト、Hugging Face チェックポイント、ComfyUI ノードは公開されておらず、フラッグシップビデオラインの公式オープンウェイトは Wan 2.2 で止まっている(Kingy AI、2026年8月)。3.0のウェイトリリースについて他で読んだ情報は、Alibaba が別段の発表をするまでは憶測として扱うこと。

最新モデル

ひとつのAPIで、あらゆるメディアAIを。

すべてのモデルを探索