スプレッドシートを1つアップロードすれば、音楽付きの23秒間のビジネスアニメーション動画が返ってくる。
それが、同ファミリー初のネイティブドキュメント入力機能である Wan 3.0 ドキュメント to 動画 の約束であり、公式デモは私の予想以上に文字通りの成果を出している。数値は正しい。$1,580 が $3,460 に増え、バッジには +45.7% と表示され、それらの数字は元のシートの特定のセルに直接由来している。
そして、再生ヘッドを12秒の位置にドラッグして、グラフの凡例を読んだ。
「Southeasta North America」。
2つの販売地域が存在しない単語に押しつぶされている。これこそが、2026年におけるドキュメント to 動画の本当の水準だ。つまり、モデルは確かにあなたの表を読んだが、それでもグラフを描くことはできない。以下は、他ではまだ公開されていないフレーム単位の監査と、今日の午後すぐに実際に実行できる3ステップのチェーンである。
主要なポイント
- Wan 3.0 は1つのファイルまたは1つのリンクを受け付け、最大100MBまたは50ページ、最大30秒の1080p出力を生成する。
- ドキュメントから映像作品を再構成する。スライド3をショット3に変換するわけではない。
- セルの値はそのまま残る。グラフの凡例、軸の目盛、桁区切りは残らない。
- 上限は厳しい: 4Kは不可、オープンウェイトはなし、提供チャネルはファーストパーティのみ。
- ロングコンテキストモデルと15秒の動画モデルを組み合わせれば、今日の時点でそのほとんどを再現できる。

Wan 3.0 ドキュメント to 動画の出力: 公式のxlsxデモがKeynoteスタイルのアニメーションデータ動画としてレンダリングされたもの
ショーケース: アリババ公式のWan 3.0 パブリックベータデモ、1つの.xlsx(月間GMV)を入力し、23秒のアニメーションデータ動画を出力。サイレントGIFとして表示。納品ファイルには44.1kHzステレオAACトラックが含まれている。出典: アリババ公式Wan 3.0 クリエイターハンドブック。
Wan 3.0 ドキュメント to 動画の実際の動作
短いバージョン。これだけ知りたいなら1分で読み終えられる。
1つのドキュメントまたは1つのウェブリンクを渡す。モデルは全体を読み込み、ストーリーを判断し、同じパスで画像と音声を生成する。最大30秒、最大1080p。ページを順番にたどるわけではない。
以下が、プロジェクトを実際に制約する限界だ。
| スペック | Wan 3.0 ドキュメント入力 |
|---|---|
| フォーマット | doc, xls, ppt, pdf, txt, md に加え、key / pages / numbers およびプレーンなウェブリンク |
| ジョブあたりの入力数 | 1ファイル または 1リンク(両方不可、複数不可) |
| サイズ上限 | 100MB |
| ページ上限 | 50ページ |
| 最大出力 | 30秒、単一の連続パス |
| 最大解像度 | 1080p(4K階層なし) |
| 音声 | 画像と同じパスで生成 |
| オープンウェイト | なし;Wan 2.2 が依然として最後のオープンウェイトリリース |
| 入手先 | アリババクラウド Model Studio(Bailian)および Qwen Cloud、招待制 |
パブリックベータは2026年8月6日に開始された(AgentUpdate、2026年8月)。フォーマットリストと2つの公開価格表は、別の仕様まとめ(Ngram、2026年8月)からのもの。
公式ハンドブックには4つのドキュメントユースケースが掲載されており、それらはすでに人々が代理店に依頼している4つの仕事に明確に対応している。
- 提案書からブランドフィルムへ。 スキンケアのピッチドキュメントが、主演女優と朝の光のストーリーを備えた30秒の広告になる。
- 教材からビデオレッスンへ。 百科事典の項目が、小学1年生向けのアニメーション授業になる。
- スプレッドシートからアニメーショングラフへ。 上記のデモであり、4つの中で最も難しい。
- レポートから音声要約へ。 書かれたレポートが、プレゼンター形式のブリーフィングになる。
さて、ここでほとんどの記事がカテゴリを間違えている。
「PDF to 動画」の既存製品は、これをやっていない。Kapwing のドキュメント to 動画は、ファイルからテキストを抽出してタイムラインに配置するだけで、シーン構築もプレゼンターもない。Pictory や Powtoon はストック映像やテンプレートアニメーションを組み立て、Powtoon の製品ページではAIアバターやスクリプトを読み上げる音声を宣伝している。これら3つはすべて、ナレーション付きのスライドを生成する。
| Wan 3.0 | Kapwing ドキュメント to 動画 | Pictory | Powtoon なんでも to 動画 | |
|---|---|---|---|---|
| 出力されるもの | 生成された映像作品 | タイムライン上のテキスト | スクリプトに合わせたストック映像 | テンプレートアニメーション |
| 新しい映像を創作するか | はい、毎フレーム | いいえ | いいえ、ライブラリのクリップ | いいえ、テンプレートアセット |
| AIプレゼンター | デフォルトではなし | なし | オプションの音声 | アバターと音声 |
| 音声 | 画像とともに生成 | ユーザーが追加 | TTSナレーション | TTSナレーション |
| 最長単一出力 | 30秒 | プロジェクトの長さ | プロジェクトの長さ | プロジェクトの長さ |
| 利用可能性 | 招待制、ファーストパーティ | 公開 | 公開 | 公開 |
この表を2回読んでほしい。これが全体の論点だからだ。これらは同じカテゴリの競合ではない。 一方はナレーション付きのスライドショーを作る。もう一方は、これまで存在しなかった映像を作る。1分あたりの価格で比較するのは、コピー機と映画クルーを比較するようなものだ。
Wan 3.0 はスライドショーもできるのか? はい、それが正直な注意点だ。
反例: 量子力学のウェブページを楽しい解説動画にするよう依頼したところ、Wan 3.0 は既存製品が販売しているのとまったく同じプレゼンター+キャプション形式を生成した。30秒の壁を30.02秒で迎えている。アリババ公式パブリックベータデモ、音声あり。
つまり、違いはWan 3.0 が話し手の解説動画を作れないことではない。既存製品では、その形式がメニューにある唯一のものだということだ。
Wan 3.0 ドキュメント to 動画がグラフを壊すが数値を保持する理由
この記事で最も役立つことはこれだ。公式スプレッドシートデモから均等に12フレームを抽出し、すべてのグリフを読み取った。
判定はきれいに二分される。値は通過する。グラフの装飾は失敗する。
生き残ったもの。 4秒の時点で、フレームには $1,580、細い灰色の矢印、$3,460、「Monthly GMV Growth」というキャプション、そして +45.7% と書かれた珊瑚色のバッジが表示されている。タイポグラフィはきれいで、カンマは正しい位置にあり、文字化けはない。このデモの背後にあるプロンプトは特定のスプレッドシートセルを参照しており、画面の数字はそれらと一致している。8ページの製品デッキを使ったサードパーティのテストでも同じ結果が得られた。45g、12時間、55度がすべて正しくレンダリングされ、閉じのスローガンは文字化けひとつなく出力された(AI-Driven Lab、2026年8月)。
これで、財務部門やL&Dチームが実際に気にする質問に答えが出る。数値が静かに変化することはない。
壊れたもの。 グラフのフレームは別の話だ。

Wan 3.0 ドキュメント to 動画のフレーム監査 - 結合されたグラフ凡例と壊れたy軸を示す
公式デモの12秒で停止。1フレームに3つの欠陥:2つの地域名が「Southeasta North America」に融合、「North America」がその後別の系列として繰り返され、y軸は30、60、70と表示されているが、一番上のデータラベルは$3,880。
その1フレームに含まれる失敗を数えよう。
- 結合された凡例。 「Southeast Asia」と「North America」が衝突して「Southeasta North America」に。その後「North America」が別の系列として再び現れるため、1つの地域が2回ラベル付けされ、もう1つは消えている。
- スケールになっていないy軸。 目盛は30、60、70。ピクセル間隔は同じだが値は異なり、40と50は単に欠落している。
- 軸とラベルの単位が異なる。 最も高いグリッド線は70。一番上のデータ点に固定されたラベルは$3,880。
- 1本の線に沿った桁のずれ。 その上部曲線のラベルは$330と$335で始まり、その後$3,970と$3,880に着地する。滑らかな上昇線が、隣接する2点間で10倍のジャンプを保持することはできない。間の2つのラベルは確実な読み取りができないほどにぼやけており、それ自体が答えの一種だ。
棒グラフのセグメントも同様のパターンを示す。4本の棒に$1750、$1,580、$2,350、$2,580と表示されているため、最も短い棒が2番目に高い数値を保持し、最初のラベルは千の位のカンマを失っているが、他の3つは保持している。その隣には、4本の棒に対して5つの緑色の成長率の数字が並んでいる。そしてドーナツセグメントの中央には $89,7M と表示され、小数点があるべき場所にカンマがある。
これらすべてに共通していることに注目してほしい。どれ一つとして内容の誤りではない。すべてが描画の誤り、つまりレイアウト、ラベル付け、スケール、句読点に関するものだ。モデルはシートを理解し、その後、動画モデルが高密度のテキストをレンダリングするのと同じように、つまり近似的に、グラフをレンダリングした。
出力があなたのデッキとまったく似ていない理由には、もう一つ構造的な理由がある。
計算してみよう。ページ上限は50ページ、時間上限は30秒。つまり1ページあたり0.6秒だ。
0.6秒でページを提示することはできないため、モデルは唯一の賢明な方法として、代わりにトレーラーを作成する。先のサードパーティのデッキテストも独立して同じ結論に達した。プレゼンテーションをスライドのページ送りとしてではなく、映画的な広告の素材として扱ったのだ。その製品のメガネフレームは、ショットをまたいで、太いものから縁なし、さらに別の形状へと変化した。
これが、30秒の上限がスペックシートの脚注ではなく、デザイン上の制約である理由でもある。
納品されたファイルを測定した。4つの公式ドキュメントデモは、30.04秒、30.02秒、25.03秒、23.04秒で着地した。2つの30秒クリップは、互いに100分の4秒以内で停止している。そしてスプレッドシートデモは22秒を要求され、その後23.04秒で納品された。この上限については、Wan 3.0 プレビューで詳しく分析している。
つまり、期待値を調整しておこう。ドキュメントを与えればトレーラーが返ってくる。グラフはシンプルに保て。
今日すぐに実行できるドキュメント to 動画ワークフロー
チュートリアルの前に、現実的な確認をしておく。これで1時間の検索が省ける。
Wan 3.0 のドキュメント入力は、アリババ自身のチャネルにのみ存在し、アクセスは招待制で、ウェイトは公開されていない。それらのチャネル外の誰も提供することはできない。私たちも含めて。今日できることは、すでにビジネスとしてオープンになっているモデルを使って、そのxlsxデモの有用な半分を再構築することだ。そして上記のフレーム監査が、壊れる部分を回避する方法を正確に教えてくれる。
3ステップ、Atlas Cloud 上の1つのブラウザタブで完結する。
- 100万トークンのモデルがドキュメントを読み、タイムコード付きのショットスクリプトを書き、すべての数値をリテラル文字列として埋め込む。
- 画像モデルが最初のフレームをレンダリングする。ここでテキストの精度がすべて決まる。
- 動画モデルがそのフレームをスクリプトに従ってアニメーション化する。
| ステップ | モデル | 表示価格 | 最大時間 | なぜここにあるか |
|---|---|---|---|---|
| 1. スクリプト | Qwen3.8 Max (/models/qwen/qwen3.8-max) | 入力100万トークンあたり$2 / 出力$6 | n/a | 100万コンテキストがデッキ全体を飲み込む |
| 2. 最初のフレーム | GPT Image 2 Text-to-Image | 1画像あたり$0.009(下限) | n/a | 画面上の数字に対する最強のテキストレンダリング |
| 3. レンダリング | Wan 2.7 Image-to-Video | 1秒あたり$0.1 | 15秒 | 最初のフレーム制御によりタイポグラフィを安定させる |
| 音声オプション | Wan 2.7 Text-to-Video | 1秒あたり$0.1 | 15秒 | 同じパスで音楽と効果音を生成するが、最初のフレームを受け付けない |
| ステップ3の代替 | MiniMax H3 Text-to-Video | 1秒あたり$0.1 | 15秒 | 同じレート、異なる動きのキャラクター |
| ステップ3の代替 | Seedance 2.5 Text-to-Video | 1秒あたり$0.134 | 30秒 | ここで30秒の1回撮りが可能な唯一のモデル |
このチェーンには正直な限界が3つある。.pptxバイナリをそのまま食べるわけではないので、自分でテキストまたはCSVを貼り付ける必要がある。Wan 2.7 は最大15秒なので、30秒の単一テイクは不可能だ。そして画像 to 動画パスはデフォルトで無音だ。その audio パラメータは唇同期用にユーザーが提供するトラックを受け取るもので、サウンドトラックを生成するわけではない。同じパスで音声を生成したい場合は、テキスト to 動画の兄弟モデルを使うことになり、最初のフレーム制御を放棄することになる。これは、ドル金額で埋め尽くされた動画にとっては間違ったトレードオフだ。価格は2026年8月20日に各モデルページで確認済み。表示価格は下限であり、品質と解像度の階層によって実際の見積もりが上がるため、実行する前にRunボタンを確認してほしい。
構築してみよう。
ステップ1: スプレッドシートをタイムコード付きショットスクリプトに変換する
動画モデルは数字を覚えない。与えられた文字列をレンダリングするだけだ。したがって、このステップの仕事は、表を、すべての数字がすでに引用符で囲まれたテキストとして書き出されたショット指示に変換することだ。
シートを <<< マーカーの間に貼り付ける。設定: 温度0.3、max_tokens 4000。max_tokens は多めにしておく。なぜなら、推論能力のあるモデルが途中で予算切れになると、空の回答を返し、それでも課金されるからだ。
text1あなたはモーショングラフィックスディレクターです。以下は生のスプレッドシートのエクスポートです。 2 3<<< 4Month,North America,Southeast Asia,Europe,Total GMV 5Jan,1580,880,640,3100 6Feb,2110,1240,900,4250 7Mar,2740,1610,1150,5500 8Apr,3120,1980,1330,6430 9May,3350,2240,1460,7050 10Jun,3460,2480,1580,7520 11H1 growth,+45.7%,,, 12>>> 13 1410秒、16:9、Apple Keynote スタイルのビジネスデータ動画用のショットスクリプトを書いてください。ルール: 151. 正確に2つのショット。各ショットにイン/アウトのタイムコードを付けてください(00:00-00:05、00:05-00:10)。 162. 画面に表示されるすべての数字は、ショットの説明の中で正確なリテラル文字列として、引用符で囲んで書いてください。例: "$1,580"。「1月の数値」とは書かず、数字を書いてください。 173. 凡例、目盛ラベル付きの軸、または一度に2つ以上のデータ系列を画面上に表示するよう要求しないでください。代わりに、大きな独立した数字と、1つの珊瑚色の錠剤型バッジを使用してください。 184. 背景は純白、パレットはソフトコーラル+ダークグレー、サンセリフ体。 195. 最後にBGM + SFXの指示を1行(スライドイン時のヒュッという音、バッジに1回のベルチャイム)で終わらせてください。 20スクリプトのみを出力し、コメントは不要です。 21
ルール3は監査の成果だ。公式出力は、凡例、軸の目盛、複数系列グラフの3つで正確に壊れた。そこで、これら3つすべてをブリーフから削除し、その画面スペースを特大の数字と色分けされたバッジに費やす。同じ情報で、失敗する表面は一切ない。
ルール2は人々がスキップするものだが、このチェーンの最後まで数字が生き残る理由だ。「1月の数値」と書かれたショット説明は、数字を再びモデルに委ね、そのモデルがグリフを発明しなければならない。引用符で囲まれた "$1,580" と書かれたショット説明は、次の2つのステップにコピーする文字列を与える。ここで求めているのはデータ可視化ではなく、タイピング指示だ。
返ってくるのは、インとアウトのタイムコードが付いた2つのショットのスクリプトで、画面上のすべての数字がリテラルとして引用符で囲まれ、最後にBGMとSFXの行がある。スクラッチファイルに保存しておく。ステップ2と3は両方ともそれを読み込む。
ステップ2: ブランドの最初のフレームを生成する
画面上のテキストのすべての文字はここで決まる。高品質の画像モデルが $1,580 を正しくレンダリングするのは、動画モデルがそれを動かしながら同時に書くよりもはるかに信頼性が高い。したがって、タイポグラフィを静止画で確定させ、ステップ3ではピクセルを動かすだけにする。
GPT Image 2 を開き、品質を high、サイズを 16:9 オプション(このページでは2048x1152)に設定する。これから作る動画とアスペクト比を合わせないと、ステップ3がタイポグラフィをクロップし始める。
text1純白の継ぎ目ない背景に、マットなスタジオの壁に投影されたかのように撮影された、Apple Keynote スタイルのプレゼンテーションフレーム。中央の見出しはダークチャコールの幾何学的サンセリフ体で「H1 2026」と表示され、広々としたネガティブスペースに配置されている。その下に、同じ書体の2つの特大の数字「$1,580」が左に、「$3,460」が右に、細いライトグレーの矢印で区切られて配置されている。矢印の下には、小さなライトグレーのキャプション「Monthly GMV Growth」。その下に、白いテキストで「+45.7%」と書かれた、1つの珊瑚色の錠剤型バッジ。柔らかく均一な拡散照明、右上隅にかすかな暖色グラデーション、さりげないペーパーグレイン、無駄のない、ロゴなし、グラフなし。ウルトラクリーンなコーポレートミニマリズム、16:9。 2
コピーすべき2つの細部。「No charts」は意図的に入れてある。Runボタンの価格見積もりを押す前に読んでほしい。高品質でワイドな2Kフレームは、リスト価格の$0.009の数倍になるからだ。

Atlas Cloud 上の GPT Image 2 プレイグラウンド。最初のフレームのプロンプトと、すべての数字が正しく綴られたレンダリング済み Keynote スタイルフレームを示す。
品質 high、16:9、2048x1152 の GPT Image 2。すべての数字が着地した。「H1 2026」、「$1,580」、「$3,460」、そして珊瑚色の「+45.7%」バッジ。これこそが、タイポグラフィを動画モデルではなく静止画で確定させる理由である。
ステップ3: ドキュメント to 動画クリップをレンダリングし、すべての数字を検証する
最後のステップ。ステップ2の画像を最初のフレームとして読み込み、動画モデルがタイポグラフィを静止させたままアニメーション化する。
Wan 2.7 Image-to-Video を開く。設定: 最初のフレームをアップロード、解像度 1080P、時間 10s。このモデルは音声を駆動入力として扱い、生成するものではないため、音声フィールドは空のままにする。このクリップは自分でスコアリングするか、別のテキスト to 動画パスで行う。
text1このフレームを10秒のApple Keynote スタイルのビジネスデータ動画としてアニメーション化し、既存のタイポグラフィをピクセル単位で安定させて保持してください。 2 300:00-00:05 - 見出し「H1 2026」が保持され、その後金色の粒子に溶けて外側に漂う。2つの数字「$1,580」と「$3,460」が左と右からスライドインして定位置にロックされる。細い灰色の矢印が左から右に描かれる。珊瑚色のバッジ「+45.7%」が下から少しオーバーシュート気味にポップアップし、1回の澄んだベルチャイムに合わせて表示される。 4 500:05-00:10 - すべてが滑らかに左にスライドオフする。同じ純白の背景に対して、共通のベースラインから3本の太い角丸の棒が上向きに成長する。珊瑚色、ティール、琥珀色で、各棒の上に1つの大きな独立した数字が表示される。「$3,460」、「$2,480」、「$1,580」。凡例、軸、目盛ラベル、グリッド線は一切なし。カメラはロックされ、完全に静止したまま。 6
「既存のタイポグラフィをピクセル単位で安定させて保持」と「カメラはロックされ、完全に静止したまま」は実際に重要な役割を果たす。カメラが動くたびに、モデルがそのままにしておくべきテキストを再描画する機会が生まれる。
次に、退屈だが重要な部分を行う。数字が表示される各フレームで一時停止し、元の行と照合する。これは30秒のチェックであり、間違った収益額を自信満々に表示する動画と、あなたの間にある唯一の盾だ。

Atlas Cloud 上の Wan 2.7 Image-to-Video プレイグラウンド。最初のフレームが読み込まれ、完成したデータクリップがレンダリングされている。
Wan 2.7 Image-to-Video、1080P、ステップ2の最初のフレームをアップロードし、出力パネルに完成したクリップ。パネルの表示内容に注目すべき点がある。10秒を要求し、時間フィールドには10と表示されていたが、レンダリングは5秒で返ってきた。Run の見積もりはファイルの前にそのことを教えてくれていた。それを見るべき理由はまさにそこにある。

同じGMVスプレッドシートから再構築された完成したデータクリップ。すべての数字がそのまま残っている。
成果: 同じスプレッドシートを、凡例と軸目盛を意図的に設計から除外して再構築。モデルはスクリプト化された両方のショットを、実際にレンダリングした5秒間に圧縮し、すべての数字が移動後も生き残った。冒頭の「$1,580」と「$3,460」、そして3本の棒の上の「$3,460」、「$2,480」、「$1,580」。ラベルの文字化けはゼロ。なぜなら、文字化けするラベルが存在しなかったからだ。画像 to 動画パスでは音声が生成されないため、デフォルトで無音。
ドキュメント to 動画のバリエーションと完成した1分間のコスト
スプレッドシートのケースが最も難しい。他の3つの公式ユースケースはより簡単で、商業的価値の大部分はそこにある。
教材。 百科事典の項目を与え、特定の読解レベル向けのレッスンを依頼する。以下の出力は、詩人・王維についてのちびキャラスタイルのアニメーション授業で、長さは25.03秒。
描画スタイルは全体を通して一貫している。キャラクターの細部はそうではない。3秒の時点では、彼は無地の白い背景に対して黒い帽子をかぶっている。22秒までに帽子は淡い青色に変わり、彼は古典的な巻物の絵の中に立っている。デッキテスターがメガネフレームに見たのと同じドリフトだ。これを3ステップのチェーンで再構築する場合は、ステップ1でキャラクターカードを固定し、ステップ2のフレームをスタイルアンカーとして再利用する。
百科事典の項目を小学1年生向けのアニメーション授業に変換、25.03秒、生成音声付き。アリババ公式Wan 3.0 パブリックベータデモ。
ブランドフィルム。 提案書が30秒のフルスポットになる。4つのデモの中で最も美しく、最も検証が難しい。なぜなら、ソースドキュメントに何が書かれていたかが見えないからだ。美しさではなく一貫性に注目してほしい。これが、サードパーティのテスターを捉えた失敗モードだ。彼らの製品は1つのクリップの中で3回形を変えた。
提案書を30.04秒のスキンケアブランドフィルムに変換。アリババ公式Wan 3.0 パブリックベータデモ、音声あり。
レポート要約。 これに関する公式デモは存在しないため、このパターンは未テストとして扱うこと。1人のプレゼンター、ショットごとに1つの主張、そしてステップ1とまったく同じようにすべての数字を引用符で囲むことを要求する。
さて、費用だ。
| 項目 | レート | 完成した動画30秒あたり |
|---|---|---|
| Wan 3.0、1080p(人民元シート) | 1秒あたり¥1.2 | ¥36 |
| Wan 3.0、1080p(米ドルシート) | 1秒あたり$0.20 | $6.00 |
| Wan 3.0、720p(人民元シート) | 1秒あたり¥0.6 | ¥18 |
| 3ステップチェーン、1回のパス | スクリプト + フレーム + 1秒あたり$0.1のレンダリング | 10秒あたり約$1.20 |
| 3ステップチェーン、3回の試行 | スクリプトは再利用、フレームとレンダリングは繰り返し | 約$3.50 |
2つの公開されたWan 3.0価格表は、1080pが¥1.2なのか$0.20なのかで一致していない。これらは同じ数字ではない。シリーズの予算を立てる前に、実際に課金されるエンドポイントのレートを確認すること。
隠れたコストは1秒あたりのレートではない。再実行だ。ドキュメント入力はジョブあたり1ファイルを受け付けるため、1つの数字を変更するだけで動画全体を再生成する必要がある。3ステップチェーンでは、ショットスクリプトは再利用可能なテキスト成果物であるため、1つの数字の変更は、1回の完全なジョブではなく、1回のレンダリングで済む。四半期レポートのサイクルでは、その差が1秒あたりの価格をはるかに凌ぐ。
何かをアップロードする前に、1つ法的な注意事項を。ホスト型モデルに送信するドキュメントは、建物の外に出るドキュメントであり、内部デッキや未公開の財務情報には通常、それに関するポリシーが付随している。締め切りのプレッシャーが来る前に確認すること。後ではなく。また、この記事のすべての公式デモクリップはアリババに帰属し、ここではパブリックベータ素材として引用されており、商業的に再利用するライセンスはここには一切ない。
Wan 3.0 ドキュメント to 動画 FAQ
Wan 3.0 ドキュメント to 動画はどのようなファイルタイプを受け付け、サイズはどのくらいですか?
doc、xls、ppt、pdf、txt、md。key、pages、numbers も報告されている。さらに、ファイルの代わりにプレーンなウェブリンクも可能。ジョブあたり1ファイルまたは1リンク、最大100MBまたは50ページ。
Wan 3.0 は各スライドを1つのシーンに変換しますか?
いいえ、これが最も一般的な誤解です。ドキュメント全体を読み、学習した内容から動画を構成します。上限では50ページを30秒、つまり1ページあたり0.6秒で処理するため、ページめくりではなくトレーラーを生成します。公式のユースケースと独立したテストの両方が同じ方向を示しています。
スプレッドシートの数値は動画で正確ですか?
私が確認したすべてのケースでセルの値は保持されました。公式デモの $1,580、$3,460、+45.7% も含まれます。失敗するのはグラフの装飾です。凡例が結合され、軸の目盛が非線形になり、桁区切りが失われます。すべての数値を引用符で囲んだリテラルとして注入し、凡例や目盛ラベルをブリーフから完全に設計除外してください。
現在、APIを通じてWan 3.0 ドキュメント to 動画を使用できますか?
アリババ自身のチャネル経由でのみ可能で、現在は招待制であり、ウェイトは公開されていません。Wan 2.2 が依然としてシリーズ最後のオープンウェイトリリースです。それが変わるまでは、上記の3ステップチェーンが実用的な代替手段です。
30秒のWan 3.0動画の費用はいくらですか?
公開されている1080pレートでは、1つの30秒クリップあたり¥36、または国際シートでは$6.00です。1回のパスではなく、再実行の予算を立ててください。なぜなら、1つの数値を修正するだけで全体を再生成する必要があるからです。
現在すぐに実行できる、Wan 3.0 ドキュメント to 動画に最も近いものは何ですか?
ロングコンテキストモデルでショットスクリプトを書き、次にWan 2.7(1秒あたり$0.1)でレンダリングする。代替として、MiniMax H3(同レート)またはSeedance 2.5(1秒あたり$0.134)も使用可能。生成映像の外観とフレーム精度の高いテキストが得られます。得られないもの:30秒の連続テイク、画像 to 動画レンダリングと同じパスでの音声、.pptx を自動で読み取る機能。
正直なまとめ:Wan 3.0 ドキュメント to 動画 は、実際の能力と実際の上限を備えた本物の機能であり、その出力とあなたの期待とのギャップは見た目よりも小さい。ただし、どちらか一方に凡例を描くよう要求するのをやめれば、の話だが。






