Seedance 2.5 już dostępne — Jako pierwsze na Atlas Cloud

Wan 3.0 Dokument na wideo: Przeanalizowałem każdą klatkę

Wan 3.0 dokument na wideo jest realny: Sprawdziłem oficjalne demo xlsx klatka po klatce. Liczby przetrwają, wykresy się psują. Plus przepływ pracy, który możesz uruchomić teraz.

Wrzuć jeden arkusz kalkulacyjny. Otrzymaj z powrotem 23-sekundową animację biznesową z muzyką.

To jest obietnica Wan 3.0 document to video, pierwszego natywnego wejścia dokumentu w rodzinie, a oficjalne demo realizuje ją dosłowniej, niż się spodziewałem. Liczby się zgadzają. 1580 $ rośnie do 3460 $, odznaka wskazuje +45,7%, a te wartości prowadzą prosto do konkretnych komórek w źródłowym arkuszu.

Następnie przeciągnąłem wskaźnik czasu do 12. sekundy i odczytałem legendę wykresu.

„Southeasta North America”.

Dwa regiony sprzedaży zgniecione w jedno słowo, które nie istnieje. To jest prawdziwa linia wodna dokumentu do wideo w 2026 roku: model faktycznie przeczytał twoją tabelę, ale wciąż nie potrafi narysować twojego wykresu. Poniżej znajduje się audyt klatka po klatce, którego nikt inny nie opublikował, plus trzyetapowy łańcuch, który możesz uruchomić jeszcze dziś po południu.

Kluczowe wnioski

  • Wan 3.0 akceptuje 1 plik lub 1 link, do 100 MB lub 50 stron, i generuje do 30 sekund w 1080p.
  • Tworzy film z twojego dokumentu. Nie przekształca slajdu 3 w ujęcie 3.
  • Wartości komórek pozostają nienaruszone. Legendy wykresów, znaczniki osi i separatory tysięcy – nie.
  • Limity są twarde: brak 4K, brak otwartych wag, tylko kanały własne.
  • Model z długim kontekstem plus 15-sekundowy model wideo odtwarzają większość tego dzisiaj.

Złoty tekst z napisem H1 2026 Wan ze złotymi rozbryzgami brokatu

Wynik Wan 3.0 dokument do wideo: oficjalne demo xlsx wyrenderowane jako animowany film danych w stylu Keynote

Pokaz: oficjalne demo publicznej bety Wan 3.0 od Alibaba, jeden .xlsx z miesięcznym GMV w środku, 23 sekundy animowanego filmu danych na wyjściu. Pokazane jako cichy GIF; dostarczony plik zawiera ścieżkę stereo AAC 44,1 kHz. Źródło: oficjalny podręcznik twórcy Wan 3.0 od Alibaba.

Co właściwie robi Wan 3.0 Document to Video

Krótka wersja, żebyś mógł wyjść za minutę, jeśli to wszystko, czego potrzebujesz.

Podajesz mu jeden dokument lub jeden link internetowy. Czyta całość, decyduje, jaka jest historia, i generuje wideo z obrazem i dźwiękiem w jednym przebiegu. Maksymalnie 30 sekund, maksymalnie 1080p. Nie przechodzi przez strony po kolei.

Oto limity, które faktycznie rządzą projektem.

SpecyfikacjaWejście dokumentu Wan 3.0
Formatydoc, xls, ppt, pdf, txt, md, plus key / pages / numbers i zwykły link internetowy
Wejścia na zadanie1 plik lub 1 link (nie oba, nie kilka)
Limit rozmiaru100 MB
Limit stron50 stron
Maks. wyjście30 sekund, pojedynczy ciągły przebieg
Maks. rozdzielczość1080p (brak poziomu 4K)
Audiogenerowane w tym samym przebiegu co obraz
Otwarte wagibrak; Wan 2.2 jest wciąż ostatnią wersją z otwartymi wagami
Gdzie zdobyćAlibaba Cloud Model Studio (Bailian) i Qwen Cloud, dostęp na zaproszenie

Publiczna beta rozpoczęła się 6 sierpnia 2026 (AgentUpdate, sierpień 2026). Lista formatów i dwa opublikowane arkusze cenowe pochodzą z osobnego zestawienia specyfikacji (Ngram, sierpień 2026).

Oficjalny podręcznik dostarcza cztery przypadki użycia dokumentów i idealnie pasują do czterech zadań, za które ludzie już płacą agencjom:

  • Dokument ofertowy w film marki. Dokument przedstawiający pielęgnację skóry staje się 30-sekundową reklamą z główną aktorką i historią w porannym świetle.
  • Materiał kursowy w lekcję wideo. Wpis encyklopedyczny staje się animowaną lekcją dla pierwszoklasistów.
  • Arkusz kalkulacyjny w animowane wykresy. Powyższe demo i zdecydowanie najtrudniejszy z czterech.
  • Raport w mówione podsumowanie. Pisemny raport staje się briefingiem w stylu prezentera.

Teraz tutaj większość artykułów myli kategorię.

Obecni gracze w „PDF do wideo” nie robią tego. Kapwing's document-to-video wyciąga tekst z twojego pliku i układa go na osi czasu, bez budowania scen i bez prezentera. Pictory i Powtoon montują stockowe materiały lub animacje szablonowe, a strony produktowe Powtoon reklamują awatary AI i głosy czytające twój skrypt. Wszystkie trzy produkują narrację slajdów.

Wan 3.0Kapwing Document to VideoPictoryPowtoon Anything-to-Video
Co wychodziwygenerowany filmtwój tekst na osi czasustockowe materiały do skryptuanimacja szablonowa
Tworzy nowe obrazytak, każda klatkanienie, klipy z bibliotekinie, zasoby szablonu
Prezenter AIdomyślnie brakbrakopcjonalny głosawatary i głosy
Audiogenerowane z obrazemdodajesz jelektor TTSlektor TTS
Najdłuższe pojedyncze wyjście30sdługość projektudługość projektudługość projektu
Dostępnośćtylko na zaproszenie, własne kanałypublicznypublicznypubliczny

Przeczytaj tę tabelę dwa razy, bo to cały argument: to nie są konkurenci w tej samej kategorii. Jeden robi narrację slajdów. Drugi tworzy materiał, który nigdy nie istniał. Porównywanie ich pod względem ceny za minutę jest jak porównywanie kserokopiarki z ekipą filmową.

Czy Wan 3.0 też może zrobić to pokaz slajdów? Tak, i to jest szczere zastrzeżenie.

Kontrprzykład: poproszony o przekształcenie strony internetowej o mechanice kwantowej w zabawny materiał wyjaśniający, Wan 3.0 wyprodukował dokładnie format prezentera plus podpis, który sprzedają obecni gracze. Uderza w ścianę 30 sekund przy 30,02 s. Oficjalne demo publicznej bety Alibaba, z dźwiękiem.

Zatem różnica nie polega na tym, że Wan 3.0 nie może tworzyć wyjaśnień z mówiącą głową. Chodzi o to, że u obecnych graczy ten format jest jedyną opcją w menu.

Dlaczego Wan 3.0 Document to Video psuje wykresy, ale zachowuje twoje liczby

Oto najważniejsza rzecz w tym artykule: wyciągnąłem 12 równomiernie rozmieszczonych klatek z oficjalnego dema arkusza kalkulacyjnego i odczytałem każdy glif.

Werdykt dzieli się wyraźnie na dwie części. Wartości przechodzą. Elementy wykresu zawodzą.

Co przetrwało. W 4. sekundzie klatka pokazuje $1,580, cienką szarą strzałkę, $3,460, podpis „Monthly GMV Growth” i koralową odznakę z napisem +45,7%. Typografia jest czysta, przecinki są we właściwych miejscach, bez zniekształconych znaków. Prompt stojący za tym demem odwołuje się do konkretnych komórek arkusza, a liczby na ekranie są z nimi zgodne. Test strony trzeciej na 8-stronicowej prezentacji produktu wykazał to samo: 45 g, 12 godzin i 55 stopni – wszystko wyrenderowane poprawnie, a końcowe hasło pojawiło się bez ani jednego błędnego znaku (AI-Driven Lab, sierpień 2026).

To odpowiada na pytanie, które faktycznie interesuje zespoły finansowe i L&D. Twoje liczby nie mutują po cichu.

Co się zepsuło. Klatki wykresów to inna historia.

Adnotowany wykres liniowy pokazujący trzy błędy w legendzie, skali i jednostkach

Audyt klatki Wan 3.0 dokument do wideo pokazujący połączoną legendę wykresu i uszkodzoną oś Y

Zatrzymane w 12. sekundzie oficjalnego dema. Trzy defekty w jednej klatce: dwie nazwy regionów połączone w „Southeasta North America”, „North America” następnie powtórzone jako osobna seria, oraz oś Y z wartościami 30, 60, 70, podczas gdy górna etykieta danych mówi $3,880.

Policz błędy w tej jednej klatce:

  1. Połączona legenda. „Southeast Asia” i „North America” zderzają się w „Southeasta North America”. Następnie „North America” pojawia się ponownie jako osobna seria, więc jeden region jest oznaczony dwukrotnie, a jeden zniknął.
  2. Oś Y, która nie jest skalą. Znaczniki pokazują 30, 60, 70. Równe odstępy pikseli, nierówne wartości, a 40 i 50 po prostu brakuje.
  3. Oś i etykiety w różnych jednostkach. Najwyższa linia siatki to 70. Etykieta przypięta do górnego punktu danych mówi $3,880.
  4. Dryf wielkości wzdłuż jednej linii. Etykiety na górnej krzywej zaczynają się od $330 i $335, po czym lądują na $3,970 i $3,880. Płynnie rosnąca linia nie może mieć dziesięciokrotnego skoku między dwoma sąsiednimi punktami. Dwie etykiety pomiędzy są rozmazane poza czytelność, co samo w sobie jest odpowiedzią.

Segment wykresu słupkowego powtarza wzór. Cztery słupki mają wartości $1750, $1,580, $2,350 i $2,580, więc najkrótszy słupek ma drugą najwyższą liczbę, a pierwsza etykieta traci separator tysięcy, podczas gdy pozostałe trzy go zachowują. Obok nich znajduje się pięć zielonych wartości wzrostu dla czterech słupków. A segment pierścienia koncentruje się na $89,7M, przecinku w miejscu, gdzie powinien być separator dziesiętny.

Zauważ, co wszystkie te błędy mają wspólnego. Żaden nie jest błędem treści. Każdy jest błędem rysowania: układ, etykietowanie, skala, interpunkcja. Model zrozumiał arkusz, a następnie wyrenderował wykres tak, jak model wideo renderuje dowolny gęsty tekst – w przybliżeniu.

Istnieje drugi, strukturalny powód, dla którego wynik nie wygląda jak twoja prezentacja.

Wykonaj arytmetykę. 50 stron to limit stron, 30 sekund to limit czasu. To 0,6 sekundy na stronę.

Nie możesz zaprezentować strony w 0,6 sekundy, więc model robi jedyną rozsądną rzecz i tworzy zwiastun. Test prezentacji strony trzeciej doszedł do tego samego wniosku niezależnie: potraktował prezentację jako materiał źródłowy do filmu reklamowego, a nie jako slajdy do przewijania. Ramki okularów produktu dryfowały od grubych do bezramkowych do trzeciego kształtu w różnych ujęciach.

Dlatego też limit 30 sekund jest ograniczeniem projektowym, a nie przypisem w specyfikacji.

Zmierzyliśmy dostarczone pliki: cztery oficjalne dema dokumentów lądują odpowiednio na 30,04s, 30,02s, 25,03s i 23,04s. Dwa 30-sekundowe klipy zatrzymują się w ciągu czterech setnych sekundy od siebie. A demo arkusza kalkulacyjnego prosiło o 22 sekundy, a dostarczyło 23,04. Rozebraliśmy ten limit na części w podglądzie Wan 3.0.

A więc: oczekiwania skalibrowane. Wrzuć dokument, zdobądź zwiastun, trzymaj wykresy prosto.

Przepływ pracy Dokument do Wideo, który możesz uruchomić dzisiaj

Szybkie sprawdzenie rzeczywistości przed samouczkiem, bo oszczędza godzinę szukania.

Wejście dokumentu Wan 3.0 istnieje tylko na własnych kanałach Alibaba, dostęp jest na zaproszenie, a wagi nie są opublikowane. Nikt poza tymi kanałami nie może go zaoferować, włączając nas. To, co możesz zrobić dzisiaj, to odtworzyć użyteczną połowę tego dema xlsx za pomocą modeli, które są już otwarte dla biznesu, a audyt klatek powyżej mówi ci dokładnie, jak ominąć część, która się psuje.

Trzy kroki, jedna karta przeglądarki w Atlas Cloud:

  1. Model z milionem tokenów czyta dokument i pisze scenariusz ujęć z czasem, z każdą liczbą wbudowaną jako dosłowny ciąg znaków.
  2. Model obrazu renderuje pierwszą klatkę, w której blokowana jest cała dokładność tekstu.
  3. Model wideo animuje tę klatkę zgodnie ze scenariuszem.
KrokModelCena katalogowaMaks. czas trwaniaDlaczego tutaj
1. ScenariuszQwen3.8 Max (/models/qwen/qwen3.8-max)$2 wejście / $6 wyjście na 1M tokenówn/d1M kontekstu połyka całą prezentację
2. Pierwsza klatkaGPT Image 2 Text-to-Image$0,009 za obraz (podstawa)n/dnajsilniejsze renderowanie tekstu dla cyfr na ekranie
3. RenderowanieWan 2.7 Image-to-Video$0,1 na sekundę15skontrola pierwszej klatki utrzymuje stabilną typografię
Opcja audioWan 2.7 Text-to-Video$0,1 na sekundę15sgeneruje muzykę i efekty dźwiękowe w tym samym przebiegu, ale nie przyjmuje pierwszej klatki
Zamiana dla kroku 3MiniMax H3 Text-to-Video$0,1 na sekundę15sta sama stawka, inny charakter ruchu
Zamiana dla kroku 3Seedance 2.5 Text-to-Video$0,134 na sekundę30sjedyny tutaj, który osiąga 30s w jednym przebiegu

Trzy uczciwe ograniczenia tego łańcucha. Nie zjada pliku binarnego .pptx, więc sam wklejasz tekst lub CSV. Wan 2.7 kończy na 15 sekundach, więc pojedyncze 30-sekundowe ujęcie nie wchodzi w grę. A ścieżka obraz-do-wideo jest domyślnie cicha: jej parametr audio przyjmuje ścieżkę dostarczoną przez ciebie w celu synchronizacji ruchu warg, nie wymyśla ścieżki dźwiękowej. Jeśli chcesz, aby audio zostało wygenerowane w tym samym przebiegu, używasz rodzeństwa tekst-do-wideo i rezygnujesz z kontroli pierwszej klatki, co w przypadku wideo pełnego kwot dolarowych jest złym kompromisem. Ceny zweryfikowane na stronach modeli 20 sierpnia 2026, i pamiętaj, że cena katalogowa to podstawa: poziomy jakości i rozdzielczości podnoszą rzeczywistą cenę, więc przeczytaj przycisk Uruchom przed zatwierdzeniem.

Zbudujmy to.

Krok 1: Przekształć swój arkusz kalkulacyjny w scenariusz ujęć z czasem

Modele wideo nie pamiętają liczb. Renderują dowolny ciąg znaków, który im podasz. Zatem zadaniem tego kroku jest przekształcenie tabeli w kierunki ujęć, w których każda wartość jest już zapisana jako tekst w cudzysłowie.

Wklej swój arkusz między znacznikami <<<. Ustawienia: temperatura 0,3, max_tokens 4000. Trzymaj max_tokens hojnie, ponieważ model zdolny do rozumowania, który wyczerpie budżet w trakcie myślenia, zwróci pustą odpowiedź, za którą i tak zapłacisz.

text
1Jesteś reżyserem motion-graphics. Poniżej znajduje się surowy eksport arkusza kalkulacyjnego.
2
3<<<
4Miesiąc,Ameryka Północna,Azja Południowo-Wschodnia,Europa,Całkowity GMV
5Sty,1580,880,640,3100
6Lut,2110,1240,900,4250
7Mar,2740,1610,1150,5500
8Kwi,3120,1980,1330,6430
9Maj,3350,2240,1460,7050
10Cze,3460,2480,1580,7520
11Wzrost H1,+45,7%,,,
12>>>
13
14Napisz scenariusz ujęć dla 10-sekundowego, 16:9, w stylu Apple Keynote
15biznesowego wideo danych. Zasady:
161. Dokładnie 2 ujęcia. Podaj każdemu czas wejścia/wyjścia (00:00-00:05,
17   00:05-00:10).
182. Każda liczba pojawiająca się na ekranie musi być zapisana w opisie
19   ujęcia jako dokładny dosłowny ciąg znaków, np. „$1,580”.
20   Nigdy nie pisz „wartość ze stycznia” – napisz cyfry.
213. NIE proś o legendę, oś z etykietami znaczników ani więcej niż
22   dwie serie danych na ekranie jednocześnie. Używaj dużych samodzielnych
23   liczb i jednej koralowej odznaki w kształcie pigułki.
244. Czyste białe tło, paleta miękki koral + głęboka szarość, bezszeryfowa.
255. Zakończ jedną linią kierunku BGM + SFX (whoosh przy wjeździe,
26   jeden dzwonek na odznace).
27Wypisz tylko scenariusz, bez komentarza.
28

Zasada 3 to korzyść z audytu. Oficjalne wyjście zepsuło się dokładnie na trzech rzeczach: legendach, znacznikach osi i wykresach wieloserii. Więc usuwamy wszystkie trzy z briefu i wykorzystujemy tę przestrzeń ekranową na ogromne liczby i kolorową odznakę. Ta sama informacja, żadnej powierzchni awarii.

Zasada 2 to ta, którą ludzie pomijają, i to jest powód, dla którego cyfry przetrwają do końca tego łańcucha. Opis ujęcia, który mówi „wartość ze stycznia” oddaje liczbę z powrotem do modelu, który musi wymyślić dla niej glify. Opis ujęcia, który mówi „$1,580” w cudzysłowie daje następnym dwóm krokom ciąg znaków do skopiowania. Nie prosisz tutaj o wizualizację danych, prosisz o instrukcję pisania na klawiaturze.

To, co wraca, to dwuujęciowy scenariusz z czasami wejścia i wyjścia, każda liczba na ekranie cytowana jako dosłowna, i zamykająca linia BGM i SFX. Zachowaj go w pliku roboczym; kroki 2 i 3 oba z niego czytają.

Krok 2: Wygeneruj pierwszą klatkę marki

Każdy znak tekstu na ekranie jest tutaj decydowany. Model obrazu w wysokiej jakości renderuje $1,580 poprawnie znacznie bardziej niezawodnie niż model wideo może to napisać, jednocześnie go poruszając, więc ustalamy typografię w nieruchomym obrazie i pozwalamy krokowi 3 tylko przesuwać piksele.

Otwórz GPT Image 2 i ustaw jakość na wysoką i rozmiar na opcję 16:9, która na tej stronie to 2048x1152. Dopasuj proporcje do wideo, które zamierzasz zrobić, w przeciwnym razie krok 3 zacznie od przycinania twojej typografii.

text
1Dziewicza ramka prezentacji w stylu Apple Keynote na czystym białym
2bezszwowym tle, sfotografowana jakby wyświetlana na matowej ścianie
3studia. Wyśrodkowany nagłówek w głębokiej grafitowej geometrycznej
4bezszeryfowej czcionce z napisem „H1 2026”, umieszczony w dużej
5ujemnej przestrzeni. Poniżej dwie ogromne cyfry w tej samej
6czcionce, „$1,580” po lewej i „$3,460” po prawej, oddzielone cienką
7jasnoszarą strzałką. Pod strzałką, mały jasnoszary podpis z tekstem
8„Monthly GMV Growth”. Pod tym, pojedyncza koralowa odznaka w kształcie
9pigułki z białym tekstem „+45,7%”. Miękkie, równomierne rozproszone
10oświetlenie, delikatny ciepły gradient w prawym górnym rogu, subtelna
11tekstura papieru, bez bałaganu, bez logo, bez wykresów. Ultra-czysty
12korporacyjny minimalizm, 16:9.
13

Warte skopiowania są dwa szczegóły. „Bez wykresów” jest tam celowo. I przeczytaj ofertę cenową na przycisku Uruchom, zanim go naciśniesz, ponieważ jakość wysoka na szerokiej klatce 2K kosztuje wielokrotność ceny katalogowej $0,009.

Zrzut ekranu generatora obrazów AI pokazujący kroki wejściowe i wyjście

Środowisko pracy GPT Image 2 w Atlas Cloud z promptem pierwszej klatki i wyrenderowaną ramką w stylu Keynote pokazującą każdą liczbę poprawnie zapisaną

GPT Image 2 przy jakości wysokiej, 16:9 w 2048x1152. Każda liczba wylądowała: „H1 2026”, „$1,580”, „$3,460” i koralowa odznaka „+45,7%”, co jest dokładnie powodem, dla którego typografia jest ustalana w nieruchomym obrazie, a nie w modelu wideo.

Krok 3: Renderuj klip dokumentu do wideo i zweryfikuj każdą cyfrę

Ostatni krok. Załaduj obraz z kroku 2 jako pierwszą klatkę i pozwól modelowi wideo go animować, utrzymując typografię w bezruchu.

Otwórz Wan 2.7 Image-to-Video. Ustawienia: przesłana pierwsza klatka, rozdzielczość 1080P, czas trwania 10s. Pozostaw pole audio puste, ponieważ ten model traktuje audio jako wejście sterujące, a nie coś, co tworzy. Sam dodajesz muzykę do tego klipu lub w osobnym przebiegu tekst-do-wideo.

text
1Animuj tę klatkę jako 10-sekundowe biznesowe wideo danych w stylu
2Apple Keynote, utrzymując istniejącą typografię w stabilnych pikselach.
3
400:00-00:05 – Nagłówek „H1 2026” pozostaje, a następnie rozpuszcza
5się w złote cząsteczki, które dryfują na zewnątrz. Dwie cyfry
6„$1,580” i „$3,460” wsuwają się z lewej i prawej strony i zatrzaskują
7na miejscu; cienka szara strzałka rysuje się między nimi od lewej do
8prawej. Koralowa odznaka z napisem „+45,7%” wyskakuje z dołu z lekkim
9przestrzeleniem, zsynchronizowana z jednym czystym dźwiękiem dzwonka.
10
1100:05-00:10 – Wszystko płynnie zjeżdża w lewo. Trzy grube zaokrąglone
12słupki rosną w górę ze wspólnej linii bazowej na tym samym czystym
13białym tle, koralowy, morski i bursztynowy, z jedną dużą samodzielną
14cyfrą nad każdym: „$3,460”, „$2,480”, „$1,580”. Żadnej legendy,
15żadnej osi, żadnych etykiet znaczników, żadnych linii siatki. Kamera
16pozostaje zablokowana i idealnie nieruchoma przez cały czas.
17

„Utrzymując istniejącą typografię w stabilnych pikselach” i „kamera pozostaje nieruchoma” robią prawdziwą robotę. Każdy ruch kamery to kolejna szansa dla modelu na przerysowanie tekstu, który powinien pozostawić w spokoju.

Następnie wykonaj nudną, ważną część: zatrzymaj się na każdej klatce, w której pojawia się liczba, i porównaj ją z wierszem źródłowym. To jest 30-sekundowe sprawdzenie i jedyna rzecz, która stoi między tobą a wideo, które pewnie pokazuje błędną wartość przychodu.

Interfejs generowania wideo AI pokazujący prompt wejściowy i ukończone wideo

Środowisko pracy Wan 2.7 Image-to-Video w Atlas Cloud z załadowaną pierwszą klatką i wyrenderowanym klipem danych

Wan 2.7 Image-to-Video w 1080P z przesłaną pierwszą klatką z kroku 2 i ukończonym klipem w panelu wyjściowym. Warto zauważyć, co mówi panel: prosiliśmy o 10 sekund, pole czasu trwania pokazało 10, a renderowanie zwróciło 5. Wycena Uruchom powiedziała nam o tym, zanim plik to zrobił, co jest całym powodem, aby ją przeczytać.

Miesięczny wzrost GMV H1 2026 od $1,580 do $3,460, w górę o 45,7%

Ukończony klip danych odtworzony z tego samego arkusza GMV, każda liczba nienaruszona

Efekt: ten sam arkusz kalkulacyjny, odtworzony z legendami i znacznikami osi celowo zaprojektowanymi poza nim. Model skompresował oba zapisane ujęcia w pięć sekund, które faktycznie wyrenderował, a każda liczba przetrwała ruch: „$1,580” i „$3,460” w otwarciu, a następnie „$3,460”, „$2,480” i „$1,580” nad trzema słupkami. Żadnych zniekształconych etykiet, ponieważ nie było żadnych etykiet do zniekształcenia. Cichy zgodnie z projektem, ponieważ ścieżka obraz-do-wideo nie generuje dla ciebie żadnego dźwięku.

Warianty dokumentu do wideo i koszt gotowej minuty

Przypadek arkusza kalkulacyjnego jest najtrudniejszy. Pozostałe trzy oficjalne przypadki użycia są łatwiejsze i tam leży większość wartości komercyjnej.

Materiały kursowe. Wrzuć wpis encyklopedyczny i poproś o lekcję na określonym poziomie czytania. Poniższe wyjście to animowana lekcja w stylu chibi o poecie Wang Wei, 25,03 sekundy długości.

Styl rysowania utrzymuje się przez cały czas. Szczegóły postaci nie. W 3. sekundzie nosi czarną czapkę na jednolitym białym tle; do 22. sekundy czapka zmieniła kolor na jasnoniebieski, a on stoi wewnątrz klasycznego malowidła zwojowego. Ten sam dryf, który tester prezentacji widział w tych ramkach okularów. Jeśli odtwarzasz to w trzyetapowym łańcuchu, zablokuj kartę postaci w kroku 1 i użyj ponownie klatki z kroku 2 jako kotwicy stylu.

Wpis encyklopedyczny w animowaną lekcję dla pierwszej klasy, 25,03s z wygenerowanym dźwiękiem. Oficjalne demo publicznej bety Wan 3.0 od Alibaba.

Filmy marki. Dokument propozycji staje się pełnym 30-sekundowym spotem. To najładniejsze z czterech dem i najmniej weryfikowalne, ponieważ nie widać, co mówił źródłowy dokument. Uważaj na spójność, a nie na urodę: to jest tryb awarii, który złapał testera zewnętrznego, którego produkt zmienił kształt trzy razy w jednym klipie.

Dokument propozycji w 30,04s film marki pielęgnacji skóry. Oficjalne demo publicznej bety Wan 3.0 od Alibaba, z dźwiękiem.

Podsumowania raportów. Nie istnieje oficjalne demo dla tego przypadku, więc traktuj wzór jako nieprzetestowany: poproś o jednego prezentera, jedno twierdzenie na ujęcie i umieść każdą liczbę w cudzysłowie dokładnie tak, jak w kroku 1.

A teraz pieniądze.

CoStawka30 sekund gotowego wideo
Wan 3.0, 1080p (arkusz RMB)¥1,2 za sekundę¥36
Wan 3.0, 1080p (arkusz USD)$0,20 za sekundę$6,00
Wan 3.0, 720p (arkusz RMB)¥0,6 za sekundę¥18
Trzyetapowy łańcuch, jeden przebiegscenariusz + klatka + render $0,1/sokoło $1,20 za 10s
Trzyetapowy łańcuch, 3 próbyscenariusz ponownie użyty, klatka i render powtórzoneokoło $3,50

Dwa opublikowane arkusze cenowe Wan 3.0 są sprzeczne co do tego, czy 1080p kosztuje ¥1,2 czy $0,20 za sekundę, co nie jest tą samą liczbą. Sprawdź stawkę w punkcie końcowym, względem którego faktycznie jesteś rozliczany, zanim zaplanujesz serię.

Ukryty koszt to nie stawka za sekundę. To ponowne uruchomienie. Wejście dokumentu przyjmuje jeden plik na zadanie, więc zmiana pojedynczej liczby oznacza regenerację całego wideo. W trzyetapowym łańcuchu scenariusz ujęć jest wielokrotnego użytku artefaktem tekstowym, więc zmiana liczby kosztuje jeden render zamiast jednego pełnego zadania. W cyklu raportowania kwartalnego ta różnica przyćmiewa cenę za sekundę.

Jedna uwaga prawna, zanim cokolwiek prześlesz. Dokument wysłany do hostowanego modelu to dokument, który opuszcza twój budynek, a wewnętrzne prezentacje i nieopublikowane dane finansowe zwykle mają politykę dotyczącą tego. Sprawdź ją, zanim nadejdzie presja terminu, a nie po. I każdy oficjalny klip demo w tym artykule należy do Alibaba, cytowany tutaj jako materiał publicznej bety; nic tutaj nie jest licencją na ich komercyjne wykorzystanie.

Wan 3.0 Document to Video FAQ

Jakie typy plików akceptuje Wan 3.0 dokument do wideo i jak duże mogą być?

doc, xls, ppt, pdf, txt i md, z key, pages i numbers również zgłaszane, plus zwykły link internetowy zamiast pliku. Jeden plik lub jeden link na zadanie, do 100 MB lub 50 stron.

Czy Wan 3.0 przekształca każdy slajd w scenę?

Nie, i to jest najczęstsze nieporozumienie. Czyta cały dokument, a następnie reżyseruje wideo z tego, czego się nauczył. Przy limicie to 50 stron w 30 sekund, czyli 0,6 sekundy na stronę, więc tworzy zwiastun, a nie przerzucanie stron. Zarówno oficjalne przypadki użycia, jak i niezależne testy wskazują ten sam kierunek.

Czy liczby z mojego arkusza kalkulacyjnego są dokładne w wideo?

Wartości komórek utrzymały się w każdym przypadku, który sprawdziłem, w tym $1,580, $3,460 i +45,7% w oficjalnym demo. To, co zawodzi, to elementy wykresu: legendy się łączą, znaczniki osi są nieliniowe, a separatory tysięcy giną. Wprowadź każdą liczbę jako dosłowny cytat i zaprojektuj legendy i etykiety znaczników całkowicie poza briefem.

Czy mogę używać Wan 3.0 dokument do wideo przez API dzisiaj?

Tylko przez własne kanały Alibaba, obecnie na zaproszenie, a wagi nie są opublikowane. Wan 2.2 pozostaje ostatnią wersją z otwartymi wagami w linii. Dopóki to się nie zmieni, trzyetapowy łańcuch powyżej jest praktycznym substytutem.

Ile kosztuje 30-sekundowe wideo Wan 3.0?

Przy opublikowanej stawce 1080p to ¥36, czyli $6,00 w arkuszu międzynarodowym, za jeden 30-sekundowy klip. Zaplanuj budżet na ponowne uruchomienia, a nie na pojedynczy przebieg, ponieważ korekta jednej liczby oznacza regenerację całości.

Co jest najbliższe Wan 3.0 dokument do wideo, co mogę uruchomić teraz?

Model z długim kontekstem do napisania scenariusza ujęć, a następnie Wan 2.7 za $0,1 na sekundę dla renderowania, z MiniMax H3 za tę samą stawkę lub Seedance 2.5 za $0,134 na sekundę jako alternatywy. Otrzymujesz wygląd wygenerowanego materiału i tekst dokładny co do klatki. Czego nie dostajesz: 30 sekund w jednym ciągłym ujęciu, dźwięku w tym samym przebiegu co renderowanie obraz-do-wideo ani modelu, który czyta za ciebie .pptx.

Szczere podsumowanie: Wan 3.0 dokument do wideo to realna możliwość z realnym limitem, a różnica między jego wyjściem a twoim jest mniejsza, niż się wydaje, o ile przestaniesz prosić którykolwiek z nich o narysowanie legendy.

Najnowsze modele

Jedno API do całej multimedialnej AI.

Przeglądaj wszystkie modele