Wrzuć jeden arkusz kalkulacyjny. Otrzymaj z powrotem 23-sekundową animację biznesową z muzyką.
To jest obietnica Wan 3.0 document to video, pierwszego natywnego wejścia dokumentu w rodzinie, a oficjalne demo realizuje ją dosłowniej, niż się spodziewałem. Liczby się zgadzają. 1580 $ rośnie do 3460 $, odznaka wskazuje +45,7%, a te wartości prowadzą prosto do konkretnych komórek w źródłowym arkuszu.
Następnie przeciągnąłem wskaźnik czasu do 12. sekundy i odczytałem legendę wykresu.
„Southeasta North America”.
Dwa regiony sprzedaży zgniecione w jedno słowo, które nie istnieje. To jest prawdziwa linia wodna dokumentu do wideo w 2026 roku: model faktycznie przeczytał twoją tabelę, ale wciąż nie potrafi narysować twojego wykresu. Poniżej znajduje się audyt klatka po klatce, którego nikt inny nie opublikował, plus trzyetapowy łańcuch, który możesz uruchomić jeszcze dziś po południu.
Kluczowe wnioski
- Wan 3.0 akceptuje 1 plik lub 1 link, do 100 MB lub 50 stron, i generuje do 30 sekund w 1080p.
- Tworzy film z twojego dokumentu. Nie przekształca slajdu 3 w ujęcie 3.
- Wartości komórek pozostają nienaruszone. Legendy wykresów, znaczniki osi i separatory tysięcy – nie.
- Limity są twarde: brak 4K, brak otwartych wag, tylko kanały własne.
- Model z długim kontekstem plus 15-sekundowy model wideo odtwarzają większość tego dzisiaj.

Wynik Wan 3.0 dokument do wideo: oficjalne demo xlsx wyrenderowane jako animowany film danych w stylu Keynote
Pokaz: oficjalne demo publicznej bety Wan 3.0 od Alibaba, jeden .xlsx z miesięcznym GMV w środku, 23 sekundy animowanego filmu danych na wyjściu. Pokazane jako cichy GIF; dostarczony plik zawiera ścieżkę stereo AAC 44,1 kHz. Źródło: oficjalny podręcznik twórcy Wan 3.0 od Alibaba.
Co właściwie robi Wan 3.0 Document to Video
Krótka wersja, żebyś mógł wyjść za minutę, jeśli to wszystko, czego potrzebujesz.
Podajesz mu jeden dokument lub jeden link internetowy. Czyta całość, decyduje, jaka jest historia, i generuje wideo z obrazem i dźwiękiem w jednym przebiegu. Maksymalnie 30 sekund, maksymalnie 1080p. Nie przechodzi przez strony po kolei.
Oto limity, które faktycznie rządzą projektem.
| Specyfikacja | Wejście dokumentu Wan 3.0 |
|---|---|
| Formaty | doc, xls, ppt, pdf, txt, md, plus key / pages / numbers i zwykły link internetowy |
| Wejścia na zadanie | 1 plik lub 1 link (nie oba, nie kilka) |
| Limit rozmiaru | 100 MB |
| Limit stron | 50 stron |
| Maks. wyjście | 30 sekund, pojedynczy ciągły przebieg |
| Maks. rozdzielczość | 1080p (brak poziomu 4K) |
| Audio | generowane w tym samym przebiegu co obraz |
| Otwarte wagi | brak; Wan 2.2 jest wciąż ostatnią wersją z otwartymi wagami |
| Gdzie zdobyć | Alibaba Cloud Model Studio (Bailian) i Qwen Cloud, dostęp na zaproszenie |
Publiczna beta rozpoczęła się 6 sierpnia 2026 (AgentUpdate, sierpień 2026). Lista formatów i dwa opublikowane arkusze cenowe pochodzą z osobnego zestawienia specyfikacji (Ngram, sierpień 2026).
Oficjalny podręcznik dostarcza cztery przypadki użycia dokumentów i idealnie pasują do czterech zadań, za które ludzie już płacą agencjom:
- Dokument ofertowy w film marki. Dokument przedstawiający pielęgnację skóry staje się 30-sekundową reklamą z główną aktorką i historią w porannym świetle.
- Materiał kursowy w lekcję wideo. Wpis encyklopedyczny staje się animowaną lekcją dla pierwszoklasistów.
- Arkusz kalkulacyjny w animowane wykresy. Powyższe demo i zdecydowanie najtrudniejszy z czterech.
- Raport w mówione podsumowanie. Pisemny raport staje się briefingiem w stylu prezentera.
Teraz tutaj większość artykułów myli kategorię.
Obecni gracze w „PDF do wideo” nie robią tego. Kapwing's document-to-video wyciąga tekst z twojego pliku i układa go na osi czasu, bez budowania scen i bez prezentera. Pictory i Powtoon montują stockowe materiały lub animacje szablonowe, a strony produktowe Powtoon reklamują awatary AI i głosy czytające twój skrypt. Wszystkie trzy produkują narrację slajdów.
| Wan 3.0 | Kapwing Document to Video | Pictory | Powtoon Anything-to-Video | |
|---|---|---|---|---|
| Co wychodzi | wygenerowany film | twój tekst na osi czasu | stockowe materiały do skryptu | animacja szablonowa |
| Tworzy nowe obrazy | tak, każda klatka | nie | nie, klipy z biblioteki | nie, zasoby szablonu |
| Prezenter AI | domyślnie brak | brak | opcjonalny głos | awatary i głosy |
| Audio | generowane z obrazem | dodajesz je | lektor TTS | lektor TTS |
| Najdłuższe pojedyncze wyjście | 30s | długość projektu | długość projektu | długość projektu |
| Dostępność | tylko na zaproszenie, własne kanały | publiczny | publiczny | publiczny |
Przeczytaj tę tabelę dwa razy, bo to cały argument: to nie są konkurenci w tej samej kategorii. Jeden robi narrację slajdów. Drugi tworzy materiał, który nigdy nie istniał. Porównywanie ich pod względem ceny za minutę jest jak porównywanie kserokopiarki z ekipą filmową.
Czy Wan 3.0 też może zrobić to pokaz slajdów? Tak, i to jest szczere zastrzeżenie.
Kontrprzykład: poproszony o przekształcenie strony internetowej o mechanice kwantowej w zabawny materiał wyjaśniający, Wan 3.0 wyprodukował dokładnie format prezentera plus podpis, który sprzedają obecni gracze. Uderza w ścianę 30 sekund przy 30,02 s. Oficjalne demo publicznej bety Alibaba, z dźwiękiem.
Zatem różnica nie polega na tym, że Wan 3.0 nie może tworzyć wyjaśnień z mówiącą głową. Chodzi o to, że u obecnych graczy ten format jest jedyną opcją w menu.
Dlaczego Wan 3.0 Document to Video psuje wykresy, ale zachowuje twoje liczby
Oto najważniejsza rzecz w tym artykule: wyciągnąłem 12 równomiernie rozmieszczonych klatek z oficjalnego dema arkusza kalkulacyjnego i odczytałem każdy glif.
Werdykt dzieli się wyraźnie na dwie części. Wartości przechodzą. Elementy wykresu zawodzą.
Co przetrwało. W 4. sekundzie klatka pokazuje $1,580, cienką szarą strzałkę, $3,460, podpis „Monthly GMV Growth” i koralową odznakę z napisem +45,7%. Typografia jest czysta, przecinki są we właściwych miejscach, bez zniekształconych znaków. Prompt stojący za tym demem odwołuje się do konkretnych komórek arkusza, a liczby na ekranie są z nimi zgodne. Test strony trzeciej na 8-stronicowej prezentacji produktu wykazał to samo: 45 g, 12 godzin i 55 stopni – wszystko wyrenderowane poprawnie, a końcowe hasło pojawiło się bez ani jednego błędnego znaku (AI-Driven Lab, sierpień 2026).
To odpowiada na pytanie, które faktycznie interesuje zespoły finansowe i L&D. Twoje liczby nie mutują po cichu.
Co się zepsuło. Klatki wykresów to inna historia.

Audyt klatki Wan 3.0 dokument do wideo pokazujący połączoną legendę wykresu i uszkodzoną oś Y
Zatrzymane w 12. sekundzie oficjalnego dema. Trzy defekty w jednej klatce: dwie nazwy regionów połączone w „Southeasta North America”, „North America” następnie powtórzone jako osobna seria, oraz oś Y z wartościami 30, 60, 70, podczas gdy górna etykieta danych mówi $3,880.
Policz błędy w tej jednej klatce:
- Połączona legenda. „Southeast Asia” i „North America” zderzają się w „Southeasta North America”. Następnie „North America” pojawia się ponownie jako osobna seria, więc jeden region jest oznaczony dwukrotnie, a jeden zniknął.
- Oś Y, która nie jest skalą. Znaczniki pokazują 30, 60, 70. Równe odstępy pikseli, nierówne wartości, a 40 i 50 po prostu brakuje.
- Oś i etykiety w różnych jednostkach. Najwyższa linia siatki to 70. Etykieta przypięta do górnego punktu danych mówi $3,880.
- Dryf wielkości wzdłuż jednej linii. Etykiety na górnej krzywej zaczynają się od $330 i $335, po czym lądują na $3,970 i $3,880. Płynnie rosnąca linia nie może mieć dziesięciokrotnego skoku między dwoma sąsiednimi punktami. Dwie etykiety pomiędzy są rozmazane poza czytelność, co samo w sobie jest odpowiedzią.
Segment wykresu słupkowego powtarza wzór. Cztery słupki mają wartości $1750, $1,580, $2,350 i $2,580, więc najkrótszy słupek ma drugą najwyższą liczbę, a pierwsza etykieta traci separator tysięcy, podczas gdy pozostałe trzy go zachowują. Obok nich znajduje się pięć zielonych wartości wzrostu dla czterech słupków. A segment pierścienia koncentruje się na $89,7M, przecinku w miejscu, gdzie powinien być separator dziesiętny.
Zauważ, co wszystkie te błędy mają wspólnego. Żaden nie jest błędem treści. Każdy jest błędem rysowania: układ, etykietowanie, skala, interpunkcja. Model zrozumiał arkusz, a następnie wyrenderował wykres tak, jak model wideo renderuje dowolny gęsty tekst – w przybliżeniu.
Istnieje drugi, strukturalny powód, dla którego wynik nie wygląda jak twoja prezentacja.
Wykonaj arytmetykę. 50 stron to limit stron, 30 sekund to limit czasu. To 0,6 sekundy na stronę.
Nie możesz zaprezentować strony w 0,6 sekundy, więc model robi jedyną rozsądną rzecz i tworzy zwiastun. Test prezentacji strony trzeciej doszedł do tego samego wniosku niezależnie: potraktował prezentację jako materiał źródłowy do filmu reklamowego, a nie jako slajdy do przewijania. Ramki okularów produktu dryfowały od grubych do bezramkowych do trzeciego kształtu w różnych ujęciach.
Dlatego też limit 30 sekund jest ograniczeniem projektowym, a nie przypisem w specyfikacji.
Zmierzyliśmy dostarczone pliki: cztery oficjalne dema dokumentów lądują odpowiednio na 30,04s, 30,02s, 25,03s i 23,04s. Dwa 30-sekundowe klipy zatrzymują się w ciągu czterech setnych sekundy od siebie. A demo arkusza kalkulacyjnego prosiło o 22 sekundy, a dostarczyło 23,04. Rozebraliśmy ten limit na części w podglądzie Wan 3.0.
A więc: oczekiwania skalibrowane. Wrzuć dokument, zdobądź zwiastun, trzymaj wykresy prosto.
Przepływ pracy Dokument do Wideo, który możesz uruchomić dzisiaj
Szybkie sprawdzenie rzeczywistości przed samouczkiem, bo oszczędza godzinę szukania.
Wejście dokumentu Wan 3.0 istnieje tylko na własnych kanałach Alibaba, dostęp jest na zaproszenie, a wagi nie są opublikowane. Nikt poza tymi kanałami nie może go zaoferować, włączając nas. To, co możesz zrobić dzisiaj, to odtworzyć użyteczną połowę tego dema xlsx za pomocą modeli, które są już otwarte dla biznesu, a audyt klatek powyżej mówi ci dokładnie, jak ominąć część, która się psuje.
Trzy kroki, jedna karta przeglądarki w Atlas Cloud:
- Model z milionem tokenów czyta dokument i pisze scenariusz ujęć z czasem, z każdą liczbą wbudowaną jako dosłowny ciąg znaków.
- Model obrazu renderuje pierwszą klatkę, w której blokowana jest cała dokładność tekstu.
- Model wideo animuje tę klatkę zgodnie ze scenariuszem.
| Krok | Model | Cena katalogowa | Maks. czas trwania | Dlaczego tutaj |
|---|---|---|---|---|
| 1. Scenariusz | Qwen3.8 Max (/models/qwen/qwen3.8-max) | $2 wejście / $6 wyjście na 1M tokenów | n/d | 1M kontekstu połyka całą prezentację |
| 2. Pierwsza klatka | GPT Image 2 Text-to-Image | $0,009 za obraz (podstawa) | n/d | najsilniejsze renderowanie tekstu dla cyfr na ekranie |
| 3. Renderowanie | Wan 2.7 Image-to-Video | $0,1 na sekundę | 15s | kontrola pierwszej klatki utrzymuje stabilną typografię |
| Opcja audio | Wan 2.7 Text-to-Video | $0,1 na sekundę | 15s | generuje muzykę i efekty dźwiękowe w tym samym przebiegu, ale nie przyjmuje pierwszej klatki |
| Zamiana dla kroku 3 | MiniMax H3 Text-to-Video | $0,1 na sekundę | 15s | ta sama stawka, inny charakter ruchu |
| Zamiana dla kroku 3 | Seedance 2.5 Text-to-Video | $0,134 na sekundę | 30s | jedyny tutaj, który osiąga 30s w jednym przebiegu |
Trzy uczciwe ograniczenia tego łańcucha. Nie zjada pliku binarnego .pptx, więc sam wklejasz tekst lub CSV. Wan 2.7 kończy na 15 sekundach, więc pojedyncze 30-sekundowe ujęcie nie wchodzi w grę. A ścieżka obraz-do-wideo jest domyślnie cicha: jej parametr audio przyjmuje ścieżkę dostarczoną przez ciebie w celu synchronizacji ruchu warg, nie wymyśla ścieżki dźwiękowej. Jeśli chcesz, aby audio zostało wygenerowane w tym samym przebiegu, używasz rodzeństwa tekst-do-wideo i rezygnujesz z kontroli pierwszej klatki, co w przypadku wideo pełnego kwot dolarowych jest złym kompromisem. Ceny zweryfikowane na stronach modeli 20 sierpnia 2026, i pamiętaj, że cena katalogowa to podstawa: poziomy jakości i rozdzielczości podnoszą rzeczywistą cenę, więc przeczytaj przycisk Uruchom przed zatwierdzeniem.
Zbudujmy to.
Krok 1: Przekształć swój arkusz kalkulacyjny w scenariusz ujęć z czasem
Modele wideo nie pamiętają liczb. Renderują dowolny ciąg znaków, który im podasz. Zatem zadaniem tego kroku jest przekształcenie tabeli w kierunki ujęć, w których każda wartość jest już zapisana jako tekst w cudzysłowie.
Wklej swój arkusz między znacznikami <<<. Ustawienia: temperatura 0,3, max_tokens 4000. Trzymaj max_tokens hojnie, ponieważ model zdolny do rozumowania, który wyczerpie budżet w trakcie myślenia, zwróci pustą odpowiedź, za którą i tak zapłacisz.
text1Jesteś reżyserem motion-graphics. Poniżej znajduje się surowy eksport arkusza kalkulacyjnego. 2 3<<< 4Miesiąc,Ameryka Północna,Azja Południowo-Wschodnia,Europa,Całkowity GMV 5Sty,1580,880,640,3100 6Lut,2110,1240,900,4250 7Mar,2740,1610,1150,5500 8Kwi,3120,1980,1330,6430 9Maj,3350,2240,1460,7050 10Cze,3460,2480,1580,7520 11Wzrost H1,+45,7%,,, 12>>> 13 14Napisz scenariusz ujęć dla 10-sekundowego, 16:9, w stylu Apple Keynote 15biznesowego wideo danych. Zasady: 161. Dokładnie 2 ujęcia. Podaj każdemu czas wejścia/wyjścia (00:00-00:05, 17 00:05-00:10). 182. Każda liczba pojawiająca się na ekranie musi być zapisana w opisie 19 ujęcia jako dokładny dosłowny ciąg znaków, np. „$1,580”. 20 Nigdy nie pisz „wartość ze stycznia” – napisz cyfry. 213. NIE proś o legendę, oś z etykietami znaczników ani więcej niż 22 dwie serie danych na ekranie jednocześnie. Używaj dużych samodzielnych 23 liczb i jednej koralowej odznaki w kształcie pigułki. 244. Czyste białe tło, paleta miękki koral + głęboka szarość, bezszeryfowa. 255. Zakończ jedną linią kierunku BGM + SFX (whoosh przy wjeździe, 26 jeden dzwonek na odznace). 27Wypisz tylko scenariusz, bez komentarza. 28
Zasada 3 to korzyść z audytu. Oficjalne wyjście zepsuło się dokładnie na trzech rzeczach: legendach, znacznikach osi i wykresach wieloserii. Więc usuwamy wszystkie trzy z briefu i wykorzystujemy tę przestrzeń ekranową na ogromne liczby i kolorową odznakę. Ta sama informacja, żadnej powierzchni awarii.
Zasada 2 to ta, którą ludzie pomijają, i to jest powód, dla którego cyfry przetrwają do końca tego łańcucha. Opis ujęcia, który mówi „wartość ze stycznia” oddaje liczbę z powrotem do modelu, który musi wymyślić dla niej glify. Opis ujęcia, który mówi „$1,580” w cudzysłowie daje następnym dwóm krokom ciąg znaków do skopiowania. Nie prosisz tutaj o wizualizację danych, prosisz o instrukcję pisania na klawiaturze.
To, co wraca, to dwuujęciowy scenariusz z czasami wejścia i wyjścia, każda liczba na ekranie cytowana jako dosłowna, i zamykająca linia BGM i SFX. Zachowaj go w pliku roboczym; kroki 2 i 3 oba z niego czytają.
Krok 2: Wygeneruj pierwszą klatkę marki
Każdy znak tekstu na ekranie jest tutaj decydowany. Model obrazu w wysokiej jakości renderuje $1,580 poprawnie znacznie bardziej niezawodnie niż model wideo może to napisać, jednocześnie go poruszając, więc ustalamy typografię w nieruchomym obrazie i pozwalamy krokowi 3 tylko przesuwać piksele.
Otwórz GPT Image 2 i ustaw jakość na wysoką i rozmiar na opcję 16:9, która na tej stronie to 2048x1152. Dopasuj proporcje do wideo, które zamierzasz zrobić, w przeciwnym razie krok 3 zacznie od przycinania twojej typografii.
text1Dziewicza ramka prezentacji w stylu Apple Keynote na czystym białym 2bezszwowym tle, sfotografowana jakby wyświetlana na matowej ścianie 3studia. Wyśrodkowany nagłówek w głębokiej grafitowej geometrycznej 4bezszeryfowej czcionce z napisem „H1 2026”, umieszczony w dużej 5ujemnej przestrzeni. Poniżej dwie ogromne cyfry w tej samej 6czcionce, „$1,580” po lewej i „$3,460” po prawej, oddzielone cienką 7jasnoszarą strzałką. Pod strzałką, mały jasnoszary podpis z tekstem 8„Monthly GMV Growth”. Pod tym, pojedyncza koralowa odznaka w kształcie 9pigułki z białym tekstem „+45,7%”. Miękkie, równomierne rozproszone 10oświetlenie, delikatny ciepły gradient w prawym górnym rogu, subtelna 11tekstura papieru, bez bałaganu, bez logo, bez wykresów. Ultra-czysty 12korporacyjny minimalizm, 16:9. 13
Warte skopiowania są dwa szczegóły. „Bez wykresów” jest tam celowo. I przeczytaj ofertę cenową na przycisku Uruchom, zanim go naciśniesz, ponieważ jakość wysoka na szerokiej klatce 2K kosztuje wielokrotność ceny katalogowej $0,009.

Środowisko pracy GPT Image 2 w Atlas Cloud z promptem pierwszej klatki i wyrenderowaną ramką w stylu Keynote pokazującą każdą liczbę poprawnie zapisaną
GPT Image 2 przy jakości wysokiej, 16:9 w 2048x1152. Każda liczba wylądowała: „H1 2026”, „$1,580”, „$3,460” i koralowa odznaka „+45,7%”, co jest dokładnie powodem, dla którego typografia jest ustalana w nieruchomym obrazie, a nie w modelu wideo.
Krok 3: Renderuj klip dokumentu do wideo i zweryfikuj każdą cyfrę
Ostatni krok. Załaduj obraz z kroku 2 jako pierwszą klatkę i pozwól modelowi wideo go animować, utrzymując typografię w bezruchu.
Otwórz Wan 2.7 Image-to-Video. Ustawienia: przesłana pierwsza klatka, rozdzielczość 1080P, czas trwania 10s. Pozostaw pole audio puste, ponieważ ten model traktuje audio jako wejście sterujące, a nie coś, co tworzy. Sam dodajesz muzykę do tego klipu lub w osobnym przebiegu tekst-do-wideo.
text1Animuj tę klatkę jako 10-sekundowe biznesowe wideo danych w stylu 2Apple Keynote, utrzymując istniejącą typografię w stabilnych pikselach. 3 400:00-00:05 – Nagłówek „H1 2026” pozostaje, a następnie rozpuszcza 5się w złote cząsteczki, które dryfują na zewnątrz. Dwie cyfry 6„$1,580” i „$3,460” wsuwają się z lewej i prawej strony i zatrzaskują 7na miejscu; cienka szara strzałka rysuje się między nimi od lewej do 8prawej. Koralowa odznaka z napisem „+45,7%” wyskakuje z dołu z lekkim 9przestrzeleniem, zsynchronizowana z jednym czystym dźwiękiem dzwonka. 10 1100:05-00:10 – Wszystko płynnie zjeżdża w lewo. Trzy grube zaokrąglone 12słupki rosną w górę ze wspólnej linii bazowej na tym samym czystym 13białym tle, koralowy, morski i bursztynowy, z jedną dużą samodzielną 14cyfrą nad każdym: „$3,460”, „$2,480”, „$1,580”. Żadnej legendy, 15żadnej osi, żadnych etykiet znaczników, żadnych linii siatki. Kamera 16pozostaje zablokowana i idealnie nieruchoma przez cały czas. 17
„Utrzymując istniejącą typografię w stabilnych pikselach” i „kamera pozostaje nieruchoma” robią prawdziwą robotę. Każdy ruch kamery to kolejna szansa dla modelu na przerysowanie tekstu, który powinien pozostawić w spokoju.
Następnie wykonaj nudną, ważną część: zatrzymaj się na każdej klatce, w której pojawia się liczba, i porównaj ją z wierszem źródłowym. To jest 30-sekundowe sprawdzenie i jedyna rzecz, która stoi między tobą a wideo, które pewnie pokazuje błędną wartość przychodu.

Środowisko pracy Wan 2.7 Image-to-Video w Atlas Cloud z załadowaną pierwszą klatką i wyrenderowanym klipem danych
Wan 2.7 Image-to-Video w 1080P z przesłaną pierwszą klatką z kroku 2 i ukończonym klipem w panelu wyjściowym. Warto zauważyć, co mówi panel: prosiliśmy o 10 sekund, pole czasu trwania pokazało 10, a renderowanie zwróciło 5. Wycena Uruchom powiedziała nam o tym, zanim plik to zrobił, co jest całym powodem, aby ją przeczytać.

Ukończony klip danych odtworzony z tego samego arkusza GMV, każda liczba nienaruszona
Efekt: ten sam arkusz kalkulacyjny, odtworzony z legendami i znacznikami osi celowo zaprojektowanymi poza nim. Model skompresował oba zapisane ujęcia w pięć sekund, które faktycznie wyrenderował, a każda liczba przetrwała ruch: „$1,580” i „$3,460” w otwarciu, a następnie „$3,460”, „$2,480” i „$1,580” nad trzema słupkami. Żadnych zniekształconych etykiet, ponieważ nie było żadnych etykiet do zniekształcenia. Cichy zgodnie z projektem, ponieważ ścieżka obraz-do-wideo nie generuje dla ciebie żadnego dźwięku.
Warianty dokumentu do wideo i koszt gotowej minuty
Przypadek arkusza kalkulacyjnego jest najtrudniejszy. Pozostałe trzy oficjalne przypadki użycia są łatwiejsze i tam leży większość wartości komercyjnej.
Materiały kursowe. Wrzuć wpis encyklopedyczny i poproś o lekcję na określonym poziomie czytania. Poniższe wyjście to animowana lekcja w stylu chibi o poecie Wang Wei, 25,03 sekundy długości.
Styl rysowania utrzymuje się przez cały czas. Szczegóły postaci nie. W 3. sekundzie nosi czarną czapkę na jednolitym białym tle; do 22. sekundy czapka zmieniła kolor na jasnoniebieski, a on stoi wewnątrz klasycznego malowidła zwojowego. Ten sam dryf, który tester prezentacji widział w tych ramkach okularów. Jeśli odtwarzasz to w trzyetapowym łańcuchu, zablokuj kartę postaci w kroku 1 i użyj ponownie klatki z kroku 2 jako kotwicy stylu.
Wpis encyklopedyczny w animowaną lekcję dla pierwszej klasy, 25,03s z wygenerowanym dźwiękiem. Oficjalne demo publicznej bety Wan 3.0 od Alibaba.
Filmy marki. Dokument propozycji staje się pełnym 30-sekundowym spotem. To najładniejsze z czterech dem i najmniej weryfikowalne, ponieważ nie widać, co mówił źródłowy dokument. Uważaj na spójność, a nie na urodę: to jest tryb awarii, który złapał testera zewnętrznego, którego produkt zmienił kształt trzy razy w jednym klipie.
Dokument propozycji w 30,04s film marki pielęgnacji skóry. Oficjalne demo publicznej bety Wan 3.0 od Alibaba, z dźwiękiem.
Podsumowania raportów. Nie istnieje oficjalne demo dla tego przypadku, więc traktuj wzór jako nieprzetestowany: poproś o jednego prezentera, jedno twierdzenie na ujęcie i umieść każdą liczbę w cudzysłowie dokładnie tak, jak w kroku 1.
A teraz pieniądze.
| Co | Stawka | 30 sekund gotowego wideo |
|---|---|---|
| Wan 3.0, 1080p (arkusz RMB) | ¥1,2 za sekundę | ¥36 |
| Wan 3.0, 1080p (arkusz USD) | $0,20 za sekundę | $6,00 |
| Wan 3.0, 720p (arkusz RMB) | ¥0,6 za sekundę | ¥18 |
| Trzyetapowy łańcuch, jeden przebieg | scenariusz + klatka + render $0,1/s | około $1,20 za 10s |
| Trzyetapowy łańcuch, 3 próby | scenariusz ponownie użyty, klatka i render powtórzone | około $3,50 |
Dwa opublikowane arkusze cenowe Wan 3.0 są sprzeczne co do tego, czy 1080p kosztuje ¥1,2 czy $0,20 za sekundę, co nie jest tą samą liczbą. Sprawdź stawkę w punkcie końcowym, względem którego faktycznie jesteś rozliczany, zanim zaplanujesz serię.
Ukryty koszt to nie stawka za sekundę. To ponowne uruchomienie. Wejście dokumentu przyjmuje jeden plik na zadanie, więc zmiana pojedynczej liczby oznacza regenerację całego wideo. W trzyetapowym łańcuchu scenariusz ujęć jest wielokrotnego użytku artefaktem tekstowym, więc zmiana liczby kosztuje jeden render zamiast jednego pełnego zadania. W cyklu raportowania kwartalnego ta różnica przyćmiewa cenę za sekundę.
Jedna uwaga prawna, zanim cokolwiek prześlesz. Dokument wysłany do hostowanego modelu to dokument, który opuszcza twój budynek, a wewnętrzne prezentacje i nieopublikowane dane finansowe zwykle mają politykę dotyczącą tego. Sprawdź ją, zanim nadejdzie presja terminu, a nie po. I każdy oficjalny klip demo w tym artykule należy do Alibaba, cytowany tutaj jako materiał publicznej bety; nic tutaj nie jest licencją na ich komercyjne wykorzystanie.
Wan 3.0 Document to Video FAQ
Jakie typy plików akceptuje Wan 3.0 dokument do wideo i jak duże mogą być?
doc, xls, ppt, pdf, txt i md, z key, pages i numbers również zgłaszane, plus zwykły link internetowy zamiast pliku. Jeden plik lub jeden link na zadanie, do 100 MB lub 50 stron.
Czy Wan 3.0 przekształca każdy slajd w scenę?
Nie, i to jest najczęstsze nieporozumienie. Czyta cały dokument, a następnie reżyseruje wideo z tego, czego się nauczył. Przy limicie to 50 stron w 30 sekund, czyli 0,6 sekundy na stronę, więc tworzy zwiastun, a nie przerzucanie stron. Zarówno oficjalne przypadki użycia, jak i niezależne testy wskazują ten sam kierunek.
Czy liczby z mojego arkusza kalkulacyjnego są dokładne w wideo?
Wartości komórek utrzymały się w każdym przypadku, który sprawdziłem, w tym $1,580, $3,460 i +45,7% w oficjalnym demo. To, co zawodzi, to elementy wykresu: legendy się łączą, znaczniki osi są nieliniowe, a separatory tysięcy giną. Wprowadź każdą liczbę jako dosłowny cytat i zaprojektuj legendy i etykiety znaczników całkowicie poza briefem.
Czy mogę używać Wan 3.0 dokument do wideo przez API dzisiaj?
Tylko przez własne kanały Alibaba, obecnie na zaproszenie, a wagi nie są opublikowane. Wan 2.2 pozostaje ostatnią wersją z otwartymi wagami w linii. Dopóki to się nie zmieni, trzyetapowy łańcuch powyżej jest praktycznym substytutem.
Ile kosztuje 30-sekundowe wideo Wan 3.0?
Przy opublikowanej stawce 1080p to ¥36, czyli $6,00 w arkuszu międzynarodowym, za jeden 30-sekundowy klip. Zaplanuj budżet na ponowne uruchomienia, a nie na pojedynczy przebieg, ponieważ korekta jednej liczby oznacza regenerację całości.
Co jest najbliższe Wan 3.0 dokument do wideo, co mogę uruchomić teraz?
Model z długim kontekstem do napisania scenariusza ujęć, a następnie Wan 2.7 za $0,1 na sekundę dla renderowania, z MiniMax H3 za tę samą stawkę lub Seedance 2.5 za $0,134 na sekundę jako alternatywy. Otrzymujesz wygląd wygenerowanego materiału i tekst dokładny co do klatki. Czego nie dostajesz: 30 sekund w jednym ciągłym ujęciu, dźwięku w tym samym przebiegu co renderowanie obraz-do-wideo ani modelu, który czyta za ciebie .pptx.
Szczere podsumowanie: Wan 3.0 dokument do wideo to realna możliwość z realnym limitem, a różnica między jego wyjściem a twoim jest mniejsza, niż się wydaje, o ile przestaniesz prosić którykolwiek z nich o narysowanie legendy.






