스프레드시트 하나를 업로드하면 23초짜리 음악이 포함된 비즈니스 애니메이션을 돌려받는다.
이것이 Wan 3.0 문서-투-비디오의 약속이며, 이 계열 최초의 네이티브 문서 입력 기능이다. 공식 데모는 내 예상보다 더 문자 그대로 그 약속을 이행한다. 숫자는 정확하다. $1,580이 $3,460으로 증가하고, 배지는 +45.7%를 표시하며, 이 수치는 원본 시트의 특정 셀에서 직접 추적된다.
그런 다음 플레이헤드를 12초 지점으로 드래그하여 차트 범례를 읽었다.
"남동북아메리카(Southeasta North America)."
존재하지 않는 단어로 합쳐진 두 판매 지역. 이것이 2026년 문서-투-비디오의 실제 수위다: 모델이 실제로 테이블을 읽었지만 여전히 차트를 그리지 못한다. 아래는 아무도 공개하지 않은 프레임별 감사 결과와 오늘 오후에 직접 실행할 수 있는 3단계 체인이다.
핵심 요점
- Wan 3.0은 최대 100MB 또는 50페이지까지 1개 파일 또는 1개 링크를 허용하며, 최대 30초, 1080p를 출력한다.
- 문서에서 영화를 재연출한다. 슬라이드 3을 장면 3으로 바꾸지 않는다.
- 셀 값은 그대로 유지된다. 차트 범례, 축 눈금, 천 단위 구분 기호는 그렇지 않다.
- 명확한 한계가 있다: 4K 없음, 오픈 웨이트 없음, 퍼스트파티 채널만 가능.
- 긴 컨텍스트 모델과 15초 비디오 모델을 결합하면 오늘날 대부분을 재현할 수 있다.

Wan 3.0 문서-투-비디오 출력: 공식 xlsx 데모가 Keynote 스타일 애니메이션 데이터 영화로 렌더링됨
쇼케이스: 알리바바의 공식 Wan 3.0 공개 베타 데모, 월간 GMV .xlsx 하나를 입력으로 23초 애니메이션 데이터 영화 출력. 무음 GIF로 표시됨; 전달된 파일에는 44.1kHz 스테레오 AAC 트랙이 포함됨. 출처: 알리바바 공식 Wan 3.0 크리에이터 핸드북.
Wan 3.0 문서-투-비디오가 실제로 하는 일
짧게 요약하면, 그것만 필요하다면 1분 안에 나갈 수 있다.
문서 하나 또는 웹 링크 하나를 제공하면 된다. 전체를 읽고 스토리를 결정한 후 동일한 패스에서 그림과 소리를 포함한 비디오를 생성한다. 최대 30초, 최대 1080p. 페이지 순서대로 진행하지 않는다.
다음은 실제 프로젝트를 제한하는 한계치다.
| 스펙 | Wan 3.0 문서 입력 |
|---|---|
| 형식 | doc, xls, ppt, pdf, txt, md, 키/페이지/넘버스 및 일반 웹 링크 포함 |
| 작업당 입력 | 1개 파일 또는 1개 링크 (둘 다 또는 여러 개 안 됨) |
| 크기 제한 | 100MB |
| 페이지 제한 | 50페이지 |
| 최대 출력 | 30초, 단일 연속 패스 |
| 최대 해상도 | 1080p (4K 계층 없음) |
| 오디오 | 그림과 동시 생성 |
| 오픈 웨이트 | 없음; Wan 2.2가 여전히 마지막 오픈 웨이트 릴리스 |
| 이용 가능 | 알리바바 클라우드 모델 스튜디오(바이리안) 및 큐웬 클라우드, 초대제 |
공개 베타는 2026년 8월 6일에 시작되었다(AgentUpdate, 2026년 8월). 형식 목록과 두 개의 공개 가격표는 별도의 스펙 요약에서 가져왔다(Ngram, 2026년 8월).
공식 핸드북에는 네 가지 문서 사용 사례가 있으며, 이는 사람들이 이미 대행사에 비용을 지불하는 네 가지 작업과 깔끔하게 매핑된다:
- 제안 문서를 브랜드 영화로. 스킨케어 피치 문서가 주연 여배우와 아침 햇살 스토리가 담긴 30초 광고가 된다.
- 강의 자료를 비디오 레슨으로. 백과사전 항목이 1학년용 애니메이션 수업이 된다.
- 스프레드시트를 애니메이션 차트로. 위의 데모이며, 네 가지 중 가장 어렵다.
- 보고서를 음성 요약으로. 작성된 보고서가 발표자 스타일 브리핑이 된다.
이제 대부분의 글에서 범주를 잘못 지정하는 부분이다.
기존의 "PDF-투-비디오" 제품들은 이렇게 하지 않는다. Kapwing의 문서-투-비디오는 파일에서 텍스트를 추출하여 타임라인에 배치하며, 장면 구성이나 발표자는 없다. Pictory와 Powtoon은 스톡 푸티지나 템플릿 애니메이션을 조합하며, Powtoon의 자체 제품 페이지는 AI 아바타와 스크립트 읽기 음성을 광고한다. 세 가지 모두 내레이션이 있는 슬라이드를 생성한다.
| Wan 3.0 | Kapwing 문서-투-비디오 | Pictory | Powtoon Anything-to-Video | |
|---|---|---|---|---|
| 출력 결과 | 생성된 영화 | 타임라인 위의 텍스트 | 스크립트에 맞춘 스톡 푸티지 | 템플릿 애니메이션 |
| 새로운 이미지 생성 | 예, 모든 프레임 | 아니요 | 아니요, 라이브러리 클립 | 아니요, 템플릿 자산 |
| AI 발표자 | 기본적으로 없음 | 없음 | 선택적 음성 | 아바타 및 음성 |
| 오디오 | 그림과 함께 생성 | 사용자 추가 | TTS 음성오버 | TTS 음성오버 |
| 최장 단일 출력 | 30초 | 프로젝트 길이 | 프로젝트 길이 | 프로젝트 길이 |
| 이용 가능 | 초대제, 퍼스트파티 | 공개 | 공개 | 공개 |
그 표를 두 번 읽어라. 이것이 전체 논쟁이다: 이들은 같은 범주의 경쟁자가 아니다. 하나는 내레이션이 있는 슬라이드쇼를 만든다. 다른 하나는 존재하지 않았던 푸티지를 만든다. 분당 가격으로 비교하는 것은 복사기를 영화 제작진과 비교하는 것과 같다.
Wan 3.0도 슬라이드쇼를 할 수 있느냐? 그렇다, 그리고 그것이 정직한 주의사항이다.
반례: 양자역학에 관한 웹 페이지를 재미있는 설명 영상으로 만들라는 요청에 Wan 3.0은 기존 제품들이 판매하는 발표자+자막 형식을 정확히 생성했다. 30초 장벽에 30.02초에 도달한다. 알리바바 공식 공개 베타 데모, 오디오 켜짐.
따라서 차이점은 Wan 3.0이 발표자 설명 영상을 만들 수 없다는 것이 아니다. 기존 제품에서는 그 형식이 메뉴의 유일한 항목이라는 점이다.
Wan 3.0 문서-투-비디오가 차트는 망가뜨리지만 숫자는 유지하는 이유
여기 이 기사에서 가장 유용한 내용이 있다: 공식 스프레드시트 데모에서 12프레임을 균등하게 추출하여 모든 글리프를 읽었다.
결론은 명확히 둘로 나뉜다. 값은 통과한다. 차트 부속물은 실패한다.
살아남은 것. 4초 지점에서 프레임은 $1,580, 얇은 회색 화살표, $3,460, 캡션 "월간 GMV 성장", 그리고 산호색 배지 +45.7%를 표시한다. 타이포그래피는 깔끔하고, 쉼표는 올바른 위치에 있으며, 깨진 문자는 없다. 이 데모의 프롬프트는 특정 스프레드시트 셀을 인용하며, 화면의 숫자는 일치한다. 8페이지 제품 덱에 대한 타사 테스트에서도 동일한 결과를 보였다: 45g, 12시간, 55도 모두 올바르게 렌더링되었고, 마무리 슬로건은 단 하나의 잘못된 문자 없이 나왔다(AI-Driven Lab, 2026년 8월).
이는 재무 및 L&D 팀이 실제로 관심을 갖는 질문에 답한다. 수치가 조용히 변형되지 않는다.
깨진 것. 차트 프레임은 다른 이야기다.

Wan 3.0 문서-투-비디오 프레임 감사: 병합된 차트 범례와 깨진 Y축
공식 데모 12초 정지. 한 프레임에 세 가지 결함: 두 지역 이름이 "Southeasta North America"로 융합, "North America"가 별도 계열로 반복, Y축이 30, 60, 70을 표시하는 반면 최상단 데이터 레이블은 $3,880.
그 한 프레임에서의 실패를 세어보자:
- 병합된 범례. "Southeast Asia"와 "North America"가 "Southeasta North America"로 충돌한다. 그런 다음 "North America"가 별도 계열로 다시 나타나므로 한 지역이 두 번 레이블 지정되고 하나는 사라진다.
- 눈금이 아닌 Y축. 눈금이 30, 60, 70으로 표시된다. 동일한 픽셀 간격, 동일하지 않은 값, 그리고 40과 50은 그냥 누락되었다.
- 축과 레이블의 단위 불일치. 가장 높은 그리드선이 70이다. 최상단 데이터 포인트에 고정된 레이블은 $3,880이라고 표시한다.
- 한 선을 따른 크기 변동. 해당 상위 곡선의 레이블은 $330과 $335에서 시작하여 $3,970과 $3,880에 도달한다. 매끄러운 상승선은 두 인접 포인트 사이에서 10배 점프를 유지할 수 없다. 그 사이에 있는 두 개의 레이블은 확실한 판독을 초과하여 번져 있으며, 이는 그 자체로 하나의 답변이다.
막대 차트 세그먼트도 패턴을 반복한다. 네 개의 막대에 $1750, $1,580, $2,350 및 $2,580이 표시되므로 가장 짧은 막대가 두 번째로 높은 숫자를 가지며, 첫 번째 레이블은 천 단위 쉼표를 잃고 나머지 세 개는 유지한다. 그 옆에는 네 개의 막대에 대한 다섯 개의 초록색 성장 수치가 있다. 그리고 도넛 세그먼트 중앙에는 $89,7M이 표시되며, 쉼표가 소수점이 있어야 할 자리에 있다.
이 모든 것의 공통점이 무엇인지 주목하라. 내용 오류는 하나도 없다. 모든 것이 그리기 오류이다: 레이아트, 레이블링, 눈금, 문장 부호. 모델은 시트를 이해한 다음, 비디오 모델이 밀도 높은 텍스트를 렌더링하는 방식(대략적으로)으로 차트를 렌더링했다.
출력이 덱의 덱과 전혀 닮지 않은 두 번째 구조적 이유가 있다.
산수를 해보자. 50페이지가 페이지 상한, 30초가 기간 상한이다. 이는 페이지당 0.6초이다.
0.6초만에 페이지를 제시할 수 없으모로 모델은 유일한 합리적 선택으로 트레일러를 만든다. 그 타사 덱 테스트도 독립적으로 동일한 결론에 도달했다: 발표를 슬라이드를 넘기는 것이 아니라 시네마틱 광고의 소스 자료로 취급했다. 제품의 안경테는 샷 간에 두꺼운 것에서 테가 없는 것, 세 번째 모양으로 변화했다.
또한 이것이 30초 제한이 사양서의 각주가 아니라 디자인 제약인 이유이기도 하다.
전달된 파일을 측정했다: 네 개의 공식 문서 데모는 30.04s, 30.02s, 25.03s 및 23.04s에 도달한다. 두 개의 30초 클립은 서로 0.04초 이내로 정확히 멈춘다. 그리고 스프레드시트 데모는 22초를 요청받았지만 23.04초를 전달했다. 우리는 [Wan 3.0 프리�](htts://www.atlascloud.ai/bllg/tis/wan-3.0-preview?utソース=ブログ&utm_mediun=제品布 &utm_campaign=wan-3.0-document-to-video)에서 그 한계를 분해했했다.
따라서: 기대치를 조정하라. 문서를 제공하면 트래일러를 받고, 차트는 단순하게 유지하라.
오늘 실행할 수 있는 문서-투-비디오 워크플로
튜토리알 전 빠른 현실 점검, 한 시간 검색을 덌어주기 위함이다.
Wan 3.0의 문서 입력은 알리바바 자체 채널에만 있으며, 접근은 초대제이고 웨이트는 공개되지 않았다. 해당 채널 밖의 누구도 포함하여 제공할 수 없다. 오늘 할 수 있는 것은 이미 서비스 중인 모델로 그 xlsx 데모의 유용한 절반을 재구성하는 것며, 위의 프레임 감사를 통해 깨지는 부분을 피하는 방법을 정확히 알 수 있다.
Atlas Cloud](https://www.atlascloud.ai/?utm_sorce=blog&utm_medium=article&utm_campaign=wan-3.0-document-to-video)에서 한 브라우저 탭, 세 단ㄹ:
- 백만 토큰 모델이 문서를 읽고 타임코드가 있샷 샷트 스크립트를 작정하며, 모든 숫자 리터럴 문잘로 포함.
- 이미지 모델이 첫 프레임을 렌더링하며, 여기서 모든 텍스트 정확도가 확보됨.
- 비디오 모델이 스크립트에 따라 해당 프레임을 애니메이션화.
| 단계 | 모델 | 나열된 가격 | 최대 기간 | 이유 |
|---|---|---|---|---|
| 1. 스크립트 | Qwen3.8 Max (/mels/qwen/qwen3.8-ax) | $2 입력 / $6 출력 (백만 토큰 당) | n/a | 1M 컨텍스트는 전체 덱을 삼킴 |
| 2. 첫 프레임 | GPT Image 2 텍스트-투-이미지 | $0.009/이미지 (최저가) | n/a | 화면 숫자에 대한 가장 강력한 텍스트 렌더링 |
| 3. 렌더링 | Wan 2.7 이미지-투-비디오 | $0.1/초 | 15s | 첫 프레임 제어가 타이포그라피를 안정화게 유지함 |
| 오디오 옵션 | Wan 2.7 텍스트-투-비디오 | $0.1/초 | 15s | 음악과 SFX를 동시에 생상하지만 첫 프레임을 받지 않음 |
| 3단계 교체 | MiniMax H3 텍스트-투-비디오 | $0.1/초 | 15s | 동일 요음, 다른 모션 특성 |
| 3단계 교체 | Seedance 2.5 텍스트-투-비디오 | $0.134/초 | 30s | 여기서 한 번에 30초에 도달하는 유일한 모델 |
이 체인에 대한 세 가지 정직한 한계. .pptx 바이너리를 먹지 않으므로 텍스트나 CSV를 직접 붙여 넣어야 한다. Wan 2.7은 최대 15초이므로 단일 30초 테이크는 불가능하다. 그리고 이미지-투-비디오 경로는 설계상 무음이다: 해당 audio 매개변수는 립싱크를 구동하기 위해 사용자가 제공하는 트랙을 가져오며, 사운드트랙을 발명하지 않는다. 동일 패스에서 오디오를 생상하려면 텍스트-투-비디오 형제를 사용하고 첫 프레임 제어를 포기해야 하며, 이는 달러 표기가 가득한 비디오에게는 잘못된 트레이다. 가격은 2026년 8월 20일 모델 페이지에서 확인했으며, 나열된 가격은 최저가이다: 품질 및 해상도 티어가 실시간 견적을 높이므로, 실행 버튼을 누르기 전에 읽어보라.
함께 만들어보자.
1단계: 스프레드시트를 타임코드가 있는 샷 스크립트로 변환
비디오 모델은 숫자를 기억하지 못한다. 사용자가 제공하는 문자열을 렌더링할 뿌�이다. 따라서 이 단계의 임무는 테이블을 모든 수치가 인용부로 텍스트로 이미 적혀 있는 샷 방향으로 변환하는 것이다.
시트를 <<< 마커 사이에 붙여넣는다. 설정: 온도 0.3, max_tokens 4000. max_tokens는 넉넉하게 유지하라. 이유를 설명하는 모델이 중간에 예산이 부족하면 여전히 비용을 지불해야 하는 빈 답변을 반환하기 때문이다.
text1You are a motion-graphics director. Below is a raw spreadsheet export. 2 3<<< 4Month,North America,Southeast Asia,Europe,Total GMV 5Jan,1580,880,640,3100 6Feb,2110,1240,900,4250 7Mar,2740,1610,1150,5500 8Apr,3120,1980,1330,6430 9May,3350,2240,1460,7050 10Jun,3460,2480,1580,7520 11H1 growth,+45.7%,,, 12>>> 13 14Write a shot script for a 10-second, 16:9, Apple-Keynote-style 15business data video. Rules: 161. Exactly 2 shots. Give each an in/out timecode (00:00-00:05, 17 00:05-00:10). 182. Every number that appears on screen must be written in the shot 19 description as an exact literal string, in quotes, e.g. "$1,580". 20 Never write "the January figure" - write the digits. 213. Do NOT ask for a legend, an axis with tick labels, or more than 22 two data series on screen at once. Use big standalone numerals 23 and one coral pill-shaped badge instead. 244. Pure white background, soft coral + deep-grey palette, sans-serif. 255. End with one line of BGM + SFX direction (whoosh on slide-in, 26 one bell chime on the badge). 27Output the script only, no commentary. 28
규칙 3은 감사 결과에서 얻은 보상이다. 공식 출력은 정확히 세 가지(범례, 축 눈금, 다중 계열 차트)에서 깨졌다. 따라서 브리핑에서 이 세 가지를 모두 제거하고 대신 그 화면 공간을 대형 숫자와 색상 코드 배지에 사용한다. 동일한 정보, 실패 표면이 없다.
규칙 2는 사람들이 건너뛰는 것이며, 이 체인의 끝까지 숫자가 살아남는 이유다. "1월 수치"라고 말하는 샷 설명은 숫자를 다시 모델에 넘겨 글리프를 발명해야 한다. 인용부로 "$1,580"라고 말하는 샷 설명은 다음 두 단계에 복사할 문자열을 제공한다. 여기서 데이터 시각화를 요청하는 것이 아니라, 타이핑 명령을 요청하는 것이다.
돌아오는 것은 진입/퇴장 타임코드, 인용된 리터럴로 모든 화면상 수치, 그리고 마무리 BGM 및 SFX 라인이 있는 두 개의 샷 스크립트다. 임시 파일에 보관하라; 2단계와 3단계 모두 이 파일을 읽는다.
2단계: 브랜드 첫 프레임 생성
화면상 텍스트의 모든 문자가 여기서 결정된다. 고품질 이미지 모델은 $1,580을 비디오 모델이 동시에 움직이면서 쓰는 것보다 훨씬 더 안정적으로 올바르게 렌더링한다. 따라서 스틸에서 타이포그래피를 확정하고 3단계는 픽셀만 밀어내도록 한다.
GPT Image 2를 열고 품질을 high로, 크기를 16:9 옵션(이 페이지에서는 2048x1152)으로 설정한다. 만들 비디오와 화면 비율을 맞추지 않으면 3단계가 타이포그래피를 자르기 시작한다.
text1A pristine Apple-Keynote-style presentation frame on a pure white 2seamless background, photographed as if projected on a matte studio 3wall. Centered headline in a deep charcoal geometric sans-serif 4reading "H1 2026", set in generous negative space. Below it, two 5oversized numerals in the same typeface, "$1,580" on the left and 6"$3,460" on the right, separated by a thin light-grey arrow. Under 7the arrow, small light-grey caption text reading "Monthly GMV 8Growth". Beneath that, a single coral pill-shaped badge with white 9text reading "+45.7%". Soft even diffused lighting, faint warm 10gradient in the top-right corner, subtle paper grain, no clutter, no 11logos, no charts. Ultra-clean corporate minimalism, 16:9. 12
복사할 가치가 있는 두 가지 세부 사항. "No charts"는 의도적으로 포함되어 있다. 그리고 누르기 전에 실행 버튼의 가격 견적을 읽어라. 고품질의 와이드 2K 프레임은 $0.009 목록 가격의 배수이기 때문이다.

Atlas Cloud의 GPT Image 2 플레이그라운드: 첫 프레임 프롬프트와 모든 숫자가 올바르게 표시된 Keynote 스타일 프레임 렌더링
고품질 GPT Image 2, 16:9 2048x1152. 모든 수치가 정확히 표시됨: "H1 2026", "$1,580", "$3,460" 및 산호색 "+45.7%" 배지. 이것이 바로 타이포그래피를 비디오 모델이 아닌 스틸에서 확정하는 이유다.
3단계: 문서-투-비디오 클립 렌더링 및 모든 숫자 확인
마지막 단계. 2단계 이미지를 첫 프레임으로 로드하고, 비디오 모델이 타이포그래피를 고정한 상태로 애니메이트하게 한다.
Wan 2.7 Image-to-Video를 연다. 설정: 첫 프레임 업로드, 해상도 1080P, 지속 시간 10s. 오디오 필드는 비워둔다. 이 모델은 오디오를 생성하는 것이 아니라 구동 입력으로 취급하기 때문이다. 이 클립은 직접 채점하거나 별도의 텍스트-투-비디오 패스에서 채점한다.
text1Animate this frame as a 10-second Apple-Keynote-style business data 2video, holding the existing typography pixel-stable. 3 400:00-00:05 - The headline "H1 2026" holds, then dissolves into 5golden particles that drift outward. The two numerals "$1,580" and 6"$3,460" slide in from left and right and lock into place; the thin 7grey arrow draws itself between them left to right. The coral badge 8reading "+45.7%" pops up from below with a slight overshoot, timed 9to a single clear bell chime. 10 1100:05-00:10 - Everything slides smoothly off to the left. Three 12thick rounded bars grow upward from a shared baseline against the 13same pure white background, coral, teal and amber, with one large 14standalone numeral above each: "$3,460", "$2,480", "$1,580". No 15legend, no axis, no tick labels, no gridlines. Camera stays locked 16and perfectly still throughout.
"기존 타이포그래피를 픽셀 안정적으로 유지"와 "카메라 고정"은 실제 작업을 수행한다. 모든 카메라 움직임은 모델이 그대로 두어야 할 텍스트를 다시 그릴 또 다른 기회다.
그런 다음 지루하지만 중요한 작업을 수행하라: 숫자가 나타나는 각 프레임에서 일시 중지하고 소스 행과 비교하여 읽어라. 이는 30초 검사이며, 잘못된 수익 수치를 자신 있게 표시하는 비디오와 사용자를 구분하는 유일한 것이다.

Atlas Cloud의 Wan 2.7 Image-to-Video 플레이그라운드: 첫 프레임 로드 및 완성된 데이터 클립 렌더링
1080P의 Wan 2.7 Image-to-Video, 2단계 첫 프레임 업로드 및 출력 패널의 완성된 클립. 패널이 말하는 것을 주목할 가치가 있다: 10초를 요청했고, 지속 시간 필드는 10을 표시했지만, 렌더링은 5초로 돌아왔다. Run 견적이 파일보다 먼저 그 사실을 알려주었으며, 이것이 읽어야 하는 이유 전부다.

동일한 GMV 스프레드시트에서 재구축된 완성된 데이터 클립, 모든 수치 그대로
성과: 동일한 스프레드시트, 범례와 축 눈금을 의도적으로 설계에서 제외하고 재구축. 모델은 스크립트된 두 샷을 실제로 렌더링된 5초로 압축했으며, 모든 수치가 이동에서 살아남았다: 시작 부분의 "$1,580" 및 "$3,460", 세 막대 위의 "$3,460", "$2,480" 및 "$1,580". 깨진 레이블이 전혀 없으며, 깨뜨릴 레이블이 없었기 때문이다. 이미지-투-비디오 경로가 어떠한 오디오도 생성하지 않으므로 설계상 무음이다.
문서-투-비디오 변형 및 완성된 1분 비용
스프레드시트 사례가 가장 어렵다. 다른 세 가지 공식 사용 사례는 더 쉬우며, 대부분의 상업적 가치가 여기에 있다.
강의 자료. 백과사전 항목을 제공하고 특정 읽기 수준의 수업을 요청한다. 아래 출력은 시인 왕웨이에 관한 귀여운 스타일의 애니메이션 수업으로, 25.03초 길이다.
그리기 스타일은 전체를 통해 유지된다. 캐릭터 세부 사항은 그렇지 않다. 3초 지점에서 그는 순백색 배경에 검은 모자를 쓰고 있다; 22초가 되면 모자는 연한 파란색으로 변하고 그는 고전적인 두루마리 그림 안에 서 있다. 덱 테스터가 안경테에서 본 것과 동일한 변화다. 3단계 체인에서 재구축하는 경우, 1단계에서 캐릭터 카드를 고정하고 2단계 프레임을 스타일 앵커로 재사용하라.
백과사전 항목을 1학년 애니메이션 수업으로 변환, 생성된 오디오 포함, 25.03초. 알리바바 공식 Wan 3.0 공개 베타 데모.
브랜드 영화. 제안 문서가 완전한 30초 스팟이 된다. 네 데모 중 가장 예�지만 가장 검증하기 어렵다. 소스 문서가 무엇을 말했는지 볼 수 없기 때문이다. 아름다움보다 일관성을 주시하라: 이것이 제품이 하나의 클립에서 세 번 모양이 바뀐 타사 테스터를 사로잡은 실패 모드다.
제안 문서를 30.04초 스킨케어 브랜드 영화로 변환. 알리바바 공식 Wan 3.0 공개 베타 데모, 오디오 켜짐.
보고서 요약. 이에 대한 공식 데모는 존재하지 않으므로 패턴을 테스트되지 않은 것으로 취급하라: 샷당 하나의 발표자, 하나의 주장을 요청하고 1단계에서와 같이 모든 수치를 인용부에 넣어라.
이제 비용이다.
| 무엇 | 요율 | 30초 완성 비디오 |
|---|---|---|
| Wan 3.0, 1080p (위안화 기준) | 초당 ¥1.2 | ¥36 |
| Wan 3.0, 1080p (USD 기준) | 초당 $0.20 | $6.00 |
| Wan 3.0, 720p (위안화 기준) | 초당 ¥0.6 | ¥18 |
| 3단계 체인, 한 번 | 스크립트 + 프레임 + $0.1/초 렌데링 | 약 $1.20 (10초 기준) |
| 3단계 체인, 3회 시도 | 스크립트 재사용, 프레임 및 렌더링 반복 | 약 $3.50 |
두 개의 공개된 Wan 3.0 가격표는 1080p가 ¥1.2인지 $0.20인지 일치하지 않으며, 이는 같은 숫자가 아니다. 시리즈 예산을 세우기 전에 실제로 청구되는 엔드포인트의 요율을 확인하라.
숨겨진 비용은 초당 요율이 아니라 재실행이다. 문서 입력은 작업당 하나의 파일을 사용하므로, 단일 수치 변경은 전체 비디오를 재생성하는 것을 의미한다. 3단계 체인에서 샷 트 스크립트는 재사용 가능한 텍스트 산출물이므로, 숫자 변경은 전 작업 대신 한 번의 렌더링 비용이 든다. 분기 보고 주기에서 그 차이는 초당 가격을 압도한다.
업로드하기 전에 한 가지 법적 참고 사항. 호스팅된 모델에 전송하는 문서는 건물을 떠나는 문서이며, 내부 덱 및 미공개 재무 정보에는 일반적으로 이에 대한 정책이 있다. 마감 압박이 닥친 후가 아니라 그 전에 확인하라. 그리고 이 기사의 모든 공식 데모 클립은 알리바바 소유이며, 공개 베타 자료로 인용된다. 여기에는 상업적 재사용 라이선스가 포함되지 않는다.
Wan 3.0 문서-투-비디오 FAQ
Wan 3.0 문서-투-비디오는 어떤 파일 형식을 지원하며, 크기는 얼마인가?
doc, xls, ppt, pdf, txt, md를 지원하며, key, pages, numbers도 보고되었고, 파일 대신 일반 웹 링크도 가능하다. 작업당 하나의 파일 또는 하나의 링크, 최대 100MB 또는 50페이지.
Wan 3.0이 각 슬라이드를 장면으로 변환하는가?
아니요, 이것이 가장 흔한 오해다. 전체 문서를 읽은 다음, 학습한 내용을 바탕으로 비디오를 연출한다. 상한에서 50페이지를 30초로 변환하면 페이지당 0.6초가 되므로, 페이지 넘김이 아니라 트레일러를 생산한다. 공식 사용 사례와 독립적 테스트 모두 동일한 방항을 가리킨다.
스프레드시트의 숫자가 비디오에서 정확한가?
내가 확인한 모든 사례에서 셀 값은 유지되었으며, 공식 데모의 $1,580, $3,460 및 +45.7%도 포함된다. 실패하는 것은 차트 부속물이다: 범례가 합쳐지고, 축 눈금이 비선형으로 나오며, 천 단위 구분 기호가 사라진다. 모든 숫자를 인용 리터럴로 삽입하고 범례와 축 눈금을 디자인에서 완전히 제외하라.
API를 통해 Wan 3.0 문서-투-비디오를 사용할 수 있는가?
알리바바 자체 채널을 통해서만 가능하며, 현재 초대제이고 웨이트는 공개되지 않았다. Wan 2.2가 계열의 마지막 오� 웨이트 릴리즈로 남아 있다. 그 것이 변할 때까지, 위의 3단계 체인이 실용적 대체안이다.
30초 Wan 3.0 비디오 비용은 얼마인가?
공개된 1080p 요율로 단일 30초 클립의 경우 ¥36 또는 $6.00(국제 시트 기준)이다. 단일 패스보다는 재실행 예산을 세워라. 하나의 숫자 수정이 전체를 재생성하는 것을 의미하기 때문이다.
지금 바로 실행할 수 있는 Wan 3.0 문서-투-비디오에 가장 가까운 것은 무엇인가?
샷 트 스크립트를 작정하기 위안 긴 컨텍스트 모델, 그런 다움 렌데링을 위안 $0.1/초의 Wan 2.7, 동일 요율의 MiniMax H3 또는 $0.134/초의 Seedance 2.5를 대체 옵션으로 사용하라. 생성된 �티지 �킄과 프레임 정확 텨스트를 얻을 수 있지만, 한 번에 30초 연속 테크, 이미지-투-비디오 렌데링과 동시에 오디오 생성, 또는 .pptx를 직접 읽는 모델은 얻을 수 없다.
정직한 요약: Wan 3.0 문서-투-비디오는 실제 한계가 있는 실제 기능이며, 그 출력과 사용자 간의 격는 사용자가 둘 중 하나에 범례를 그리라고 요청하지 않는 한 보기보다 작다.






