Seedance 2.5 서비스 시작 — Atlas Cloud 최초 공개

Wan 3.0 멀티모달 참조는 20개의 에셋을 지원하며, 그 중 하나가 PDF입니다.

Wan 3.0 멀티모달 참조는 한 번의 호출로 20개의 에셋(이미지, 비디오, 오디오, PDF, URL까지)을 받아들입니다. Alibaba의 자체 결과와 오늘 바로 실행할 수 있는 워크플로를 확인하세요.

15초짜리 광고 하나를 위해 폴더를 만들었다. 캐릭터 스틸 이미지 두 장. 클라이언트가 보내온 브랜드 톤 비디오. PDF로만 존재하는 브랜드 북. 실제로 원하는 배우의 음성 샘플.

그런데 비디오 모델을 열었더니 이미지 하나만 넣으라고 한다.

그래서 누구나 하는 짓을 했다. 폴더를 800단어짜리 프롬프트로 옮겨 적고 기도했다. 세 번째 샷에서 얼굴이 틀어졌다. 재킷 색이 바뀌었다. 목소리는 전혀 다른 사람이었다.

Wan 3.0의 옴니 레퍼런스는 비디오 모델이 처음으로 "좋아, 폴더를 통째로 줘"라고 말하는 경우다. 한 번의 호출에 최대 20개의 에셋, 다섯 가지 입력 유형을 하나의 연속된 30초 테이크로 묶어낸다.

이 글은 세 가지를 다루고 나머지는 생략한다. 그 20개 에셋이 실제로 무엇인지 분석하고, 알리바바 자체 생성 클립을 증거로 사용하며, 오늘 당장 실행할 수 있는 동등한 워크플로우를 제시한다. Wan 3.0이 아직 알리바바 자체 클라우드에서 공개 베타 중이고 타사 플랫폼에서 호출할 수 없기 때문이다.

핵심 요점

  • Wan 3.0의 멀티모달 레퍼런스는 한 번의 호출에 최대 20개의 에셋(이미지, 비디오, 오디오, 문서, 라이브 웹페이지)을 받아들이고, 단일 30초 테이크 전체에서 일관성을 유지한다.
  • PDF, 슬라이드 데크 또는 URL을 프롬프트로 요약하는 대신 창의적 입력으로 취급하는 최초의 주류 비디오 모델이다.
  • Wan 3.0은 2026년 8월 6일 Alibaba Cloud Model Studio와 Qwen Cloud에서 wan3.0-video로 공개 베타에 들어갔다. 비공개 가중치다. 이미 Apache 2.0이라고 말하는 사람은 추측하는 것이다.
  • 20개 에셋이라는 헤드라인은 실제 강점이 아니다. 지금 바로 호출할 수 있는 레퍼런스-투-비디오 모델들은 이미 20개 이상의 에셋을 받아들인다. 차이는 에셋 개수가 아니라 문서와 웹페이지에 있다.
  • Atlas Cloud의 무료 AI 광고 스킷 생성기를 사용하면 두 캐릭터, 레퍼런스 고정, 완전 음성 지원 형식을 무료로 테스트할 수 있다. 제품 사진 네 장을 넣으면 15초짜리 음성 스킷이 나온다. 카드 불필요.

Fluffy cat and black cat running down a grand hotel hallway

Wan 3.0이 캐릭터 드리프트 없이 다섯 개의 다른 세트를 통해 추적한 두 마리 고양이_두 장의 레퍼런스 이미지. 호텔 복도부터 세탁기 드럼, 빨간 전화 부스까지 완전히 다른 다섯 세트. 드리프트는 한 프레임도 없다. 출처: 알리바바 공식_ Wan 3.0 제작자 핸드북 , 2026년 8월. 이 글에 나오는 다른 모든 Wan 3.0 클립도 동일 출처.

멀티 레퍼런스 비디오가 왜 실패하는지, 그리고 Wan 3.0 멀티모달 레퍼런스가 무엇을 바꾸는지

비디오 모델은 클립 간에 메모리가 없다. 모든 생성은 제로에서 시작한다. 이것이 한 문장으로 요약되는 전체 문제다.

따라서 이야기에 두 개 이상의 샷이 필요해지는 순간부터 이어붙이기(stitching)가 시작된다. 샷 1에서는 마음에 드는 얼굴이 나온다. 샷 2에서는 그 얼굴의 사촌이 나온다. 샷 3에서는 조용히 재킷 색이 자두색에서 버건디로 바뀌고, 눈치챘을 때는 이미 11번의 렌더링 비용을 지불한 후다.

단일 이미지 레퍼런스는 도움이 되었지만 항상 한 가지(얼굴)만 고정했다. 얼굴, 의상, 소품, 장소, 목소리를 동시에 고정할 수 없었다. 슬롯이 하나뿐인데 작업이 다섯 개였기 때문이다.

두 가지 해결책이 있다. 모델에 더 많은 슬롯을 주거나, 다시 시작하지 않게 하는 것이다. Wan 3.0은 두 가지를 동시에 수행하며, 이것이 두 헤드라인 기능이 실제로 하나의 기능인 이유다. 기본 30초 테이크는 캐릭터가 드리프트할 컷이 없음을 의미한다. 20개의 레퍼런스 에셋은 고정되어야 하는 모든 요소가 하나의 슬롯을 두고 싸우는 대신 전용 슬롯을 가짐을 의미한다.

다음은 아무것도 이어붙이지 않았을 때의 모습이다. 30초, 연속적인 하나의 카메라, 쇼핑 카트에 탄 아이가 결국 빌보드 안에 박혀 있다가 그 아래에서 걸어나온다.

한 번의 패스로 30초 전체, 컷 없음, 사운드트랙도 같은 패스에서 생성됨. 출처: 알리바바 공식 Wan 3.0 제작자 핸드북.

Wan 3.0 멀티모달 레퍼런스에서 "20개 에셋"이 실제로 의미하는 것

20은 헤드라인 숫자다. 중요한 것은 20개가 모두 같은 종류의 것이 아니라는 점이다. Wan 3.0의 옴니 레퍼런스는 다섯 가지 입력 유형을 포함하며, 각각 출력의 서로 다른 축을 제어한다.

이미지는 정체성을 제어한다. 캐릭터 카드, 제품 샷, 장소 판. Wan 3.0은 이것을 픽셀 수준의 일관성이라고 부르며, 알리바바 자체 예시에서 잠금은 얼굴을 넘어 의상까지 확장된다. 겹겹이 쌓인 회색 로브, 끈이 달린 가죽 조끼, 어두운 허리 랩 모두 세 장소에 걸친 16초간의 격투 장면에서 유지된다.

Young man in traditional Chinese robes standing outdoors at sunset

두 캐릭터 카드가 의상 디테일을 프레임 간 유지하며 무술 액션 장면을 이끎

두 캐릭터 카드와 갈대 둑 장소 판. 모든 던지기 동작 동안 의상과 배경이 유지된다. 여기서는 무음 GIF로 표시되었지만, 전달된 파일에는 44.1kHz 스테레오 믹스가 포함되어 있다. 출처: 알리바바 공식 Wan 3.0 제작자 핸드북.

오디오는 목소리를 제어한다. 이것이 "멀티모달"을 단순한 마케팅 이상으로 만드는 부분이다. 캐릭터별로 음성 샘플을 첨부하고, 프롬프트에 대사를 작성하면, 그림과 같은 패스에서 립싱크된 해당 음색으로 대사가 나온다. 두 사람, 두 개의 음성 레퍼런스, 하나의 체육관.

두 대상 이미지와 두 개의 개별 음성 레퍼런스 클립. 대사가 두 목소리로 돌아온다. 이건 소리를 켜고 보는 게 좋다. 출처: 알리바바 공식 Wan 3.0 제작자 핸드북.

비디오는 타이밍을 제어한다. 레퍼런스 비디오는 복사 대상이 아니다. 리듬을 제공한다: 비트가 얼마나 유지되는지, 전환이 어떻게 움직이는지. 이 예시에서는 다섯 개의 키프레임이 대상을 제공하고, 레퍼런스 비디오가 그들 사이의 수평 카드 뒤집기 리듬을 제공한다.

Woman wearing an elaborate traditional Chinese headdress and blue embroidered dress

레퍼런스 비디오에서 가져온 페이스로 다섯 개의 키프레임을 뒤집음_대상용 다섯 개의 키프레임 이미지, 뒤집기 리듬용 레퍼런스 비디오 하나. 출처: 알리바바 공식 Wan 3.0 제작자 핸드북._

문서와 웹페이지는 구조를 제어한다. 이것이 진정으로 새로운 부분이다. Wan 3.0은 문서 파일과 라이브 URL을 창의적 입력으로 받아들이며, 베타에 대한 보고서에는 .doc, .xls, .ppt, .pdf, .txt가 허용 형식으로 나열되어 있다(AlphaSignal, 2026년 8월). 동일한 로직이 스토리보드 이미지에서도 이미 작동한다. 하나의 보드를 넣으면 보드 순서대로 여섯 개의 샷이 나온다.

Two people with umbrellas stand on a rainy train station platform

비오는 기차역 플랫폼에서 단일 스토리보드 시트가 여섯 개의 연속 샷으로 확장됨

하나의 스토리보드 시트를 레퍼런스로 사용하여 순서대로 생성된 여섯 개의 샷. 다섯 번째 샷에서 손에 쪽지를 건네는 디테일까지 살아있다. 출처: 알리바바 공식 Wan 3.0 제작자 핸드북.

첫 번째와 마지막 프레임은 끝점을 제어한다. 책에서 가장 오래된 방법이며, 여전히 지원되고, 샷을 제한하는 가장 빠른 방법이다.

다음은 현재 대부분의 사람들이 실제로 사용하는 버전과 비교한 표다.

Wan 2.7 Reference-to-VideoWan 3.0 omni-reference
레퍼런스 에셋대상당 이미지 1개, 최대 3개 비디오, 1개 음성 클립총 최대 20개 에셋
모달리티이미지, 비디오, 오디오이미지, 비디오, 오디오, 문서, 웹페이지
한 패스 최대 길이10초30초 기본, 스마트 지속 시간 포함
동일 패스 오디오
비디오 편집 및 확장노출되지 않음명령 및 레퍼런스 기반 편집, 확장 지원
가용성타사 API에서 사용 가능Alibaba Cloud Model Studio 및 Qwen Cloud 베타

문서에 적히지 않았지만 모두가 힘겹게 배우는 규칙이 하나 있다: 레퍼런스 하나, 작업 하나. Image1은 얼굴과 의상을 고정한다. Video1은 움직임만 제공한다. Audio1은 음색만 제공한다. 단일 에셋에 두 가지 상충되는 작업을 주거나, 두 사람이 있는 레퍼런스 이미지를 업로드하면 모델이 추측해야 하며, 추측은 바로 당신이 막으려 했던 것이다. 알리바바의 핸드북도 이것에 대해 단호하다: 레퍼런스 이미지당 한 명의 대상.

오늘 당장 실행할 수 있는 Wan 3.0 멀티모달 레퍼런스 워크플로우

먼저 직설적인 답변. Wan 3.0은 알리바바 자체 클라우드에서 모델 ID wan3.0-video로 공개 베타 중이다(Alibaba Wan, 2026년 8월). 아직 Atlas Cloud를 포함한 타사 API 플랫폼에 도착하지 않았다. 지금 Wan 3.0 API 액세스를 판매하는 사람은 다른 것을 재판매하는 것이다.

도착한 것은 워크플로우 형태다. 레퍼런스 팩을 넣고, 한 번 호출하면, 사운드가 포함된 완성된 클립이 나온다. 이것은 브라우저 탭에서 호출할 수 있는 레퍼런스-투-비디오 모델에서 오늘 실행되며, 모두 정렬하면 20개 에셋 헤드라인이 다르게 보인다.

모델레퍼런스 에셋모달리티최대 길이기본 오디오초당 가격
Wan 3.0 (Alibaba 베타, Atlas 미포함)총 20개이미지, 비디오, 오디오, 문서, 웹페이지30초해상도별 $0.05~$0.20 (보고됨)
Wan 2.7 Reference-to-Video대상당 이미지 1개, 비디오 3개, 음성 클립 1개이미지, 비디오, 오디오10초$0.10
Seedance 2.5 Reference-to-Video50개 (이미지 30개 / 비디오 10개 / 오디오 10개)이미지, 비디오, 오디오30초$0.13
MiniMax H3 Reference-to-Video혼합, 명시된 상한 없음이미지, 비디오, 오디오15초$0.10
Kling Video O3 Pro Reference-to-Video이미지 7개, 또는 이미지 4개 + 비디오 1개이미지, 비디오15초$0.10
Vidu Q3-Mix Reference-to-Video이미지 4개이미지16초$0.11
Veo 3.1 Reference-to-Video이미지 3개이미지8초선택 사항$0.20

가격은 2026년 8월 기준 Atlas Cloud 요금이다. Wan 3.0의 수치는 Alibaba Cloud 베타에 대해 보고된 것이며 Atlas 요금이 아니며, Alibaba는 아직 모델에 대한 공개 가격 페이지를 게시하지 않았으므로 해당 행은 잠정적이다.

표를 두 번 읽으면 실제 이야기가 드러난다. 20개 에셋 헤드라인은 Wan 3.0이 앞서는 부분이 아니다. Seedance 2.5가 이미 50개를 받아들이고 30초를 맞추기 때문이다. 그 목록에서 다른 어떤 것도 PDF를 받아들이지 않는다.

아래 워크스루 데모는 Wan 2.7 Reference-to-Video에서 실행된다. 그 입력 형태가 옴니 레퍼런스와 가장 가깝기 때문이다: 여러 대상 이미지, 선택적 레퍼런스 비디오, 음성 클립. 이 모두가 프롬프트 내 character1character2 레이블에 매핑된다. 세 개의 모델, 하나의 브라우저 탭, 로컬 설치 불필요.

직접 제작: 4단계 멀티모달 레퍼런스 장면

장면: 파스텔 호텔 프론트 데스크. 무표정한 컨시어지. 랙돌 고양이를 안고 있는 여행자. 컨시어지가 렌즈를 똑바로 쳐다보며 말한다. "고양이는 예약이 있습니다. 당신은 없습니다."

이미지 두 장과 음성 클립 하나, 즉 두 가지 모달리티에 걸친 세 개의 레퍼런스 에셋. 이것이 단순한 다중 이미지가 아닌 진정한 멀티모달을 위한 가장 작은 구성이다.

1단계. 레퍼런스 이미지 1 생성: 고정해야 할 대상

레퍼런스 이미지에는 세 가지 작업만 있다: 한 명의 대상, 카메라를 향함, 깔끔한 배경. 나머지는 장식이다. GPT Image 2를 사용하고 quality high, size 16:9, n=1로 설정한다.

Plain
1Full-body studio portrait of a middle-aged hotel concierge with a deadpan expression, standing dead-centre against a flat dusty-pink wall. He wears a plum-purple double-breasted bellhop uniform with gold piping and brass buttons, a small round pillbox hat, and a thin moustache. Perfectly symmetrical framing, even soft frontal light, no cast shadow on the wall, 35mm film grain, muted pastel palette. One subject only, no other people, no text, no logo, no props in frame.

AI image generator interface showing numbered steps and a generated bellhop

Atlas Cloud의 GPT Image 2 플레이그라운드, 출력 패널에 렌더링된 컨시어지 레퍼런스 초상화

Atlas Cloud의 GPT Image 2: quality high, 16:9, 한 명의 대상, 평평한 배경. 이 파일이 character1이 된다.

2단계. 레퍼런스 이미지 2 생성: 두 번째 고정 대상

동일한 모델, 동일한 설정. 두 캐릭터 간의 색상 대비는 의도적이며, 모델이 같은 프레임에 있을 때 쉽게 구분할 수 있도록 한다.

Plain
1Full-body studio portrait of a young woman traveller holding a fluffy ragdoll cat against her chest, standing dead-centre against a flat mustard-yellow wall. She wears a mustard wool coat, a red beret and round tortoiseshell glasses, and holds a small vintage leather suitcase in her free hand. Perfectly symmetrical framing, even soft frontal light, no cast shadow on the wall, 35mm film grain, muted pastel palette. One subject only, no other people, no text, no logo.

3단계. 음성 레퍼런스 생성: 실제 멀티모달 부분

음성 클립은 이것을 다중 이미지 작업에서 멀티모달 작업으로 바꾸는 요소다. Wan 2.7의 오디오 슬롯은 약 1~10초의 짧은 샘플을 원하므로 대사를 짧게 유지한다. MiniMax Speech 2.6 HD를 사용하고 낮고 평평하며 방해받지 않는 남성 목소리를 선택한다.

Plain
1Good evening. Checking in? Of course. Everyone is.

4단계. 한 번의 호출, 세 개의 레퍼런스, 하나의 완성된 클립

이제 전체 팩을 Wan 2.7 Reference-to-Video에 함께 넣는다. 설정: resolution: 1080P, ratio: 16:9, duration: 10 (이 모델의 최대치), prompt_extend: false, seed: -1. images를 순서대로 로드한다. 먼저 1단계를 character1에 매핑하고, 2단계를 character2로 매핑한 다음, 3단계 파일을 audio에 첨부한다.

Plain
1Symmetrical, dead-centre wide shot of a pastel hotel lobby front desk, dusty-pink walls and a mustard-yellow key rack behind it. character1 is the concierge standing behind the desk; character2 is the traveller standing in front of it, still holding her ragdoll cat. The camera pushes in slowly along a perfect centre axis and never tilts. character1 looks straight down the lens and says flatly: "The cat has a reservation. You do not." character2 blinks once, turns her head slowly towards the cat, then back to the desk. The cat stares directly into the camera without moving. 35mm film grain, even soft lighting, muted pastel palette, no camera shake, no cuts.

부정적 프롬프트:

Plain
1handheld shake, jump cuts, subtitles, on-screen text, watermark, extra people, deformed hands, face morphing, colour shift, motion blur

Screenshot of an AI video generator interface with input and output

Atlas Cloud의 Wan 2.7 Reference-to-Video 플레이그라운드, 두 개의 레퍼런스 이미지와 하나의 오디오 파일이 로드되고 출력 패널에 완성된 클립이 표시됨

Atlas Cloud의 Wan 2.7 Reference-to-Video: 왼쪽에 두 개의 레퍼런스 이미지와 하나의 음성 클립이 첨부되고, 오른쪽에 1080P 및 16:9로 완성된 테이크가 재생 중이다. 이 캡처는 모델의 기본 지속 시간으로 실행되었으며, 아래 전체 버전을 보려면 10으로 설정하라.

완성된 클립. 두 얼굴이 모두 유지되었고, 두 의상이 유지되었으며, 대사가 3단계의 복제된 목소리로 전달된다. 그러니 소리를 켜고 보는 것이 좋다.

Woman holding a cat at a hotel reception desk with bellhop

두 개의 레퍼런스 초상화와 완성된 클립의 한 프레임, 같은 얼굴과 의상이 보임

왼쪽의 레퍼런스, 오른쪽의 전달된 클립 프레임. 유니폼 파이핑, 베레모, 안경, 고양이가 모두 전달 과정에서 살아남았다.

Wan 3.0 멀티모달 레퍼런스 워크플로우 변형

30초로 밀어붙이기. 동일한 레퍼런스 팩이 Seedance 2.5 Reference-to-Video에서 duration: 30으로 실행되며, 베타를 기다리지 않고 Wan 3.0이 약속하는 길이를 얻을 수 있다. 최대 30개의 레퍼런스 이미지, 10개의 비디오, 10개의 오디오 클립을 받아들이므로 팩이 커질 여지가 있다. 추가 20초를 프롬프트에서 분위기가 아닌 비트(beats)로 작성하라. 그렇지 않으면 모델이 패딩할 것이다.

AI video generator interface showing input settings and generation progress

Atlas Cloud의 Seedance 2.5 Reference-to-Video 플레이그라운드, duration이 30으로 설정되고 긴 테이크가 렌더링됨

Atlas Cloud의 Seedance 2.5 Reference-to-Video, duration이 30으로 설정되고 동일한 두 개의 레퍼런스 초상화가 첨부되어 생성 중인 모습. 프롬프트에 있는 @image1@image2 칩에 주목하라. 이것이 Seedance에 어떤 레퍼런스가 어떤 역할을 하는지 알리는 방법이다. 실행 버튼에 표시된 견적 가격을 확인하라. 작업이 실제로 제출할 지속 시간을 반영하기 때문이다.

동일한 장면의 30초 버전, 동일한 레퍼런스 팩, 샷별로 작성된 비트.

움직임만을 위한 레퍼런스 비디오 추가. 원하는 페이스의 클립을 첨부하고 프롬프트에 명시적으로 "컷 리듬에 대해서만 레퍼런스 비디오를 따르고, 대상과 배경은 무시하라"고 말한다. 이것이 위의 카드 뒤집기 예시 뒤에 있는 트릭이다.

긍정적 프롬프트를 건드리기 전에 부정적 프롬프트로 드리프트 수정하기. 얼굴 변형, 색상 이동, 핸드헬드 흔들림은 레퍼런스 고정 샷을 망치는 세 가지이며, 일반적으로 설명을 추가하는 것보다 억제하는 것이 더 저렴하다.

멀티모달 레퍼런스 형식을 무료로 시도해보기

매개변수 전에 이 형태를 원한다면, Atlas Cloud는 지난주에 무료 AI 광고 스킷 생성기를 출시했으며, 이는 노브(knobs) 없이 동일한 체인을 실행한다.

제품과 그 판매 포인트에 대해 한 줄을 작성한다. 그러면 두 캐릭터 코미디 스크립트(후크, 갈등, 반전)를 작성하고, 15초짜리 비디오를 음성 대화와 음향 효과와 함께 렌더링한다. 최대 4개의 실제 제품 사진을 레퍼런스로 첨부할 수 있으며, 광고는 스크립트부터 최종 프레임까지 모양, 색상, 라벨, 로고를 유지한다. 여섯 가지 스타일(재미있는 밈, 반전, 시트콤, 럭셔리, 하드셀 등)이 포함되어 있으며, 대사는 설명을 작성한 언어로 나온다.

튜토리얼의 동일한 두 캐릭터 + 레퍼런스 이미지 + 음성 체인이며, 프롬프트 작성과 비용이 없다. 따라서 이 형식이 제품에 적합한지 조정에 비용을 쓰기 전에 알아보는 좋은 방법이다.

레퍼런스 스틸 스택이 제품 조각에 어떤 영향을 미치는지 보려면, 다음은 Wan 3.0 자체 버전의 작업이다: 다섯 개의 이미지를 넣고 하나의 런치 릴이 나오며, 각 스틸이 편집의 한 비트를 고정한다.

Animated floating stack of white and mint green cards

다섯 개의 레퍼런스 스틸이 Material Design 스타일 제품 런치 릴로 확장됨_다섯 개의 레퍼런스 이미지가 9초 제품 필름을 구동하며, 각각 하나의 비트를 고정하고 다음으로 넘겨준다. 출처: 알리바바 공식 Wan 3.0 제작자 핸드북._

Wan 3.0 멀티모달 레퍼런스 클립 비용

단계모델단가수량비용
1 및 2, 레퍼런스 이미지 2개GPT Image 2이미지당 $0.0092$0.02
3, 음성 레퍼런스MiniMax Speech 2.6 HD1,000자당 $0.0849자$0.00
4, 1080P 10초 테이크Wan 2.7 Reference-to-Video1080P 초당 $0.1510초$1.50
튜토리얼 총계약 $1.52
변형, 30초Seedance 2.5 Reference-to-Video480P 초당 $0.13430초약 $4.02
무료 경로무료 AI 광고 스킷 생성기무료1개 클립, 15초$0

위는 플랫폼 자체 요금이며, 2026년 8월 기준으로 확인되었고 종량제로 청구된다. 사람들이 예상보다 더 많이 움직이는 두 가지가 있다. 첫 번째는 해상도다. 비교표의 초당 $0.10은 Wan 2.7의 기본 요금이며, 1080P는 초당 $0.15로 청구되므로 위의 $1.50이 나온다. 두 번째는 Seedance가 픽셀 수로 가격을 책정하므로, 나열된 초당 $0.134는 480P 수치이며 720P 테이크는 단순 곱셈보다 더 비싸다. 참고로, 보고된 Wan 3.0 베타 요금인 1080P 초당 $0.20은 30초 전체 테이크에 약 $6이며, 이는 오늘날 480P의 Seedance 경로보다 더 비싸다.

이 도구 사용에 관한 참고 사항. Wan 3.0은 베타이며 약관이 변경될 수 있으므로, 파이프라인을 구축하기 전에 다시 읽어보라. 레퍼런스 이미지가 실제 사람이라면 먼저 허락을 받아라. 레퍼런스-투-비디오는 바로 그 점을 중요하게 만드는 기능이기 때문이다. 이 글의 예제 클립은 알리바바의 공개 제작자 핸드북에서 가져온 알리바바 자체 생성 결과물이며, 논평을 위해 여기에 재현되었다.

자주 묻는 질문

Wan 3.0의 멀티모달 레퍼런스는 실제로 몇 개의 레퍼런스를 받을 수 있나요?

단일 호출에 최대 20개의 에셋을 이미지, 비디오, 오디오, 문서, 웹페이지에서 가져올 수 있다. 실제 한계는 기술적 한계보다 낮다. 각 에셋에 정확히 하나의 작업을 할당하고, 이미지당 한 명의 대상을 지정하면 대부분의 장면에서 20개보다 훨씬 적게 사용할 것이다.

Wan 3.0이 정말 PDF나 웹페이지를 비디오로 변환할 수 있나요?

예, 그것이 진정으로 독특한 부분이다. 텍스트, 이미지, 오디오, 비디오와 함께 문서 파일과 라이브 URL을 받아들이며, 베타에 대한 보고서에는 .doc, .xls, .ppt, .pdf, .txt가 나열되어 있다. 위 비교표에 있는 다른 레퍼런스-투-비디오 모델 중 문서를 전혀 받아들이는 모델은 없다.

Wan 3.0은 오픈소스인가요? ComfyUI에서 실행할 수 있나요?

아니요, 그리고 지금은 불가능하다. Wan 3.0은 알리바바 자체 클라우드에서 실행되는 비공개 베타다. 이전 Wan 세대는 공개적으로 출시되었기 때문에 기대가 존재하지만, 알리바바는 3.0에 대한 가중치를 확인하지 않았다. Wan 3.0의 1.3B 또는 14B Apache 2.0 릴리스를 주장하는 페이지는 공식적인 뒷받침이 없다.

Wan 3.0이 타사 API를 통해 사용 가능한가요?

아직 아니다. Atlas Cloud도 포함된다. 오늘 호출할 수 있는 가장 가까운 것은 Wan 2.7 Reference-to-Video이며, 그 입력 형태는 문서 및 웹페이지 모달리티를 제외하고 옴니 레퍼런스와 거의 정확히 일치한다. 또는 30초 전체가 필요하면 Seedance 2.5 Reference-to-Video를 사용할 수 있다.

레퍼런스 고정, 두 캐릭터 비디오를 테스트하는 가장 저렴한 방법은 무엇인가요?

위에 링크된 무료 AI 광고 스킷 생성기다. 네 장의 레퍼런스 사진을 넣으면 15초짜리 음성 두 캐릭터 클립이 나온다. 매개변수와 비용이 없다. 제품과 형식에 맞는다면 유료 체인을 조정하면 된다.

레퍼런스 이미지를 사용해도 캐릭터가 계속 드리프트하는 이유는 무엇인가요?

세 가지 원인이 빈도 순서대로 있다. 하나의 레퍼런스가 두 가지 작업을 수행하고 있어 얼굴과 장소를 모두 고정하도록 요청받고 있다. 레퍼런스 이미지에 두 명 이상의 사람이나 복잡한 배경이 있어 모델이 어떤 부분을 고정해야 할지 모른다. 또는 드리프트가 레퍼런스 실패가 아닌 렌더링 아티팩트이며, 이 경우 아무것도 다시 작성하기 전에 부정적 프롬프트에 face morphing, colour shift를 넣어라.

최신 모델

하나의 API로 모든 미디어 AI를.

모든 모델 탐색