Seedance 2.5 서비스 시작 — Atlas Cloud 최초 공개

Wan 3.0 Multi-Shot 일관성: 공식 클립 110개에서 모든 컷을 세어봤습니다

Wan 3.0 멀티샷 일관성: 110개 클립을 모두 세어보았습니다

Wan 3.0 멀티샷 일관성: 공식 클립 110개에서 모든 컷을 세어보았습니다

당신은 4샷 스크립트를 작성했습니다. 샷 1은 완벽하게 들어맞습니다: 밀짚모자, 검은 구슬 목걸이, 흰색 린넨 드레스, 조명이 정확합니다. 샷 2가 도착했는데, 다른 모자를 쓴 다른 여성입니다.

그 간극이 바로 사람들이 Wan 3.0 멀티샷 일관성에 주목하는 이유입니다. 하나의 프롬프트, 여섯 개의 샷, 30초, 전체에 걸쳐 동일한 캐릭터를 약속합니다.

그래서 저는 사양서 읽기를 그만두었습니다. 알리바바가 자체 Wan 3.0 크리에이터 핸드북과 함께 공개한 110개의 데모 파일을 모두 다운로드했고, 모든 파일에 ffmpeg를 실행했으며, 64개의 쌍을 이루는 프롬프트를 모두 분석했습니다. 그리고 검색 결과에서 아무도 하지 않은 일을 했습니다: 전달된 비디오의 실제 컷 수를 세고, 각 프롬프트가 요청한 샷 수와 비교했습니다.

세 가지 발견이 여러분이 다른 곳에서 읽을 내용과 모순됩니다.

여섯 개의 다른 샷에서 동일한 밀짚모자 캐릭터가 유지되는 모습을 모니터 벽이 보여주는 시네마틱 컬러 그레이딩 스위트, Wan 3.0 멀티샷 일관성의 기준점

컬러리스트의 기준 벽이 멀티샷 일관성에 대한 정직한 정신 모델입니다: 하나의 정체성, 여섯 개의 프레이밍, 나란히 확인. openai/gpt-image-2로 생성됨.

핵심 요약

  • 6샷은 현실적이지만 보장되지는 않습니다: 알리바바 자체 멀티샷 프롬프트 중 3개는 선언된 수를 정확히 맞췄고, 2개는 부족했습니다.
  • 최악의 경우 4샷을 요청했지만 2샷만 렌더링되었습니다.
  • 4K는 없습니다. 공식 파일 110개 중 1080p를 초과하는 것은 없으며, 정확히 1920x1080인 것은 단 4개뿐입니다.
  • 소품과 카메라는 얼굴보다 먼저 변합니다. 눈이 아닌 모자를 보세요.
  • 아직 알리바바 자체 플랫폼 외부에는 공개 Wan 3.0 API가 없습니다. 따라서 아래 튜토리얼은 오늘 호출할 수 있는 모델로 이를 재구성합니다.

다음은 알리바바 자체 핸드북에서 가져온 최상의 결과입니다. 프롬프트에 6샷이 선언되었고, 6샷이 전달되었으며, 동일한 두 캐릭터, 동일한 의상, 동일한 비가 내립니다:

비 오는 기차 플랫폼에서의 6샷 애니메이션 시퀀스, 투명 우산을 든 같은 소녀와 카키색 백팩을 멘 소년이 모든 컷에서 일관되게 유지됨

알리바바 공식 Wan 3.0 베타 데모 (핸드북 클립 v013, 1280x720, 20.05초). 프롬프트는 샷 1부터 6까지 번호를 매겼고, ffmpeg는 정확히 5개의 하드 컷을 찾았으므로 6개의 샷이 모두 생성되었습니다. Atlas Cloud에서 생성되지 않음.

Wan 3.0 멀티샷 일관성이 실제로 무엇인가

짧게 말하면: 하나의 이름을 가진 세 가지 별개의 약속이며, 알리바바는 어느 세 가지인지 특이하게 구체적입니다.

출시 글에서 알리바바는 일관성을 캐릭터("얼굴 특징, 헤어스타일과 헤어 컬러, 체형, 의복 및 액세서리"), 소품("다각도 외형, 하드웨어 구조, 로고 및 재질 세부 사항"), 공간("캐릭터 배치 및 카메라 시점")으로 나눕니다(Alibaba Cloud, 2026). 이 세 가지 레이어 분할이 아래 모든 것의 평가 기준입니다. 같은 얼굴, 다른 목걸이는 실패입니다.

모델은 한 번의 작업으로 최대 30초, 480P, 720P 또는 1080P로 생성합니다(Alibaba Cloud, 2026).

이제 검색 결과가 잘못 알고 있는 부분입니다.

검색 결과의 일반적인 주장실제 1차 자료가 보여주는 것
"네이티브 4K 생성"공식 게시물은 480P / 720P / 1080P만 나열합니다. 110개의 공식 데모 파일 중 1080p를 초과하는 것은 없으며, 정확히 1920x1080인 파일은 4개뿐입니다. 일반적인 "1080p" 가로 출력은 1920x1072입니다.
"생성당 최대 6개의 독립 샷"알리바바 자체 출시 게시물에는 샷 수 사양이 나타나지 않습니다. 경험적으로는 유효합니다: 핸드북의 명시적으로 멀티샷 프롬프트 8개 중 가장 높은 선언은 6개이며, 그중 2개가 6개를 전달했습니다.
"최대 12개의 참조 이미지"실제 테스트에서는 최대 10개의 이미지와 5개의 비디오 클립 및 5개의 오디오 클립이 보고되었습니다(Curious Refuge, 2026). 알리바바의 게시물은 숫자를 전혀 제공하지 않습니다.
"오픈 가중치, Apache-2.0"이전 Wan 릴리스는 오픈 가중치였습니다. Wan 3.0은 플랫폼 서비스로 제공되며 가중치가 나타나지 않았습니다(Curious Refuge, 2026).
"API가 나왔다"알리바바 클라우드 모델 스튜디오에서 실행됩니다. 타사 추론 플랫폼에는 아직 없습니다.

그리고 이것이 구축하는 데 가장 오래 걸린 표입니다. 모든 숫자는 제가 ffmpeg 장면 감지를 통해 전달된 파일과 쌍을 이루는 프롬프트에 쓰여진 샷 수를 비교한 것입니다:

공식 데모프롬프트 선언발견된 하드 컷전달된 샷판정
v013 비오는 플랫폼, 애니메이션6샷56정확
v055 골든 리트리버 일기6샷, 30.0초56정확
v021 라면 가게와 새끼 고양이4샷34정확
v008 숲 호수, 3D4샷23하나 부족
v085 밀짚모자 여성4샷12절반
v041 복도에서 마법 골목까지3세그먼트, "하드 컷 없음"01개 연속 테이크요청대로 정확
v045, v084, v1023 / 5 / 다중 주제해결 불가능할 정도로 많음셀 수 없음빠른 컷팅과 수묵화 스트로빙으로 감지 불가

중간 행을 다시 읽어보세요. 세 개의 프롬프트는 숫자를 정확히 맞췄습니다. 두 개는 그렇지 못했습니다. 당신이 입력한 샷 수는 요청일 뿐, 계약이 아닙니다.

Wan 3.0 멀티샷 일관성이 깨지는 이유: 4가지 실패 모드

먼저 판정: 얼굴에서 거의 깨지지 않습니다. 소품과 카메라에서 깨지며, 한 번에 여러 가지를 변경할 때 가장 심하게 깨집니다.

다음은 가장 많은 것을 가르쳐준 클립입니다. 알리바바 자체 쇼케이스에서 최악의 성능을 보였기 때문입니다.

GtZy2TUK4ak

알리바바 공식 Wan 3.0 베타 데모 (핸드북 클립 v085, 1240x742, 30.08초). 프롬프트는 4개의 시간 코드된 샷을 스크립팅합니다. ffmpeg는 9.3초에서 하나의 실제 컷을 찾습니다. 샷 3과 4는 하나의 유지된 테이크로 붕괴되어 검은색으로 페이드 아웃됩니다. Atlas Cloud에서 생성되지 않음.

실패 모드 1: 소품이 얼굴보다 먼저 변합니다. 해당 클립에서 컷이 발생하기 전의 오프닝 테이크만 보세요. 0.6초에서 보트 모자는 얇은 검은색 밴드가 있고 펜던트는 면처된 네이비 스톤입니다. 9.2초에서 밴드는 넓은 검은색 리본이고 펜던트는 매끄러운 광택 검은색 드롭입니다. 그녀의 얼굴은 전체 시간 동안 안정적입니다. 액세서리는 그렇지 않습니다.

동일한 연속 9초 테이크의 두 프레임을 나란히 보여줌, 모자 밴드가 넓어지고 목걸이 펜던트의 모양과 색상이 변함

두 프레임 모두 공식 v085 데모의 동일한 분할되지 않은 테이크에서 8.6초 간격으로, 두 프레임 사이에 컷이 없습니다. 모자 밴드와 펜던트가 모두 변경됩니다. 캐릭터 레이어가 유지되는 동안 소품 레이어가 실패하는 경우입니다.

이것이 실제로 작동하는 승인 테스트가 분위기 확인이 아닌 소품 체크리스트인 이유입니다. 이 캐릭터의 경우 세 가지 항목입니다: 모자 모양과 밴드, 구슬 목걸이와 펜던트, 드레스 네크라인.

실패 모드 2: 다중 주제 장면은 개별적으로 유지되다가 접촉 시 번집니다. 각 캐릭터는 혼자 있을 때 알아볼 수 있습니다. 함께 프레임에 넣고 상호 작용하면 정체성이 번집니다. 독립 테스트에서도 동일한 것을 발견했습니다: "캐릭터 일관성이 무너지기 시작했고, 합성은 때때로 자연스럽게 생성된 환경보다 나쁜 그린 스크린 효과처럼 보였습니다." 립싱크가 가장 큰 약점으로 지목되었습니다(Curious Refuge, 2026).

실패 모드 3: 한 줄에서 네 가지 변수를 변경했습니다. 새로운 위치에 새로운 카메라 각도, 새로운 조명, 새로운 의상 상태를 더하면 정체성을 잃는 확실한 방법입니다. 핸드북 자체 프롬프트는 모든 세그먼트에서 전체 의상을 다시 진술함으로써 이에 맞서 싸웁니다. 64개의 쌍을 이루는 프롬프트 중 9개는 "변경되지 않음"을 명시하고, 5개는 카메라 위치를 고정하며, 4개는 캐릭터가 동일하게 유지될 것을 요구합니다.

실패 모드 4: 한 작업에서 30초는 한 샷의 30초가 아닙니다. 이들은 다른 제품입니다. 30초 멀티샷 작업은 프레이밍 사이를 전환합니다. 원하는 것이 하나의 연속적인 분할되지 않은 테이크라면, 연속성 연결을 연결하면 저하됩니다: 정체성 오류가 모든 핸드오프에서 누적되므로 깨끗한 단일 테이크는 본질적으로 짧습니다.

핸드북에는 완벽하게 매끄러움을 얻는 프롬프트가 정확히 하나 있으며, 그 문장 구조를 복사할 가치가 있습니다:

아파트 복도에서 문을 통해 램프 불빛이 비치는 고딕 양식의 골목까지 이어지는 하나의 분할되지 않은 연속 테이크로 렌더링된 세 개의 프롬프트 세그먼트

알리바바 공식 Wan 3.0 베타 데모 (핸드북 클립 v041, 720x1280, 15.04초). 세 개의 프롬프트 세그먼트, 그리고 ffmpeg는 하드 컷을 0개 찾습니다. 이는 프롬프트가 요구한 것과 정확히 일치합니다. Atlas Cloud에서 생성되지 않음.

번역된 핸드오프 라인은 전체 핸드북에서 가장 재사용 가능한 것입니다: 이전 세그먼트의 마지막 프레임에서 매끄럽게 이어집니다. 캐릭터, 의상, 위치 및 카메라 위치는 완전히 동일하게 유지됩니다. 하드 컷이나 갑작스러운 장면 전환이 없습니다. 64개 프롬프트 중 단 하나만 사용합니다. 훔쳐서 사용하세요.

오늘 실행할 수 있는 멀티샷 일관성 워크플로우

문제는 실제로 이것을 어디서 실행하느냐입니다.

현재 Wan 3.0은 알리바바 자체 모델 스튜디오에 있습니다. 타사 추론 플랫폼은 호스팅하지 않습니다. Atlas Cloud에서는 라이브 엔드포인트가 없는 '출시 예정' 항목으로만 나타납니다. 이는 솔직한 현재 상태이며, 그렇지 않은 척하기보다는 명확히 말할 가치가 있습니다.

따라서 두 가지 옵션이 있습니다: 기다리거나, 하나의 프롬프트가 여섯 가지 일을 하도록 요청하는 것을 중단하는 것입니다.

두 번째 옵션이 어쨌든 더 낫고, 제 컷 카운팅이 그에 대한 논거입니다. 단일 멀티샷 작업은 알리바바 자체 쇼케이스에서 샷 수가 절반으로 빗나갔습니다. 작업을 분할하면 그 통제권을 다시 손에 넣을 수 있습니다:

  1. 한 번에 스틸 이미지로 룩을 고정합니다.
  2. 각 샷에 대해 하나의 변수만 변경하여 해당 정체성을 키프레임에 복제합니다.
  3. 참조를 고정한 상태로 각 샷을 개별적으로 애니메이션합니다.
  4. 로컬에서 연결합니다.

설정이 더 느리지만, 극적으로 더 예측 가능합니다. 그리고 체인의 모든 모델이 오늘 호출 가능합니다.

단계모델체인에서의 역할나열된 가격
1bytedance/seedream-v5.0-pro/text-to-image캐릭터 룩 고정$0.045 / 이미지
2google/nano-banana-2/edit각 샷의 키프레임에 정체성 복제$0.08 / 이미지
3alibaba/wan-2.7/reference-to-video참조를 고정한 상태로 각 샷 애니메이션$0.10 / 초
대안alibaba/wan-2.7/text-to-video하나의 프롬프트, 여러 샷 (가장 제어하기 어려움)$0.10 / 초
수정alibaba/wan-2.7/video-edit재생성 없이 잘못된 소품 하나 수리$0.10 / 초

"멀티샷 일관성을 위한 최고의 모델" 질문에 대해 알아두면 좋은 점: 참조-투-비디오는 이제 전체 카테고리입니다. bytedance/seedance-2.0-fast/reference-to-video는 $0.072/s (2026년 8월 기준 $0.09에서 20% 할인), kwaivgi/kling-video-o3-pro/reference-to-video는 $0.095/s ($0.112에서 15% 할인), minimax/h3/reference-to-video는 $0.10/s, google/veo3.1/reference-to-video는 $0.20/s입니다. 모든 가격은 2026년 8월 21일 라이브 카탈로그에서 확인되었습니다.

단계 전에 한 가지 경고: 나열된 가격은 최저 가격이지 견적이 아닙니다. 해상도와 지속 시간이 실제 숫자를 변경하므로, 실행 버튼을 읽기 전에 약정하지 마십시오.

Wan 3.0 스타일 멀티샷 일관성을 구축하는 방법, 단계별

알리바바 자체 모델이 실수한 정확한 비트 시트를 재구축하고 있습니다: 밀짚모자 여성, 4샷, 정원에서 차까지. 동일한 스크립트, 샷별 제어, 이번에는 4개의 샷을 렌더링했기 때문에 4개의 샷을 얻을 수 있습니다.

시작해 봅시다.

1단계: 룩을 고정합니다. 하나의 이미지가 다운스트림 모든 것의 정체성 앵커가 됩니다. Seedream v5.0 Pro에서 16:9, 페이지가 제공하는 최고 해상도로 생성합니다. 세 가지 체크포인트 소품을 명시적으로 이름을 지정합니다. 왜냐하면 그것들이 변하기 때문입니다.

plaintext
135mm film still, vintage sunlit rose garden. An elegant young woman wearing a
2natural straw boater hat with a black band, a black beaded necklace with a single
3teardrop pendant, and a white sleeveless linen dress. She stands before a wall of
4blooming pink and cream roses, one hand lightly touching the brim of her hat,
5gentle and thoughtful gaze just off camera. Soft warm natural light, dappled sun
6flare, shallow depth of field, fine film grain, medium close-up.

Atlas Cloud의 Seedream v5.0 Pro 플레이그라운드, 밀짚모자 프롬프트가 입력되고 완성된 캐릭터 키프레임이 출력 패널에 렌더링됨

1단계 완료: 전체 4샷 시퀀스의 정체성 앵커.

2단계: 샷 2~4에 정체성을 복제합니다. 샷당 하나의 키프레임, 각각 한 번씩 실행하며, 1단계 출력을 참조로 사용하여 Nano Banana 2 Edit를 사용합니다. 중요한 규율: 매번 전체 의상을 다시 진술한 다음 정확히 한 가지를 변경합니다.

샷 2, 감정적 전환:

plaintext
1Keep the exact same woman from the reference image: identical face, identical
2natural straw boater hat with black band, identical black beaded necklace with a
3teardrop pendant, identical white sleeveless linen dress. New shot: cinematic
4close-up, she slowly lifts the straw hat off her head and lowers her chin, a faint
5wistful expression. Same rose garden background. Strictly preserve the same
6lighting, skin tone, film grain and colour grade as the reference.

샷 3, 차로 컷:

plaintext
1Keep the exact same woman from the reference image: identical face, identical black
2beaded necklace with a teardrop pendant, identical white sleeveless linen dress,
3the straw boater hat now resting on her lap. New shot: back seat of a moving car,
4side profile, her hand propped against the door, gazing out a rain-beaded window,
5blurred green foliage rushing past. Overcast light with a warm interior fill,
6shallow depth of field, elegant melancholy. Strictly preserve the same face, the
7same colour grade and the same 35mm film grain as the reference.

샷 4, 마지막 모습:

plaintext
1Keep the exact same woman from the reference image: identical face, identical black
2beaded necklace with a teardrop pendant. New shot: extreme facial close-up beside
3the car window, eyes slowly closing, a calm and released expression. Raindrops
4slide down the glass in front of her, focus shifting onto the droplets, background
5falling into bokeh. Wong Kar-wai style cinematic mood, fine film grain. Strictly
6preserve the same face, the same lighting and the same colour grade as the
7reference.

Atlas Cloud의 Nano Banana 2 Edit 플레이그라운드, 1단계 키프레임이 참조로 로드되고 샷 2 키프레임이 렌더링됨, 정체성과 의상 유지됨

2단계 완료: 샷 2의 키프레임, 같은 여성, 모자가 이제 손에 있음.

3단계: 참조를 고정한 상태로 샷 1을 애니메이션합니다. 이제 각 샷이 Wan 2.7 reference-to-video에서 독립적으로 비디오가 됩니다. 설정: 720P, 5초, 1단계 키프레임을 이미지 슬롯에 드롭합니다. 실행 버튼 견적을 확인한 후 실행하십시오.

plaintext
1Shot 1 of 4. Reference image 1 defines the character: keep the same face, the same
2natural straw boater hat with black band, the same black beaded necklace with a
3teardrop pendant and the same white sleeveless linen dress identical for the entire
4clip. 35mm film look, vintage sunlit rose garden. The woman lightly touches the
5brim of her hat as a soft breeze lifts strands of her hair; the camera pushes in
6very slowly. Warm natural light, dappled sun flare, shallow depth of field, fine
7film grain. The camera position stays stable. No hard cut and no scene change.

Atlas Cloud의 Wan 2.7 reference-to-video 플레이그라운드, 이미지 슬롯에 키프레임이 있고 완성된 5초 클립이 출력 패널에서 재생됨

3단계 완료: 출력 패널에서 렌더링된 참조 고정 클립.

그리고 결과물은 다음과 같습니다:

장미 정원에서 밀짚모자 여성의 5초 참조 고정 클립, 모자 밴드와 목걸이가 전체적으로 안정적으로 유지됨

Atlas Cloud에서 직접 실행한 결과, 알리바바 데모가 아님. 무음 GIF로 표시됨; 전달된 파일에는 오디오 트랙이 포함됨.

4단계: 샷 2~4를 연결한 다음 스티치합니다. 나머지 각 키프레임에 대해 3단계를 반복하고, 모든 후속 프롬프트 상단에 핸드북의 핸드오프 문장을 붙여넣습니다:

plaintext
1Continue seamlessly from the last frame of the previous segment. The character,
2the wardrobe, the location and the camera position stay completely identical.
3No hard cut and no abrupt scene transition.

그런 다음 ffmpeg로 로컬에서 연결하고 세 가지 포인트 승인 확인을 실행합니다: 모자 모양과 밴드, 구슬 목걸이와 펜던트, 그리고 샷 간 프레이밍 진행이 실제로 의미가 있는지 여부. 정확히 하나의 소품이 하나의 샷에서 잘못된 경우, 샷을 재생성하지 마십시오. wan-2.7/video-edit을 통해 보내고 해당 부분만 변경하십시오. 핸드북의 표현을 빌리자면: 동작, 의상 및 프레임의 나머지 부분은 변경하지 않고 유지합니다.

변형: 다중 주제 장면 및 스타일 잠금

핸드북에서 가져올 세 가지 패턴입니다.

다중 주제 샷을 위한 캐릭터 카드. 두 명 이상의 사람이 프레임을 공유할 때 공식 프롬프트는 문자로 표시된 캐릭터 카드를 할당하고 각 세그먼트에서 각 캐릭터의 전체 의상을 다시 선언합니다. 장황하고 보기 흉하지만, 대명사보다 더 잘 작동합니다.

스타일화된 작업을 위한 전역 스타일 선언. 수묵화, 셀 애니메이션 및 기타 무거운 스타일은 전체 작품에 대해 한 번 스타일을 고정한 다음 그 아래에 시간 코드된 비트 시트가 필요합니다.

시간 코드된 5비트 전투에서 스타일이 잠긴 대나무 숲 검객의 수묵화 무술 시퀀스

알리바바 공식 Wan 3.0 베타 데모 (핸드북 클립 v084, 20.05초, 자름). 하나의 전역 수묵화 스타일 선언 아래 5개의 시간 코드된 비트. 스트로빙 붓터치가 자동 컷 감지가 이 클립을 셀 수 없는 이유입니다. Atlas Cloud에서 생성되지 않음.

수정하고, 재생성하지 마십시오. 하나의 잘못된 소품에 대한 비디오 편집 패스는 새 렌더링보다 저렴하고 이미 올바른 샷을 망칠 수 없습니다.

4샷 시퀀스의 비용

위에서 구축한 시퀀스의 구체적인 숫자, 나열된 요율 기준:

  • Seedream v5.0 Pro의 정체성 앵커 1개: $0.045
  • Nano Banana 2 Edit의 샷 키프레임 3개: 3 x $0.08 = $0.24
  • Wan 2.7 reference-to-video의 5초, 720P 클립 4개: 20초 x $0.10 = $2.00
  • 총계: 20초, 4샷, 정체성 고정 시퀀스에 약 $2.29

6샷 30초 작품으로 늘리면 비디오 라인이 $3.00이 되어 총 약 $3.44에 도달합니다.

두 가지 솔직한 주의 사항. 첫째, 나열된 가격은 최저 가격입니다: 해상도 계층과 지속 시간이 실제 청구 금액을 변경하며, 플레이그라운드 자체의 실행 견적만이 유일한 구속력 있는 숫자입니다. 이것이 위의 스크린샷이 이 목록보다 더 중요한 이유입니다. 둘째, Wan 3.0 자체에서 알리바바는 모델 스튜디오 비디오 생성을 해상도 계층별로 초당 가격을 책정하지만, 1차 페이지에서 정확한 Wan 3.0 초당 요율을 확인할 수 없었으므로 확인할 수 없는 수치를 인용하지 않습니다.

분할 작업 접근 방식으로 구매하는 것이 무엇인지 주목할 가치가 있습니다: 더 낮은 가격이 아니라, 스크립트와 일치하는 샷 수입니다. 알리바바 자체 쇼케이스의 증거에 따르면, 단일 30초 작업이 아직 약속할 수 있는 것이 아니며, API가 열릴 때까지 Wan 3.0 멀티샷 일관성에 대한 실용적인 답변입니다.

자주 묻는 질문

Wan 3.0은 한 번의 생성에서 몇 개의 샷을 일관되게 유지할 수 있습니까?

현재 증거상으로는 6개이며, 주의 사항이 있습니다. 알리바바의 출시 게시물은 샷 수 사양을 게시하지 않습니다. 공식 핸드북의 명시적으로 멀티샷 프롬프트 8개 중 가장 높은 선언은 6개이며, 그중 2개가 정확히 6개의 컷 확인된 샷을 전달했습니다. 6개를 보장이 아닌 관찰된 상한선으로 취급하십시오.

Wan 3.0이 정말 네이티브 4K를 생성합니까?

아니요. 공식 게시물은 480P, 720P 및 1080P만 나열합니다. 모든 110개의 공식 데모 파일 중 1080p를 초과하는 것은 없으며, 정확히 1920x1080인 파일은 4개뿐이며, 일반적인 가로 출력은 1920x1072입니다. 프레임 속도는 63개 파일이 24fps, 46개 파일이 30fps로 나뉩니다.

Wan 3.0 API를 사용할 수 있으며, 어디서 실행할 수 있습니까?

알리바바 클라우드 모델 스튜디오에서 실행됩니다. 아직 타사 추론 플랫폼이 호스팅하지 않습니다. Atlas Cloud는 라이브 엔드포인트가 없는 '출시 예정' 항목으로 나열합니다. 이번 주에 멀티샷 출력이 필요하다면 위의 Wan 2.7 reference-to-video 체인이 작동하는 대체품입니다.

참조 이미지가 있어도 캐릭터가 여전히 샷 사이에서 변경되는 이유는 무엇입니까?

일반적으로 하나의 프롬프트가 위치, 카메라 각도 및 조명을 동시에 변경했기 때문입니다. 샷당 하나의 변수만 변경하고 모든 프롬프트에서 전체 의상을 다시 진술하십시오. 또한 올바른 것을 확인하십시오: 알리바바 자체 데모에서 얼굴은 안정적으로 유지된 반면 모자 밴드와 목걸이 펜던트는 분할되지 않은 단일 테이크 내에서 변경되었습니다.

Wan 3.0 가중치는 오픈 소스입니까?

가중치가 공개되지 않았습니다. 이전 Wan 버전은 다운로드 가능하고 로컬에서 실행 가능했지만, Wan 3.0은 호스팅된 플랫폼 서비스로 제공됩니다. Wan 3.0에 대해 Apache-2.0 라이선스를 인용하는 사람은 그 뒤에 1차 출처가 없는 내용을 반복하는 것입니다.

Wan 3.0 액세스 없이 멀티샷 일관성을 얻는 가장 빠른 방법은 무엇입니까?

네 가지 단계: 하나의 정체성 이미지를 고정하고, 각 샷에 대해 하나의 변수만 변경하여 하나의 키프레임에 복제하고, 각 샷을 reference-to-video로 애니메이션한 다음 로컬에서 연결하고 소품을 확인하십시오. 4샷 시퀀스의 경우 약 $2.29와 약 30분이 소요됩니다.


방법론: 모든 110개의 데모 파일과 64개의 쌍을 이루는 프롬프트는 알리바바 공식 Wan 3.0 크리에이터 핸드북에서 가져왔으며, 2026년 8월 11일에 로컬에 보관되었습니다. 메타데이터는 ffmpeg로 파일별로 읽었습니다. 샷 수는 0.2 임계값의 ffmpeg 장면 변경 감지에서 비롯되었으며, 추출된 프레임과 교차 확인되었습니다. 프롬프트 구조는 프로그래밍 방식으로 분석되었습니다. Atlas Cloud 가격은 2026년 8월 21일 라이브 모델 카탈로그에서 확인되었습니다.

출처: Alibaba Cloud (2026년 8월); Curious Refuge (2026).

최신 모델

하나의 API로 모든 미디어 AI를.

모든 모델 탐색