
최신 업데이트: Wan 3.0이 2026년 8월 24일부터 라이브로 제공됩니다.
두 개의 편집 모니터가 같은 사막 주유소 장면을 재생하고 있습니다. 하나는 아래에 끊김 없는 30초 타임라인이 있고, 다른 하나는 두 개의 세그먼트로 나뉜 타임라인이 있습니다.
20초에 연료 노즐에서 싱싱한 녹색 풀이 뿜어져 나옵니다. 아직 물방울이 맺혀 있습니다. 말이 기쁘게 눈을 가늘게 뜹니다. 주유원의 이쑤시개가 입에서 떨어집니다.
그 농담은 하나의 연속된 30초 샷 안에서만 작동합니다. 8초짜리 클립 네 개를 이어 붙이면 말의 털색이 바뀌고, 선글라스 모양이 바뀌고, 하늘 색조가 따뜻하게 변하며, 농담의 포인트는 어딘가에서 사라집니다.
그래서 Wan 3.0과 Seedance 2.5가 동시에 등장하여 '네이티브 30초, 한 번에, 연결 없음'을 주장했을 때, 그것은 더 이상 벤치마크 이야기가 아니었습니다. AI 비디오 모델이 단일 테이크로 설정, 전환, 그리고 결말을 유지할 수 있는 첫 번째 사례가 된 것입니다.
사양을 분석하고, 알리바바의 공개 데모 파일을 기준으로 사양을 확인한 결과, 이에 대해 글을 쓰는 누구도 인쇄하지 않은 사실을 발견했습니다: 두 모델 모두 30초라고 말하지만, 그 30초 아래의 해상도는 전혀 다른 제품입니다.
주요 내용
- 두 모델 모두 실제로 단일 패스로 30초를 생성합니다. 그 부분은 마케팅이 아닙니다. Wan 3.0은 2
30초를 스마트 지속 시간 옵션으로 커버하고, Seedance 2.5는 430초를 커버합니다. - 오직 Wan 3.0만이 30초에서 네이티브 1080p를 렌더링합니다. Seedance 2.5는 네이티브로 480p와 720p만 생성합니다. 1080p, 1440p 및 4K 옵션은 720p 소스의 사후 생성 업스케일이며, 자체 API 문서에 따르면 4K 계층은 "네이티브 4K 생성이 아닙니다".
- Seedance 2.5는 참조 볼륨에서 우위를 점합니다: 최대 30개의 이미지 + 10개의 비디오 + 10개의 오디오 파일, 총 50개. Wan 3.0의 크리에이터 핸드북은 참조를 20개로 제한합니다.
- Wan 3.0에는 다른 모델에는 없는 입력이 하나 있습니다:
.doc,.xls,.ppt,.pdf,.txt파일 및 라이브 웹 페이지를 크리에이티브 참조로 직접 입력할 수 있습니다. - 오직 하나만이 현재 알리바바 외부에서 실제로 실행 가능합니다. Wan 3.0은 알리바바 클라우드 모델 스튜디오와 Qwen Cloud에서 공개 베타로 제공되며, 타사 API 액세스는 아직 출시 중입니다. Seedance 2.5는 Atlas Cloud에서 지속 시간 컨트롤에 30이 설정된 상태로 라이브입니다.
- 30초 스토리 구조를 실제로 지불하기 전에 테스트해보고 싶으신가요? Atlas Cloud의 무료 AI 광고 스킷 생성기는 무료로 한 번 실행해 볼 수 있습니다: 대사와 음향 효과가 포함된 15초 완성 스팟, 워터마크 없는 다운로드.
알리바바 공식 Wan 3.0 데모, Tongyi Wan 3.0 크리에이터 핸드북에서 가져옴. 한 번의 테이크, 컷 없음, 30.07초. ffprobe로 측정: 1920x1072, 24fps, AAC 스테레오 오디오 내장. 29초에 꼬리 채찍과 이쑤시개가 바닥에 떨어지는 소리를 들으려면 사운드를 켜세요. 비교 및 논평을 위한 참고 자료로만 사용됩니다.
Wan 3.0 vs Seedance 2.5 네이티브 30초: 이번 달 실제로 변경된 사항
15초는 오랫동안 벽이었습니다. Wan 2.7은 거기서 한계에 도달합니다. Seedance 2.0도 거기서 한계에 도달했습니다. 지난 1년 동안 여러분의 피드에서 본 모든 "1분짜리 AI 영화"는 NLE에서 4~8개의 클립을 붙이고, 이음새를 숨기기 위해 컬러리스트 패스를 거친 것입니다.
두 가지 사항이 같은 몇 주 안에 그 벽을 깨뜨렸습니다. 알리바바는 2026년 8월 6일에 네이티브 30초 생성과 완전한 멀티모달 참조 입력을 갖춘 Wan 3.0 공개 베타를 열었습니다. ByteDance는 Seedance를 2.5에서 15초에서 30초로 두 배로 늘리면서, 클립 스티칭과 그에 따른 시각적 드리프트를 줄이는 방법으로 명시적으로 포지셔닝했습니다.
여기서 '네이티브'는 특정 기술적 의미를 가집니다. 이는 마지막 프레임 확장이 아닌, 하나의 잠재 시퀀스에 대한 단일 순방향 패스를 의미합니다. 확장은 모델이 클립 A의 마지막 프레임을 가져와 클립 B를 시작하는 방식입니다. 확장이 캐릭터의 재킷 칼라가 장면 사이에서 조용히 모양을 바꾸는 이유입니다. 네이티브 패스는 전체 30초가 동일한 컨텍스트에 있으므로 말은 같은 말로 유지됩니다.
주유소 데모는 이를 테스트하는 가장 깨끗한 방법입니다. 구조는 4개의 비트로 구성됩니다: 08초는 아무 일도 일어나지 않음, 816초는 이상한 일이 발생, 1624초는 농담의 포인트, 2430초는 퇴장. 농담은 20초에 떨어집니다. 즉, 말, 선글라스, 청록색과 주황색 그레이딩, 그리고 무표정한 고정 카메라가 모두 처음 19초 동안 손상되지 않고 유지되어야만 농담이 성립합니다. 스티칭으로는 그렇게 할 수 없습니다. 편집자가 나쁘기 때문이 아니라, 클립 B는 클립 A를 본 적이 없기 때문입니다.
Wan 3.0 vs Seedance 2.5 네이티브 30초: 실제로 화면이 깨지는 지점
30초는 15초의 두 배입니다. 드리프트 위험은 두 배가 아니라 더 심각하며, 다른 실패 모드로 이동합니다.
스티치된 워크플로의 실패는 클립 사이에서 발생했습니다. 네이티브 30초의 실패는 클립 내부에서 발생합니다. Seedance 2.5 단편 영화 제작 실습에서 리뷰어는 빠른 액션 시퀀스에 집중된 "캐릭터 모델의 시각적 불안정성 또는 변형"으로 나타나는 디코히어런스와 모핑을 발견했으며, 이러한 아티팩트는 업스케일링으로 제거할 수 없다고 구체적으로 언급했습니다. 720p로 렌더링한 후 4K로 업스케일링할 계획인 사람에게 중요한 부분입니다. 업스케일러는 모핑을 선명하게 만들 뿐 제거하지 않습니다.
동일한 제작에서 3.2대 1의 촬영 비율을 기록했습니다. 2분 22초짜리 최종본을 편집하기 위해 약 450초의 원시 생성이 필요했습니다. 모든 작업이 배송되는 렌더 큐처럼 다루지 말고, 커버리지가 있는 촬영처럼 롱테이크 작업을 계획하세요.
해당 제작에서 얻은 두 가지 더 많은 발견은 그대로 가져올 가치가 있습니다. 전체 영화의 시각적 정체성은 시스템이 최대 50개를 허용함에도 불구하고 세 개의 참조 이미지(두 개의 캐릭터 초상화와 한 개의 로케이션 플레이트)에 의존했습니다. 그리고 보이스 캐스팅에서 "American"을 작성하면 의도하지 않은 영국식 억양이 수정되었지만 "American English"를 작성하면 수정되지 않았습니다. "English"라는 단어가 전달을 영국식으로 다시 밀어넣었기 때문입니다.
30초를 견디는 프롬프트 구조는 알리바바가 자체 핸드북에서 사용하는 구조입니다: 명시적인 타임스탬프가 있는 비트. 분위기에 대한 단락이 아닙니다. 0-8s, 8-16s, 16-24s, 24-30s를 작성하고, 각 블록에 자체 카메라 동작과 자체 이벤트를 부여하고, 전체 클립을 포괄하는 단일 오디오 라인으로 끝내세요. 아래 4단계에서 정확히 그 구조를 볼 수 있습니다. 알리바바의 구조를 유지하고 번역만 했기 때문입니다.
현재 호스팅된 실행을 위해, 워크플로를 게시하기 전에 Atlas Cloud의 Wan 3.0을 열고 아래와 같은 프롬프트를 테스트하세요.

Wan 3.0 vs Seedance 2.5 네이티브 30초: 사양, 가격, 그리고 오늘 실행할 수 있는 것
다음은 정직한 현재 상황이며, 두 모델이 더 이상 비교 가능한 제품이 아닌 부분입니다.
해상도 행을 두 번 읽으세요. 이것이 전체 기사의 핵심입니다. Atlas Cloud 자체의 Seedance 2.5 텍스트-투-비디오 API 문서는 720p-esr이 480p 소스를 향상시키고, 1080p-esr, 1440p-esr 및 4k-esr이 모두 720p 소스를 향상시키며, 4K 옵션이 2160픽셀 짧은 가장자리를 제공하는 "네이티브 4K 생성이 아님"을 명시합니다. 따라서 4K로 표시된 30초 Seedance 클립은 실제 디테일이 720p이며, 리샘플링된 것입니다. 반면 Wan 3.0의 가격표에는 초당 $0.20의 직선 1080p 계층이 있으며, 알리바바가 게시한 30초 데모 파일은 1920x1072로 측정됩니다.
이 제약 조건의 장점: 전체 테스트가 로컬 설정 없이 하나의 브라우저 탭에서 세 가지 모델로 실행됩니다.
| 이 테스트에서의 역할 | 모델 | 나열된 가격 |
|---|---|---|
| 오프닝 프레임 | GPT Image 2 텍스트-투-이미지 | 이미지당 $0.009부터 |
| 네이티브 30초 실행 | Seedance 2.5 텍스트-투-비디오 | 초당 $0.134부터 |
나열된 가격은 2026년 8월 Atlas Cloud 모델 페이지에서 확인되었습니다. 최소 가격으로 읽으세요. 이 모델들은 모두 실제로 요청한 내용에 따라 청구되며, 실행 버튼은 클릭하기 전에 정확한 설정에 대한 가격을 표시합니다. 이 테스트에서 버튼은 GPT Image 2 프레임 하나(품질 높음, 2048x1152)에 대해 $0.1745, 5초 Seedance 2.5 작업(720p, 16:9)에 대해 $1.514799를 표시했으며, 이는 나열된 $0.134가 아닌 대략 초당 $0.30에 해당합니다. 나열된 수치는 480p 요금입니다. 카탈로그가 아닌 버튼을 확인하세요. Seedance 2.5는 또한 50개 참조 한도를 사용하려는 경우 동일한 초당 $0.134의 참조-투-비디오 엔드포인트를 제공합니다.
Seedance 2.5에서 이 네이티브 30초 테스트를 재현하는 방법
5단계, 3개의 모델, 모두 브라우저에서. 프롬프트를 그대로 복사하세요.
1단계: 타임스탬프가 있는 30초 구조 고정
아직 아무것도 실행하지 마세요. 먼저 구조를 읽으세요. 30초가 유지되는지 여부를 결정하는 부분이기 때문입니다.
이 기사 상단의 Wan 3.0 주유소 데모는 머리말에 한 번 명시된 고정 카메라 원칙(차분하고 객관적인 관찰, 고정된 미디엄 와이드, 터무니없는 비트에서만 갑작스러운 극도 클로즈업)과 함께 4개의 레이블이 지정된 블록으로 구성됩니다. 모든 이벤트는 시간 범위에 고정됩니다. 오디오는 전체 30초를 포괄하는 끝에 한 줄입니다.
다음은 빈 구조입니다. 채우면 네이티브 30초 모델이 실제로 추적할 수 있는 프롬프트가 완성됩니다:
Plain130초짜리 [장르]로, [장소] 배경. [시각적 스타일, 그레이딩, 채도]. 카메라 언어: [원칙], [예외]로 강조. 2 30-8초: [설정, 와이드, 평범한 세계를 구축하고, 지평선에 나타난 이상 징후 소개] 4 58-16초: [이상 징후가 행동하지만, 여전히 평범하게 취급되며, 하나의 POV 또는 반응 삽입] 6 716-24초: [결말, 사물 자체의 극단적인 클로즈업, 반응 표정으로 하드 컷] 8 924-30초: [퇴장, 농담을 마무리하는 작은 물리적 버튼] 10 11오디오: [앰비언스, 3~4개의 구체적인 다이제틱 사운드, 하나의 마지막 작은 소리]. 음악 없음, 대사 없음, 화면상 텍스트 없음. 12
알리바바의 참조 파일 측정 사양(수치를 확인하려는 분들을 위해): 30.07초, 1920x1072, 24fps, AAC 스테레오. 이것이 Seedance 실행이 측정되는 기준입니다.
2단계: 오프닝 프레임 생성
15초와 30초 실행이 동일한 세계에서 시작되도록 고정된 시각적 앵커가 필요합니다. GPT Image 2 텍스트-투-이미지를 여세요.
설정: 품질 high, 종횡비 16:9, 1개 이미지.
Plain1밝은 사막에 있는 고독한 Route 66 스타일 주유소의 넓고 정지된 설정 샷. 복고풍 노란색-주황색-파란색 건물, 페인트가 희미하게 햇볕에 바랜 색; 앞에 빛바랜 빈티지 빨간색 연료 펌프; 옆에 문 옆에 씻겨 나간 콜라 자판기가 있는 작은 편의점. 전경에 갈라진 주황색 마른 땅, 멀리 따뜻한 테라코타 산, 구름 한 점 없는 청명한 청록색 하늘. 기름때 묻은 파란색 작업복과 큰 검은색 선글라스를 쓴 주유소 직원이 문 옆 의자에 반쯤 잠들어 축 처져 있으며, 입에 이쑤시개를 물고 있습니다. 엄격한 밝은 청록색-주황색 색상 그레이딩, 높은 채도, 높은 밝기, 영화적 사실주의, 고정 카메라, 16:9. 2

Atlas Cloud의 GPT Image 2 플레이그라운드, 품질 high, 16:9로 설정, 출력 패널에 생성된 Route 66 주유소 설정 샷
Atlas Cloud의 GPT Image 2: 품질 high, 16:9, 이미지 1개. 실행 버튼은 이 프레임에 대해 $0.1745를 표시했으며, 이는 2048x1152 고품질 렌더링의 실제 비용입니다. 모델 페이지의 $0.009는 최소 가격입니다.

GPT Image 2로 생성된 Route 66 주유소 설정 프레임, 청록색 하늘과 주황색 갈라진 땅, 문 옆에서 졸고 있는 직원
오프닝 프레임. 이것은 3단계의 입력이자 4단계의 시각적 대상입니다. openai/gpt-image-2로 생성됨.
3단계: 15초 벽 돌파
설정: 첫 번째 프레임 = 2단계 출력, duration을 최대 15로 드래그, 해상도 1080P.
Plain1고정된 와이드 샷 유지. 챙이 넓은 모자를 쓴 카우걸이 진짜 말을 타고 지평선에서 걸어옵니다. 졸고 있던 직원이 발굽 소리에 잠에서 깨고, 선글라스를 올리며, 똑바로 앉아 이쑤시개를 씹으며, 감탄하지 않습니다. 그녀는 깔끔하게 내려서 말을 곧장 빈티지 연료 펌프로 안내합니다. 밝은 청록색-주황색 그레이딩, 높은 채도, 사실주의, 차분한 관찰 카메라, 컷 없음. 2
드롭다운이 15에서 멈춥니다. 이것이 이 단계의 핵심입니다. 농담의 포인트는 20초로 예정되어 있으며, 이 파이프라인은 20초까지 한 조각으로 도달할 수 없습니다. 거기에 도달하려면 마지막 프레임에서 두 번째 클립을 생성해야 하며, 그렇게 하는 순간 말은 새로운 말이 됩니다.

4단계: 전체 네이티브 30초 패스 실행
Seedance 2.5 텍스트-투-비디오를 여세요.
설정: duration = 30, resolution = 720p, ratio = 16:9, generate_audio = 켜기, output_format = mp4, 워터마크 끄기.
1080p-esr이 아닌 의도적으로 720p를 선택하세요. 720p는 모델의 실제 최대치이므로, 업스케일러와의 비교가 아닌 동등한 픽셀 비교입니다.
아래 프롬프트는 알리바바의 자체 주유소 데모 프롬프트를 Wan 3.0 크리에이터 핸드북에서 충실하게 번역하고 아무것도 재구성한 것입니다. 동일한 비트, 동일한 타이밍, 동일한 카메라 원칙, 동일한 오디오 목록.
Plain1밝은 사막에 있는 햇볕에 바랜 Route 66 스타일 주유소를 배경으로 한 30초짜리 터무니없는 무표정 코미디 단편. 사실주의, 엄격한 밝은 청록색-주황색 그레이딩, 높은 채도와 높은 밝기로, 터무니없는 사건이 완전히 평범하고 거의 예쁜 세계에서 발생합니다. 카메라 언어: 차분하고 객관적인 관찰, 대부분 고정된 미디엄 와이드와 느린 수평 이동, 감정적 유도 없음, 터무니없는 비트에서 갑작스러운 극도 클로즈업으로 강조. 2 30-8초: 와이드, 고정. 청록색 하늘, 떠다니는 먼지. 복고풍 노란색-주황색-파란색 주유소가 도로 옆에 홀로 서 있습니다. 기름때 묻은 파란색 작업복과 큰 검은색 선글라스를 쓴 직원이 의자에서 졸고 있으며, 입에 이쑤시개를 물고 있습니다. 바람 소리만. 지평선에 카우걸이 진짜 말을 타고 걸어옵니다. 미디엄 컷: 발굽 소리에 그가 잠에서 깨고, 선글라스를 올리며, 앉아서 두 사람을 "또 길을 묻는 사람이군"이라고 읽습니다. 4 58-16초: 그녀는 아무 말도 하지 않습니다. 그녀는 깔끔하게 내려서 말을 곧장 오래된 연료 펌프로 안내합니다. 말은 마치 전에도 해본 적이 있는 것처럼 자연스럽게 펌프 옆에 머리를 댑니다. 그의 선글라스 뒤에서 약간 어안 렌즈 같은 POV, 여자와 말이 더욱 이상해 보입니다. 클로즈: 그의 이마가 찌푸려지고, 선글라스를 벗으며, 소리치려 합니다. 슬로우 모션 클로즈업: 선글라스가 벗겨지면서 그녀가 연료 노즐을 말의 입으로 겨누고 방아쇠를 당깁니다. 6 716-24초: 노즐의 극도 클로즈업. 휘발유 대신 싱싱한 밝은 녹색 풀이 물방울이 맺힌 채로 분출됩니다. 직원의 얼굴 극도 클로즈업으로 하드 컷, 얼어붙음: 눈이 접시처럼 커지고, 입이 약간 열리고, 이쑤시개는 씹는 것을 잊었습니다. 미디엄: 말이 행복하게 먹고, 기쁘게 눈을 가늘게 뜨고, 만족스러운 강력한 꼬리 채찍을 한 번 하고, 그 흙먼지가 여전히 멍한 직원의 얼굴에 정확히 떨어집니다. 8 924-30초: "풀 가득". 그녀는 노즐을 펌프에 다시 걸고, 주머니에서 동전을 꺼내, 가게 문으로 걸어가 카운터 위의 양철통에 동전을 덜그럭 떨어뜨립니다. 그녀는 겁에 질린 직원을 뒤돌아보고, 모자 챙 아래 입꼬리가 살짝 올라갑니다. 그녀는 다시 말에 올라 먼지 구름을 일으키며 떠납니다. 카메라는 그에게 천천히 다가갑니다: 같은 얼어붙은 자세, 얼굴에 먼지, 선글라스는 여전히 손에 쥐어져 있고, 마침내 이쑤시개가 작은 딸깍 소리와 함께 입에서 떨어집니다. 10 11오디오: 마른 사막 바람이 내내, 발굽 소리, 펌프 손잡이의 기계적 덜컹 소리, 젖은 풀이 뿜어져 나오는 소리, 꼬리 채찍 소리, 양철통에 떨어지는 동전 소리, 그리고 이쑤시개가 바닥에 닿는 작은 딸깍 소리 하나. 음악 없음, 대사 없음, 화면상 텍스트 없음. 12
청구서를 낭비하지 않게 해줄 한 가지 경고는 3단계와 동일한 함정입니다: 지속 시간 슬라이더를 30으로 드래그하세요. 숫자 상자에 30을 입력하지 마세요. 상자는 슬라이더가 5초 기본값으로 유지되는 동안 30을 표시할 수 있으며, 실행 버튼은 5초에 대한 가격을 표시합니다. 클릭하기 전에 견적을 확인하세요. 720p 및 16:9에서 5초 작업은 $1.514799로 견적되므로, 실제 30초 패스는 대략 그 6배가 견적됩니다.
이 단계에 대한 완료 실행 스크린샷은 없습니다. 세 번의 자동 캡처 시도 모두 슬라이더 기본값을 30초 대신 제출했으며, 30초라고 표시된 5초 클립을 보여주는 대신 캡처를 생략했습니다. 위의 프롬프트와 설정은 정확히 붙여넣고 설정할 내용입니다.
5단계: 드리프트를 정직하게 읽기
다음은 정확히 동일한 프롬프트에 대한 Seedance 2.5 측면으로, 네이티브 30초, 720p, 16:9, 오디오 켜짐으로 생성되었습니다.
Seedance 2.5, 동일한 Wan 3.0 주유소 프롬프트를 그대로 복사: 단일 생성에서 네이티브 30초, 1280x720, 24fps, 오디오 내장. 동일한 4비트, 카우걸과 말 도착, 연료 노즐 개그, 직원의 인지 부조화 클로즈업. 상단의 Wan 3.0 클립과 나란히 놓고 동등하게 비교해 보세요.
두 클립을 나란히 놓고 다섯 가지 특정 사항을 확인하세요. "어느 것이 더 좋아 보이는지" 확인하지 마세요. 그것은 취향 논쟁이며 오후를 낭비하게 할 것입니다.
- 코트 및 의상 정체성. 말이 29초에서 6초와 같은 색깔인가요? 선글라스는 벗었다가 다시 손에 쥐었을 때 같은 모양인가요?
- 그레이딩 안정성. 2초와 28초의 하늘을 샘플링하세요. 청록색-주황색 그레이딩은 긴 생성 동안 사람들이 예상하는 것보다 더 자주 따뜻하게 표류합니다.
- 20초의 물리적 비트. 연료 노즐에서 나오는 풀은 물리학 요청입니다. 무게감 있게 아치형으로 떨어지나요, 아니면 텍스처로 페이드 인되나요?
- 카메라 규율. 프롬프트는 고정을 요구합니다. 카메라가 요청하지 않은 푸시인을 발명하는 횟수를 세어보세요. 이것은 가장 일반적인 긴 생성 실패입니다: 모델이 예정된 이벤트를 소진하고 움직임으로 시간을 채웁니다.
- 빠른 모션 모핑. 꼬리 채찍과 먼지 차기는 클립에서 가장 빠른 움직임입니다. MindStudio 제작 노트에 따르면, 이것이 바로 디코히어런스가 집중되는 지점이며, 업스케일이 해결하지 못할 지점입니다.
분위기가 아닌 이 다섯 가지를 점수화하세요. 그것이 고객에게 변호할 수 있는 비교입니다.
Wan 3.0 vs Seedance 2.5 네이티브 30초 매칭 프롬프트 세 가지 더
데모 하나는 일화에 불과합니다. 동일한 핸드북에서 가져온 세 가지 더 공식적인 Wan 3.0 30초 파일이 있으며, 각각 30초 문제의 다른 부분을 강조합니다. 바다 괴물과 다크 판타지 독백의 경우, Seedance 2.5 측면은 동일한 프롬프트로 네이티브 30초에서 생성되었으며 각각 바로 뒤에 삽입되어 있으므로 제 말을 믿는 대신 직접 볼 수 있습니다.
| 프롬프트 | 스트레스 테스트 내용 | Wan 3.0 공식 파일, 측정됨 | Seedance 2.5 측면, 동일한 프롬프트 |
|---|---|---|---|
| 바다 괴수 재난 영화 | 30초 내에 10개의 스크립트된 샷과 오케스트라 악보 | 1920x1072, 24fps, 30.07s, AAC | 30초에서 생성, 아래에 삽입; Seedance의 콘텐츠 필터를 통과시키기 위해 IP 이름 하나와 보트 브랜드 텍스트가 제거되었으며, 스토리보드는 그 외에는 동일합니다. |
| 다크 판타지 영어 독백 | 느린 연속 푸시에서 네이티브 영어 음성 및 립싱크 | 1280x720, 24fps, 30.05s, AAC | 프롬프트를 그대로 30초에서 생성, 아래에 삽입 |
| 2D 스포츠 애니메이션, 두 줄 프롬프트 | 모델이 거의 지시 없이 30초를 채울 수 있는가 | 1280x720, 24fps, 30.05s, AAC | 여기서 생성되지 않음; 시간 경과에 따른 구조를 읽기 위해 Wan 전용 프레임 그리드로 표시 |
| 윕팬 코미디 단편 (제외됨) | 컷 없이 8개의 윕팬과 8개의 감정 비트 | 1280x720, 24fps, 30.04s, AAC | 실행되지 않음: 대사 밀도가 중국어 특화, 영어 재작성은 공정한 동등 비교가 아님 |
공식 Wan 3.0 데모: 하나의 30초 패스 안에 10개의 스크립트된 샷과 전체 오케스트라 빌드, 1920x1072. 이것은 720p 업스케일이 발명하는 것이지 해결하지 못하는 물의 부피와 생물의 젖은 피부 디테일 때문에 네이티브 1080p에 대한 가장 강력한 주장입니다. 알리바바 Tongyi 크리에이터 핸드북, 비교 및 논평을 위해 사용됨.
Seedance 2.5, 동일한 10샷 재난 프롬프트를 네이티브 30초, 사운드 켜짐. 폭풍에 흔들리는 어선, 겁에 질린 선원, 솟아오르는 너울, 그리고 번개 속에서 수면을 깨고 나오는 심해 괴수. IP 참조 하나와 선체 브랜드 텍스트가 Seedance의 콘텐츠 필터를 통과시키기 위해 제거되었으며, 스토리보드는 그 외에는 동일하므로, 물의 부피와 젖은 피부 디테일이 위의 Wan 3.0 클립에 대한 공정한 동등 비교가 됩니다.
공식 Wan 3.0 데모, 사운드 켜짐. 네이티브 영어 악당 대사, "Ripe enough for the void", 컷 없이 단일 느린 상향 틸트로 전달. 영어 사용 팀이 테스트해야 할 클립입니다. 음성, 립싱크 및 30초 연속 카메라 무브가 모두 동시에 유지되어야 하기 때문입니다.
Seedance 2.5, 동일한 다크 판타지 프롬프트를 그대로 복사, 네이티브 30초, 사운드 켜짐. 동일한 보라색 눈의 악당, 별 룬 문양, 그의 열린 손바닥에 형성되는 그림자 성운, 그리고 두 개의 영어 대사. Wan 3.0 측면에서처럼 립싱크와 단일 연속 푸시가 전체 30초 동안 유지되는지 확인하세요.
이 프롬프트의 매칭된 Seedance 2.5 측면을 실행하는 경우, 두 개의 영어 대사를 그대로 유지하고 제작 노트의 억양 특성을 기억하세요: "American English"가 아닌 "American"을 작성하세요. "English"라는 단어는 전달을 영국식 발음으로 다시 끌어당깁니다.
세 번째는 조용한 놀라움입니다. 알리바바 핸드북의 2D 스포츠 애니메이션 프롬프트는 두 줄입니다. 타임스탬프, 샷 목록 없이, 단지 샌드백을 치는 피곤하고 고통스러운 권투 선수입니다. 이것으로 30초를 만드는 것은 모델이 자체 구조를 발명할 수 있는지에 대한 진정한 테스트입니다. 여기서는 자체 실행 시간에 걸쳐 샘플링되었습니다:

공식 Wan 3.0 2D 스포츠 애니메이션 데모의 네 프레임, 약 1, 10, 20, 29초에 샘플링됨. 전체 30초에 걸쳐 권투 선수의 디자인과 체육관 배경을 보여줍니다.
공식 Wan 3.0 2D 스포츠 애니메이션 데모의 네 프레임, 약 1, 10, 20, 29초에 샘플링됨. 프롬프트가 요청하지 않은 와이드에서 클로즈업으로의 변화에도 불구하고 동일한 캐릭터 디자인, 동일한 탱크탑, 동일한 샌드백, 동일한 사물함 행. 클립이 아닌 정지 그리드로 표시한 이유는 비교가 움직임이 아닌 하나의 파일 내 시간 경과에 따른 것이기 때문입니다.
실용적인 해석: 두 줄 프롬프트로 모델은 자체 커버리지를 발명했으며, 고정된 와이드에서 땀과 피로의 클로즈업으로 이동하면서 캐릭터 디자인을 유지했습니다. 이것이 좋은 소식입니다. 대가는 언제 무슨 일이 일어날지에 대한 통제권을 포기했다는 것입니다. 특정 초에 특정 비트를 맞추기 위해 30초가 필요하다면 타임스탬프를 작성하세요.
둘 중 하나를 지불하기 전에 네이티브 30초 스토리텔링을 무료로 테스트하세요
Seedance 2.5에서 30초 720p 실행은 실제 해상도를 카탈로그 최소 가격 대신 가격을 매기면 약 $9 정도 견적됩니다. Wan 3.0의 가격표에서 30초 1080p 실행은 $6.00입니다. 제작 표준으로는 둘 다 비싸지 않지만, 3.2대 1의 촬영 비율에서는 하나의 클립을 구매하는 것이 아니라 세 개 또는 네 개를 구매하는 것입니다.
지출하기 전에 더 저렴한 질문에 답하는 것이 좋습니다: 내 스크립트가 실제로 하나의 연속 샷으로 유지되는가? 대부분의 30초 실패는 모델 실패가 아닙니다. 구조 실패입니다. 세 개의 비트가 두 개를 위한 공간에 쑤셔 넣어졌거나, 26초에 작성된 결말이 8초에서 20초를 아무것도 전달하지 못한 경우입니다.
Atlas Cloud의 무료 AI 광고 스킷 생성기는 이에 대해 무료로 답변합니다. 하나의 제품 설명과 각각 8MB 미만의 최대 4개의 제품 사진을 제공하고, 6가지 스타일(재미있는 밈, 반전, 시트콤, 감동, 럭셔리, 또는 하드 셀) 중 하나를 선택하면, 먼저 두 캐릭터 스크립트를 작성하고, 3초 후크, 갈등 및 반전을 만든 다음, 모든 샷을 해당 스크립트를 기반으로 구축합니다. 캐릭터는 대사를 큰 소리로 말하고 음향 효과는 비디오에 렌더링됩니다.
정직한 한계: 30초가 아닌 15초이며, 로그인이 필요하고, 크레딧을 충전하기 전에 무료 생성 한 번만 가능합니다. 하지만 후크, 갈등 및 반전이 있는 15초는 세 개의 비트가 숨 쉴 수 있는지 알려줍니다. 구조가 거기서 작동한다면, 동일한 비트를 가져와 1단계의 0-8s / 8-16s / 16-24s / 24-30s 구조에 늘리고, 실제 네이티브 30초 패스에 $9를 지출하세요.
Wan 3.0 vs Seedance 2.5에서 네이티브 30초 클립의 실제 비용
| 설정 | 요금 | 지속 시간 | 클립 하나 |
|---|---|---|---|
| Wan 3.0, 1080p 네이티브 (알리바바 클라우드 전용) | $0.20 / 초 | 30초 | $6.00 |
| Wan 3.0, 720p 네이티브 (알리바바 클라우드 전용) | $0.10 / 초 | 30초 | $3.00 |
| Wan 3.0, 480p 네이티브 (알리바바 클라우드 전용) | $0.05 / 초 | 30초 | $1.50 |
| Seedance 2.5, 720p 네이티브, Atlas Cloud | $0.30 / 초 (720p 측정, $0.134부터 나열) | 30초 | 약 $9.09 |
| GPT Image 2 오프닝 프레임, 품질 high, 2048x1152 | 이미지당 $0.009부터 나열 | 1 이미지 | 견적 $0.1745 |
실제로 결정을 내리는 비교: Wan 3.0 720p는 초당 비용이 Seedance 2.5 720p보다 저렴하며, 1080p에서는 실제 픽셀을 판매하는 유일한 모델입니다. Seedance 2.5의 대답은 50개의 참조 슬롯, 즉시 사용 가능성, 그리고 오늘 오후에 배송할 수 있는 작동하는 API입니다.
이러한 네이티브 30초 클립에 대한 출처 및 라이선스 참고 사항
이 기사의 모든 Wan 3.0 클립 및 모든 Wan 3.0 프롬프트는 알리바바가 공개적으로 배포한 Tongyi Wan 3.0 크리에이터 핸드북에서 가져왔으며, 비교 및 논평을 위해 여기에 재현되었으며, 출처를 표시하고, 수정하지 않았으며, 워터마크를 제거하지 않았습니다. Seedance 2.5 출력의 상업적 사용은 ByteDance 및 Volcengine 이용 약관에 따릅니다. Atlas Cloud 측의 API 청구 및 데이터 처리는 Atlas Cloud 자체 이용 약관에 따릅니다. 실제 사람의 초상은 이 테스트에서 어디에도 재현되지 않습니다. 클라이언트 작업을 배송하는 경우, 블로그 요약이 아닌 호출하는 특정 엔드포인트에 대한 모델 이용 약관을 읽으세요.
자주 묻는 질문
Wan 3.0의 네이티브 30초가 실제로 한 번의 패스인가요, 아니면 스티치된 클립인가요?
한 번의 패스입니다. Wan 3.0은 스마트 지속 시간 옵션을 통해 단일 생성으로 2~30초를 생성하므로, 클립이 전체 30초가 필요하지 않다고 결정할 수도 있습니다. 이것은 두 번째 클립이 첫 번째 클립의 마지막 프레임에서 시드되고 정체성이 이음새에서 드리프트되는 마지막 프레임 확장과 다릅니다.
30초에서 진정한 1080p는 Wan 3.0과 Seedance 2.5 중 어느 것인가요?
Wan 3.0입니다. 가격표에 네이티브 1080p 계층이 있으며, 알리바바의 30초 데모 파일은 1920x1072로 측정됩니다. Seedance 2.5는 네이티브로 480p와 720p만 생성합니다. 1080p, 1440p 및 4K 옵션은 720p 소스의 업스케일이며, API 문서는 4K 계층을 "네이티브 4K 생성이 아님"으로 설명합니다.
25초에 화면이 여전히 망가지나요?
그럴 수 있지만 실패 형태가 바뀌었습니다. 클립 사이의 눈에 띄는 이음새 대신, 샷 내부에서 모핑 및 디코히어런스가 발생하며, 빠른 모션 구절에 집중되며, 업스케일링이 이를 제거하지 않습니다. 문서화된 Seedance 2.5 단편 영화 제작은 3.2대 1의 촬영 비율을 기록했으므로, 커버리지로 롱테이크를 계획하세요.
어떤 모델이 더 많은 참조 자료를 사용하나요?
Seedance 2.5가 훨씬 더 많습니다: 30개의 이미지 + 10개의 비디오 + 10개의 오디오 파일, 총 50개이며, 참조 비디오 및 오디오는 각각 요청당 최대 30초로 제한됩니다. Wan 3.0의 핸드북은 참조를 20개로 제한하지만, .pdf, .ppt, .xls, .doc, .txt 파일 및 라이브 웹 페이지를 크리에이티브 입력으로 허용하는 유일한 모델입니다.
Wan 3.0에 오픈 가중치가 제공되나요?
공식적인 약속은 없습니다. 2026년 8월 공개 베타 기준으로, Wan 3.0 가중치, Hugging Face 체크포인트 또는 ComfyUI 노드는 게시되지 않았으며, 플래그십 비디오 라인에 대한 공식 오픈 가중치는 Wan 2.2에서 중단됩니다. 3.0 가중치 드롭에 대해 읽은 다른 내용은 알리바바가 달리 말할 때까지 추측으로 간주하세요.






