你的手机拍到了一段完美的五秒钟片段,现在你想让它看起来像手绘的,而不是真实的。搜索如何把视频变成卡通,排名靠前的结果大多是工具的落地页,在你看到哪怕一帧证明之前就要求你先注册。
有两种 AI 方法真正能实现这一点。一种是对你已有的片段进行风格重绘,保留镜头运动和手势不变。另一种是仅凭一段文字提示从零构建全新的动漫风格片段。两者都运行在 Atlas Cloud 上,本指南会逐一讲解每种方法,包括确切的提示词、步骤,以及我们得到的结果片段。
核心要点
- 在“把视频变成卡通”这个说法下藏着两种不同的 AI 任务:对你已经拍好的素材进行风格重绘,以及根据文字生成全新的片段。
- Atlas Cloud 视频生成器中的 Video Edit 标签页可以在保留原始运动和镜头运动的同时对已有片段进行风格重绘;同样的任务也可以通过 Gemini Omni 1.1 Flash Video Edit API 运行。
- Gemini Omni 1.1 Flash Text-to-Video 可以直接根据文字提示生成全新的动漫风格片段,无需任何源素材。
- 用于风格重绘方法的源片段上限为 10 秒;生成器接受上传,而 API 需要公开的 MP4 链接。
- 像 VEED 的 Video Cartoonizer 这样知名的工具,是通过给一张单独的角色图片做动画来伪造视频转卡通的效果,而不是对你实际的素材进行风格重绘。
把视频变成卡通 vs. 视频转动漫:两种不同的 AI 任务
卡通和动漫只是两种艺术风格。真正的岔路口在于 AI 对你的素材做了什么。人们会根据想要的效果,把它搜索为把视频变成卡通、视频转动漫或视频转动漫 AI,但底层的问题是同一个:重绘还是生成?
一种路径保留你的原始片段。你上传它,指明唯一需要改变的东西,其余一切都在编辑中保留下来:人物的脸、镜头的平移、背景中的车流。结果仍然以你源素材的运动方式移动,只是被重新上色了。
另一种路径则抛弃镜头。你用文字描述一个场景,模型从零渲染它,比如动漫太空飞船追逐,或卡通狗追球,完全不涉及源素材。原始片段的任何东西都不会延续,因为一开始就不存在原始片段。
| 你拥有的 | 你想要的 | 属于哪种任务 | Atlas Cloud 上的模型 |
|---|---|---|---|
| 一段真实视频片段 | 同一镜头,呈现卡通或动漫外观 | 重绘(视频转视频) | Gemini Omni 1.1 Flash Video Edit |
| 没有素材,只有一个想法 | 从零生成全新的动漫或卡通场景 | 生成(文字转视频) | Gemini Omni 1.1 Flash Text-to-Video |
当人们说把视频变成卡通时,通常指的就是重绘这条路径,因为他们已经有值得保留的素材。
重绘真实素材:把视频变成卡通或动漫而不丢失运动
Gemini Omni 1.1 Flash Video Edit 接收你的片段和一段通俗易懂的指令,然后返回同一镜头但艺术风格已改变的版本。镜头运动保持原样。手势落在与之前相同的帧上。模型一次性读取整个片段,而不是逐帧重绘,因此进去时流畅的运动出来时依然流畅。
我们把同一段七秒的街景片段两次输入 Gemini Omni 1.1 Flash Video Edit,一次用卡通提示词,一次用动漫提示词。行走、回头朝向镜头,以及街道布局在两次处理中都保留了下来。
卡通提示词:“Restyle this clip as a flat 2D cartoon with bold outlines and warm saturated colors. Keep the same person, walking pace, camera framing, and background layout. Do not add text, dialogue, or new objects.”
动漫提示词:“Restyle this clip as Japanese anime with clean linework and cel shading. Keep the same person, motion, camera framing, and background. No new dialogue or text.”
方法 1:在 Atlas Cloud 生成器上重绘
登录 Atlas Cloud,打开 Atlas Cloud 生成器,切换到 Video Edit 标签页。从模型列表中选择 Gemini Omni Flash,上传你的片段,然后输入你想要的变化。
- 上传一段 10 秒以内的片段,保存为 MP4。
- 指明一处变化:艺术风格、一种颜色、单个物体。省略任何你希望保持原样的内容。
- 在提交前查看 Run 按钮上的价格。我们七秒的 1080p 测试片段显示为 $0.98。
- 运行编辑,并在下载前将输出与源素材逐帧对比。

如果你想要匹配参考图像,或专门使用 1.1 端点,Gemini Omni 1.1 Flash Video Edit 模型页面有它自己的 playground,提供相同的上传加提示词流程,并额外支持最多十张参考图像。同一个 Video Edit 标签页也能处理清理类任务,这也是为什么我们关于从视频中移除文字的指南也是从同一个表单开始的。
方法 2:用 3 个步骤调用 Gemini Omni Video Edit API
一旦某个提示词在生成器中运行良好,API 就能在 1.1 端点上通过脚本运行同样的任务。
步骤 1:获取你的 API 密钥。 在 Atlas Cloud 控制台中创建一个,并将其存为环境变量,绝不要放进客户端代码里。

步骤 2:查看 API 文档。 该模型的参数和身份验证信息都在API 文档中。
步骤 3:发出你的第一个请求。 提交任务:
plaintext1curl -X POST https://api.atlascloud.ai/api/v1/model/generateVideo \ 2 -H "Content-Type: application/json" \ 3 -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \ 4 -d '{ 5 "model": "google/gemini-omni-1.1-flash/video-edit", 6 "video": "https://yourdomain.com/source-clip.mp4", 7 "prompt": "Restyle this clip as Japanese anime with clean linework and cel shading. Keep the same person, motion, camera framing, and background. No new dialogue or text." 8 }'
响应会返回一个 prediction ID。轮询它,直到状态显示为 completed:
plaintext1curl https://api.atlascloud.ai/api/v1/model/prediction/<prediction_id> \ 2 -H "Authorization: Bearer $ATLASCLOUD_API_KEY"
完成后的响应会带有托管的视频链接。之后把模型字符串换成 google/gemini-omni-1.1-flash/text-to-video,相同的密钥、请求头和轮询循环依然有效,因为 Atlas Cloud 上的视频模型共用这一个 generateVideo 端点。
视频转动漫 AI:根据文字生成全新的动漫片段
有时没有素材可以重绘,只有一个想法。Gemini Omni 1.1 Flash Text-to-Video 接收一段书面场景描述,并直接将其渲染为成品片段,包含声音。
上面的片段来自这段提示词的一次 7 秒、720p 运行:“A lone samurai walks through a rain-soaked Japanese street market at night, anime style with cel shading and bold linework, neon signs reflecting in puddles, distant thunder, footsteps splashing in rhythm, one continuous tracking shot.”
描述五件事,模型就有足够信息可处理:镜头与镜头运动、艺术风格、光线、场景和动作。当措辞还比较粗糙时,先用 360p 起草,等镜头观感正确后,再把胜出的版本以 1080p 或 4K 重新运行。
这条路径从不接触源片段,所以当场景只存在于你脑海中时,就该用它。
其他 AI 视频风格迁移工具如何处理这件事(VEED 和 DomoAI)
VEED 的 Video Cartoonizer 并不会重绘你的素材。它自己的操作指南一开始就说“Create or upload a cartoon photo”,这是在单独的图像生成器中制作的,然后“the AI transfers your expressions and gestures onto the cartoon”。你原始片段中的背景、镜头运动和地点都不会延续,因为它们从来就不是模型接收到的内容的一部分。
DomoAI 的视频风格迁移更接近真正的重绘。其网站将该工具描述为可“custom art styles to any video based on text or image reference”,因此你的素材才是被转换的对象,这与 Gemini Omni 的思路相同,只是把风格图像作为可选的额外输入。
下表列出了每个工具实际使用的机制,与落地页的承诺无关。
| 工具 | 实际改变的内容 | 需要你提供什么 |
|---|---|---|
| Gemini Omni 1.1 Flash Video Edit (Atlas Cloud) | 原地重绘真实片段,包含运动和背景 | 你的视频加一段书面指令 |
| VEED Video Cartoonizer | 将你的运动转移到单独一个卡通角色上 | 你的视频加一张预先制作好的角色图像 |
| DomoAI AI Video Style Transfer | 将你已有素材转换为所选风格 | 你的视频加文字或图像参考 |
让卡通或动漫观感更干净的视频风格迁移提示词技巧
Gemini Omni 1.1 Flash 更青睐范围狭窄的指令。指明唯一要改变的东西,然后列出所有必须在编辑中保留下来的内容。像“make this better”这样的提示词等于允许模型重新诠释整个场景,而结构化的保留指令则能让编辑保持受控。
| 提示词习惯 | 为什么有效 |
|---|---|
| 先说明变化:“Restyle as anime with cel shading” | 模型清楚知道允许什么发生改变 |
| 列出要保留的内容:人物、运动、镜头、背景、音频 | 不会有任何东西被意外改写 |
| 先用 5 秒单镜头片段测试,再用更长片段 | 更容易逐帧检查漂移 |
| 运行一次,检查,然后再做一处更改 | 在一个提示词中叠加多个更改会提高失败率 |
关于保留契约式提示词的更深入拆解,Atlas Cloud 的 Gemini Omni 1.1 Flash 视频编辑指南逐帧讲解了三组测试案例。
把视频变成卡通或动漫时的常见问题(以及修复方法)
有几个问题出现得足够频繁,值得在它们耗费一次渲染之前提前规划。
| 问题 | 发生原因 | 修复方法 |
|---|---|---|
| 人物的脸随着风格一起改变 | 提示词描述了整个场景,而不是只指明一处变化 | 只指明风格,然后把脸部和身份列为需要保留的内容 |
| 运动看起来僵硬或延迟 | 风格请求与源素材原有的节奏发生冲突 | 保持风格请求简单,不要在同一提示词中加入新的镜头运动 |
| 原始对白消失或不同步 | 声音和口型同步无法保证在重绘后保留 | 先用无声片段测试,如果对白重要,请单独保留原始音轨 |
| 文字转视频生成的动漫片段看起来太普通 | 提示词省略了镜头方向或光线 | 加入真正的摄影术语:镜头类型、镜头运动、光线,并描述音频 |
常见问题
在 Atlas Cloud 上用 AI 把视频变成卡通或动漫要多少钱?
使用 Gemini Omni 1.1 Flash Video Edit 重绘已有片段按源视频每秒计费:360p 档为每秒 $0.041,高于 1080p 最高为每秒 $0.31,另有一小笔按秒计的摄取费用,以及添加参考图像时按张收取的费用。
使用 Gemini Omni 1.1 Flash Text-to-Video 根据文字生成新的动漫片段使用相同的按秒档位,从 360p 草稿的 $0.041 到 4K 的 $0.31,两种方式都有 3 秒最低时长。先用最便宜的分辨率起草,因为一次 360p 测试只花 4K 最终渲染的一小部分费用,却能在你为成品版本付费之前告诉你提示词是否有效。
视频转动漫会保留原始音频和人声吗?
并不可靠。Gemini Omni 1.1 Flash 可以在重绘的同时重新生成音频,但对白和口型同步无法保证在编辑后完好保留。先运行一段无声测试片段,并保留你的原始音轨,以便在生成版本不匹配时可以在普通编辑器中重新同步。
风格迁移编辑的源视频可以有多长?
10 秒或更短。Gemini Omni 1.1 Flash Video Edit 需要一个 10 秒或更短的公开可访问 MP4 链接,输出的时长和宽高比会与你上传的内容保持一致。对于更长的作品,请将其切成 10 秒的片段,并分别重绘每一段。
视频风格迁移和从零生成新动漫视频有什么区别?
风格迁移从你的素材开始,在保留运动的同时改变其外观。文字转视频生成则从一段书面描述开始,构建整个片段,包括镜头。当你已有的镜头就是你想保留的镜头时,选择风格迁移;当没有素材可起点时,选择文字转视频。
结论
把视频变成卡通或动漫,归根结底是根据你实际拥有的东西选择正确的任务。一段值得保留的片段需要重绘,此时 Gemini Omni 1.1 Flash Video Edit 会保留运动,只重新绘制表面。一个背后没有素材的想法则需要文字转视频生成,根据书面描述构建整个场景。
两条路径都通过同一个 Atlas Cloud API 运行,所以更难的部分是写出一段足够狭窄、能在编辑中保留下来的提示词,而不是找到正确的模型。先用一段短测试片段,指明一处变化,并在投入更长渲染之前将输出与源素材对比。要做到把视频变成仍然看起来像你的卡通或动漫素材,真正需要的就是这些。






