建筑起重机斜插入房地产看房视频一半的镜头里。婚礼视频中,餐饮服务人员从祭坛后方穿过,正好在誓言环节中间。
这些都不是叠在画面上的文字。它们原本就立在场景里。所以当你从视频中移除对象时,AI 模型并不是剥掉一层平面图层。它是在重建一段从未真正看到过的场景内容,一旦重建出错,原来人物所在的位置就会留下一道涂抹痕迹,或者一块与周围不匹配的补丁。
我们测试了一个穿过静态镜头的路人、一个位于移动镜头边缘的对象,以及一个处于复杂背景前的主体,看哪些接缝会露出来,哪些不会。

关键要点
- 从视频中移除对象或人物,意味着要在每一帧中重建他们背后的内容,而移动主体背后的空间一直在变化。
- 只绘制一次并交给跟踪器沿用的遮罩,在主体被短暂遮挡或离开画面之前都能用。大多数工具就是在这里留下拖尾涂抹。
- Atlas Cloud 的 Video Edit 标签页 可基于上传的片段和一段文字描述工作,无需遮罩或画笔:准确说出要移除什么,然后运行任务。
- 同一个 Video Edit 工具还能换入一个全新背景,而不只是擦掉站在前面的东西。
- 只移除你拥有或有权编辑的素材中的人物。
为什么从视频中移除对象或人物意味着要重建每一帧
用来从照片中擦除某物的工具只需要把一帧处理好。修补对象背后的像素,完成。
把同类逻辑用于视频,它就必须每秒做出几十次这样的判断,并且得出的结果要与其前一帧和后一帧一致。
一旦主体移动,难度就上来了。一个人走过房间,会依次经过墙、门口、书架。填补他们身后空缺的内容必须随之变化,同时还要足够稳定,让接缝从不闪烁。

大多数工具用你绘制一次的遮罩来处理,然后由一个算法在片段余下部分向前跟踪它。主体几乎不动时,这没问题。
一旦他们走过镜头,就开始变得更不稳定。跟踪器必须在每一帧中不断重新找到精确轮廓,而几个像素的漂移就足以在他们身后留下一块淡淡的拖尾补丁——这种鬼影第一次看容易忽略,一旦知道要找就会很明显。
用于从照片中移除人物的工具永远不会遇到这个问题,因为只需要把一帧处理好。把它用于视频,一次导出一帧,同样的漂移就会出现,再乘以片段拥有多少帧。
视频对象移除工具实际做什么:3 种方法对比
搜索一下就会发现,视频对象移除工具通常分为三类,而它们要求你投入的工作量差别很大。
| 方法 | 工作原理 | 需要你做什么 | 会在哪里出问题 |
|---|---|---|---|
| 绘制并跟踪遮罩(After Effects Content-Aware Fill) | 你为对象制作遮罩;填充引擎会估算其后方场景的运动,并从附近帧中拉取匹配像素 | 在主体出现的每一帧上制作遮罩,手动绘制或跟踪 | 一旦遮罩正确,填充质量就很可靠,但在长片段中让这个遮罩始终贴合移动主体,确实要花不少剪辑时间 |
| 刷一次自动跟踪(大多数网页工具) | 在主体上涂抹一次;工具自带的跟踪器会把该轮廓延续到片段余下部分 | 一个粗略轮廓;其余交给跟踪器 | 当主体被短暂遮挡、离开画面或移动很快时就会跟丢,之后有几帧填充会偏离目标 |
| 文本指令重写(Runway、Atlas Cloud) | 描述要移除什么;模型读取整个片段并重绘该区域,不涉及遮罩 | 一段文字描述,无需绘制任何东西 | 完全取决于描述措辞有多精确 |
Adobe 关于 Content-Aware Fill 的官方文档很好地解释了第一种路线:该面板具有“时间感知”能力,因此它会“分析一段时间内的帧,从其他帧合成新像素”,其对象填充模式专为像“路上的汽车”这样的移动主体而设计。问题在于,绘制并跟踪遮罩、告诉它该看哪里的人是你。
第三条路线完全跳过遮罩,也是最接近 Atlas Cloud 的 Video Edit 工具工作方式的一条。
在 Atlas Cloud 上用 AI 从视频中移除对象
在 Atlas Cloud 上,移除对象与任何其他 Video Edit 任务的工作方式相同:片段输入,附上一段文字指令,模型只重写该指令指向的部分。Seedance 2.5 默认处理该任务。它把上传的片段视为参考,而不是起点,因此输出时长会与输入相同,可直接放入时间线,无需重新调整时长。
方法 1:在 Video Edit 标签页中移除对象
- 前往 AI 视频编辑器,点击进入 Video Edit 标签页,它与面板顶部的 Generation、Extend 和 Motion 归在一起。编辑模式会让模型读取你的上传内容,而不是从空提示开始。
- 放入仍带有对象或人物的片段。
- 具体指向主体,而不是整个镜头:“移除背景中从左向右走过的人。保持其他一切不变。”提示越精确地隔离目标,模型对周围内容的改动就越少。
- 提交任务,然后以完整尺寸查看输出,而不是看时间线缩略图。慢慢拖动经过主体离开画面的位置,因为薄弱的填充往往最先在这里显现。

方法 2:通过 API 从视频中移除对象
步骤 1:获取 API 密钥。 在 Atlas Cloud 控制台 中创建一个并复制。

步骤 2:查看 API 文档。 参数、支持的格式和时长限制都在 API 文档 中。
步骤 3:发出你的第一个请求。 提交片段和指令:
plaintext1curl -X POST https://api.atlascloud.ai/api/v1/model/generateVideo \ 2 -H "Content-Type: application/json" \ 3 -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \ 4 -d '{ 5 "model": "bytedance/seedance-2.5/reference-to-video", 6 "prompt": "Remove the person walking through the background, moving from left to right. Keep everything else unchanged.", 7 "reference_videos": ["<your_clip_url>"], 8 "duration": -1, 9 "resolution": "720p" 10 }'
duration 必须保持为 -1,用于像这样的编辑提示。模型会把它理解为匹配源片段长度的指令,而不是生成新内容。
轮询任务直到完成:
plaintext1curl https://api.atlascloud.ai/api/v1/model/prediction/<prediction_id> \ 2 -H "Authorization: Bearer $ATLASCLOUD_API_KEY"
密钥以及提交并轮询的循环并非这个模型独有。Atlas Cloud 将其托管的每个模型都放在同一个 API 后面,所以之后要把这个集成指向另一个模型,只需要更改 model 字符串,代码中其他部分都不用动。
我们在 3 个困难案例中测试了如何从视频中移除人物
一个静止在纯色墙前的单个对象,是所有演示都会展示的情况。我们选了三个并非如此的案例。
一个人穿过静态镜头。 有人从固定机位画面的背景中穿过,经过栅栏、小路,或实际存在的任何东西前。
摇摄镜头边缘附近的对象。 这次摄像机本身在移动,意味着对象背后的背景也在滑动,而不只是静止等待被填补。
主体处于复杂、有纹理的背景前。 主体背后是茂密枝叶或带图案的表面,这类细节对任何模型来说都最难有把握地重建。
在这三个案例中,仅靠“目标是否消失”并不足够。要观察摄像机或主体移动时填充边缘的表现,确认画面中没有其他东西发生位移,并检查音频是否原样通过。
要从视频中移除某物时该输入什么
Atlas Cloud 的视频编辑器里没有画笔或遮罩,只有一个文本字段,所以提示几乎承担了全部工作。

准确说出要移除的东西,而不是整个场景:“the person walking”,而不是“the video”。如果它会移动,就说明怎么动:“from left to right”,或“exits the frame partway through”。静态对象只需要一个位置:“the cone in the bottom right corner”。
然后用一条指令收尾,要求其他一切保持不动。省略这部分,模型就可能比你预想的更多重新诠释镜头。
单独使用“Remove the person”往往会产生技术上正确但过于激进的编辑,有时背景被重新调整得超出了必要。“Remove the person walking through the background from left to right, keep everything else in the shot exactly as it is”则给模型一个它真正能在其中工作的边界。
同一个工具还能替换视频背景
一旦你开始描述要移除什么,再描述要在它背后放入什么,就只有一步之遥。Video Edit 标签页用同样仅靠提示的设置处理背景替换:没有遮罩,只有一段文字指令。
“Replace the background with a sunset over the ocean, keep the person in the foreground unchanged”与对象移除提示通过同一个标签页运行,并得到同样的结果:完整片段,而不是单帧,且生成长度与源片段匹配。
常见问题
我可以在线免费从视频中移除对象吗?
可以,对于短片或单个片段来说可以。Atlas Cloud 的 Video Edit 标签页基于浏览器,无需安装软件,定价按输出秒数而非固定订阅收费,所以一个短片段的成本只是完整编辑的一小部分。
在更大批量之前,先查看模型页面上的当前费率,因为促销定价会变化。
移除对象会留下模糊或鬼影吗?
只会在被重绘的区域出现,而且只有在主体背后的内容难以重建时才会。纯色墙或失焦背景会填充得很干净。
茂密枝叶、复杂图案或快速移动的摄像机会让任何模型都更难保持稳定,这正是我们在上面分别测试这些情况,而不是只测简单情况的原因。无论如何,画面其余部分都会保留原始分辨率,这与让模糊视频变清晰时一般重要的区分相同。
AI 可以移除正在移动的人物或对象,而不只是静止不动的东西吗?
可以,当模型读取整个片段而不是一次一帧时。描述运动,而不是单一瞬间:“the person walking from left to right”,而不只是“the person”,这样指令才能应用于他们实际出现在屏幕上的那些帧。
我可以在一次处理中从视频中移除多个对象或人物吗?
可以,在同一个提示中完成:在同一句或分别列出描述每一个,并告诉模型哪些不要动。一个包含多个不相关待移除内容的片段,最好分别具体说明,而不是用一条含糊指令覆盖全部。
从别人的视频中移除人物可以吗?
许可才是决定因素:你自己的素材,或你已获准编辑的素材。TikTok 的社区准则直接写明:“You should only post content you created or have the right to share”,而这个标准不会因为片段托管在哪个平台或由哪个工具编辑而改变。在这里它比文字叠加更重要,因为消失的是一个真真实实存在过的人。
结论
从视频中移除对象或人物,归根结底取决于填充能否跟上运动。绘制一次并向前跟踪的遮罩能用,直到主体移动得足够快、足够远,从它下面滑出去。
一个在重绘任何内容之前先读取整个片段的模型没有这个问题,因为它在决定用什么替代之前,已经知道主体在每一帧中实际位于哪里。先用自己的素材从最简单的情况开始,等信任结果后,再尝试移动主体或复杂背景。无论任务是为客户从视频中移除对象,还是从婚礼片段中拉掉某个人,方法都一样:准确说出要移除什么,描述它如何移动,并在运行前锁定其他一切。






