Skip to main content
ATI(Any Trajectory Instruction) 是由字节跳动团队提出的可控视频生成框架。ATI 基于 Wan2.1 实现,支持通过任意轨迹指令对视频中的物体、局部区域及摄像机运动进行统一控制。

项目仓库

GitHub 上的 ATI 源代码与文档

在线轨迹编辑工具

在图片上绘制和编辑运动轨迹的可视化工具

主要特性

  • 统一运动控制:支持物体、局部、摄像机等多种运动类型的轨迹控制。
  • 交互式轨迹编辑器:可视化工具,用户可在图片上自由绘制、编辑运动轨迹。
  • 兼容 Wan2.1:基于 Wan2.1 官方实现,环境和模型结构兼容。
  • 丰富的可视化工具:支持输入轨迹、输出视频及轨迹可视化。

WAN ATI 轨迹控制工作流示例

请确保你的 ComfyUI 已经更新。本指南里的工作流可以在工作流模板中找到。如果找不到,可能是 ComfyUI 没有更新。如果加载工作流时有节点缺失,可能原因有:
  1. 你用的不是最新版(每夜版)。
  2. 启动时有些节点导入失败。

1. 工作流下载

请先将 ComfyUI 更新到最新版本,然后下载工作流文件并拖入 ComfyUI,或在模板库的 WorkflowBrowse TemplatesVideo 中找到 “Wan2.1 ATI”。 Wan2.1 ATI 工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索 “Wan2.1 ATI”
下载下面的视频并拖入 ComfyUI 中,以加载对应的工作流 我们将使用下面的素材作为输入:

输入图片: video_wan_ati_input_image.jpg

下载默认的输入图片,或者使用你自己的图片作为起始帧。

2. 模型下载

本指南涉及的所有模型都可以在这里找到。 Diffusion Model :选择其中一个版本:

Diffusion Model: Wan2_1-I2V-ATI-14B_fp8_e4m3fn.safetensors

Wan2.1 I2V ATI 14B 扩散模型(fp8 精度)。放入 ComfyUI/models/diffusion_models/
Text Encoders :选择其中一个版本:

Text Encoder: umt5_xxl_fp16.safetensors

全精度文本编码器(质量更高,体积更大)。放入 ComfyUI/models/text_encoders/

Text Encoder: umt5_xxl_fp8_e4m3fn_scaled.safetensors

FP8 文本编码器(显存占用更低)。放入 ComfyUI/models/text_encoders/
VAE

VAE: wan_2.1_vae.safetensors

Wan2.1 VAE 模型。放入 ComfyUI/models/vae/
CLIP Vision

CLIP Vision: clip_vision_h.safetensors

用于处理参考图像的 CLIP Vision 模型。放入 ComfyUI/models/clip_vision/
如果你没有成功下载工作流中的模型文件,可以尝试使用下面的链接手动下载 Diffusion Model VAE Text encoders Chose one of following model clip_vision 文件存放位置

3. 按步骤完成工作流的运行

工作流步骤图 请参照图片序号进行逐步确认,来保证对应工作流的顺利运行
  1. 确保Load Diffusion Model节点加载了 Wan2_1-I2V-ATI-14B_fp8_e4m3fn.safetensors 模型
  2. 确保Load CLIP节点加载了 umt5_xxl_fp8_e4m3fn_scaled.safetensors 模型
  3. 确保Load VAE节点加载了 wan_2.1_vae.safetensors 模型
  4. 确保Load CLIP Vision节点加载了 clip_vision_h.safetensors 模型
  5. Load Image 节点上传提供的输入图片
  6. 轨迹编辑: 目前 ComfyUI 中还未有对应的轨迹编辑器,你可以使用下面的链接来完成轨迹编辑
  7. 如果你需要修改提示词(正向及负向)请在序号5CLIP Text Encoder 节点中进行修改
  8. 点击 Run 按钮,或者使用快捷键 Ctrl(cmd) + Enter(回车) 来执行视频生成