> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-docs-partner-nodes-consolidate.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# WanSoundImageToVideo - ComfyUI Built-in Node Documentation

> WanSoundImageToVideo 节点可根据图像生成视频内容，并支持可选的音频条件控制。

WanSoundImageToVideo 节点可根据图像生成视频内容，并支持可选的音频条件控制。它接收正面和负面条件提示词以及一个 VAE 模型来创建视频潜在表示，并可结合参考图像、音频编码、控制视频和运动参考来引导视频生成过程。

## 输入

| 参数        | 描述                                                                       | 数据类型                   | 是否必填 | 范围                    |
| --------- | ------------------------------------------------------------------------ | ---------------------- | ---- | --------------------- |
| `正面提示词`   | 正面条件提示词，用于引导生成视频中应出现的内容                                                  | CONDITIONING           | 是    | -                     |
| `负面提示词`   | 负面条件提示词，用于指定生成视频中应避免的内容                                                  | CONDITIONING           | 是    | -                     |
| `VAE`     | 用于编码和解码视频潜在表示的 VAE 模型                                                    | VAE                    | 是    | -                     |
| `宽度`      | 输出视频的宽度（像素），默认值：832，必须能被 16 整除                                           | INT                    | 是    | 16 to MAX\_RESOLUTION |
| `高度`      | 输出视频的高度（像素），默认值：480，必须能被 16 整除                                           | INT                    | 是    | 16 to MAX\_RESOLUTION |
| `长度`      | 生成视频的帧数，默认值：77，必须能被 4 整除                                                 | INT                    | 是    | 1 to MAX\_RESOLUTION  |
| `批次大小`    | 同时生成的视频数量（默认值：1）                                                         | INT                    | 是    | 1 到 4096              |
| `音频编码器输出` | 可选的音频编码，可根据声音特征影响视频生成。提供后，音频特征会被插值并用于视频生成的条件控制。                          | AUDIO\_ENCODER\_OUTPUT | 否    | -                     |
| `参考图像`    | 可选的参考图像，为视频内容提供视觉引导。该图像会被放大到指定的宽度和高度，然后编码为潜在表示。仅使用输入的第一张图像作为参考。          | IMAGE                  | 否    | -                     |
| `控制视频`    | 可选的控制视频，用于引导生成视频的运动和结构。该视频会被放大并编码，然后用于输出条件控制。仅使用前 `length` 帧。            | IMAGE                  | 否    | -                     |
| `参考动作`    | 可选的运动参考，为视频中的运动模式提供引导。如果输入超过 73 帧，则仅使用最后 73 帧。如果提供的帧数少于 73 帧，则使用中性帧填充序列。 | IMAGE                  | 否    | -                     |

## 输出

| 输出名称    | 描述                                                                                                           | 数据类型         |
| ------- | ------------------------------------------------------------------------------------------------------------ | ------------ |
| `正面提示词` | 经处理后用于视频生成并修改过的正面条件，包含音频嵌入、参考潜在表示、运动参考和控制视频条件                                                                | CONDITIONING |
| `负面提示词` | 经处理后用于视频生成并修改过的负面条件，包含音频嵌入（置为零）、参考潜在表示、运动参考和控制视频条件                                                           | CONDITIONING |
| `潜变量`   | 潜在空间中生成的视频表示，可解码为最终视频帧。潜在张量形状为 \[batch\_size, 16, latent\_t, height/8, width/8]，其中 latent\_t 由 `length` 参数派生 | LATENT       |

> 本文档由 AI 生成。如果您发现任何错误或有改进建议，欢迎贡献！ [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/WanSoundImageToVideo/zh.md)

***

**Source fingerprint (SHA-256):** `b1148cd00d8999dd6842e3c2fb13655fda8f20d5befed975a6d1652688b2807c`
