<Picture i>、<Video k> 和 <Audio j> 标签引用参考内容。
输入
说明:
- 提示词使用每种类型从 1 开始的标签引用参考媒体:
<Picture i>用于图像,<Video k>用于视频,<Audio j>用于音频。参考内容以固定顺序呈现给模型:先是图像,然后是视频(每条音轨的<Audio j>标签紧跟在其<Video k>之前),最后是独立音频。 - 参考视频必须至少包含 5 帧(24 fps 下约 0.2 秒),否则节点会报错。视频帧数还会被限制到所选的
length,并裁剪到受支持的帧数。 - 在创建潜空间之前,请求的
length会对齐到受支持的帧数。
输出
本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑
Source fingerprint (SHA-256):
d9a444e712cdc255d7c56a3ab38d0523659f198b3228b9283a7028cfd0e4f3f9