Skip to main content
此节点对 LTXV-AV 模型应用跨模态(音频-视频)引导。在采样过程中,它每一步会额外执行一次前向传播,并禁用音频到视频和视频到音频的交叉注意力连接,然后将结果推向耦合预测。这增强了音视频同步性,例如唇形同步。modality_scale 的参考默认值为 3.0;将其设置为 1.0 可禁用额外的前向传播。

输入

模态引导仅应用于 sigma 值落在 start_percentend_percent 所定义范围内的采样步骤。在此范围之外,节点会原样返回去噪结果。modality_scale 为 1.0 时也会完全禁用额外的前向传播。

输出

本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑

Source fingerprint (SHA-256): 038be607c42e626a8a8f5fe336ee466d0847d43835edb71e20ff38f668069cfb