入力
注意
latentとguiding_latentはどちらも、(batch, channels, frames, height, width) 形状の 5D 動画 latent である必要があります。- ガイドはターゲット latent 内に収まる必要があります。ガイドのフレーム数に
latent_idxを加えた値が、ターゲット latent の終端を超えてはなりません。負のlatent_idx値も使用でき、latent の開始前にガイドを配置します。 - ガイドの空間サイズは、高さ軸と幅軸の両方で、ターゲットの空間サイズを整数で割り切れる必要があります。
- 高さの比率と幅の比率は同じ値である必要があります(正方形の比率)。正方形でない比率はエラーになります。これは、拡張と RoPE 配置が両軸で単一のダウンスケール係数を使用するためです。
出力
このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集
Source fingerprint (SHA-256):
19542500484dbc57fdbeeab8ba05bc2978246b3be5decc413825f616cab46f73