Skip to main content
Block Sparse Attention ノードは、アテンション層が入力全体ではなく最も関連する部分のみに注目するようにモデルを変更し、長いシーケンスに必要な計算量を削減します。短いシーケンスでは通常の(密な)アテンションの方が速いことが多いため、この削減効果はシーケンス長が長くなるほど大きくなります。

入力

共通入力

sol-attn 入力

sla 入力

vsa 入力

注記: 現在選択されているメソッドに属するパラメータのみがインターフェースに表示されます。

出力

制約と制限

  • min_tokens より短いシーケンス、dense_blocks に記載されたブロック、および start_percent から end_percent の範囲外のサンプリングステップは、Model Attention Backend ノードで選択された密なモデルアテンションバックエンドにフォールバックします。
  • vsa メソッドが選択されている場合、extra_tokens は無視されます。VSA の重みはスパースパターンに対してトレーニングされているため、メッセージがログに記録されます。
  • vsa メソッドには MiniMax-H3 モデルが必要です。それ以外のモデルではエラーが発生します。モデルに to_gate_compress 層がない場合、ファインステージは粗いブランチなしで実行され、警告がログに記録されます。
  • ブロックインデックスを報告しないモデルでは dense_blocks は無視されます。これは verbose が有効な場合にログに記録されます。
  • sink_conditioning は、現在のシーケンス長に一致するレイアウトを報告する MiniMax-H3 モデルにのみ適用されます。
このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集

Source fingerprint (SHA-256): 0c34876b49a04db0ab265526e2bb5f784e150591aab631713ad2ab420a3327c4