Skip to main content
Block Sparse Attention 节点会修改模型,使其注意力层仅关注输入中最相关的部分,而不是一次性处理所有内容,从而减少长序列所需的计算量。序列越长,节省越多,因为短序列通常使用普通(稠密)注意力更快。

输入

通用输入

sol-attn 输入

sla 输入

vsa 输入

注意: 界面中仅显示属于当前所选方法的参数。

输出

约束与限制

  • 短于 min_tokens 的序列、dense_blocks 中列出的块,以及采样步长在 start_percentend_percent 窗口之外时,会回退到由 Model Attention Backend 节点选择的稠密模型注意力后端。
  • 选择 vsa 方法时,extra_tokens 会被忽略。由于 VSA 权重是针对其稀疏模式训练的,因此会记录一条消息。
  • vsa 方法需要 MiniMax-H3 模型;任何其他模型都会引发错误。如果模型缺少 to_gate_compress 层,精细阶段将在没有粗分支的情况下运行,并记录一条警告。
  • 对于不报告块索引的模型,dense_blocks 会被忽略;当启用 verbose 时,日志中会注明这一点。
  • sink_conditioning 仅适用于报告与当前序列长度匹配的布局的 MiniMax-H3 模型。
本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑

Source fingerprint (SHA-256): 0c34876b49a04db0ab265526e2bb5f784e150591aab631713ad2ab420a3327c4