输入
通用输入
sol-attn 输入
sla 输入
vsa 输入
注意: 界面中仅显示属于当前所选方法的参数。
输出
约束与限制
- 短于
min_tokens的序列、dense_blocks中列出的块,以及采样步长在start_percent到end_percent窗口之外时,会回退到由 Model Attention Backend 节点选择的稠密模型注意力后端。 - 选择
vsa方法时,extra_tokens会被忽略。由于 VSA 权重是针对其稀疏模式训练的,因此会记录一条消息。 vsa方法需要 MiniMax-H3 模型;任何其他模型都会引发错误。如果模型缺少to_gate_compress层,精细阶段将在没有粗分支的情况下运行,并记录一条警告。- 对于不报告块索引的模型,
dense_blocks会被忽略;当启用verbose时,日志中会注明这一点。 sink_conditioning仅适用于报告与当前序列长度匹配的布局的 MiniMax-H3 模型。
本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑
Source fingerprint (SHA-256):
0c34876b49a04db0ab265526e2bb5f784e150591aab631713ad2ab420a3327c4