Skip to main content
Block Sparse Attention 노드는 모델을 수정하여 어텐션 레이어가 입력의 모든 부분을 한 번에 처리하는 대신 가장 관련성 높은 부분에만 집중하도록 합니다. 이는 긴 시퀀스에 필요한 연산 작업을 줄여 줍니다. 절약 효과는 시퀀스 길이가 길어질수록 커지며, 짧은 시퀀스는 보통 일반(밀집) 어텐션을 사용할 때 더 빠릅니다.

입력

공통 입력

sol-attn 입력

sla 입력

vsa 입력

참고: 현재 선택된 방법에 속하는 매개변수만 인터페이스에 표시됩니다.

출력

제약 및 제한 사항

  • min_tokens보다 짧은 시퀀스, dense_blocks에 나열된 블록, 그리고 start_percent에서 end_percent 범위 밖의 샘플링 단계는 Model Attention Backend 노드에서 선택한 밀집 모델 어텐션 백엔드로 폴백됩니다.
  • vsa 방법이 선택되면 extra_tokens은 무시됩니다. VSA 가중치가 자체 희소 패턴을 기준으로 학습되었기 때문에 메시지가 로그에 기록됩니다.
  • vsa 방법은 MiniMax-H3 모델이 필요하며, 다른 모델을 사용하면 오류가 발생합니다. 모델에 to_gate_compress 레이어가 없으면 세밀 단계가 거친 분기 없이 실행되고 경고가 로그에 기록됩니다.
  • dense_blocks는 블록 인덱스를 보고하지 않는 모델에서는 무시되며, verbose가 활성화된 경우 로그에 이 사실이 기록됩니다.
  • sink_conditioning은 현재 시퀀스 길이와 일치하는 레이아웃을 보고하는 MiniMax-H3 모델에만 적용됩니다.
이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집

Source fingerprint (SHA-256): 0c34876b49a04db0ab265526e2bb5f784e150591aab631713ad2ab420a3327c4