본 논문은 긴 컨텍스트를 처리하는 대규모 언어 모델(LLM)의 추론 속도를 저해하는 사전 충전(prefill) 단계를 최적화하는 RBS-Attention 기법을 제안합니다. 기존의 희소(sparse) 사전 충전 방식이 평균 정보 희석(mean dilution) 문제를 겪는 것을 극복하기 위해, RBS-Attention은 중심점 기반 선택과 반경 기반 탐색이라는 두 가지 보완적인 선택 방식을 사용하여 관련성이 높은 토큰을 놓치지 않고 더 효율적으로 블록을 선택합니다. 이를 통해 128K 길이의 컨텍스트에서 상당한 사전 충전 속도 향상과 더불어 첫 토큰 생성 시간 단축이라는 주요 성과를 달성했습니다.