본 논문은 Document Visual Question Answering (DocVQA)에서 사용되는 기존의 고정된 상위 $k$개 문서 페이지 검색 방식의 문제점을 지적합니다. 이를 해결하기 위해, 훈련 없이 쿼리 복잡성에 따라 동적으로 검색할 페이지 수를 결정하는 ViSAR (Visual Semantic Activation Retrieval)라는 새로운 방법을 제안합니다. ViSAR는 임베딩 공간에서 쿼리 조건부 페이지 유사도 행렬을 생성하여 관련성 높은 페이지를 효율적으로 추출함으로써, 검색 지연 시간을 줄이고 답변 정확도를 유지하거나 향상시킵니다.