본 논문은 대화형 기억력 측정 방식의 한계를 지적하며, 실제 도구 사용 LLM 에이전트의 장기 기억 효용성을 비용을 고려하여 평가하는 새로운 벤치마크 MERIT를 제안합니다. MERIT는 에피소드 기반의 도구 사용 과제를 통해 기억이 작업 수행에 미치는 영향을 측정하고, 각 기억 연산의 비용을 계량합니다. 실험 결과, 기억은 특정 과제의 성공률을 크게 향상시키지만, 최신 사실에 대한 검색 및 활용은 임베딩 기반 검색의 불확실성과 낮은 활용률로 인해 비효율적임을 보여줍니다.