# Navigating the Nuances: A Fine-grained Evaluation of Vision-Language Navigation

- Author: Zehao Wang1, Minye Wu1, Yixin Cao4, Yubo Ma3, Meiqi Chen2, Tinne Tuytelaars1

- Conference / Journal: EMNLP 2024 Findings

- PDF: [https://arxiv.org/pdf/2409.17313](https://arxiv.org/pdf/2409.17313) 

[https://arxiv.org/pdf/2409.17313](https://arxiv.org/pdf/2409.17313)

- Code: [https://github.com/zehao-wang/navnuances](https://github.com/zehao-wang/navnuances) 

[GitHub - zehao-wang/navnuances: [EMNLP 2024 Findings] Navigating the Nuances: A Fine-grained Evaluation of Vision-Language Navigation](https://github.com/zehao-wang/navnuances)

---

# tl;dr

- VLN 모델의 다양한 지시 유형을 세밀하게 평가할 수 있는 프레임워크를 제시함.

- 이를 통해 수치 이해, 특정 방향 인식에서 모델의 성능 부족이 드러남.

- 발견된 문제점을 바탕으로 VLN 모델의 성능 향상을 위한 구체적 방향성을 제공함.

# Motivation

![Image](https://upload.cafenono.com/image/slashpagePost/20241103/174438_JO7VhqXtQhijP55Ekp?q=80&s=1280x180&t=outside&f=webp)

- **기존 VLN 모델의 한계**: VLN 모델이 복잡한 내비게이션 지시를 제대로 이해하고 실행하는 능력이 과대평가되었을 가능성이 있다.

    - **세밀한 평가 필요성**: VLN Task를 더 작은 단위로 쪼개어 다양한 지시 유형에 대해 세밀한 성능 평가가 필요함.

- **→ LLM 기반 평가 프레임워크 필요성:** LLM기반으로 VLN Instruction을 구성하고 세밀한 평가가 가능한 새로운 프레임워크를 제안하고자 함.

# Method

- **Context-Free Grammar(CFG)**

    - VLN Instruction의 구조를 체계적으로 정의하기 위해 CFG를 사용하여 다양한 지시 유형을 표현. (LLM을 통해 구축)

CFG = (N, T, P, S)

    - LLM 을 이용해 CFG를 Parse하고 누락된게 없는지 계속 iterate

![Image](https://upload.cafenono.com/image/slashpagePost/20241103/180255_bowuWU9pyxh5l5qCXK?q=80&s=1280x180&t=outside&f=webp)

- **Atomic Instruction Categories**

![Image](https://upload.cafenono.com/image/slashpagePost/20241103/180357_anpAz1XlyaTNzyKfSZ?q=80&s=1280x180&t=outside&f=webp)

- DC: ActionT (turning action)

- VM: ActionS (asc, desc action)

- NU: ?

- LR: P

- RR: P

- 데이터셋 구축(NAVNUANCES)

![Image](https://upload.cafenono.com/image/slashpagePost/20241103/180347_DVEgDPrrO3OyrsYKcy?q=80&s=1280x180&t=outside&f=webp)

    - 90개 가상 환경에서 각 지시 유형에 맞는 데이터를 수집하여 NAVNUANCES라는 세밀한 평가 데이터셋을 제작

1. Rule-based Candidate Path Proposing

- 유형별 조건

    - DC: 회전 각도를 기준으로 명확히 다른 방향을 제시하는 경로를 선정하여, "turn left/right/around"와 같은 지시를 만듦

    - VM: 수직 이동(Vertical Movement): 계단을 오르거나 내리는 경로를 선택하고, 가시성을 높이기 위해 시작과 종료 위치를 명확히 지정

    - NU: 수치 이해(Numerical Comprehension): 특정 순서의 위치(예: 첫 번째, 두 번째 방 등)를 지시하며, 정확한 방 번호를 포함하는 경로를 설정

    - LR: 특정 랜드마크를 중심으로 경로를 구성하여, 객체를 지나가거나 특정 객체 쪽으로 이동하도록

    - RR: 지역 인식(Region Recognition): 특정 구역이나 방에 들어가거나 나오는 지시를 통해 구역 간 이동을 유도

2. CFG-driven Instruction Crafting

3. Human Refinement

4. Linguistic Enrichment vis LLMs

# Experiment

- 다양한 VLN 모델 평가

    - NAVNUANCES 데이터셋을 활용하여 다양한 VLN 모델을 평가함. 주요 성능 차이와 문제를 분석하여 모델 간 성능 격차를 확인.

![Image](https://upload.cafenono.com/image/slashpagePost/20241103/180427_KZUZPkLfwb8wOzQXd8?q=80&s=1280x180&t=outside&f=webp)

- 카테고리별 성능 평가

    - 방향 전환, 수치 이해, 랜드마크 인식, 지역 인식, 수직 이동에 대해 세분화된 성능 지표를 통해 모델의 한계를 파악.

![Image](https://upload.cafenono.com/image/slashpagePost/20241103/180441_DX5Ny381pDUYg0iHfN?q=80&s=1280x180&t=outside&f=webp)

    - NU

        - 그냥 NU 성능비교만으로는 수치이해의 문제인지, 다른 요인에 의한건지 몰라서 추가실험

        - Agent 1

            - 단순히 공간적 배치를 이해하는 에이전트로, 방을 인식하고 진입할 수는 있지만, 방향이나 숫자에 대한 이해는 부족한 상태의 에이전트

            - 모델이 Agent 1보다 높은 성능을 보인다면, 숫자와 방향 같은 더 복잡한 지시를 일부라도 이해하고 있을 가능성을 나타냄

        - Agent 2

            - 여기에 추가로 방향 감각이 더해져 특정 측면(예: "왼쪽" 또는 "오른쪽")의 방으로 이동할 수 있는 에이전트

            -  모델이 Agent 2의 성능에 가까워진다면 숫자와 방향 모두를 이해하고 있음을 나타냄

→ 숫자 와 방향을 결합하여 이해하지 못함 (일부모델이 A1은 이김)

![Image](https://upload.cafenono.com/image/slashpagePost/20241103/195459_HkrelYlt6o2En4YwrI?q=80&s=1280x180&t=outside&f=webp)

    - LR

        - Supervised front-view models: 전면 시야만을 사용하는 지도학습 모델. 

            - Seq2Seq

        - Supervised panorama-view models: 파노라마 시야를 사용하는 지도학습 모델

            - HAMT, ScaleVLN

        - Zero-shot models enhanced with Large Multimodal Models

            - GPTx

        - toward vs past

            - 정면 시야만을 사용하더라도 강력한 시각적 특징이 object-centric instruction에 효과적일 수 있다

            - LMM 이 훨씬 잘하긴 하지만, spatial한걸 못함 (past)

                - beside에 있어도 past 했다고 생각한다거나..

![Image](https://upload.cafenono.com/image/slashpagePost/20241103/180515_NlStmG9QT8Rr56KaIZ?q=80&s=1280x180&t=outside&f=webp)

    - DC

        - directional bias

            - 특정한 방향만 높음

        - selective bias

            - Dual SR이 낮음 (L + R 둘다 있는 Inst.)

![Image](https://upload.cafenono.com/image/slashpagePost/20241103/180536_tkI6kXCdwpaVwFijlM?q=80&s=1280x180&t=outside&f=webp)

# Conclusion & Limitations

- 수치 이해의 부족, 특정 방향 개념에 대한 편향 등 주요 문제를 통해 향후 VLN 시스템 개선을 위한 방향을 제시

- Simulator의 한계로 데이터 다양성이 부족하여 NU (같은 객체 부족), LR(객체 수정 불가) 같은 데이터가 부족함

- Long Term 명령과 같은 부분을 다루지 못함

- 우리의 자동 CFG 파이프라인은 복잡한 걸 잘 못함(manual correction이 필요한 경우)

# Critiques and Questions

- 왜 Findings에 갔을까?

    - Novelty의 부족?

    - 이를 해결할 방향성을 제시하지 않아서?

- Landmark Rec는 왜이리 못하는 것일까? 

    - Landmark RxR 같은거로 성능을 향상한 모델도 있었는데

    - 그러면 저번에 말한 Image를 NLI랑 넣어주는 애는 훨씬 잘하려나?

- GPT는 왜 수직을 못할까?

For the site tree, see the [root Markdown](https://slashpage.com/all-about-tika.md).
