Sign In

Navigating the Nuances: A Fine-grained Evaluation of Vision-Language Navigation

T
TikaToka
  1. VLN
  2. Dataset
  3. EmbodiedAI
•
Author: Zehao Wang1, Minye Wu1, Yixin Cao4, Yubo Ma3, Meiqi Chen2, Tinne Tuytelaars1
•
Conference / Journal: EMNLP 2024 Findings

tl;dr

•
VLN 모델의 다양한 지시 유형을 세밀하게 평가할 수 있는 프레임워크를 제시함.
•
이를 통해 수치 이해, 특정 방향 인식에서 모델의 성능 부족이 드러남.
•
발견된 문제점을 바탕으로 VLN 모델의 성능 향상을 위한 구체적 방향성을 제공함.

Motivation

•
기존 VLN 모델의 한계: VLN 모델이 복잡한 내비게이션 지시를 제대로 이해하고 실행하는 능력이 과대평가되었을 가능성이 있다.
◦
세밀한 평가 필요성: VLN Task를 더 작은 단위로 쪼개어 다양한 지시 유형에 대해 세밀한 성능 평가가 필요함.
•
→ LLM 기반 평가 프레임워크 필요성: LLM기반으로 VLN Instruction을 구성하고 세밀한 평가가 가능한 새로운 프레임워크를 제안하고자 함.

Method

•
Context-Free Grammar(CFG)
◦
VLN Instruction의 구조를 체계적으로 정의하기 위해 CFG를 사용하여 다양한 지시 유형을 표현. (LLM을 통해 구축)
CFG = (N, T, P, S)
•
N: 비종결기호 (방향, 객체, 행동)
•
T: 종결기호 (방향지시어, object 이름)
•
P: 생성 규칙 (N들이 어떻게 T나 다른 N으로 변환될 수 있는지 규칙) 3~7
◦
N → T
◦
N → N
•
S: 시작 기호
•
"Walk past the red chair": ActionO + Landmark(Modifier(Attribute) + Object)
◦
LLM 을 이용해 CFG를 Parse하고 누락된게 없는지 계속 iterate
•
Atomic Instruction Categories
•
DC: ActionT (turning action)
•
VM: ActionS (asc, desc action)
•
NU: ?
•
LR: P
•
RR: P
•
데이터셋 구축(NAVNUANCES)
◦
90개 가상 환경에서 각 지시 유형에 맞는 데이터를 수집하여 NAVNUANCES라는 세밀한 평가 데이터셋을 제작
1.
Rule-based Candidate Path Proposing
•
유형별 조건
◦
DC: 회전 각도를 기준으로 명확히 다른 방향을 제시하는 경로를 선정하여, "turn left/right/around"와 같은 지시를 만듦
◦
VM: 수직 이동(Vertical Movement): 계단을 오르거나 내리는 경로를 선택하고, 가시성을 높이기 위해 시작과 종료 위치를 명확히 지정
◦
NU: 수치 이해(Numerical Comprehension): 특정 순서의 위치(예: 첫 번째, 두 번째 방 등)를 지시하며, 정확한 방 번호를 포함하는 경로를 설정
◦
LR: 특정 랜드마크를 중심으로 경로를 구성하여, 객체를 지나가거나 특정 객체 쪽으로 이동하도록
◦
RR: 지역 인식(Region Recognition): 특정 구역이나 방에 들어가거나 나오는 지시를 통해 구역 간 이동을 유도
2.
CFG-driven Instruction Crafting
3.
Human Refinement
4.
Linguistic Enrichment vis LLMs

Experiment

•
다양한 VLN 모델 평가
◦
NAVNUANCES 데이터셋을 활용하여 다양한 VLN 모델을 평가함. 주요 성능 차이와 문제를 분석하여 모델 간 성능 격차를 확인.
•
카테고리별 성능 평가
◦
방향 전환, 수치 이해, 랜드마크 인식, 지역 인식, 수직 이동에 대해 세분화된 성능 지표를 통해 모델의 한계를 파악.
◦
NU
▪
그냥 NU 성능비교만으로는 수치이해의 문제인지, 다른 요인에 의한건지 몰라서 추가실험
▪
Agent 1
•
단순히 공간적 배치를 이해하는 에이전트로, 방을 인식하고 진입할 수는 있지만, 방향이나 숫자에 대한 이해는 부족한 상태의 에이전트
•
모델이 Agent 1보다 높은 성능을 보인다면, 숫자와 방향 같은 더 복잡한 지시를 일부라도 이해하고 있을 가능성을 나타냄
▪
Agent 2
•
여기에 추가로 방향 감각이 더해져 특정 측면(예: "왼쪽" 또는 "오른쪽")의 방으로 이동할 수 있는 에이전트
•
모델이 Agent 2의 성능에 가까워진다면 숫자와 방향 모두를 이해하고 있음을 나타냄
→ 숫자 와 방향을 결합하여 이해하지 못함 (일부모델이 A1은 이김)
◦
LR
▪
Supervised front-view models: 전면 시야만을 사용하는 지도학습 모델.
•
Seq2Seq
▪
Supervised panorama-view models: 파노라마 시야를 사용하는 지도학습 모델
•
HAMT, ScaleVLN
▪
Zero-shot models enhanced with Large Multimodal Models
•
GPTx
▪
toward vs past
•
정면 시야만을 사용하더라도 강력한 시각적 특징이 object-centric instruction에 효과적일 수 있다
•
LMM 이 훨씬 잘하긴 하지만, spatial한걸 못함 (past)
◦
beside에 있어도 past 했다고 생각한다거나..
◦
DC
▪
directional bias
•
특정한 방향만 높음
▪
selective bias
•
Dual SR이 낮음 (L + R 둘다 있는 Inst.)

Conclusion & Limitations

•
수치 이해의 부족, 특정 방향 개념에 대한 편향 등 주요 문제를 통해 향후 VLN 시스템 개선을 위한 방향을 제시
•
Simulator의 한계로 데이터 다양성이 부족하여 NU (같은 객체 부족), LR(객체 수정 불가) 같은 데이터가 부족함
•
Long Term 명령과 같은 부분을 다루지 못함
•
우리의 자동 CFG 파이프라인은 복잡한 걸 잘 못함(manual correction이 필요한 경우)

Critiques and Questions

•
왜 Findings에 갔을까?
◦
Novelty의 부족?
◦
이를 해결할 방향성을 제시하지 않아서?
•
Landmark Rec는 왜이리 못하는 것일까?
◦
Landmark RxR 같은거로 성능을 향상한 모델도 있었는데
◦
그러면 저번에 말한 Image를 NLI랑 넣어주는 애는 훨씬 잘하려나?
•
GPT는 왜 수직을 못할까?
Al
Subscribe to 'All about TIKA'
AI Tech Blog with Curriculum Vitae
Subscribe
👍