# LLM4Drive: A Survey of Large Language Models for Autonomous Driving

> 🚗 **LLMs와 비전 모델의 통합 활용**: LLM과 비전 모델을 결합하여 자율 주행의 이해 및 의사 결정을 강화합니다.

> 🔍 **기술 발전 평가 및 도전 과제 규명**: 현재의 기술적 진보를 평가하고 자율 주행 분야의 과제를 명확히 합니다.

> 📚 **최신 연구 동향 및 오픈 소스 자료 제공**: 연구자들을 위해 최신 개발 사항 및 관련 오픈 소스 자료를 지속적으로 업데이트합니다.

## Introduction

- 자율주행(Autonomous Driving)은 전통적으로는 모듈 기반의 시스템이었지만, 최근에는 End-to-End 시스템으로 전환하고 있다. 

    - 묘듈 기반의 시스템은 각 모듈의 오류가 누적되어 성능 저하를 가져올 수 있다.

    - 데이터 기반 End-to-End 시스템은 더 일반화된 성능을 제공함.

→ 이런 점에서 LLM은 context를 잘 이해하고, reasoning을 잘 하기 때문에 자율주행 분야에서 많은 관심을 받고 있다.

## LLM

- Internet AI에서 학습한 일반적인 상식과, 상황을 인식할 수 있는 능력을 가짐

→ LLM 자율주행 시스템에 어떻게 기여할 수 있는가?

![Image](https://upload.cafenono.com/image/slashpagePost/20250226/170057_ZkHbahUuJB7jNxTHB5?q=80&s=1280x180&t=outside&f=webp)

LLM의 주행 능력을 향상시키는 방법

1. Simulator상에서의 학습(Closed-Loop Setting)

2. Offline Dataset에서의 학습(Open-Loop Setting)

하지만, Sim2Real gap + 실제 환경에서의 데이터수집의 어려움 때문에, 운전 실력을 expert level 까지 올리는 데에는 어려움이 있다.

→ 이를 LLM이 내재하고 있는 Commonsense를 통해서 어느정도 해결할 수 있지 않을까?

## Methods

![Image](https://upload.cafenono.com/image/slashpagePost/20250226/172700_Z2FXlQNCDiKaZASrzn?q=80&s=1280x180&t=outside&f=webp)

![Image](https://upload.cafenono.com/image/slashpagePost/20250226/175109_6Cz9mNwYGsR2Fiz6qi?q=80&s=1280x180&t=outside&f=webp)

### Planning and Control

- LLM은 open-world 인지 및 추론 능력에 큰 성공을 보였다.

    - 이는 자율주행에서 decision making을 할 때 어떤 근거로 판단을 내렸는지 제공할 수 있음

        - 시스템과 기술에 대한 신뢰도를 높임

LLM을 어떻게 쓸 것인가?

**Finetuning**

- MTD-GPT

    - Multi-task decision making 문제를 sequence modeling problem으로 바꿈

        - + Mult-task dataset에서 학습 → 신호 없는 교차로 상황에서의 의사 결정 문제를 해결

        - + Single-task RL 보다 더 나은 성능

        - - 신호가 없는 교차로 장면만 사용됨 

- Driving with LLMs

    - 벡터화된 입력을 LLM에 융합하는 아키텍처를 설계.

    - 두 단계 사전 학습 및 미세 조정 방법을 사용하고, 벡터화된 표현의 한계를 가지고 있어 시뮬레이션에서만 테스트됨.

- DriveGPT4

    - 멀티모달 LLM로, 해석 가능한 자율주행을 위한 시각적 지시 조정 데이터셋을 개발.

    - 기본적인 제어 신호 예측 외에도 실시간으로 수행한 행동의 이유를 설명하는 기능을 가지며, 다양한 QA 작업에서 성능이 뛰어남.

- GPT-Driver

    - motion planning을 language modeling problem으로 변환하며, UniAD보다 더 높은 L2 메트릭 성능을 기록

    - 그러나 과거 속도 및 가속 정보를 사용하는 점에서 UniAD와의 공정한 비교가 아닐 수 있음

- UniAD.

    - 다중 모달 데이터를 통합해 자율주행의 인지와 계획을 수행하는 통합 모델

- Agent-Driver

    - LLM의 상식과 추론 능력을 활용하여 계획 능력을 향상시키는 도구 라이브러리 및 인지 메모리, 추론 엔진 설계

    -  nuScenes 데이터셋에서 더 좋은 결과를 보였으나 추론 시간 단축이 시급함.

- DriveLM

    - 정확한 제어 신호 생성을 위한 의사 결정 및 계획 모델을 사용하여 비정형 경로 신호를 텍스트로 처리

    - 이 토크나이저는 일반 비전 언어 모델에 적용 가능함.

- ChatGPT as Your Vehicle Co-Pilot.

    - LLM을 차량 보조 파일럿으로 활용해 인간의 지시에 따른 주행 지원을 제공

- LMDrive

    - 인스트럭션을 완료했는지 여부와 제어 신호를 예측하는 멀티모달 프레임워크 설계. 64K 개의 인스트럭션 데이터 클립을 포함하는 LangAuto 벤치마크를 도입

    - 이러한 다양한 접근 방식은 자율주행에 LLM을 적용하기 위한 혁신적 방법들을 보여줌

    - 각 방법은 독특한 장점과 제한점을 가지며, 특히 실험 환경이 시뮬레이션에 국한되는 경우가 많습니다.

- DriveMLM.

    - 다중 뷰 이미지, 포인트 클라우드, 텍스트 프롬프트를 활용해 고수준 주행 명령을 생성하고 Apollo 플래너와 연계

- KoMA.

    - 각 에이전트가 LLM을 활용해 주변 차량의 의도를 분석, 주행 의사결정을 향상시키는 지식 기반 다중 에이전트 프레임워크

- AsyncDriver.

    - LLM 추론 주기 제어 가능 하고 실시간 플래너와 분리하여 비동기적으로 작동 가능

    - nuPlan의 난이도 높은 시나리오에서 우수한 성능

- PlanAgent.

    - BEV 표현과 차선 지도 기반 텍스트 설명을 생성해 계층적 추론으로 주행 장면 이해와 명령 생성을 수행

- AGENTCODRIVER.

    - LLM 기반 협업형 다중 차량 주행 프레임워크

    - 복잡한 환경에서 에이전트 간 소통 및 collaboration 가능

    - life-long learning 지원

- DriveVLM.

    - 비전 언어 모델을 활용하여 자율 주행을 위한 장면 이해 및 계획 기능을 향상

- DriveVLM-Dual.

    - 위의 방법에 기존 3D perception과 planning 방법론을 결합

    - 공간추론 및 계산 문제를 해결

- RAG-Driver.

    - 검색 기반 증강을 적용한 다중 모달 LLM

    - 해설과 함께 numerical 제어 신호를 생성하며 제로샷 일반화 능력을 갖춤

    - 추가 학습 없이도 unseen 환경에서 인상적인 zero shot generalization

- LLaDA.

    - 학습 없이도 인간 운전자를 보조하고 새로운 환경에 주행 정책을 적응시키는 메커니즘

- VLP.

    - ALP: 생성된 BEV와 GT BEV를 align, 자율주행 BEV reasoning 성능을 높임

    - SLP:  ego vehicle의 query feature를 textual planning feature로 바꿈, self-driving decision making 성능을 높임

- DME-Driver.

    - VLM으로 decision making + planning-oriented perception model을 결합

    - 환경 인식 정확도와 주행 논리 설명력을 높여 인간 같은 주행 논리를 정밀 제어 명령으로 전환

**Prompt engineering**

- DiLu

    - 

- Receive Reason and React

- Drive as You Speak

- SurrealDriver

- LanguageMPC

- TrafficGPT

- Talk2BEV

- Talk2Drive

- AccidentGPT

**Metric**

### Perception

### Question Answering

### Generation

### Evaluation and Benchmark

![Image](https://upload.cafenono.com/image/slashpagePost/20250226/200038_FRDPc5e2RdgR1N9yhX?q=80&s=1280x180&t=outside&f=webp)

For the site tree, see the [root Markdown](https://slashpage.com/all-about-tika.md).
