# 거대 언어 모델 LLM

대규모 언어 모델(Large Language Models, LLM)은 방대한 양의 데이터로 학습한 고도의 인공지능 시스템으로, 인간과 유사한 텍스트를 이해하고 생성할 수 있다. LLM은 언어 번역, 요약부터 창의적인 글쓰기와 코딩 지원과 같은 복잡한 작업까지 다양한 작업을 수행할 수 있다.

### 학습 방식

LLM은 딥러닝 기술을 활용하여 방대한 양의 텍스트 데이터를 학습하고, 이를 기반으로 작동하는 모델이다. LLM은 여러 계층의 신경망으로 구성되며, 신경망마다 미세 조정할 수 있는 매개변수가 있다. 이러한 모델은 단어가 제공하는 컨텍스트를 기반으로 문장의 다음 단어를 예측하는 방법을 학습한다. 그리고 토큰화된 단어를 더 작은 문자 시퀀스로 분류하여 반복되는 단어에 확률 점수를 부여한다. 이후 이러한 이를 숫자로 표현하는 임베딩으로 변환된다. 훈련하는 텍스트의 양은 수십억 페이지에 달하며, 제로 샷, 자기 지도 학습 방법 등으로 문법, 의미론, 개념 관계를 학습한다.

### 핵심 개념

LLM은 데이터를 처리하고 분석하기 위해 인간의 뇌 구조와 기능을 모방한 인공 신경망을 사용한다. 특히, 트랜스포머 설계는 어텐션 메커니즘을 통해 입력 텍스트의 다양한 부분에 초점을 맞추어 언어의 복잡한 패턴과 관계를 파악한다.

- 어텐션 메커니즘(Attention Mechanism): 입력 텍스트의 각 단어(토큰) 간 관계를 분석해 문맥을 이해한다. 

- 사전 학습(Pre-training): 책, 웹사이트 등 방대한 텍스트 데이터를 활용해 문법, 문맥, 사실 및 미묘한 언어 스타일 등을 학습한다.

- 임베딩(Embedding): 텍스트를 컴퓨터가 처리할 수 있는 숫자로 변환한다.

- 미세 조정(Fine Tuning): 더 작은 특화 데이터셋을 사용하여 특정 작업이나 윤리적 지침에 맞도록 세부 조정한다.

- 다음 단어 예측: 입력된 문맥을 기반으로 다음 단어를 예측해 텍스트를 생성한다.

- 파라미터: LLM은 조정 가능한 가중치인 파라미터의 수가 매우 중요하다. 최첨단 LLM은 수십억에서 수조 개의 파라미터가 있어 복잡한 의사 결정과 다양한 언어 사용이 가능하다.

### 역사

- 트랜스포머의 등장 (2017): 구글에서 개발한 트랜스포머는 셀프 어텐션(Self-Attention) 메커니즘을 기반으로, 긴 시퀀스(Sequence)로 이루어진 데이터의 문맥을 효과적으로 파악하여 기계 번역 등에서 뛰어난 성능을 보여주었다.

- BERT와 GPT (2018):  

     -BERT는(Bidirectional Encoder Representations from Transformers)는 트랜스포머의 인코더 구조를 활용하여 문맥을 양방향으로 이해하는 데 특화되었다. 

     -GPT (Generative Pre-trained Transformer)는 디코더 구조를 활용하며 데이터를 비지도방식으로 학습하였다.

- GPT의 발전 (2019-2020): 

     -GPT-2는 15억 개의 매개변수를 활용해 높은 수준의 텍스트 생성 능력을 입증했다. 

     -GPT-3은 1,750억 개의 매개변수로 다양한 작업을 미세 조정 없이 수행했다. 

- 멀티모달 및 차세대 모델 (2023 이후):
- -GPT-4: GPT-4는 텍스트와 이미지를 결합하는 멀티모달 기능을 지원한다. 

     -Anthropic의 클로드(Claude), Google의 제미나이(Gemini) 등 다양한 모델이 등장하였다. 

- 새로운 구조의 시도: 트랜스포머 외에도 선택적 상태 공간 기반의 Mamba, Griffin 기반의 RecurrentGemma 등 새로운 아키텍처가 등장했다.

![출처: https://www.leewayhertz.com/build-private-llm/#What-are-Large-Language-Models](https://upload.cafenono.com/image/slashpagePost/20241229/102310_5dJa21E1G9BMRUEaI0?q=80&s=1280x180&t=outside&f=webp)

관련 자료

[https://www.datacamp.com/blog/what-is-an-llm-a-guide-on-large-language-models?utm_source=google&utm_medium=paid_search&utm_campaignid=19589720824&utm_adgroupid=152984013054&utm_device=c&utm_keyword=&utm_matchtype=&utm_network=g&utm_adpostion=&utm_creative=684592140452&utm_targetid=aud-2191467489830:dsa-2222697810678&utm_loc_interest_ms=&utm_loc_physical_ms=9208843&utm_content=DSA~blog~Artificial-Intelligence&utm_campaign=230119_1-sea~dsa~tofu_2-b2c_3-row-p2_4-prc_5-na_6-na_7-le_8-pdsh-go_9-nb-e_10-na_11-na&gad_source=1&gclid=Cj0KCQiA4L67BhDUARIsADWrl7HXL1iqU9tDqfKgyYZAYUb1CxqFvMAG6SX-Y70g4C8BR-Jepxt4JwsaAlVoEALw_wcB](https://www.datacamp.com/blog/what-is-an-llm-a-guide-on-large-language-models?utm_source=google&utm_medium=paid_search&utm_campaignid=19589720824&utm_adgroupid=152984013054&utm_device=c&utm_keyword=&utm_matchtype=&utm_network=g&utm_adpostion=&utm_creative=684592140452&utm_targetid=aud-2191467489830:dsa-2222697810678&utm_loc_interest_ms=&utm_loc_physical_ms=9208843&utm_content=DSA~blog~Artificial-Intelligence&utm_campaign=230119_1-sea~dsa~tofu_2-b2c_3-row-p2_4-prc_5-na_6-na_7-le_8-pdsh-go_9-nb-e_10-na_11-na&gad_source=1&gclid=Cj0KCQiA4L67BhDUARIsADWrl7HXL1iqU9tDqfKgyYZAYUb1CxqFvMAG6SX-Y70g4C8BR-Jepxt4JwsaAlVoEALw_wcB) 

[https://www.ibm.com/kr-ko/topics/large-language-models](https://www.ibm.com/kr-ko/topics/large-language-models)

[https://aws.amazon.com/what-is/large-language-model/](https://aws.amazon.com/what-is/large-language-model/) 

[https://aws.amazon.com/what-is/large-language-model/](https://aws.amazon.com/what-is/large-language-model/)

*오류, 수정, 내용 추가 등의 요청이 있는 분들은 댓글이나 자유게시판 등에 자유롭게 내용을 남겨주세요.

For the site tree, see the [root Markdown](https://slashpage.com/ai-workers.md).
