데이터 전처리와 정규표현식

CG-VLM : Constrastive Vision-Language Alignment maskes Efficient Instruction Learner

논문명 : Constrastive Vision-Language Alignment maskes Efficient Instruction Learner 링크 : https://arxiv.org/abs/2311.17945 출간일 : 2023.11.29 저자 : Lizhao Liu, Xinyu Sun, Tianhang Xiang, Zhuangwei Zhuang, Liuren Yin, Mingkui Tan, 소속 : South China University of Technology, PengCheng Laboratory, Duke University 인용 수 : 1 코드 : https://github.com/lizhaoliu-Lec/CG-VLM (coming soon..) Abstract 주제 : LLM 모델을 vision-language instruction-following 모델로 확장 = LLM이 이미지를 더 효과적으로 이해하고 처리할 수 있게끔 한다 Challenge 텍스트만 학습된 LLM에 어떻게 이미지 정보를 효과적으로 학습시키는가 핵심 Task ViT와 LLM 간의 표현을 최대한 일치시키기 Generative image caption loss를 활용하여 Visual adapter 학습 → 이미지 세부 사항을 학습하기 어려움 ViT와 LLM의 표현을 최대한 일치시켜 세부적인 연관성에 대해 학습한다 → Contrastive + Generative → 이미지 patch 수준의 특징과 텍스트 토큰 수준의 임베딩 정렬 Image-caption dataset에서 패치-토큰 관계가 제공되지 않음 → 이미지 패치 특징과 텍스트 토큰 임베딩 간의 평균 유사도 최대화 Introduction 기존 연구 pre-trained ViT와 LLM을 결합하여 복잡한 비전 지시 작업을 수행 (CLIP의 pre-trained ViT를 주로 이용) Image-Text 정렬 단계가 필수적, vision adapter를 학습하여 정렬

최

최윤진

2024/10/31 4:23 PM

LightRAG: Simple and fast retrieval augmented generation

링크 : https://arxiv.org/abs/2410.05779 출간일 : 2024.10 저자 : Zirui Guo, Lianghao Xia, Yanhua Yu, Tu Ao, Chao Huang 코드 : https://github.com/HKUDS/LightRAG Abstract 기존 문제점 복잡한 관계나 문맥을 제대로 이해하지 못함 단편적인 답변을 제공- > 질문이 여러 주제에 걸쳐있을 때 문제 발생 ex) 전기차의 증가가 도시의 공기질과 대중교통 인프라에 어떤 영향을 미치는가? 논문 제안 텍스트 색인 및 검색 과정에 그래프 구조 도입 저수준(세부 사항), 고수준(넓은 주제)를 모두 다룰 수 있는 이중 레벨 검색 시스템 증분 업데이트 알고리즘으로 새로운 데이터만 부분적으로 업데이트 증분 업데이트(incremental update algorithm)란, 새로운 데이터만 부분적으로 업데이트 하는것을 말함 기존 RAG 시스템들과 비교하여 더 높은 검색 정확도, 더 빠른 검색 속도 제공 1. Introduction 일반적인 측면 그래프 기반 RAG 시스템을 개발하는 것이 기존 방법의 한계를 극복하는 중요한 방법임. 그래프 구조를 통합함으로써, 복잡한 관계를 더 잘 이해하고 맥락적으로 풍부한 응답 생성 방법론적 측면

Eunyoung Lee

2024/10/23 2:26 PM

Introducing Contextual Retrieval

아티클 개요 아티클 명: Introducing Contextual Retrieval 링크 : https://www.anthropic.com/news/contextual-retrieval 출간일 : 2024.9 저자 : Anthropic 소속 : Anthropic 코드 : https://github.com/anthropics/anthropic-cookbook/tree/main/skills/contextual-embeddings Introduction Problem of traditional RAG 정보를 인코딩할 때 컨텍스트를 삭제하여, 지식 베이스로부터 관련 있는 정보를 검색하는 데 실패함 Contextual Retrieval Two sub-techniques Contextual Embedding Contextual BM25 retrieval 실패 확률을 49% 줄임 reranking과 함께 사용되었을 때는 67% ❓A note on simply using a longer prompt 지식 베이스가 200,000 토큰 이하일 경우 가능 프롬프트 캐싱을 사용할 수도 있겠지만, 지식 베이스가 커지면 한계가 있음

Eunyoung Lee

2024/10/17 4:35 PM

LaVIT : UNIFIED LANGUAGE-VISION PRETRAINING IN LLM WITH DYNAMIC DISCRETE VISUAL TOKENIZATION

논문명 : UNIFIED LANGUAGE-VISION PRETRAINING IN LLM WITH DYNAMIC DISCRETE VISUAL TOKENIZATION 링크 : https://arxiv.org/pdf/2309.04669 출간일 : 2023.09 출간 학회 : ICLR 2024 저자 : Yang Jin1∗ , Kun Xu2, Kun Xu2, Liwei Chen2, Chao Liao2, Jianchao Tan2, Quzhe Huang1, Bin Chen2, Chenyi Lei2, An Liu2, Chengru Song2, Xiaoqiang Lei2, Di Zhang2, Wenwu Ou2, Kun Gai2, Yadong Mu1 소속 : Peking University, Kuaishou Technology 인용 수 : 30 코드 : https://github.com/jy0205/LaVIT https://huggingface.co/rain1011/LaVIT-7B-v2 Abstract 기존 VLM 방법 → visual input 을 prompt 로 처리 하고 text generation 을 최적화 하는것에 집중. vision 과 text 에 대한 모달리티를 다르게 처리하기 때문에 VLM 의 potential 이 많이 발현이 안됨. ❓VLM 이 image 와 text 를 동등하게 처리해줘야 한다. In this paper vision 과 language 를 통합된 형식으로 represent 해서 기존 문제를 해결함. visual tokenizer 를 이용해서 non linguistic 한 이미지를 llm 이 이해할수 있는 sequence token 으로 처리 propose LaVIT model Understanding, Generation 으로 각각 인퍼런스 가능함. Introduction (a), (b) 기존 VLM 방법들.

최

최윤진

2024/10/10 12:39 PM

The Power of Noise: Redefining Retrieval for RAG Systems

Abstract 질문과 관련이 있지만 답을 포함하지 않은 문서는 LLM의 정확도를 하락시킬 수 있음 무작위 문서(무관한 문서)를 RAG 시스템에 추가했을 때 오히려 LLM의 정확도가 상승하였음 검색된 문서의 개수가 증가할수록 성능 저하 골드 문서가 프롬프트 내애서 질문과 가까운 위치에 있을 때 정확도가 높아짐 Condition Dataset Natural Questions(NQ) dataset 구글 검색 데이터에서 실제 사용자 쿼리를 기반으로 수집된 데이터 NQ-Open dataset NQ 데이터셋과 달리 정답이 특정 Wikipedia에 직접 연결 X where did they film hot tub time machine [ "Fernie Alpine Resort" ] who has the right of way in international waters [ "Neither vessel" ] who does annie work for attack on titan [ "Marley" ] Wikipedia dataset 100단어 구절로 나뉘어 사용 Types of Documents

Eunyoung Lee

2024/10/07 2:56 PM

DetailCLIP: Detail-Oriented CLIP for Fine-Grained Tasks

ABSTRACT 주제 Detail-oriented, fine-grained task를 위한 Model 문제점 CLIP의 한계 Detail-oriented (segmentation) task에서 contrastive learning 기반 vision-language model의 한계 Global alignment에서는 뛰어나지만 fine-grained detail을 포착하는데 어려움이 있음 목적 고수준의 의미 이해 세부적인 특징 추출 Introduction CLIP 장단점 장점 Shared embedding space를 생성하는 혁신적인 접근법 Classification task에서 효과적임을 입증 단점 Contrastive loss에 의존하는 것은 image segmentation같은 정밀한 작업에 모델을 적응시키는데 있어 한계점 이유 Segmentaion과 같은 정밀한 작업을 위해서; 장면 전체에 대한 포괄적인 이해 + 픽셀 수준의 정확한 경계 구분

최

최윤진

2024/10/07 2:46 PM

Precise Zero-Shot Dense Retrieval without Relevance Labels

논문 개요 논문명: Precise Zero-Shot Dense Retrieval without Relevance Labels 링크 : https://arxiv.org/pdf/2212.10496 출간일 : 2022.12 출간 학회 : - 저자 : Luyu Gao, Xueguang Ma, Jimmy Lin, Jamie Callan 소속 : Carnegie Mellon University, University of Waterloo 인용 수 : 130 코드 : https://python.langchain.com/v0.1/docs/use_cases/query_analysis/techniques/hyde/ (비공식 코드) Abstract dense retrieval이 다양한 작업과 언어에서 효과적이고 효율적인 것으로 나타났지만, relevance label이 없는 상황에서 효과적인 fully zero-shot dense retrieval system을 만드는 것은 어려움 Hypothetical Document Embeddings (HyDE) 쿼리가 주어졌을 때, instruction-following language model(e.g. InstructGPT)가 hypothetical 문서를 생성하도록 함 문서는 relevance pattern을 포착하지만 비현실적이고 틀린 디테일을 가질 수 있음 supervised contrastively learned encoder(e.g. Contriever)가 문서를 임베딩, 벡터 유사도를 기반으로 하여 유사한 실제 문서를 retrieve 생성된 문서를 실제 코퍼스와 연결시키며, 인코더(contriever)의 dense bottleneck 현상이 부정확한 세부 사항을 필터링함 실험 결과, HyDE는 최신 unsupervised dense retriever인 Contriever의 성능 크게 능가, 다양한 작업(예: 웹 검색, QA, 사실 확인)과 언어(예: 스와힐리어, 한국어, 일본어)에서 fine-tuned된 retriever와 비교할 만한 강력한 성능을 보여줌 Introduction 기존 방법 Dense retrieval: 시멘틱 임베딩 유사도로 문서 검색 supervised dense retrieval model 성능 개선 방법 제시: negative mining, distillation, task-specific pre-training

Eunyoung Lee

2024/09/13 4:33 PM

LiLT:A Simple yet Effective Language-Independent Layout Transformer for Structured Document Understanding

LiLT: A Simple yet Effective Language-Independent Layout Transformer for Structured Document Understanding 논문명 : LiLT: A Simple yet Effective Language-Independent Layout Transformer for Structured Document Understanding 링크 : https://arxiv.org/abs/2202.13669 출간일 : 2022.02 출간 학회 : ACL 저자 : Wang, Jiapeng, Lianwen Jin, and Kai Ding 소속 : South China University of Technology, Guangzhou, China IntSig Information Co., Ltd, Shanghai, China INTSIG-SCUT Joint Laboratory of Document Recognition and Understanding, China Peng Cheng Laboratory, Shenzhen, China 인용 수 : 117 코드 : https://github.com/jpWang/LiLT https://huggingface.co/docs/transformers/main/model_doc/lilt Abstract 문제 의식 : English 에 특화된 Structured Document Understanding (SDU) 모델들만 있음 → Multi lingual SDU 모델에 Contribution DLA 태스크를 명확히 말하지 않음. Semantic Entity Recognition (SER), Relation Extraction(RE) 에 한정해서 언급 Paragraph 단위의 SER 이 DLA Task 와 같은 것으로 보임

Lighthouse

2024/09/05 3:48 PM

Improving Text Embeddings with Large Language Models

논문 개요 논문명: Improving Text Embeddings with Large Language Models 링크 : https://arxiv.org/pdf/2401.00368 출간일 : 2023.12 출간 학회 : ACL 저자 : Liang Wang, Nan Yang, Xiaolong Huang, Linjun Yang, Rangan Majumder, Furu Wei 소속 : Microsoft Corporation 인용 수 : 51 코드 : https://github.com/microsoft/unilm/tree/master/e5 Abstract 합성 데이터와 1K 학습 스텝보다 적은 스텝을 사용하여 높은 퀄리티의 텍스트 임베딩 얻는 방법 소개 기존 방법은 많은 양의 weakly-supervised text pair로 프리트레인을 하고 라벨링 된 데이터로 파인튜닝을 해야했음 proprietary(독자적) LLM을 활용하여 93개 언어에 걸쳐 임베딩 태스크를 위한 합성 데이터 생성 오픈 소스 디코더-only LLM을 합성 데이터로 standard contrastive loss로 파인튜닝 라벨링 데이터를 하나도 사용하지 않고 좋은 성능을 보임 합성 데이터와 라벨링 데이터를 섞어 파인튜닝을 더 진행하여 BEIR와 MTEB에서 sota 달성 Introduction 이전 연구들(Glove 등)에서 사전 학습된 단어 임베딩의 가중 평균이 semantic similarity를 측정하는 강력한 기준임을 보여줬지만, 이 방법들은 자연어의 풍부한 맥락 정보를 포착하지 못함(토큰 간의 관계 파악) 프리트레인 언어 모델 등장 이후 NLI 데이터셋에 BERT를 파인튜닝한 예시들: Sentence-BERT, SimCSE BGE, E5: multi-stage 학습 패러다임으로, 수십억 개의 weakly-supervised 텍스트 쌍에 대해 사전 학습 후 고품질 라벨 데이터셋에 대해 파인튜닝

Lighthouse

2024/08/16 1:57 PM

SELF-RAG: Learning to Retrieve, Generate and Critique Through Self-Reflection

안녕하세요! KPMG 라이트하우스 AI Engineer들은 매주 쏟아지는 LLM 및 모델관련 논문 스터디를 수행하고 실무에 적용해오고 있습니다. 그 중 일부를 발췌하여 여러분들께 공유드립니다. SELF-RAG: Learning to Retrieve, Generate and Critique Through Self-Reflection Abstract LLM은 자체 매개변수 지식에 의존하기 때문에 부정확한 답변을 생성하지만 RAG로 이런 문제를 줄일 수 있음 문서가 관련성이 있는지 확인하지 않은 무분별한 검색과 고정된 수의 검색 문서 통합은 성능을 저하시킴 Self-Reflective Retrieval-Augmented Generation 소개 LM을 on-demand로 상황에 맞게 검색할 수있게 학습시키고, ‘reflection token’을 사용하여 검색한 문서와 생성물을 성찰 reflection token 생성으로 추론 단계에서 LM을 제어하고 다양한 작업 요구사항에 맞춰 LM의 동작을 조정 가능 1. Introduction SELF-RAG: 온디맨드 검색과 self reflection을 통해 LLM의 생성 품질과 정확성 향상 임의의 LM을 end-to-end 방식으로 주어진 작업 입력에 대해 자체 생성 과정을 성찰하도록 학습, 태스크 아웃풋과 중간에 특별한 토큰(reflection token) 출력 Reflection 토큰은 retrieval과 critique 토큰으로 나뉘며 검색 필요성과 생성 성능을 표시

Lighthouse

2024/08/05 12:17 PM

Unlocking the Potential of LLMOps: A Practical Guide for Industry Application

In the ever-evolving landscape of artificial intelligence, Large Language Model Operations (LLM Ops) are emerging as a game-changer for businesses striving to harness the power of AI. Implementing LLM Ops effectively can propel your company to new heights, but it requires strategic planning and execution. Here are the key secrets to successfully applying LLM Ops in the industry. Understand Your Use Case: Before diving into LLM Ops, clearly define your business objectives and identify the specific problems you aim to solve. Whether it's customer service automation, content generation, or data analysis, a targeted approach ensures that the LLM's capabilities align with your needs. Data is King: Quality data is the backbone of any successful LLM application. Invest in curating, cleaning, and annotating your datasets. Ensure diversity and representativeness to avoid biases and enhance the model's performance across different scenarios. Infrastructure and Scalability: Deploying LLMs demands robust infrastructure. Leverage cloud platforms like AWS, Google Cloud, or Azure, which offer scalable resources tailored for high-computational tasks. This not only facilitates smooth operations but also accommodates future growth and increased workloads. Fine-Tuning and Customization: Generic models often fall short in specialized applications. Fine-tuning your LLM on domain-specific data can significantly improve accuracy and relevance. This step requires expertise but pays dividends in creating models that understand and predict user needs more precisely. Human-in-the-Loop: Integrate human oversight to ensure quality and reliability. Humans can provide critical feedback, correct errors, and introduce nuances that automated systems might miss. This collaborative approach enhances model trustworthiness and effectiveness. Continuous Monitoring and Iteration: LLM Ops is not a set-and-forget operation. Continuous monitoring for performance, biases, and anomalies is essential. Implement feedback loops and regularly update the model with new data to keep it relevant and accurate. Ethical Considerations: Ethics in AI cannot be overstated. Ensure transparency, fairness, and accountability in your LLM applications. Establish guidelines and frameworks to mitigate risks related to privacy, security, and societal impacts. By following these steps, businesses can unlock the full potential of LLM Ops, driving innovation and efficiency in their operations. Embrace the future of AI with confidence and transform your industry through smart, ethical, and effective LLM practices. Use Cases in the Finance Industry Automated Customer Support: LLMs can enhance customer service by providing instant, accurate responses to common inquiries. This reduces the burden on human agents and improves customer satisfaction. Fraud Detection: By analyzing transaction patterns and identifying anomalies, LLMs can help detect fraudulent activities in real-time, providing a layer of security and trust for financial institutions and their customers. Financial Forecasting: LLMs can process vast amounts of historical and real-time data to generate accurate financial forecasts. This aids in strategic planning, risk management, and decision-making.

Lighthouse

2024/07/22 3:51 PM

LLM 컨텍스트 길이 늘이기

컨텍스트 길이 늘이기 컨텍스트 길이는 언어 모델이 한 번에 처리할 수 있는 토큰의 개수입니다. LLM이 처리할 수 있는 토큰 개수는 한정적이기 때문에 요약 태스크와 같이 긴 텍스트를 다루는 태스크를 위해서는 컨텍스트 길이가 긴 모델을 사용해야 합니다. 예를 들어 LLaMA3의 경우, 컨텍스트 길이가 8192기 때문에 최대 8192개의 토큰까지 밖에 다루지 못하고 더 긴 텍스트가 들어갈 경우 아웃풋 출력을 제대로 하지 못합니다. 또한 트랜스포머 기반 LLM은 메모리 footprint와 계산 시간이 지수적으로 증가하기 때문에 기존 트랜스포머 아키텍처로는 긴 시퀀스를 처리하는 데 비용이 많이 소요됩니다. 컨텍스트 길이가 긴 한국어 LLM을 사용하고자 LLM의 컨텍스트 길이를 효율적으로 늘이기 위해 조사 및 시도해본 다양한 방법들에 대해 알아보겠습니다. 컨텍스트 길이 확장 정리 표 파인튜닝 필요 여부 확장 가능 범위 사용해봤는지 여부 LongLoRA O 8배 파인튜닝 자원 부족 Position Interpolation O 8배

Eunyoung Lee

2024/06/19 5:13 PM

MLE와 MAP로 살펴보는 딥러닝

이번 글에서는 딥러닝을 통계로 이해하는 방법인 MLE와 MAP에 대해서 살펴보겠습니다. 1. MLE MLE는 Maximum Likelihood Estimation의 약자입니다. 가능도(Likelihood) 가능도는 확률과 대비되는 개념입니다. 정육면체의 주사위의 각 면이 나올 ‘확률’은 1/6로 정의할 수 있습니다. 확률을 사용할 수 있는 이유는 확률 분포나 모델이 명확히 정의되어 있기 때문입니다. 특정 데이터가 관찰될 정도는 확률로 표현할 수 있습니다. 반면 가능도는 데이터가 미리 정의된 상황에서 어떠한 확률 분포 혹은 모델이 그것을 설명하는 정도를 측정할때 사용합니다. 예를 들어 형태를 모르는 주사위를 400번 던졌는데 1,2,3,4의 숫자만 100번씩 나온 상황이 있다고 해봅시다. 그렇다면 주사위의 모양은 정육면체가 아니라 정사면체로부터 나올 가능성이 높다고 생각할 수 있습니다. 이러한 정도를 측정할 때 가능도를 사용합니다. 아래 그림에서 특정 점에 위치하는 데이터 x 를 설명할 가능도가 높은 것은 분홍색 확률 분포라고 할 수 있습니다. 확률은 특정 모델이 정해진 상황에서 데이터를 예측하는데 사용하지만, 가능도는 데이터가 관찰된 상황에서 사용하기 때문에 딥러닝과 관련이 있습니다. 딥러닝은 MLE다. 신경망의 가중치들이 올바르게 학습될 수록, 신경망은 데이터를 더 잘 설명할 수 있습니다. 가능도가 커지고 있다고 볼 수 있습니다. 즉, 가능도를 최대화 하는 것(MLE)는 딥러닝의 목표입니다. 가능도 $L(\theta|Data)$는 조건부 확률 $P(Data|\theta)$로 계산하며 MLE 는 아래와 같이 적을 수 있습니다.

최

최윤진

2024/06/05 4:29 PM

Llama 3

이번 글에서는 메타의 LLM인 Llama3에 대해 살펴보도록 하겠습니다. LLaMA(Large Language Model Meta AI) 모델 메타의 오픈소스 LLM 모델로 2023년 2월에 Llama1이 처음 발표되었다. 트랜스포머 아키텍처를 기반으로 하며, Llama2의 경우 Llama1에서 학습 데이터를 40% 더 많이 사용하였다. 7B, 13B, 70B 등 여러 파라미터 사이즈의 모델이 존재하며, Alpaca와 Vinuca 같이 수많은 파생 모델이 존재한다. GPT-3와의 차이점 GeLU 대신 SwiGLU 활성화 함수 사용 Swish와 GLU의 조합인 활성화 함수로 실험적으로 성능이 뛰어나서 사용 Swish는 학습 가능한 파라미터인 $β$ 값에 따라 다른 특성을 가지는 활성화 함수 GLU(Gated Linear Units)는 모델이 신경망에서 정보가 흐르는 것을 선택적으로 조절할 수 있도록 해주는 방법 SwiGLU에서 β, W, b는 모두 학습 가능한 파라미터 SwiGLU(x) = x * sigmoid(β * x) + (**1** - sigmoid(β * x)) * (Wx + b) 절대 위치 임베딩 대신 Rotary Positional Embedding(RoPE) 사용 트랜스포머는 위치를 고려 못하기 때문에 위치 임베딩 추가 필요 기존 트랜스포머는 절대 위치 임베딩을 사용하여 위치에 따른 사인함수와 코사인 함수 값을 더하는 방식을 사용 RoPE는 시퀀스의 각 위치마다 고유한 값의 회전을 통하여 절대 위치 임베딩과 상대 위치 임베딩을 통합하는 방법 Root-Mean-Square(제곱평균제곱근) 레이어 정규화 사용 모델이 재스케일링에 영향을 받지 않고, 적절한 학습률을 자동으로 찾아가는 암시적 학습률 적응 능력을 갖게 됨 기본 레이어 정규화에 비하여 계산이 효율적이고 안정적 Grouped Query Attention 사용 기존 Multihead Attention에서는 계산된 key와 value 벡터를 디코딩 단계에 쓸 수 있도록 저장하는 Key-Value caching 때문에 연산에 비용이 많이 소요되고, 디코딩 단계마다 캐시를 로드하고 업데이트 해야 하기 때문에 메모리 오버헤드 발생 Grouped Query Attention은 Query를 그룹으로 나누고 각 그룹이 Key와 Value를 공유하도록 하여 긴 컨텍스트에서 어텐션 계산을 더 빨리 할 수 있도록 함

Eunyoung Lee

2024/05/10 11:15 AM

DALLE 는 어떻게 이미지를 생성할까 ?

이번 글에서는 텍스트로 이미지를 생성할 수 있는(text to image) 모델인 DALLE에 대해 살펴보도록 하겠습니다. Image Generation 이미지 생성 분야의 경우 2014년 부터 GAN이라는 모델을 기반으로 빠르게 발전해왔습니다. 현재는 사람의 그림과 AI가 생성한 그림을 구분하는 게 불가능에 가까울 정도로 고도화 된 상황입니다. 2022년에는 미드저니라는 이미지 생성 AI 모델의 작품을 이용하여 그림 대회에서 우승한 사건이 있었습니다. DALLE를 살펴보기 앞서, GenAI에 대해 먼저 살펴보도록 하겠습니다. Gen AI Representation 일반적으로는 딥러닝 모델은 데이터의 정답을 기반으로 지도학습을 수행합니다. 개와 고양이를 구분하는 분류 문제를 푸는 경우, 이 과정에서 모델은 서로 다른 클래스의 구분하는 함수를 근사합니다. 오버피팅, 언더피팅이 되지 않고 잘 학습된 모델은 새로운 데이터에 대해서도 올바르게 예측을 할 수 있습니다. 이때 모델을 보고 데이터를 잘 representation 했다고 말합니다. AlexNet은 MNIST 손글씨 데이터셋 대해 잘 분류를 해냈기 때문에 MNIST 손글씨 데이터셋에 대해 좋은 representation 가진 모델이라 할 수 있습니다. Generation 하지만 이런 Representation을 잘한다고 해서 Generation 잘 하지는 않습니다. 영어를 잘 읽고 듣는 사람이, 쓰거나 말하지 못하는 경우와 마찬가지 입니다. 그런 이유로 Generation을 잘 할 수 있도록 모델을 설계하는 분야가 GenAI로써 별도로 존재합니다. GenAI 모델은 representaion Model 의 도움을 받아 생성을 수행할 수도 있으며 단독으로 생성을 학습할 수 도 있습니다.

최

최윤진

2024/04/17 5:44 PM

데이터 전처리와 정규표현식

이번 글에서는 딥러닝 학습에서 데이터가 가지는 중요성을 살펴보고, 데이터 전처리에 사용되는 정규표현식에 대해 살펴보겠습니다. 1. 딥러닝 성공 배경 딥러닝이 성공할 수 있었던 이유는 크게 3가지 입니다. Algorithms AlexNet, CNN, RNN, Transformer, BERT, GPT .. Computation V100, A100 .. Data MNIST, CIFAR, WikiText .. Data - Model - Cuda 먼저, Backpropagation, ReLU, Dropout, CNN 과 같은 기술들을 통해 AlexNet 이 만들어졌습니다. 시계열 데이터의 경우 RNN-LSTM-Transformer-BERT/GPT 로 이어지는 모델 계보가 있습니다. 이러한 모델 아키텍쳐가 있었기 때문에 딥러닝이 성공할 수 있었습니다. 다음 Computation 능력의 경우 병렬 처리가 가능한 좋은 GPU가 덕분에 효과적으로 학습과 추론을 할 수 있었고, 이 때문에 딥러닝이 성공할 수 있었습니다. 마지막으로 데이터입니다. 딥러닝 모델과 GPU 모두 양질의 데이터가 있을 때 비로소 의미가 있습니다. MNIST, CIFAR, WikiText 와 같은 품질 좋은 거대 데이터셋이 있었기 때문에 오차 계산의 재료가 충분했습니다. 소프트웨어 개발에 있어서 코드(Code)는 딥러닝 개발에 있어서 데이터와 같습니다. 2. 데이터 & 데이터 전처리 필요성

최

최윤진

2024/03/13 7:22 PM

Embedding이란 무엇인가? 쉽게 배우는 AI

들어가며 인공지능(AI) 분야에서 'Embedding'이란 단어를 종종 듣게 됩니다. 하지만 이 용어가 무엇을 의미하는지, 왜 중요한지 이해하기 어려울 수 있습니다. 이 글에서는 Embedding이 무엇인지, 그리고 AI에서 어떻게 사용되는지 쉽게 설명해보겠습니다. Embedding의 기본 개념 AI 모델은 숫자로 된 데이터를 가지고 작동합니다. 하지만 실제 세계의 데이터, 특히 텍스트나 이미지 같은 비정형 데이터는 숫자가 아닙니다. Embedding을 통해 이러한 비정형 데이터를 AI 모델이 이해할 수 있는 형태로 변환할 수 있습니다. Embedding의 종류 텍스트 Embedding 가장 널리 알려진 형태의 Embedding입니다. 텍스트 Embedding은 단어, 문장, 문단을 수치 벡터로 변환합니다. 예를 들어, '사과'라는 단어를 [0.65, -0.23, 0.11] 같은 벡터로 나타낼 수 있습니다. 이를 통해 컴퓨터는 '사과'라는 단어의 의미를 어느 정도 이해할 수 있게 됩니다. 이미지 Embedding 이미지 Embedding은 이미지 데이터를 처리할 때 사용됩니다. 각 이미지를 대표하는 벡터로 변환하여, 이미지의 내용이나 스타일을 수치적으로 표현할 수 있습니다. 그래프 Embedding 소셜 네트워크나 추천 시스템에서 사용되는 그래프 데이터를 위한 Embedding 방법입니다. 이는 복잡한 네트워크 구조를 단순한 벡터 형태로 표현하여, 관계나 연결성 분석을 용이하게 합니다. Embedding의 활용 예시 자연어 처리 (NLP): 텍스트 Embedding은 NLP에서 필수적입니다. 이를 통해 기계 번역, 감정 분석, 챗봇 개발 등 다양한 응용이 가능합니다. 이미지 인식: 이미지 Embedding은 사진에서 객체를 인식하거나 스타일을 분석하는 데 사용됩니다. 예를 들어, 얼굴 인식 시스템이 여기에 해당합니다. 추천 시스템: 사용자와 상품 정보를 Embedding으로 변환하여, 사용자의 취향에 맞는 상품을 추천하는 데 활용됩니다. 결론 Embedding은 AI 분야에서 중요한 개념입니다. 비정형 데이터를 수치적 형태로 변환함으로써, AI 모델이 이를 이해하고, 다양한 문제를 해결하는 데 도움을 줍니다. 이러한 기술의 발전으로 인공지능은 우리 생활에 더욱 깊숙이 자리 잡게 될 것입니다.

Lighthouse

2024/01/30 9:54 AM

퍼셉트론부터 AlexNet 까지

이번 글에서는 딥러닝의 초기 구조인 퍼셉트론부터 현대 아키텍쳐의 완성이라고 볼 수 있는 AlexNet까지 살펴보며 딥러닝을 전체적으로 개괄 해보도록 하겠습니다. 딥러닝이란? 만약 세상의 모든 지식, 원리, 감각, 현상 모두를 논리적으로 풀어내서 코딩으로 구현해낸다면 완벽한 인공지능을 만들어 낼 수 있습니다. 하지만 현실적으로 불가능하기 때문에 데이터를 통해 학습시키는 머신러닝을 통해 인공지능을 구현합니다. 학습이란 데이터의 패턴이나 특징을 일반화되도록 하는 과정을 말합니다. 딥러닝은 머신러닝 방법론 중 하나로 인간의 신경망을 모방하는 방법론 입니다. 현재 대부분의 인공지능 연구는 딥러닝을 기반으로 이루어지고 있습니다. 대표적으로 기존의 머신러닝 방법들은 데이터의 특징(피처)을 지정해줘야만 데이터 학습을 진행할 수 있지만, 딥러닝은 데이터의 특성을 지정해주지 않고도 학습 시킬 수 있다는 점에서 가장 큰 차이점이 있습니다. 예를 들어 기존 머신러닝 방법은 개나 고양이 사진을 분류하기 위해서 귀 모양, 눈의 크기 같은 피처를 지정해줘야하지만 딥러닝은 단지 이미지 벡터를 넣어주면 됩니다. 특징(피처)를 선별할 필요가 없다는 딥러닝의 특성상 많은 분야에 적용이 가능합니다. 대표적으로 언어와 같은 시퀀스 데이터를 학습하는 자연어 처리, 인간의 시각을 학습하는 컴퓨터 비전과 같은 분야가 있으며 로보틱스, 음성 등의 분야에서도 활발히 적용되고 있습니다. 특히, 문서를 종합적으로 이해하는 AI 모델을 만드는 DocumentAI 의 경우 컴퓨터 비전, 자연어 처리의 여러 태스크를 혼합하여 풉니다. 대표적으로 아래와 같은 태스크가 있습니다. 자연어 처리 (NLP) 기계 독해 MRC (Machine Reading Comprehesion) 엔티티 분석 NER - (Name Entity Relation) 개체간 관계 분석 RE (Relation Extraction)

최

최윤진

2024/01/25 2:14 PM

스크래치 nanoGPT

들어가며 네이처는 매년 이슈가 된 과학자 10인, nature’s 10을 뽑습니다. 2023년 nature’s 10에 ChatGPT가 명단을 올렸습니다. 네이처는 2023년 ChatGPT 가 세상 전반에 큰 영향력을 끼쳤다고 했습니다. 더 성능이 좋고 가벼운 모델들을 개발하려는 움직임에 막대한 자본과 인력이 투입되고 있습니다. 동시에 점점 더 커지고 복잡해지는 LLM을 이해하는 것이 어려워 지고 있습니다. 이번 글에서는 GPT를 아주 간소하게 만든 nanoGPT를 만들어봄으로써 LLM의 내부 메커니즘을 파악해보겠습니다. 먼저 GPT를 잘 알기 위해서는 Transformer 모델을 알아야 합니다. 이 모델을 공식적으로 발간한 ‘Attention is all you need(NeurIPS, 2017)’ 논문은 인용수는 10만회를 넘었습니다. 이 논문을 기반으로 GPT 시리즈가 만들어졌습니다. GPT-1(2018년), GPT-2(2019년), GPT-3(2020년), InstructGPT(2022년), 그리고 2023년에 GPT-4가 나왔습니다. [Transformer] Attention Is All You Need, 2017 [GPT-1] Improving Language Understanding by Generative Pre-Training, 2018 [GPT-2] Language Models are Unsupervised Multitask Learners, 2019 [GPT-3] Language Models are Few-Shot Learners, 2020 [Instruct GPT] Training language models to follow instructions with human feedback, 2022 [GPT-4] GPT-4 Technical Report, 2023 때문에 먼저 Transformer 의 아키텍쳐를 살펴보고 nanoGPT 를 만드는 순으로 진행하겠습니다. 코드는 Andrej Karpathy 의 Let's build GPT: from scratch, in code, spelled out. 를 참고했습니다. 셰익스피어의 문체를 학습하고 생성하는 모델을 만들어보겠습니다. Before Transformer

최

최윤진

2024/01/25 1:15 PM

Langchain이란?

Langchain은 방대한 양의 텍스트 데이터를 학습하여 텍스트를 생성하고, 언어를 번역하고, 다양한 종류의 창의적인 콘텐츠를 작성하는 등 인간과 같은 방식으로 언어를 처리할 수 있습니다. Langchain은 다음과 같은 특징을 가지고 있습니다. 대규모 데이터 학습: Langchain은 수십억 개의 단어로 구성된 데이터 세트에서 학습합니다. 이러한 대규모 데이터 세트는 Langchain이 인간 언어의 복잡성을 이해하고 학습하는 데 도움이 됩니다. 텍스트 생성: Langchain은 텍스트를 생성할 수 있습니다. 예를 들어, Langchain은 시, 코드, 대본, 음악 작품, 이메일, 편지 등과 같은 다양한 종류의 창의적인 텍스트 형식을 생성할 수 있습니다. 언어 번역: Langchain은 언어를 번역할 수 있습니다. 예를 들어, Langchain은 영어에서 한국어로, 한국어에서 영어로 등 다양한 언어 간의 번역을 수행할 수 있습니다. Langchain의 응용 방안 Langchain은 다양한 분야에서 응용될 수 있습니다. 다음은 Langchain의 대표적인 응용 방안입니다. 챗봇: Langchain은 챗봇에 사용될 수 있습니다. 챗봇은 사람과 대화할 수 있는 컴퓨터 프로그램입니다. Langchain은 챗봇이 더 자연스럽고 유익한 대화를 할 수 있도록 합니다. 창의적인 콘텐츠 생성: Langchain은 창의적인 콘텐츠를 생성하는 데 사용될 수 있습니다. 예를 들어, Langchain은 시, 코드, 대본, 음악 작품, 이메일, 편지 등과 같은 다양한 종류의 창의적인 텍스트 형식을 생성할 수 있습니다. 자연어 처리: Langchain은 자연어 처리(NLP) 분야에서 사용될 수 있습니다. NLP는 컴퓨터가 인간 언어를 이해하고 처리할 수 있도록 하는 분야입니다. Langchain은 NLP의 다양한 작업에 사용될 수 있습니다. 예를 들어, Langchain은 텍스트를 분류하고, 텍스트에서 정보를 추출하고, 텍스트를 요약하는 데 사용될 수 있습니다.

Lighthouse

2023/12/12 3:57 PM

특수 문자	설명
.	줄바꿈 문자를 제외한 모든 문자와 매치
?	앞의 문자가 0번 또는 1번 나타나는 패턴과 매치
*	앞의 문자가 0번 이상 반복되는 패턴과 매치
+	앞의 문자가 1번 이상 반복되는 패턴과 매치

특수 문자	설명
^	뒤의 문자열로 문자열이 시작됩니다.
$	앞의 문자열로 문자열이 끝납니다.
{숫자}	숫자만큼 반복합니다.
{숫자1, 숫자2}	숫자1 이상 숫자2 이하만큼 반복합니다. ?, *, +를 이것으로 대체할 수 있습니다.
{숫자,}	숫자 이상만큼 반복합니다.

특수 문자	설명
[ ]	대괄호 안의 문자들 중 한 개의 문자와 매치합니다. [amk]라고 한다면 a 또는 m 또는 k 중 하나라도 존재하면 매치를 의미합니다. [a-z]와 같이 범위를 지정할 수도 있습니다. [a-zA-Z]는 알파벳 전체를 의미하는 범위이며, 문자열에 알파벳이 존재하면 매치를 의미합니다.
[^문자]	해당 문자를 제외한 문자를 매치합니다
l	AlB와 같이 쓰이며 A 또는 B의 의미를 가집니다.
\\	역 슬래쉬 문자 자체를 의미합니다
\d	모든 숫자를 의미합니다. [0-9]와 의미가 동일합니다.
\D	숫자를 제외한 모든 문자를 의미합니다. [^0-9]와 의미가 동일합니다.
\s	공백을 의미합니다. [ \t\n\r\f\v]와 의미가 동일합니다. • space character 의 단축어 • 스페이스( ``) • 탭(t) • 라인 피드 또는 새 줄(n) • 캐리지 리턴(r) • 폼 피드(f) • 수직 탭(v)
\S	공백을 제외한 문자를 의미합니다. [^ \t\n\r\f\v]와 의미가 동일합니다.
\w	문자 또는 숫자를 의미합니다. [a-zA-Z0-9]와 의미가 동일합니다. • word character 의 단축어
\W	문자 또는 숫자가 아닌 문자를 의미합니다. [^a-zA-Z0-9]와 의미가 동일합니다.

AI

1. 딥러닝 성공 배경

2. 데이터 & 데이터 전처리 필요성

3. 텍스트 데이터 전처리 방법 : 정규 표현식

3.1 re 메서드

3.2 정규 표현식 문법

📌 . ? * +

📌 ^ $ {number}

📌 [ ] [^문자] | \d \D \s \S \w \W

3.3 정규표현식을 통한 이메일 주소, URL 검증

📌 이메일 검증

📌 URL 검증

3.4 정규표현식을 통한 크롤링 텍스트 데이터 전처리

4. 마치며

참고자료