Pa
Paperl
Study
Embedding / VectorDB
Agent
Document Parsing
Side
Side Project
Conference
Debug
Me
लॉगिन
Embedding 학습을 위한 공부
P
paper Lee
30 सित. 2025
1 साल पहले
공부해야할 것들을 적어두기 위한 페이지입니다.
더 봐야하거나 잘못된 부분이 있다면 언제든지 태클걸어주세요!
Model & Train
Sparse
•
BM25
•
BM25F
•
BM42
Cross-Encoder (Rerank)
•
How..?
Bi-Encoder (Embedding)
•
BERT
•
RoBERTa
◦
XLM-RoBERTa (bge3 계열 모델은 위 모델 참조함)
•
DeBERTa
•
ColBERT
◦
What is Late Interaction?
◦
Multi Vector with MUVERA (FDE)
•
ModernBERT
◦
SKT A.X Encoder
•
E5, BGE-m3, mE5
Hybrid?
•
SPLADE
◦
SPLADE는 Tokenizer 영향을 많이 받는 것 같다함
◦
telepix에서도 a.x Encoder를 사용했는데, tokenizer가 좋아서 사용하는 듯
Loss
•
InfoNCE Loss
•
GISTEmbedLoss
•
Cached_contrastiveLoss (Pylate)
Train
•
pylate, Sentence-Transformer, Transformers, etc...
•
DAPT / TAPT
•
RetroMAE
Inference
•
Text Embedding Inference (TEI, Huggingface)
Method
•
Martryoshka Representation Learning
Benchmark
Task : IR, STS, NLI, Clustering
Evaluation Metric
•
Precision & Recall & F1
•
MAP(Mean Average Precision)
•
DCG
•
nDCG(normalized DCG) @K
•
MRR (Mean Reciprocal Rank)
Benchmark
•
MTEB (Embedding Benchmark)
•
K-MTEB (Korean Embedding Benchmark)
◦
Include Rerank (by. BM-K)
◦
MultiLongDocRetrieval
◦
BelebeleRetrieval
◦
PublicHealthQA
◦
Ko-StrategyQA
◦
MSMARCO
◦
MIRACL
•
AutoRAGEmbeddingBench
•
BEIR (Zeroshot)
ETC
•
FlagEmbedding for BAAI
•
PAQ
•
COIL
•
XTR
Pa
'Paperl' की सदस्यता लें
साइट को सब्सक्राइब करने पर आप नए पोस्ट आदि के नवीनतम अपडेट सबसे पहले नोटिफिकेशन और ईमेल से प्राप्त कर सकते हैं.
Slashpage में शामिल हों और 'Paperl' को सब्सक्राइब करें!
सदस्यता लें
चैनल खोलें