Beyond Multilingual Averages: MTEB-PT, a Benchmark for Portuguese Sentence Encoders
작성자
Haebom
카테고리
Empty
저자
Lucas Hideki Takeuchi Okamura, Alexandre Alcoforado, Anna Helena Reali Costa
💡 개요
이 논문은 포르투갈어 문장 인코더의 성능 평가를 위한 포르투갈어 중심의 새로운 벤치마크인 MTEB-PT를 제안합니다. 기존의 영어 또는 다국어 중심 평가가 포르투갈어 모델의 실제 성능을 제대로 반영하지 못한다는 문제점을 해결하고자 하였습니다. MTEB-PT를 통해 17개의 다양한 임베딩 모델을 평가한 결과, 포르투갈어 성능은 작업 유형에 따라 크게 달라지며, 특정 모델이 모든 작업에서 우수하지는 않다는 것을 보여줍니다.
🔑 시사점 및 한계
•
포르투갈어 텍스트 임베딩 모델의 성능을 정확하게 평가하기 위한 언어 특화 벤치마크의 중요성이 입증되었습니다.
•
다국어 모델의 순위가 포르투갈어 특정 성능을 신뢰성 있게 예측하지 못하며, 작업별 성능 편차가 크다는 점이 확인되었습니다.
•
언어 특화 파인튜닝, 특히 대조 학습 및 Matryoshka Representation Learning(MRL)을 통해 포르투갈어 성능을 향상시킬 수 있으며, 특히 STS 작업에서 효과가 두드러집니다.
•
향후 더 다양한 포르투갈어 데이터셋을 포함하거나, 더 복잡한 포르투갈어 언어 현상(예: 방언, 구어체)을 포괄하는 벤치마크 확장이 필요합니다.