Open Source Embedding Model
유료 Embedding Model (임베딩 모델) 대처할 Open Source Embedding Model (임베딩 모델)

Hugging Face (허깅 페이스)
머신 러닝 커뮤니티로 모델, 데이터 세트 그리고 애플리케이션을 협업하는 플랫폼입니다.
기계 학습 모델을 구축, 배포 및 교육하기 위한 도구와 리소스를 개발하는 프랑스계 미국 회사이자 오픈 소스 커뮤니티이다.
Hugging Face (https://huggingface.co/)

LangChain은 Hugging Face 임베딩 모델을 사용하는 다양한 방법을 지원하고 있습니다. 그 중에서 Local inference(로컬 추론 방식)을 사용해보겠습니다.
Local inference은 모델을 다운로드하고 Sentence Transformers를 사용하여 프로세스 내에서 실행합니다.
로컬에서 생성하고 처음 실행할 때 모델 가중치가 다운로드됩니다.
Embed Text (https://docs.langchain.com/oss/python/integrations/embeddings/huggingfacehub)

Hugging Face (허깅 페이스)에서 무료로 사용할 모델을 검색하겠습니다.
Search – sentence-transformers/all-mpnet-base-v2
(https://huggingface.co/models?library=transformers&sort=trending&search=sentence)

sentence-transformers/all-mpnet-base-v2 모델을 확인해 보겠습니다.
sentence-transformers/all-mpnet-base-v2 (https://huggingface.co/sentence-transformers/all-mpnet-base-v2)

LangChain에서 Hugging Face (허깅 페이스)를 사용하기 위해서 langchain-huggingface를 설치해야 합니다.
pip install -U langchain-huggingface
Hugging Face (허깅 페이스) 모델을 사용하여 임베딩(인코딩)하여 사용할 수 있습니다.

모델의 성능을 확인할 수 있습니다. 오픈 소스라 성능은 높지 않습니다. 그렇지만 무료이기 때문에 적절하게 사용한다면 좋습니다.
https://www.sbert.net/docs/sentence_transformer/pretrained_models.html


다국어 임베딩 모델 (Multilingual Embedding Model)
Hugging Face (허깅 페이스)에서 많이 사용되는 Multilingual Embedding Model (멀티링구얼 임베딩 모델, 다국어 임베딩 모델)에 대해 알아보겠습니다.
sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2
이 모델은 50개 언어를 지원합니다.
intfloat/multilingual-e5-large-instruct
이 모델은 xlm-roberta에서 제공하는 100개 언어를 지원합니다. (xlm-roberta-large에서 초기화되었고 다양한 다국어 데이터셋을 사용하여 지속적으로 학습되었습니다.)
snunlp/KR-SBERT-V40K-klueNLI-augSTS
이 모델은 서울대학교 컴퓨터언어학 연구실에서 개발한 모델입니다.
KLUE-NLI 데이터 세트와 증강된 KorSTS 데이터 세트를 추가하여 SBERT 모델을 미세 조정하였습니다.
dragonkue/snowflake-arctic-embed-l-v2.0-ko
이 모델은 Snowflake/snowflake-arctic-embed-l-v2.0 모델에 한국어 검색의 성능을 향상시키기 위해 한국어 데이터를 추가 학습하여 미세 조정하였습니다.
한국어 임베딩 모델을 비교하고 평가하는 리더보드입니다.

최신의 정보는 https://github.com/OnAnd0n/ko-embedding-leaderboard에서 확인하실 수 있습니다.
multilingual 모델 검색하기
(https://huggingface.co/models?pipeline_tag=sentence-similarity&library=transformers&sort=trending&search=multilingual)

sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2
(https://huggingface.co/sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2)


intfloat/multilingual-e5-large-instruct
(https://huggingface.co/intfloat/multilingual-e5-large-instruct)

이 모델은 xlm-roberta-large에서 초기화되었고 다양한 다국어 데이터셋을 사용하여 지속적으로 학습됩니다. xlm-roberta에서 제공하는 100개 언어를 지원하지만, 리소스가 부족한 언어는 성능 저하가 발생할 수 있습니다.

XLM-RoBERTa 모델은 100개 언어가 포함된 2.5TB의 필터링된 CommonCrawl 데이터를 기반으로 사전 학습되었습니다.

Embedding Leaderboard – Multilingual (https://huggingface.co/spaces/mteb/leaderboard)

KR 모델 검색하기
(https://huggingface.co/models?pipeline_tag=sentence-similarity&library=transformers&sort=trending&search=KR)

snunlp/KR-SBERT-V40K-klueNLI-augSTS
(https://huggingface.co/snunlp/KR-SBERT-V40K-klueNLI-augSTS)

snunlp/KR-SBERT
(https://github.com/snunlp/KR-SBERT)

서울대학교 컴퓨터언어학 연구실에서 개발한 사전 학습된 한국어 특정 Sentence-BERT model(닐스 라이머스와 이리나 구레비치 2019)
Sentence-BERT(센텐스버트, SBERT)는 기본적으로 BERT의 문장 임베딩의 성능을 우수하게 개선시킨 모델입니다. SBERT는 BERT의 문장 임베딩을 응용하여 BERT를 파인 튜닝하였습니다.

KLUE-NLI 데이터셋과 증강 KorSTS 데이터셋을 기반으로 SBERT 모델을 파인 튜닝하였습니다.
dragonkue/snowflake-arctic-embed-l-v2.0-ko
(https://huggingface.co/dragonkue/snowflake-arctic-embed-l-v2.0-ko)

'LLM Application > LangChain' 카테고리의 다른 글
| Open Source (Local) LLM - Ollama 사용하기 (0) | 2026.07.24 |
|---|---|
| RAG App 개발 - Open Source 모델 사용 (0) | 2026.07.23 |
| RAG App 개발 2 - Retrieval and Generation (검색과 생성) 하기 (0) | 2026.07.23 |
| RAG App 개발 1 - Indexing (인덱싱) 하기 (0) | 2026.07.23 |
| RAG(Retrieval-Augmented Generation) (0) | 2026.07.22 |