I/O 다이어그램

텍스트

jina-embedding-b-en-v1

벡터

파레토 프론트
30M100M300M1B3.0B657075808590bge-m3e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embedding-b-en-v1파라미터 수(로그)Spearman
이 모델
프론트에 있음
Jina AI
기타
MTEB English · sts
79.93
매개변수
110M
점수 순위
28 / 39
파레토 프론트
프론트 아래
비교할 모델을 선택하세요
논문 (1)

개요

jina-embedding-b-en-v1는 Jina AI가 공개한 최초의 텍스트 임베딩 모델입니다: 110M 파라미터의 양방향 인코더로, 영어 텍스트를 768차원 벡터로 매핑합니다. 512토큰 컨텍스트가 업계 표준이던 시기에 의미 검색, 유사도 비교, 콘텐츠 추천을 위해 설계되어 Jina의 오픈소스 임베딩 분야 진출을 확립했습니다. 모델은 이제 레거시이며, 8K+ 토큰 컨텍스트와 다국어 입력을 지원하는 v2, v3 패밀리로 대체되었습니다.

방법

모델은 T5-인코더 아키텍처와 평균 풀링을 사용해 고정된 768차원 표현을 생성합니다. 학습은 Linnaeus-Clean 데이터셋(16억 후보에서 필터링된 385M 문장 쌍)에서 2단계 대비 레시피를 따랐습니다: 먼저 텍스트 쌍의 양성(positive) 쌍에 대해 InfoNCE 손실로 의미 정렬을 학습하고, 둘째 유사하지만 의미적으로 다른 텍스트 간 판별력을 높이기 위해 트리트플렛 손실을 사용합니다. 핵심 설계 결정은 평균 풀링 전략으로, 토큰 수준 표현을 평균화해 문장의 전체 의미를 포착하는 단일 벡터를 생성합니다. 512토큰 컨텍스트 윈도우는 당시 표준이었으나, 긴 문서 애플리케이션에서의 모델 유용성을 제한합니다.

성능

STS12에서 모델은 0.751의 상관 계수를 달성해, 출시 당시 all-mpnet-base-v2와 all-minilm-l6-v2를 능가했습니다. 표준 영어 문장 임베딩 작업 전반에서 강한 성능을 보여주면서도 프로덕션에 적합한 빠른 추론 시간을 유지했습니다. 512토큰 컨텍스트 윈도우와 영어 전용 포커스는 2025년까지 표준이 된 긴 문서 및 다국어 워크로드에는 부적합하게 만들었습니다. 모델은 jina-embeddings-v2-base-en(8K 컨텍스트, 양방향 ALiBi)과 jina-embeddings-v3(570M 파라미터, 89개 언어, 작업별 LoRA 어댑터)으로 대체되었습니다.

모범 사례

이 모델은 레거시이므로 새로운 프로젝트에는 사용하지 마세요. jina-embedding-b-en-v1에서 마이그레이션할 경우, 현재 워크로드를 위해 jina-embeddings-v5-text-small로 업그레이드하세요 — 32K 토큰 컨텍스트, 89개 언어, 작업별 LoRA 어댑터를 지원합니다. 코드 특화 임베딩 필요에는 jina-code-embeddings-1.5b를 사용하세요. 모델은 최적의 성능을 위해 CUDA 지원 하드웨어가 필요하고 최대 512토큰 입력을 수용합니다. 다국어 콘텐츠, 긴 문서, 코드 중심 애플리케이션에는 부적합합니다.