Elastic
Jina AI
모델
API
keyboard_arrow_down
Reader
어떤 URL이든 Markdown으로 변환하여 LLM 그라운딩을 개선하세요.
Embeddings
멀티모달 및 다국어 임베딩.
Reranker
검색 관련성을 극대화하는 리랭커.
Elastic Inference Service
Jina 모델을 Elasticsearch에서 네이티브 방식으로 실행하세요.
MCP
terminal
CLI
article
llms.txt
smart_toy
에이전트
data_object
스키마
menu_book
문서
로그인
login
warning
이 모델은 최신 모델로 대체되어 더 이상 권장되지 않습니다.
Embeddings
아파치 2.0 라이선스

jina-embedding-b-en-v1

Jina Embedding 모델의 첫 번째 버전, 바로 그 원조(OG)입니다.
라이선스
Apache-2.0
출시일
calendar_month
2023-06-17
입력
abc
텍스트
arrow_forward
출력
more_horiz
벡터
모델 세부정보
매개변수: 110M
입력 토큰 길이: 512
출력 크기: 768
기본 모델 help_outline
open_in_new
T5-Base Encoder
훈련된 언어 help_outline
1 언어
관련 모델
link
jina-embeddings-v2-base-en
link
jina-embeddings-v3
다음을 통해 이용 가능
Hugging Face
망분리
I/O 다이어그램

텍스트

jina-embedding-b-en-v1

벡터

Pareto fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-l-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embedding-b-en-v1Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
MTEB English · retrieval
44.03
Parameters
110M
Rank by score
28 / 39
Pareto front
Behind it
비교할 모델을 선택하세요
논문 (1)
EMNLP 2023
7월 20, 2023
Jina Embeddings: A Novel Set of High-Performance Sentence Embedding Models

개요

Jina Embedding B v1은 의미를 유지하면서 영어 텍스트를 고차원 수치 표현으로 변환하도록 설계된 특화된 텍스트 임베딩 모델입니다. 이 모델은 프로덕션 환경에서 효율적이고 정확한 텍스트 임베딩에 대한 중요한 요구 사항을 해결하며, 특히 계산 효율성과 임베딩 품질의 균형이 필요한 조직에 유용합니다. 768차원 임베딩을 생성하는 1억 1천만 개의 매개변수를 갖춘 이 모델은 광범위한 컴퓨팅 리소스 없이도 시맨틱 검색, 문서 클러스터링 또는 콘텐츠 추천 시스템을 구현하는 팀을 위한 실용적인 솔루션입니다.

방법

이 모델은 평균 풀링으로 강화된 T5 인코더 기반 아키텍처를 사용하여 고정 길이 표현을 생성합니다. 이 모델은 원래 16억 개의 문장 쌍에서 추출된 3억 8,500만 개의 고품질 문장 쌍을 포함하는 선별된 Linnaeus-Clean 데이터세트에서 훈련되었으며 2단계 훈련 과정을 거칩니다. 첫 번째 단계에서는 대조 학습을 활용하여 텍스트 쌍에 대한 InfoNCE 손실을 수행하고, 두 번째 단계에서는 삼중 훈련을 사용하여 유사 콘텐츠와 유사하지 않은 콘텐츠를 구별하는 모델의 능력을 향상시킵니다. 엄격한 데이터 필터링(언어 감지 및 일관성 확인 포함)과 결합된 이 혁신적인 훈련 방법을 통해 모델은 미묘한 의미 관계를 효과적으로 포착할 수 있습니다.

성능

실제 평가에서 Jina Embedding B v1은 특히 의미론적 텍스트 유사성 작업에서 인상적인 기능을 보여줍니다. 이 모델은 STS12에서 0.751의 점수로 최고의 성능을 달성하여 all-mpnet-base-v2 및 all-minilm-l6-v2와 같은 성숙한 모델을 능가합니다. 효율적인 추론 시간을 유지하면서 다양한 벤치마크에서 좋은 성능을 발휘합니다. 그러나 사용자는 이 모델이 특히 영어 콘텐츠에 최적화되어 있으며 다국어 또는 코드별 작업에서는 최적의 성능을 달성하지 못할 수 있다는 점에 유의해야 합니다. 이 모델은 더 광범위한 사용 사례에서 향상된 성능을 제공하는 jina-embeddings-v2-base-en 및 jina-embeddings-v3로 대체되었습니다.

모범 사례

최적의 배포를 위해 모델에는 CUDA 지원 GPU가 필요하지만 크기가 적당하므로 표준 하드웨어에서 효율적인 추론이 가능합니다. 이 모델은 최대 512개 토큰 길이의 입력 시퀀스를 허용하므로 일관되고 안정적인 벡터 생성이 중요한 생산 환경에 이상적입니다. 영어 콘텐츠에서 가장 좋은 성능을 발휘하며 의미 검색, 문서 유사성 비교, 콘텐츠 추천 시스템과 같은 애플리케이션에 이상적입니다. 팀에서는 더 나은 성능과 더 광범위한 언어 지원을 제공하는 최신 v2 또는 v3 버전을 새 프로젝트에 사용하는 것을 고려해야 합니다. 이 모델은 일반적인 영어 텍스트 이상의 다국어 이해나 전문적인 도메인 지식이 필요한 작업에는 권장되지 않습니다.
현재 언어 / 테마
Search Foundation
Reader
Embeddings
Reranker
Jina API 키 받기
속도 제한
회사 소개
소식
Jina 로고 다운로드
open_in_new
Elastic 로고 다운로드
open_in_new
API 상태
Elastic © 2026.보안이용약관개인정보 보호쿠키 관리제 개인 정보를 판매하거나 공유하지 마세요.
본 웹사이트 및 관련 콘텐츠, 소프트웨어, 제품, 서비스는 전문가용으로만 제작되었습니다. 일반 소비자를 위한 것이 아니며, 소비자의 사용을 권장하지 않습니다.