Elastic
Jina AI
모델
API
keyboard_arrow_down
Reader
어떤 URL이든 Markdown으로 변환하여 LLM 그라운딩을 개선하세요.
Embeddings
멀티모달 및 다국어 임베딩.
Reranker
검색 관련성을 극대화하는 리랭커.
Elastic Inference Service
Jina 모델을 Elasticsearch에서 네이티브 방식으로 실행하세요.
MCP
terminal
CLI
article
llms.txt
smart_toy
에이전트
data_object
스키마
menu_book
문서
로그인
login
warning
이 모델은 최신 모델로 대체되어 더 이상 권장되지 않습니다.
Embeddings
아파치 2.0 라이선스
open_in_new 릴리스 노트

jina-embeddings-v2-base-es

SOTA 성능의 스페인어-영어 이중 언어 벡터 모델
라이선스
Apache-2.0
출시일
calendar_month
2024-02-14
입력
abc
텍스트
arrow_forward
출력
more_horiz
벡터
Late Chunking help_outline
check_circle
Yes
모델 세부정보
매개변수: 161M
입력 토큰 길이: 8K
출력 크기: 768
기본 모델 help_outline
open_in_new
jina-embeddings-v2-base-en
훈련된 언어 help_outline
2 언어
관련 모델
link
jina-embeddings-v2-base-en
link
jina-embeddings-v2-base-de
link
jina-embeddings-v2-base-zh
다음을 통해 이용 가능
Jina API
AWS SageMaker
Microsoft Azure
Hugging Face
망분리
I/O 다이어그램

텍스트

jina-embeddings-v2-base-es

벡터

Pareto fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
MTEB English · retrieval
46.40
Parameters
161M
Rank by score
24 / 39
Pareto front
Behind it
값 분포help_outline
AUC 0.8383
코퍼스
번역 쌍
문서 검색
0.6830.000.200.400.600.80
관련17.6%
하드 네거티브3.0%
무관0.8%
권장 컷오프
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
균형 · 0.365
AUC
0.8383
노이즈 상한
0.774
재현율 절벽
0.163
측정 쌍 수
119 / 11k
벡터 성분help_outline
-0.160.000.17
σ 0.0361 · 183k 개 값
임베딩 기하 구조help_outline
0768
차원별 평균, 마우스를 올리면 범위 표시
노이즈 하한
0.326
유효 차원
51 / 768
언어 쌍help_outline
de-ruen-deen-koen-zhja-ko
쌍 간 컷오프 편차: 0.315
비교할 모델을 선택하세요
논문 (1)
arXiv
2월 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

개요

Jina Embeddings v2 Base Spanish는 스페인어와 영어 콘텐츠 간의 언어 간 정보 검색 및 분석이라는 중요한 문제를 해결하는 획기적인 이중 언어 텍스트 임베딩 모델입니다. 특정 언어에 편향되는 경우가 많은 기존의 다국어 모델과 달리 이 모델은 스페인어와 영어 모두에서 진정으로 균형 잡힌 성능을 제공합니다. 이는 스페인어 사용 시장에서 활동하거나 이중 언어 콘텐츠를 다루는 조직에 필수적입니다. 이 모델의 가장 눈에 띄는 특징은 기하학적으로 정렬된 임베딩을 생성하는 능력입니다. 스페인어와 영어 텍스트가 동일한 의미를 표현하는 경우 해당 벡터 표현이 임베딩 공간에서 자연스럽게 함께 군집을 이루어 원활한 언어 간 검색 및 분석이 가능합니다.

방법

모델의 중심에는 전통적인 위치 벡터 없이도 최대 8,192개의 토큰 시퀀스를 처리할 수 있는 정교한 접근 방식인 대칭 양방향 ALiBi(Attention with Linear Bias)를 기반으로 하는 혁신적인 아키텍처가 있습니다. 이 모델은 GLU(Gated Linear Unit)와 특수 레이어 정규화 기술을 결합하여 161M 매개변수를 갖춘 수정된 BERT 아키텍처를 사용합니다. 훈련은 3단계 프로세스를 따릅니다. 먼저 대규모 텍스트 코퍼스에 대한 사전 훈련, 신중하게 선택한 텍스트 쌍을 사용하여 미세 조정, 마지막으로 유사하지만 의미상 다른 콘텐츠의 차별성을 강화하기 위한 하드 네거티브 훈련입니다. 768차원 벡터와 결합된 이 접근 방식을 통해 모델은 계산 효율성을 유지하면서 미묘한 의미 관계를 포착할 수 있습니다.

성능

포괄적인 벤치마크 평가에서 이 모델은 크기가 15~30%에 불과함에도 불구하고 E5 및 BGE-M3와 같은 최신 대규모 다국어 모델을 능가하는 뛰어난 기능을 보여주었습니다. 이 모델은 검색 및 클러스터링 작업에서 잘 수행되며 언어 전체에서 의미상 동일한 콘텐츠를 일치시키는 데 탁월합니다. MTEB 벤치마크에서는 분류, 클러스터링, 의미 유사성 등 다양한 작업에서 좋은 성능을 발휘합니다. 8,192개 토큰의 확장된 컨텍스트 창은 긴 문서 처리에 특히 유용하며, 문서가 여러 페이지에 걸쳐 있는 경우에도 일관된 성능을 제공합니다. 이는 대부분의 경쟁 모델에는 부족한 기능입니다.

모범 사례

이 모델을 효과적으로 활용하려면 조직은 최적의 성능을 위해 CUDA 지원 GPU 인프라에 액세스할 수 있는지 확인해야 합니다. 이 모델은 MongoDB, Qdrant, Weaviate, Haystack을 포함한 주요 벡터 데이터베이스 및 RAG 프레임워크와 원활하게 통합되므로 프로덕션 환경에 쉽게 배포할 수 있습니다. 이중 언어 문서 검색, 콘텐츠 추천 시스템, 언어 간 문서 분석과 같은 애플리케이션에 탁월합니다. 이 모델은 잘 작동하지만 특히 스페인어-영어 이중 언어 시나리오에 최적화되어 있으며 단일 언어 애플리케이션이나 다른 언어 쌍이 포함된 시나리오에는 최선의 선택이 아닐 수도 있습니다. 최상의 결과를 얻으려면 입력 텍스트의 형식이 스페인어 또는 영어로 적절하게 지정되어야 하지만 모델은 혼합 언어 콘텐츠를 효과적으로 처리할 수 있습니다. 이 모델은 도메인별 애플리케이션에 대한 미세 조정을 지원하지만 훈련 데이터의 품질과 분포를 신중하게 고려해야 합니다.
이 모델을 언급하는 블로그
4월 29, 2024 • 7 분 소요
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
2월 14, 2024 • 4 분 소요
Aquí Se Habla Español: Top-Quality Spanish-English Embeddings and 8k Context
Jina AI's new bilingual Spanish-English embedding model brings the state-of-the-art in AI to half a billion Spanish speakers.
Jina AI
Digital wireframe rendering of a Gothic-style cathedral, with colorful outlines and pointed spires on a dark background.
현재 언어 / 테마
Search Foundation
Reader
Embeddings
Reranker
Jina API 키 받기
속도 제한
회사 소개
소식
Jina 로고 다운로드
open_in_new
Elastic 로고 다운로드
open_in_new
API 상태
Elastic © 2026.보안이용약관개인정보 보호쿠키 관리제 개인 정보를 판매하거나 공유하지 마세요.
본 웹사이트 및 관련 콘텐츠, 소프트웨어, 제품, 서비스는 전문가용으로만 제작되었습니다. 일반 소비자를 위한 것이 아니며, 소비자의 사용을 권장하지 않습니다.