Elastic
Jina AI
모델
API
keyboard_arrow_down
Reader
어떤 URL이든 Markdown으로 변환하여 LLM 그라운딩을 개선하세요.
Embeddings
멀티모달 및 다국어 임베딩.
Reranker
검색 관련성을 극대화하는 리랭커.
MCP
terminal
CLI
article
llms.txt
smart_toy
에이전트
data_object
스키마
menu_book
문서
로그인
login
warning
이 모델은 최신 모델로 대체되어 더 이상 권장되지 않습니다.
Embeddings
아파치 2.0 라이선스
open_in_new 릴리스 포스트

jina-embeddings-v2-base-en

OpenAI의 text-embedding-ada002와 비교 가능
라이선스
Apache-2.0
출시일
calendar_month
2023-10-28
입력
abc
텍스트
arrow_forward
출력
more_horiz
벡터
Late Chunking help_outline
check_circle
Yes
모델 세부정보
매개변수: 137M
입력 토큰 길이: 8K
출력 크기: 768
훈련된 언어 help_outline
1 언어
관련 모델
link
jina-embedding-b-en-v1
link
jina-embeddings-v3
다음을 통해 이용 가능
Jina API
AWS SageMaker
Microsoft Azure
Hugging Face
망분리
I/O 다이어그램

텍스트

jina-embeddings-v2-base-en

벡터

파레토 프론트help_outline
MTEB English
RTEB public
LongEmbed
LoCo
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B30B20406080all-MiniLM-L12-v2all-mpnet-base-v2bge-m3e5-basee5-smalle5-small-v2EmbeddingGemma-300Mgranite-embedding-278m-…granite-embedding-311m-…granite-embedding-engli…granite-embedding-small…GritLM-7BGritLM-8x7Bgte-basegte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-smallinf-retriever-v1jasper_en_vision_langua…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…LaBSELLM2Vec-Mistral-7B-Inst…multilingual-e5-largenomic-embed-text-v1nomic-embed-text-v1.5NV-Embed-v1NV-Embed-v2Qwen3-Embedding-4BSFR-Embedding-Mistralsnowflake-arctic-embed-…snowflake-arctic-embed-…snowflake-arctic-embed-…stella_en_1.5B_v5voyage-4-nanojina-embeddings-v2-base…파라미터 수(로그)nDCG@10
이 모델
프론트에 있음
Jina AI
기타
LongEmbed
58.12
매개변수
137M
점수 순위
18 / 69
파레토 프론트
프론트 아래
값 분포help_outline
AUC 0.8376
코퍼스
번역 쌍
문서 검색
0.8500.600.700.800.90
관련26.9%
하드 네거티브2.7%
무관1.1%
권장 컷오프
FPR 0.1 · 0.793
FPR 0.01 · 0.850
FPR 0.001 · 0.894
FPR 0.0001 · 0.914
균형 · 0.762
AUC
0.8376
노이즈 상한
0.893
재현율 절벽
0.691
측정 쌍 수
119 / 11k
벡터 성분help_outline
-0.14-0.000.14
σ 0.0361 · 183k 개 값
임베딩 기하 구조help_outline
0768
차원별 평균, 마우스를 올리면 범위 표시
노이즈 하한
0.751
유효 차원
59 / 768
비교할 모델을 선택하세요
논문 (1)
arXiv
10월 30, 2023
Jina Embeddings 2: 8192-Token General-Purpose Text Embeddings for Long Documents

개요

jina-embeddings-v2-base-en는 137M 파라미터 영어 텍스트 임베딩 모델로, 8,192토큰 컨텍스트 윈도우를 갖추었습니다 — 당시 표준 512토큰 한도의 16배입니다. 대칭 양방향 ALiBi(Attention with Linear Biases)를 갖춘 BERT-small 백본 위에 구축되어, 절단이나 청킹 없이 긴 문서를 네이티브로 처리한 최초의 오픈소스 Jina 임베딩입니다. 768차원 벡터를 생성하며, v3/v5의 다국어 또는 긴 컨텍스트 기능이 필요 없는 영어 전용 검색에서 여전히 탄탄한 선택지입니다.

방법

아키텍처는 BERT-small 트랜스퍼머(12층, 12개 어텐션 헤드, 768차원 숨김)와 대칭 양방향 ALiBi 위치 인코딩을 조합합니다. ALiBi는 학습된 위치 임베딩을 선형적으로 감소하는 어텐션 편향으로 대체해, 모델이 512토큰 훈련 길이를 크게 벗어나 8,192토큰까지 성능 저하 없이 외삽할 수 있게 합니다. 학습은 2단계 파이프라인을 따랐습니다: C4에서의 사전학습, 이후 어려운 음의(negative) 마이닝을 포함한 Jina가 큐레이션한 40개 이상의 전문 문장 쌍 데이터셋에서 정밀조정. 대칭 양방향 어텐션은 각 토큰이 이전과 이후 컨텍스트 모두에 주목해 문장의 전체 의미를 포착하는 표현을 생성하도록 보장합니다. 모든 토큰 표현에 대한 평균 풀링이 최종 768차원 임베딩을 생성합니다.

성능

출시 시, 모델은 OpenAI의 text-embedding-ada-002를 여러 MTEB 영어 서브태스크에서 능가했습니다: 분류(73.45% vs 70.93%), 리랭킹(85.38% vs 84.89%), 검색(56.98% vs 56.32%), 요약(31.6% vs 30.8%). 8,192토큰 컨텍스트는 512–2,048토큰에 제한된 경쟁 모델에 대한 상당한 우위가 되어, 청킹 없이 문서 수준의 검색을 가능하게 했습니다. 컴팩트한 307MB 풋프린트는 컨슈머 등급 GPU에서도 배포 가능하게 했습니다. 2026년에 jina-embeddings-v5-text-small(677M 파라미터, 32K 컨텍스트, 작업별 LoRA 어댑터)은 대부분의 프로덕션 워크로드에서 이를 능가하지만, 경량 영어 전용 파이프라인에서는 여전히 관련성이 있습니다.

모범 사례

8K 컨텍스트 윈도우가 충분하고 다국어 또는 작업별 어댑터가 필요 없는 영어 전용 검색에 이 모델을 사용하세요. 8,192토큰을 초과하는 문서에는 임베딩 전에 시맨틱 청킹을 적용하세요. 모델은 주요 벡터 데이터베이스(Qdrant, Weaviate, MongoDB Atlas, Milvus) 및 RAG 프레임워크(LangChain, LlamaIndex, Haystack)와 통합됩니다. 다국어 지원, 32K 컨텍스트 또는 작업별 최적화가 필요한 새 프로젝트에는 jina-embeddings-v5-text-small을 권장합니다. 프로덕션 처리량을 위해 CUDA 지원 GPU를 권장합니다. CPU 추론도 가능하지만 현저히 느립니다.

이 모델을 언급하는 블로그
12월 17, 2024 • 12 분 소요
Text Embeddings Fail to Capture Word Order and How to Fix It
Text embedding models struggle with capturing subtle linguistic nuances like word order, directional relationships, temporal sequences, causal connections, comparisons, and negation. Understanding these challenges is key to improving model performance.
Bo Wang
Alex C-G
Three abstract figures in white, gray, and pink on matching cubes placed on a colorful checkered surface against a green back
10월 25, 2024 • 19 분 소요
Finding Optimal Breakpoints in Long Documents Using Small Language Models
We trained three small language models to better segment long documents into chunks, and here are the key lessons we learned.
Andrei Ungureanu
Alex C-G
A pattern of yellow file icons on a blue background with one icon displaying a smiley face creating an emotive contrast.
10월 15, 2024 • 9 분 소요
Fact-Checking with New Grounding API in Jina Reader
With the new g.jina.ai, you can easily ground statements to reduce LLM hallucinations or improve the integrity of human-written content.
Jina AI
Jina developer interface showing "Jina AI was founded in 2020" with controls labeled true and false, and web address on top.
9월 27, 2024 • 15 분 소요
Migration From Jina Embeddings v2 to v3
We collected some tips to help you migrate from Jina Embeddings v2 to v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
9월 18, 2024 • 10 분 소요
Jina Embeddings v3: A Frontier Multilingual Embedding Model
jina-embeddings-v3 is a frontier multilingual text embedding model with 570M parameters and 8192 token-length, outperforming the latest proprietary embeddings from OpenAI and Cohere on MTEB.
Jina AI
Dynamic image showing the characters "V3" formed by bright green dots varying in size on a black background.
현재 언어 / 테마
Search Foundation
Reader
Embeddings
Reranker
Jina API 키 받기
속도 제한
회사 소개
소식
Jina 로고 다운로드
open_in_new
Elastic 로고 다운로드
open_in_new
API 상태
Elastic © 2026.보안이용약관개인정보 보호쿠키 관리제 개인 정보를 판매하거나 공유하지 마세요.
본 웹사이트와 모든 관련 콘텐츠, 소프트웨어, 제품 및 서비스는 전문 목적 사용을 위한 것입니다. 소비자 사용은 의도되지 않았습니다.