Elastic
Jina AI
모델
API
keyboard_arrow_down
Reader
어떤 URL이든 Markdown으로 변환하여 LLM 그라운딩을 개선하세요.
Embeddings
멀티모달 및 다국어 임베딩.
Reranker
검색 관련성을 극대화하는 리랭커.
MCP
terminal
CLI
article
llms.txt
smart_toy
에이전트
data_object
스키마
menu_book
문서
로그인
login
Embeddings
Reranker
copyright CC BY-NC 4.0
open_in_new 릴리스 포스트

jina-colbert-v2

벡터화 및 재정렬에서 최고의 성능을 갖춘 최고의 다국어 ColBERT
라이선스
copyright CC-BY-NC-4.0
출시일
calendar_month
2024-08-31
입력
abc
텍스트
arrow_forward
출력
apps
다중 벡터
Matryoshka 차원 help_outline
64
96
128
모델 세부정보
매개변수: 560M
입력 토큰 길이: 8K
출력 크기: 128
기본 모델 help_outline
jina-xlm-roberta
훈련된 언어 help_outline
89 언어
지원되는 언어 help_outline
108 언어
관련 모델
link
jina-colbert-v1-en
다음을 통해 이용 가능
Jina API
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
망분리
I/O 다이어그램 1

다중

벡터

쿼리

jina-colbert-v2

I/O 다이어그램 2

다중

벡터

문서

jina-colbert-v2

파레토 프론트help_outline
BEIR
MIRACL
chevron_leftchevron_right
30M100M300M1B3.0B50556065answerai-colbert-small-…bge-reranker-basebge-reranker-v2-m3ColBERTv2GTE-ModernColBERT-v1jina-reranker-m0jina-reranker-v1-base-enjina-reranker-v1-turbo-…jina-reranker-v2-base-m…jina-reranker-v3jina-reranker-v3.5ms-marco-MiniLM-L-4-v2mxbai-rerank-base-v1mxbai-rerank-base-v2mxbai-rerank-large-v2mxbai-rerank-xsmall-v1Qwen3-Reranker-0.6Bjina-colbert-v2파라미터 수(로그)nDCG@10
이 모델
프론트에 있음
Jina AI
기타
BEIR
54.49
매개변수
559M
점수 순위
12 / 21
파레토 프론트
프론트 아래
값 분포help_outline
AUC 0.9726
코퍼스
번역 쌍
코드
19.141518202325
관련81.0%
하드 네거티브10.3%
무관0.8%
권장 컷오프
FPR 0.1 · 17.83
FPR 0.01 · 19.14
FPR 0.001 · 21.08
FPR 0.0001 · 23.67
균형 · 18.66
AUC
0.9726
노이즈 상한
21.05
재현율 절벽
16.22
측정 쌍 수
100 / 9,200
순위별 점수help_outline
12345678910
각 순위 위치의 평균 점수
비교할 모델을 선택하세요
논문 (1)
EMNLP 2024
8월 30, 2024
Jina-ColBERT-v2: A General-Purpose Multilingual Late Interaction Retriever

개요

jina-colbert-v2는 560M 파라미터의 다국어 레이트 인터랙션 검색 모델로, 89개 언어를 지원합니다. 토큰 수준 컴팩트 임베딩(토큰당 64–128차원)을 생성하는 최초의 다국어 ColBERT 유사 모델로, 확장 가능하고 비용 효율적인 다국어 검색을 가능하게 합니다. Matryoshka 표현 학습을 통해 128에서 64로 차원을 줄이면 성능 감소가 단 1.5%에 불과해 저장 요구사항을 절반으로 줄입니다.

방법

모델은 회전 위치 임베딩을 강화하고 Flash Attention으로 최적화된 수정 XLM-RoBERTa 백본(560M 파라미터)을 갖춘 ColBERT 레이트 인터랙션 아키텍처를 기반으로 합니다. 학습은 두 가지 핵심 단계를 포함합니다: (1) 다양한 언어의 다양한 약히 지도된 데이터로 초기 사전학습, (2) 라벨된 트리플렛 데이터와 더 큰 교사 모델로부터의 지도 증류로 정밀조정. 핵심 혁신은 멀티 벡터 임베딩에 Matryoshka 표현 학습을 구현한 것으로, 모델은 단일 학습 프로세스에서 128, 96 또는 64차원의 토큰 수준 벡터를 생성해 재학습 없이 동적 저장 최적화를 가능하게 합니다. 8,192토큰 문서 컨텍스트(12,288까지 확장 가능)와 32토큰 쿼리 한도는 ALiBi 위치 인코딩으로 관리됩니다.

성능

모델은 영어 작업에서 원래 ColBERT-v2 대비 6.5% 개선을 달성하며, 14개 BEIR 벤치마크에 걸쳐 평균 0.521점을 기록합니다. MIRACL 벤치마크에서 테스트된 모든 언어에 걸쳐 전통적인 BM25 기반 검색 방법보다 우수하며, 특히 크로스 링구얼 시나리오에서 강점을 보입니다. 128에서 64차원으로 줄이면 성능 감소는 1.5%에 그치고 저장 요구사항은 절반으로 줄어듭니다 — 예를 들어, 64차원 벡터로 1억 개 문서를 저장하면 AWS에서 월 659.62달러의 비용이 드는 반면, 128차원은 1,319.24달러입니다. 모델의 다국어 커버리지(89개 언어)와 컴팩트 토큰 임베딩은 글로벌 검색 애플리케이션에 특히 적합하게 만듭니다.

모범 사례

모델은 최적의 성능을 위해 CUDA 지원 하드웨어가 필요합니다. 쿼리는 32토큰으로 제한하면서 최대 8,192토큰(12,288까지 확장 가능)의 문서 길이를 지원합니다. 프로덕션 배포를 위해 Jina Search Foundation API, AWS 마켓플레이스, Azure를 통해 사용할 수 있으며, Hugging Face에는 비상용 버전이 있습니다. 구현 시 쿼리나 문서 중 어느 쪽을 임베딩하는지 지정하세요 — 모델은 비대칭 인코딩을 사용합니다. 적절한 인덱싱 없이 극도로 큰 문서 컬렉션을 실시간으로 처리하도록 설계되지 않았으므로, ANN 검색에는 FAISS, Qdrant 또는 Weaviate를 사용하세요. 도메인 특화 작업에는 코퍼스에 대한 정밀조정을 고려하세요. 더 높은 차원의 출력이 필요한 단일 벡터 검색에는 jina-embeddings-v4(멀티 벡터 모드) 또는 jina-embeddings-v5-text-small를 고려하세요.

이 모델을 언급하는 블로그
10월 03, 2025 • 7 분 소요
Jina Reranker v3: 0.6B Listwise Reranker for SOTA Multilingual Retrieval
New 0.6B-parameter listwise reranker that considers the query and all candidate documents in a single context window.
Jina AI
Light blue background with stylized text in the center, composed of small dots or squares, evoking a modern and minimalistic
12월 16, 2024 • 2 분 소요
Re·Search: Order 2024 Yearbook of Search Foundation Advances
Discover Re·Search, our premium yearbook showcasing our best research articles and search foundation models in 2024. Featuring spot UV-coated hardcover, 160 full-color pages, and meticulous design throughout. Available worldwide at $35, shipping included.
Jina AI
Open red publication "ReSearch" volume 24 displayed on a white surface with a distinctive shadow casting over the pages.
10월 29, 2024 • 11 분 소요
Beyond CLIP: How Jina-CLIP Advances Multimodal Search
Learn how Jina-CLIP enhances OpenAI's CLIP with better retrieval accuracy and more diverse results through unified text-image embeddings.
Bo Wang
Alex C-G
Abstract digital landscape with wave-like green and pink dunes against a dark background, conveying a tranquil atmosphere.
8월 30, 2024 • 10 분 소요
Jina ColBERT v2: Multilingual Late Interaction Retriever for Embedding and Reranking
Jina ColBERT v2 supports 89 languages with superior retrieval performance, user-controlled output dimensions, and 8192 token-length.
Jina AI
Dark-themed coding interface displaying English and Japanese characters with "JINA COLBERT V2" highlighted in the center.
2월 20, 2024 • 16 분 소요
What is ColBERT and Late Interaction and Why They Matter in Search?
Jina AI's ColBERT on Hugging Face has set Twitter abuzz, bringing a fresh perspective to search with its 8192-token capability. This article unpacks the nuances of ColBERT and ColBERTv2, showcasing their innovative designs and why their late interaction feature is a game-changer for search.
Han Xiao
Neon theater or concert hall marquee letters lit up at night with city lights and faint "Adobe Sto" visible.
현재 언어 / 테마
Search Foundation
Reader
Embeddings
Reranker
Jina API 키 받기
속도 제한
회사 소개
소식
Jina 로고 다운로드
open_in_new
Elastic 로고 다운로드
open_in_new
API 상태
Elastic © 2026.보안이용약관개인정보 보호쿠키 관리제 개인 정보를 판매하거나 공유하지 마세요.
본 웹사이트와 모든 관련 콘텐츠, 소프트웨어, 제품 및 서비스는 전문 목적 사용을 위한 것입니다. 소비자 사용은 의도되지 않았습니다.