오늘 저희는 텍스트 및 이미지를 위한 새로운 38억 개의 파라미터 유니버설 向量模型 (Embeddings) 모델인 jina-embeddings-v4를 출시합니다. 여기에는 쿼리-문서 검색, 의미 매칭 및 코드 검색을 포함하여 가장 인기 있는 검색 작업에 대한 성능을 최적화하는 작업별 LoRA 어댑터 세트가 포함되어 있습니다. jina-embeddings-v4는 MTEB, MMTEB, CoIR, LongEmbed, STS, Jina-VDR, CLIP 및 ViDoRe 벤치마크에서 멀티모달 및 다국어 작업에 대한 최첨단 검색 성능을 달성하며, 특히 테이블, 차트, 다이어그램 및 혼합된 콘텐츠와 같이 시각적으로 풍부한 콘텐츠를 처리하는 데 강점을 보입니다. 이 모델은 단일 벡터와 다중 벡터 向量模型 (Embeddings)을 모두 지원합니다.

jina-embeddings-v4는 저희의 가장 야심찬 向量模型 (Embeddings) 모델입니다. 오픈 소스 모델인 jina-embeddings-v4는 주요 제공업체의 선도적인 폐쇄 소스 向量模型 (Embeddings) 모델보다 뛰어난 성능을 제공하며, 다국어 검색에서 OpenAI의 text-embedding-3-large보다 12% 더 나은 성능 (66.49 vs 59.27), 긴 문서 작업에서 28% 향상 (67.11 vs 52.42), 코드 검색에서 voyage-3보다 15% 더 나은 성능 (71.59 vs 67.23)을 제공하고 Google의 gemini-embedding-001 성능과 일치합니다. 이를 통해 v4는 오늘날 사용 가능한 가장 강력한 오픈 소스 유니버설 向量模型 (Embeddings) 모델이 되어 연구원과 개발자에게 종합적인 기술 보고서를 통해 훈련 과정, 아키텍처 결정 및 모델 가중치에 대한 완전한 투명성을 갖춘 엔터프라이즈급 멀티모달 向量模型 (Embeddings) 기능을 제공합니다.

tag새로운 아키텍처
Qwen2.5-VL-3B-Instruct 백본 (38억 개의 파라미터)을 기반으로 구축되었습니다. 텍스트 및 이미지 입력은 공유 경로를 통해 처리됩니다. 이미지는 먼저 비전 인코더를 통해 词元 (Tokens) 시퀀스로 변환된 다음, 두 모달리티 모두 컨텍스트 주의 계층이 있는 언어 모델 디코더에 의해 공동으로 처리됩니다. 세 개의 작업별 LoRA 어댑터 (각각 6천만 개의 파라미터)는 고정된 백본 가중치를 수정하지 않고 검색, 텍스트 매칭 및 코드 작업에 대한 특수 최적화를 제공합니다. 이 아키텍처는 이중 출력 모드를 지원합니다. (1) 효율적인 유사성 검색을 위해 평균 풀링을 통해 생성된 단일 벡터 向量模型 (Embeddings) (2048차원, 128로 절단 가능) 및 (2) 후기 상호 작용 검색 전략을 위해 프로젝션 계층을 통해 词元 (Tokens)당 128차원의 다중 벡터 向量模型 (Embeddings)입니다.jina-embeddings-v3에서 업그레이드된jina-embeddings-v4는 텍스트 전용에서 멀티모달 向量模型 (Embeddings)으로의 패러다임 전환을 나타냅니다. v3가 작업별 LoRA 어댑터로 텍스트 向量模型 (Embeddings) 최적화에 중점을 둔 반면, v4는 통합된 표현으로 텍스트 및 시각적 콘텐츠를 모두 포함하는 증가하는 요구 사항을 해결합니다.
| 측면 | <strong>jina-embeddings-v3</strong> | <strong>jina-embeddings-v4</strong> |
|---|---|---|
| 백본 모델 | jina-XLM-RoBERTa | Qwen2.5-VL-3B-Instruct |
| 매개변수 (기본) | 559M | 3.8B |
| 매개변수 (어댑터 포함) | 572M | 3.8B + 어댑터당 60M |
| 모달리티 | 텍스트 전용 | 텍스트 + 이미지 (멀티모달) |
| 최대 입력 길이 | 8,192 Tokens (Tokens) | 32,768 Tokens (Tokens) |
| 이미지 처리 | 없음 | 최대 2천만 화소, 시각적으로 풍부한 문서 |
| 다국어 지원 | 89개 언어 | 29+개 언어 |
| 벡터 유형 | 단일 벡터만 | 단일 벡터 + 다중 벡터 (지연 상호 작용) |
| 단일 벡터 차원 | 1024 (MRL로 32까지 절단 가능) | 2048 (MRL로 128까지 절단 가능) |
| 다중 벡터 차원 | 사용 불가 | 토큰당 128 |
| 작업 LoRA 특화 | • 비대칭 검색 • 의미론적 유사성 • 분류 • 분리 |
• 비대칭 검색 • 의미론적 유사성 • 코드 검색 |
| 훈련 단계 | 3단계: 사전 훈련 → 向量模型 (Embeddings) 미세 조정 → 어댑터 훈련 | 2단계: 결합 쌍 훈련 → 작업별 어댑터 훈련 |
| 손실 함수 | InfoNCE, CoSent, 확장된 삼중 손실 | 단일/다중 벡터에 대한 결합 InfoNCE + KL 발산 |
| 위치 인코딩 | RoPE (회전 기준 주파수 조정) | M-RoPE (멀티모달 회전 위치 向量模型 (Embeddings)) |
| 교차 모달 처리 | 해당 없음 | 통합 인코더 (모달리티 격차 감소) |
| MRL 지원 | 예 | 예 |
| 어텐션 구현 | FlashAttention2 | FlashAttention2 |
tag백본
v4에서 가장 중요한 아키텍처 변경 사항은 백본이 XLM-RoBERTa에서 Qwen2.5-VL-3B-Instruct로 변경된 것입니다. 이 결정은 이미지를 토큰 시퀀스로 변환하고 텍스트와 함께 처리하여 이중 인코더 아키텍처에 존재하는 모달리티 격차를 제거하는 "진정한 멀티모달 처리"를 가능하게 하는 보편적인 向量模型 (Embeddings) 모델을 만들려는 v4의 핵심 목표에 의해 주도되었습니다.
백본 선택은 몇 가지 주요 설계 목표와 일치합니다. Qwen2.5-VL의 문서 이해 능력은 테이블, 차트 및 스크린샷과 같은 시각적으로 풍부한 콘텐츠를 처리하는 v4의 강점을 직접적으로 지원합니다. 동적 해상도 기능을 통해 v4는 아키텍처에 지정된 대로 최대 2천만 화소로 크기가 조정된 이미지를 처리할 수 있습니다. 고급 위치 인코딩은 v4가 OpenAI CLIP의 0.15에 비해 0.71의 정렬 점수로 우수한 교차 모달 정렬을 달성할 수 있도록 하는 기반을 제공합니다.
tagLoRA 어댑터
v4는 효과 및 사용자 채택에 대한 학습된 교훈을 반영하여 v3의 5가지 작업에서 3가지 집중된 작업으로 간소화합니다.
- 비대칭 검색 (v3의 쿼리/통과 어댑터 통합)
- 대칭 유사성 (STS 작업에 대한 v3의 텍스트 일치와 동일)
- 코드 검색 (v2-code에서 학습, v3에서 누락)
이 통합은 v3의 분류 및 분리 어댑터를 제거하고 가장 영향력 있는 向量模型 (Embeddings) 사용 사례인 검색 및 STS에 v4를 집중시킵니다.
tag출력 向量模型 (Embeddings)
v4는 단일 벡터 및 다중 벡터 向量模型 (Embeddings)을 모두 지원하는 이중 출력 시스템을 도입하는 반면, v3는 단일 벡터 출력만 제공했습니다. 이는 다양한 검색 시나리오를 해결합니다.
- 단일 벡터 모드: 효율적인 유사성 검색을 위한 2048차원 向量模型 (Embeddings) (MRL을 통해 128까지 절단 가능)
- 다중 벡터 모드: 지연 상호 작용 검색을 위한 토큰당 128차원
이 이중 접근 방식은 특히 시각적으로 풍부한 문서 검색에서 다중 벡터 표현으로 더 큰 효과를 제공하는 동시에 표준 유사성 작업에 대한 효율성을 유지합니다. 시각적 작업에서 단일 벡터 모드보다 다중 벡터의 일관된 7-10% 성능 이점은 지연 상호 작용이 멀티모달 콘텐츠에 대한 근본적으로 더 나은 의미론적 일치를 제공함을 시사합니다.
tag매개변수 크기
v4는 v3보다 6.7배 더 크지만 (3.8B 대 570M 매개변수), 텍스트 전용 성능 개선은 실제로 미미하며, 매개변수 확장이 주로 텍스트 향상보다는 멀티모달 요구 사항에 의해 주도되었음을 시사합니다. 핵심 텍스트 벤치마크에서 v4는 MMTEB에서 66.49를 달성한 반면 v3는 58.58 (14% 개선)이고 MTEB-EN에서는 55.97을 달성한 반면 v3는 54.33 (3% 개선)입니다. 코드 검색의 경우 v4는 CoIR에서 71.59를 기록한 반면 v3는 55.07 (30% 개선)이고, 긴 문서 성능은 LongEmbed에서 v4가 67.11인 반면 v3는 55.66 (21% 개선)입니다. v4의 멀티모달 기능을 고려할 때 상당한 확장이 정당화됩니다. 시각적 문서 검색 (Jina-VDR)에서 84.11 nDCG@5 및 ViDoRe 벤치마크에서 90.17을 달성합니다. 이는 v3에는 완전히 없는 기능입니다. 따라서 매개변수 증가는 경쟁력 있는 텍스트 성능을 유지하면서 멀티모달 기능에 대한 투자를 나타내며, 통합 아키텍처는 기존 이중 인코더 접근 방식에 비해 0.15에 비해 0.71 교차 모달 정렬을 달성하면서 별도의 텍스트 및 비전 모델의 필요성을 제거합니다.
tag시작하기
빠른 분위기 확인을 위해 Search Foundation 툴박스에서 텍스트-이미지 데모를 사용해 보십시오. 당사 웹사이트의 문서 이미지 컬렉션을 준비했으며 사용자 지정 이미지 URL을 추가할 수도 있습니다. 쿼리를 입력하고 Enter 키를 눌러 순위가 매겨진 결과를 확인하십시오. OCR 또는 콘텐츠 기반 이미지 검색과 같이 다시 검색할 수 있으며, 영어가 아닌 쿼리를 사용해 볼 수도 있습니다.
데모는 다음에서 사용할 수 있습니다. https://jina.ai/api-dashboard/m0-image-rerank 이 데모를 사용하면 기본 API 키의 토큰이 소모됩니다. 또한 서버에서 해당 URL의 모든 이미지를 다운로드해야 하므로 데모가 약간 느리게 보일 수 있으며 이미지에 대한 캐시가 구현되지 않았습니다.
tagAPI를 통해
아래 코드는 jina-embeddings-v4를 사용하는 방법을 보여줍니다. 텍스트 문자열, base64로 인코딩된 이미지 또는 이미지 URL을 전달할 수 있습니다. 신규 사용자는 1,000만 개의 무료 Tokens (Tokens)으로 Jina API 키를 얻을 수 있습니다.
curl https://api.jina.ai/v1/embeddings \
-H "Content-Type: application/json" \
-H "Authorization: Bearer JINA_API_KEY" \
-d @- <<EOFEOF
{
"model": "jina-embeddings-v4",
"task": "text-matching",
"input": [
{
"text": "A beautiful sunset over the beach"
},
{
"text": "Un beau coucher de soleil sur la plage"
},
{
"text": "海滩上美丽的日落"
},
{
"text": "浜辺に沈む美しい夕日"
},
{
"image": "https://i.ibb.co/nQNGqL0/beach1.jpg"
},
{
"image": "https://i.ibb.co/r5w8hG8/beach2.jpg"
},
{
"image": "iVBORw0KGgoAAAANSUhEUgAAABwAAAA4CAIAAABhUg/jAAAAMklEQVR4nO3MQREAMAgAoLkoFreTiSzhy4MARGe9bX99lEqlUqlUKpVKpVKpVCqVHksHaBwCA2cPf0cAAAAASUVORK5CYII="
}
]
}
EOFEOF
제한된 GPU 리소스 때문에 현재 Embedding API는 jina-embeddings-v4가 최대 32K개의 词元 (Tokens)을 처리할 수 있는 기본 기능에도 불구하고 최대 8K 词元 (Tokens) 길이의 문서만 지원합니다. 8K 词元 (Tokens)을 초과하는 더 긴 컨텍스트를 요구하는 애플리케이션 (예: Late Chunking)의 경우, CSP를 통해 모델을 배포하거나 모델을 자체 호스팅하는 것이 좋습니다.
tagCSP 마켓플레이스를 통해
jina-embeddings-v4는 AWS, Azure 및 GCP에서 곧 직접 사용할 수 있으며, 가격은 해당 플랫폼에 게시될 예정입니다.
tagHuggingFace를 통해
연구 및 실험 목적으로 Hugging Face 페이지에서 로컬로 모델을 사용할 수 있습니다. 작동 방식을 보여주는 Google Colab 노트북을 준비했습니다.

tag결론
jina-embeddings-v4는 현재까지 가장 큰 도약이라고 할 수 있습니다. 38억 개의 파라미터를 가진 범용 向量模型 (Embedding) 모델로, 텍스트와 이미지를 통합된 경로를 통해 처리하여 밀집 검색 및 지연 상호 작용 검색을 모두 지원하며, 특히 시각적으로 풍부한 문서 검색에서 Google, OpenAI 및 Voyage AI의 독점 모델보다 성능이 뛰어납니다. 그러나 이러한 기능은 고립적으로 나타난 것이 아니라 근본적인 한계를 해결해 온 4세대의 결과입니다.
2022년 초에 jina-embeddings-v1으로 시작했을 때, 모든 사람이 더 많은 데이터가 더 나은 성능을 의미한다고 가정했습니다. 우리는 그 반대를 증명했습니다. 즉, 15억 쌍을 필터링하여 3억 8,500만 개의 고품질 예제로 줄이는 것이 훨씬 더 큰 데이터 세트보다 성능이 뛰어났습니다. 교훈은 큐레이션이 수집보다 낫다는 것입니다.

그러나 사용자는 계속해서 BERT의 512 词元 (Tokens) 제한에 부딪혔습니다. 더 긴 시퀀스에서 훈련하는 것은 비용이 많이 드는 것처럼 보였지만, jina-embeddings-v2는 훈련은 짧게, 배포는 길게 하는 우아한 솔루션을 제시했습니다. ALiBi의 선형 어텐션 바이어스는 512 词元 (Tokens)에서 훈련된 모델이 추론 시 8,192 词元 (Tokens)을 원활하게 처리할 수 있도록 합니다. 더 적은 컴퓨팅으로 더 많은 기능을 얻었습니다.

jina-embeddings-v2의 성공은 또 다른 제약 조건을 드러냈습니다. 즉, 서로 다른 작업에는 서로 다른 최적화가 필요했습니다. 별도의 모델을 구축하는 대신 jina-embeddings-v3는 모든 작업에 대해 5억 7천만 개의 기본 모델을 사용자 정의하기 위해 작은 6천만 개의 LoRA 어댑터를 사용했습니다. 하나의 모델이 5개의 전문 모델이 되었습니다.

작업 전문화에도 불구하고 우리는 텍스트 전용으로 남아 있었지만 사용자는 시각적 이해가 필요했습니다. jina-clip-v1 및 jina-clip-v2와 같은 표준 CLIP 기반 모델은 별도의 인코더를 사용하여 서로 다른 형식의 유사한 콘텐츠가 멀리 떨어져 있는 "양식 간 격차"를 만듭니다. 최근에 출시된 jina-reranker-m0처럼 jina-embeddings-v4는 이 문제를 완전히 제거했습니다. 즉, 하나의 통합된 경로가 모든 것을 처리하여 격차를 해소하는 대신 메웁니다.

jina-embeddings-v4와 jina-reranker-m0는 모두 근본적인 변화를 공유합니다. 즉, 인코더 전용 모델 대신 大模型 (LLM)을 백본으로 사용합니다. 이것은 우연이 아닙니다. 대부분 놓치는 깊은 장점을 반영합니다. 인코더 전용 모델은 이미지가 텍스트와 별도로 클러스터링되는 "양식 간 격차"를 만듭니다. 디코더 전용 모델은 진정한 혼합 양식 표현 및 설명 가능성을 포함하여 인코더 전용 아키텍처로는 달성할 수 없었던 가능성을 열어줍니다.
핵심 통찰력: 向量模型 (embeddings)과 생성은 모두 의미론적 이해와 관련이 있습니다. 생성을 잘하는 大模型 (LLM)은 당연히 표현 능력도 뛰어납니다. 미래는 동일한 검색 기반 모델에서 向量模型 (embedding)과 重排器 (reranking)가 나타나는 통합 아키텍처에 있다고 생각하며, Jina AI는 바로 그 방향으로 나아가고 있습니다.














