Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
MCP
terminal
命令列
article
llms.txt
smart_toy
智慧體
data_object
Schema
menu_book
文件
登入
login
向量模型
copyright CC BY-NC 4.0
open_in_new 釋出部落格

jina-clip-v2

文字和圖片的多語言多模態向量模型
許可證
copyright CC-BY-NC-4.0
釋出日期
calendar_month
2024-11-05
輸入
image
圖片
abc
文字
arrow_forward
輸出
more_horiz
向量
Matryoshka 維度 help_outline
64
128
256
512
768
1024
模型詳情
參數: 865M
輸入詞元長度: 8K
輸入影像尺寸: 512×512
輸出維度: 1024
底座模型 help_outline
open_in_new
EVA02-L-14
link
jina-embeddings-v3
已訓練語言 help_outline
32 種語言
支援的語言 help_outline
108 種語言
相關模型
link
jina-clip-v1
可透過以下方式獲取
Elastic Inference Service
Jina API
AWS SageMaker
Microsoft Azure
谷歌雲
Hugging Face
物理隔離
I/O 圖 1

文字

jina-clip-v2

向量

I/O 圖 2

圖片

jina-clip-v2

向量

帕累託前緣help_outline
ViDoRe v1
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN2B-CLIP-ViT-B-16DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v2參數量(對數)i2t-recall@5
本模型
在前緣上
Jina AI
其他
CLIP Benchmark
89.73
參數量
865M
按分數的排名
34 / 56
帕累託前緣
在前緣之後
取值分佈help_outline
AUC 0.8383
語料
翻譯對
文件檢索
圖片 / 頭圖
圖片 / 標識
任務
default
retrieval.query
0.6040.000.200.400.60
相關20.2%
困難負例3.6%
無關0.8%
推薦閾值
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
均衡 · 0.403
AUC
0.8383
噪聲上限
0.666
召回懸崖
0.224
測量樣本對
119 / 11k
向量分量help_outline
-0.43-0.070.29
σ 0.0313 · 244k 個數值
向量幾何help_outline
01024
各維度均值,懸停檢視區間
噪聲下限
0.420
有效維度
52 / 1024
語言對help_outline
de-ruen-deen-koen-zhja-ko
各語言對之間的閾值跨度:0.064
選擇要比較的模型
論文 (2)
ICLR 2026
一月 22, 2026
Embedding Compression via Spherical Coordinates
ICLR 2025
十二月 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

概述

jina-clip-v2 是一個 865M 參數的多語言多模態向量模型,支援 89 種語言和 512×512 圖片輸入。它在 jina-clip-v1 基礎上增加了跨語言圖文對齊、用於降維的 Matryoshka 表示學習(1024→64),以及在視覺豐富文件上的性能提升。它在跨語言圖片檢索上達到最先進水平,同時保持純文字和單模態上的強勁表現。

方法

該模型採用雙編碼器架構,將 Jina XLM-RoBERTa 文字編碼器(561M 參數、89 種語言、696,320 token 上下文)與 EVA02-L14 視覺編碼器(304M 參數、512×512 像素輸入)相結合。訓練採用多任務、多階段對比學習範式:模型同時在文字對、文字三元組和圖文對上訓練,以支援純文字和跨模態兩類任務。訓練資料集擴展了來自 29 種非英語語言(包括印地語、中文、德語、法語)的多語言文字,以及視覺豐富文件的圖片。Matryoshka 表示學習支援將向量維度從 1024 降到 64 維,同時保持 99% 以上的性能。模型使用 Last-Token-Pooling 作為最終向量。

效能

該模型在 Flickr30k 圖片到文字檢索上取得 98.0% 的準確率,超過 jina-clip-v1 和 NLLB-CLIP-SigLIP。在多語言場景中,跨語言圖片檢索相對於 NLLB-CLIP-SigLIP 最多提升 4%。向量壓縮效果顯著:維度降低 75%(1024→256)後,文字、圖片和跨模態任務上仍保持 99% 以上的性能。在 Multilingual MTEB 上,檢索取得 69.86%,語意相似度取得 67.77%,與專門的文字向量模型具有競爭力。89 種語言支援和視覺豐富文件處理使其特別適合全球電商和內容管理。

最佳實踐

處理前請將圖片調整為 512×512 像素——更大的圖片會自動分塊,增加 token 使用量和處理時間。該模型擅長在 89 種語言中匹配圖片與描述性文字,非常適合全球電商商品搜尋、內容推薦和多語言視覺搜尋。它可能在抽象概念或高度專業的領域內容上表現欠佳。使用 Matryoshka 降維時,64 維向量在索引上仍保持強勁性能;關鍵應用的重排序請使用 512 以上維度。該模型需要 CUDA 相容硬體。純文字工作負載請使用 jina-embeddings-v5-text-small(每參數精度更高)。程式碼檢索請使用 jina-code-embeddings-1.5b。可透過 Jina API、AWS、Azure 和 GCP 市場取得。

提及此模型的部落格
七月 31, 2025 • 12 分鐘閱讀
How Image Resolution Impacts Visual Document Retrieval
Image resolution is crucial for embedding visually rich documents. Too small and models miss key details; too large and they can't connect the parts.
Maximilian Werk
Michael Günther
Scott Martens
Abstract composition with a dark background featuring a flower-like design, radiant eye-like feature, rainbow-colored curved
七月 25, 2025 • 8 分鐘閱讀
JinaVDR: New Visual Document Retrieval Benchmark with 95 Tasks in 20 Languages
JinaVDR is a new benchmark spanning 95 tasks across 20 languages for visual document retrieval, soon on MTEB.
Maximilian Werk
Alex C-G
Black-and-white design for "Jinavor Benchmark" with bold text. Below, "Visual Docs: 95 Tasks: 20 Languages" appears; an abstr
六月 25, 2025 • 12 分鐘閱讀
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
五月 28, 2025 • 4 分鐘閱讀
Correlations: Vibe-Testing Embeddings in GUI
As serious as we are about MTEB, we also love vibe-testing. Correlations is a simple GUI we use for validating citations in DeepSearch, debugging late chunking, and vibe-testing embeddings. Now it's open-source.
Jina AI
Technical screen showing green and yellow visual data, including charts in the lower half and a heat-map-like visualization a
五月 25, 2025 • 21 分鐘閱讀
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
當前語言 / 主題
搜尋底座
Reader
向量模型
重排模型
獲取 Jina API 金鑰
速率限制
關於我們
新聞
下載 Jina 標誌
open_in_new
下載 Elastic 標誌
open_in_new
API 狀態
Elastic © 2026.安全條款及條件隱私管理 Cookie請勿出售或分享我的個人資訊
本網站及其所有相關內容、軟體、產品和服務僅供專業使用,不面向消費者。