Elastic
Jina AI
新聞
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
Elastic Inference Service
在 Elasticsearch 中原生執行 Jina 模型。
MCP terminal命令列articlellms.txtsmart_toy智慧體data_objectSchemamenu_book文件



登入
login
向量模型
copyright CC BY-NC 4.0
open_in_new 釋出部落格

jina-clip-v2

文字和圖片的多語言多模態向量模型
許可證
copyright CC-BY-NC-4.0
釋出日期
calendar_month
2024-11-05
輸入
image
影象
abc
文字
arrow_forward
輸出
more_horiz
向量
Matryoshka 維度 help_outline
64
128
256
512
768
1024
模型詳情
引數: 865M
輸入詞元長度: 8K
輸入影象尺寸: 512×512
輸出維度: 1024
底座模型 help_outline
open_in_new
XLM-RoBERTa Large
已訓練語言 help_outline
32 種語言
支援的語言 help_outline
108 種語言
相關模型
link
jina-clip-v1
可透過以下方式獲取
Elastic Inference Service
Jina API
AWS SageMaker
Microsoft Azure
谷歌雲
Hugging Face
物理隔離
I/O 圖 1

文字

jina-clip-v2

向量

I/O 圖 2

影象

jina-clip-v2

向量

取值分佈help_outline
AUC 0.8383
語料
翻譯對
文件檢索
影象 / 頭圖
影象 / 標識
任務
default
retrieval.query
0.6040.000.200.400.60
相關20.2%
困難負例3.6%
無關0.8%
懸停或點選圖表可移動閾值
推薦閾值
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
均衡 · 0.403
AUC
0.8383
噪聲上限
0.666
召回懸崖
0.224
測量樣本對
119 / 11k
向量分量help_outline
-0.43-0.070.29
σ 0.0313 · 244k 個數值
嵌入幾何help_outline
01024
各維度均值,懸停檢視區間
噪聲下限
0.420
有效維度
52 / 1024
語言對help_outline
de-ruen-deen-koen-zhja-ko
各語言對之間的閾值跨度:0.064
選擇要比較的模型
論文 (2)
ICLR 2026
一月 22, 2026
Embedding Compression via Spherical Coordinates
ICLR 2025
十二月 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

概述

Jina CLIP v2 打通視覺與文字理解,覆蓋 89 種語言,為多模態 AI 帶來全新可能。它讓圖文匹配不再受語言障礙限制,切實解決了全球電商、內容管理和跨文化溝通中的核心難題。對於拓展海外市場或管理多語言內容的企業,無需再為每種語言單獨部署模型,也不必搭建複雜的翻譯流程。在需要跨語言精準視覺搜尋的場景中,例如全球電商平臺的商品發現或多語言數字資產管理,該模型的表現尤為突出。

方法

Jina CLIP v2 的核心是一套精巧的雙編碼器架構,把 Jina XLM-RoBERTa 文本編碼器(5.61 億參數)與 EVA02-L14 視覺編碼器(3.04 億參數)結合在一起。文本編碼器以 696,320 詞元的超大上下文視窗處理 89 種語言的內容,視覺編碼器則可處理最高 512x512 像素的高解析度圖像。該模型引入了創新的 Matryoshka 表示學習,向量維度可從 1024 動態調整到 64,效能基本不受影響。文本和圖像分別經各自的編碼器處理後,被投射到同一個語義空間,含義相近的概念無論來自哪種模態或語言都會彼此靠攏。

效能

該模型在 Flickr30k 影象到文字檢索任務中取得 98.0% 的準確率,達到業界領先水平,超過上一代和 NLLB-CLIP-SigLIP。多語言場景下,儘管引數量少於最大的競品,它在跨語言影象檢索任務上仍比 NLLB-CLIP-SigLIP 高出最多 4%。即便壓縮向量,模型表現依然穩健:維度減少 75% 後,文字、影象和跨模態任務仍能保留 99% 以上的效能。在綜合性的多語言 MTEB 基準上,檢索任務得 69.86%,語義相似度任務得 67.77%,與專用文字向量模型不相上下。

最佳實踐

要獲得最佳部署效果,請留意以下幾個關鍵點。模型需要支援 CUDA 的硬體才能高效執行,視訊記憶體需求隨批大小和影象解析度變化。為控制 API 成本和耗時,建議先把影象縮放到 512x512 畫素再處理,更大的影象會被自動切分成圖塊,詞元用量和處理時間都會增加。該模型擅長跨語言匹配影象與描述文字,但面對抽象概念或高度專業的垂直領域內容可能力有不逮。它非常適合電商商品搜尋、內容推薦和視覺搜尋場景,但不太適合需要細粒度視覺細節分析或深度專業知識的任務。使用 Matryoshka 表示時,請權衡降維與效能:64 維向量仍能保持不錯的效果,但關鍵業務建議採用更高維度。
提及此模型的部落格
十一月 21, 2024 • 9 分鐘閱讀
Jina CLIP v2:文本與影像的多語言多模態嵌入表示
Jina-CLIP v2,一個規模為 0.9B 的多模態嵌入模型,支援 89 種語言的多語言功能、512x512 的高解析度圖像處理能力,以及具備 Matryoshka 表示法。
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
十月 29, 2024 • 11 分鐘閱讀
超越 CLIP:Jina-CLIP 如何推進多模態搜索
了解 Jina-CLIP 如何透過統一的文字-圖像嵌入,增強 OpenAI 的 CLIP,實現更好的檢索準確度和更多樣化的結果。
Bo Wang
Alex C-G
Abstract digital landscape with wave-like green and pink dunes against a dark background, conveying a tranquil atmosphere.
六月 05, 2024 • 9 分鐘閱讀
Jina CLIP v1:適用於文字和圖像的真正多模態 Embeddings 模型
Jina AI 的新型多模態嵌入模型不僅在文本圖像檢索方面優於 OpenAI CLIP,同時還是一個出色的圖像嵌入模型和最先進的文本嵌入模型。你不再需要為不同模態使用不同的模型了。
Sofia Vasileva
Scott Martens
Susana Guzmán
Abstract 3D render of a neon blue and green grid pattern on a black background, creating a sense of depth.
九月 27, 2024 • 15 分鐘閱讀
從 Jina Embeddings v2 遷移到 v3
我們收集了一些建議,幫助您從 Jina Embeddings v2 遷移到 v3。
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
八月 30, 2024 • 10 分鐘閱讀
Jina ColBERT v2:用於 Embedding 與重排序的多語言後期互動檢索器
Jina ColBERT v2 支援 89 種語言,具有卓越的檢索效能、使用者可控的輸出維度,以及 8192 的 token 長度。
Jina AI
Dark-themed coding interface displaying English and Japanese characters with "JINA COLBERT V2" highlighted in the center.
搜尋底座
Reader
向量模型
重排模型
Elastic Inference Service
open_in_new
獲取 Jina API 金鑰
速率限制
API 狀態
條款
安全
條款及條件
隱私
管理 Cookie
請勿出售或分享我的個人資訊
下載 Jina 徽標
open_in_new
下載 Elastic 徽標
open_in_new
Elastic © 2020-2026.
本網站及其所有相關內容、軟體、產品和服務僅供專業人士使用。不面向任何消費者,也不鼓勵任何消費者使用。