Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
MCP
terminal
命令列
article
llms.txt
smart_toy
智慧體
data_object
Schema
menu_book
文件
登入
login
warning
此模型已被更新的模型取代。
向量模型
Apache 2.0 許可證
open_in_new 釋出部落格

jina-clip-v1

圖片和英文文字的多模態向量模型
許可證
Apache-2.0
釋出日期
calendar_month
2024-06-05
輸入
image
圖片
abc
文字
arrow_forward
輸出
more_horiz
向量
模型詳情
參數: 223M
輸入詞元長度: 8K
輸入影像尺寸: 224×224
輸出維度: 768
底座模型 help_outline
open_in_new
EVA02-B-16
link
jina-embeddings-v2-base-en
已訓練語言 help_outline
1 種語言
相關模型
link
jina-clip-v2
link
jina-embeddings-v3
link
jina-colbert-v2
可透過以下方式獲取
Jina API
AWS SageMaker
Microsoft Azure
Hugging Face
物理隔離
I/O 圖 1

文字

jina-clip-v1

向量

I/O 圖 2

圖片

jina-clip-v1

向量

帕累託前緣 help_outline
workspace_premium
MTEB English
ViDoRe v1
MIEB
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
chevron_leftchevron_right
300M1B3.0B10B20406080100bge-visualized-m3BiModernVBERTDSE-Phi3dse-qwen2-2b-mrl-v1e5-vjina-clip-v2jina-embeddings-v3jina-embeddings-v4llama-nemoretriever-col…MoCa-3Bnemotron-colembed-vl-8b…nllb-siglip-largeONE-PEACESauerkrautLM-ColLFM2-45…SauerkrautLM-ColMinistr…siglip-so400m-patch14-3…SigLIP2-L-512/16VLM2VecVultronRetrieverFlash-Q…jina-clip-v1參數量(對數)nDCG@5
本模型
在前緣上
Jina AI
其他
ViDoRe v1
17.72
參數量
223M
按分數的排名
32 / 33
帕累託前緣
在前緣上
取值分佈help_outline
AUC 0.8440
語料
翻譯對
文件檢索
圖片 / 頭圖
0.6750.000.200.400.600.80
相關20.2%
困難負例3.2%
無關1.2%
推薦閾值
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
均衡 · 0.376
AUC
0.8440
噪聲上限
0.779
召回懸崖
0.123
測量樣本對
119 / 11k
向量分量help_outline
-0.18-0.010.15
σ 0.0361 · 183k 個數值
向量幾何help_outline
0768
各維度均值,懸停檢視區間
噪聲下限
0.283
有效維度
55 / 768
選擇要比較的模型
論文 (1)
ICML 2024
五月 30, 2024
Jina CLIP: Your CLIP Model Is Also Your Text Retriever

概述

jina-clip-v1 是一個 223M 參數的多模態向量模型,在文字到文字和文字到圖片檢索任務上均達到最先進的性能——CLIP 家族模型中首次實現。與為跨模態對齊而犧牲純文字檢索的標準 CLIP 模型不同,jina-clip-v1 透過多任務對比訓練在所有檢索組合中保持強勁表現。它支援 12,288 token 的文字上下文,是原始 CLIP 77 token 限制的 100 倍。

方法

該架構將改造後的 Jina BERT v2 文字編碼器(透過 ALiBi 支援 12,288 token)與北京智源人工智慧研究院(Beijing Academy for AI)的 EVA-02 圖像編碼器相結合。關鍵創新是多任務對比訓練方法:模型同時在 (1) 圖片-字幕對上進行跨模態對齊、(2) 文字-文字對上保持純文字檢索品質、(3) AI 生成的圖片長文字描述上提升對不同文字長度的穩健性進行訓練。最後階段使用困難負樣本文字三元組來銳化語義區分。這種多任務方法防止了標準 CLIP 訓練中常見的純文字檢索災難性遺忘。圖像編碼器處理 224×224 像素塊,每個塊消耗 1,000 token 的處理容量。

效能

在純文字檢索中,該模型相對於 OpenAI CLIP 性能提升 165%(MTEB 上 0.429 vs 0.162)。圖片任務:文字到圖片檢索提升 2%(0.899)、圖片到文字檢索提升 6%(0.803)、圖片到圖片檢索提升 12%(0.916)。在零樣本視覺分類(CIFAR-100)上,優於標準 CLIP。在 Flickr8k/30k 和 MSCOCO Captions 上的跨模態性能與專門的單模態模型相當。12,288 token 的文字上下文對於連同圖片檢索長文件是重大優勢。2026 年,jina-clip-v2 以 89 種語言支援和 512×512 圖片處理取代該模型。

最佳實踐

該模型以 224×224 像素塊處理圖片;每個塊消耗 1,000 token。一張 750×500 像素的圖片需要 12 個塊(12,000 token)。文字約每詞 1.1 token。請為混合模態查詢相應規劃 token 預算。該模型目前僅支援英語——多語言應用請使用 jina-clip-v2。可透過 Jina Embeddings API 使用,也可作為 Hugging Face 上 Apache 2.0 許可的開源版本。生產環境中,AWS Marketplace 和 Azure 部署選項提供優化的基礎設施。跨模態比較請使用餘弦相似度。新的多模態專案請優先選擇 jina-clip-v2(89 種語言、512×512 圖片、支援 MRL)或 jina-embeddings-v4(32K 上下文、多向量模式、支援程式碼)。

提及此模型的部落格
六月 25, 2025 • 12 分鐘閱讀
Jina 向量模型 v4:適用於多模態多語檢索的通用向量模型 (Embeddings)
Jina 向量模型 (Embeddings) v4 是一個 38 億參數的通用向量模型 (Embedding model),適用於多模和多語言檢索,支援單一向量和多向量向量模型 (Embedding) 輸出。
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
四月 08, 2025 • 21 分鐘閱讀
jina-reranker-m0:多語言多模態文件重排序器
介紹 jina-reranker-m0,這是我們新的多語言多模態重排序器,用於檢索視覺文件,在多語言長文件和程式碼搜尋任務上都達到了最先進的效能。
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
十二月 12, 2024 • 12 分鐘閱讀
調整嵌入模型的測試時計算資源
更好的效果隨著運算能力而擴展——更多學習,更多搜尋。一個優秀的預訓練模型能帶你走很遠,但測試階段的運算能力能讓你走得更遠。即便是對於 embedding 模型,認識到這種擴展測試階段運算能力的新範式也很重要。
Han Xiao
David Hockney artwork of a hand holding a rod with three colored spheres on a blue-toned background.
十二月 04, 2024 • 13 分鐘閱讀
當長上下文模型能夠處理所有內容時,還需要分塊嗎?
比較不同切分策略對長文本嵌入模型的性能表現,以找出最適合你需求的方法。
Michael Günther
Alex C-G
Artistic pixel art of two seagulls on colored pipes with speech bubbles; one reads "Too long?" and the other shows math equat
十一月 21, 2024 • 9 分鐘閱讀
Jina CLIP v2:文本與影像的多語言多模態嵌入表示
Jina-CLIP v2,一個規模為 0.9B 的多模態嵌入模型,支援 89 種語言的多語言功能、512x512 的高解析度圖像處理能力,以及具備 Matryoshka 表示法。
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
當前語言 / 主題
搜尋底座
Reader
向量模型
重排模型
獲取 Jina API 金鑰
速率限制
關於我們
新聞
下載 Jina 標誌
open_in_new
下載 Elastic 標誌
open_in_new
API 狀態
Elastic © 2026.安全條款及條件隱私管理 Cookie請勿出售或分享我的個人資訊
本網站及其所有相關內容、軟體、產品和服務僅供專業使用,不面向消費者。