E/A-Diagramm 1

Text

jina-clip-v1

Vektor

E/A-Diagramm 2

Bild

jina-clip-v1

Vektor

Pareto-Front
300M1B3.0B10B20406080100bge-visualized-m3BiModernVBERTDSE-Phi3dse-qwen2-2b-mrl-v1e5-vjina-clip-v2jina-embeddings-v3jina-embeddings-v4llama-nemoretriever-col…MoCa-3Bnemotron-colembed-vl-8b…nllb-siglip-largeONE-PEACESauerkrautLM-ColLFM2-45…SauerkrautLM-ColMinistr…siglip-so400m-patch14-3…SigLIP2-L-512/16VLM2VecVultronRetrieverFlash-Q…jina-clip-v1Parameter (log)nDCG@5
Dieses Modell
Auf der Front
Jina AI
Andere
ViDoRe v1
17.72
Parameter
223M
Rang nach Score
32 / 33
Pareto-Front
Darauf
Werteverteilung
AUC 0.8440
Korpus
Übersetzungspaare
Dokumentensuche
Bild / Banner
0.6750.000.200.400.600.80
Verwandt20.2%
Hartes Negativ3.2%
Unverwandt1.2%
Empfohlene Schwellenwerte
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
ausgewogen · 0.376
AUC
0.8440
Rauschgrenze
0.779
Recall-Kante
0.123
Gemessene Paare
119 / 11k
Vektorkomponenten
-0.18-0.010.15
σ 0.0361 · 183k Werte
Einbettungsgeometrie
0768
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.283
Effektive Dim.
55 / 768
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)

Überblick

jina-clip-v1 ist ein multimodales Embedding-Modell mit 223M Parametern, das state-of-the-art-Performance bei Text-zu-Text- und Text-zu-Bild-Retrieval erreicht — das erste Modell der CLIP-Familie, dem das gelingt. Im Gegensatz zu Standard-CLIP-Modellen, die reines Text-Retrieval für die multimodale Ausrichtung opfern, nutzt jina-clip-v1 Multi-Task-Kontrast-Training, um starke Performance in allen Retrieval-Kombinationen zu halten. Es unterstützt einen Textkontext von 12.288 Tokens — das 100-Fache der 77-Token-Grenze des originalen CLIP.

Methoden

Die Architektur kombiniert einen angepassten Jina-BERT-v2-Text-Encoder (12.288 Tokens dank ALiBi) mit dem EVA-02-Bild-Encoder der Beijing Academy for AI. Die Schlüsselinnovation ist die Multi-Task-Kontrast-Trainingsmethode: Das Modell wird gleichzeitig auf (1) Bild-Beschriftungs-Paaren für die multimodale Ausrichtung, (2) Text-Text-Paaren zur Erhaltung der reinen Text-Retrieval-Qualität und (3) längeren, KI-generierten Textbeschreibungen von Bildern für Robustheit gegenüber variierenden Textlängen trainiert. Eine letzte Stufe verwendet harte negative Text-Triplets, um semantische Unterscheidungen zu schärfen. Dieser Multi-Task-Ansatz verhindert das katastrophale Vergessen von Text-Retrieval, das standardmäßiges CLIP-Training plagt. Der Bild-Encoder verarbeitet 224×224-Pixel-Kacheln, wobei jede Kachel 1.000 Tokens Verarbeitungskapazität verbraucht.

Leistung

Beim reinen Text-Retrieval erreicht das Modell eine 165-prozentige Leistungssteigerung gegenüber OpenAI CLIP (0,429 vs. 0,162 auf MTEB). Für Bildaufgaben: 2 % besser im Text-zu-Bild-Retrieval (0,899), 6 % im Bild-zu-Text-Retrieval (0,803) und 12 % im Bild-zu-Bild-Retrieval (0,916). Bei der Zero-Shot-Bildklassifikation (CIFAR-100) übertrifft es Standard-CLIP. Die multimodale Performance auf Flickr8k/30k und MSCOCO Captions ist mit spezialisierten Einzelmodalitäts-Modellen vergleichbar. Der 12.288-Token-Textkontext ist ein großer Vorteil für die Suche in umfangreichen Textdokumenten neben Bildern. 2026 wird dieses Modell durch jina-clip-v2 mit 89 Sprachen und 512×512-Bildverarbeitung abgelöst.

Anleitung

Das Modell verarbeitet Bilder in 224×224-Pixel-Kacheln; jede Kachel verbraucht 1.000 Tokens. Ein 750×500-Pixel-Bild benötigt 12 Kacheln (12.000 Tokens). Text benötigt etwa 1,1 Tokens pro Wort. Planen Sie Token-Budgets entsprechend für multimodale Anfragen. Das Modell unterstützt derzeit nur Englisch — für mehrsprachige Anwendungen jina-clip-v2 verwenden. Verfügbar über die Jina Embeddings API und als Open-Source-Veröffentlichung auf Hugging Face unter der Apache-2.0-Lizenz. Für Produktionsumgebungen bieten AWS Marketplace und Azure-Deployment-Optionen optimierte Infrastruktur. Für multimodale Vergleiche Cosine-Ähnlichkeit verwenden. Für neue multimodale Projekte jina-clip-v2 (89 Sprachen, 512×512-Bilder, MRL-Unterstützung) oder jina-embeddings-v4 (32K-Kontext, Multi-Vektor-Modus, Code-Unterstützung) bevorzugen.

Blogs, die dieses Modell erwähnen
Juni 25, 2025 • 12 Minuten gelesen
Jina Embeddings v4: Universelle Vektor Modelle (Embeddings) für Multimodale, Mehrsprachige Suche
Jina Embeddings v4 ist ein universelles 向量模型 (Embeddings)-Modell mit 3,8 Milliarden Parametern für multimodale und mehrsprachige Suche, das sowohl Single-Vektor- als auch Multi-Vektor-Embedding-Ausgaben unterstützt.
April 08, 2025 • 21 Minuten gelesen
jina-reranker-m0: Mehrsprachiger multimodaler Dokument-Reranker
Wir stellen jina-reranker-m0 vor, unseren neuen mehrsprachigen multimodalen Reranker für das Abrufen visueller Dokumente, mit SOTA-Performance bei mehrsprachigen langen Dokumenten und Code-Suchaufgaben.
Dezember 12, 2024 • 12 Minuten gelesen
Skalierung der Rechenleistung zur Testzeit bei Embedding-Modellen
Bessere Ergebnisse skalieren mit Rechenleistung—mehr beim Lernen, mehr bei der Suche. Ein gutes vortrainiertes Modell bringt einen weit, aber Rechenleistung zur Testzeit bringt einen noch weiter. Es ist wichtig, dieses neue Paradigma der Skalierung von Rechenleistung zur Testzeit zu erkennen, selbst bei Embedding-Modellen.
Dezember 04, 2024 • 13 Minuten gelesen
Braucht man immer noch Chunking, wenn Long-Context-Modelle alles können?
Vergleich der Leistung von Long-Context-Embedding-Modellen mit verschiedenen Chunking-Strategien, um den optimalen Ansatz für Ihre Anforderungen zu finden.
November 21, 2024 • 9 Minuten gelesen
Jina CLIP v2: Multilinguale und Multimodale Embeddings für Text und Bilder
Jina-CLIP v2, ein multimodales Embedding-Modell mit 0,9 Milliarden Parametern, das 89 Sprachen unterstützt, eine hohe Bildauflösung von 512x512 bietet und Matryoshka-Repräsentationen verwendet.