Überblick
jina-clip-v1 ist ein multimodales Embedding-Modell mit 223M Parametern, das state-of-the-art-Performance bei Text-zu-Text- und Text-zu-Bild-Retrieval erreicht — das erste Modell der CLIP-Familie, dem das gelingt. Im Gegensatz zu Standard-CLIP-Modellen, die reines Text-Retrieval für die multimodale Ausrichtung opfern, nutzt jina-clip-v1 Multi-Task-Kontrast-Training, um starke Performance in allen Retrieval-Kombinationen zu halten. Es unterstützt einen Textkontext von 12.288 Tokens — das 100-Fache der 77-Token-Grenze des originalen CLIP.
Methoden
Die Architektur kombiniert einen angepassten Jina-BERT-v2-Text-Encoder (12.288 Tokens dank ALiBi) mit dem EVA-02-Bild-Encoder der Beijing Academy for AI. Die Schlüsselinnovation ist die Multi-Task-Kontrast-Trainingsmethode: Das Modell wird gleichzeitig auf (1) Bild-Beschriftungs-Paaren für die multimodale Ausrichtung, (2) Text-Text-Paaren zur Erhaltung der reinen Text-Retrieval-Qualität und (3) längeren, KI-generierten Textbeschreibungen von Bildern für Robustheit gegenüber variierenden Textlängen trainiert. Eine letzte Stufe verwendet harte negative Text-Triplets, um semantische Unterscheidungen zu schärfen. Dieser Multi-Task-Ansatz verhindert das katastrophale Vergessen von Text-Retrieval, das standardmäßiges CLIP-Training plagt. Der Bild-Encoder verarbeitet 224×224-Pixel-Kacheln, wobei jede Kachel 1.000 Tokens Verarbeitungskapazität verbraucht.
Leistung
Beim reinen Text-Retrieval erreicht das Modell eine 165-prozentige Leistungssteigerung gegenüber OpenAI CLIP (0,429 vs. 0,162 auf MTEB). Für Bildaufgaben: 2 % besser im Text-zu-Bild-Retrieval (0,899), 6 % im Bild-zu-Text-Retrieval (0,803) und 12 % im Bild-zu-Bild-Retrieval (0,916). Bei der Zero-Shot-Bildklassifikation (CIFAR-100) übertrifft es Standard-CLIP. Die multimodale Performance auf Flickr8k/30k und MSCOCO Captions ist mit spezialisierten Einzelmodalitäts-Modellen vergleichbar. Der 12.288-Token-Textkontext ist ein großer Vorteil für die Suche in umfangreichen Textdokumenten neben Bildern. 2026 wird dieses Modell durch jina-clip-v2 mit 89 Sprachen und 512×512-Bildverarbeitung abgelöst.
Anleitung
Das Modell verarbeitet Bilder in 224×224-Pixel-Kacheln; jede Kachel verbraucht 1.000 Tokens. Ein 750×500-Pixel-Bild benötigt 12 Kacheln (12.000 Tokens). Text benötigt etwa 1,1 Tokens pro Wort. Planen Sie Token-Budgets entsprechend für multimodale Anfragen. Das Modell unterstützt derzeit nur Englisch — für mehrsprachige Anwendungen jina-clip-v2 verwenden. Verfügbar über die Jina Embeddings API und als Open-Source-Veröffentlichung auf Hugging Face unter der Apache-2.0-Lizenz. Für Produktionsumgebungen bieten AWS Marketplace und Azure-Deployment-Optionen optimierte Infrastruktur. Für multimodale Vergleiche Cosine-Ähnlichkeit verwenden. Für neue multimodale Projekte jina-clip-v2 (89 Sprachen, 512×512-Bilder, MRL-Unterstützung) oder jina-embeddings-v4 (32K-Kontext, Multi-Vektor-Modus, Code-Unterstützung) bevorzugen.









