Elastic
Jina AI
Pressemitteilungen
Modelle
API
keyboard_arrow_down
Leser
Lesen Sie URLs und suchen Sie im Internet nach fundierteren LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
Elastic Inference Service
Jina-Modelle nativ in Elasticsearch ausführen.
MCP terminalCLIarticlellms.txtsmart_toyAgentendata_objectSchemamenu_bookDokumente



Einloggen
login
Einbettungen
copyright CC BY-NC 4.0
open_in_new Beitrag veröffentlichen

jina-clip-v2

Mehrsprachige multimodale Einbettungen für Texte und Bilder
Lizenz
copyright CC-BY-NC-4.0
Veröffentlichungsdatum
calendar_month
2024-11-05
Eingang
image
Bild
abc
Text
arrow_forward
Ausgabe
more_horiz
Vektor
Matryoshka-Dimensionen help_outline
64
128
256
512
768
1024
Modelldetails
Parameter: 865M
Länge des Eingabetokens: 8K
Eingabebildgröße: 512×512
Ausgabedimension: 1024
Basismodell help_outline
open_in_new
XLM-RoBERTa Large
Ausgebildete Sprachen help_outline
32 Sprachen
Unterstützte Sprachen help_outline
108 Sprachen
Ähnliche Modelle
link
jina-clip-v1
Erhältlich über
Elastic Inference Service
Jina-API
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-Gapped
E/A-Diagramm 1

Text

jina-clip-v2

Vektor

E/A-Diagramm 2

Bild

jina-clip-v2

Vektor

Werteverteilunghelp_outline
AUC 0.8383
Korpus
Übersetzungspaare
Dokumentensuche
Bild / Banner
Bild / Logo
Aufgabe
default
retrieval.query
0.6040.000.200.400.60
Verwandt20.2%
Hartes Negativ3.6%
Unverwandt0.8%
Zum Verschieben des Schwellenwerts das Diagramm überfahren oder anklicken
Empfohlene Schwellenwerte
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
ausgewogen · 0.403
AUC
0.8383
Rauschgrenze
0.666
Recall-Kante
0.224
Gemessene Paare
119 / 11k
Vektorkomponentenhelp_outline
-0.43-0.070.29
σ 0.0313 · 244k Werte
Einbettungsgeometriehelp_outline
01024
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.420
Effektive Dim.
52 / 1024
Sprachpaarehelp_outline
de-ruen-deen-koen-zhja-ko
Streuung des Schwellenwerts über die Paare: 0.064
Wählen Sie Modelle zum Vergleichen aus
Publikationen (2)
ICLR 2026
Januar 22, 2026
Embedding Compression via Spherical Coordinates
ICLR 2025
Dezember 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

Überblick

Jina CLIP v2 revolutioniert die multimodale KI, indem es die Lücke zwischen visuellem und textlichem Verständnis in 89 Sprachen schließt. Dieses Modell löst kritische Herausforderungen im globalen E-Commerce, im Content Management und in der interkulturellen Kommunikation, indem es eine genaue Bild-Text-Übereinstimmung unabhängig von Sprachbarrieren ermöglicht. Für Unternehmen, die international expandieren oder mehrsprachige Inhalte verwalten, macht es separate Modelle pro Sprache oder komplexe Übersetzungspipelines überflüssig. Das Modell glänzt insbesondere in Szenarien, die eine präzise visuelle Suche über Sprachgrenzen hinweg erfordern, wie z. B. die Produktfindung auf globalen Marktplätzen oder das mehrsprachige digitale Asset-Management.

Methoden

Im Kern verwendet Jina CLIP v2 eine ausgeklügelte Dual-Encoder-Architektur, die einen Jina XLM-RoBERTa-Text-Encoder (561 Millionen Parameter) mit einem EVA02-L14-Vision-Encoder (304 Millionen Parameter) kombiniert. Der Text-Encoder verarbeitet Inhalte in 89 Sprachen mit einem riesigen Kontextfenster von 696.320 Token, während der Vision-Encoder hochauflösende Bilder mit bis zu 512 x 512 Pixeln verarbeitet. Das Modell führt innovatives Matryoshka-Repräsentationslernen ein, das eine dynamische Anpassung der Einbettungsdimension von 1024 auf 64 Dimensionen unter Beibehaltung der Leistung ermöglicht. Diese Architektur verarbeitet sowohl Text als auch Bilder über ihre jeweiligen Encoder und projiziert sie in einen gemeinsamen semantischen Raum, in dem ähnliche Konzepte unabhängig von ihrer ursprünglichen Modalität oder Sprache ausgerichtet sind.

Leistung

Das Modell erreicht mit 98,0 % Genauigkeit bei Flickr30k-Bild-zu-Text-Abrufaufgaben eine hochmoderne Leistung und übertrifft damit sowohl seinen Vorgänger als auch NLLB-CLIP-SigLIP. In mehrsprachigen Szenarien zeigt es eine bis zu 4 %ige Verbesserung gegenüber NLLB-CLIP-SigLIP bei sprachübergreifenden Bildabrufaufgaben, obwohl es weniger Parameter als sein größter Konkurrent hat. Das Modell behält seine starke Leistung auch bei komprimierten Einbettungen bei – bei einer Reduzierung der Abmessungen um 75 % bleiben bei Text-, Bild- und modalübergreifenden Aufgaben immer noch über 99 % der Leistung erhalten. Bei den umfassenden mehrsprachigen MTEB-Benchmarks erreicht es 69,86 % beim Abruf und 67,77 % bei Aufgaben zur semantischen Ähnlichkeit und ist damit konkurrenzfähig mit spezialisierten Text-Einbettungsmodellen.

Anleitung

Für eine optimale Bereitstellung sollten Benutzer mehrere Schlüsselfaktoren berücksichtigen. Das Modell erfordert CUDA-fähige Hardware für eine effiziente Verarbeitung, wobei der Speicherbedarf basierend auf Batchgröße und Bildauflösung skaliert wird. Um API-Kosten und -Leistung zu optimieren, skalieren Sie Bilder vor der Verarbeitung auf 512 x 512 Pixel – größere Bilder werden automatisch gekachelt, was den Token-Verbrauch und die Verarbeitungszeit erhöht. Das Modell eignet sich hervorragend zum Abgleichen von Bildern mit beschreibendem Text in verschiedenen Sprachen, kann jedoch mit abstrakten Konzepten oder hochspezialisierten domänenspezifischen Inhalten Probleme haben. Es ist besonders effektiv für die E-Commerce-Produktsuche, Inhaltsempfehlungssysteme und visuelle Suchanwendungen, ist jedoch möglicherweise nicht für Aufgaben geeignet, die eine feinkörnige visuelle Detailanalyse oder hochspezialisiertes Fachwissen erfordern. Berücksichtigen Sie bei Verwendung der Matryoshka-Darstellungsfunktion den Kompromiss zwischen Dimensionsreduzierung und Leistung – während 64-dimensionale Einbettungen eine starke Leistung beibehalten, können kritische Anwendungen von höheren Dimensionen profitieren.
Blogs, die dieses Modell erwähnen
November 21, 2024 • 9 Minuten gelesen
Jina CLIP v2: Multilinguale und Multimodale Embeddings für Text und Bilder
Jina-CLIP v2, ein multimodales Embedding-Modell mit 0,9 Milliarden Parametern, das 89 Sprachen unterstützt, eine hohe Bildauflösung von 512x512 bietet und Matryoshka-Repräsentationen verwendet.
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
Oktober 29, 2024 • 11 Minuten gelesen
Jenseits von CLIP: Wie Jina-CLIP die multimodale Suche voranbringt
Erfahren Sie, wie Jina-CLIP die CLIP-Technologie von OpenAI durch einheitliche Text-Bild-Embeddings verbessert und dabei eine höhere Abrufgenauigkeit und vielfältigere Ergebnisse erzielt.
Bo Wang
Alex C-G
Abstract digital landscape with wave-like green and pink dunes against a dark background, conveying a tranquil atmosphere.
Juni 05, 2024 • 9 Minuten gelesen
Jina CLIP v1: Ein wirklich multimodales Embedding-Modell für Text und Bild
Das neue multimodale Embedding-Modell von Jina AI übertrifft nicht nur OpenAI CLIP bei der Text-Bild-Suche, es ist gleichzeitig auch ein leistungsstarkes Image-Embedding-Modell und ein hochmodernes Text-Embedding-Modell. Sie benötigen keine verschiedenen Modelle mehr für unterschiedliche Modalitäten.
Sofia Vasileva
Scott Martens
Susana Guzmán
Abstract 3D render of a neon blue and green grid pattern on a black background, creating a sense of depth.
September 27, 2024 • 15 Minuten gelesen
Migration von Jina Embeddings v2 zu v3
Wir haben einige Tipps zusammengestellt, die Ihnen bei der Migration von Jina Embeddings v2 auf v3 helfen.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
August 30, 2024 • 10 Minuten gelesen
Jina ColBERT v2: Mehrsprachiger Late-Interaction-Retriever für Embedding und Reranking
Jina ColBERT v2 unterstützt 89 Sprachen mit überlegener Retrievalleistung, benutzerdefinierten Ausgabedimensionen und einer Token-Länge von 8192.
Jina AI
Dark-themed coding interface displaying English and Japanese characters with "JINA COLBERT V2" highlighted in the center.
Search Foundation
Leser
Einbettungen
Reranker
Elastic Inference Service
open_in_new
Jina API-Schlüssel abrufen
Ratenbegrenzung
API-Status
Bedingungen
Sicherheit
Terms & amp; Bedingungen
Privatsphäre
Cookie-Einstellungen
Meine persönlichen Daten werden nicht verkauft oder weitergegeben.
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
Elastic © 2020-2026.
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.