E/A-Diagramm 1
E/A-Diagramm 2
E/A-Diagramm 3
E/A-Diagramm 4
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
RTEB public
66.84
Parameters
1.6B
Rank by score
14 / 62
Pareto front
Behind it
Werteverteilunghelp_outlineAUC 0.8269
Korpus
Übersetzungspaare
Dokumentensuche
Code
Bild / Banner
Bild / Logo
Aufgabe
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
Verwandt10.9%
Hartes Negativ2.1%
Unverwandt0.9%
Empfohlene Schwellenwerte
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
ausgewogen · 0.697
AUC
0.8269
Rauschgrenze
0.855
Recall-Kante
0.566
Gemessene Paare
119 / 11k
Dieses Modell teilt sich den Text-Tower mit jina-embeddings-v5-text-small. Die Verteilungen hier sind die jenes Modells, mit dem es bis auf fp16-Übertragungsgenauigkeit übereinstimmt.
Vektorkomponentenhelp_outline
σ 0.0313 · 244k Werte
Einbettungsgeometriehelp_outline
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.300
Effektive Dim.
70 / 1024
Dimensionskürzunghelp_outline
text-matching · Schwellenwert nach angeforderten Dimensionen
Sprachpaarehelp_outline
Streuung des Schwellenwerts über die Paare: 0.024
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)
Überblick
jina-embeddings-v5-omni-small (~1,74 Milliarden Parameter) ist ein multimodales Embedding-Modell, das Text, Bilder, Videos und Audio verarbeitet und Embeddings in einem gemeinsamen Vektorraum erzeugt, der mit jina-embeddings-v5-text-small übereinstimmt. Sie können mit Text indizieren und mit jeder Modalität abfragen oder umgekehrt, ohne neu indizieren zu müssen. Das Text-Backbone und alle vier aufgabenspezifischen LoRA-Adapter (Retrieval, Textvergleich, Clustering, Klassifizierung) werden während des multimodalen Trainings eingefroren, sodass die reinen Textausgaben bitgenau mit jina-embeddings-v5-text-small übereinstimmen. Das Modell erzeugt 1024-dimensionale Embeddings mit Matryoshka-Trunkierung auf bis zu 32 Dimensionen und unterstützt eine Kontextlänge von 32K Token.
Methoden
Das Training erfolgte in einer dritten Stufe, die jina-embeddings-v5-text-small erweiterte. Das Text-Backbone und alle vier aufgabenspezifischen LoRA-Adapter sind eingefroren; lediglich die crossmodalen Projektoren wurden neu trainiert. Ein SigLIP2 So400m Vision-Encoder verarbeitet Bilder und Videos (32 gleichmäßig abgetastete Frames). Ein Whisper-large-v3 Audio-Encoder verarbeitet die Audioeingabe. PDF-Seiten werden als Bilder gerendert und über den Bildverarbeitungspfad verarbeitet. Das Training verwendet einen kontrastiven Verlust mit crossmodalen harten Negativen, um visuelle und auditive Repräsentationen an den bestehenden Text-Embedding-Raum anzupassen.
Leistung
Die Leistung bei reinen Textdaten ist identisch mit der von jina-embeddings-v5-text-small – das Text-Backbone und die LoRA-Adapter bleiben während des multimodalen Trainings unverändert. Bei der modalitätsübergreifenden Suche zeigt das Modell eine starke Übereinstimmung zwischen Text-Bild-, Text-Audio- und Text-Video-Aufgaben. Die Suche nach PDF-Seiten erfolgt über den Bildverarbeitungspfad. Das Omni-Small-Modell bietet unter den multimodalen Jina-Embedding-Modellen für den Servereinsatz das beste Verhältnis von Genauigkeit zu Effizienz.
Anleitung
Die gleichen vier LoRA-Adapter wie in v5-text-small: retrieval, text-matching, clustering und classification. Für multimodale Eingaben über die API können Bild-, Audio-, Video- oder PDF-URLs direkt übergeben werden – das Modell leitet jede Modalität an den entsprechenden Encoder weiter. Unterstützte Audioformate sind WAV, MP3, FLAC, OGG, M4A und Opus. Videoeingaben werden als 32 gleichmäßig abgetastete Frames verarbeitet. Modalitäten können innerhalb eines Batches beliebig kombiniert werden: Der Embedding-Raum wird von allen Modalitäten gemeinsam genutzt. Für den Vergleich wird die Kosinusähnlichkeit verwendet. Die Matryoshka-Trunkierung von 1024 auf 32 Dimensionen wird unterstützt. Reine Text-Embeddings sind direkt kompatibel mit jina-embeddings-v5-text-small – beim Upgrade ist keine Neuindizierung erforderlich.
Blogs, die dieses Modell erwähnen



