E/A-Diagramm 1

Text

jina-embeddings-v5-omni-small

Bild

Aufgabe

Vektor

E/A-Diagramm 2

Text

jina-embeddings-v5-omni-small

Audio

Aufgabe

Vektor

E/A-Diagramm 3

Text

jina-embeddings-v5-omni-small

Video

Aufgabe

Vektor

E/A-Diagramm 4

mehrere

Vektor

Text

jina-embeddings-v5-omni-small

PDF

Aufgabe

Pareto-Front
300M1B3.0B10B20304050BidirLM-Omni-2.5B-Embed…e5-omni-3Be5-omni-7Bjina-embeddings-v5-omni…LanguageBindlarger_clap_generallarger_clap_musicLCO-Embedding-Omni-3Bmsclap-2022MuQ-MuLan-largeOmni-Embed-Nemotron-3BQwen2-Audio-7BQwen2.5-Omni-3Bspeecht5_multimodalwav2clipjina-embeddings-v5-omni…Parameter (log)score
Dieses Modell
Auf der Front
Jina AI
Andere
MAEB
49.96
Parameter
1.6B
Rang nach Score
5 / 21
Pareto-Front
Darauf
Werteverteilung
AUC 0.8269
Korpus
Übersetzungspaare
Dokumentensuche
Code
Bild / Banner
Bild / Logo
Aufgabe
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
Verwandt10.9%
Hartes Negativ2.1%
Unverwandt0.9%
Empfohlene Schwellenwerte
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
ausgewogen · 0.697
AUC
0.8269
Rauschgrenze
0.855
Recall-Kante
0.566
Gemessene Paare
119 / 11k
Dieses Modell teilt sich den Text-Tower mit jina-embeddings-v5-text-small. Die Verteilungen hier sind die jenes Modells, mit dem es bis auf fp16-Übertragungsgenauigkeit übereinstimmt.
Vektorkomponenten
-0.160.010.18
σ 0.0313 · 244k Werte
Einbettungsgeometrie
01024
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.300
Effektive Dim.
70 / 1024
Dimensionskürzung
32641282565121024
text-matching · Schwellenwert nach angeforderten Dimensionen
Sprachpaare
de-ruen-deen-koen-zhja-ko
Streuung des Schwellenwerts über die Paare: 0.024
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)

Überblick

jina-embeddings-v5-omni-small ist ein multimodales Embedding-Modell mit rund 1,74B Parametern, das Text, Bilder, Video, Audio und PDF akzeptiert und Embeddings in einem gemeinsamen 1024-dimensionalen Vektorraum erzeugt. Es ist das Standard-Embedding-Modell der Jina-API und bietet den besten Genauigkeits-Effizienz-Kompromiss unter Jinas multimodalen Embedding-Modellen. Die rein textuellen Ausgaben sind bit-identisch mit jina-embeddings-v5-text-small, was einen nahtlosen Wechsel von text-only zu multimodal ohne Reindexierung ermöglicht.

Methoden

Das Modell wird in einer dritten Phase trainiert, die jina-embeddings-v5-text-small erweitert. Während des multimodalen Trainings werden das Qwen3-0,6B-Base-Text-Backbone und alle vier aufgaben-spezifischen LoRA-Adapter eingefroren; nur die Cross-Modal-Projectoren werden neu trainiert. Ein SigLIP2 Large-Vision-Encoder verarbeitet Bilder und Video (32 gleichmäßig abgetastete Frames pro Video). Ein Whisper-large-v3-Audio-Encoder verarbeitet Audioeingaben. PDF-Seiten werden als Bilder gerendert und über den visuellen Pfad verarbeitet. Das Training verwendet einen kontrastiven Verlust mit Cross-Modal-Hard-Negativen, um visuelle und Audio-Darstellungen mit dem bestehenden Text-Embedding-Raum auszurichten. Die 1024-dimensionale Ausgabe unterstützt Matryoshka-Verkürzung bis hinab zu 32 Dimensionen. Das 32K-Token-Kontextfenster deckt den Texteingang ab. Das Modell unterstützt quantisierte und MLX-Inferenz für Apple Silicon.

Leistung

Die reine Text-Leistung ist bit-identisch mit jina-embeddings-v5-text-small (67,0 MMTEB Task-Ebene-Durchschnitt, 71,7 englisches MTEB) — das Text-Backbone und die LoRA-Adapter bleiben während des multimodalen Trainings unberührt. Im Cross-Modal-Retrieval demonstriert das Modell starke Ausrichtung über Text-Bild-, Text-Audio- und Text-Video-Aufgaben hinweg. PDF-Seiten-Retrieval wird über den visuellen Pfad abgewickelt. Das omni-small-Modell bietet den besten Genauigkeits-Effizienz-Kompromiss unter Jinas multimodalen Embedding-Modellen für Server-Deployment, wobei 1024-dimensionale Embeddings mehr Diskriminationsvermögen bieten als die 768-dimensionale omni-nano-Variante.

Anleitung

Wählen Sie den passenden LoRA-Adapter: retrieval, text-matching, clustering oder classification. Für multimodale Eingaben über die API übergeben Sie direkt Bild-URLs, Audio-Datei-URLs, Video-Datei-URLs oder PDF-URLs — das Modell leitet jede Modalität über den passenden Encoder weiter. Unterstützte Audio-Formate umfassen WAV, MP3, FLAC, OGG, M4A und Opus. Videoeingaben werden als 32 gleichmäßig abgetastete Frames verarbeitet. Mischen Sie Modalitäten frei innerhalb eines einzigen Batches: Der Embedding-Raum wird über alle Modalitäten hinweg geteilt. Verwenden Sie Kosinus-Ähnlichkeit zum Vergleich. Matryoshka-Verkürzung von 1024 auf 32 Dimensionen wird unterstützt. Reine Text-Embeddings sind drop-in-kompatibel mit jina-embeddings-v5-text-small — bei der Aufrüstung ist keine Reindexierung nötig. Für Edge-Deployments ohne GPU nutzen Sie stattdessen jina-embeddings-v5-omni-nano.

Blogs, die dieses Modell erwähnen