E/A-Diagramm 1

Text

jina-embeddings-v5-omni-nano

Bild

Aufgabe

Vektor

E/A-Diagramm 2

Text

jina-embeddings-v5-omni-nano

Audio

Aufgabe

Vektor

E/A-Diagramm 3

Text

jina-embeddings-v5-omni-nano

Video

Aufgabe

Vektor

E/A-Diagramm 4

mehrere

Vektor

Text

jina-embeddings-v5-omni-nano

PDF

Aufgabe

Pareto-Front
300M1B3.0B10B20304050BidirLM-Omni-2.5B-Embed…e5-omni-3Be5-omni-7Bjina-embeddings-v5-omni…LanguageBindlarger_clap_generallarger_clap_musicLCO-Embedding-Omni-3Bmsclap-2022MuQ-MuLan-largeOmni-Embed-Nemotron-3BQwen2-Audio-7BQwen2.5-Omni-3Bspeecht5_multimodalwav2clipjina-embeddings-v5-omni…Parameter (log)score
Dieses Modell
Auf der Front
Jina AI
Andere
MAEB
49.69
Parameter
986M
Rang nach Score
6 / 21
Pareto-Front
Darauf
Werteverteilung
AUC 0.8242
Korpus
Übersetzungspaare
Dokumentensuche
Code
Bild / Banner
Bild / Logo
Aufgabe
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.7930.400.500.600.700.80
Verwandt20.2%
Hartes Negativ1.7%
Unverwandt1.1%
Empfohlene Schwellenwerte
FPR 0.1 · 0.722
FPR 0.01 · 0.793
FPR 0.001 · 0.841
FPR 0.0001 · 0.865
ausgewogen · 0.678
AUC
0.8242
Rauschgrenze
0.840
Recall-Kante
0.557
Gemessene Paare
119 / 11k
Dieses Modell teilt sich den Text-Tower mit jina-embeddings-v5-text-nano. Die Verteilungen hier sind die jenes Modells, mit dem es bis auf fp16-Übertragungsgenauigkeit übereinstimmt.
Vektorkomponenten
-0.180.000.19
σ 0.0361 · 183k Werte
Einbettungsgeometrie
0768
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.288
Effektive Dim.
69 / 768
Dimensionskürzung
3264128256512768
text-matching · Schwellenwert nach angeforderten Dimensionen
Sprachpaare
de-ruen-deen-koen-zhja-ko
Streuung des Schwellenwerts über die Paare: 0.027
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)

Überblick

jina-embeddings-v5-omni-nano ist ein multimodales Embedding-Modell mit rund 1,04B Parametern, das Text, Bilder, Video und Audio akzeptiert und Embeddings in einem gemeinsamen Vektorraum erzeugt. Es ist die kompakte Variante der v5-omni-Familie, entworfen für Edge- und Standard-Hardware ohne GPU. Die rein textuellen Ausgaben sind bit-identisch mit jina-embeddings-v5-text-nano, was ein Drop-in-Upgrade von text-only zu multimodal ohne Reindexierung möglich macht.

Methoden

Das Modell wird durch eine dritte Trainingsphase von jina-embeddings-v5-text-nano aus um multimodale Fähigkeiten erweitert. Das EuroBERT-210M-Text-Backbone und alle vier aufgaben-spezifischen LoRA-Adapter werden eingefroren; nur die Cross-Modal-Projectoren werden neu trainiert. Ein SigLIP2 Base-Vision-Encoder verarbeitet Bilder und Video (32 gleichmäßig abgetastete Frames pro Video). Ein Whisper-large-v3-Audio-Encoder verarbeitet Audioeingaben. PDF-Seiten werden als Bilder gerendert und über den visuellen Pfad verarbeitet. Das Training verwendet einen kontrastiven Verlust mit Cross-Modal-Hard-Negativen, um visuelle und Audio-Darstellungen mit dem bestehenden Text-Embedding-Raum auszurichten. Der 768-dimensionale Ausgabe-Raum unterstützt Matryoshka-Verkürzung bis hinab zu 32 Dimensionen. Das 8K-Token-Kontextfenster deckt den Texteingang ab; Bild- und Audioeingaben werden über ihre jeweiligen Encoder verarbeitet.

Leistung

Die reine Text-Leistung ist bit-identisch mit jina-embeddings-v5-text-nano (65,5 MMTEB Task-Ebene-Durchschnitt, 71,0 englisches MTEB). Die multimodale Leistung liegt leicht unter jina-embeddings-v5-omni-small, da der 768-dimensionale Embedding-Raum (gegenüber 1024) schmaler ist und das Text-Backbone kleiner, sie erhält aber eine starke Cross-Modal-Ausrichtung über Text-Bild-, Text-Audio- und Text-Video-Retrieval. Das Modell ist für CPU- und Edge-Hardware optimiert, wo das größere omni-small-Modell nicht effizient läuft. Die Cross-Modal-Retrieval-Qualität ist für seine Größenklasse wettbewerbsfähig.

Anleitung

Gleiche Nutzungsmuster wie jina-embeddings-v5-omni-small: Wählen Sie den passenden LoRA-Adapter (retrieval, text-matching, clustering, classification) und übergeben Sie direkt über die API Bild-URLs, Audio-Datei-URLs, Video-Datei-URLs oder PDF-URLs — das Modell leitet jede Modalität über den passenden Encoder weiter. Unterstützte Audio-Formate: WAV, MP3, FLAC, OGG, M4A, Opus. Videoeingaben werden als 32 gleichmäßig abgetastete Frames verarbeitet. Modalitäten können innerhalb eines einzigen Batches frei gemischt werden; der Embedding-Raum wird über alle Modalitäten hinweg geteilt. Nutzen Sie Kosinus-Ähnlichkeit zum Vergleich. Matryoshka-Verkürzung von 768 auf 32 Dimensionen wird unterstützt. Reine Text-Embeddings sind drop-in-kompatibel mit jina-embeddings-v5-text-nano — bei der Aufrüstung ist keine Reindexierung nötig. Für Server-Deployments, die höhere Genauigkeit erfordern, nutzen Sie jina-embeddings-v5-omni-small (1024 Dimensionen, größeres Backbone).

Blogs, die dieses Modell erwähnen