Überblick
jina-embeddings-v5-omni-small ist ein multimodales Embedding-Modell mit rund 1,74B Parametern, das Text, Bilder, Video, Audio und PDF akzeptiert und Embeddings in einem gemeinsamen 1024-dimensionalen Vektorraum erzeugt. Es ist das Standard-Embedding-Modell der Jina-API und bietet den besten Genauigkeits-Effizienz-Kompromiss unter Jinas multimodalen Embedding-Modellen. Die rein textuellen Ausgaben sind bit-identisch mit jina-embeddings-v5-text-small, was einen nahtlosen Wechsel von text-only zu multimodal ohne Reindexierung ermöglicht.
Methoden
Das Modell wird in einer dritten Phase trainiert, die jina-embeddings-v5-text-small erweitert. Während des multimodalen Trainings werden das Qwen3-0,6B-Base-Text-Backbone und alle vier aufgaben-spezifischen LoRA-Adapter eingefroren; nur die Cross-Modal-Projectoren werden neu trainiert. Ein SigLIP2 Large-Vision-Encoder verarbeitet Bilder und Video (32 gleichmäßig abgetastete Frames pro Video). Ein Whisper-large-v3-Audio-Encoder verarbeitet Audioeingaben. PDF-Seiten werden als Bilder gerendert und über den visuellen Pfad verarbeitet. Das Training verwendet einen kontrastiven Verlust mit Cross-Modal-Hard-Negativen, um visuelle und Audio-Darstellungen mit dem bestehenden Text-Embedding-Raum auszurichten. Die 1024-dimensionale Ausgabe unterstützt Matryoshka-Verkürzung bis hinab zu 32 Dimensionen. Das 32K-Token-Kontextfenster deckt den Texteingang ab. Das Modell unterstützt quantisierte und MLX-Inferenz für Apple Silicon.
Leistung
Die reine Text-Leistung ist bit-identisch mit jina-embeddings-v5-text-small (67,0 MMTEB Task-Ebene-Durchschnitt, 71,7 englisches MTEB) — das Text-Backbone und die LoRA-Adapter bleiben während des multimodalen Trainings unberührt. Im Cross-Modal-Retrieval demonstriert das Modell starke Ausrichtung über Text-Bild-, Text-Audio- und Text-Video-Aufgaben hinweg. PDF-Seiten-Retrieval wird über den visuellen Pfad abgewickelt. Das omni-small-Modell bietet den besten Genauigkeits-Effizienz-Kompromiss unter Jinas multimodalen Embedding-Modellen für Server-Deployment, wobei 1024-dimensionale Embeddings mehr Diskriminationsvermögen bieten als die 768-dimensionale omni-nano-Variante.
Anleitung
Wählen Sie den passenden LoRA-Adapter: retrieval, text-matching, clustering oder classification. Für multimodale Eingaben über die API übergeben Sie direkt Bild-URLs, Audio-Datei-URLs, Video-Datei-URLs oder PDF-URLs — das Modell leitet jede Modalität über den passenden Encoder weiter. Unterstützte Audio-Formate umfassen WAV, MP3, FLAC, OGG, M4A und Opus. Videoeingaben werden als 32 gleichmäßig abgetastete Frames verarbeitet. Mischen Sie Modalitäten frei innerhalb eines einzigen Batches: Der Embedding-Raum wird über alle Modalitäten hinweg geteilt. Verwenden Sie Kosinus-Ähnlichkeit zum Vergleich. Matryoshka-Verkürzung von 1024 auf 32 Dimensionen wird unterstützt. Reine Text-Embeddings sind drop-in-kompatibel mit jina-embeddings-v5-text-small — bei der Aufrüstung ist keine Reindexierung nötig. Für Edge-Deployments ohne GPU nutzen Sie stattdessen jina-embeddings-v5-omni-nano.



