Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Reader
Konvertieren Sie jede URL in Markdown für besseres Grounding von LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumentation
Einloggen
login
Einbettungen
copyright CC BY-NC 4.0
open_in_new Release-Post

jina-embeddings-v5-omni-small

Multimodale Einbettungen für Text, Bild, Audio, Video und PDF
Lizenz
copyright CC-BY-NC-4.0
Veröffentlichungsdatum
calendar_month
2026-05-07
Eingabe
abc
Text
image
Bild
audiotrack
Audio
videocam
Video
picture_as_pdf
PDF
arrow_forward
Ausgabe
more_horiz
Vektor
Matryoshka-Dimensionen help_outline
32
64
128
256
512
768
1024
Modelldetails
Parameter: 1.7B
Länge des Eingabetokens: 32K
Ausgabedimension: 1024
Basismodell help_outline
link
jina-embeddings-v5-text-small
open_in_new
SigLIP2 Large
open_in_new
Whisper-large-v3
Ausgebildete Sprachen help_outline
32 Sprachen
Unterstützte Sprachen help_outline
93 Sprachen
Quantisierungen help_outline
GGUF
Apple Silicon-Unterstützung help_outline
MLX
Ähnliche Modelle
link
jina-embeddings-v5-omni-nano
link
jina-embeddings-v5-text-small
link
jina-embeddings-v3
link
jina-clip-v2
Unterstützte Aufgaben
search Retrieval
compare_arrows Text-Matching
bubble_chart Clustering
label Klassifizierung
Erhältlich über
Elastic Inference Service
Jina-API
AWS SageMaker
Hugging Face
Air-Gapped
E/A-Diagramm 1

Text

jina-embeddings-v5-omni-small

Bild

Aufgabe

Vektor

E/A-Diagramm 2

Text

jina-embeddings-v5-omni-small

Audio

Aufgabe

Vektor

E/A-Diagramm 3

Text

jina-embeddings-v5-omni-small

Video

Aufgabe

Vektor

E/A-Diagramm 4

mehrere

Vektor

Text

jina-embeddings-v5-omni-small

PDF

Aufgabe

Pareto-Fronthelp_outline
MMTEB
RTEB public
MIEB
MAEB
chevron_leftchevron_right
300M1B3.0B10B20304050BidirLM-Omni-2.5B-Embed…e5-omni-3Be5-omni-7Bjina-embeddings-v5-omni…LanguageBindlarger_clap_generallarger_clap_musicLCO-Embedding-Omni-3Bmsclap-2022MuQ-MuLan-largeOmni-Embed-Nemotron-3BQwen2-Audio-7BQwen2.5-Omni-3Bspeecht5_multimodalwav2clipjina-embeddings-v5-omni…Parameter (log)score
Dieses Modell
Auf der Front
Jina AI
Andere
MAEB
49.96
Parameter
1.6B
Rang nach Score
5 / 21
Pareto-Front
Darauf
Werteverteilunghelp_outline
AUC 0.8269
Korpus
Übersetzungspaare
Dokumentensuche
Code
Bild / Banner
Bild / Logo
Aufgabe
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
Verwandt10.9%
Hartes Negativ2.1%
Unverwandt0.9%
Empfohlene Schwellenwerte
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
ausgewogen · 0.697
AUC
0.8269
Rauschgrenze
0.855
Recall-Kante
0.566
Gemessene Paare
119 / 11k
Dieses Modell teilt sich den Text-Tower mit jina-embeddings-v5-text-small. Die Verteilungen hier sind die jenes Modells, mit dem es bis auf fp16-Übertragungsgenauigkeit übereinstimmt.
Vektorkomponentenhelp_outline
-0.160.010.18
σ 0.0313 · 244k Werte
Einbettungsgeometriehelp_outline
01024
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.300
Effektive Dim.
70 / 1024
Dimensionskürzunghelp_outline
32641282565121024
text-matching · Schwellenwert nach angeforderten Dimensionen
Sprachpaarehelp_outline
de-ruen-deen-koen-zhja-ko
Streuung des Schwellenwerts über die Paare: 0.024
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)
SIGIR 2026
Mai 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

Überblick

jina-embeddings-v5-omni-small ist ein multimodales Embedding-Modell mit rund 1,74B Parametern, das Text, Bilder, Video, Audio und PDF akzeptiert und Embeddings in einem gemeinsamen 1024-dimensionalen Vektorraum erzeugt. Es ist das Standard-Embedding-Modell der Jina-API und bietet den besten Genauigkeits-Effizienz-Kompromiss unter Jinas multimodalen Embedding-Modellen. Die rein textuellen Ausgaben sind bit-identisch mit jina-embeddings-v5-text-small, was einen nahtlosen Wechsel von text-only zu multimodal ohne Reindexierung ermöglicht.

Methoden

Das Modell wird in einer dritten Phase trainiert, die jina-embeddings-v5-text-small erweitert. Während des multimodalen Trainings werden das Qwen3-0,6B-Base-Text-Backbone und alle vier aufgaben-spezifischen LoRA-Adapter eingefroren; nur die Cross-Modal-Projectoren werden neu trainiert. Ein SigLIP2 Large-Vision-Encoder verarbeitet Bilder und Video (32 gleichmäßig abgetastete Frames pro Video). Ein Whisper-large-v3-Audio-Encoder verarbeitet Audioeingaben. PDF-Seiten werden als Bilder gerendert und über den visuellen Pfad verarbeitet. Das Training verwendet einen kontrastiven Verlust mit Cross-Modal-Hard-Negativen, um visuelle und Audio-Darstellungen mit dem bestehenden Text-Embedding-Raum auszurichten. Die 1024-dimensionale Ausgabe unterstützt Matryoshka-Verkürzung bis hinab zu 32 Dimensionen. Das 32K-Token-Kontextfenster deckt den Texteingang ab. Das Modell unterstützt quantisierte und MLX-Inferenz für Apple Silicon.

Leistung

Die reine Text-Leistung ist bit-identisch mit jina-embeddings-v5-text-small (67,0 MMTEB Task-Ebene-Durchschnitt, 71,7 englisches MTEB) — das Text-Backbone und die LoRA-Adapter bleiben während des multimodalen Trainings unberührt. Im Cross-Modal-Retrieval demonstriert das Modell starke Ausrichtung über Text-Bild-, Text-Audio- und Text-Video-Aufgaben hinweg. PDF-Seiten-Retrieval wird über den visuellen Pfad abgewickelt. Das omni-small-Modell bietet den besten Genauigkeits-Effizienz-Kompromiss unter Jinas multimodalen Embedding-Modellen für Server-Deployment, wobei 1024-dimensionale Embeddings mehr Diskriminationsvermögen bieten als die 768-dimensionale omni-nano-Variante.

Anleitung

Wählen Sie den passenden LoRA-Adapter: retrieval, text-matching, clustering oder classification. Für multimodale Eingaben über die API übergeben Sie direkt Bild-URLs, Audio-Datei-URLs, Video-Datei-URLs oder PDF-URLs — das Modell leitet jede Modalität über den passenden Encoder weiter. Unterstützte Audio-Formate umfassen WAV, MP3, FLAC, OGG, M4A und Opus. Videoeingaben werden als 32 gleichmäßig abgetastete Frames verarbeitet. Mischen Sie Modalitäten frei innerhalb eines einzigen Batches: Der Embedding-Raum wird über alle Modalitäten hinweg geteilt. Verwenden Sie Kosinus-Ähnlichkeit zum Vergleich. Matryoshka-Verkürzung von 1024 auf 32 Dimensionen wird unterstützt. Reine Text-Embeddings sind drop-in-kompatibel mit jina-embeddings-v5-text-small — bei der Aufrüstung ist keine Reindexierung nötig. Für Edge-Deployments ohne GPU nutzen Sie stattdessen jina-embeddings-v5-omni-nano.

Blogs, die dieses Modell erwähnen
Mai 12, 2026 • 7 Minuten gelesen
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
Aktuelle Sprache / Design
Search Foundation
Reader
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Neuigkeiten
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitAGBPrivatsphäreCookie-EinstellungenMeine persönlichen Daten nicht verkaufen oder weitergeben
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.