Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Leser
Lesen Sie URLs und suchen Sie im Internet nach fundierteren LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
Elastic Inference Service
Jina-Modelle nativ in Elasticsearch ausführen.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumente
Einloggen
login
Einbettungen
copyright CC BY-NC 4.0
open_in_new Beitrag veröffentlichen

jina-embeddings-v5-omni-small

Multimodale Einbettungen für Text, Bild, Audio, Video und PDF
Lizenz
copyright CC-BY-NC-4.0
Veröffentlichungsdatum
calendar_month
2026-05-07
Eingang
abc
Text
image
Bild
audiotrack
Audio
videocam
Video
picture_as_pdf
PDF
arrow_forward
Ausgabe
more_horiz
Vektor
Matryoshka-Dimensionen help_outline
32
64
128
256
512
768
1024
Modelldetails
Parameter: 1.7B
Länge des Eingabetokens: 32K
Ausgabedimension: 1024
Basismodell help_outline
open_in_new
jina-embeddings-v5-text-small
Ausgebildete Sprachen help_outline
32 Sprachen
Unterstützte Sprachen help_outline
93 Sprachen
Quantisierungen help_outline
GGUF
Apple Silicon-Unterstützung help_outline
MLX
Ähnliche Modelle
link
jina-embeddings-v5-omni-nano
link
jina-embeddings-v5-text-small
link
jina-embeddings-v3
link
jina-clip-v2
Unterstützte Aufgaben
search Abruf
compare_arrows Textabgleich
bubble_chart Clustering
label Einstufung
Erhältlich über
Elastic Inference Service
Jina-API
AWS SageMaker
Hugging Face
Air-Gapped
E/A-Diagramm 1

Text

jina-embeddings-v5-omni-small

Bild

Aufgabe

Vektor

E/A-Diagramm 2

Text

jina-embeddings-v5-omni-small

Audio

Aufgabe

Vektor

E/A-Diagramm 3

Text

jina-embeddings-v5-omni-small

Video

Aufgabe

Vektor

E/A-Diagramm 4

mehrere

Vektor

Text

jina-embeddings-v5-omni-small

PDF

Aufgabe

Pareto fronthelp_outline
MMTEB
RTEB public
MIEB
MAEB
chevron_leftchevron_right
30M100M300M1B3.0B10B20406080bekko-embedding-v1-a25mbge-large-enbge-large-en-v1.5bge-m3bge-small-en-v1.5BOOM-4B-v1e5-base-v2e5-mistral-7b-instructF2LLM-v2-14BF2LLM-v2-330MF2LLM-v2-4BF2LLM-v2-80Mgranite-embedding-small…GritLM-7Bjina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-omni…jina-embeddings-v5-text…jina-embeddings-v5-text…LaBSEMoD-EmbeddingNemotron-3-Embed-8BNV-Embed-v2Octen-Embedding-0.6BOcten-Embedding-4BOcten-Embedding-8Bparaphrase-multilingual…paraphrase-multilingual…PIXIE-Rune-v1.0potion-multilingual-128Msnowflake-arctic-embed-…UAE-Large-V1voyage-4-nanoParameters (log)nDCG@10
This model
On the front
Jina AI
Other
RTEB public
66.84
Parameters
1.6B
Rank by score
14 / 62
Pareto front
Behind it
Werteverteilunghelp_outline
AUC 0.8269
Korpus
Übersetzungspaare
Dokumentensuche
Code
Bild / Banner
Bild / Logo
Aufgabe
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
Verwandt10.9%
Hartes Negativ2.1%
Unverwandt0.9%
Empfohlene Schwellenwerte
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
ausgewogen · 0.697
AUC
0.8269
Rauschgrenze
0.855
Recall-Kante
0.566
Gemessene Paare
119 / 11k
Dieses Modell teilt sich den Text-Tower mit jina-embeddings-v5-text-small. Die Verteilungen hier sind die jenes Modells, mit dem es bis auf fp16-Übertragungsgenauigkeit übereinstimmt.
Vektorkomponentenhelp_outline
-0.160.010.18
σ 0.0313 · 244k Werte
Einbettungsgeometriehelp_outline
01024
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.300
Effektive Dim.
70 / 1024
Dimensionskürzunghelp_outline
32641282565121024
text-matching · Schwellenwert nach angeforderten Dimensionen
Sprachpaarehelp_outline
de-ruen-deen-koen-zhja-ko
Streuung des Schwellenwerts über die Paare: 0.024
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)
SIGIR 2026
Mai 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

Überblick

jina-embeddings-v5-omni-small (~1,74 Milliarden Parameter) ist ein multimodales Embedding-Modell, das Text, Bilder, Videos und Audio verarbeitet und Embeddings in einem gemeinsamen Vektorraum erzeugt, der mit jina-embeddings-v5-text-small übereinstimmt. Sie können mit Text indizieren und mit jeder Modalität abfragen oder umgekehrt, ohne neu indizieren zu müssen. Das Text-Backbone und alle vier aufgabenspezifischen LoRA-Adapter (Retrieval, Textvergleich, Clustering, Klassifizierung) werden während des multimodalen Trainings eingefroren, sodass die reinen Textausgaben bitgenau mit jina-embeddings-v5-text-small übereinstimmen. Das Modell erzeugt 1024-dimensionale Embeddings mit Matryoshka-Trunkierung auf bis zu 32 Dimensionen und unterstützt eine Kontextlänge von 32K Token.

Methoden

Das Training erfolgte in einer dritten Stufe, die jina-embeddings-v5-text-small erweiterte. Das Text-Backbone und alle vier aufgabenspezifischen LoRA-Adapter sind eingefroren; lediglich die crossmodalen Projektoren wurden neu trainiert. Ein SigLIP2 So400m Vision-Encoder verarbeitet Bilder und Videos (32 gleichmäßig abgetastete Frames). Ein Whisper-large-v3 Audio-Encoder verarbeitet die Audioeingabe. PDF-Seiten werden als Bilder gerendert und über den Bildverarbeitungspfad verarbeitet. Das Training verwendet einen kontrastiven Verlust mit crossmodalen harten Negativen, um visuelle und auditive Repräsentationen an den bestehenden Text-Embedding-Raum anzupassen.

Leistung

Die Leistung bei reinen Textdaten ist identisch mit der von jina-embeddings-v5-text-small – das Text-Backbone und die LoRA-Adapter bleiben während des multimodalen Trainings unverändert. Bei der modalitätsübergreifenden Suche zeigt das Modell eine starke Übereinstimmung zwischen Text-Bild-, Text-Audio- und Text-Video-Aufgaben. Die Suche nach PDF-Seiten erfolgt über den Bildverarbeitungspfad. Das Omni-Small-Modell bietet unter den multimodalen Jina-Embedding-Modellen für den Servereinsatz das beste Verhältnis von Genauigkeit zu Effizienz.

Anleitung

Die gleichen vier LoRA-Adapter wie in v5-text-small: retrieval, text-matching, clustering und classification. Für multimodale Eingaben über die API können Bild-, Audio-, Video- oder PDF-URLs direkt übergeben werden – das Modell leitet jede Modalität an den entsprechenden Encoder weiter. Unterstützte Audioformate sind WAV, MP3, FLAC, OGG, M4A und Opus. Videoeingaben werden als 32 gleichmäßig abgetastete Frames verarbeitet. Modalitäten können innerhalb eines Batches beliebig kombiniert werden: Der Embedding-Raum wird von allen Modalitäten gemeinsam genutzt. Für den Vergleich wird die Kosinusähnlichkeit verwendet. Die Matryoshka-Trunkierung von 1024 auf 32 Dimensionen wird unterstützt. Reine Text-Embeddings sind direkt kompatibel mit jina-embeddings-v5-text-small – beim Upgrade ist keine Neuindizierung erforderlich.
Blogs, die dieses Modell erwähnen
Mai 12, 2026 • 7 Minuten gelesen
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
Aktuelle Sprache / Design
Search Foundation
Leser
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Pressemitteilungen
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitTerms & amp; BedingungenPrivatsphäreCookie-EinstellungenMeine persönlichen Daten werden nicht verkauft oder weitergegeben.
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.