Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Reader
Konvertieren Sie jede URL in Markdown für besseres Grounding von LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumentation
Einloggen
login
Einbettungen
copyright CC BY-NC 4.0
open_in_new Release-Post

jina-embeddings-v5-omni-nano

Kompakte multimodale Einbettungen für den Edge-Einsatz
Lizenz
copyright CC-BY-NC-4.0
Veröffentlichungsdatum
calendar_month
2026-05-07
Eingabe
abc
Text
image
Bild
audiotrack
Audio
videocam
Video
picture_as_pdf
PDF
arrow_forward
Ausgabe
more_horiz
Vektor
Matryoshka-Dimensionen help_outline
32
64
128
256
512
768
Modelldetails
Parameter: 1.0B
Länge des Eingabetokens: 8K
Ausgabedimension: 768
Basismodell help_outline
link
jina-embeddings-v5-text-nano
open_in_new
SigLIP2 Base
open_in_new
Whisper-large-v3
Ausgebildete Sprachen help_outline
32 Sprachen
Unterstützte Sprachen help_outline
108 Sprachen
Quantisierungen help_outline
GGUF
Apple Silicon-Unterstützung help_outline
MLX
Ähnliche Modelle
link
jina-embeddings-v5-omni-small
link
jina-embeddings-v5-text-nano
link
jina-embeddings-v3
link
jina-clip-v2
Unterstützte Aufgaben
search Retrieval
compare_arrows Text-Matching
bubble_chart Clustering
label Klassifizierung
Erhältlich über
Elastic Inference Service
Jina-API
AWS SageMaker
Hugging Face
Air-Gapped
E/A-Diagramm 1

Text

jina-embeddings-v5-omni-nano

Bild

Aufgabe

Vektor

E/A-Diagramm 2

Text

jina-embeddings-v5-omni-nano

Audio

Aufgabe

Vektor

E/A-Diagramm 3

Text

jina-embeddings-v5-omni-nano

Video

Aufgabe

Vektor

E/A-Diagramm 4

mehrere

Vektor

Text

jina-embeddings-v5-omni-nano

PDF

Aufgabe

Pareto-Fronthelp_outline
MMTEB
RTEB public
MIEB
MAEB
chevron_leftchevron_right
300M1B3.0B10B20304050BidirLM-Omni-2.5B-Embed…e5-omni-3Be5-omni-7Bjina-embeddings-v5-omni…LanguageBindlarger_clap_generallarger_clap_musicLCO-Embedding-Omni-3Bmsclap-2022MuQ-MuLan-largeOmni-Embed-Nemotron-3BQwen2-Audio-7BQwen2.5-Omni-3Bspeecht5_multimodalwav2clipjina-embeddings-v5-omni…Parameter (log)score
Dieses Modell
Auf der Front
Jina AI
Andere
MAEB
49.69
Parameter
986M
Rang nach Score
6 / 21
Pareto-Front
Darauf
Werteverteilunghelp_outline
AUC 0.8242
Korpus
Übersetzungspaare
Dokumentensuche
Code
Bild / Banner
Bild / Logo
Aufgabe
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.7930.400.500.600.700.80
Verwandt20.2%
Hartes Negativ1.7%
Unverwandt1.1%
Empfohlene Schwellenwerte
FPR 0.1 · 0.722
FPR 0.01 · 0.793
FPR 0.001 · 0.841
FPR 0.0001 · 0.865
ausgewogen · 0.678
AUC
0.8242
Rauschgrenze
0.840
Recall-Kante
0.557
Gemessene Paare
119 / 11k
Dieses Modell teilt sich den Text-Tower mit jina-embeddings-v5-text-nano. Die Verteilungen hier sind die jenes Modells, mit dem es bis auf fp16-Übertragungsgenauigkeit übereinstimmt.
Vektorkomponentenhelp_outline
-0.180.000.19
σ 0.0361 · 183k Werte
Einbettungsgeometriehelp_outline
0768
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.288
Effektive Dim.
69 / 768
Dimensionskürzunghelp_outline
3264128256512768
text-matching · Schwellenwert nach angeforderten Dimensionen
Sprachpaarehelp_outline
de-ruen-deen-koen-zhja-ko
Streuung des Schwellenwerts über die Paare: 0.027
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)
SIGIR 2026
Mai 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

Überblick

jina-embeddings-v5-omni-nano ist ein multimodales Embedding-Modell mit rund 1,04B Parametern, das Text, Bilder, Video und Audio akzeptiert und Embeddings in einem gemeinsamen Vektorraum erzeugt. Es ist die kompakte Variante der v5-omni-Familie, entworfen für Edge- und Standard-Hardware ohne GPU. Die rein textuellen Ausgaben sind bit-identisch mit jina-embeddings-v5-text-nano, was ein Drop-in-Upgrade von text-only zu multimodal ohne Reindexierung möglich macht.

Methoden

Das Modell wird durch eine dritte Trainingsphase von jina-embeddings-v5-text-nano aus um multimodale Fähigkeiten erweitert. Das EuroBERT-210M-Text-Backbone und alle vier aufgaben-spezifischen LoRA-Adapter werden eingefroren; nur die Cross-Modal-Projectoren werden neu trainiert. Ein SigLIP2 Base-Vision-Encoder verarbeitet Bilder und Video (32 gleichmäßig abgetastete Frames pro Video). Ein Whisper-large-v3-Audio-Encoder verarbeitet Audioeingaben. PDF-Seiten werden als Bilder gerendert und über den visuellen Pfad verarbeitet. Das Training verwendet einen kontrastiven Verlust mit Cross-Modal-Hard-Negativen, um visuelle und Audio-Darstellungen mit dem bestehenden Text-Embedding-Raum auszurichten. Der 768-dimensionale Ausgabe-Raum unterstützt Matryoshka-Verkürzung bis hinab zu 32 Dimensionen. Das 8K-Token-Kontextfenster deckt den Texteingang ab; Bild- und Audioeingaben werden über ihre jeweiligen Encoder verarbeitet.

Leistung

Die reine Text-Leistung ist bit-identisch mit jina-embeddings-v5-text-nano (65,5 MMTEB Task-Ebene-Durchschnitt, 71,0 englisches MTEB). Die multimodale Leistung liegt leicht unter jina-embeddings-v5-omni-small, da der 768-dimensionale Embedding-Raum (gegenüber 1024) schmaler ist und das Text-Backbone kleiner, sie erhält aber eine starke Cross-Modal-Ausrichtung über Text-Bild-, Text-Audio- und Text-Video-Retrieval. Das Modell ist für CPU- und Edge-Hardware optimiert, wo das größere omni-small-Modell nicht effizient läuft. Die Cross-Modal-Retrieval-Qualität ist für seine Größenklasse wettbewerbsfähig.

Anleitung

Gleiche Nutzungsmuster wie jina-embeddings-v5-omni-small: Wählen Sie den passenden LoRA-Adapter (retrieval, text-matching, clustering, classification) und übergeben Sie direkt über die API Bild-URLs, Audio-Datei-URLs, Video-Datei-URLs oder PDF-URLs — das Modell leitet jede Modalität über den passenden Encoder weiter. Unterstützte Audio-Formate: WAV, MP3, FLAC, OGG, M4A, Opus. Videoeingaben werden als 32 gleichmäßig abgetastete Frames verarbeitet. Modalitäten können innerhalb eines einzigen Batches frei gemischt werden; der Embedding-Raum wird über alle Modalitäten hinweg geteilt. Nutzen Sie Kosinus-Ähnlichkeit zum Vergleich. Matryoshka-Verkürzung von 768 auf 32 Dimensionen wird unterstützt. Reine Text-Embeddings sind drop-in-kompatibel mit jina-embeddings-v5-text-nano — bei der Aufrüstung ist keine Reindexierung nötig. Für Server-Deployments, die höhere Genauigkeit erfordern, nutzen Sie jina-embeddings-v5-omni-small (1024 Dimensionen, größeres Backbone).

Blogs, die dieses Modell erwähnen
Mai 12, 2026 • 7 Minuten gelesen
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
Aktuelle Sprache / Design
Search Foundation
Reader
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Neuigkeiten
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitAGBPrivatsphäreCookie-EinstellungenMeine persönlichen Daten nicht verkaufen oder weitergeben
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.