Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Leser
Lesen Sie URLs und suchen Sie im Internet nach fundierteren LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
Elastic Inference Service
Jina-Modelle nativ in Elasticsearch ausführen.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumente
Einloggen
login
Architektur
Erste Schritte
Training
Fazit
star
Hervorgehoben
Pressemitteilung
Mai 12, 2026

jina-embeddings-v5-omni: Embeddings für Text, Bild, Audio und Video

Ein Modell, vier Modalitäten: Text, Bild, Audio, Video. Erstklassige Omni-Embeddings mit 1,6 Mrd. und 0,9 Mrd. Parametern.
Han Xiao
Han Xiao • 7 Minuten gelesen
jina-embeddings-v5-omni - eine jinaai Kollektion
Multimodale (Text + Bild + Video + Audio) 向量模型, die auf jina-embeddings-v5-text-* abgestimmt sind. Zwei Größen, jeweils vier Aufgabenvarianten.
eine jinaai Kollektion
jina-embeddings-v5-omni: Text-Geometry-Preserving Multimodal Embeddings via Frozen-Tower Composition
In dieser Arbeit stellen wir die Frozen-Encoder-Modellkomposition vor, einen neuartigen Ansatz für multimodale 向量模型. Wir bauen auf einer Architektur im VLM-Stil auf, bei der Nicht-Text-Encoder so angepasst werden, dass sie Eingaben für ein 大模型 liefern, welches wiederum 向量模型 für alle Arten von Eingaben generiert. Wir präsentieren das Ergebnis: die jina-embeddings-v5-omni-Reihe, ein Paar von Modellen, die Text-, Bild-, Audio- und Videoeingaben in einen einzigen semantischen Vektorraum kodieren. Unsere Methode besteht darin, die beiden Jina Embeddings v5 Text-Modelle durch das Hinzufügen von Encodern für Bilder und Audio für zusätzliche Medien zu erweitern. Die zugrunde liegenden Text-向量模型 und die hinzugefügten Nicht-Text-Medien-Encoder bleiben eingefroren. Wir haben nur die Verbindungskomponenten trainiert, was 0,35 % der Gesamtgewichte des gemeinsamen Modells entspricht. Das Training ist daher weitaus effizienter als eine Umschulung der vollständigen Parameter. Zudem bleibt das 大模型 effektiv unverändert und erzeugt exakt dieselben 向量模型 für Texteingaben wie die Jina Embeddings v5 Text-Modelle. Unsere Evaluierungen zeigen, dass dieser Ansatz Ergebnisse liefert, die mit dem Stand der Technik konkurrenzfähig sind und eine nahezu gleichwertige Leistung wie größere multimodale 向量模型 erbringen.
arXiv.orgFlorian Hönicke

Wir veröffentlichen jina-embeddings-v5-omni und erweitern damit unsere v5-text 向量模型 auf Bilder, Audio und Video. Beide Modelle teilen sich dasselbe eingefrorene Text-Backbone wie v5-text, was bedeutet, dass die 向量模型 identisch sind – es ist kein Neuaufbau des Index erforderlich. jina-embeddings-v5-omni-small erzielt durchschnittlich 53,93 über vier Modalitäten hinweg und entspricht damit LCO-7B (54,43) bei 5,7-fach weniger Parametern, während jina-embeddings-v5-omni-nano eine wettbewerbsfähige Dokumentensuche mit nur 0,95 Mrd. Parametern liefert.

Pareto frontier
Pareto-Front aller Omni-向量模型 mit offenen Gewichten (unterstützt Text, Bild, Audio und Video). jina-embeddings-v5-omni-small (1,57 Mrd.) entspricht der durchschnittlichen Punktzahl von LCO-7B (8,93 Mrd.) bei 5,7-fach weniger Parametern. jina-embeddings-v5-omni-nano (0,95 Mrd.) übertrifft LanguageBind (1,14 Mrd.) um +8,9 Punkte. Baselines: LanguageBind, Omni-Embed-Nemotron-3B, LCO-Embedding-Omni-3B, LCO-Embedding-Omni-7B.
Per-modality scores
Aufschlüsselung nach Modalität für Text (MMTEB), Bild (MIEB), Video (MMEB-Video) und Audio (MAEB). jina-embeddings-v5-omni-small führt bei allen Omni-Modellen im Bereich Text mit 67,0 und übernimmt die volle Qualität von jina-embeddings-v5-text-small. Bei Bildern (56,05) zeichnet es sich durch Klassifizierung (68,55) und Clustering (84,57, das beste unter allen Modellen) aus. Audio (51,46) liegt nahe an LCO-7B (52,37), mit der besten Punktzahl bei der Audioklassifizierung (55,89). Video (41,20) ist die aktuelle Lücke gegenüber LCO-7B (47,41), da zeitliche Schlussfolgerungen stärker von End-to-End-Training profitieren.
Task breakdown
Leistung pro Aufgabe über 13 Aufgabentypen hinweg. Goldene Sterne markieren Aufgaben, bei denen jina-embeddings-v5-omni-small die beste Baseline mit offenen Gewichten (3-9x größer) schlägt. Siege: Bildklassifizierung (68,55 vs 64,30), Bild-Clustering (84,57 vs 83,24), Audioklassifizierung (55,89 vs 53,39). Hauptlücken: Videosuche (27,82 vs 58,73) und kompositionelle Aufgaben/VQA (44,23 vs 53,40).
Document retrieval
Dokumentensuche (ViDoRe-in-MIEB). jina-embeddings-v5-omni-small mit 0,92 Mrd. aktiven Text+Bild-Parametern erzielt 79,08 und übertrifft LCO-3B (78,24 bei 4,07 Mrd.). jina-embeddings-v5-omni-nano erreicht 70,05 mit nur 0,31 Mrd. aktiven Parametern, weit über LanguageBind (37,33). Nemotron-3B führt mit 85,64, nutzt jedoch 5,1-fach mehr Parameter.

tagArchitektur

v5-omni hält das v5-text-Backbone komplett eingefroren und fügt vortrainierte Vision- und Audio-Encoder hinzu, die durch kleine trainierbare Projektoren verbunden sind:

  • Vision: Qwen3.5-Vision-Encoder (angepasst von SigLIP2) mit 2x2 räumlicher Zusammenführung (4-fache Reduzierung der 词元). Wir frieren alles bis auf die finale Projektionsschicht (fc_vision_2) ein, die wir durch eine zufällig initialisierte Schicht ersetzen, welche in die verborgene Dimension des Text-Backbones abbildet.
  • Audio: Qwen2.5-Omni-Encoder (angepasst von Whisper-large-v3). Eine einzelne zufällig initialisierte fc_audio-Schicht projiziert den 1280-dimensionalen Output in das Text-Backbone.
  • Video: Wird als Abfolge von visuellen Frames behandelt, optional vorangestellt durch ein extrahiertes Audiosegment.

Das Modell übernimmt die vier aufgabenspezifischen LoRA-Adapter von v5-text (Suche, Text-Matching, Klassifizierung, Clustering) und trainiert separate Projektorgewichte für jede Aufgabenvariante. Die Architektur ist vollständig modular: Ein reiner Text-Einsatz lädt keine Vision- oder Audio-Gewichte (identisch mit dem Footprint von v5-text), bei reinen Bildern wird Audio übersprungen, bei Full-Omni wird alles geladen.

Architecture
v5-omni-Architektur. Eingefrorene Vision- und Audio-Encoder speisen trainierbare Projektoren in das eingefrorene Text-Backbone. Nur die Projektoren (0,35 % der Gesamtgewichte) werden trainiert. Aufgabenspezifische LoRA-Adapter übernehmen Suche, Klassifizierung, Clustering und Text-Matching.
Merkmaljina-embeddings-v5-omni-smalljina-embeddings-v5-omni-nano
Basis-Textmodelljina-embeddings-v5-text-small (Qwen3-0.6B)jina-embeddings-v5-text-nano (EuroBERT-210m)
Gesamtparameter~1,56 Mrd.~1,04 Mrd.
ModalitätenText, Bild, Audio, Video, PDFText, Bild, Audio, Video, PDF
Embedding-Dimensionen1024768
Matryoshka-Dimensionen32, 64, 128, 256, 512, 768, 102432, 64, 128, 256, 512, 768
Max. Sequenzlänge32768 词元8192 词元
Vision-EncoderQwen3.5-2B ViT (SigLIP2)SigLIP2 Base
Audio-EncoderWhisper-large-v3Whisper-large-v3
AufgabenSuche, Text-Matching, Klassifizierung, ClusteringSuche, Text-Matching, Klassifizierung, Clustering
Text-KompatibilitätIdentisch mit jina-embeddings-v5-text-smallIdentisch mit jina-embeddings-v5-text-nano
Trainable Parameters~18M Projektoren (0,35 %)~7M Projektoren (0,35 %)
PoolingLast-tokenLast-token
LicenseCC BY-NC 4.0CC BY-NC 4.0

tagErste Schritte

tagElasticsearch (Elastic Inference Service)

Wenn Sie bereits jina-embeddings-v5-text in Elasticsearch verwenden, funktionieren Ihre bestehenden Textindizes sofort mit v5-omni. Die Omni-Modelle erzeugen identische Vektor-Modelle (Embeddings) für Texteingaben wie v5-text – gleiche Eingabe, gleicher Vektor, Byte für Byte. Sie müssen keinen Textindex neu erstellen oder Daten erneut einbetten. Um neben Ihren bestehenden Textdaten auch nach Bildern, Audio und Video zu suchen, erstellen Sie einfach einen neuen Index mit v5-omni und fügen Sie Ihre multimodalen Inhalte dort hinzu.

Erstellen Sie einen semantic_text-Index mit v5-omni als Inference-Endpunkt. EIS wählt automatisch den korrekten LoRA-Adapter für Indizierung und Abfrage aus:

PUT multimodal-semantic-index
{
  "mappings": {
    "properties": {
      "content": {
        "type": "semantic_text",
        "inference_id": ".jina-embeddings-v5-omni-small"
      }
    }
  }
}

Fügen Sie Text, Bilder (als base64-Daten-URIs), Audio und Video in dasselbe Feld und denselben Index ein:

// Ingest text
POST multimodal-semantic-index/_doc
{
  "content": "'Kraft Dinner' is what Canadians call macaroni and cheese when prepared from a kit."
}

// Ingest an image (base64)
POST multimodal-semantic-index/_doc
{
  "content": "data:image/png;base64,iVBORw0KGgoAAAAN..."
}

Suchen Sie über alle Modalitäten hinweg mit einer einzigen Textabfrage:

GET multimodal-semantic-index/_search
{
  "query": {
    "semantic": {
      "field": "content",
      "query": "Was bedeutet 'Kraft Dinner' für Kanadier?"
    }
  }
}

tagJina Embedding API

curl https://api.jina.ai/v1/embeddings \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -d '{
    "model": "jina-embeddings-v5-omni-small",
    "task": "retrieval.query",
    "dimensions": 1024,
    "input": ["What does this image show?"],
    "images": ["data:image/png;base64,..."]
  }'

tagHugging Face

from sentence_transformers import SentenceTransformer
import torch

model = SentenceTransformer(
    "jinaai/jina-embeddings-v5-omni-small-retrieval",
    model_kwargs={"dtype": torch.bfloat16},
)

# Text embedding (identisch zu v5-text)
text_emb = model.encode("What is knowledge distillation?", prompt_name="query")

# Image embedding
from PIL import Image
img = Image.open("photo.jpg")
img_emb = model.encode(img)

# Cross-modal similarity
similarity = model.similarity(text_emb, img_emb)

tagTraining

Die Kernidee ist die Zusammensetzung von Modellen mit eingefrorenem Encoder (frozen-encoder model composition): Man nimmt ein leistungsstarkes Text-Vektor-Modell, fügt vortrainierte Vision- und Audio-Encoder hinzu, verbindet sie mit kleinen, trainierbaren Projektoren und friert alles außer diesen Projektoren ein. Nur 0,35 % der gesamten Gewichte werden trainiert, was uns drei Eigenschaften verleiht: (1) Erhaltung der Textidentität – das Grundmodell bleibt unverändert, dieselbe Eingabe erzeugt dieselbe Ausgabe; (2) Trainingseffizienz – das Training nur der Projektoren ist 1,8- bis 3,9-mal schneller bei 42-64 % weniger GPU-Speicherbedarf; (3) Modularität – die Komponenten können unabhängig geladen werden.

Training efficiency
Training nur der Projektoren im Vergleich zum vollständigen Training auf 4x H100 GPUs (Batch-Größe 256, 15K Schritte). Das Training des Audio-Projektors ist besonders effizient: 3,2-mal schneller für small (154 Min. vs. 497 Min.) und 3,9-mal schneller für nano (112 Min. vs. 441 Min.). Die Speichereinsparungen von 42-64 % resultieren daraus, dass keine Gradienten und Optimierer-Zustände für die eingefrorenen Encoder gespeichert werden müssen.

v5-omni erbt die Unterstützung für Matryoshka-Dimensionen von v5-text. Bild- und Audio-Vektor-Modelle behalten die meiste Qualität bei einer Reduzierung der Dimensionen bei, während die Qualität bei Video in kleinen Dimensionen stärker abnimmt.

Radar summary
Zusammenfassung: Modalitätsspezifisches Profil von v5-omni im Vergleich zu den stärksten Baselines. jina-embeddings-v5-omni-small mit 1,57B Parametern deckt Text, Bild und Audio wettbewerbsfähig ab, wobei Video die verbleibende Lücke darstellt, die geschlossen werden muss.

tagFazit

Die herkömmliche Meinung besagt, dass multimodale Vektor-Modelle das Training des gesamten Modells von Grund auf erfordern. Wir sind anderer Meinung. v5-omni friert das Text-Grundmodell ein, trainiert 0,35 % der Gewichte und erreicht die Leistung von Modellen, die 5- bis 7-mal größer sind. Die Lehre daraus: Zusammensetzung schlägt Umschulung. Ein starker Text-Encoder ist der schwierigste Teil – sobald man ihn hat, ist das Hinzufügen von Vision- und Audio-Funktionen über leichtgewichtige Projektoren fast kostenlos.

Dies ist für die Produktion entscheidend. Ihre bestehenden v5-text-Indizes bleiben unberührt. Gleiche Abfrage, gleicher Vektor, Byte für Byte. Sie erhalten eine Suchfunktion für Bilder, Audio und Video, ohne ein einziges Dokument neu einbetten zu müssen. Das ist der wahre Durchbruch: multimodales Retrieval als Drop-in-Upgrade, kein Migrationsprojekt.

jina-embeddings-v5-omni-small ist das leistungsstärkste Open-Weight-Omni-Embedding-Modell unter 2 Mrd. Parametern. jina-embeddings-v5-omni-nano erreicht dies bei 0,9 Mrd. Parametern. Beide sind ab sofort auf Hugging Face, über die Jina Search Foundation API und als nativer Inference-Endpunkt in Elasticsearch verfügbar.

Kategorien:
star
Hervorgehoben
Pressemitteilung
rss_feed

Weiterlesen
August 03, 2026 • 11 Minuten gelesen
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
Februar 19, 2026 • 7 Minuten gelesen
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Dezember 04, 2025 • 7 Minuten gelesen
Jina-VLM: Small Multilingual Vision Language Model
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Aktuelle Sprache / Design
Search Foundation
Leser
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Pressemitteilungen
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitTerms & amp; BedingungenPrivatsphäreCookie-EinstellungenMeine persönlichen Daten werden nicht verkauft oder weitergegeben.
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.