

Wir veröffentlichen jina-embeddings-v5-omni und erweitern damit unsere v5-text 向量模型 auf Bilder, Audio und Video. Beide Modelle teilen sich dasselbe eingefrorene Text-Backbone wie v5-text, was bedeutet, dass die 向量模型 identisch sind – es ist kein Neuaufbau des Index erforderlich. jina-embeddings-v5-omni-small erzielt durchschnittlich 53,93 über vier Modalitäten hinweg und entspricht damit LCO-7B (54,43) bei 5,7-fach weniger Parametern, während jina-embeddings-v5-omni-nano eine wettbewerbsfähige Dokumentensuche mit nur 0,95 Mrd. Parametern liefert.




tagArchitektur
v5-omni hält das v5-text-Backbone komplett eingefroren und fügt vortrainierte Vision- und Audio-Encoder hinzu, die durch kleine trainierbare Projektoren verbunden sind:
- Vision: Qwen3.5-Vision-Encoder (angepasst von SigLIP2) mit 2x2 räumlicher Zusammenführung (4-fache Reduzierung der 词元). Wir frieren alles bis auf die finale Projektionsschicht (
fc_vision_2) ein, die wir durch eine zufällig initialisierte Schicht ersetzen, welche in die verborgene Dimension des Text-Backbones abbildet. - Audio: Qwen2.5-Omni-Encoder (angepasst von Whisper-large-v3). Eine einzelne zufällig initialisierte
fc_audio-Schicht projiziert den 1280-dimensionalen Output in das Text-Backbone. - Video: Wird als Abfolge von visuellen Frames behandelt, optional vorangestellt durch ein extrahiertes Audiosegment.
Das Modell übernimmt die vier aufgabenspezifischen LoRA-Adapter von v5-text (Suche, Text-Matching, Klassifizierung, Clustering) und trainiert separate Projektorgewichte für jede Aufgabenvariante. Die Architektur ist vollständig modular: Ein reiner Text-Einsatz lädt keine Vision- oder Audio-Gewichte (identisch mit dem Footprint von v5-text), bei reinen Bildern wird Audio übersprungen, bei Full-Omni wird alles geladen.

| Merkmal | jina-embeddings-v5-omni-small | jina-embeddings-v5-omni-nano |
|---|---|---|
| Basis-Textmodell | jina-embeddings-v5-text-small (Qwen3-0.6B) | jina-embeddings-v5-text-nano (EuroBERT-210m) |
| Gesamtparameter | ~1,56 Mrd. | ~1,04 Mrd. |
| Modalitäten | Text, Bild, Audio, Video, PDF | Text, Bild, Audio, Video, PDF |
| Embedding-Dimensionen | 1024 | 768 |
| Matryoshka-Dimensionen | 32, 64, 128, 256, 512, 768, 1024 | 32, 64, 128, 256, 512, 768 |
| Max. Sequenzlänge | 32768 词元 | 8192 词元 |
| Vision-Encoder | Qwen3.5-2B ViT (SigLIP2) | SigLIP2 Base |
| Audio-Encoder | Whisper-large-v3 | Whisper-large-v3 |
| Aufgaben | Suche, Text-Matching, Klassifizierung, Clustering | Suche, Text-Matching, Klassifizierung, Clustering |
| Text-Kompatibilität | Identisch mit jina-embeddings-v5-text-small | Identisch mit jina-embeddings-v5-text-nano |
| Trainable Parameters | ~18M Projektoren (0,35 %) | ~7M Projektoren (0,35 %) |
| Pooling | Last-token | Last-token |
| License | CC BY-NC 4.0 | CC BY-NC 4.0 |
tagErste Schritte
tagElasticsearch (Elastic Inference Service)
Wenn Sie bereits jina-embeddings-v5-text in Elasticsearch verwenden, funktionieren Ihre bestehenden Textindizes sofort mit v5-omni. Die Omni-Modelle erzeugen identische Vektor-Modelle (Embeddings) für Texteingaben wie v5-text – gleiche Eingabe, gleicher Vektor, Byte für Byte. Sie müssen keinen Textindex neu erstellen oder Daten erneut einbetten. Um neben Ihren bestehenden Textdaten auch nach Bildern, Audio und Video zu suchen, erstellen Sie einfach einen neuen Index mit v5-omni und fügen Sie Ihre multimodalen Inhalte dort hinzu.
Erstellen Sie einen semantic_text-Index mit v5-omni als Inference-Endpunkt. EIS wählt automatisch den korrekten LoRA-Adapter für Indizierung und Abfrage aus:
PUT multimodal-semantic-index
{
"mappings": {
"properties": {
"content": {
"type": "semantic_text",
"inference_id": ".jina-embeddings-v5-omni-small"
}
}
}
}Fügen Sie Text, Bilder (als base64-Daten-URIs), Audio und Video in dasselbe Feld und denselben Index ein:
// Ingest text
POST multimodal-semantic-index/_doc
{
"content": "'Kraft Dinner' is what Canadians call macaroni and cheese when prepared from a kit."
}
// Ingest an image (base64)
POST multimodal-semantic-index/_doc
{
"content": "data:image/png;base64,iVBORw0KGgoAAAAN..."
}Suchen Sie über alle Modalitäten hinweg mit einer einzigen Textabfrage:
GET multimodal-semantic-index/_search
{
"query": {
"semantic": {
"field": "content",
"query": "Was bedeutet 'Kraft Dinner' für Kanadier?"
}
}
}tagJina Embedding API
curl https://api.jina.ai/v1/embeddings \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model": "jina-embeddings-v5-omni-small",
"task": "retrieval.query",
"dimensions": 1024,
"input": ["What does this image show?"],
"images": ["data:image/png;base64,..."]
}'tagHugging Face
from sentence_transformers import SentenceTransformer
import torch
model = SentenceTransformer(
"jinaai/jina-embeddings-v5-omni-small-retrieval",
model_kwargs={"dtype": torch.bfloat16},
)
# Text embedding (identisch zu v5-text)
text_emb = model.encode("What is knowledge distillation?", prompt_name="query")
# Image embedding
from PIL import Image
img = Image.open("photo.jpg")
img_emb = model.encode(img)
# Cross-modal similarity
similarity = model.similarity(text_emb, img_emb)tagTraining
Die Kernidee ist die Zusammensetzung von Modellen mit eingefrorenem Encoder (frozen-encoder model composition): Man nimmt ein leistungsstarkes Text-Vektor-Modell, fügt vortrainierte Vision- und Audio-Encoder hinzu, verbindet sie mit kleinen, trainierbaren Projektoren und friert alles außer diesen Projektoren ein. Nur 0,35 % der gesamten Gewichte werden trainiert, was uns drei Eigenschaften verleiht: (1) Erhaltung der Textidentität – das Grundmodell bleibt unverändert, dieselbe Eingabe erzeugt dieselbe Ausgabe; (2) Trainingseffizienz – das Training nur der Projektoren ist 1,8- bis 3,9-mal schneller bei 42-64 % weniger GPU-Speicherbedarf; (3) Modularität – die Komponenten können unabhängig geladen werden.

v5-omni erbt die Unterstützung für Matryoshka-Dimensionen von v5-text. Bild- und Audio-Vektor-Modelle behalten die meiste Qualität bei einer Reduzierung der Dimensionen bei, während die Qualität bei Video in kleinen Dimensionen stärker abnimmt.

tagFazit
Die herkömmliche Meinung besagt, dass multimodale Vektor-Modelle das Training des gesamten Modells von Grund auf erfordern. Wir sind anderer Meinung. v5-omni friert das Text-Grundmodell ein, trainiert 0,35 % der Gewichte und erreicht die Leistung von Modellen, die 5- bis 7-mal größer sind. Die Lehre daraus: Zusammensetzung schlägt Umschulung. Ein starker Text-Encoder ist der schwierigste Teil – sobald man ihn hat, ist das Hinzufügen von Vision- und Audio-Funktionen über leichtgewichtige Projektoren fast kostenlos.
Dies ist für die Produktion entscheidend. Ihre bestehenden v5-text-Indizes bleiben unberührt. Gleiche Abfrage, gleicher Vektor, Byte für Byte. Sie erhalten eine Suchfunktion für Bilder, Audio und Video, ohne ein einziges Dokument neu einbetten zu müssen. Das ist der wahre Durchbruch: multimodales Retrieval als Drop-in-Upgrade, kein Migrationsprojekt.
jina-embeddings-v5-omni-small ist das leistungsstärkste Open-Weight-Omni-Embedding-Modell unter 2 Mrd. Parametern. jina-embeddings-v5-omni-nano erreicht dies bei 0,9 Mrd. Parametern. Beide sind ab sofort auf Hugging Face, über die Jina Search Foundation API und als nativer Inference-Endpunkt in Elasticsearch verfügbar.






