Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Leser
Lesen Sie URLs und suchen Sie im Internet nach fundierteren LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
Elastic Inference Service
Jina-Modelle nativ in Elasticsearch ausführen.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumente
Einloggen
login
Einbettungen
copyright CC BY-NC 4.0
open_in_new Beitrag veröffentlichen

jina-embeddings-v5-text-small

SOTA-Mehrsprachigkeitseinbettungen mit aufgabenspezifischen Adaptern
Lizenz
copyright CC-BY-NC-4.0
Veröffentlichungsdatum
calendar_month
2026-02-18
Eingang
abc
Text
arrow_forward
Ausgabe
more_horiz
Vektor
Matryoshka-Dimensionen help_outline
32
64
128
256
512
1024
Modelldetails
Parameter: 677M
Länge des Eingabetokens: 32K
Ausgabedimension: 1024
Basismodell help_outline
open_in_new
Qwen3-0.6B-Base
Ausgebildete Sprachen help_outline
32 Sprachen
Unterstützte Sprachen help_outline
93 Sprachen
Quantisierungen help_outline
GGUF
Apple Silicon-Unterstützung help_outline
MLX
Ähnliche Modelle
link
jina-embeddings-v3
link
jina-embeddings-v5-text-nano
Unterstützte Aufgaben
search Abruf
compare_arrows Textabgleich
bubble_chart Clustering
label Einstufung
Erhältlich über
Elastic Inference Service
Jina-API
AWS SageMaker
Hugging Face
Air-Gapped
E/A-Diagramm

Text

jina-embeddings-v5-text-small

Aufgabe

Vektor

Pareto fronthelp_outline
MMTEB
MIRACL
RTEB public
LongEmbed
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B30B20406080all-MiniLM-L12-v2all-mpnet-base-v2bge-m3e5-basee5-smalle5-small-v2EmbeddingGemma-300Mgranite-embedding-278m-…granite-embedding-311m-…granite-embedding-engli…granite-embedding-small…GritLM-7BGritLM-8x7Bgte-basegte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-smallinf-retriever-v1jasper_en_vision_langua…jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v4LaBSELLM2Vec-Mistral-7B-Inst…multilingual-e5-largenomic-embed-text-v1nomic-embed-text-v1.5NV-Embed-v1NV-Embed-v2Qwen3-Embedding-4BSFR-Embedding-Mistralsnowflake-arctic-embed-…snowflake-arctic-embed-…snowflake-arctic-embed-…stella_en_1.5B_v5voyage-4-nanojina-embeddings-v5-text…Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
LongEmbed
66.39
Parameters
596M
Rank by score
8 / 69
Pareto front
Behind it
Werteverteilunghelp_outline
AUC 0.8269
Korpus
Übersetzungspaare
Dokumentensuche
Code
Bild / Banner
Bild / Logo
Aufgabe
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
Verwandt10.9%
Hartes Negativ2.1%
Unverwandt0.9%
Empfohlene Schwellenwerte
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
ausgewogen · 0.697
AUC
0.8269
Rauschgrenze
0.855
Recall-Kante
0.566
Gemessene Paare
119 / 11k
Vektorkomponentenhelp_outline
-0.160.010.18
σ 0.0313 · 244k Werte
Einbettungsgeometriehelp_outline
01024
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.300
Effektive Dim.
70 / 1024
Dimensionskürzunghelp_outline
32641282565121024
text-matching · Schwellenwert nach angeforderten Dimensionen
Sprachpaarehelp_outline
de-ruen-deen-koen-zhja-ko
Streuung des Schwellenwerts über die Paare: 0.024
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)
SIGIR 2026
Februar 17, 2026
jina-embeddings-v5-text: Task-Targeted Embedding Distillation

Überblick

jina-embeddings-v5-text-small ist ein mehrsprachiges Text-Embedding-Modell mit 0,6 Milliarden Parametern, das auf dem Qwen3-0.6B-Base-Backbone basiert. Es erzeugt 1024-dimensionale Embeddings mittels Last-Token-Pooling und unterstützt Kontextlängen von bis zu 32.000 Token durch Rotary Positional Embeddings (RoPE) mit angepassten Basisfrequenzen. Das Modell umfasst vier aufgabenspezifische LoRA-Adapter für Retrieval, semantische Ähnlichkeit, Clustering und Klassifizierung, die unabhängig voneinander mit eingefrorenen Backbone-Gewichten trainiert werden. Matryoshka Representation Learning ermöglicht die Reduzierung der Embedding-Dimension auf bis zu 32. Das Modell wird in zwei Schritten trainiert: Zuerst erfolgt eine Embedding-Destillation von Qwen3-Embedding-4B, um Wissen vom übergeordneten Lehrermodell zu übertragen. Anschließend werden die aufgabenspezifischen Adapter mit spezialisierten Verlustfunktionen für jede Aufgabenkategorie trainiert. Es unterstützt asymmetrisches Retrieval mit den Präfixen „Query:“ und „Document:“.

Methoden

Das Training erfolgt in zwei Phasen. In der ersten Phase überträgt die Embedding-Destillation Wissen vom Qwen3-Embedding-4B (einem Lehrermodell mit 4 Milliarden Parametern) auf das Qwen3-0.6B-Base-Schülermodell. Dabei wird ein Kosinusdistanzverlust zwischen den projizierten Schüler- und Lehrer-Embeddings verwendet. Eine lineare Projektionsschicht bildet den 1024-dimensionalen Raum des Schülermodells auf den höherdimensionalen Raum des Lehrermodells ab. Die allgemeine Destillation nutzt über 300 Datensätze in mehr als 30 Sprachen für 50.000 Schritte. Anschließend erfolgt ein Training mit langen Kontexten auf synthetischen und natürlichen langen Dokumenten (1.000–4.096 Token) mit angepassten RoPE-Parametern. In der zweiten Phase werden vier LoRA-Adapter mit eingefrorenen Backbone-Gewichten trainiert: Der Retrieval-Adapter kombiniert den InfoNCE-Kontrastverlust mit harten Negativen, dem fortgesetzten Destillationsverlust und einem globalen orthogonalen Regularisierer (GOR) zur Quantisierungsrobustheit. Der Textvergleichsadapter verwendet den CoSENT-Ranking-Verlust für abgestufte Ähnlichkeit mit Destillation auf unbewerteten Paaren; der Clustering-Adapter verwendet Re-Destillation mit einer clusteringspezifischen Lehreranweisung; und der Klassifizierungsadapter verwendet den bidirektionalen InfoNCE-Verlust mit relationaler Wissensdestillationsregularisierung. Die endgültigen Gewichte der Retrieval-Adapter werden über alle Prüfpunkte gemittelt.

Leistung

Auf MMTEB (mehrsprachig) erzielt jina-embeddings-v5-text-small einen Durchschnittswert von 67,0 (Aufgabenebene) und 58,9 (Typenebene) – die höchsten Werte aller Modelle mit weniger als 1 Milliarde Parametern. Die Klassifizierungsleistung liegt bei 71,3, die Clustering-Leistung bei 53,4, die Paarklassifizierung bei 82,9, die Reranking-Leistung bei 65,7, die Retrieval-Leistung bei 64,9 und die STS-Leistung bei 78,9. Auf englischem MTEB erreicht es einen Durchschnittswert von 71,7 und übertrifft damit Qwen3-0.6B mit Anweisungen (70,5) und jina-embeddings-v3 (65,7). Bei Retrieval-spezifischen Benchmarks erzielt es 64,88 Punkte auf MTEB-M Retrieval, 66,84 auf RTEB, 56,67 auf BEIR und 66,39 auf LongEmbed. Das Modell übertrifft sein Lehrermodell Qwen3-4B bei der Paarklassifizierung (42,0 gegenüber 26,8 bei MMTEB) und erzielt trotz seiner sechsmal geringeren Größe in allen anderen Kategorien wettbewerbsfähige Ergebnisse.

Anleitung

Wählen Sie den passenden LoRA-Adapter für Ihre Aufgabe: „retrieval“ für die asymmetrische Query-Dokument-Suche (fügen Sie „Query:“ vor Suchanfragen und „Document:“ vor Passagen ein), „text-matching“ für symmetrische Ähnlichkeitsaufgaben wie Duplikaterkennung und Paraphrasenidentifizierung (verwendet das Präfix „Document:“ für beide Eingaben), „clustering“ zum Gruppieren verwandter Dokumente und „classification“ für Kategorisierung und Stimmungsanalyse. Verwenden Sie bei Retrieval-Aufgaben immer das korrekte Präfix, da das Modell mit asymmetrischer Kodierung trainiert wurde. Die Matryoshka-Trunkierung ermöglicht die Reduzierung der Embeddings von 1024 auf bis zu 32 Dimensionen; die Leistung bleibt oberhalb von 256 Dimensionen hoch, verschlechtert sich jedoch unterhalb dieser Schwelle merklich, was den Johnson-Lindenstrauss-Grenzen entspricht. Binäre Quantisierung wird dank GOR-Regularisierung mit minimalem Leistungsverlust unterstützt. Das 32K-Kontextfenster verarbeitet lange Dokumente nativ, das Modell wurde jedoch zusätzlich mit Long-Context-Daten für ein robustes Retrieval langer Dokumente trainiert. Verwenden Sie die Kosinusähnlichkeit für den Embedding-Vergleich. Das Modell ist über die Jina AI API, Hugging Face (mit Sentence Transformers und vLLM-Integration) sowie in quantisierten Varianten für llama.cpp verfügbar.
Blogs, die dieses Modell erwähnen
August 03, 2026 • 11 Minuten gelesen
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
A 0.6B listwise reranker that beats Qwen3-Reranker-4B on BEIR, reranks up to 1.56x faster than v3, and gains 9.6 nDCG@10 on semi-structured retrieval.
Jina AI
März 06, 2026 • 6 Minuten gelesen
Identifying Embedding Models from Raw Numerical Values
A tiny transformer that fingerprints embedding models by reading raw numerical digits. No feature engineering.
Han Xiao
Fingerprint illustration made from numbers, showcasing digital and high-tech design on a light background.
Februar 19, 2026 • 7 Minuten gelesen
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Two sub-1B multilingual embeddings with best-in-class performance, available on Elastic Inference Service, Llama.cpp and MLX.
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Aktuelle Sprache / Design
Search Foundation
Leser
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Pressemitteilungen
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitTerms & amp; BedingungenPrivatsphäreCookie-EinstellungenMeine persönlichen Daten werden nicht verkauft oder weitergegeben.
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.