

Wir veröffentlichen jina-embeddings-v5-text, die fünfte Generation unserer 向量模型-Familie, welche die Grenze zwischen Qualität und Effizienz für mehrsprachige 向量模型 unter 1 Mrd. Parametern verschiebt:
- jina-embeddings-v5-text-small (677M Parameter): 67.0 auf MMTEB, 71.7 auf MTEB Englisch
- jina-embeddings-v5-text-nano (239M Parameter): 65.5 auf MMTEB, 71.0 auf MTEB Englisch
Das kleine Modell unterstützt 32K 词元 Kontext (8K für nano), 4 aufgabenspezifische LoRA-Adapter (Retrieval, Text-Matching, Klassifizierung, Clustering) sowie Matryoshka-Dimensionskürzung von 1024 auf 32. Mit 239M Parametern erreicht das Nano-Modell die Retrieval-Qualität von Modellen mit doppelt so vielen Parametern.
Im Vergleich zu unseren früheren Generationen: v5-text-small entspricht jina-embeddings-v4 (3.8B) beim Retrieval, ist aber 5,6-mal kleiner und übertrifft jina-embeddings-v3 (572M) bei allen Aufgaben mit einer ähnlichen Parameteranzahl.
| Feature | v5-text-small | v5-text-nano |
|---|---|---|
| Basis-Modell | Qwen3-0.6B-Base | EuroBERT-210m |
| Parameter | 677M | 239M |
| Embedding-Dimensionen | 1024 | 768 |
| Kontextlänge | 32.768 | 8.192 |
| Sprachen | 119 (Qwen3-Tokenizer) | 15+ (EuroBERT-Tokenizer) |
| Pooling | Last-token | Last-token |
| LoRA-Adapter | 4 (Retrieval, Text-Matching, Klassifizierung, Clustering) | |
| Matryoshka-Dims | 32-1024 | 32-768 |
| MMTEB-Score | 67.0 | 65.5 |
| MTEB Englisch | 71.7 | 71.0 |
| Lizenz | CC BY-NC 4.0 |
v5-text-small erreicht 67.0 auf MMTEB (gemittelt über 131 Aufgaben in 9 Aufgabentypen) und übertrifft damit das nächstbeste Modell unter 1 Mrd. Parametern (Qwen3-0.6B mit Anweisungen bei 64.3) um +2,7 Punkte. Das Nano-Modell mit 239M Parametern erzielt 65.5 und schlägt damit Modelle mit doppelt so vielen Parametern.v5-text-small alle mehrsprachigen Modelle unter 1 Mrd. Parametern mit 71.7 (gemittelt über 41 Aufgaben in 7 Aufgabentypen) an, dicht gefolgt von KaLM-mini-v2.5 (71.3) und v5-text-nano (71.0). Das 239M-Nano-Modell erreicht die Parität mit dem 494M KaLM bei weniger als der Hälfte seiner Größe.v5-text-small erreicht den höchsten aufgabenbezogenen Durchschnitt (63.28) über fünf Retrieval-Benchmarks (MTEB Multilingual, MTEB English, RTEB, BEIR und LongEmbed) unter den Modellen mit weniger als 4 Mrd. Parametern und entspricht damit jina-embeddings-v4 (3.8B, 63.62), während es 5,6-mal kleiner ist.
jina-embeddings-v5-small (0.6B Parameter, Rang 8) das leistungsstärkste 向量模型 unter 1 Mrd. Parametern auf MTEB Multilingual v2 und übertrifft Qwen3-Embedding-0.6b bei jeder Metrik. jina-embeddings-v5-nano (0.2B Parameter, Rang 11) liefert eine Top-11-Leistung bei einem Bruchteil der Größe; kein anderes Modell in dieser Parameterklasse kommt dem nahe.tagArchitektur

v5-text verwendet Decoder-only-Backbones mit Last-Token-Pooling anstelle von Mean-Pooling. Vier leichtgewichtige LoRA-Adapter werden in jede Transformer-Schicht injiziert, die Retrieval, Text-Matching, Klassifizierung und Clustering unabhängig voneinander handhaben. Benutzer wählen den passenden Adapter zum Zeitpunkt der Inferenz aus. Für das Retrieval erhalten Anfragen ein „Query:“-Präfix und Dokumente ein „Document:“-Präfix. Die Kontextlänge beträgt 32K 词元 für das Small-Modell (8K für Nano), eine 4-fache Steigerung gegenüber v3.
tagErste Schritte
tagElastic Inference Service
Der schnellste Weg, v5-text in der Produktion zu nutzen. Elastic Inference Service (EIS) bietet eine verwaltete Embedding-Inferenz mit integrierter Skalierung, sodass Sie 向量模型 direkt innerhalb Ihrer Elastic-Bereitstellung generieren können, ohne die Infrastruktur verwalten zu müssen.
PUT _inference/text_embedding/jina-v5
{
"service": "elastic",
"service_settings": {
"model_id": "jina-embeddings-v5-text-small"
}
}
Weitere Informationen zur Einrichtung finden Sie in der EIS-Dokumentation.
tagJina Embedding API
Unsere gehostete API mit Pay-per-词元-Abrechnung. Unterstützt die Aufgabenauswahl, Dimensionskürzung und Batch-Verarbeitung direkt nach dem Start. Keine GPU erforderlich.
curl https://api.jina.ai/v1/embeddings \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model": "jina-embeddings-v5-text-small",
"task": "retrieval.query",
"dimensions": 1024,
"input": ["What is knowledge distillation?"]
}'
Holen Sie sich einen API-Schlüssel unter jina.ai/embeddings.
tagHugging Face + sentence-transformers
Führen Sie das Modell lokal mit voller Kontrolle über die Inferenz aus. Die Gewichte sind auf Hugging Face mit einer sofort einsatzbereiten sentence-transformers-Integration verfügbar.
from sentence_transformers import SentenceTransformer
import torch
model = SentenceTransformer(
"jinaai/jina-embeddings-v5-text-small-retrieval",
model_kwargs={"dtype": torch.bfloat16},
)
query_emb = model.encode("What is knowledge distillation?", prompt_name="query")
doc_embs = model.encode(["Knowledge distillation transfers...", "Venus is..."], prompt_name="document")
similarity = model.similarity(query_emb, doc_embs)
tagvLLM
Hochdurchsatz-Serving für Produktions-Workloads. vLLM unterstützt v5-text nativ mit Last-Token-Pooling.
from vllm import LLM
from vllm.config.pooler import PoolerConfig
model = LLM(
model="jinaai/jina-embeddings-v5-text-small-retrieval",
dtype="float16",
runner="pooling",
pooler_config=PoolerConfig(seq_pooling_type="LAST", normalize=True),
)
outputs = model.encode(["Query: climate change impacts"], pooling_task="embed")
Für eine optimierte lokale Inferenz via llama.cpp und MLX werden die LoRA-Gewichte jedes Aufgabenadapters in das Basismodell integriert, um eigenständige Gewichtsdateien zu erzeugen. Aus diesem Grund sehen Sie separate Repositories pro Aufgabe (Retrieval, Text-Matching, Klassifizierung, Clustering) – jedes enthält die vollständig zusammengeführten Gewichte, die direkt geladen werden können, ohne LoRA-Overhead zur Inferenzzeit.
tagllama.cpp (GGUF)
Führen Sie quantisierte Modelle auf CPUs oder Edge-Geräten aus. Wir stellen 14 GGUF-Quantisierungsvarianten für jedes Modell bereit, von F16 bis hinunter zu IQ1_S.
llama-server -hf jinaai/jina-embeddings-v5-text-small-retrieval-GGUF:Q4_K_M \
--embedding --pooling last -ub 32768
tagMLX
Native Apple Silicon Inferenz via MLX. Verfügbar in voller Präzision sowie in 4-Bit- und 8-Bit-Quantisierung für alle Aufgabenadapter.
import mlx.core as mx
from tokenizers import Tokenizer
from model import JinaEmbeddingModel
import json
with open("config.json") as f:
config = json.load(f)
model = JinaEmbeddingModel(config)
weights = mx.load("model-4bit.safetensors") # oder model.safetensors, model-8bit.safetensors
model.load_weights(list(weights.items()))
tokenizer = Tokenizer.from_file("tokenizer.json")
texts = ["Query: What is machine learning?"]
embeddings = model.encode(texts, tokenizer)
Download von Hugging Face: jinaai/jina-embeddings-v5-text-small-retrieval-mlx (auch verfügbar für Text-Matching-, Klassifizierungs- und Clustering-Adapter).
tagTraining
Beide Modelle wurden mittels Distillation aus Qwen3-Embedding-4B gewonnen, einem wesentlich größeren trainierten Vektormodell. Die Small-Variante nutzt Qwen3-0.6B-Base als Backbone, während das Nano-Modell auf EuroBERT-210m basiert. Unser Training kombiniert zwei sich ergänzende Signale:
- Vektor-Distillation vom 4B-Lehrermodell mittels Kosinus-Ähnlichkeitsverlust (Cosine Similarity Loss). Das Schülermodell lernt, den Vektorraum des Lehrers zu approximieren, ohne dass instruktionsartige 提示词 erforderlich sind. Dies ist besonders effektiv für Sprachen und Aufgaben, bei denen nur wenige annotierte Daten vorhanden sind.
- Aufgabenspezifischer kontrastiver Verlust (
InfoNCE) für annotierte Query-Dokument-Paare mit Hard-Negative-Mining und In-Batch-Negativen. Nachdem das destillierte Backbone eingefroren wurde, trainieren wir separate LoRA-Adapter für jede Aufgabenkategorie.
Unsere Ablationsstudien zeigen, dass dieser kombinierte Ansatz jede Methode für sich allein konsistent übertrifft. Beim MTEB English Retrieval erreicht die kombinierte Methode 60.1 nDCG@10 gegenüber 58.6 bei reiner Distillation und 54.3 bei rein kontrastivem Training auf demselben Backbone.
Wir wenden während des Trainings außerdem GOR (Generalized Orthogonal Regularization) an, was dazu beiträgt, dass die Vektorkomponenten gleichmäßiger verteilt werden. Dies verbessert die Standard-Benchmark-Ergebnisse zwar nicht dramatisch, macht aber die binäre Quantisierung nahezu verlustfrei, was eine kritische Eigenschaft für den Einsatz in speicherbegrenzten Umgebungen ist.
Einige Beobachtungen aus dem Training sind erwähnenswert:
- Distillation und kontrastives Lernen ergänzen sich auf eine Weise, die wir anfangs nicht erwartet hatten.
- Das Entfernen einer einzelnen Komponente aus unserer Verlustmischung verschlechtert die Leistung durchgehend.
- Aufgabenspezifische LoRA-Adapter übertreffen das Multi-Task-Training bei vernachlässigbarem Parameter-Overhead.
- GOR-Regularisierung macht binäre Quantisierung nahezu verlustfrei, was für den Einsatz wichtiger ist als marginale Gewinne bei voller Präzision.
tagFazit
Vektormodelle werden zunehmend als Komponenten in größeren Tool-Ketten verwendet. LLM-Agenten rufen Embedding-APIs für Retrieval, Gedächtnis und Klassifizierung als Teil von agentischen Workflows auf. Projekte wie OpenClaw und OpenViking betrachten Vektormodelle als zentrale Infrastrukturschicht für das Kontextmanagement von Agenten und nicht als eigenständige Such-Endpunkte. In diesem Szenario sind Inferenzkosten und Latenz pro Aufruf ebenso wichtig wie Benchmark-Ergebnisse, weshalb kompakte Modelle zur natürlichen Wahl werden.
Der Trend zu kleineren Vektormodellen spiegelt einen breiteren Wandel wider. On-Device-Retrieval, browserbasierte Suche und Edge-Deployment erfordern Modelle, die in begrenzte Speicherbudgets passen. Die Unterstützung für Matryoshka-Dimensionen ermöglicht es einem einzelnen Modell, sowohl hochpräzise als auch ultraschnelle approximative Suche ohne erneutes Training anzubieten. In Kombination mit GGUF-Quantisierung bis auf 1-2 Bits sinkt der effektive Speicherbedarf für einen produktiven Embedding-Dienst um eine Größenordnung.
Wir arbeiten derzeit an jina-embeddings-v5-multimodal, um dieselbe Architektur auf Bild- und Cross-Modal-Retrieval auszuweiten. Frühe Ergebnisse deuten darauf hin, dass es möglich ist, einen Vision-Encoder mit einem feinabgestimmten Text-Vektormodell in Einklang zu bringen, ohne die Textleistung zu verschlechtern. Bleiben Sie dran.






