Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Leser
Lesen Sie URLs und suchen Sie im Internet nach fundierteren LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
Elastic Inference Service
Jina-Modelle nativ in Elasticsearch ausführen.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumente
Einloggen
login
Architektur
Erste Schritte
Training
Fazit
star
Hervorgehoben
Pressemitteilung
Februar 19, 2026

jina-embeddings-v3-text: Neue SOTA kleine mehrsprachige Embeddings

Zwei mehrsprachige Embeddings mit weniger als 1 Milliarde Parametern und erstklassiger Leistung, verfügbar für Elastic Inference Service, Llama.cpp und MLX.
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Han Xiao
Han Xiao • 7 Minuten gelesen
jina-embeddings-v5-text: Task-Targeted Embedding Distillation
Text-Embedding-Modelle werden häufig für Aufgaben der semantischen Ähnlichkeit eingesetzt, einschließlich Information Retrieval, Clustering und Klassifizierung. Allzweckmodelle werden in der Regel in ein- oder mehrstufigen Prozessen unter Verwendung kontrastiver Verlustfunktionen trainiert. Wir stellen ein neuartiges Trainingsverfahren vor, das Modelldestillationstechniken mit aufgabenbezogenem kontrastivem Verlust kombiniert, um kompakte, leistungsstarke 向量模型 zu erstellen. Unsere Ergebnisse deuten darauf hin, dass dieser Ansatz für das Training kleiner Modelle effektiver ist als rein kontrastive oder auf Destillation basierende Trainingsparadigmen allein. Die Benchmark-Ergebnisse der resultierenden Modelle, jina-embeddings-v5-text-small und jina-embeddings-v5-text-nano, übertreffen oder erreichen den Stand der Technik für Modelle ähnlicher Größe. Die jina-embeddings-v5-text-Modelle unterstützen zusätzlich lange Texte (bis zu 32K 词元 bei small, 8K bei nano) in vielen Sprachen und generieren 向量模型, die bei Trunkierung und binärer Quantisierung robust bleiben. Die Modellgewichte sind öffentlich verfügbar, in der Hoffnung, weitere Fortschritte bei der Entwicklung von 向量模型 zu inspirieren.
arXiv.orgMohammad Kalim Akram
jina-embeddings-v5-text - a jinaai Collection
Unsere 向量模型 der 5. Generation: zwei leichtgewichtige mehrsprachige Modelle mit SOTA-Leistung bei Retrieval, Matching, Clustering und Klassifizierung.
a jinaai Collection

Wir veröffentlichen jina-embeddings-v5-text, die fünfte Generation unserer 向量模型-Familie, welche die Grenze zwischen Qualität und Effizienz für mehrsprachige 向量模型 unter 1 Mrd. Parametern verschiebt:

  • jina-embeddings-v5-text-small (677M Parameter): 67.0 auf MMTEB, 71.7 auf MTEB Englisch
  • jina-embeddings-v5-text-nano (239M Parameter): 65.5 auf MMTEB, 71.0 auf MTEB Englisch

Das kleine Modell unterstützt 32K 词元 Kontext (8K für nano), 4 aufgabenspezifische LoRA-Adapter (Retrieval, Text-Matching, Klassifizierung, Clustering) sowie Matryoshka-Dimensionskürzung von 1024 auf 32. Mit 239M Parametern erreicht das Nano-Modell die Retrieval-Qualität von Modellen mit doppelt so vielen Parametern.

Im Vergleich zu unseren früheren Generationen: v5-text-small entspricht jina-embeddings-v4 (3.8B) beim Retrieval, ist aber 5,6-mal kleiner und übertrifft jina-embeddings-v3 (572M) bei allen Aufgaben mit einer ähnlichen Parameteranzahl.

Featurev5-text-smallv5-text-nano
Basis-ModellQwen3-0.6B-BaseEuroBERT-210m
Parameter677M239M
Embedding-Dimensionen1024768
Kontextlänge32.7688.192
Sprachen119 (Qwen3-Tokenizer)15+ (EuroBERT-Tokenizer)
PoolingLast-tokenLast-token
LoRA-Adapter4 (Retrieval, Text-Matching, Klassifizierung, Clustering)
Matryoshka-Dims32-102432-768
MMTEB-Score67.065.5
MTEB Englisch71.771.0
LizenzCC BY-NC 4.0
MMTEB Multilingual Benchmark
v5-text-small erreicht 67.0 auf MMTEB (gemittelt über 131 Aufgaben in 9 Aufgabentypen) und übertrifft damit das nächstbeste Modell unter 1 Mrd. Parametern (Qwen3-0.6B mit Anweisungen bei 64.3) um +2,7 Punkte. Das Nano-Modell mit 239M Parametern erzielt 65.5 und schlägt damit Modelle mit doppelt so vielen Parametern.
MTEB English Benchmark
Bei der rein englischen Auswertung führt v5-text-small alle mehrsprachigen Modelle unter 1 Mrd. Parametern mit 71.7 (gemittelt über 41 Aufgaben in 7 Aufgabentypen) an, dicht gefolgt von KaLM-mini-v2.5 (71.3) und v5-text-nano (71.0). Das 239M-Nano-Modell erreicht die Parität mit dem 494M KaLM bei weniger als der Hälfte seiner Größe.
Retrieval Benchmark Results
v5-text-small erreicht den höchsten aufgabenbezogenen Durchschnitt (63.28) über fünf Retrieval-Benchmarks (MTEB Multilingual, MTEB English, RTEB, BEIR und LongEmbed) unter den Modellen mit weniger als 4 Mrd. Parametern und entspricht damit jina-embeddings-v4 (3.8B, 63.62), während es 5,6-mal kleiner ist.
Table showing multilingual MTEB model performance metrics, rankings, and evaluations across various tasks and language benchm
Laut dem MTEB Leaderboard vom 21.02.2026 ist jina-embeddings-v5-small (0.6B Parameter, Rang 8) das leistungsstärkste 向量模型 unter 1 Mrd. Parametern auf MTEB Multilingual v2 und übertrifft Qwen3-Embedding-0.6b bei jeder Metrik. jina-embeddings-v5-nano (0.2B Parameter, Rang 11) liefert eine Top-11-Leistung bei einem Bruchteil der Größe; kein anderes Modell in dieser Parameterklasse kommt dem nahe.

tagArchitektur

<code>jina-embeddings-v5-text</code> Architecture

v5-text verwendet Decoder-only-Backbones mit Last-Token-Pooling anstelle von Mean-Pooling. Vier leichtgewichtige LoRA-Adapter werden in jede Transformer-Schicht injiziert, die Retrieval, Text-Matching, Klassifizierung und Clustering unabhängig voneinander handhaben. Benutzer wählen den passenden Adapter zum Zeitpunkt der Inferenz aus. Für das Retrieval erhalten Anfragen ein „Query:“-Präfix und Dokumente ein „Document:“-Präfix. Die Kontextlänge beträgt 32K 词元 für das Small-Modell (8K für Nano), eine 4-fache Steigerung gegenüber v3.

tagErste Schritte

tagElastic Inference Service

Der schnellste Weg, v5-text in der Produktion zu nutzen. Elastic Inference Service (EIS) bietet eine verwaltete Embedding-Inferenz mit integrierter Skalierung, sodass Sie 向量模型 direkt innerhalb Ihrer Elastic-Bereitstellung generieren können, ohne die Infrastruktur verwalten zu müssen.

PUT _inference/text_embedding/jina-v5
{
  "service": "elastic",
  "service_settings": {
    "model_id": "jina-embeddings-v5-text-small"
  }
}

Weitere Informationen zur Einrichtung finden Sie in der EIS-Dokumentation.

tagJina Embedding API

Unsere gehostete API mit Pay-per-词元-Abrechnung. Unterstützt die Aufgabenauswahl, Dimensionskürzung und Batch-Verarbeitung direkt nach dem Start. Keine GPU erforderlich.

curl https://api.jina.ai/v1/embeddings \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -d '{
    "model": "jina-embeddings-v5-text-small",
    "task": "retrieval.query",
    "dimensions": 1024,
    "input": ["What is knowledge distillation?"]
  }'

Holen Sie sich einen API-Schlüssel unter jina.ai/embeddings.

tagHugging Face + sentence-transformers

Führen Sie das Modell lokal mit voller Kontrolle über die Inferenz aus. Die Gewichte sind auf Hugging Face mit einer sofort einsatzbereiten sentence-transformers-Integration verfügbar.

from sentence_transformers import SentenceTransformer
import torch

model = SentenceTransformer(
    "jinaai/jina-embeddings-v5-text-small-retrieval",
    model_kwargs={"dtype": torch.bfloat16},
)

query_emb = model.encode("What is knowledge distillation?", prompt_name="query")
doc_embs = model.encode(["Knowledge distillation transfers...", "Venus is..."], prompt_name="document")
similarity = model.similarity(query_emb, doc_embs)

tagvLLM

Hochdurchsatz-Serving für Produktions-Workloads. vLLM unterstützt v5-text nativ mit Last-Token-Pooling.

from vllm import LLM
from vllm.config.pooler import PoolerConfig

model = LLM(
    model="jinaai/jina-embeddings-v5-text-small-retrieval",
    dtype="float16",
    runner="pooling",
    pooler_config=PoolerConfig(seq_pooling_type="LAST", normalize=True),
)
outputs = model.encode(["Query: climate change impacts"], pooling_task="embed")

Für eine optimierte lokale Inferenz via llama.cpp und MLX werden die LoRA-Gewichte jedes Aufgabenadapters in das Basismodell integriert, um eigenständige Gewichtsdateien zu erzeugen. Aus diesem Grund sehen Sie separate Repositories pro Aufgabe (Retrieval, Text-Matching, Klassifizierung, Clustering) – jedes enthält die vollständig zusammengeführten Gewichte, die direkt geladen werden können, ohne LoRA-Overhead zur Inferenzzeit.

tagllama.cpp (GGUF)

Führen Sie quantisierte Modelle auf CPUs oder Edge-Geräten aus. Wir stellen 14 GGUF-Quantisierungsvarianten für jedes Modell bereit, von F16 bis hinunter zu IQ1_S.

llama-server -hf jinaai/jina-embeddings-v5-text-small-retrieval-GGUF:Q4_K_M \
  --embedding --pooling last -ub 32768

tagMLX

Native Apple Silicon Inferenz via MLX. Verfügbar in voller Präzision sowie in 4-Bit- und 8-Bit-Quantisierung für alle Aufgabenadapter.

import mlx.core as mx
from tokenizers import Tokenizer
from model import JinaEmbeddingModel
import json

with open("config.json") as f:
    config = json.load(f)

model = JinaEmbeddingModel(config)
weights = mx.load("model-4bit.safetensors")  # oder model.safetensors, model-8bit.safetensors
model.load_weights(list(weights.items()))

tokenizer = Tokenizer.from_file("tokenizer.json")
texts = ["Query: What is machine learning?"]
embeddings = model.encode(texts, tokenizer)

Download von Hugging Face: jinaai/jina-embeddings-v5-text-small-retrieval-mlx (auch verfügbar für Text-Matching-, Klassifizierungs- und Clustering-Adapter).

tagTraining

Beide Modelle wurden mittels Distillation aus Qwen3-Embedding-4B gewonnen, einem wesentlich größeren trainierten Vektormodell. Die Small-Variante nutzt Qwen3-0.6B-Base als Backbone, während das Nano-Modell auf EuroBERT-210m basiert. Unser Training kombiniert zwei sich ergänzende Signale:

  1. Vektor-Distillation vom 4B-Lehrermodell mittels Kosinus-Ähnlichkeitsverlust (Cosine Similarity Loss). Das Schülermodell lernt, den Vektorraum des Lehrers zu approximieren, ohne dass instruktionsartige 提示词 erforderlich sind. Dies ist besonders effektiv für Sprachen und Aufgaben, bei denen nur wenige annotierte Daten vorhanden sind.
  2. Aufgabenspezifischer kontrastiver Verlust (InfoNCE) für annotierte Query-Dokument-Paare mit Hard-Negative-Mining und In-Batch-Negativen. Nachdem das destillierte Backbone eingefroren wurde, trainieren wir separate LoRA-Adapter für jede Aufgabenkategorie.

Unsere Ablationsstudien zeigen, dass dieser kombinierte Ansatz jede Methode für sich allein konsistent übertrifft. Beim MTEB English Retrieval erreicht die kombinierte Methode 60.1 nDCG@10 gegenüber 58.6 bei reiner Distillation und 54.3 bei rein kontrastivem Training auf demselben Backbone.

Wir wenden während des Trainings außerdem GOR (Generalized Orthogonal Regularization) an, was dazu beiträgt, dass die Vektorkomponenten gleichmäßiger verteilt werden. Dies verbessert die Standard-Benchmark-Ergebnisse zwar nicht dramatisch, macht aber die binäre Quantisierung nahezu verlustfrei, was eine kritische Eigenschaft für den Einsatz in speicherbegrenzten Umgebungen ist.

Einige Beobachtungen aus dem Training sind erwähnenswert:

  • Distillation und kontrastives Lernen ergänzen sich auf eine Weise, die wir anfangs nicht erwartet hatten.
  • Das Entfernen einer einzelnen Komponente aus unserer Verlustmischung verschlechtert die Leistung durchgehend.
  • Aufgabenspezifische LoRA-Adapter übertreffen das Multi-Task-Training bei vernachlässigbarem Parameter-Overhead.
  • GOR-Regularisierung macht binäre Quantisierung nahezu verlustfrei, was für den Einsatz wichtiger ist als marginale Gewinne bei voller Präzision.

tagFazit

Vektormodelle werden zunehmend als Komponenten in größeren Tool-Ketten verwendet. LLM-Agenten rufen Embedding-APIs für Retrieval, Gedächtnis und Klassifizierung als Teil von agentischen Workflows auf. Projekte wie OpenClaw und OpenViking betrachten Vektormodelle als zentrale Infrastrukturschicht für das Kontextmanagement von Agenten und nicht als eigenständige Such-Endpunkte. In diesem Szenario sind Inferenzkosten und Latenz pro Aufruf ebenso wichtig wie Benchmark-Ergebnisse, weshalb kompakte Modelle zur natürlichen Wahl werden.

Der Trend zu kleineren Vektormodellen spiegelt einen breiteren Wandel wider. On-Device-Retrieval, browserbasierte Suche und Edge-Deployment erfordern Modelle, die in begrenzte Speicherbudgets passen. Die Unterstützung für Matryoshka-Dimensionen ermöglicht es einem einzelnen Modell, sowohl hochpräzise als auch ultraschnelle approximative Suche ohne erneutes Training anzubieten. In Kombination mit GGUF-Quantisierung bis auf 1-2 Bits sinkt der effektive Speicherbedarf für einen produktiven Embedding-Dienst um eine Größenordnung.

Wir arbeiten derzeit an jina-embeddings-v5-multimodal, um dieselbe Architektur auf Bild- und Cross-Modal-Retrieval auszuweiten. Frühe Ergebnisse deuten darauf hin, dass es möglich ist, einen Vision-Encoder mit einem feinabgestimmten Text-Vektormodell in Einklang zu bringen, ohne die Textleistung zu verschlechtern. Bleiben Sie dran.

Kategorien:
star
Hervorgehoben
Pressemitteilung
rss_feed

Weiterlesen
August 03, 2026 • 11 Minuten gelesen
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
Mai 12, 2026 • 7 Minuten gelesen
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
Dezember 04, 2025 • 7 Minuten gelesen
Jina-VLM: Small Multilingual Vision Language Model
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Aktuelle Sprache / Design
Search Foundation
Leser
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Pressemitteilungen
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitTerms & amp; BedingungenPrivatsphäreCookie-EinstellungenMeine persönlichen Daten werden nicht verkauft oder weitergegeben.
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.