Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Reader
Konvertieren Sie jede URL in Markdown für besseres Grounding von LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumentation
Einloggen
login
warning
Dieses Modell wird durch neuere Modelle ersetzt.
Einbettungen
Apache 2.0 Lizenz
open_in_new Release-Post

jina-embeddings-v2-base-de

Zweisprachige Einbettungen Deutsch-Englisch mit SOTA-Leistung
Lizenz
Apache-2.0
Veröffentlichungsdatum
calendar_month
2024-01-15
Eingabe
abc
Text
arrow_forward
Ausgabe
more_horiz
Vektor
Spätes Chunking help_outline
check_circle
Yes
Modelldetails
Parameter: 161M
Länge des Eingabetokens: 8K
Ausgabedimension: 768
Basismodell help_outline
jina-bert-v2-base-de
Ausgebildete Sprachen help_outline
2 Sprachen
Ähnliche Modelle
link
jina-embeddings-v2-base-en
Erhältlich über
Jina-API
AWS SageMaker
Microsoft Azure
Hugging Face
Air-Gapped
E/A-Diagramm

Text

jina-embeddings-v2-base-de

Vektor

Pareto-Fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Parameter (log)nDCG@10
Dieses Modell
Auf der Front
Jina AI
Andere
MTEB English · retrieval
44.10
Parameter
161M
Rang nach Score
27 / 39
Pareto-Front
Dahinter
Werteverteilunghelp_outline
AUC 0.8452
Korpus
Übersetzungspaare
Dokumentensuche
0.6900.000.200.400.600.80
Verwandt16.8%
Hartes Negativ1.7%
Unverwandt0.9%
Empfohlene Schwellenwerte
FPR 0.1 · 0.499
FPR 0.01 · 0.690
FPR 0.001 · 0.796
FPR 0.0001 · 0.897
ausgewogen · 0.368
AUC
0.8452
Rauschgrenze
0.793
Recall-Kante
0.195
Gemessene Paare
119 / 11k
Vektorkomponentenhelp_outline
-0.19-0.010.17
σ 0.0361 · 183k Werte
Einbettungsgeometriehelp_outline
0768
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.316
Effektive Dim.
49 / 768
Sprachpaarehelp_outline
de-ruen-deen-koen-zhja-ko
Streuung des Schwellenwerts über die Paare: 0.158
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)
arXiv
Februar 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

Überblick

jina-embeddings-v2-base-de ist ein 161M-Parameter zweisprachiges Text-Embedding-Modell für Deutsch und Englisch mit einem 8.192-Token-Kontextfenster. Es bildet semantisch äquivalente Inhalte in beiden Sprachen in denselben 768-dimensionalen Embedding-Raum ab und ermöglicht so cross-sprachliches Retrieval ohne Übersetzung. Das Modell war eines der ersten Open-Source-zweisprachigen Embedding-Modelle, die Langkontext-Unterstützung mit ausgeglichener Performance in beiden Sprachen verbanden.

Methoden

Auf einem BERT-basierten Backbone mit symmetrischen bidirektionalen ALiBi-Position-Encodings gebaut, verarbeitet das Modell sowohl Deutsch als auch Englisch durch eine einheitliche 161M-Parameter-Architektur, die 768-dimensionale Embeddings erzeugt. Das Training umfasste drei Stufen: (1) mehrsprachiges Pretraining auf deutsch-englischen Parallel-Korpora, (2) kontrastives Feintuning auf kuratierten Satzpaaren mit Hard-Negativen und (3) cross-linguales Alignement-Training, um sicherzustellen, dass semantisch äquivalente Texte in Deutsch und Englisch auf nahe Regionen des Embedding-Raums abgebildet werden. Eine zentrale Designentscheidung war das Bias-Minimierungs-Objektiv, das die Tendenz mehrsprachiger Modelle zur Bevorzugung englischer grammatischer Strukturen kompensiert — ein dokumentierter Fehlermodus früherer mehrsprachiger Embeddings. Das 8.192-Token-Fenster via ALiBi ermöglicht die Verarbeitung ganzer Dokumente in beiden Sprachen ohne Trunkierung.

Leistung

Das Modell übertraf Microsofts E5-base bei weniger als einem Drittel seiner Größe und erreichte die Performance von E5-large, obwohl es 7-mal kleiner war. Auf WikiCLIR (Englisch-zu-Deutsch-Retrieval), STS17/STS22 (bidirektionale semantische Ähnlichkeit) und BUCC (zweisprachige Text-Alignment) übertraf es konsistent Modelle gleicher oder größerer Größe. Der 322MB-Fußabdruck ermöglichte das Deployment auf Standard-Hardware. Im Jahr 2026 ersetzt jina-embeddings-v5-text-small dieses Modell für die meisten Anwendungen und bietet 32K-Kontext, 89 Sprachen und task-spezifische LoRA-Adapter. Das v2-base-de-Modell bleibt für deutsch-englische Zweisprach-Pipelines nützlich, bei denen der 8K-Kontext ausreicht.

Anleitung

Optimal für deutsch-englisches Zweisprach-Retrieval: Produktsuche, Support-Dokumentation und Content-Management, bei denen Anfragen und Dokumente in verschiedenen Sprachen vorliegen können. Für Dokumente über 8.192 Tokens semantisches Chunking oder den `late_chunking-Parameter über die Jina-API verwenden. Das Modell integriert sich mit Qdrant, Weaviate, MongoDB und Milvus. Für neue mehrsprachige Projekte, die mehr als zwei Sprachen umfassen, jina-embeddings-v5-text-small` bevorzugen (89 Sprachen, 32K-Kontext, LoRA-Adapter). CUDA-fähige GPU für Produktions-Durchsatz empfohlen.

Blogs, die dieses Modell erwähnen
September 27, 2024 • 15 Minuten gelesen
Migration From Jina Embeddings v2 to v3
We collected some tips to help you migrate from Jina Embeddings v2 to v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
Mai 15, 2024 • 11 Minuten gelesen
Binary Embeddings: All the AI, 3.125% of the Fat
32-bits is a lot of precision for something as robust and inexact as an AI model. So we got rid of 31 of them! Binary embeddings are smaller, faster and highly performant.
Sofia Vasileva
Scott Martens
Futuristic digital 3D model of a coffee grinder with blue neon lights on a black background, featuring numerical data.
April 29, 2024 • 7 Minuten gelesen
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
Januar 31, 2024 • 16 Minuten gelesen
A Deep Dive into Tokenization
Tokenization, in LLMs, means chopping input texts up into smaller parts for processing. So why are embeddings billed by the token?
Scott Martens
Colorful speckled grid pattern with a mix of small multicolored dots on a black background, creating a mosaic effect.
Januar 26, 2024 • 13 Minuten gelesen
Jina Embeddings v2 Bilingual Models Are Now Open-Source On Hugging Face
Jina AI's open-source bilingual embedding models for German-English and Chinese-English are now on Hugging Face. We’re going to walk through installation and cross-language retrieval.
Scott Martens
Colorful "EMBEDDINGS" text above a pile of yellow smileys on a black background with decorative lines at the top.
Aktuelle Sprache / Design
Search Foundation
Reader
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Neuigkeiten
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitAGBPrivatsphäreCookie-EinstellungenMeine persönlichen Daten nicht verkaufen oder weitergeben
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.