Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Reader
Converti qualsiasi URL in Markdown per un migliore ancoraggio dei LLM.
Embeddings
Embeddings multimodali e multilingue.
Reranker
Reranker per massimizzare la pertinenza dei risultati di ricerca.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
warning
Questo modello è obsoleto nei modelli più recenti.
Embeddings
Licenza Apache 2.0
open_in_new Post di rilascio

jina-embeddings-v2-base-de

Embeddings bilingue tedesco-inglese con prestazioni SOTA
Licenza
Apache-2.0
Data di rilascio
calendar_month
2024-01-15
Ingresso
abc
Testo
arrow_forward
Produzione
more_horiz
Vettore
Chunking tardivo help_outline
check_circle
Yes
Dettagli del modello
Parametri: 161M
Lunghezza del token di input: 8K
Dimensione di uscita: 768
Modello base help_outline
jina-bert-v2-base-de
Lingue addestrate help_outline
2 lingue
Modelli correlati
link
jina-embeddings-v2-base-en
Disponibile tramite
API di Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Grafico I/O

Testo

jina-embeddings-v2-base-de

Vettore

Frontiera di Paretohelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Parametri (log)nDCG@10
Questo modello
Sulla frontiera
Jina AI
Altri
MTEB English · retrieval
44.10
Parametri
161M
Classifica per punteggio
27 / 39
Frontiera di Pareto
Dietro
Distribuzione dei valorihelp_outline
AUC 0.8452
Corpus
Coppie di traduzione
Ricerca documentale
0.6900.000.200.400.600.80
Correlate16.8%
Negativo difficile1.7%
Non correlate0.9%
Soglie consigliate
FPR 0.1 · 0.499
FPR 0.01 · 0.690
FPR 0.001 · 0.796
FPR 0.0001 · 0.897
bilanciata · 0.368
AUC
0.8452
Soglia del rumore
0.793
Crollo del richiamo
0.195
Coppie misurate
119 / 11k
Componenti del vettorehelp_outline
-0.19-0.010.17
σ 0.0361 · 183k valori
Geometria dell'embeddinghelp_outline
0768
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.316
Dim. effettive
49 / 768
Coppie linguistichehelp_outline
de-ruen-deen-koen-zhja-ko
Dispersione della soglia tra le coppie: 0.158
Scegli i modelli da confrontare
Pubblicazioni (1)
arXiv
febbraio 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

Panoramica

jina-embeddings-v2-base-de è un modello di embedding del testo bilingue da 161M parametri che copre tedesco e inglese, con una finestra di contesto di 8.192 token. Mappa i contenuti semanticamente equivalenti in entrambe le lingue nello stesso spazio di embedding a 768 dimensioni, abilitando la retrieval cross-linguistico senza traduzione. Il modello è stato uno dei primi modelli di embedding bilingue open source a combinare il supporto al lungo contesto con prestazioni bilanciate in entrambe le lingue.

Metodi

Costruito su un backbone basato su BERT con codifiche posizionali ALiBi bidirezionali simmetriche, il modello elabora sia tedesco che inglese attraverso un'architettura unificata da 161M parametri che produce embedding a 768 dimensioni. L'addestramento ha compreso tre stadi: (1) pre-addestramento multilingua su corpora paralleli tedesco-inglese, (2) fine-tuning contrastivo su coppie di frasi curate con negativi difficili, e (3) addestramento di allineamento cross-linguistico per assicurare che i testi semanticamente equivalenti in tedesco e inglese mappino su regioni vicine dello spazio di embedding. Una scelta di progettazione chiave fu l'obiettivo di minimizzazione del bias, che contrasta la tendenza dei modelli multilingua a favorire le strutture grammaticali inglesi — un noto modo di fallimento degli embedding multilingua precedenti. La finestra di 8.192 token via ALiBi permette l'elaborazione di documenti interi in entrambe le lingue senza troncatura.

Prestazione

Il modello ha superato E5-base di Microsoft essendo meno di un terzo della sua dimensione, e ha eguagliato le prestazioni di E5-large nonostante fosse 7 volte più piccolo. Su WikiCLIR (retrieval inglese-tedesco), STS17/STS22 (similarità semantica bidirezionale) e BUCC (allineamento di testo bilingue), ha costantemente superato modelli di dimensione comparabile o maggiore. Il footprint di 322MB ne ha permesso il deployment su hardware standard. Nel 2026, jina-embeddings-v5-text-small rimpiazza questo modello per la maggior parte delle applicazioni, offrendo contesto di 32K, 89 lingue e adattatori LoRA specifici per il task. Il modello v2-base-de resta utile per pipeline bilingue tedesco-inglese in cui il contesto di 8K è sufficiente.

Orientamento

Ottimale per la retrieval bilingue tedesco-inglese: ricerca di prodotti, documentazione di supporto e gestione dei contenuti dove query e documenti possono essere in lingue diverse. Per documenti che superano 8.192 token, usa il chunking semantico o il parametro `late_chunking tramite l'API di Jina. Il modello si integra con Qdrant, Weaviate, MongoDB e Milvus. Per nuovi progetti multilingua che coprono più di due lingue, preferisci jina-embeddings-v5-text-small` (89 lingue, contesto di 32K, adattatori LoRA). GPU con supporto CUDA consigliata per il throughput di produzione.

Blog che menzionano questo modello
settembre 27, 2024 • 15 minuti letti
Migration From Jina Embeddings v2 to v3
We collected some tips to help you migrate from Jina Embeddings v2 to v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
maggio 15, 2024 • 11 minuti letti
Binary Embeddings: All the AI, 3.125% of the Fat
32-bits is a lot of precision for something as robust and inexact as an AI model. So we got rid of 31 of them! Binary embeddings are smaller, faster and highly performant.
Sofia Vasileva
Scott Martens
Futuristic digital 3D model of a coffee grinder with blue neon lights on a black background, featuring numerical data.
aprile 29, 2024 • 7 minuti letti
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
gennaio 31, 2024 • 16 minuti letti
A Deep Dive into Tokenization
Tokenization, in LLMs, means chopping input texts up into smaller parts for processing. So why are embeddings billed by the token?
Scott Martens
Colorful speckled grid pattern with a mix of small multicolored dots on a black background, creating a mosaic effect.
gennaio 26, 2024 • 13 minuti letti
Jina Embeddings v2 Bilingual Models Are Now Open-Source On Hugging Face
Jina AI's open-source bilingual embedding models for German-English and Chinese-English are now on Hugging Face. We’re going to walk through installation and cross-language retrieval.
Scott Martens
Colorful "EMBEDDINGS" text above a pile of yellow smileys on a black background with decorative lines at the top.
Lingua / tema attuale
Search Foundation
Reader
Embeddings
Reranker
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizie
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.