Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Leser
Lesen Sie URLs und suchen Sie im Internet nach fundierteren LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
Elastic Inference Service
Jina-Modelle nativ in Elasticsearch ausführen.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumente
Einloggen
login
warning
Dieses Modell wird durch neuere Modelle ersetzt.
Einbettungen
Apache 2.0 Lizenz
open_in_new Beitrag veröffentlichen

jina-embeddings-v2-base-es

Zweisprachige Einbettungen Spanisch-Englisch mit SOTA-Leistung
Lizenz
Apache-2.0
Veröffentlichungsdatum
calendar_month
2024-02-14
Eingang
abc
Text
arrow_forward
Ausgabe
more_horiz
Vektor
Späte Chunking help_outline
check_circle
Yes
Modelldetails
Parameter: 161M
Länge des Eingabetokens: 8K
Ausgabedimension: 768
Basismodell help_outline
open_in_new
jina-embeddings-v2-base-en
Ausgebildete Sprachen help_outline
2 Sprachen
Ähnliche Modelle
link
jina-embeddings-v2-base-en
link
jina-embeddings-v2-base-de
link
jina-embeddings-v2-base-zh
Erhältlich über
Jina-API
AWS SageMaker
Microsoft Azure
Hugging Face
Air-Gapped
E/A-Diagramm

Text

jina-embeddings-v2-base-es

Vektor

Pareto fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
MTEB English · retrieval
46.40
Parameters
161M
Rank by score
24 / 39
Pareto front
Behind it
Werteverteilunghelp_outline
AUC 0.8383
Korpus
Übersetzungspaare
Dokumentensuche
0.6830.000.200.400.600.80
Verwandt17.6%
Hartes Negativ3.0%
Unverwandt0.8%
Empfohlene Schwellenwerte
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
ausgewogen · 0.365
AUC
0.8383
Rauschgrenze
0.774
Recall-Kante
0.163
Gemessene Paare
119 / 11k
Vektorkomponentenhelp_outline
-0.160.000.17
σ 0.0361 · 183k Werte
Einbettungsgeometriehelp_outline
0768
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.326
Effektive Dim.
51 / 768
Sprachpaarehelp_outline
de-ruen-deen-koen-zhja-ko
Streuung des Schwellenwerts über die Paare: 0.315
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)
arXiv
Februar 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

Überblick

Jina Embeddings v2 Base Spanish ist ein bahnbrechendes zweisprachiges Texteinbettungsmodell, das sich der kritischen Herausforderung der sprachübergreifenden Informationsbeschaffung und -analyse von spanischen und englischen Inhalten stellt. Im Gegensatz zu herkömmlichen mehrsprachigen Modellen, die häufig eine Voreingenommenheit gegenüber bestimmten Sprachen zeigen, liefert dieses Modell eine wirklich ausgewogene Leistung sowohl auf Spanisch als auch auf Englisch und ist daher unverzichtbar für Organisationen, die in spanischsprachigen Märkten tätig sind oder zweisprachige Inhalte verarbeiten. Das bemerkenswerteste Merkmal des Modells ist seine Fähigkeit, geometrisch ausgerichtete Einbettungen zu generieren – wenn Texte auf Spanisch und Englisch dieselbe Bedeutung ausdrücken, gruppieren sich ihre Vektordarstellungen auf natürliche Weise im Einbettungsraum und ermöglichen so eine nahtlose sprachübergreifende Suche und Analyse.

Methoden

Das Herzstück dieses Modells ist eine innovative Architektur, die auf symmetrischem bidirektionalem ALiBi (Attention with Linear Biases) basiert, einem ausgeklügelten Ansatz, der die Verarbeitung von Sequenzen mit bis zu 8.192 Token ohne traditionelle Positionseinbettungen ermöglicht. Das Modell verwendet eine modifizierte BERT-Architektur mit 161 Millionen Parametern, die Gated Linear Units (GLU) und spezielle Layer-Normalisierungstechniken enthält. Das Training erfolgt in einem dreistufigen Prozess: anfängliches Vortraining anhand eines riesigen Textkorpus, gefolgt von Feinabstimmung mit sorgfältig kuratierten Textpaaren und schließlich hartes Negativtraining zur Verbesserung der Unterscheidung zwischen ähnlichen, aber semantisch unterschiedlichen Inhalten. Dieser Ansatz, kombiniert mit 768-dimensionalen Einbettungen, ermöglicht es dem Modell, nuancierte semantische Beziehungen zu erfassen und gleichzeitig die Rechenleistung aufrechtzuerhalten.

Leistung

In umfassenden Benchmark-Bewertungen zeigt das Modell außergewöhnliche Fähigkeiten, insbesondere bei sprachübergreifenden Abrufaufgaben, bei denen es deutlich größere mehrsprachige Modelle wie E5 und BGE-M3 übertrifft, obwohl es nur 15-30 % deren Größe hat. Das Modell erzielt eine überlegene Leistung bei Abruf- und Clustering-Aufgaben und zeigt besondere Stärken beim Abgleichen semantisch äquivalenter Inhalte über Sprachen hinweg. Beim Test mit dem MTEB-Benchmark zeigt es eine robuste Leistung bei verschiedenen Aufgaben, darunter Klassifizierung, Clustering und semantische Ähnlichkeit. Das erweiterte Kontextfenster von 8.192 Tokens erweist sich als besonders wertvoll für die Verarbeitung langer Dokumente und zeigt eine konsistente Leistung selbst bei Dokumenten, die sich über mehrere Seiten erstrecken – eine Fähigkeit, die den meisten Konkurrenzmodellen fehlt.

Anleitung

Um dieses Modell effektiv zu nutzen, sollten Organisationen für optimale Leistung Zugriff auf eine CUDA-fähige GPU-Infrastruktur sicherstellen. Das Modell lässt sich nahtlos in die wichtigsten Vektordatenbanken und RAG-Frameworks wie MongoDB, Qdrant, Weaviate und Haystack integrieren und ist somit problemlos in Produktionsumgebungen einsetzbar. Es eignet sich hervorragend für Anwendungen wie die zweisprachige Dokumentensuche, Inhaltsempfehlungssysteme und die sprachenübergreifende Dokumentenanalyse. Obwohl das Modell eine beeindruckende Vielseitigkeit aufweist, ist es insbesondere für zweisprachige Szenarien in Spanisch und Englisch optimiert und möglicherweise nicht die beste Wahl für einsprachige Anwendungen oder Szenarien mit anderen Sprachpaaren. Für optimale Ergebnisse sollten Eingabetexte entweder in Spanisch oder Englisch richtig formatiert sein, obwohl das Modell gemischtsprachige Inhalte effektiv verarbeitet. Das Modell unterstützt die Feinabstimmung für domänenspezifische Anwendungen, dies sollte jedoch unter sorgfältiger Berücksichtigung der Qualität und Verteilung der Trainingsdaten angegangen werden.
Blogs, die dieses Modell erwähnen
April 29, 2024 • 7 Minuten gelesen
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
Februar 14, 2024 • 4 Minuten gelesen
Aquí Se Habla Español: Top-Quality Spanish-English Embeddings and 8k Context
Jina AI's new bilingual Spanish-English embedding model brings the state-of-the-art in AI to half a billion Spanish speakers.
Jina AI
Digital wireframe rendering of a Gothic-style cathedral, with colorful outlines and pointed spires on a dark background.
Aktuelle Sprache / Design
Search Foundation
Leser
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Pressemitteilungen
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitTerms & amp; BedingungenPrivatsphäreCookie-EinstellungenMeine persönlichen Daten werden nicht verkauft oder weitergegeben.
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.