Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Reader
Konvertieren Sie jede URL in Markdown für besseres Grounding von LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumentation
Einloggen
login
warning
Dieses Modell wird durch neuere Modelle ersetzt.
Einbettungen
Apache 2.0 Lizenz
open_in_new Release-Post

jina-embeddings-v2-base-en

Auf Augenhöhe mit text-embedding-ada002 von OpenAI
Lizenz
Apache-2.0
Veröffentlichungsdatum
calendar_month
2023-10-28
Eingabe
abc
Text
arrow_forward
Ausgabe
more_horiz
Vektor
Spätes Chunking help_outline
check_circle
Yes
Modelldetails
Parameter: 137M
Länge des Eingabetokens: 8K
Ausgabedimension: 768
Ausgebildete Sprachen help_outline
1 Sprachen
Ähnliche Modelle
link
jina-embedding-b-en-v1
link
jina-embeddings-v3
Erhältlich über
Jina-API
AWS SageMaker
Microsoft Azure
Hugging Face
Air-Gapped
E/A-Diagramm

Text

jina-embeddings-v2-base-en

Vektor

Pareto-Fronthelp_outline
MTEB English
RTEB public
LongEmbed
LoCo
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B30B20406080all-MiniLM-L12-v2all-mpnet-base-v2bge-m3e5-basee5-smalle5-small-v2EmbeddingGemma-300Mgranite-embedding-278m-…granite-embedding-311m-…granite-embedding-engli…granite-embedding-small…GritLM-7BGritLM-8x7Bgte-basegte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-smallinf-retriever-v1jasper_en_vision_langua…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…LaBSELLM2Vec-Mistral-7B-Inst…multilingual-e5-largenomic-embed-text-v1nomic-embed-text-v1.5NV-Embed-v1NV-Embed-v2Qwen3-Embedding-4BSFR-Embedding-Mistralsnowflake-arctic-embed-…snowflake-arctic-embed-…snowflake-arctic-embed-…stella_en_1.5B_v5voyage-4-nanojina-embeddings-v2-base…Parameter (log)nDCG@10
Dieses Modell
Auf der Front
Jina AI
Andere
LongEmbed
58.12
Parameter
137M
Rang nach Score
18 / 69
Pareto-Front
Dahinter
Werteverteilunghelp_outline
AUC 0.8376
Korpus
Übersetzungspaare
Dokumentensuche
0.8500.600.700.800.90
Verwandt26.9%
Hartes Negativ2.7%
Unverwandt1.1%
Empfohlene Schwellenwerte
FPR 0.1 · 0.793
FPR 0.01 · 0.850
FPR 0.001 · 0.894
FPR 0.0001 · 0.914
ausgewogen · 0.762
AUC
0.8376
Rauschgrenze
0.893
Recall-Kante
0.691
Gemessene Paare
119 / 11k
Vektorkomponentenhelp_outline
-0.14-0.000.14
σ 0.0361 · 183k Werte
Einbettungsgeometriehelp_outline
0768
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.751
Effektive Dim.
59 / 768
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)
arXiv
Oktober 30, 2023
Jina Embeddings 2: 8192-Token General-Purpose Text Embeddings for Long Documents

Überblick

jina-embeddings-v2-base-en ist ein 137M-Parameter Englisch-Text-Embedding-Modell mit einem 8.192-Token-Kontextfenster — das 16-Fache der 512-Token-Grenze seiner Ära. Auf einem BERT-small-Backbone mit symmetrischer bidirektionaler ALiBi (Attention with Linear Biases) gebaut, war es das erste Open-Source-Jina-Embedding, das lange Dokumente nativ ohne Trunkierung oder Chunking verarbeitete. Es erzeugt 768-dimensionale Vektoren und bleibt eine solide Wahl für englisch-spezifisches Retrieval, bei dem mehrsprachige oder Langkontext-Funktionen von v3/v5 nicht benötigt werden.

Methoden

Die Architektur kombiniert einen BERT-small-Transformer (12 Schichten, 12 Attention-Heads, 768 verborgene Dimensionen) mit symmetrischen bidirektionalen ALiBi-Position-Encodings. ALiBi ersetzt erlernte Positions-Embeddings durch einen linear abfallenden Attention-Bias, wodurch das Modell weit über seine 512-Token-Trainingslänge hinaus bis zu 8.192 Tokens extrapolieren kann, ohne Performance-Verluste. Das Training folgte einer zweistufigen Pipeline: Pretraining auf C4, dann Feintuning auf Jinas kuratierte Sammlung von 40+ spezialisierten Satzpaar-Datensätzen mit Hard-Negative-Mining. Symmetrische bidirektionale Aufmerksamkeit stellt sicher, dass jedes Token sowohl auf vorangegangenen als auch folgenden Kontext achtet und Repräsentationen erzeugt, die globale Satzbedeutung erfassen. Mean-Pooling über alle Token-Repräsentationen erzeugt das finale 768-dimensionale Embedding.

Leistung

Bei der Veröffentlichung übertraf das Modell OpenAIs text-embedding-ada-002 auf mehreren MTEB-Englisch-Unteraufgaben: Klassifikation (73,45 % vs. 70,93 %), Reranking (85,38 % vs. 84,89 %), Retrieval (56,98 % vs. 56,32 %) und Zusammenfassung (31,6 % vs. 30,8 %). Sein 8.192-Token-Kontext war ein erheblicher Vorteil gegenüber konkurrierenden Modellen mit Begrenzung auf 512–2.048 Tokens und ermöglichte Dokument-Ebenen-Retrieval ohne Chunking. Der kompakte 307MB-Fußabdruck machte es auf Consumer-GPUs deploybar. Im Jahr 2026 übertrifft jina-embeddings-v5-text-small (677M Parameter, 32K-Kontext, task-spezifische LoRA-Adapter) es für die meisten Produktions-Workloads, aber es bleibt für leichte englisch-spezifische Pipelines relevant.

Anleitung

Verwenden Sie dieses Modell für englisch-spezifisches Retrieval, bei dem das 8K-Kontextfenster ausreicht und mehrsprachige oder task-spezifische Adapter nicht benötigt werden. Für Dokumente über 8.192 Tokens semantisches Chunking vor dem Embedding anwenden. Das Modell integriert sich mit großen Vektor-Datenbanken (Qdrant, Weaviate, MongoDB Atlas, Milvus) und RAG-Frameworks (LangChain, LlamaIndex, Haystack). Für neue Projekte mit mehrsprachiger Unterstützung, 32K-Kontext oder task-spezifischer Optimierung jina-embeddings-v5-text-small bevorzugen. CUDA-fähige GPU für Produktions-Durchsatz empfohlen; CPU-Inferenz ist möglich, aber deutlich langsamer.

Blogs, die dieses Modell erwähnen
Dezember 17, 2024 • 12 Minuten gelesen
Text Embeddings Fail to Capture Word Order and How to Fix It
Text embedding models struggle with capturing subtle linguistic nuances like word order, directional relationships, temporal sequences, causal connections, comparisons, and negation. Understanding these challenges is key to improving model performance.
Bo Wang
Alex C-G
Three abstract figures in white, gray, and pink on matching cubes placed on a colorful checkered surface against a green back
Oktober 25, 2024 • 19 Minuten gelesen
Finding Optimal Breakpoints in Long Documents Using Small Language Models
We trained three small language models to better segment long documents into chunks, and here are the key lessons we learned.
Andrei Ungureanu
Alex C-G
A pattern of yellow file icons on a blue background with one icon displaying a smiley face creating an emotive contrast.
Oktober 15, 2024 • 9 Minuten gelesen
Fact-Checking with New Grounding API in Jina Reader
With the new g.jina.ai, you can easily ground statements to reduce LLM hallucinations or improve the integrity of human-written content.
Jina AI
Jina developer interface showing "Jina AI was founded in 2020" with controls labeled true and false, and web address on top.
September 27, 2024 • 15 Minuten gelesen
Migration From Jina Embeddings v2 to v3
We collected some tips to help you migrate from Jina Embeddings v2 to v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
September 18, 2024 • 10 Minuten gelesen
Jina Embeddings v3: A Frontier Multilingual Embedding Model
jina-embeddings-v3 is a frontier multilingual text embedding model with 570M parameters and 8192 token-length, outperforming the latest proprietary embeddings from OpenAI and Cohere on MTEB.
Jina AI
Dynamic image showing the characters "V3" formed by bright green dots varying in size on a black background.
Aktuelle Sprache / Design
Search Foundation
Reader
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Neuigkeiten
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitAGBPrivatsphäreCookie-EinstellungenMeine persönlichen Daten nicht verkaufen oder weitergeben
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.