Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Leser
Lesen Sie URLs und suchen Sie im Internet nach fundierteren LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
Elastic Inference Service
Jina-Modelle nativ in Elasticsearch ausführen.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumente
Einloggen
login
warning
Dieses Modell wird durch neuere Modelle ersetzt.
Einbettungen
Apache 2.0 Lizenz

jina-embedding-b-en-v1

Die erste Version des Jina-Embedding-Modells, das OG.
Lizenz
Apache-2.0
Veröffentlichungsdatum
calendar_month
2023-06-17
Eingang
abc
Text
arrow_forward
Ausgabe
more_horiz
Vektor
Modelldetails
Parameter: 110M
Länge des Eingabetokens: 512
Ausgabedimension: 768
Basismodell help_outline
open_in_new
T5-Base Encoder
Ausgebildete Sprachen help_outline
1 Sprachen
Ähnliche Modelle
link
jina-embeddings-v2-base-en
link
jina-embeddings-v3
Erhältlich über
Hugging Face
Air-Gapped
E/A-Diagramm

Text

jina-embedding-b-en-v1

Vektor

Pareto fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-l-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embedding-b-en-v1Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
MTEB English · retrieval
44.03
Parameters
110M
Rank by score
28 / 39
Pareto front
Behind it
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)
EMNLP 2023
Juli 20, 2023
Jina Embeddings: A Novel Set of High-Performance Sentence Embedding Models

Überblick

Jina Embedding B v1 ist ein spezialisiertes Text-Embedding-Modell, das englische Texte in hochdimensionale numerische Darstellungen transformiert und dabei die semantische Bedeutung beibehält. Das Modell erfüllt den kritischen Bedarf an effizienten und genauen Text-Embeddings in Produktionsumgebungen und ist besonders wertvoll für Organisationen, die ein Gleichgewicht zwischen Rechenleistung und Einbettungsqualität benötigen. Mit seinen 110 Millionen Parametern, die 768-dimensionale Embeddings generieren, dient es als praktische Lösung für Teams, die semantische Such-, Dokumentclustering- oder Inhaltsempfehlungssysteme implementieren, ohne umfangreiche Rechenressourcen zu benötigen.

Methoden

Das Modell verwendet eine T5-Encoder-basierte Architektur, die mit Mean Pooling erweitert wurde, um Darstellungen mit fester Länge zu generieren. Das Modell wurde anhand des sorgfältig kuratierten Linnaeus-Clean-Datensatzes trainiert, der 385 Millionen hochwertige Satzpaare enthält, die aus anfänglich 1,6 Milliarden Paaren herausgefiltert wurden, und durchlief einen zweiphasigen Trainingsprozess. Die erste Phase nutzte kontrastives Lernen mit InfoNCE-Verlust bei Textpaaren, während die zweite Phase ein Triplet-Training beinhaltete, um die Fähigkeit des Modells zu verfeinern, zwischen ähnlichen und unähnlichen Inhalten zu unterscheiden. Dieser innovative Trainingsansatz, kombiniert mit strenger Datenfilterung einschließlich Spracherkennung und Konsistenzprüfung, ermöglicht es dem Modell, nuancierte semantische Beziehungen effektiv zu erfassen.

Leistung

Bei realen Tests zeigt Jina Embedding B v1 beeindruckende Fähigkeiten, insbesondere bei Aufgaben zur semantischen Textähnlichkeit. Das Modell erreicht mit einem Score von 0,751 eine Spitzenleistung bei STS12 und übertrifft damit etablierte Modelle wie all-mpnet-base-v2 und all-minilm-l6-v2. Es zeigt eine starke Leistung bei verschiedenen Benchmarks und behält gleichzeitig effiziente Inferenzzeiten bei. Benutzer sollten jedoch beachten, dass das Modell speziell für englischsprachige Inhalte optimiert ist und bei mehrsprachigen oder codespezifischen Aufgaben möglicherweise nicht optimal funktioniert. Das Modell wurde inzwischen durch jina-embeddings-v2-base-en und jina-embeddings-v3 ersetzt, die eine verbesserte Leistung für ein breiteres Spektrum von Anwendungsfällen bieten.

Anleitung

Für eine optimale Bereitstellung erfordert das Modell eine CUDA-fähige GPU, obwohl seine moderate Größe eine effiziente Inferenz auf Standardhardware ermöglicht. Das Modell akzeptiert Eingabesequenzen mit einer Länge von bis zu 512 Token und eignet sich besonders gut für Produktionsumgebungen, in denen eine konsistente, zuverlässige Einbettungsgenerierung von entscheidender Bedeutung ist. Es funktioniert am besten bei englischsprachigem Inhalt und ist ideal für Anwendungen wie semantische Suche, Dokumentähnlichkeitsvergleich und Inhaltsempfehlungssysteme. Teams sollten die Verwendung der neueren Versionen v2 oder v3 für neue Projekte in Betracht ziehen, da diese eine verbesserte Leistung und eine breitere Sprachunterstützung bieten. Das Modell wird nicht für Aufgaben empfohlen, die mehrsprachiges Verständnis oder spezielles Domänenwissen über allgemeine englische Texte hinaus erfordern.
Aktuelle Sprache / Design
Search Foundation
Leser
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Pressemitteilungen
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitTerms & amp; BedingungenPrivatsphäreCookie-EinstellungenMeine persönlichen Daten werden nicht verkauft oder weitergegeben.
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.