Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Lettore
Leggi gli URL e cerca sul web per ottenere LLM più approfonditi.
Incorporamenti
Incorporamenti multimodali multilingue.
Riclassificazione
Strumento di riordinamento per massimizzare la pertinenza dei risultati di ricerca.
Elastic Inference Service
Esegui i modelli Jina in modo nativo all'interno di Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
warning
Questo modello è obsoleto nei modelli più recenti.
Incorporamenti
Licenza Apache 2.0

jina-embedding-b-en-v1

La prima versione del modello Jina Embedding, la OG.
Licenza
Apache-2.0
Data di rilascio
calendar_month
2023-06-17
Ingresso
abc
Testo
arrow_forward
Produzione
more_horiz
Vettore
Dettagli del modello
Parametri: 110M
Lunghezza del token di input: 512
Dimensione di uscita: 768
Modello base help_outline
open_in_new
T5-Base Encoder
Lingue addestrate help_outline
1 lingue
Modelli correlati
link
jina-embeddings-v2-base-en
link
jina-embeddings-v3
Disponibile tramite
Hugging Face
Air-gapped
Grafico I/O

Testo

jina-embedding-b-en-v1

Vettore

Pareto fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-l-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embedding-b-en-v1Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
MTEB English · retrieval
44.03
Parameters
110M
Rank by score
28 / 39
Pareto front
Behind it
Scegli i modelli da confrontare
Pubblicazioni (1)
EMNLP 2023
luglio 20, 2023
Jina Embeddings: A Novel Set of High-Performance Sentence Embedding Models

Panoramica

Jina Embedding B v1 è un modello di embedding di testo specializzato progettato per trasformare il testo inglese in rappresentazioni numeriche ad alta dimensionalità mantenendo il significato semantico. Il modello risponde all'esigenza critica di embedding di testo efficienti e precisi negli ambienti di produzione, particolarmente prezioso per le organizzazioni che richiedono un equilibrio tra efficienza computazionale e qualità dell'embedding. Con i suoi 110M di parametri che generano embedding a 768 dimensioni, funge da soluzione pratica per i team che implementano sistemi di ricerca semantica, clustering di documenti o raccomandazione di contenuti senza richiedere ampie risorse computazionali.

Metodi

Il modello impiega un'architettura basata su codificatore T5 potenziata con pooling medio per generare rappresentazioni di lunghezza fissa. Addestrato sul dataset Linnaeus-Clean attentamente curato, che contiene 385 milioni di coppie di frasi di alta qualità filtrate da 1,6 miliardi di coppie iniziali, il modello è stato sottoposto a un processo di addestramento in due fasi. La prima fase ha utilizzato l'apprendimento contrastivo con perdita di InfoNCE su coppie di testo, mentre la seconda fase ha incorporato l'addestramento di triplette per perfezionare la capacità del modello di distinguere tra contenuti simili e dissimili. Questo approccio di addestramento innovativo, combinato con un rigoroso filtraggio dei dati che include il rilevamento della lingua e il controllo della coerenza, consente al modello di catturare efficacemente relazioni semantiche sfumate.

Prestazione

Nelle valutazioni del mondo reale, Jina Embedding B v1 dimostra capacità impressionanti, in particolare in attività di similarità testuale semantica. Il modello raggiunge prestazioni all'avanguardia su STS12 con un punteggio di 0,751, superando modelli consolidati come all-mpnet-base-v2 e all-minilm-l6-v2. Mostra prestazioni elevate in vari benchmark mantenendo tempi di inferenza efficienti. Tuttavia, gli utenti devono notare che il modello è specificamente ottimizzato per contenuti in lingua inglese e potrebbe non funzionare in modo ottimale su attività multilingue o specifiche del codice. Il modello è stato da allora sostituito da jina-embeddings-v2-base-en e jina-embeddings-v3, che offrono prestazioni migliorate in una gamma più ampia di casi d'uso.

Orientamento

Per un'implementazione ottimale, il modello richiede una GPU compatibile con CUDA, sebbene le sue dimensioni moderate consentano un'inferenza efficiente su hardware standard. Il modello accetta sequenze di input lunghe fino a 512 token ed è particolarmente adatto per ambienti di produzione in cui è fondamentale una generazione di incorporamenti coerente e affidabile. Offre le massime prestazioni su contenuti in lingua inglese ed è ideale per applicazioni come la ricerca semantica, il confronto di similarità di documenti e i sistemi di raccomandazione di contenuti. I team dovrebbero prendere in considerazione l'utilizzo delle versioni v2 o v3 più recenti per i nuovi progetti, in quanto offrono prestazioni migliorate e un supporto linguistico più ampio. Il modello non è consigliato per attività che richiedono una comprensione multilingue o una conoscenza di dominio specializzata al di fuori del testo inglese generale.
Lingua / tema attuale
Search Foundation
Lettore
Incorporamenti
Riclassificazione
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizia
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.