Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Lettore
Leggi gli URL e cerca sul web per ottenere LLM più approfonditi.
Incorporamenti
Incorporamenti multimodali multilingue.
Riclassificazione
Strumento di riordinamento per massimizzare la pertinenza dei risultati di ricerca.
Elastic Inference Service
Esegui i modelli Jina in modo nativo all'interno di Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
Incorporamenti
Riclassificazione
copyright CC BY-NC 4.0
open_in_new Pubblicazione post

jina-colbert-v2

Il miglior ColBERT multilingue con le massime prestazioni nell'incorporamento e nella riclassificazione
Licenza
copyright CC-BY-NC-4.0
Data di rilascio
calendar_month
2024-08-31
Ingresso
abc
Testo
arrow_forward
Produzione
apps
Multi-vettore
Dimensioni Matryoshka help_outline
64
96
128
Dettagli del modello
Parametri: 560M
Lunghezza del token di input: 8K
Dimensione di uscita: 128
Modello base help_outline
open_in_new
XLM-RoBERTa Large
Lingue addestrate help_outline
89 lingue
Lingue supportate help_outline
108 lingue
Modelli correlati
link
jina-colbert-v1-en
Disponibile tramite
API di Jina
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-gapped
Grafico I/O 1

multiplo

Vettore

Domanda

jina-colbert-v2

Grafico I/O 2

multiplo

Vettore

Documento

jina-colbert-v2

Distribuzione dei valorihelp_outline
AUC 0.9726
Corpus
Coppie di traduzione
Codice
19.141518202325
Correlate81.0%
Negativo difficile10.3%
Non correlate0.8%
Passa il cursore o fai clic sul grafico per spostare la soglia
Soglie consigliate
FPR 0.1 · 17.83
FPR 0.01 · 19.14
FPR 0.001 · 21.08
FPR 0.0001 · 23.67
bilanciata · 18.66
AUC
0.9726
Soglia del rumore
21.05
Crollo del richiamo
16.22
Coppie misurate
100 / 9,200
Punteggio per posizionehelp_outline
12345678910
Punteggio medio a ogni posizione
Scegli i modelli da confrontare
Pubblicazioni (1)
EMNLP 2024
agosto 30, 2024
Jina-ColBERT-v2: A General-Purpose Multilingual Late Interaction Retriever

Panoramica

Jina-ColBERT-v2 è un modello di recupero di informazioni multilingue rivoluzionario che risolve la sfida critica di una ricerca efficiente e di alta qualità in più lingue. Come primo modello multilingue simile a ColBERT a generare incorporamenti compatti, risponde alla crescente necessità di soluzioni di ricerca multilingue scalabili e convenienti nelle applicazioni globali. Le organizzazioni che si occupano di contenuti multilingue, dalle piattaforme di e-commerce ai sistemi di gestione dei contenuti, possono sfruttare questo modello per fornire risultati di ricerca accurati in 89 lingue, riducendo significativamente i costi di archiviazione e di elaborazione attraverso le sue innovative capacità di riduzione delle dimensioni.

Metodi

Il modello si basa sull'architettura ColBERT, introducendo un sofisticato meccanismo di interazione tardiva che cambia radicalmente il modo in cui vengono abbinate query e documenti. Al suo interno, utilizza un backbone XLM-RoBERTa modificato con 560M di parametri, potenziato da incorporamenti di posizione rotativa e ottimizzato con attenzione flash. Il processo di addestramento prevede due fasi chiave: pre-addestramento iniziale con diversi dati debolmente supervisionati da varie lingue, seguito da una messa a punto con dati di triplette etichettati e distillazione supervisionata. Ciò che rende unico questo approccio è l'implementazione dell'apprendimento della rappresentazione Matryoshka, che consente al modello di produrre incorporamenti in più dimensioni (128, 96 o 64) da un singolo processo di addestramento, consentendo l'ottimizzazione dinamica dell'archiviazione senza riaddestramento.

Prestazione

Nei test nel mondo reale, Jina-ColBERT-v2 dimostra capacità eccezionali in più benchmark. Raggiunge un miglioramento del 6,5% rispetto al ColBERT-v2 originale nelle attività in inglese, con un punteggio medio di 0,521 in 14 benchmark BEIR. Ancora più impressionante, supera i tradizionali metodi di recupero basati su BM25 in tutte le lingue testate nei benchmark MIRACL, dimostrando una particolare forza negli scenari multilinguistici. Il modello mantiene queste elevate prestazioni anche quando si utilizzano dimensioni di incorporamento ridotte: il passaggio da 128 a 64 dimensioni comporta solo una riduzione delle prestazioni dell'1,5%, dimezzando al contempo i requisiti di archiviazione. Ciò si traduce in significativi risparmi sui costi di produzione: ad esempio, l'archiviazione di 100 milioni di documenti con vettori a 64 dimensioni costa $ 659,62 al mese su AWS, rispetto a $ 1.319,24 per 128 dimensioni.

Orientamento

Per distribuire efficacemente Jina-ColBERT-v2, i team devono considerare diversi aspetti pratici. Il modello richiede hardware compatibile con CUDA per prestazioni ottimali e supporta lunghezze di documenti fino a 8.192 token (estendibili a 12.288) limitando le query a 32 token. Per la distribuzione in produzione, il modello è disponibile tramite l'API Jina Search Foundation, AWS Marketplace e Azure, con una versione non commerciale accessibile tramite Hugging Face. Durante l'implementazione, i team devono specificare se stanno incorporando query o documenti, poiché il modello utilizza la codifica asimmetrica. Il modello non è progettato per l'elaborazione in tempo reale di raccolte di documenti estremamente grandi senza un'indicizzazione adeguata e, sebbene eccella nel recupero multilingue, potrebbe mostrare prestazioni leggermente inferiori su attività specifiche di dominio specializzate rispetto ai modelli ottimizzati per quei domini specifici.
Blog che menzionano questo modello
ottobre 03, 2025 • 7 minuti letti
Jina Reranker v3: 0.6B Listwise Reranker for SOTA Multilingual Retrieval
New 0.6B-parameter listwise reranker that considers the query and all candidate documents in a single context window.
Jina AI
Light blue background with stylized text in the center, composed of small dots or squares, evoking a modern and minimalistic
dicembre 16, 2024 • 2 minuti letti
Re·Search: Order 2024 Yearbook of Search Foundation Advances
Discover Re·Search, our premium yearbook showcasing our best research articles and search foundation models in 2024. Featuring spot UV-coated hardcover, 160 full-color pages, and meticulous design throughout. Available worldwide at $35, shipping included.
Jina AI
Open red publication "ReSearch" volume 24 displayed on a white surface with a distinctive shadow casting over the pages.
ottobre 29, 2024 • 11 minuti letti
Beyond CLIP: How Jina-CLIP Advances Multimodal Search
Learn how Jina-CLIP enhances OpenAI's CLIP with better retrieval accuracy and more diverse results through unified text-image embeddings.
Bo Wang
Alex C-G
Abstract digital landscape with wave-like green and pink dunes against a dark background, conveying a tranquil atmosphere.
agosto 30, 2024 • 10 minuti letti
Jina ColBERT v2: Multilingual Late Interaction Retriever for Embedding and Reranking
Jina ColBERT v2 supports 89 languages with superior retrieval performance, user-controlled output dimensions, and 8192 token-length.
Jina AI
Dark-themed coding interface displaying English and Japanese characters with "JINA COLBERT V2" highlighted in the center.
febbraio 20, 2024 • 16 minuti letti
What is ColBERT and Late Interaction and Why They Matter in Search?
Jina AI's ColBERT on Hugging Face has set Twitter abuzz, bringing a fresh perspective to search with its 8192-token capability. This article unpacks the nuances of ColBERT and ColBERTv2, showcasing their innovative designs and why their late interaction feature is a game-changer for search.
Han Xiao
Neon theater or concert hall marquee letters lit up at night with city lights and faint "Adobe Sto" visible.
Lingua / tema attuale
Search Foundation
Lettore
Incorporamenti
Riclassificazione
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizia
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.