

Lanzamos jina-embeddings-v5-text, la quinta generación de nuestra familia de modelos de 向量模型, que impulsa la frontera de calidad-eficiencia para 向量模型 multilingües de menos de 1B de parámetros:
- jina-embeddings-v5-text-small (677M de parámetros): 67.0 en MMTEB, 71.7 en MTEB English
- jina-embeddings-v5-text-nano (239M de parámetros): 65.5 en MMTEB, 71.0 en MTEB English
El modelo small admite un contexto de 32K 词元 (8K para nano), 4 adaptadores LoRA específicos para tareas (recuperación, emparejamiento de texto, clasificación, agrupación) y truncamiento de dimensión de Matryoshka de 1024 a 32. Con 239M de parámetros, el modelo nano iguala la calidad de recuperación de modelos con el doble de parámetros.
En comparación con nuestras generaciones anteriores: v5-text-small iguala a jina-embeddings-v4 (3.8B) en recuperación siendo 5.6 veces más pequeño, y supera a jina-embeddings-v3 (572M) en todas las tareas con un número de parámetros similar.
| Característica | v5-text-small | v5-text-nano |
|---|---|---|
| Modelo base | Qwen3-0.6B-Base | EuroBERT-210m |
| Parámetros | 677M | 239M |
| Dimensiones de 向量模型 | 1024 | 768 |
| Longitud de contexto | 32,768 | 8,192 |
| Idiomas | 119 (詞元化器 Qwen3) | 15+ (詞元化器 EuroBERT) |
| Pooling | Last-token | Last-token |
| Adaptadores LoRA | 4 (recuperación, emparejamiento de texto, clasificación, agrupación) | |
| Dimensiones Matryoshka | 32-1024 | 32-768 |
| Puntuación MMTEB | 67.0 | 65.5 |
| MTEB English | 71.7 | 71.0 |
| Licencia | CC BY-NC 4.0 |
v5-text-small alcanza 67.0 en MMTEB (promediado entre 131 tareas en 9 tipos de tarea), superando al siguiente mejor modelo sub-1B (Qwen3-0.6B con instrucciones a 64.3) por +2.7 puntos. El modelo nano con 239M de parámetros obtiene 65.5, superando a modelos con el doble de parámetros.v5-text-small lidera todos los modelos multilingües sub-1B con 71.7 (promediado entre 41 tareas en 7 tipos de tarea), seguido de cerca por KaLM-mini-v2.5 (71.3) y v5-text-nano (71.0). El modelo nano de 239M logra la paridad con el KaLM de 494M teniendo menos de la mitad de su tamaño.v5-text-small alcanza el promedio a nivel de tarea más alto (63.28) entre cinco evaluaciones comparativas de recuperación (MTEB Multilingual, MTEB English, RTEB, BEIR y LongEmbed) entre los modelos sub-4B, igualando a jina-embeddings-v4 (3.8B, 63.62) mientras es 5.6 veces más pequeño.
jina-embeddings-v5-small (0.6B params, rango #8) es el modelo de 向量模型 más fuerte por debajo de 1B de parámetros en MTEB Multilingual v2, superando a Qwen3-Embedding-0.6b en todas las métricas. jina-embeddings-v5-nano (0.2B params, rango #11) ofrece un rendimiento de top-11 con una fracción del tamaño; ningún otro modelo en esta clase de parámetros se le acerca.tagArquitectura

v5-text utiliza backbones de solo decodificador (decoder-only) con pooling del último 词元 (last-token pooling) en lugar de pooling medio. Se inyectan cuatro adaptadores LoRA ligeros en cada capa del transformador, manejando la recuperación, el emparejamiento de texto, la clasificación y la agrupación de forma independiente. Los usuarios seleccionan el adaptador adecuado en el momento de la inferencia. Para la recuperación, las consultas reciben un prefijo "Query:" y los documentos reciben "Document:". La longitud de contexto es de 32K 词元 para la versión small (8K para la nano), un aumento de 4x respecto a v3.
tagPrimeros pasos
tagServicio de inferencia elástica (Elastic Inference Service)
La forma más rápida de usar v5-text en producción. Elastic Inference Service (EIS) proporciona inferencia de 向量模型 gestionada con escalado integrado, por lo que puede generar 向量模型 directamente dentro de su despliegue de Elastic sin gestionar infraestructura.
PUT _inference/text_embedding/jina-v5
{
"service": "elastic",
"service_settings": {
"model_id": "jina-embeddings-v5-text-small"
}
}
Consulte la documentación de EIS para obtener detalles sobre la configuración.
tagJina Embedding API
Nuestra API alojada con precios de pago por 词元. Admite selección de tareas, truncamiento de dimensiones y procesamiento por lotes desde el primer momento. No requiere GPU.
curl https://api.jina.ai/v1/embeddings \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model": "jina-embeddings-v5-text-small",
"task": "retrieval.query",
"dimensions": 1024,
"input": ["What is knowledge distillation?"]
}'
Obtén una clave de API en jina.ai/embeddings.
tagHugging Face + sentence-transformers
Ejecuta localmente con control total sobre la inferencia. Los pesos están disponibles en Hugging Face con integración inmediata de sentence-transformers.
from sentence_transformers import SentenceTransformer
import torch
model = SentenceTransformer(
"jinaai/jina-embeddings-v5-text-small-retrieval",
model_kwargs={"dtype": torch.bfloat16},
)
query_emb = model.encode("What is knowledge distillation?", prompt_name="query")
doc_embs = model.encode(["Knowledge distillation transfers...", "Venus is..."], prompt_name="document")
similarity = model.similarity(query_emb, doc_embs)
tagvLLM
Servicio de alto rendimiento para cargas de trabajo en producción. vLLM es compatible de forma nativa con v5-text mediante pooling del último token (last-token pooling).
from vllm import LLM
from vllm.config.pooler import PoolerConfig
model = LLM(
model="jinaai/jina-embeddings-v5-text-small-retrieval",
dtype="float16",
runner="pooling",
pooler_config=PoolerConfig(seq_pooling_type="LAST", normalize=True),
)
outputs = model.encode(["Query: climate change impacts"], pooling_task="embed")
Para una inferencia local optimizada a través de llama.cpp y MLX, los pesos LoRA de cada adaptador de tarea se fusionan en el modelo base para producir archivos de pesos independientes. Es por esto que verás repositorios separados por tarea (recuperación, coincidencia de texto, clasificación, agrupación): cada uno contiene los pesos fusionados completos listos para cargar directamente, sin sobrecarga de LoRA durante la inferencia.
tagllama.cpp (GGUF)
Ejecuta modelos cuantizados en CPU o dispositivos de borde (edge). Proporcionamos 14 variantes de cuantización GGUF para cada modelo, desde F16 hasta IQ1_S.
llama-server -hf jinaai/jina-embeddings-v5-text-small-retrieval-GGUF:Q4_K_M \
--embedding --pooling last -ub 32768
tagMLX
Inferencia nativa para Apple Silicon mediante MLX. Disponible en precisión completa, y cuantización de 4 bits y 8 bits para todos los adaptadores de tareas.
import mlx.core as mx
from tokenizers import Tokenizer
from model import JinaEmbeddingModel
import json
with open("config.json") as f:
config = json.load(f)
model = JinaEmbeddingModel(config)
weights = mx.load("model-4bit.safetensors") # o model.safetensors, model-8bit.safetensors
model.load_weights(list(weights.items()))
tokenizer = Tokenizer.from_file("tokenizer.json")
texts = ["Query: What is machine learning?"]
embeddings = model.encode(texts, tokenizer)
Descárgalo desde Hugging Face: jinaai/jina-embeddings-v5-text-small-retrieval-mlx (también disponible para adaptadores de coincidencia de texto, clasificación y agrupación).
tagEntrenamiento
Ambos modelos han sido destilados a partir de Qwen3-Embedding-4B, un modelo de vectores (vector model) entrenado mucho más grande. La variante pequeña utiliza Qwen3-0.6B-Base como columna vertebral, mientras que la versión nano utiliza EuroBERT-210m. Nuestro entrenamiento combina dos señales complementarias:
- Destilación de vectores (embeddings) desde el profesor de 4B mediante una pérdida de similitud de coseno. El estudiante aprende a aproximar el espacio vectorial del profesor sin necesidad de usar 提示词 (prompts) tipo instrucción. Esto es especialmente efectivo para idiomas y tareas donde los datos etiquetados son escasos.
- Pérdida contrastiva específica de tarea (
InfoNCE) en pares de consulta-documento etiquetados con minería de negativos difíciles (hard negative mining) y negativos dentro del lote. Tras congelar la columna vertebral destilada, entrenamos adaptadores LoRA separados para cada categoría de tarea.
Nuestros estudios de ablación muestran que este enfoque combinado supera sistemáticamente a cualquiera de los métodos por separado. En recuperación en inglés MTEB, el método combinado logra 60.1 nDCG@10 frente a 58.6 para la destilación sola y 54.3 para el método contrastivo solo sobre la misma base.
También aplicamos GOR (Regularización Ortogonal Generalizada) durante el entrenamiento, lo que fomenta que los componentes de los vectores se distribuyan de manera más uniforme. Esto no mejora drásticamente las puntuaciones en los benchmarks estándar, pero hace que la cuantización binaria sea casi sin pérdidas, una propiedad crítica para despliegues con restricciones de memoria.
Algunas observaciones del entrenamiento dignas de mención:
- La destilación y el aprendizaje contrastivo son complementarios de maneras que no esperábamos inicialmente.
- Eliminar cualquier componente individual de nuestra mezcla de pérdidas degrada el rendimiento de forma generalizada.
- Los adaptadores LoRA específicos para tareas superan al entrenamiento multitarea con una sobrecarga de parámetros insignificante.
- La regularización GOR hace que la cuantización binaria sea casi sin pérdidas, lo cual es más importante para el despliegue que las ganancias marginales en precisión completa.
tagConclusión
Los modelos de vectores (embeddings) se utilizan cada vez más como componentes de cadenas de herramientas dentro de sistemas más grandes. Los agentes de LLM llaman a APIs de vectores para tareas de recuperación, memoria y clasificación como parte de flujos de trabajo agentes. Proyectos como OpenClaw y OpenViking tratan a los vectores como una capa de infraestructura central para la gestión del contexto del agente, no como endpoints de búsqueda independientes. En este régimen, el costo de inferencia y la latencia por llamada son tan importantes como las puntuaciones de los benchmarks, y los modelos compactos se convierten en la opción natural.
La tendencia hacia modelos de vectores más pequeños refleja un cambio más amplio. La recuperación en el dispositivo (on-device), la búsqueda basada en navegador y el despliegue en el borde exigen modelos que quepan en presupuestos de memoria restringidos. El soporte de dimensiones Matryoshka permite que un solo modelo sirva tanto para búsquedas de alta precisión como para búsquedas aproximadas ultrarrápidas sin necesidad de reentrenamiento. Combinado con la cuantización GGUF de hasta 1-2 bits, la huella de memoria efectiva para un servicio de vectores en producción se reduce en un orden de magnitud.
Estamos trabajando en jina-embeddings-v5-multimodal, extendiendo la misma arquitectura a la visión y a la recuperación transmodal. Los primeros resultados sugieren que es posible alinear un codificador de visión con un modelo de vectores de texto ajustado sin degradar el rendimiento del texto. Permanece atento.






