Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Lector
Lea las URL y busque en la web para obtener una base más sólida para su LLM.
Incrustaciones
Incrustaciones multimodales y multilingües.
reclasificador
Reclasificador para maximizar la relevancia de los resultados de búsqueda.
Elastic Inference Service
Ejecuta modelos Jina de forma nativa dentro de Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
Arquitectura
Primeros pasos
Entrenamiento
Conclusión
star
Presentado
presione soltar
febrero 19, 2026

jina-embeddings-v5-text: Nuevos Embeddings Multilingües Pequeños SOTA

Dos modelos de embeddings multilingües de menos de 1B de parámetros con un rendimiento líder en su clase, disponibles en Elastic Inference Service, Llama.cpp y MLX.
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Han Xiao
Han Xiao • 7 minutos de lectura
jina-embeddings-v5-text: Destilación de 向量模型 orientada a tareas
Los modelos de 向量模型 de texto se utilizan ampliamente para tareas de similitud semántica, incluidas la recuperación de información, la agrupación (clustering) y la clasificación. Los modelos de propósito general suelen entrenarse mediante procesos de una o varias etapas utilizando funciones de pérdida contrastiva. Presentamos un régimen de entrenamiento novedoso que combina técnicas de destilación de modelos con una función de pérdida contrastiva específica para tareas, con el fin de producir modelos de 向量模型 compactos y de alto rendimiento. Nuestros hallazgos sugieren que este enfoque es más eficaz para entrenar SLM que los paradigmas de entrenamiento puramente contrastivos o basados en destilación por sí solos. Las puntuaciones de evaluación comparativa de los modelos resultantes, jina-embeddings-v5-text-small y jina-embeddings-v5-text-nano, superan o igualan el estado del arte para modelos de tamaño similar. Además, los modelos jina-embeddings-v5-text admiten textos largos (hasta 32K 词元 para la versión small, 8K para la nano) en muchos idiomas y generan 向量模型 que permanecen robustos bajo truncamiento y cuantización binaria. Los pesos del modelo están disponibles públicamente, con la esperanza de inspirar nuevos avances en el desarrollo de modelos de 向量模型.
arXiv.orgMohammad Kalim Akram
jina-embeddings-v5-text - una colección de jinaai
Nuestros 向量模型 de 5.ª generación: dos modelos multilingües ligeros con rendimiento SOTA en recuperación, emparejamiento, agrupación y clasificación.
una colección de jinaai

Lanzamos jina-embeddings-v5-text, la quinta generación de nuestra familia de modelos de 向量模型, que impulsa la frontera de calidad-eficiencia para 向量模型 multilingües de menos de 1B de parámetros:

  • jina-embeddings-v5-text-small (677M de parámetros): 67.0 en MMTEB, 71.7 en MTEB English
  • jina-embeddings-v5-text-nano (239M de parámetros): 65.5 en MMTEB, 71.0 en MTEB English

El modelo small admite un contexto de 32K 词元 (8K para nano), 4 adaptadores LoRA específicos para tareas (recuperación, emparejamiento de texto, clasificación, agrupación) y truncamiento de dimensión de Matryoshka de 1024 a 32. Con 239M de parámetros, el modelo nano iguala la calidad de recuperación de modelos con el doble de parámetros.

En comparación con nuestras generaciones anteriores: v5-text-small iguala a jina-embeddings-v4 (3.8B) en recuperación siendo 5.6 veces más pequeño, y supera a jina-embeddings-v3 (572M) en todas las tareas con un número de parámetros similar.

Característicav5-text-smallv5-text-nano
Modelo baseQwen3-0.6B-BaseEuroBERT-210m
Parámetros677M239M
Dimensiones de 向量模型1024768
Longitud de contexto32,7688,192
Idiomas119 (詞元化器 Qwen3)15+ (詞元化器 EuroBERT)
PoolingLast-tokenLast-token
Adaptadores LoRA4 (recuperación, emparejamiento de texto, clasificación, agrupación)
Dimensiones Matryoshka32-102432-768
Puntuación MMTEB67.065.5
MTEB English71.771.0
LicenciaCC BY-NC 4.0
MMTEB Multilingual Benchmark
v5-text-small alcanza 67.0 en MMTEB (promediado entre 131 tareas en 9 tipos de tarea), superando al siguiente mejor modelo sub-1B (Qwen3-0.6B con instrucciones a 64.3) por +2.7 puntos. El modelo nano con 239M de parámetros obtiene 65.5, superando a modelos con el doble de parámetros.
MTEB English Benchmark
En la evaluación solo en inglés, v5-text-small lidera todos los modelos multilingües sub-1B con 71.7 (promediado entre 41 tareas en 7 tipos de tarea), seguido de cerca por KaLM-mini-v2.5 (71.3) y v5-text-nano (71.0). El modelo nano de 239M logra la paridad con el KaLM de 494M teniendo menos de la mitad de su tamaño.
Retrieval Benchmark Results
v5-text-small alcanza el promedio a nivel de tarea más alto (63.28) entre cinco evaluaciones comparativas de recuperación (MTEB Multilingual, MTEB English, RTEB, BEIR y LongEmbed) entre los modelos sub-4B, igualando a jina-embeddings-v4 (3.8B, 63.62) mientras es 5.6 veces más pequeño.
Table showing multilingual MTEB model performance metrics, rankings, and evaluations across various tasks and language benchm
Según el MTEB Leaderboard el 21/02/2026, jina-embeddings-v5-small (0.6B params, rango #8) es el modelo de 向量模型 más fuerte por debajo de 1B de parámetros en MTEB Multilingual v2, superando a Qwen3-Embedding-0.6b en todas las métricas. jina-embeddings-v5-nano (0.2B params, rango #11) ofrece un rendimiento de top-11 con una fracción del tamaño; ningún otro modelo en esta clase de parámetros se le acerca.

tagArquitectura

<code>jina-embeddings-v5-text</code> Architecture

v5-text utiliza backbones de solo decodificador (decoder-only) con pooling del último 词元 (last-token pooling) en lugar de pooling medio. Se inyectan cuatro adaptadores LoRA ligeros en cada capa del transformador, manejando la recuperación, el emparejamiento de texto, la clasificación y la agrupación de forma independiente. Los usuarios seleccionan el adaptador adecuado en el momento de la inferencia. Para la recuperación, las consultas reciben un prefijo "Query:" y los documentos reciben "Document:". La longitud de contexto es de 32K 词元 para la versión small (8K para la nano), un aumento de 4x respecto a v3.

tagPrimeros pasos

tagServicio de inferencia elástica (Elastic Inference Service)

La forma más rápida de usar v5-text en producción. Elastic Inference Service (EIS) proporciona inferencia de 向量模型 gestionada con escalado integrado, por lo que puede generar 向量模型 directamente dentro de su despliegue de Elastic sin gestionar infraestructura.

PUT _inference/text_embedding/jina-v5
{
  "service": "elastic",
  "service_settings": {
    "model_id": "jina-embeddings-v5-text-small"
  }
}

Consulte la documentación de EIS para obtener detalles sobre la configuración.

tagJina Embedding API

Nuestra API alojada con precios de pago por 词元. Admite selección de tareas, truncamiento de dimensiones y procesamiento por lotes desde el primer momento. No requiere GPU.

curl https://api.jina.ai/v1/embeddings \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -d '{
    "model": "jina-embeddings-v5-text-small",
    "task": "retrieval.query",
    "dimensions": 1024,
    "input": ["What is knowledge distillation?"]
  }'

Obtén una clave de API en jina.ai/embeddings.

tagHugging Face + sentence-transformers

Ejecuta localmente con control total sobre la inferencia. Los pesos están disponibles en Hugging Face con integración inmediata de sentence-transformers.

from sentence_transformers import SentenceTransformer
import torch

model = SentenceTransformer(
    "jinaai/jina-embeddings-v5-text-small-retrieval",
    model_kwargs={"dtype": torch.bfloat16},
)

query_emb = model.encode("What is knowledge distillation?", prompt_name="query")
doc_embs = model.encode(["Knowledge distillation transfers...", "Venus is..."], prompt_name="document")
similarity = model.similarity(query_emb, doc_embs)

tagvLLM

Servicio de alto rendimiento para cargas de trabajo en producción. vLLM es compatible de forma nativa con v5-text mediante pooling del último token (last-token pooling).

from vllm import LLM
from vllm.config.pooler import PoolerConfig

model = LLM(
    model="jinaai/jina-embeddings-v5-text-small-retrieval",
    dtype="float16",
    runner="pooling",
    pooler_config=PoolerConfig(seq_pooling_type="LAST", normalize=True),
)
outputs = model.encode(["Query: climate change impacts"], pooling_task="embed")

Para una inferencia local optimizada a través de llama.cpp y MLX, los pesos LoRA de cada adaptador de tarea se fusionan en el modelo base para producir archivos de pesos independientes. Es por esto que verás repositorios separados por tarea (recuperación, coincidencia de texto, clasificación, agrupación): cada uno contiene los pesos fusionados completos listos para cargar directamente, sin sobrecarga de LoRA durante la inferencia.

tagllama.cpp (GGUF)

Ejecuta modelos cuantizados en CPU o dispositivos de borde (edge). Proporcionamos 14 variantes de cuantización GGUF para cada modelo, desde F16 hasta IQ1_S.

llama-server -hf jinaai/jina-embeddings-v5-text-small-retrieval-GGUF:Q4_K_M \
  --embedding --pooling last -ub 32768

tagMLX

Inferencia nativa para Apple Silicon mediante MLX. Disponible en precisión completa, y cuantización de 4 bits y 8 bits para todos los adaptadores de tareas.

import mlx.core as mx
from tokenizers import Tokenizer
from model import JinaEmbeddingModel
import json

with open("config.json") as f:
    config = json.load(f)

model = JinaEmbeddingModel(config)
weights = mx.load("model-4bit.safetensors")  # o model.safetensors, model-8bit.safetensors
model.load_weights(list(weights.items()))

tokenizer = Tokenizer.from_file("tokenizer.json")
texts = ["Query: What is machine learning?"]
embeddings = model.encode(texts, tokenizer)

Descárgalo desde Hugging Face: jinaai/jina-embeddings-v5-text-small-retrieval-mlx (también disponible para adaptadores de coincidencia de texto, clasificación y agrupación).

tagEntrenamiento

Ambos modelos han sido destilados a partir de Qwen3-Embedding-4B, un modelo de vectores (vector model) entrenado mucho más grande. La variante pequeña utiliza Qwen3-0.6B-Base como columna vertebral, mientras que la versión nano utiliza EuroBERT-210m. Nuestro entrenamiento combina dos señales complementarias:

  1. Destilación de vectores (embeddings) desde el profesor de 4B mediante una pérdida de similitud de coseno. El estudiante aprende a aproximar el espacio vectorial del profesor sin necesidad de usar 提示词 (prompts) tipo instrucción. Esto es especialmente efectivo para idiomas y tareas donde los datos etiquetados son escasos.
  2. Pérdida contrastiva específica de tarea (InfoNCE) en pares de consulta-documento etiquetados con minería de negativos difíciles (hard negative mining) y negativos dentro del lote. Tras congelar la columna vertebral destilada, entrenamos adaptadores LoRA separados para cada categoría de tarea.

Nuestros estudios de ablación muestran que este enfoque combinado supera sistemáticamente a cualquiera de los métodos por separado. En recuperación en inglés MTEB, el método combinado logra 60.1 nDCG@10 frente a 58.6 para la destilación sola y 54.3 para el método contrastivo solo sobre la misma base.

También aplicamos GOR (Regularización Ortogonal Generalizada) durante el entrenamiento, lo que fomenta que los componentes de los vectores se distribuyan de manera más uniforme. Esto no mejora drásticamente las puntuaciones en los benchmarks estándar, pero hace que la cuantización binaria sea casi sin pérdidas, una propiedad crítica para despliegues con restricciones de memoria.

Algunas observaciones del entrenamiento dignas de mención:

  • La destilación y el aprendizaje contrastivo son complementarios de maneras que no esperábamos inicialmente.
  • Eliminar cualquier componente individual de nuestra mezcla de pérdidas degrada el rendimiento de forma generalizada.
  • Los adaptadores LoRA específicos para tareas superan al entrenamiento multitarea con una sobrecarga de parámetros insignificante.
  • La regularización GOR hace que la cuantización binaria sea casi sin pérdidas, lo cual es más importante para el despliegue que las ganancias marginales en precisión completa.

tagConclusión

Los modelos de vectores (embeddings) se utilizan cada vez más como componentes de cadenas de herramientas dentro de sistemas más grandes. Los agentes de LLM llaman a APIs de vectores para tareas de recuperación, memoria y clasificación como parte de flujos de trabajo agentes. Proyectos como OpenClaw y OpenViking tratan a los vectores como una capa de infraestructura central para la gestión del contexto del agente, no como endpoints de búsqueda independientes. En este régimen, el costo de inferencia y la latencia por llamada son tan importantes como las puntuaciones de los benchmarks, y los modelos compactos se convierten en la opción natural.

La tendencia hacia modelos de vectores más pequeños refleja un cambio más amplio. La recuperación en el dispositivo (on-device), la búsqueda basada en navegador y el despliegue en el borde exigen modelos que quepan en presupuestos de memoria restringidos. El soporte de dimensiones Matryoshka permite que un solo modelo sirva tanto para búsquedas de alta precisión como para búsquedas aproximadas ultrarrápidas sin necesidad de reentrenamiento. Combinado con la cuantización GGUF de hasta 1-2 bits, la huella de memoria efectiva para un servicio de vectores en producción se reduce en un orden de magnitud.

Estamos trabajando en jina-embeddings-v5-multimodal, extendiendo la misma arquitectura a la visión y a la recuperación transmodal. Los primeros resultados sugieren que es posible alinear un codificador de visión con un modelo de vectores de texto ajustado sin degradar el rendimiento del texto. Permanece atento.

Categorías:
star
Presentado
presione soltar
rss_feed

Leer más
agosto 03, 2026 • 11 minutos de lectura
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
mayo 12, 2026 • 7 minutos de lectura
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
diciembre 04, 2025 • 7 minutos de lectura
Jina-VLM: Small Multilingual Vision Language Model
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Idioma / tema actual
Search Foundation
Lector
Incrustaciones
reclasificador
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y todo su contenido, software, productos y servicios asociados están destinados exclusivamente al uso profesional. No se permite ni se recomienda su uso por parte de consumidores.