Elastic
Jina AI
Модели
API
keyboard_arrow_down
Reader
Конвертируйте любой URL в Markdown для лучшей привязки LLM к источникам.
Эмбеддинги
Мультимодальные многоязычные векторные представления.
Реранкер
Реранкер для максимизации релевантности результатов поиска.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документация
Авторизоваться
login
Эмбеддинги
copyright CC BY-NC 4.0
open_in_new Пост о релизе

jina-clip-v2

Многоязычные мультимодальные эмбеддинги для текстов и изображений
Лицензия
copyright CC-BY-NC-4.0
Дата выпуска
calendar_month
2024-11-05
Вход
image
Изображение
abc
Текст
arrow_forward
Выход
more_horiz
Вектор
Размерности Matryoshka help_outline
64
128
256
512
768
1024
Подробности модели
Параметры: 865M
Длина входного токена: 8K
Размер входного изображения: 512×512
Выходной размер: 1024
Базовая модель help_outline
open_in_new
EVA02-L-14
link
jina-embeddings-v3
Обученные языки help_outline
32 языки
Поддерживаемые языки help_outline
108 языки
Похожие модели
link
jina-clip-v1
Доступно через
Elastic Inference Service
API Jina AI
AWS SageMaker
Microsoft Azure
Google Облако
Hugging Face
Air-gapped
График ввода-вывода 1

Текст

jina-clip-v2

Вектор

График ввода-вывода 2

Изображение

jina-clip-v2

Вектор

Парето-фронтhelp_outline
ViDoRe v1
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN2B-CLIP-ViT-B-16DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v2Параметры (лог)i2t-recall@5
Эта модель
На фронте
Jina AI
Другие
CLIP Benchmark
89.73
Параметры
865M
Ранг по баллу
34 / 56
Парето-фронт
Позади
Распределение значенийhelp_outline
AUC 0.8383
Корпус
Пары переводов
Поиск по документации
Изображение / баннер
Изображение / логотип
Задача
default
retrieval.query
0.6040.000.200.400.60
Связанные20.2%
Сложный отрицательный3.6%
Несвязанные0.8%
Рекомендуемые пороги
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
сбалансированный · 0.403
AUC
0.8383
Потолок шума
0.666
Обрыв полноты
0.224
Измерено пар
119 / 11k
Компоненты вектораhelp_outline
-0.43-0.070.29
σ 0.0313 · 244k значений
Геометрия эмбеддинговhelp_outline
01024
Среднее по измерениям, наведите для диапазона
Уровень шума
0.420
Эффективных изм.
52 / 1024
Языковые парыhelp_outline
de-ruen-deen-koen-zhja-ko
Разброс порога между парами: 0.064
Выберите модели для сравнения
Публикации (2)
ICLR 2026
январь 22, 2026
Embedding Compression via Spherical Coordinates
ICLR 2025
декабрь 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

Обзор

jina-clip-v2 — мультиязычная мультимодальная эмбеддинг-модель на 865M параметров с поддержкой 89 языков и входа изображений 512×512. Она расширяет jina-clip-v1 кросс-язычным согласованием «изображение-текст», обучением представлений Matryoshka для сокращения размерности (1024→64) и улучшенными результатами на визуально насыщенных документах. Достигает передовых результатов в кросс-язычном поиске изображений, сохраняя сильные показатели в поиске только по тексту и в одно-модальном режиме.

Методы

Модель использует архитектуру с двойным энкодером, сочетающую текстовый энкодер Jina XLM-RoBERTa (561M параметров, 89 языков, контекст 696 320 токенов) и визуальный энкодер EVA02-L14 (304M параметров, вход 512×512 пикселя). Обучение использует мультизадачный многостадийный контрастивный подход: модель обучается одновременно на парах текста, тройках текста и парах «изображение-текст», поддерживая задачи как только по тексту, так и кросс-модальные. Набор данных обучения был расширен, включая мультиязычные тексты на 29 неанглийских языках (в том числе хинди, китайский, немецкий, французский) и изображения визуально насыщенных документов. Обучение представлений Matryoshka позволяет сократить размерность эмбеддингов с 1024 до 64 измерений, сохраняя более 99% качества. Модель использует Last-Token-Pooling для финального эмбеддинга.

Производительность

Модель достигает точности 98,0% в поиске «изображение в текст» на Flickr30k, превосходя и jina-clip-v1, и NLLB-CLIP-SigLIP. В мультиязычных сценариях она показывает улучшение до 4% по сравнению с NLLB-CLIP-SigLIP в кросс-язычном поиске изображений. Сжатие эмбеддингов необычайно эффективно: сокращение размерности на 75% (1024→256) всё ещё сохраняет более 99% качества во всех задачах — тексте, изображениях и кросс-модальных. На Multilingual MTEB модель достигает 69,86% в поиске и 67,77% в семантическом сходстве, показывая конкурентоспособные результаты со специализированными текстовыми эмбеддинг-моделями. Поддержка 89 языков и работа с визуально насыщенными документами делают её особенно подходящей для глобального e-commerce и управления контентом.

Руководство

Перед обработкой уменьшайте изображения до 512×512 пикселей — более крупные изображения автоматически разбиваются на тайлы, что увеличивает расход токенов и время обработки. Модель отлично сопоставляет изображения с описательным текстом на 89 языках, что делает её идеальной для глобального e-commerce поиска товаров, рекомендации контента и мультиязычного визуального поиска. Она может испытывать трудности с абстрактными концепциями или высокоспециализированным контентом. При использовании сокращения размерности Matryoshka эмбеддинги в 64 измерения сохраняют сильное качество для индексации; для re-ranking критически важных приложений используйте 512+ измерений. Модели требуется CUDA-совместимое оборудование. Для задач только по тексту jina-embeddings-v5-text-small даёт лучшее качество на параметр. Для поиска кода используйте jina-code-embeddings-1.5b. Доступна через Jina API, AWS, Azure и маркетплейсы GCP.

Блоги, в которых упоминается эта модель
июль 31, 2025 • 12 минуты чтения
How Image Resolution Impacts Visual Document Retrieval
Image resolution is crucial for embedding visually rich documents. Too small and models miss key details; too large and they can't connect the parts.
Maximilian Werk
Michael Günther
Scott Martens
Abstract composition with a dark background featuring a flower-like design, radiant eye-like feature, rainbow-colored curved
июль 25, 2025 • 8 минуты чтения
JinaVDR: New Visual Document Retrieval Benchmark with 95 Tasks in 20 Languages
JinaVDR is a new benchmark spanning 95 tasks across 20 languages for visual document retrieval, soon on MTEB.
Maximilian Werk
Alex C-G
Black-and-white design for "Jinavor Benchmark" with bold text. Below, "Visual Docs: 95 Tasks: 20 Languages" appears; an abstr
июнь 25, 2025 • 12 минуты чтения
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
май 28, 2025 • 4 минуты чтения
Correlations: Vibe-Testing Embeddings in GUI
As serious as we are about MTEB, we also love vibe-testing. Correlations is a simple GUI we use for validating citations in DeepSearch, debugging late chunking, and vibe-testing embeddings. Now it's open-source.
Jina AI
Technical screen showing green and yellow visual data, including charts in the lower half and a heat-map-like visualization a
май 25, 2025 • 21 минуты чтения
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
Текущий язык / тема
Search Foundation
Reader
Эмбеддинги
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.