График ввода-вывода 1

Текст

jina-clip-v2

Вектор

График ввода-вывода 2

Изображение

jina-clip-v2

Вектор

Парето-фронт
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN2B-CLIP-ViT-B-16DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v2Параметры (лог)i2t-recall@5
Эта модель
На фронте
Jina AI
Другие
CLIP Benchmark
89.73
Параметры
865M
Ранг по баллу
34 / 56
Парето-фронт
Позади
Распределение значений
AUC 0.8383
Корпус
Пары переводов
Поиск по документации
Изображение / баннер
Изображение / логотип
Задача
default
retrieval.query
0.6040.000.200.400.60
Связанные20.2%
Сложный отрицательный3.6%
Несвязанные0.8%
Рекомендуемые пороги
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
сбалансированный · 0.403
AUC
0.8383
Потолок шума
0.666
Обрыв полноты
0.224
Измерено пар
119 / 11k
Компоненты вектора
-0.43-0.070.29
σ 0.0313 · 244k значений
Геометрия эмбеддингов
01024
Среднее по измерениям, наведите для диапазона
Уровень шума
0.420
Эффективных изм.
52 / 1024
Языковые пары
de-ruen-deen-koen-zhja-ko
Разброс порога между парами: 0.064
Выберите модели для сравнения
Публикации (2)

Обзор

jina-clip-v2 — мультиязычная мультимодальная эмбеддинг-модель на 865M параметров с поддержкой 89 языков и входа изображений 512×512. Она расширяет jina-clip-v1 кросс-язычным согласованием «изображение-текст», обучением представлений Matryoshka для сокращения размерности (1024→64) и улучшенными результатами на визуально насыщенных документах. Достигает передовых результатов в кросс-язычном поиске изображений, сохраняя сильные показатели в поиске только по тексту и в одно-модальном режиме.

Методы

Модель использует архитектуру с двойным энкодером, сочетающую текстовый энкодер Jina XLM-RoBERTa (561M параметров, 89 языков, контекст 696 320 токенов) и визуальный энкодер EVA02-L14 (304M параметров, вход 512×512 пикселя). Обучение использует мультизадачный многостадийный контрастивный подход: модель обучается одновременно на парах текста, тройках текста и парах «изображение-текст», поддерживая задачи как только по тексту, так и кросс-модальные. Набор данных обучения был расширен, включая мультиязычные тексты на 29 неанглийских языках (в том числе хинди, китайский, немецкий, французский) и изображения визуально насыщенных документов. Обучение представлений Matryoshka позволяет сократить размерность эмбеддингов с 1024 до 64 измерений, сохраняя более 99% качества. Модель использует Last-Token-Pooling для финального эмбеддинга.

Производительность

Модель достигает точности 98,0% в поиске «изображение в текст» на Flickr30k, превосходя и jina-clip-v1, и NLLB-CLIP-SigLIP. В мультиязычных сценариях она показывает улучшение до 4% по сравнению с NLLB-CLIP-SigLIP в кросс-язычном поиске изображений. Сжатие эмбеддингов необычайно эффективно: сокращение размерности на 75% (1024→256) всё ещё сохраняет более 99% качества во всех задачах — тексте, изображениях и кросс-модальных. На Multilingual MTEB модель достигает 69,86% в поиске и 67,77% в семантическом сходстве, показывая конкурентоспособные результаты со специализированными текстовыми эмбеддинг-моделями. Поддержка 89 языков и работа с визуально насыщенными документами делают её особенно подходящей для глобального e-commerce и управления контентом.

Руководство

Перед обработкой уменьшайте изображения до 512×512 пикселей — более крупные изображения автоматически разбиваются на тайлы, что увеличивает расход токенов и время обработки. Модель отлично сопоставляет изображения с описательным текстом на 89 языках, что делает её идеальной для глобального e-commerce поиска товаров, рекомендации контента и мультиязычного визуального поиска. Она может испытывать трудности с абстрактными концепциями или высокоспециализированным контентом. При использовании сокращения размерности Matryoshka эмбеддинги в 64 измерения сохраняют сильное качество для индексации; для re-ranking критически важных приложений используйте 512+ измерений. Модели требуется CUDA-совместимое оборудование. Для задач только по тексту jina-embeddings-v5-text-small даёт лучшее качество на параметр. Для поиска кода используйте jina-code-embeddings-1.5b. Доступна через Jina API, AWS, Azure и маркетплейсы GCP.

Блоги, в которых упоминается эта модель
июль 31, 2025 • 12 минуты чтения
Как разрешение изображения влияет на поиск визуальных документов
Разрешение изображений имеет решающее значение для создания 向量模型 визуально насыщенных документов. Слишком маленькое разрешение приводит к тому, что модели упускают ключевые детали, а слишком большое — к тому, что они не могут связать части воедино.
июль 25, 2025 • 8 минуты чтения
JinaVDR: Новый бенчмарк для визуального поиска документов с 95 задачами на 20 языках
JinaVDR — это новый бенчмарк, охватывающий 95 задач на 20 языках для визуального поиска документов, который скоро появится на MTEB.
июнь 25, 2025 • 12 минуты чтения
Jina Embeddings v4: Универсальные векторные модели (Embeddings) для мультимодального многоязыкового поиска
Jina Embeddings v4 — это универсальная модель векторного представления (Embeddings) с 3,8 миллиардами параметров для мультимодального и многоязыкового поиска, которая поддерживает вывод как одно-, так и многовекторных векторных представлений (Embeddings).
май 28, 2025 • 4 минуты чтения
Корреляции: Vibe-Testing 向量模型 (Embeddings) в GUI
Несмотря на наше серьезное отношение к MTEB, мы также любим проверять атмосферу. Correlations – это простой графический интерфейс, который мы используем для проверки цитирования в DeepSearch, отладки позднего чанкинга и проверки атмосферы 向量模型 (embeddings). Теперь он с открытым исходным кодом.
май 25, 2025 • 21 минуты чтения
Что мы узнали на ICLR2025
Мы собрали несколько наиболее интересных статей на ICLR 2025, посвященных TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba и т. д.