Elastic
Jina AI
Новости
Модели
API
keyboard_arrow_down
Читатель
Читайте URL-адреса и ищите информацию в Интернете для получения более подходящей подготовки для получения степени магистра права.
Вложения
Мультимодальные многоязычные векторные представления.
Реранкер
Инструмент переранжирования для максимизации релевантности результатов поиска.
Elastic Inference Service
Запускайте модели Jina непосредственно в Elasticsearch.
MCP terminalCLIarticlellms.txtsmart_toyАгентыdata_objectСхемаmenu_bookДокументы



Авторизоваться
login
Вложения
copyright CC BY-NC 4.0
open_in_new Выпуск Пост

jina-clip-v2

Многоязычные мультимодальные вложения для текстов и изображений
Лицензия
copyright CC-BY-NC-4.0
Дата выпуска
calendar_month
2024-11-05
Вход
image
Изображение
abc
Текст
arrow_forward
Выход
more_horiz
Вектор
Размерности Matryoshka help_outline
64
128
256
512
768
1024
Подробности модели
Параметры: 865M
Длина входного токена: 8K
Размер входного изображения: 512×512
Выходной размер: 1024
Базовая модель help_outline
open_in_new
XLM-RoBERTa Large
Обученные языки help_outline
32 языки
Поддерживаемые языки help_outline
108 языки
Похожие модели
link
jina-clip-v1
Доступно через
Elastic Inference Service
API Джина
AWS SageMaker
Microsoft Azure
Google Облако
Hugging Face
Air-gapped
График ввода-вывода 1

Текст

jina-clip-v2

Вектор

График ввода-вывода 2

Изображение

jina-clip-v2

Вектор

Распределение значенийhelp_outline
AUC 0.8383
Корпус
Пары переводов
Поиск по документации
Изображение / баннер
Изображение / логотип
Задача
default
retrieval.query
0.6040.000.200.400.60
Связанные20.2%
Сложный отрицательный3.6%
Несвязанные0.8%
Наведите курсор или щёлкните по графику, чтобы сдвинуть порог
Рекомендуемые пороги
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
сбалансированный · 0.403
AUC
0.8383
Потолок шума
0.666
Обрыв полноты
0.224
Измерено пар
119 / 11k
Компоненты вектораhelp_outline
-0.43-0.070.29
σ 0.0313 · 244k значений
Геометрия эмбеддинговhelp_outline
01024
Среднее по измерениям, наведите для диапазона
Уровень шума
0.420
Эффективных изм.
52 / 1024
Языковые парыhelp_outline
de-ruen-deen-koen-zhja-ko
Разброс порога между парами: 0.064
Выберите модели для сравнения
Публикации (2)
ICLR 2026
январь 22, 2026
Embedding Compression via Spherical Coordinates
ICLR 2025
декабрь 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

Обзор

Jina CLIP v2 производит революцию в мультимодальном ИИ, преодолевая разрыв между визуальным и текстовым пониманием на 89 языках. Эта модель решает критические проблемы в глобальной электронной коммерции, управлении контентом и межкультурной коммуникации, обеспечивая точное сопоставление изображений и текста независимо от языковых барьеров. Для компаний, расширяющихся на международном уровне или управляющих многоязычным контентом, она устраняет необходимость в отдельных моделях для каждого языка или сложных конвейерах перевода. Модель особенно хороша в сценариях, требующих точного визуального поиска через языковые границы, таких как обнаружение продуктов на глобальном рынке или многоязычное управление цифровыми активами.

Методы

В своей основе Jina CLIP v2 использует сложную архитектуру с двумя кодировщиками, которая объединяет текстовый кодировщик Jina XLM-RoBERTa (561 млн параметров) с визуальным кодировщиком EVA02-L14 (304 млн параметров). Текстовый кодировщик обрабатывает контент на 89 языках с огромным контекстным окном из 696 320 токенов, в то время как визуальный кодировщик обрабатывает изображения с высоким разрешением до 512x512 пикселей. Модель представляет инновационное обучение представлений Matryoshka, которое позволяет динамически корректировать размерность эмбеддингов с 1024 до 64 измерений, сохраняя производительность. Эта архитектура обрабатывает как текст, так и изображения через соответствующие кодировщики, проецируя их в общее семантическое пространство, где схожие концепции выравниваются независимо от их исходной модальности или языка.

Производительность

Модель достигает самой современной производительности с точностью 98,0% в задачах поиска изображений в текст Flickr30k, превосходя как своего предшественника, так и NLLB-CLIP-SigLIP. В многоязычных сценариях она демонстрирует улучшение до 4% по сравнению с NLLB-CLIP-SigLIP в кросс-языковых задачах поиска изображений, несмотря на то, что имеет меньше параметров, чем ее крупнейший конкурент. Модель сохраняет высокую производительность даже при сжатии вложений — уменьшение размеров на 75% по-прежнему сохраняет более 99% производительности в текстовых, графических и кросс-модальных задачах. В комплексных многоязычных бенчмарках MTEB она достигает 69,86% в задачах поиска и 67,77% в задачах семантического сходства, выступая на равных со специализированными моделями встраивания текста.

Руководство

Для оптимального развертывания пользователи должны учитывать несколько ключевых факторов. Для эффективной обработки модели требуется оборудование с поддержкой CUDA, а требования к памяти масштабируются на основе размера пакета и разрешения изображения. Чтобы оптимизировать затраты и производительность API, измените размер изображений до 512x512 пикселей перед обработкой — более крупные изображения автоматически разбиваются на плитки, что увеличивает использование токенов и время обработки. Модель отлично сопоставляет изображения с описательным текстом на разных языках, но может испытывать трудности с абстрактными концепциями или узкоспециализированным контентом, специфичным для домена. Она особенно эффективна для поиска товаров в электронной коммерции, систем рекомендаций контента и приложений визуального поиска, но может не подходить для задач, требующих детального визуального анализа деталей или узкоспециализированной экспертизы домена. При использовании функции представления Matryoshka рассмотрите компромисс между уменьшением размерности и производительностью — в то время как 64-мерные вложения сохраняют высокую производительность, критически важные приложения могут выиграть от более высоких размерностей.
Блоги, в которых упоминается эта модель
ноябрь 21, 2024 • 9 минуты чтения
Jina CLIP v2: Мультиязычные мультимодальные эмбеддинги для текста и изображений
Jina-CLIP v2 — мультимодальная модель эмбеддингов размером 0.9B с многоязычной поддержкой 89 языков, высоким разрешением изображений 512x512 и представлениями Matryoshka.
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
октябрь 29, 2024 • 11 минуты чтения
CLIP и не только: как Jina-CLIP развивает мультимодальный поиск
Узнайте, как Jina-CLIP улучшает модель CLIP от OpenAI, обеспечивая более высокую точность поиска и более разнообразные результаты благодаря унифицированным текстово-графическим эмбеддингам.
Bo Wang
Alex C-G
Abstract digital landscape with wave-like green and pink dunes against a dark background, conveying a tranquil atmosphere.
июнь 05, 2024 • 9 минуты чтения
Jina CLIP v1: Действительно мультимодальная модель для эмбеддингов текста и изображений
Новая мультимодальная модель эмбеддингов от Jina AI не только превосходит OpenAI CLIP в поиске изображений по тексту, она одновременно является отличной моделью для эмбеддинга изображений и передовой моделью для эмбеддинга текста. Вам больше не нужны разные модели для разных модальностей.
Sofia Vasileva
Scott Martens
Susana Guzmán
Abstract 3D render of a neon blue and green grid pattern on a black background, creating a sense of depth.
сентябрь 27, 2024 • 15 минуты чтения
Миграция с Jina Embeddings v2 на v3
Мы собрали несколько советов, которые помогут вам мигрировать с Jina Embeddings v2 на v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
август 30, 2024 • 10 минуты чтения
Jina ColBERT v2: многоязычный ретривер с поздним взаимодействием для эмбеддингов и переранжирования
Jina ColBERT v2 поддерживает 89 языков с улучшенной производительностью поиска, настраиваемой размерностью выходных данных и длиной токена 8192.
Jina AI
Dark-themed coding interface displaying English and Japanese characters with "JINA COLBERT V2" highlighted in the center.
Search Foundation
Читатель
Вложения
Реранкер
Elastic Inference Service
open_in_new
Получить API-ключ Jina
Ограничение скорости
Статус API
Условия
Безопасность
Условия использования
Конфиденциальность
Управление файлами cookie
Не продавайте и не передавайте мою личную информацию третьим лицам.
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Elastic © 2020-2026.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.