Elastic
Jina AI
Модели
API
keyboard_arrow_down
Reader
Конвертируйте любой URL в Markdown для лучшей привязки LLM к источникам.
Эмбеддинги
Мультимодальные многоязычные векторные представления.
Реранкер
Инструмент реранжирования для максимизации релевантности результатов поиска.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документы
Авторизоваться
login
warning
Эта модель устарела из-за появления новых моделей.
Эмбеддинги
Лицензия Apache 2.0
open_in_new Выпуск Пост

jina-clip-v1

Мультимодальные модели эмбеддинга для изображений и английского текста
Лицензия
Apache-2.0
Дата выпуска
calendar_month
2024-06-05
Вход
image
Изображение
abc
Текст
arrow_forward
Выход
more_horiz
Вектор
Подробности модели
Параметры: 223M
Длина входного токена: 8K
Размер входного изображения: 224×224
Выходной размер: 768
Базовая модель help_outline
open_in_new
EVA02-B-16
link
jina-embeddings-v2-base-en
Обученные языки help_outline
1 языки
Похожие модели
link
jina-clip-v2
link
jina-embeddings-v3
link
jina-colbert-v2
Доступно через
API Jina AI
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
График ввода-вывода 1

Текст

jina-clip-v1

Вектор

График ввода-вывода 2

Изображение

jina-clip-v1

Вектор

Парето-фронтhelp_outline
MTEB English
ViDoRe v1
MIEB
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
chevron_leftchevron_right
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14jina-clip-v2MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v1Параметры (лог)i2t-recall@5
Эта модель
На фронте
Jina AI
Другие
CLIP Benchmark
87.65
Параметры
223M
Ранг по баллу
44 / 56
Парето-фронт
Позади
Распределение значенийhelp_outline
AUC 0.8440
Корпус
Пары переводов
Поиск по документации
Изображение / баннер
0.6750.000.200.400.600.80
Связанные20.2%
Сложный отрицательный3.2%
Несвязанные1.2%
Рекомендуемые пороги
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
сбалансированный · 0.376
AUC
0.8440
Потолок шума
0.779
Обрыв полноты
0.123
Измерено пар
119 / 11k
Компоненты вектораhelp_outline
-0.18-0.010.15
σ 0.0361 · 183k значений
Геометрия эмбеддинговhelp_outline
0768
Среднее по измерениям, наведите для диапазона
Уровень шума
0.283
Эффективных изм.
55 / 768
Выберите модели для сравнения
Публикации (1)
ICML 2024
май 30, 2024
Jina CLIP: Your CLIP Model Is Also Your Text Retriever

Обзор

Jina CLIP v1 производит революцию в мультимодальном ИИ, став первой моделью, которая одинаково хорошо справляется как с задачами поиска текста в текст, так и с задачами поиска текста в изображение. В отличие от традиционных моделей CLIP, которые испытывают трудности с текстовыми сценариями, эта модель достигает высочайшей производительности во всех комбинациях поиска, сохраняя при этом удивительно компактный размер параметра 223M. Модель решает важнейшую отраслевую задачу, устраняя необходимость в отдельных моделях для обработки текста и изображений, снижая сложность системы и вычислительные издержки. Для команд, создающих поисковые системы, рекомендательные системы или инструменты анализа контента, Jina CLIP v1 предлагает единое эффективное решение, которое обрабатывает как текст, так и визуальный контент с исключительной точностью.

Методы

Архитектура модели представляет собой значительное новшество в дизайне мультимодального ИИ, объединяя адаптированный текстовый кодер Jina BERT v2 с передовым кодером изображений EVA-02 из Пекинской академии искусственного интеллекта. Текстовый кодер поддерживает последовательности до 12 288 токенов — более чем в 100 раз длиннее, чем предел в 77 токенов оригинального CLIP — в то время как кодер изображений эффективно обрабатывает 16 токенов патчей. Процесс обучения следует новому трехэтапному подходу: во-первых, выравнивание пар изображение-подпись с сохранением понимания текста посредством чередующегося обучения пар текста; во-вторых, включение более длинных текстовых описаний изображений, сгенерированных ИИ; и, наконец, использование жестких отрицательных текстовых триплетов для улучшения возможностей семантического различия. Эта уникальная методология обучения позволяет модели поддерживать высокую производительность как для коротких подписей, так и для подробных текстовых описаний с сохранением сильного визуального понимания.

Производительность

Jina CLIP v1 демонстрирует значительные улучшения по сравнению с оригинальным CLIP от OpenAI во всех тестах. В текстовом поиске он достигает 165% прироста производительности с результатом 0,429 по сравнению с 0,162 у CLIP. Для задач, связанных с изображениями, он показывает последовательные улучшения: на 2% лучше в поиске изображений по тексту (0,899), на 6% в поиске текста по изображению (0,803) и на 12% в поиске изображений по изображению (0,916). Модель особенно хороша в задачах zero-shot визуальной классификации, успешно классифицируя изображения без предварительного обучения в конкретных доменах. При оценке по стандартным бенчмаркам, таким как MTEB для текстового поиска, CIFAR-100 для задач с изображениями, а также Flickr8k/30k и MSCOCO Captions для кросс-модальной производительности, он неизменно превосходит специализированные одномодальные модели, сохраняя при этом конкурентоспособную производительность в кросс-модальных задачах.

Руководство

Для эффективного развертывания Jina CLIP v1 команды должны учитывать как ее возможности, так и требования к ресурсам. Модель обрабатывает изображения в плитках размером 224x224 пикселя, при этом каждая плитка потребляет 1000 токенов вычислительной мощности. Для оптимальной производительности реализуйте эффективную предварительную обработку изображений для соответствия этим размерам. Хотя модель отлично справляется как с обработкой коротких, так и длинных текстов, в настоящее время она поддерживает только ввод на английском языке. Командам следует тщательно продумать использование токенов: текст требует приблизительно 1,1 токена на слово, тогда как изображения обрабатываются плитками (например, изображение размером 750x500 пикселей требует 12 плиток, потребляя 12 000 токенов). Модель доступна как через Jina Embeddings API, так и в виде релиза с открытым исходным кодом на Hugging Face по лицензии Apache 2.0, что обеспечивает гибкость в вариантах развертывания. Для производственных сред рассмотрите возможность использования вариантов развертывания AWS Marketplace или Azure, которые обеспечивают оптимизированные настройки инфраструктуры.
Блоги, в которых упоминается эта модель
июнь 25, 2025 • 12 минуты чтения
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
апрель 08, 2025 • 21 минуты чтения
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
декабрь 12, 2024 • 12 минуты чтения
Scaling Test-Time Compute For Embedding Models
Better results scale with compute—more on learning, more on search. A good pretrained model takes you far, but test-time compute takes you further. It's time to recognize this paradigm of test-time compute, even for embedding models.
Han Xiao
David Hockney artwork of a hand holding a rod with three colored spheres on a blue-toned background.
декабрь 04, 2024 • 13 минуты чтения
Still Need Chunking When Long-Context Models Can Do It All?
Comparing how long-context embedding models perform with different chunking strategies to find the optimal approach for your needs.
Michael Günther
Alex C-G
Artistic pixel art of two seagulls on colored pipes with speech bubbles; one reads "Too long?" and the other shows math equat
ноябрь 21, 2024 • 9 минуты чтения
Jina CLIP v2: Multilingual Multimodal Embeddings for Text and Images
Jina-CLIP v2, a 0.9B multimodal embedding model with multilingual support of 89 languages, high image resolution at 512x512, and Matryoshka representations.
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
Текущий язык / тема
Search Foundation
Reader
Эмбеддинги
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.