График ввода-вывода 1
График ввода-вывода 2
Парето-фронтhelp_outline
chevron_leftchevron_right
Эта модель
На фронте
Jina AI
Другие
CLIP Benchmark
87.65
Параметры
223M
Ранг по баллу
44 / 56
Парето-фронт
Позади
Распределение значенийhelp_outlineAUC 0.8440
Корпус
Пары переводов
Поиск по документации
Изображение / баннер
Связанные20.2%
Сложный отрицательный3.2%
Несвязанные1.2%
Рекомендуемые пороги
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
сбалансированный · 0.376
AUC
0.8440
Потолок шума
0.779
Обрыв полноты
0.123
Измерено пар
119 / 11k
Компоненты вектораhelp_outline
σ 0.0361 · 183k значений
Геометрия эмбеддинговhelp_outline
Среднее по измерениям, наведите для диапазона
Уровень шума
0.283
Эффективных изм.
55 / 768
Выберите модели для сравнения
Публикации (1)
Обзор
Jina CLIP v1 производит революцию в мультимодальном ИИ, став первой моделью, которая одинаково хорошо справляется как с задачами поиска текста в текст, так и с задачами поиска текста в изображение. В отличие от традиционных моделей CLIP, которые испытывают трудности с текстовыми сценариями, эта модель достигает высочайшей производительности во всех комбинациях поиска, сохраняя при этом удивительно компактный размер параметра 223M. Модель решает важнейшую отраслевую задачу, устраняя необходимость в отдельных моделях для обработки текста и изображений, снижая сложность системы и вычислительные издержки. Для команд, создающих поисковые системы, рекомендательные системы или инструменты анализа контента, Jina CLIP v1 предлагает единое эффективное решение, которое обрабатывает как текст, так и визуальный контент с исключительной точностью.
Методы
Архитектура модели представляет собой значительное новшество в дизайне мультимодального ИИ, объединяя адаптированный текстовый кодер Jina BERT v2 с передовым кодером изображений EVA-02 из Пекинской академии искусственного интеллекта. Текстовый кодер поддерживает последовательности до 12 288 токенов — более чем в 100 раз длиннее, чем предел в 77 токенов оригинального CLIP — в то время как кодер изображений эффективно обрабатывает 16 токенов патчей. Процесс обучения следует новому трехэтапному подходу: во-первых, выравнивание пар изображение-подпись с сохранением понимания текста посредством чередующегося обучения пар текста; во-вторых, включение более длинных текстовых описаний изображений, сгенерированных ИИ; и, наконец, использование жестких отрицательных текстовых триплетов для улучшения возможностей семантического различия. Эта уникальная методология обучения позволяет модели поддерживать высокую производительность как для коротких подписей, так и для подробных текстовых описаний с сохранением сильного визуального понимания.
Производительность
Jina CLIP v1 демонстрирует значительные улучшения по сравнению с оригинальным CLIP от OpenAI во всех тестах. В текстовом поиске он достигает 165% прироста производительности с результатом 0,429 по сравнению с 0,162 у CLIP. Для задач, связанных с изображениями, он показывает последовательные улучшения: на 2% лучше в поиске изображений по тексту (0,899), на 6% в поиске текста по изображению (0,803) и на 12% в поиске изображений по изображению (0,916). Модель особенно хороша в задачах zero-shot визуальной классификации, успешно классифицируя изображения без предварительного обучения в конкретных доменах. При оценке по стандартным бенчмаркам, таким как MTEB для текстового поиска, CIFAR-100 для задач с изображениями, а также Flickr8k/30k и MSCOCO Captions для кросс-модальной производительности, он неизменно превосходит специализированные одномодальные модели, сохраняя при этом конкурентоспособную производительность в кросс-модальных задачах.
Руководство
Для эффективного развертывания Jina CLIP v1 команды должны учитывать как ее возможности, так и требования к ресурсам. Модель обрабатывает изображения в плитках размером 224x224 пикселя, при этом каждая плитка потребляет 1000 токенов вычислительной мощности. Для оптимальной производительности реализуйте эффективную предварительную обработку изображений для соответствия этим размерам. Хотя модель отлично справляется как с обработкой коротких, так и длинных текстов, в настоящее время она поддерживает только ввод на английском языке. Командам следует тщательно продумать использование токенов: текст требует приблизительно 1,1 токена на слово, тогда как изображения обрабатываются плитками (например, изображение размером 750x500 пикселей требует 12 плиток, потребляя 12 000 токенов). Модель доступна как через Jina Embeddings API, так и в виде релиза с открытым исходным кодом на Hugging Face по лицензии Apache 2.0, что обеспечивает гибкость в вариантах развертывания. Для производственных сред рассмотрите возможность использования вариантов развертывания AWS Marketplace или Azure, которые обеспечивают оптимизированные настройки инфраструктуры.
Блоги, в которых упоминается эта модель









