Обзор
jina-clip-v1 — мультимодальная эмбеддинг-модель на 223M параметров, достигающая передовых результатов как в поиске «текст в текст», так и «текст в изображение» — впервые среди моделей семейства CLIP. В отличие от стандартных CLIP-моделей, жертвующих поиском только по тексту ради кросс-модального согласования, jina-clip-v1 использует мультизадачное контрастивное обучение, чтобы сохранять сильный результат во всех сочетаниях поиска. Поддерживается текстовый контекст 12 288 токенов — в 100 раз больше лимита в 77 токенов исходного CLIP.
Методы
Архитектура сочетает адаптированный текстовый энкодер Jina BERT v2 (12 288 токенов благодаря ALiBi) с энкодером изображений EVA-02 от Beijing Academy for AI. Ключевое новшество — метод мультизадачного контрастивного обучения: модель обучается одновременно на (1) парах «изображение-подпись» для кросс-модального согласования, (2) парах «текст-текст» для сохранения качества поиска только по тексту и (3) более длинных описаниях изображений, сгенерированных ИИ, для устойчивости к разной длине текста. На финальном этапе используются тройки текста с трудными негативами для обострения семантического различения. Этот мультизадачный подход предотвращает катастрофическое забывание при поиске только по тексту, характерное для стандартного обучения CLIP. Энкодер изображений обрабатывает тайлы 224×224 пикселей; каждый тайл расходует 1000 токенов вычислительной мощности.
Производительность
В поиске только по тексту модель даёт прирост производительности на 165% по сравнению с OpenAI CLIP (0,429 против 0,162 на MTEB). Для задач с изображениями: на 2% лучше в «текст в изображение» (0,899), на 6% в «изображение в текст» (0,803) и на 12% в «изображение в изображение» (0,916). В zero-shot визуальной классификации (CIFAR-100) превосходит стандартный CLIP. Кросс-модальные результаты на Flickr8k/30k и MSCOCO Captions конкурентоспособны со специализированными одно-модальными моделями. Текстовый контекст 12 288 токенов — большое преимущество для поиска длинных текстовых документов наряду с изображениями. В 2026 году jina-clip-v2 заменяет эту модель поддержкой 89 языков и обработкой изображений 512×512.
Руководство
Модель обрабатывает изображения тайлами 224×224 пикселя; каждый тайл расходует 1000 токенов. Изображение 750×500 пикселей требует 12 тайлов (12 000 токенов). Текст требует примерно 1,1 токена на слово. Планируйте бюджет токенов соответственно для смешанных мультимодальных запросов. Модель пока поддерживает только английский — для мультиязычных приложений используйте jina-clip-v2. Доступна через Jina Embeddings API и как open-source релиз на Hugging Face под лицензией Apache 2.0. Для продакшена варианты AWS Marketplace и Azure предоставляют оптимизированную инфраструктуру. Используйте косинусное сходство для кросс-модального сравнения. Для новых мультимодальных проектов предпочитайте jina-clip-v2 (89 языков, изображения 512×512, поддержка MRL) или jina-embeddings-v4 (контекст 32K, мульти-векторный режим, поддержка кода).









