I/O 図

テキスト

jina-embedding-b-en-v1

ベクター

パレートフロン
30M100M300M1B3.0B657075808590bge-m3e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embedding-b-en-v1パラメータ数(対数)Spearman
このモデル
フロン上
Jina AI
その他
MTEB English · sts
79.93
パラメータ
110M
スコア順位
28 / 39
パレートフロン
フロン未満
比較するモデルを選択してください
論文 (1)

概要

jina-embedding-b-en-v1 は Jina AI 初の公開テキスト埋め込みモデルです:110M パラメータの双方向エンコーダーで、英語テキストを 768 次元のベクトルにマッピングします。当時 512 トークンのコンテキストが業界標準だった時代に、セマンティック検索、類似度比較、コンテンツ推奨のために設計され、Jina のオープンソース埋め込み領域への参入を確立しました。モデルは現在レガシーで、v2 および v3 ファミリーに置き換えられており、それらは 8K 超トークンのコンテキストと多言語入力をサポートします。

方法

モデルは T5-エンコーダーアーキテクチャに平均プーリングを用い、固定長の 768 次元表現を生成します。学習は Linnaeus-Clean データセット(16 億候補から 385M 文ペアに絞り込み)での 2 段階の対比レシピに従いました:まず正のテキストペアでの InfoNCE 損失によりセマンティックアラインメントを学習し、次にトリプレット損失により類似だが意味的に異なるテキスト間の識別を鋭敏にします。主要な設計決定は平均プーリング戦略で、トークン単位の表現を平均化して文のグローバルな意味を捉える単一ベクトルを生成します。512 トークンのコンテキストウィンドウはその時代の標準でしたが、長文書アプリケーションでのモデルの有用性を制限します。

パフォーマンス

STS12 で、モデルは相関スコア 0.751 を達成し、リリース当時 all-mpnet-base-v2 および all-minilm-l6-v2 を上回りました。標準的な英語文埋め込みタスク全体で強い性能を示しつつ、本番環境に適した高速推論時間を維持しました。512 トークンのコンテキストウィンドウと英語専用という焦点により、2025 年までに標準となった長文書・多言語ワークロードには適しません。モデルは jina-embeddings-v2-base-en(8K コンテキスト、双方向 ALiBi)および jina-embeddings-v3570M パラメータ、89 言語、タスク固有 LoRA アダプタ)に置き換えられました。

ベストプラクティス

このモデルはレガシーで、新しいプロジェクトには使用しないでください。jina-embedding-b-en-v1 から移行する場合は、現在のワークロード用に jina-embeddings-v5-text-small へアップグレードしてください — 32K トークンコンテキスト、89 言語、タスク固有 LoRA アダプタをサポートします。コード特化の埋め込みニーズには jina-code-embeddings-1.5b を使用してください。モデルは最適な性能に CUDA 対応ハードウェアを必要とし、最大 512 トークンの入力を受理します。多言語コンテンツ、長文書、コード中心のアプリケーションには適していません。