Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
Elastic Inference Service
Elasticsearch内でJinaモデルをネイティブに実行する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
warning
このモデルは、新しいモデルでは非推奨になりました。
Embeddings
Apache 2.0 ライセンス

jina-embedding-b-en-v1

Jina Embedding モデルの最初のバージョン、元祖です。
ライセンス
Apache-2.0
発売日
calendar_month
2023-06-17
入力
abc
文章
arrow_forward
出力
more_horiz
ベクター
モデル詳細
パラメータ: 110M
入力トークン長: 512
出力寸法: 768
ベースモデル help_outline
open_in_new
T5-Base Encoder
訓練された言語 help_outline
1 言語
関連機種
link
jina-embeddings-v2-base-en
link
jina-embeddings-v3
以下の方法で入手できます
Hugging Face
エアギャップ
I/O 図

文章

jina-embedding-b-en-v1

ベクター

Pareto fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-l-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embedding-b-en-v1Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
MTEB English · retrieval
44.03
Parameters
110M
Rank by score
28 / 39
Pareto front
Behind it
比較するモデルを選択してください
論文 (1)
EMNLP 2023
7月 20, 2023
Jina Embeddings: A Novel Set of High-Performance Sentence Embedding Models

概要

Jina Embedding B v1 は、意味論的な意味を維持しながら英語テキストを高次元の数値表現に変換するように設計された特殊なテキスト ベクトル モデルです。このモデルは、運用環境における効率的で正確なテキスト ベクトルに対する重要なニーズに対応しており、計算効率とベクトル品質のバランスをとる必要がある組織にとって特に価値があります。 768 次元のベクトルを生成する 1 億 1,000 万個のパラメータにより、大規模なコンピューティング リソースを必要とせずに、セマンティック検索、ドキュメント クラスタリング、またはコンテンツ推奨システムを実装するチームにとって実用的なソリューションとして機能します。

方法

このモデルは、平均プーリングで強化された T5 エンコーダベースのアーキテクチャを使用して、固定長表現を生成します。このモデルは、元の 16 億の文ペアから絞り込まれた 3 億 8,500 万の高品質な文ペアを含む厳選された Linnaeus-Clean データセットでトレーニングされ、2 段階のトレーニング プロセスを経ています。第 1 段階では、テキスト ペアに対して InfoNCE 損失を用いた対照学習を利用します。第 2 段階ではトリプレット トレーニングを取り入れ、類似したコンテンツと類似していないコンテンツを区別するモデルの能力を向上させます。この革新的なトレーニング方法と、言語検出や一貫性チェックを含む厳密なデータ フィルタリングを組み合わせることで、モデルが微妙な意味関係を効果的に捉えられるようになります。

パフォーマンス

実際の評価では、Jina Embedding B v1 は、特に意味論的なテキストの類似性タスクにおいて優れた機能を実証します。このモデルは、STS12 で 0.751 のスコアで最高のパフォーマンスを達成し、all-mpnet-base-v2 や all-minilm-l6-v2 などの成熟したモデルを上回ります。効率的な推論時間を維持しながら、さまざまなベンチマークで良好なパフォーマンスを発揮します。ただし、このモデルは英語コンテンツに特化して最適化されており、多言語タスクやコード固有のタスクでは最適なパフォーマンスが得られない可能性があることに注意してください。このモデルは、jina-embeddings-v2-base-en および jina-embeddings-v3 に置き換えられ、より幅広いユースケースにわたってパフォーマンスが向上しました。

ベストプラクティス

最適な展開のためには、モデルには CUDA 対応 GPU が必要ですが、その適度なサイズにより標準ハードウェアで効率的な推論が可能になります。このモデルは最大 512 トークンの長さの入力シーケンスを受け入れるため、一貫性のある信頼性の高いベクトル生成が重要な運用環境に最適です。英語コンテンツで最高のパフォーマンスを発揮し、意味検索、文書類似性比較、コンテンツ推奨システムなどのアプリケーションに最適です。チームは、より優れたパフォーマンスとより広範な言語サポートを提供するため、新しいプロジェクトには新しい v2 または v3 バージョンの使用を検討する必要があります。このモデルは、多言語の理解や一般的な英語のテキストを超えた専門分野の知識を必要とするタスクにはお勧めできません。
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するすべてのコンテンツ、ソフトウェア、製品、サービスは、専門家による利用のみを目的としています。一般消費者向けのものではなく、一般消費者による利用も推奨されていません。