Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
warning
このモデルは、新しいモデルでは非推奨になりました。
Embeddings
Apache 2.0 ライセンス
open_in_new リリース記事

jina-embeddings-v2-base-en

OpenAI の text-embedding-ada002 に相当
ライセンス
Apache-2.0
発売日
calendar_month
2023-10-28
入力
abc
テキスト
arrow_forward
出力
more_horiz
ベクター
レイトチャンキング help_outline
check_circle
Yes
モデル詳細
パラメータ: 137M
入力トークン長: 8K
出力寸法: 768
訓練された言語 help_outline
1 言語
関連機種
link
jina-embedding-b-en-v1
link
jina-embeddings-v3
以下の方法で入手できます
Jina API
AWS SageMaker
Microsoft Azure
Hugging Face
エアギャップ
I/O 図

テキスト

jina-embeddings-v2-base-en

ベクター

パレートフロンhelp_outline
MTEB English
RTEB public
LongEmbed
LoCo
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B30B20406080all-MiniLM-L12-v2all-mpnet-base-v2bge-m3e5-basee5-smalle5-small-v2EmbeddingGemma-300Mgranite-embedding-278m-…granite-embedding-311m-…granite-embedding-engli…granite-embedding-small…GritLM-7BGritLM-8x7Bgte-basegte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-smallinf-retriever-v1jasper_en_vision_langua…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…LaBSELLM2Vec-Mistral-7B-Inst…multilingual-e5-largenomic-embed-text-v1nomic-embed-text-v1.5NV-Embed-v1NV-Embed-v2Qwen3-Embedding-4BSFR-Embedding-Mistralsnowflake-arctic-embed-…snowflake-arctic-embed-…snowflake-arctic-embed-…stella_en_1.5B_v5voyage-4-nanojina-embeddings-v2-base…パラメータ数(対数)nDCG@10
このモデル
フロン上
Jina AI
その他
LongEmbed
58.12
パラメータ
137M
スコア順位
18 / 69
パレートフロン
フロン未満
値の分布help_outline
AUC 0.8376
コーパス
翻訳ペア
ドキュメント検索
0.8500.600.700.800.90
関連26.9%
ハードネガティブ2.7%
無関連1.1%
推奨しきい値
FPR 0.1 · 0.793
FPR 0.01 · 0.850
FPR 0.001 · 0.894
FPR 0.0001 · 0.914
バランス · 0.762
AUC
0.8376
ノイズ上限
0.893
再現率の崖
0.691
測定ペア数
119 / 11k
ベクトル成分help_outline
-0.14-0.000.14
σ 0.0361 · 183k 個の値
埋め込みの幾何help_outline
0768
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.751
実効次元数
59 / 768
比較するモデルを選択してください
論文 (1)
arXiv
10月 30, 2023
Jina Embeddings 2: 8192-Token General-Purpose Text Embeddings for Long Documents

概要

jina-embeddings-v2-base-en は 137M パラメータの英語テキスト埋め込みモデルで、8,192 トークンのコンテキストウィンドウを備えています — その時代の標準 512 トークン制限の 16 倍です。対称双方向 ALiBi(Attention with Linear Biases)を備えた BERT-small バックボーン上に構築され、切り詰めやチャンキングなしで長文書をネイティブに処理した最初のオープンソース Jina 埋め込みでした。768 次元のベクトルを生成し、v3/v5 の多言語や長コンテキスト機能が不要な英語専用の検索では引き続き堅実な選択肢です。

方法

アーキテクチャは BERT-small トランスフォーマー(12 層、12 アテンションヘッド、768 隠れ次元)と対称双方向 ALiBi 位置エンコーディングを組み合わせます。ALiBi は学習済み位置埋め込みを線形的に減衰するアテンションバイアスに置き換え、モデルが 512 トークンの訓練長を大きく超えて 8,192 トークンまで性能劣化なしに外挿できるようにします。訓練は 2 段階のパイプラインに従いました:C4 での事前学習、その後困難負サンプルマイニングを伴う Jina がキュレーションした 40 以上の専門的文ペアデータセットでのファインチューニング。対称双方向のアテンションにより、各トークンが前後のコンテキストの両方に注意を払い、文のグローバルな意味を捉える表現が生成されます。全トークン表現に対する平均プーリングにより、最終的な 768 次元埋め込みが生成されます。

パフォーマンス

リリース時、モデルは OpenAI の text-embedding-ada-002 を複数の MTEB 英語サブタスクで上回りました:分類(73.45% vs 70.93%)、リランキング(85.38% vs 84.89%)、検索(56.98% vs 56.32%)、要約(31.6% vs 30.8%)。8,192 トークンのコンテキストは、512–2,048 トークンに制限された競合モデルに対する大きな優位性であり、チャンキングなしの文書レベル検索を可能にしました。コンパクトな 307MB のフットプリントにより、コンシューマー向け GPU でのデプロイができました。2026 年、jina-embeddings-v5-text-small(677M パラメータ、32K コンテキスト、タスク固有 LoRA アダプタ)はほとんどの本番ワークロードでこれを上回りますが、軽量な英語専用パイプラインでは引き続き関連があります。

ベストプラクティス

8K コンテキストウィンドウが十分で、多言語やタスク固有アダプタが不要な英語専用の検索にこのモデルを使用してください。8,192 トークンを超えるドキュメントには、埋め込み前にセマンティックチャンキングを適用してください。モデルは主要なベクトルデータベース(Qdrant、Weaviate、MongoDB Atlas、Milvus)および RAG フレームワーク(LangChain、LlamaIndex、Haystack)と統合できます。多言語サポート、32K コンテキスト、タスク固有の最適化を必要とする新規プロジェクトには、jina-embeddings-v5-text-small を推奨します。本番のスループットには CUDA 対応 GPU を推奨します。CPU 推論も可能ですが、大幅に遅くなります。

このモデルについて言及しているブログ
12月 17, 2024 • 12 読む時間
Text Embeddings Fail to Capture Word Order and How to Fix It
Text embedding models struggle with capturing subtle linguistic nuances like word order, directional relationships, temporal sequences, causal connections, comparisons, and negation. Understanding these challenges is key to improving model performance.
Bo Wang
Alex C-G
Three abstract figures in white, gray, and pink on matching cubes placed on a colorful checkered surface against a green back
10月 25, 2024 • 19 読む時間
Finding Optimal Breakpoints in Long Documents Using Small Language Models
We trained three small language models to better segment long documents into chunks, and here are the key lessons we learned.
Andrei Ungureanu
Alex C-G
A pattern of yellow file icons on a blue background with one icon displaying a smiley face creating an emotive contrast.
10月 15, 2024 • 9 読む時間
Fact-Checking with New Grounding API in Jina Reader
With the new g.jina.ai, you can easily ground statements to reduce LLM hallucinations or improve the integrity of human-written content.
Jina AI
Jina developer interface showing "Jina AI was founded in 2020" with controls labeled true and false, and web address on top.
9月 27, 2024 • 15 読む時間
Migration From Jina Embeddings v2 to v3
We collected some tips to help you migrate from Jina Embeddings v2 to v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
9月 18, 2024 • 10 読む時間
Jina Embeddings v3: A Frontier Multilingual Embedding Model
jina-embeddings-v3 is a frontier multilingual text embedding model with 570M parameters and 8192 token-length, outperforming the latest proprietary embeddings from OpenAI and Cohere on MTEB.
Jina AI
Dynamic image showing the characters "V3" formed by bright green dots varying in size on a black background.
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するコンテンツ、ソフトウェア、製品、サービスは、すべて専門的な利用を目的としています。消費者向けの利用は想定していません。