Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
Elastic Inference Service
Elasticsearch内でJinaモデルをネイティブに実行する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
warning
このモデルは、新しいモデルでは非推奨になりました。
Embeddings
Apache 2.0 ライセンス
open_in_new リリースノート

jina-embeddings-v2-base-es

スペイン語と英語のバイリンガルをサポートする 8K 最高のベクトル モデル
ライセンス
Apache-2.0
発売日
calendar_month
2024-02-14
入力
abc
文章
arrow_forward
出力
more_horiz
ベクター
レイトチャンキング help_outline
check_circle
Yes
モデル詳細
パラメータ: 161M
入力トークン長: 8K
出力寸法: 768
ベースモデル help_outline
open_in_new
jina-embeddings-v2-base-en
訓練された言語 help_outline
2 言語
関連機種
link
jina-embeddings-v2-base-en
link
jina-embeddings-v2-base-de
link
jina-embeddings-v2-base-zh
以下の方法で入手できます
Jina API
AWS SageMaker
Microsoft Azure
Hugging Face
エアギャップ
I/O 図

文章

jina-embeddings-v2-base-es

ベクター

Pareto fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
MTEB English · retrieval
46.40
Parameters
161M
Rank by score
24 / 39
Pareto front
Behind it
値の分布help_outline
AUC 0.8383
コーパス
翻訳ペア
ドキュメント検索
0.6830.000.200.400.600.80
関連17.6%
ハードネガティブ3.0%
無関連0.8%
推奨しきい値
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
バランス · 0.365
AUC
0.8383
ノイズ上限
0.774
再現率の崖
0.163
測定ペア数
119 / 11k
ベクトル成分help_outline
-0.160.000.17
σ 0.0361 · 183k 個の値
埋め込みの幾何help_outline
0768
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.326
実効次元数
51 / 768
言語ペアhelp_outline
de-ruen-deen-koen-zhja-ko
ペア間のしきい値のばらつき: 0.315
比較するモデルを選択してください
論文 (1)
arXiv
2月 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

概要

Jina Embeddings v2 Base Spain は、スペイン語と英語のコンテンツ間の言語を越えた情報検索と分析という重要な課題を解決する画期的なバイリンガル テキスト ベクトル モデルです。特定の言語に偏りがちな従来の多言語モデルとは異なり、このモデルはスペイン語と英語の間で真にバランスの取れたパフォーマンスを提供します。これは、スペイン語圏の市場で活動している組織やバイリンガルのコンテンツを扱っている組織にとって不可欠です。このモデルの最も顕著な特徴は、幾何学的に整列したベクトルを生成できることです。スペイン語と英語のテキストが同じ意味を表現する場合、それらのベクトル表現はベクトル空間内で自然にクラスタリングされ、シームレスな言語間検索と分析が可能になります。

方法

モデルの中心となるのは、対称双方向 ALiBi (直線バイアス付き注意) に基づく革新的なアーキテクチャです。これは、従来の位置ベクトルを必要とせずに、最大 8,192 個のトークンのシーケンスを処理できる洗練されたアプローチです。このモデルは、ゲート線形ユニット (GLU) と特殊なレイヤー正規化技術を組み合わせた、1 億 6100 万のパラメーターを備えた修正された BERT アーキテクチャを使用します。トレーニングは 3 段階のプロセスに従います。まず、大規模なテキスト コーパスでの事前トレーニング、次に慎重に選択されたテキスト ペアを使用した微調整、そして最後に、類似しているが意味的に異なるコンテンツの識別を強化するためのハード ネガティブ トレーニングです。このアプローチと 768 次元のベクトルを組み合わせることで、モデルは計算効率を維持しながら微妙な意味関係を捉えることができます。

パフォーマンス

包括的なベンチマーク評価では、このモデルは特に言語間の検索タスクにおいて優れた機能を示し、サイズが E5 や BGE-M3 などのはるかに大規模な多言語モデルのわずか 15 ~ 30% であるにもかかわらず、それらを上回りました。このモデルは、検索およびクラスタリングのタスクで優れたパフォーマンスを発揮し、言語間で意味的に同等のコンテンツを照合することに優れています。MTEB ベンチマークでは、分類、クラスタリング、意味的類似性などのさまざまなタスクで良好なパフォーマンスを示します。8,192 トークンの拡張コンテキスト ウィンドウは、長いドキュメントの処理に特に価値があり、ドキュメントが複数ページにまたがる場合でも一貫したパフォーマンスを実現します。これは、ほとんどの競合モデルにはない機能です。

ベストプラクティス

このモデルを効果的に活用するには、組織は最適なパフォーマンスを得るために CUDA 対応の GPU インフラストラクチャにアクセスできるようにする必要があります。このモデルは、MongoDB、Qdrant、Weaviate、Haystack などの主要なベクトル データベースや RAG フレームワークとシームレスに統合されているため、運用環境への導入が簡単になります。バイリンガル文書検索、コンテンツ推奨システム、言語横断文書分析などのアプリケーションに優れています。このモデルはパフォーマンスは良好ですが、スペイン語と英語のバイリンガル シナリオに特化して最適化されているため、単言語アプリケーションや他の言語ペアが関与するシナリオには最適な選択ではない可能性があります。最良の結果を得るには、入力テキストはスペイン語または英語で適切にフォーマットされている必要がありますが、モデルは混合言語コンテンツを効果的に処理できます。このモデルはドメイン固有のアプリケーションの微調整をサポートしていますが、トレーニング データの品質と配布については慎重に考慮する必要があります。
このモデルについて言及しているブログ
4月 29, 2024 • 7 読む時間
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
2月 14, 2024 • 4 読む時間
Aquí Se Habla Español: Top-Quality Spanish-English Embeddings and 8k Context
Jina AI's new bilingual Spanish-English embedding model brings the state-of-the-art in AI to half a billion Spanish speakers.
Jina AI
Digital wireframe rendering of a Gothic-style cathedral, with colorful outlines and pointed spires on a dark background.
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するすべてのコンテンツ、ソフトウェア、製品、サービスは、専門家による利用のみを目的としています。一般消費者向けのものではなく、一般消費者による利用も推奨されていません。