자동 미세 조정

임베딩이 어떤 도메인에서 뛰어나길 원하는지 알려주시면, 해당 도메인에 맞게 미세 조정된 즉시 사용 가능한 임베딩 모델을 자동으로 제공해 드립니다.

자동 미세 조정이란 무엇인가요?

요구 사항을 지정하는 방법에는 일반 설명, URL 또는 쿼리 문서 설명의 세 가지가 있습니다. 하나를 선택해 주세요.
기본 벡터 모델 선택
미세 조정을 사용하면 사전 학습된 모델을 새로운 데이터 세트로 학습시켜 특정 작업이나 도메인에 맞게 적응시킬 수 있습니다. 하지만 실제로 많은 사용자에게 효과적인 학습 데이터를 찾는 일은 간단하지 않습니다. 효과적인 학습에는 원시 PDF나 HTML을 모델에 그대로 넣는 것 이상이 필요하며, 제대로 해내기가 어렵습니다. 자동 미세 조정은 고급 LLM 에이전트 파이프라인을 사용해 효과적인 학습 데이터를 자동으로 생성하고 ML 워크플로 안에서 모델을 미세 조정함으로써 이 문제를 해결합니다. 합성 데이터 생성과 AutoML을 결합한 것으로 생각하면 됩니다. 즉, 사용자는 자연어로 대상 도메인을 설명하기만 하면 나머지는 저희 시스템이 처리합니다.
자동 미세 조정은 원하는 어떤 도메인에도 미세 조정된 임베딩을 마법처럼 제공하겠다고 약속합니다. 그런데 정말 효과가 있을까요? 충분히 합리적인 의심입니다. 저희는 다양한 도메인과 기본 모델에서 이를 테스트해 보았습니다. 아래에서 잘 나온 사례와 잘 나오지 않은 사례를 모두 확인해 보세요.
미세 조정에 사용할 기본 모델
jinaai/jina-embeddings-v2-base-en
평균 개선
2%

도메인 지시어
미세 조정 전후의 합성 검증 세트 성능
NDCG
0.505 0.532 5%
MAP
0.352 0.389 10%
MRR
0.352 0.389 10%
미세 조정 전후 홀드아웃 테스트 세트에서의 성능
tollefj/norwegian-nli-triplets의 50 무작위 샘플에서 테스트되었습니다.
NDCG
0.852 0.867 2%
MAP
0.800 0.820 2%
MRR
0.800 0.820 2%
합성 데이터 생성
전체
4648
학습
4480
검증
168

미세 조정에 사용할 기본 모델
jinaai/jina-embeddings-v2-base-en
평균 개선
6%

도메인 지시어
미세 조정 전후의 합성 검증 세트 성능
NDCG
0.672 0.755 12%
MAP
0.567 0.675 19%
MRR
0.567 0.675 19%
미세 조정 전후 홀드아웃 테스트 세트에서의 성능
mteb/askubuntudupquestions-reranking의 50 무작위 샘플에서 테스트되었습니다.
NDCG
0.698 0.722 3%
MAP
0.515 0.549 6%
MRR
0.666 0.712 7%
합성 데이터 생성
전체
616
학습
448
검증
168

미세 조정에 사용할 기본 모델
jinaai/jina-embeddings-v2-base-en
평균 개선
9%

도메인 지시어
미세 조정 전후의 합성 검증 세트 성능
NDCG
0.727 0.861 18%
MAP
0.640 0.814 27%
MRR
0.640 0.814 27%
미세 조정 전후 홀드아웃 테스트 세트에서의 성능
mteb/scidocs-reranking의 50 무작위 샘플에서 테스트되었습니다.
NDCG
0.773 0.822 6%
MAP
0.575 0.651 13%
MRR
0.823 0.884 7%
합성 데이터 생성
전체
616
학습
448
검증
168

미세 조정에 사용할 기본 모델
jinaai/jina-embeddings-v2-base-zh
평균 개선
1%

도메인 지시어
미세 조정 전후의 합성 검증 세트 성능
NDCG
0.718 0.785 9%
MAP
0.629 0.717 14%
MRR
0.629 0.717 14%
미세 조정 전후 홀드아웃 테스트 세트에서의 성능
C-MTEB/CMedQAv2-reranking의 50 무작위 샘플에서 테스트되었습니다.
NDCG
0.938 0.948 1%
MAP
0.912 0.926 2%
MRR
0.920 0.933 1%
합성 데이터 생성
전체
616
학습
448
검증
168

미세 조정에 사용할 기본 모델
jinaai/jina-embeddings-v2-base-en
평균 개선
6%

도메인 지시어
미세 조정 전후의 합성 검증 세트 성능
NDCG
0.543 0.579 7%
MAP
0.402 0.452 12%
MRR
0.402 0.452 12%
미세 조정 전후 홀드아웃 테스트 세트에서의 성능
nc33/triplet_sbert_law2 (machine-translated to dutch)의 50 무작위 샘플에서 테스트되었습니다.
NDCG
0.904 0.948 5%
MAP
0.870 0.930 7%
MRR
0.870 0.930 7%
합성 데이터 생성
전체
9128
학습
8960
검증
168

미세 조정에 사용할 기본 모델
jinaai/jina-embeddings-v2-base-code
평균 개선
-4%

도메인 지시어
미세 조정 전후의 합성 검증 세트 성능
NDCG
0.671 0.640 -5%
MAP
0.569 0.525 -8%
MRR
0.569 0.525 -8%
미세 조정 전후 홀드아웃 테스트 세트에서의 성능
mteb/stackoverflowdupquestions-reranking의 50 무작위 샘플에서 테스트되었습니다.
NDCG
0.640 0.621 -3%
MAP
0.530 0.505 -5%
MRR
0.555 0.532 -4%
합성 데이터 생성
전체
616
학습
448
검증
168

미세 조정에 사용할 기본 모델
jinaai/jina-embeddings-v2-base-code
평균 개선
-4%

도메인 지시어
미세 조정 전후의 합성 검증 세트 성능
NDCG
0.632 0.711 13%
MAP
0.517 0.622 20%
MRR
0.517 0.622 20%
미세 조정 전후 홀드아웃 테스트 세트에서의 성능
mteb/stackoverflowdupquestions-reranking의 50 무작위 샘플에서 테스트되었습니다.
NDCG
0.640 0.619 -3%
MAP
0.530 0.504 -5%
MRR
0.555 0.525 -5%
합성 데이터 생성
전체
616
학습
448
검증
168

미세 조정에 사용할 기본 모델
jinaai/jina-embeddings-v2-base-en
평균 개선
1%

도메인 지시어
미세 조정 전후의 합성 검증 세트 성능
NDCG
0.646 0.729 13%
MAP
0.535 0.644 20%
MRR
0.535 0.644 20%
미세 조정 전후 홀드아웃 테스트 세트에서의 성능
mteb/askubuntudupquestions-reranking의 50 무작위 샘플에서 테스트되었습니다.
NDCG
0.645 0.650 1%
MAP
0.452 0.462 2%
MRR
0.606 0.605 -0%
합성 데이터 생성
전체
616
학습
448
검증
168

자동 미세 조정 API

원하는 모든 도메인에 대해 미세 조정된 벡터 모델을 얻으세요.


r.jina.ai를 사용하여 URL을 읽고 해당 내용을 가져옵니다.
s.jina.ai로 웹을 검색하고 SERP를 얻으세요
LLM에서 당사 API를 사용할 수 있도록 mcp.jina.ai를 MCP 서버로 추가하세요


요청
GET
curl "https://r.jina.ai/https://www.example.com"


속도 제한
속도 제한은 두 가지 방식으로 추적됩니다. RPM(분당 요청 수)과 TPM(분당 토큰 수)입니다. 제한은 IP/API 키별로 적용되며 RPM 또는 TPM 임계값 중 먼저 도달하는 쪽에서 트리거됩니다. 요청 헤더에 API 키를 제공하면 IP 주소 대신 키별로 속도 제한을 추적합니다.
제품API 엔드포인트설명API 키 없음무료 API 키 사용 시유료 API 키 사용 시프리미엄 API 키 사용 시평균 지연토큰 사용량 계산허용 요청
Reader APIhttps://r.jina.aiURL을 LLM 친화적인 텍스트로 변환20 RPM500 RPM500 RPM5000 RPM7.9s출력 응답의 토큰 수를 기준으로 합니다.GET/POST
Reader APIhttps://s.jina.ai웹 검색 후 결과를 LLM 친화적인 텍스트로 변환100 RPM100 RPM1000 RPM2.5s각 요청에는 10,000개의 토큰으로 시작하는 고정된 수의 토큰이 필요합니다.GET/POST
Reranker APIhttps://api.jina.ai/v1/rerank쿼리 기준으로 문서 순위 매기기100 RPM & 100,000 TPM500 RPM & 2,000,000 TPM5,000 RPM & 50,000,000 TPM
입력 크기에 따라 다름
입력 요청의 토큰 수를 기준으로 합니다.POST
벡터 모델 APIhttps://api.jina.ai/v1/embeddings텍스트/이미지를 고정 길이 벡터로 변환100 RPM & 100,000 TPM500 RPM & 2,000,000 TPM5,000 RPM & 50,000,000 TPM
입력 크기에 따라 다름
입력 요청의 토큰 수를 기준으로 합니다.POST
청구 관련 자주 묻는 질문