이전 Embeddings V2의 주목할 만한 성공에 이어, 최신 중국어/영어 이중언어 텍스트 임베딩 모델인 jina-embeddings-v2-base-zh의 출시를 발표하게 되어 기쁩니다. 이 새로운 모델은 Jina Embeddings V2의 뛰어난 8K 토큰 길이를 계승하면서 중국어와 영어 모두를 강력하게 지원합니다.
jina-embeddings-v2-base-zh는 고품질 이중언어 데이터를 통한 엄격하고 균형 잡힌 사전 학습으로 탁월한 품질과 성능을 보여줍니다. 이러한 접근 방식은 불균형한 다국어 데이터로 학습된 모델에서 흔히 볼 수 있는 편향을 크게 감소시킵니다.
tag주요 특징
- 이중언어 모델: 이 모델은 영어와 중국어 텍스트를 모두 인코딩하여 쿼리나 대상 문서에 어느 언어든 사용할 수 있습니다. 두 언어에서 동일한 의미를 가진 텍스트는 동일한 임베딩 공간에 매핑되어 다양한 다국어 애플리케이션의 기반이 됩니다.
- 확장된 8K 토큰 길이: 우리 모델은 상당히 긴 텍스트 구절을 처리할 수 있으며, 이는 대부분의 다른 오픈소스 모델의 능력을 뛰어넘는 특징입니다.
- 컴팩트하고 효율적: 322MB 크기(1억 6100만 파라미터)와 768차원의 출력으로, 우리 모델은 GPU 없이도 일반 컴퓨터 하드웨어에서 고성능을 발휘하도록 설계되어 접근성이 향상되었습니다.
tagC-MTEB에서의 선도적 성능
Chinese MTEB 리더보드에서 중국어와 영어를 모두 지원하는 Jina Embeddings v2는 0.5GB 미만 모델 중 최상위 모델 중 하나로 자리잡았습니다. 특히 8K 토큰 길이 처리 능력은 이 카테고리에서 독보적인 특징입니다.

비슷한 크기의 중국어 모델 중에서 E5 Multilingual 모델과 우리의 jina-embeddings-v2-base-zh만이 영어를 지원하여 효과적인 교차 언어 애플리케이션을 가능하게 합니다. 특히 Jina는 중국어가 관련된 모든 카테고리에서 현저히 우수한 성능을 보여줍니다.

두 모델 모두 8K 토큰 컨텍스트 크기를 가지고 있지만, jina-embeddings-v2-base-zh는 OpenAI의 text-embedding-ada-002보다 특히 중국어가 포함된 작업에서 현저히 우수한 성능을 보입니다.

tag중국 기업의 글로벌 확장을 위한 지원
우리의 중국어-영어 임베딩 모델은 '해외 진출'(出海)을 목표로 하는 중국 기업들을 위한 강력한 도구입니다. 중국어 텍스트를 원활하게 처리하여 주요 벡터 데이터베이스, 검색 시스템, RAG 애플리케이션과 쉽게 통합되는 고품질 임베딩을 제공합니다.
jina-embeddings-v2-base-zh는 특히 국제적으로 확장하는 기업들에게 중요한 중국어-영어 컨텍스트에 맞춘 AI 애플리케이션 개발에 매우 유용합니다. 구체적인 사용 사례는 다음과 같습니다:
- 문서 분석 및 관리: 국제 법률 및 비즈니스 거래에 도움이 되는 광범위한 문서를 분석하고 관리할 수 있습니다.
- AI 기반 검색 애플리케이션: 다국어 환경에서 검색 기능을 향상시켜 글로벌 사용자가 중국어와 영어로 관련 정보를 쉽게 찾을 수 있게 합니다.
- 검색 강화 챗봇 및 질의응답: 효율적인 이중언어 고객 서비스 봇을 구축하여 전 세계 고객과의 상호작용을 개선합니다.
- 자연어 처리 애플리케이션: 글로벌 시장 트렌드를 이해하기 위한 감정 분석, 국제 마케팅 전략을 위한 토픽 모델링, 글로벌 커뮤니케이션 관리를 위한 텍스트 분류 등이 포함됩니다.
- 추천 시스템: 중국어와 영어 데이터에서 얻은 인사이트를 활용하여 다양한 글로벌 사용자를 위한 제품 및 콘텐츠 추천을 맞춤화합니다.
이 모델을 활용함으로써 중국 기업들은 AI 애플리케이션에서의 언어 장벽을 효과적으로 극복하여 글로벌 경쟁력과 시장 도달범위를 향상시킬 수 있습니다.
tagAPI를 통한 jina-embeddings-v2-base-zh 시작하기
Embeddings API를 통해 즉시 우리 모델을 워크플로우에 통합해 보세요. Embeddings 포털을 방문하여 무료 액세스 키를 받거나 기존 키를 충전한 다음, 드롭다운 메뉴에서 jina-embeddings-v2-base-zh를 선택하기만 하면 됩니다. 시작하기가 이렇게 쉽습니다!


tag다음 계획: 언어 지원 확대 및 AWS Sagemaker 통합
jina-embeddings-v2-base-zh는 곧 AWS Sagemaker와 Hugging Face를 통해 이용 가능해질 예정입니다.


Jina AI는 글로벌 고객을 위한 저렴하고 접근 가능한 임베딩 기술의 선도자가 되겠다는 우리의 약속을 굳건히 지키고 있습니다. 우리는 주요 유럽 및 기타 국제 언어에 초점을 맞춘 추가 다국어 제품을 적극적으로 개발하여 우리의 도달 범위를 확대하고 있습니다. AWS SageMaker와의 통합을 포함한 이러한 흥미진진한 업데이트를 계속 지켜봐 주시기 바랍니다.
tag초기 테스터들에 대한 특별한 감사
프리뷰 버전(jina-embeddings-v2-base-zh-preview)을 테스트해 주신 중국 사용자 커뮤니티의 선별된 멤버들에게 깊은 감사를 드립니다. 그들의 통찰력 있는 피드백은 이번 공식 릴리스의 성능을 향상시키는 데 매우 중요했습니다. 우리 모델의 품질에 대한 관찰이나 제안이 있으시다면 Discord 서버에 참여하여 여러분의 생각을 공유해 주시기 바랍니다. 여러분의 의견은 우리의 지속적인 개선 여정에 매우 소중합니다.

향상된 점수 분포 vs. jina-embeddings-v2-base-zh-preview
jina-embeddings-v2-base-zh-preview는 유사도 점수가 과대 평가되어 관련 없는 항목에도 높은 코사인 점수가 나타나는 문제가 있었습니다. 이는 아래 스크린샷의 상위 5개 결과에서 특히 두드러졌습니다. 유사도 점수가 일관되게 높았고 항목 간의 실제 관계를 정확하게 반영하지 못했습니다. 예를 들어 "안니"와 "증기기관" 간의 비교에서 오해의 소지가 있는 높은 유사도 점수가 나타났습니다.
정식 출시 버전에서는 모델을 미세 조정하여 더 명확하고 논리적인 유사도 점수를 생성하도록 하여 항목 간의 관계를 더 정확하게 표현할 수 있게 되었습니다. 예를 들어, 개선된 점수 체계는 이제 더 넓은 범위를 제시하여 항목 간의 상대적 유사도에 대한 더 명확한 통찰을 제공합니다.
또한 Jina Embeddings는 이제 8192 토큰을 지원하는 유일한 오픈소스 임베딩 모델이 되었습니다. 이 기능은 긴 문서부터 짧은 구문, 또는 "안니" vs "루나"와 같은 개별 단어/이름까지 다양한 유형의 데이터를 처리할 수 있는 능력을 강조합니다.

tag중영 이중언어 8K 벡터 대형 모델 출시, 기업의 해외 진출에 필수!
Embeddings V2가 각계의 호평을 받은 이후, 오늘 우리는 새로운 중영 이중언어 텍스트 벡터 대형 모델인 jina-embeddings-v2-base-zh를 출시했습니다. 이 모델은 V2의 모든 장점을 계승했을 뿐만 아니라 8천 토큰의 텍스트를 처리할 수 있으며, 중국어와 영어 이중언어 콘텐츠를 원활하게 다룰 수 있어 다국어 애플리케이션에 날개를 달아주었습니다.
jina-embeddings-v2-base-zh가 탁월한 성능을 보이는 것은 고품질 이중언어 데이터셋과 엄격하고 균형 잡힌 사전 훈련, 1차 미세조정, 2차 미세조정 덕분입니다. 이러한 3단계 훈련 방식은 모델의 이중언어 능력을 일반화했을 뿐만 아니라 모델의 편향을 효과적으로 줄여 다국어 모델이 자주 직면하는 "불균형" 문제를 해결했습니다.
tag모델 특징 개요
특징 1: 이중언어 원활한 연결
jina-embeddings-v2-base-zh 모델은 중국어와 영어 텍스트를 원활하게 처리할 수 있으며, 검색 쿼리나 대상 문서로 모두 사용할 수 있습니다. 중영 텍스트에서 의미가 유사한 내용은 동일한 벡터 공간에 매핑되어 다국어 애플리케이션을 위한 견고한 기반을 마련했습니다.
특징 2: 8k Token 초장문 텍스트 지원
우리 모델은 8K Token의 텍스트 처리를 지원하며, 이는 오픈소스 벡터 모델 중 독보적이며 더 긴 텍스트 단락 처리에 있어 상당한 이점을 제공합니다.
특징 3: 효율적이고 컴팩트한 모델 구조
jina-embeddings-v2-base-zh 모델은 322MB의 작은 크기(1.61억 개의 매개변수 포함)로 768차원의 출력을 제공하며, 일반 컴퓨터 하드웨어에서도 GPU 없이 효율적으로 실행될 수 있어 실용성과 편의성이 크게 향상되었습니다.
tag모델 성능 우수
CMTEB 순위표의 치열한 경쟁에서 우리의 Jina Embeddings v2 모델은 0.5GB 이하 모델 카테고리에서 두각을 나타냈으며, 중영 텍스트를 지원할 뿐만 아니라 최대 8K Token의 텍스트를 처리할 수 있는 능력은 같은 종류의 모델 중에서 매우 드문 특징입니다.

동일한 크기의 중국어 지원 모델 중에서 Multilingual E5와 우리의 jina-embeddings-v2-base-zh만이 영어를 처리할 수 있는 유일한 두 모델이며, 이는 다국어 애플리케이션을 가능하게 합니다.

현재 전 세계적으로 OpenAI의 비공개 모델인 text-embedding-ada-002와 Jina Embeddings만이 8k Token의 장문 텍스트 입력을 지원합니다. 중국어 작업 처리에 있어서 Jina Embeddings는 뛰어난 성능 우위를 보여주고 있습니다.

tag중국 기업의 글로벌 비즈니스 확장 지원
우리의 중영 이중언어 벡터 모델 jina-embeddings-v2-base-zh는 중국 기업의 국제 시장 진출을 위한 강력한 파트너입니다. 중영 이중언어 텍스트를 원활하게 처리하고 고품질 텍스트 벡터 표현을 제공하며, 고급 벡터 데이터베이스, 검색 시스템 및 RAG 애플리케이션에 쉽게 통합될 수 있습니다.
이 모델은 특히 중영 이중언어 시나리오에 적합한 AI 애플리케이션을 구축하는 데 적합하며, 글로벌화를 추구하는 기업에게 그 가치는 매우 큽니다. 다음은 몇 가지 실제 적용 사례입니다:
- 문서 분석 및 관리: 대량의 문서를 분석하고 관리하여 국제 법률 및 비즈니스 거래의 원활한 진행을 지원합니다.
- AI 기반 검색 애플리케이션: 다국어 환경에서 검색 성능을 향상시켜 전 세계 사용자가 중국어와 영어 관련 정보를 쉽게 찾을 수 있도록 지원합니다.
- 향상된 검색 챗봇 및 Q&A 시스템: 효율적인 이중 언어 고객 서비스 봇을 구축하여 글로벌 고객과의 커뮤니케이션 경험을 최적화합니다.
- 자연어 처리 애플리케이션: 글로벌 시장 트렌드 분석, 국제 시장 전략을 위한 토픽 모델링, 글로벌 커뮤니케이션 관리를 위한 텍스트 분류를 포함합니다.
- 추천 시스템: 중국어와 영어 데이터 인사이트를 활용하여 글로벌 다양한 사용자에게 개인화된 제품과 콘텐츠를 추천합니다.
이 모델을 통해 중국 기업들은 AI 애플리케이션 분야에서 언어의 장벽을 넘어 글로벌 시장에서 선점할 수 있습니다.
tagjina-embeddings-v2-base-zh 쉽게 시작하기
우리의 이중 언어 임베딩 모델을 워크플로우에 빠르게 통합하고 싶으신가요? 간단한 몇 단계만 따르시면 됩니다: https://jina.ai/embeddings를 방문하여 무료 API 키를 받거나 기존 키를 업데이트하고, 드롭다운 메뉴에서 jina-embeddings-v2-base-zh를 선택하면 모델이 즉시 준비되어 탐색하고 사용할 수 있습니다!


tag미래 전망: 다국어 지원과 AWS SageMaker 통합
jina-embeddings-v2-base-zh는 곧 AWS SageMaker와 HuggingFace에서 출시되어 사용자에게 더욱 편리한 서비스를 제공할 예정입니다.


우리는 전 세계 사용자의 다양한 요구를 충족시키기 위해 다국어 임베딩 모델, 특히 유럽 및 기타 국제 언어 지원을 적극적으로 추진하고 있습니다. AWS SageMaker와의 심층 통합을 포함한 흥미로운 업데이트가 곧 출시될 예정이니 기대해 주시기 바랍니다. 우리는 계속해서 서비스 범위를 확대하고 심화할 것입니다.
tag감사의 말: 얼리 테스터들의 소중한 기여에 감사드립니다
jina-embeddings-v2-base-zh-preview 테스트에 참여해 주신 중국 커뮤니티 여러분께 진심으로 감사드립니다. 여러분의 소중한 의견은 우리 모델을 최적화하는 데 중요한 역할을 했습니다. 사용 중 어떤 제안이나 아이디어가 있으시다면 언제든 알려주시기 바랍니다. 여러분의 모든 피드백은 우리가 지속적으로 발전하는 원동력이 됩니다.

정식 버전에서 프리뷰 버전의 점수 인플레이션 문제 해결
이전 프리뷰 버전 모델과 비교하여, 정식 버전 모델은 더 분산되고 합리적인 유사도 점수를 제공합니다. 프리뷰 버전 테스트에서 우리 모델은 유사도 점수의 인플레이션 현상을 보였으며, '안니'와 '증기기관'과 같은 완전히 관련 없는 단어들도 높은 코사인 유사도를 얻었습니다. 정식 버전에서는 콘텐츠 간의 관계를 더 정확하게 반영하도록 모델을 최적화하여 유사도 점수가 더 합리적으로 나타나도록 했습니다.
또한, Jina Embeddings는 이제 최대 8192 Token의 텍스트 처리를 지원하여, 긴 글이든 짧은 문장이든, 심지어 단일 단어나 이름("안니"와 "루나"의 비교)까지도 다양한 유형의 데이터를 처리하는 강력한 능력을 보여줍니다. 이러한 개선은 모델의 정확성을 높일 뿐만 아니라 다양한 데이터를 처리할 때의 유연성과 실용성도 강화했습니다.







