개요
jina-embeddings-v2-base-code는 161M 파라미터 코드 임베딩 모델로, 30개 언어의 프로그래밍 코드를 공유하는 768차원 의미 공간으로 매핑합니다. 8,192토큰 컨텍스트 윈도우를 갖추고 있어, 절단 없이 전체 함수 및 여러 파일 코드 검색을 지원한 최초의 Jina 임베딩 모델입니다. 출시 시점 CodeNetSearch 벤치마크 15개 중 9개에서 1위였습니다.
방법
모델은 161M 파라미터의 트랜스퍼머 기반 인코더를 사용하며, Python, JavaScript, Java, PHP, Go, Ruby에 중점을 둔 다양한 프로그래밍 언어 데이터셋에서 학습되었습니다. 8,192토큰 컨텍스트 윈도우(ALiBi 위치 인코딩을 통해)는 함수 전체와 작은 파일을 단일 포워드 패스에서 처리할 수 있게 합니다. 학습에는 코드-텍스트 쌍(자연어 설명과 코드 구현의 짝짓기)에서의 대비 사전학습과, 어려운 음의(negative) 마이닝을 포함한 코드 검색 데이터셋에서의 지도 정밀조정이 포함됩니다. 768차원 임베딩은 문법 구조와 의미를 모두 포착해, 다른 언어의 기능적으로 동등한 코드가 임베딩 공간의 인접 영역으로 매핑되는 크로스 언어 코드 매칭을 가능하게 합니다.
성능
출시 시점, 모델은 CodeNetSearch 벤치마크 15개 중 9개에서 선두를 유지하며 Microsoft와 Salesforce의 코드 임베딩 모델을 능가했고, 더 효율적인 307MB 풋프린트를 유지했습니다. 8,192토큰 컨텍스트는 경쟁 코드 임베딩 모델보다 4–16배 커, 파일 전체와 복잡한 코드 블록에 대한 검색을 가능하게 했습니다. 크로스 언어 코드 이해는 특히 강점이었으며, 다른 프로그래밍 언어 간 기능적으로 동등한 스니펫을 매칭했습니다. 2026년에 jina-code-embeddings-0.5b와 jina-code-embeddings-1.5b가 자기회귀 백본, 32K 컨텍스트, 현저히 높은 검색 정확도로 이 모델을 대체합니다.
모범 사례
단일 언어 또는 크로스 언어 코드베이스의 코드 검색, 문서 검색, 코드 재사용에 사용하세요. 8,192토큰을 초과하는 문서에는 함수 또는 클래스 경계에서 청킹(chunking)을 구현하세요. 모델은 벡터 데이터베이스(Qdrant, Weaviate, MongoDB) 및 RAG 프레임워크와 통합됩니다. 새로운 코드 검색 프로젝트에는 jina-code-embeddings-1.5b(1.5B 파라미터, 32K 컨텍스트, SOTA 정확도) 또는 jina-code-embeddings-0.5b(494M 파라미터, 엣지 친화적)를 권장합니다. 프로덕션에는 CUDA 지원 GPU를 권장합니다. Python, JavaScript, Java, PHP, Go, Ruby에서 가장 강한 성능을 보여주며, 30개 이상 언어를 점진적 성능 저하와 함께 지원합니다.









