In unserer aktuellen Publikation, Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings, haben wir die Entwicklung unserer Deutsch-Englisch und Spanisch-Englisch bilingualen Text-Embedding-Modelle detailliert beschrieben.


Unser Ansatz nutzt Multi-Task Contrastive Learning und eine fortschrittliche Datenkuratierungs-Pipeline, wobei der Fokus auf bilinguale Fähigkeiten gerichtet ist und die Unterstützung auf 8192 Token erweitert wurde. Diese Methode ermöglicht es unseren Modellen, sowohl im Verständnis der Zielsprachen als auch bei der effizienten Durchführung sprachübergreifender Evaluierungen hervorragende Leistungen zu erbringen.


Zusätzlich zu den in der Publikation behandelten bilingualen Modellen haben wir auch bilinguale Chinesisch-Englisch und monolinguale Englisch Modelle entwickelt. Diese Ergänzungen zeigen unser Engagement für die Abdeckung eines breiten Spektrums sprachlicher Anforderungen und die Weiterentwicklung unserer Fähigkeiten in der Sprachverarbeitung.


Unsere bilingualen Modelle zeichnen sich durch ihre Effizienz aus, da sie mit optimierten Vokabulargrößen arbeiten und dadurch weniger Parameter und Speicher benötigen. Diese Effizienz unterstreicht unser Engagement für die Entwicklung leistungsstarker und gleichzeitig ressourceneffizienter Werkzeuge für die Sprachverarbeitung.
Nach der Veröffentlichung unserer Publikation haben wir den Massive Text Embedding Benchmark (MTEB) um Benchmarks für unsere Englisch-Deutsch und Englisch-Spanisch Embedding-Modelle erweitert. Diese Erweiterung ist Teil unserer Bemühungen, weitere Forschung und Fortschritte in der Text-Embedding-Technologie für nicht-englische Sprachen anzuregen.
Bei Jina AI ist es unser Ziel, die Verarbeitung und das Verständnis mehrerer Sprachen zu verbessern und mit unseren Entwicklungen im Bereich bilingualer und monolingualer Text-Embedding-Modelle zum NLP-Bereich beizutragen.







