新闻

加速搜索 AI,集腋成裘。

RSS
甄选
学术论文
arXiv
九月 02, 2026
jina-ocr-v1: Efficient Document Parsing with Speculative Decoding and Dense Verifiable Rewards
arXiv
七月 20, 2026
jina-reranker-v3.5: An Efficient Listwise Reranker with Hybrid Attention and Self-Distillation
SIGIR 2026
五月 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers
SIGIR 2026
二月 17, 2026
jina-embeddings-v5-text: Task-Targeted Embedding Distillation
ICLR 2026
一月 22, 2026
Embedding Compression via Spherical Coordinates
arXiv
十二月 29, 2025
Vision Encoders in Vision-Language Models: A Survey
ICLR 2026
十二月 04, 2025
Jina-VLM: Small Multilingual Vision Language Model
AAAI 2026
十月 01, 2025
jina-reranker-v3: Last but Not Late Interaction for Document Reranking
NeurIPS 2025
八月 31, 2025
Efficient Code Embeddings from Code Generation Models
EMNLP 2025
六月 24, 2025
jina-embeddings-v4: Universal Embeddings for Multimodal Multilingual Retrieval
ICLR 2025
三月 04, 2025
ReaderLM-v2: Small Language Model for HTML to Markdown and JSON
ACL 2025
十二月 17, 2024
AIR-Bench: Automated Heterogeneous Information Retrieval Benchmark
ICLR 2025
十二月 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images
ECIR 2025
九月 18, 2024
jina-embeddings-v3: Multilingual Embeddings With Task LoRA
SIGIR 2025
九月 07, 2024
Late Chunking: Contextual Chunk Embeddings Using Long-Context Embedding Models
EMNLP 2024
八月 30, 2024
Jina-ColBERT-v2: A General-Purpose Multilingual Late Interaction Retriever
WWW 2025
六月 21, 2024
Leveraging Passage Embeddings for Efficient Listwise Reranking with Large Language Models
ICML 2024
五月 30, 2024
Jina CLIP: Your CLIP Model Is Also Your Text Retriever
arXiv
二月 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings
arXiv
十月 30, 2023
Jina Embeddings 2: 8192-Token General-Purpose Text Embeddings for Long Documents
EMNLP 2023
七月 20, 2023
Jina Embeddings: A Novel Set of High-Performance Sentence Embedding Models
共计 21 篇论文。

九月 14, 2026 • 9 分钟阅读
jina-ocr-v1:在低成本 GPU 上实现更快的文档解析
jina-ocr-v1 是一款拥有 34 亿参数和 5.7 亿激活参数的视觉语言模型,在 OmniDocBench v1.6 上得分为 91.1,在 olmOCR-Bench 上得分为 83.4。
八月 03, 2026 • 11 分钟阅读
jina-reranker-v3.5:基于混合注意力机制与自蒸馏的更高效列表式重排器
一款在 BEIR 基准测试中超越 Qwen3-Reranker-4B 的 0.6B 参数列表式重排器,其重排速度比 v3 快 1.56 倍,并在半结构化检索任务中提升了 9.6 个 nDCG@10 分值。
五月 12, 2026 • 7 分钟阅读
jina-embeddings-v5-omni:支持文本、图像、音频和视频的向量模型
一个模型,四种模态:文本、图像、音频、视频。业界领先的 1.6B 和 0.9B 全能型向量模型。
三月 11, 2026 • 7 分钟阅读
从多模态大模型中引导音频向量模型
将任何多模态大模型转化为小型音频向量模型,仅需 1/25 的数据量即可超越 CLAP。
三月 06, 2026 • 6 分钟阅读
通过原始数值识别向量模型
一个通过读取原始数字来为向量模型提取指纹的微型 Transformer。无需特征工程。
二月 19, 2026 • 7 分钟阅读
jina-embeddings-v5-text:全新的 SOTA 小型多语言向量模型
两款性能领先的 1B 以下多语言向量模型,现已在 Elastic Inference Service、Llama.cpp 和 MLX 上可用。
十二月 04, 2025 • 7 分钟阅读
Jina-VLM:小型多语言视觉语言模型
全新 2B 视觉语言模型在多语言 VQA 上实现 SOTA,在纯文本任务上没有灾难性遗忘。
十月 03, 2025 • 7 分钟阅读
Jina Reranker v3:用于 SOTA 多语言检索的 0.6B Listwise 重排器
全新 0.6B 参数的 listwise 重排器,可在单个上下文窗口中考虑查询和所有候选文档。
九月 09, 2025 • 11 分钟阅读
Llama.cpp 和 GGUF 中的多模态向量模型
我们为 llama.cpp 和 GGUF 引入了多模态 向量模型,并在过程中发现了一些令人惊讶的问题。
九月 04, 2025 • 6 分钟阅读
Jina Code Embeddings:0.5B 和 1.5B 参数规模下的 SOTA 代码检索向量模型
代码生成大模型 → 代码向量模型:0.5B/1.5B 模型在 25 个代码检索基准测试中实现了 SOTA 性能。