Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
MCP
terminal
命令列
article
llms.txt
smart_toy
智慧體
data_object
Schema
menu_book
文件
登入
login
我們在 Jina-CLIP-v1 上的工作
我們的最愛
總結
活動
八月 07, 2024

ICML2024 亮點觀察:PLaG、XRM、tinyBenchmark、MagicLens、Prompt Sketching 等研究動態

我們在維也納的 ICML 2024 玩得非常開心,想與大家分享我們所說、所見、所學的一切。
Two logos on gray background: upper "ICML International Conference on Machine Learning," lower abstract "vibo" logo.
Florian Hönicke, Michael Günther, Georgios Mastrapas, Scott Martens • 10 分鐘閱讀

International Conference on Machine Learning(國際機器學習會議)是機器學習和人工智慧領域最具權威性的會議之一,今年於 7 月 21 日至 27 日在維也納舉行 2024 年會議。

Interior of a bustling academic conference hall with many attendees, some carrying backpacks, and research posters displayed

這場為期七天的會議提供了密集的學習體驗,包括口頭報告和與其他研究者直接交流想法的機會。目前在強化學習、生命科學 AI、表徵學習、多模態模型,以及 AI 模型開發的核心要素等領域都有許多有趣的研究正在進行。特別重要的是關於大型語言模型物理學的教程,深入探討了 LLM 的內部運作機制,並為 LLM 是記憶資訊還是運用推理來產生回應這個問題提供了令人信服的答案。

tag我們在 Jina-CLIP-v1 上的工作

我們在「多模態基礎模型遇見具身 AI」工作坊(Multi-modal Foundation Models meet Embodied AI)中展示了海報,介紹了我們新的多模態模型 jina-clip-v1。

Jina CLIP: Your CLIP Model Is Also Your Text Retriever
Contrastive Language-Image Pretraining (CLIP) is widely used to train models to align images and texts in a common embedding space by mapping them to fixed-sized vectors. These models are key to multimodal information retrieval and related tasks. However, CLIP models generally underperform in text-only tasks compared to specialized text models. This creates inefficiencies for information retrieval systems that keep separate embeddings and models for text-only and multimodal tasks. We propose a novel, multi-task contrastive training method to address this issue, which we use to train the jina-clip-v1 model to achieve the state-of-the-art performance on both text-image and text-text retrieval tasks.
arXiv.orgAndreas Koukounas

與來自各個領域的國際同行會面討論我們的工作非常具有啟發性。我們的演示獲得了許多正面回饋,許多人對 Jina CLIP 如何統一多模態和單模態對比學習範式很感興趣。討論的範圍從 CLIP 架構的限制,到擴展到其他模態,再到在胜肽和蛋白質匹配中的應用。

0:00
/3:09

Michael Günther 展示 Jina CLIP

tag我們的最愛

我們有機會討論許多其他研究者的專案和演示,以下是我們最喜歡的幾個:

tag像圖一樣規劃(PLaG)

Lin, F., La Malfa, E., Hofmann, V., Yang, E. M., Cohn, A., & Pierrehumbert, J. B. (2024). Graph-Enhanced Large Language Models in Asynchronous Plan Reasoning. arXiv:2402.02805

很多人都知道「少量樣本提示」或「思維鏈提示」。Fangru Lin 在 ICML 上介紹了一個新的更好的方法:像圖一樣規劃(PLaG)。

她的想法很簡單:給予 LLM 的任務被分解成多個子任務,LLM 可以並行或順序地解決這些子任務。這些子任務形成一個執行圖。執行整個圖就能解決高階任務。

在上面的影片中,Fangru Lin 用一個容易理解的例子說明了這個方法。請注意,雖然這改善了結果,但當任務複雜度增加時,LLM 的效能仍會大幅下降。不過,這仍然是朝著正確方向邁進的一大步,並能帶來立即的實際效益。

對我們來說,有趣的是看到她的工作如何與我們在 Jina AI 的提示詞應用相互呼應。我們已經實施了類似圖的提示詞結構,但像她那樣動態生成執行圖是一個我們將探索的新方向。

tag使用 XRM 探索環境

Pezeshki, M., Bouchacourt, D., Ibrahim, M., Ballas, N., Vincent, P., & Lopez-Paz, D. (2024). Discovering Environments with XRM. arXiv:2309.16748

這篇論文提出了一個簡單的演算法,用於發現那些會導致模型依賴於與標籤相關但不能產生準確分類/相關性的特徵的訓練環境。一個著名的例子是水鳥數據集(參見 arXiv:1911.08731),其中包含了在不同背景下的鳥類照片,需要將其分類為水鳥或陸鳥。在訓練過程中,分類器會檢測圖片中的背景是否有水,而不是依靠鳥類本身的特徵。這樣的模型在背景中沒有水的情況下會錯誤分類水鳥。

為了緩解這種行為,需要檢測模型依賴誤導性背景特徵的樣本。這篇論文提出了 XRM 演算法來實現這一點。

該演算法在訓練數據集的兩個不同部分上訓練兩個模型。在訓練過程中,某些樣本的標籤會被翻轉。具體來說,如果另一個模型(未在相應樣本上訓練)對樣本的分類不同,就會發生這種情況。通過這種方式,模型被鼓勵依賴虛假相關性。之後,你可以從訓練數據中提取出一個模型預測的標籤與真實標籤不同的樣本。隨後,可以使用這些信息來訓練更穩健的分類模型,例如使用 Group DRO 演算法。

tag將你的 LLM 評估成本降低 140 倍!

Maia Polo, F., Weber, L., Choshen, L., Sun, Y., Xu, G., & Yurochkin, M. (2024). tinyBenchmarks: evaluating LLMs with Fewer Examples. arXiv:2402.14992

沒錯,你沒聽錯。只要用這個技巧,LLM 評估的成本就能降低到原來的一小部分。

核心想法很簡單:移除所有測試相同模型能力的評估樣本。背後的數學雖然不那麼直觀,但在海報展示環節中 Felipe Maia Polo 解釋得很清楚。請注意,降低 140 倍的效果是針對流行的 MMLU 數據集(大規模多任務語言理解)。對於你自己的評估數據集,則取決於樣本之間的評估結果相關程度。也許你可以跳過很多樣本,或者只能跳過一些。

不妨試試看。我們會持續更新 Jina AI 能夠減少多少評估樣本。

tag使用多邊際匹配差距對比多重表示

Piran, Z., Klein, M., Thornton, J., & Cuturi, M. (2024). Contrasting Multiple Representations with the Multi-Marginal Matching Gap. arXiv:2405.19532
Research paper diagram illustrating Multi-Marginal Matching Gap concepts, with titles, descriptions, and flow charts in blue

這項工作解決了對比學習中的一個常見挑戰:大多數對比損失函數(如 InfoNCE loss)都是對數據點成對操作並測量正樣本對之間的距離。為了擴展到大小為 k > 2 的正樣本元組,對比學習通常試圖將問題簡化為多個對,並累積所有正樣本對的成對損失。作者在此提出了 M3G(Multi-Marginal Matching Gap)損失,這是 Sinkhorn 演算法的修改版本,可以解決多邊際最佳傳輸問題。這個損失函數可以用於數據集由大小 k > 2 的正樣本元組組成的場景,例如,同一物體的 >2 張圖片、具有三個或更多模態的多模態問題,或具有三個或更多同一圖片增強版本的 SimCLR 擴展。實證結果表明,這種方法優於將問題簡單地簡化為成對處理的方法。

tag不需要真實標註!

Robertson, Z., Cha, H., Sheha, A., & Koyejo, S. (2024). Implementability of Information Elicitation Mechanisms with Pre-Trained Language Models. In ICML 2024 Workshop on Theoretical Foundations of Foundation Models. URL https://openreview.net/forum?id=QqMnRGlRJk

來自 Stanford University 的 Zachary Robertson 展示了他關於無需標註數據評估 LLM 的研究。雖然這是理論性的工作,但它對於進階 AI 系統的可擴展監督具有巨大潛力。這不是為了普通的 LLM 用戶,但如果你從事 LLM 評估工作,這絕對值得深入研究。我們已經可以看到,我們可以用這種方式評估 Jina AI 的代理。一旦我們進行第一次實驗,我們會分享結果。

tag模型崩塌是否不可避免?透過積累真實和合成數據打破遞迴詛咒

Gerstgrasser, M., Schaeffer, R., Dey, A., Rafailov, R., Sleight, H., Hughes, J., Korbak, T., Agrawal, R., Pai, D., Gromov, A., Roberts, D. A., Yang, D., Donoho, D. L., & Koyejo, S. (2024). Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data. arXiv:2404.01413
Illustration of two machine learning data processes: "Replace Data" and "Accumulate Data", with detailed flowcharts and model

近期多篇文章(例如這篇Nature 文章)預測,由於網路爬取的訓練數據中包含越來越多的合成數據,新訓練的模型性能可能會隨時間變差。

我們的同事 Scott Martens 也發表了一篇關於模型崩潰的文章,討論了合成數據在模型訓練中可能有用的案例。

When AI Makes AI: Synthetic Data, Model Distillation, And Model Collapse
AI creating AI! Is it the end of the world? Or just another tool to make models do value-adding work? Let's find out!

當訓練數據是由模型的早期版本或使用相同數據訓練的模型產生時,模型訓練可能會崩潰。這篇論文的實驗顯示了略微不同的圖景:崩潰只發生在用合成數據「替換」真實數據的情況下,這是之前實驗中所做的。然而,當用合成數據「增強」真實數據時,在所得模型的性能上沒有測量到變化。這些結果表明類似模型崩潰的情況不會發生。但是,這再次證明,使用額外的合成數據無助於訓練出一個普遍優於用於創建這些合成數據點的模型。

tagAI 的腦部手術現在成為可能

Singh, S., Ravfogel, S., Herzig, J., Aharoni, R., Cotterell, R., & Kumaraguru, P. (2024). Representation Surgery: Theory and Practice of Affine Steering. arXiv:2402.09631

假設你想預測某人的職業但不想預測其性別。這項來自 Google Research、ETH Zürich、International Institute of Information Technology Hyderabad (IIITH) 和 Bar-Ilan University 的研究展示了如何使用轉向向量和協方差匹配來控制偏差。

tagMagicLens - 使用開放式指令的自監督圖像檢索

Zhang, K., Luan, Y., Hu, H., Lee, K., Qiao, S., Chen, W., Su, Y., & Chang, M.-W. (2024). MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions. arXiv:2403.19651
Interactive slide showing MagicLens tool for visually guided navigation with tasks like identifying buildings and comparing h

這篇論文介紹了 MagicLens 模型,這是一系列在查詢圖像 + 指令 + 目標圖像三元組上訓練的自監督圖像檢索模型。

作者介紹了一個數據收集/整理管道,該管道從網路收集圖像對,並使用 LLMs 合成開放式文本指令,這些指令將圖像與超越純視覺相似性的多樣化語義關係聯繫起來。這個管道被用來生產 3,670 萬個高質量的三元組。然後使用該數據集來訓練一個具有共享參數的簡單雙編碼器架構。視覺和語言編碼器的骨幹分別使用 CoCa 或 CLIP base 和 large 變體進行初始化。引入了一個單一的多頭注意力池化器,將兩個多模態輸入壓縮成單一嵌入。訓練目標是將查詢圖像和指令對與目標圖像和空字符串指令進行對比,使用簡單的 InfoNCE 損失來訓練 MagicLens。作者展示了基於指令的圖像檢索的評估結果。

tagPrompt Sketching - 提示的新方式

Beurer-Kellner, L., Müller, M. N., Fischer, M., & Vechev, M. (2023). Prompt Sketching for Large Language Models. arXiv:2311.04954

我們提示 LLMs 的方式正在改變。Prompt Sketching 讓我們能夠給生成模型固定的約束。不是僅僅提供一個指令並希望模型做你想要的,而是定義一個完整的模板,強制模型生成你想要的內容。

不要將這與微調為提供結構化 JSON 格式的 LLMs 混淆。使用微調方法,模型仍然可以自由生成它想要的內容。Prompt Sketching 則不同。它為提示工程師提供了一個全新的工具箱,並開闢了需要探索的研究領域。在上面的視頻中,Mark Müller 詳細解釋了這個新範式。

你也可以查看他們的開源項目 LMQL。

tagRepoformer - 用於儲存庫級代碼完成的選擇性檢索

Wu, D., Ahmad, W. U., Zhang, D., Ramanathan, M. K., & Ma, X. (2024). Repoformer: Selective Retrieval for Repository-Level Code Completion. arXiv:2403.10059

對於許多查詢來說,RAG 並不真正有幫助,因為查詢太簡單或檢索系統找不到相關文檔,可能是因為根本沒有相關文檔。如果模型依賴誤導性或缺失的來源,這會導致生成時間更長和性能更低。

這篇論文通過使 LLMs 能夠自我評估檢索是否有用來解決這個問題。他們在代碼完成模型上展示了這種方法,該模型被訓練用來填充代碼模板中的空白。對於給定的模板,系統首先決定檢索結果是否有用,如果有用,就調用檢索器。最後,無論是否將檢索結果添加到其提示中,代碼 LLM 都會生成缺失的上下文。

tag柏拉圖表徵假說

Huh, M., Cheung, B., Wang, T., & Isola, P. (2024). The Platonic Representation Hypothesis. arXiv:2405.07987
Illustration of "The Platonic Representation Hypothesis" with geometric shapes, mathematical text, and diagrams explaining a

「柏拉圖表徵假說」認為神經網絡模型會傾向於收斂到對世界的共同表徵。借鑒柏拉圖的理型論中存在一個「理念」領域的觀點,這些理念以扭曲的形式呈現給我們,我們只能間接觀察到,作者聲稱我們的 AI 模型似乎會收斂到單一的現實表徵,無論訓練架構、訓練數據,甚至輸入模態如何。數據規模和模型規模越大,它們的表徵似乎越相似。

作者們考慮向量表示並使用核心對齊指標來衡量表示的對齊程度,具體來說是使用互近鄰指標,該指標測量由兩個核心 K1 和 K2 所產生的 k 近鄰集合的平均交集,並以 k 進行標準化。本研究提供了實證證據,表明隨著模型和數據集規模的增長以及性能的提升,核心之間的對齊程度也越來越高。即使在比較不同模態的模型(如文本模型和圖像模型)時,也可以觀察到這種對齊現象。

tag總結

雖然最初對擴展定律的熱情開始減弱,但 ICML 2024 已經展示出大量新的、多樣化的創意人才已經進入我們的領域,這讓我們確信進展遠未結束。

我們在 ICML 2024 玩得很開心,你可以打賭我們 2025 年一定會再來 🇨🇦。

類別:
活動
rss_feed

閱讀更多
八月 11, 2025 • 8 分鐘閱讀
What We Learned at SIGIR 2025
Michael Günther
Bo Wang
Scott Martens
Conference scene in a large auditorium with a "SIGIR 2025" banner on the projected screen, a speaker on stage, and attendees
五月 25, 2025 • 21 分鐘閱讀
What We Learned at ICLR2025
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
十一月 05, 2024 • 2 分鐘閱讀
Call for Participants: EMNLP 2024 BoF on Embeddings, Reranker & Small LMs for Better Search
Jina AI
Event poster for "Embedding Reranker, Small LM & Better Search" on Nov 14, 2024, from 10:30 to 12:00 at Miami Lecture Hall. F
當前語言 / 主題
搜尋底座
Reader
向量模型
重排模型
獲取 Jina API 金鑰
速率限制
關於我們
新聞
下載 Jina 標誌
open_in_new
下載 Elastic 標誌
open_in_new
API 狀態
Elastic © 2026.安全條款及條件隱私管理 Cookie請勿出售或分享我的個人資訊
本網站及其所有相關內容、軟體、產品和服務僅供專業使用,不面向消費者。