International Conference on Machine Learning(國際機器學習會議)是機器學習和人工智慧領域最具權威性的會議之一,今年於 7 月 21 日至 27 日在維也納舉行 2024 年會議。

這場為期七天的會議提供了密集的學習體驗,包括口頭報告和與其他研究者直接交流想法的機會。目前在強化學習、生命科學 AI、表徵學習、多模態模型,以及 AI 模型開發的核心要素等領域都有許多有趣的研究正在進行。特別重要的是關於大型語言模型物理學的教程,深入探討了 LLM 的內部運作機制,並為 LLM 是記憶資訊還是運用推理來產生回應這個問題提供了令人信服的答案。
tag我們在 Jina-CLIP-v1 上的工作
我們在「多模態基礎模型遇見具身 AI」工作坊(Multi-modal Foundation Models meet Embodied AI)中展示了海報,介紹了我們新的多模態模型 jina-clip-v1。

與來自各個領域的國際同行會面討論我們的工作非常具有啟發性。我們的演示獲得了許多正面回饋,許多人對 Jina CLIP 如何統一多模態和單模態對比學習範式很感興趣。討論的範圍從 CLIP 架構的限制,到擴展到其他模態,再到在胜肽和蛋白質匹配中的應用。
Michael Günther 展示 Jina CLIP
tag我們的最愛
我們有機會討論許多其他研究者的專案和演示,以下是我們最喜歡的幾個:
tag像圖一樣規劃(PLaG)
很多人都知道「少量樣本提示」或「思維鏈提示」。Fangru Lin 在 ICML 上介紹了一個新的更好的方法:像圖一樣規劃(PLaG)。
她的想法很簡單:給予 LLM 的任務被分解成多個子任務,LLM 可以並行或順序地解決這些子任務。這些子任務形成一個執行圖。執行整個圖就能解決高階任務。
在上面的影片中,Fangru Lin 用一個容易理解的例子說明了這個方法。請注意,雖然這改善了結果,但當任務複雜度增加時,LLM 的效能仍會大幅下降。不過,這仍然是朝著正確方向邁進的一大步,並能帶來立即的實際效益。
對我們來說,有趣的是看到她的工作如何與我們在 Jina AI 的提示詞應用相互呼應。我們已經實施了類似圖的提示詞結構,但像她那樣動態生成執行圖是一個我們將探索的新方向。
tag使用 XRM 探索環境
這篇論文提出了一個簡單的演算法,用於發現那些會導致模型依賴於與標籤相關但不能產生準確分類/相關性的特徵的訓練環境。一個著名的例子是水鳥數據集(參見 arXiv:1911.08731),其中包含了在不同背景下的鳥類照片,需要將其分類為水鳥或陸鳥。在訓練過程中,分類器會檢測圖片中的背景是否有水,而不是依靠鳥類本身的特徵。這樣的模型在背景中沒有水的情況下會錯誤分類水鳥。
為了緩解這種行為,需要檢測模型依賴誤導性背景特徵的樣本。這篇論文提出了 XRM 演算法來實現這一點。
該演算法在訓練數據集的兩個不同部分上訓練兩個模型。在訓練過程中,某些樣本的標籤會被翻轉。具體來說,如果另一個模型(未在相應樣本上訓練)對樣本的分類不同,就會發生這種情況。通過這種方式,模型被鼓勵依賴虛假相關性。之後,你可以從訓練數據中提取出一個模型預測的標籤與真實標籤不同的樣本。隨後,可以使用這些信息來訓練更穩健的分類模型,例如使用 Group DRO 演算法。
tag將你的 LLM 評估成本降低 140 倍!
沒錯,你沒聽錯。只要用這個技巧,LLM 評估的成本就能降低到原來的一小部分。
核心想法很簡單:移除所有測試相同模型能力的評估樣本。背後的數學雖然不那麼直觀,但在海報展示環節中 Felipe Maia Polo 解釋得很清楚。請注意,降低 140 倍的效果是針對流行的 MMLU 數據集(大規模多任務語言理解)。對於你自己的評估數據集,則取決於樣本之間的評估結果相關程度。也許你可以跳過很多樣本,或者只能跳過一些。
不妨試試看。我們會持續更新 Jina AI 能夠減少多少評估樣本。
tag使用多邊際匹配差距對比多重表示

這項工作解決了對比學習中的一個常見挑戰:大多數對比損失函數(如 InfoNCE loss)都是對數據點成對操作並測量正樣本對之間的距離。為了擴展到大小為 k > 2 的正樣本元組,對比學習通常試圖將問題簡化為多個對,並累積所有正樣本對的成對損失。作者在此提出了 M3G(Multi-Marginal Matching Gap)損失,這是 Sinkhorn 演算法的修改版本,可以解決多邊際最佳傳輸問題。這個損失函數可以用於數據集由大小 k > 2 的正樣本元組組成的場景,例如,同一物體的 >2 張圖片、具有三個或更多模態的多模態問題,或具有三個或更多同一圖片增強版本的 SimCLR 擴展。實證結果表明,這種方法優於將問題簡單地簡化為成對處理的方法。
tag不需要真實標註!
來自 Stanford University 的 Zachary Robertson 展示了他關於無需標註數據評估 LLM 的研究。雖然這是理論性的工作,但它對於進階 AI 系統的可擴展監督具有巨大潛力。這不是為了普通的 LLM 用戶,但如果你從事 LLM 評估工作,這絕對值得深入研究。我們已經可以看到,我們可以用這種方式評估 Jina AI 的代理。一旦我們進行第一次實驗,我們會分享結果。
tag模型崩塌是否不可避免?透過積累真實和合成數據打破遞迴詛咒

近期多篇文章(例如這篇Nature 文章)預測,由於網路爬取的訓練數據中包含越來越多的合成數據,新訓練的模型性能可能會隨時間變差。
我們的同事 Scott Martens 也發表了一篇關於模型崩潰的文章,討論了合成數據在模型訓練中可能有用的案例。

當訓練數據是由模型的早期版本或使用相同數據訓練的模型產生時,模型訓練可能會崩潰。這篇論文的實驗顯示了略微不同的圖景:崩潰只發生在用合成數據「替換」真實數據的情況下,這是之前實驗中所做的。然而,當用合成數據「增強」真實數據時,在所得模型的性能上沒有測量到變化。這些結果表明類似模型崩潰的情況不會發生。但是,這再次證明,使用額外的合成數據無助於訓練出一個普遍優於用於創建這些合成數據點的模型。
tagAI 的腦部手術現在成為可能
假設你想預測某人的職業但不想預測其性別。這項來自 Google Research、ETH Zürich、International Institute of Information Technology Hyderabad (IIITH) 和 Bar-Ilan University 的研究展示了如何使用轉向向量和協方差匹配來控制偏差。
tagMagicLens - 使用開放式指令的自監督圖像檢索

這篇論文介紹了 MagicLens 模型,這是一系列在查詢圖像 + 指令 + 目標圖像三元組上訓練的自監督圖像檢索模型。
作者介紹了一個數據收集/整理管道,該管道從網路收集圖像對,並使用 LLMs 合成開放式文本指令,這些指令將圖像與超越純視覺相似性的多樣化語義關係聯繫起來。這個管道被用來生產 3,670 萬個高質量的三元組。然後使用該數據集來訓練一個具有共享參數的簡單雙編碼器架構。視覺和語言編碼器的骨幹分別使用 CoCa 或 CLIP base 和 large 變體進行初始化。引入了一個單一的多頭注意力池化器,將兩個多模態輸入壓縮成單一嵌入。訓練目標是將查詢圖像和指令對與目標圖像和空字符串指令進行對比,使用簡單的 InfoNCE 損失來訓練 MagicLens。作者展示了基於指令的圖像檢索的評估結果。
tagPrompt Sketching - 提示的新方式
我們提示 LLMs 的方式正在改變。Prompt Sketching 讓我們能夠給生成模型固定的約束。不是僅僅提供一個指令並希望模型做你想要的,而是定義一個完整的模板,強制模型生成你想要的內容。
不要將這與微調為提供結構化 JSON 格式的 LLMs 混淆。使用微調方法,模型仍然可以自由生成它想要的內容。Prompt Sketching 則不同。它為提示工程師提供了一個全新的工具箱,並開闢了需要探索的研究領域。在上面的視頻中,Mark Müller 詳細解釋了這個新範式。
你也可以查看他們的開源項目 LMQL。
tagRepoformer - 用於儲存庫級代碼完成的選擇性檢索
對於許多查詢來說,RAG 並不真正有幫助,因為查詢太簡單或檢索系統找不到相關文檔,可能是因為根本沒有相關文檔。如果模型依賴誤導性或缺失的來源,這會導致生成時間更長和性能更低。
這篇論文通過使 LLMs 能夠自我評估檢索是否有用來解決這個問題。他們在代碼完成模型上展示了這種方法,該模型被訓練用來填充代碼模板中的空白。對於給定的模板,系統首先決定檢索結果是否有用,如果有用,就調用檢索器。最後,無論是否將檢索結果添加到其提示中,代碼 LLM 都會生成缺失的上下文。
tag柏拉圖表徵假說

「柏拉圖表徵假說」認為神經網絡模型會傾向於收斂到對世界的共同表徵。借鑒柏拉圖的理型論中存在一個「理念」領域的觀點,這些理念以扭曲的形式呈現給我們,我們只能間接觀察到,作者聲稱我們的 AI 模型似乎會收斂到單一的現實表徵,無論訓練架構、訓練數據,甚至輸入模態如何。數據規模和模型規模越大,它們的表徵似乎越相似。
作者們考慮向量表示並使用核心對齊指標來衡量表示的對齊程度,具體來說是使用互近鄰指標,該指標測量由兩個核心 K1 和 K2 所產生的 k 近鄰集合的平均交集,並以 k 進行標準化。本研究提供了實證證據,表明隨著模型和數據集規模的增長以及性能的提升,核心之間的對齊程度也越來越高。即使在比較不同模態的模型(如文本模型和圖像模型)時,也可以觀察到這種對齊現象。
tag總結
雖然最初對擴展定律的熱情開始減弱,但 ICML 2024 已經展示出大量新的、多樣化的創意人才已經進入我們的領域,這讓我們確信進展遠未結束。
我們在 ICML 2024 玩得很開心,你可以打賭我們 2025 年一定會再來 🇨🇦。









