Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Reader
Converti qualsiasi URL in Markdown per un migliore ancoraggio dei LLM.
Embeddings
Embeddings multimodali e multilingue.
Reranker
Reranker per massimizzare la pertinenza dei risultati di ricerca.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
Il Nostro Lavoro su Jina-CLIP-v1
I Nostri Preferiti
Riepilogo
Evento
agosto 07, 2024

Cosa abbiamo imparato a ICML2024 con PLaG, XRM, tinyBenchmark, MagicLens, Prompt Sketching e altro

Ci siamo divertiti tantissimo all'ICML 2024 a Vienna, e vogliamo condividere con voi tutto ciò che abbiamo detto, visto e imparato.
Two logos on gray background: upper "ICML International Conference on Machine Learning," lower abstract "vibo" logo.
Florian Hönicke, Michael Günther, Georgios Mastrapas, Scott Martens • 10 minuti letti

L'International Conference on Machine Learning è una delle conferenze più prestigiose nella comunità del machine learning e dell'intelligenza artificiale e ha tenuto il suo incontro 2024 a Vienna dal 21 al 27 luglio di quest'anno.

Interior of a bustling academic conference hall with many attendees, some carrying backpacks, and research posters displayed

La conferenza è stata un'esperienza di apprendimento intensiva di 7 giorni, con presentazioni orali e opportunità di scambiare idee direttamente con altri ricercatori. C'è molto lavoro interessante in corso nel reinforcement learning, nell'AI per le scienze della vita, nel representation learning, nei modelli multi-modali e, naturalmente, negli elementi fondamentali dello sviluppo dei modelli AI. Di particolare importanza è stato il tutorial sulla Physics of Large Language Models, che ha esplorato approfonditamente il funzionamento interno dei LLM e ha offerto risposte convincenti alla domanda se gli LLM memorizzino le informazioni o applichino il ragionamento quando dicono le cose.

tagIl Nostro Lavoro su Jina-CLIP-v1

Abbiamo presentato un poster del lavoro dietro il nostro nuovo modello multi-modale jina-clip-v1 come parte del workshop Multi-modal Foundation Models meet Embodied AI.

Jina CLIP: Your CLIP Model Is Also Your Text Retriever
Contrastive Language-Image Pretraining (CLIP) is widely used to train models to align images and texts in a common embedding space by mapping them to fixed-sized vectors. These models are key to multimodal information retrieval and related tasks. However, CLIP models generally underperform in text-only tasks compared to specialized text models. This creates inefficiencies for information retrieval systems that keep separate embeddings and models for text-only and multimodal tasks. We propose a novel, multi-task contrastive training method to address this issue, which we use to train the jina-clip-v1 model to achieve the state-of-the-art performance on both text-image and text-text retrieval tasks.
arXiv.orgAndreas Koukounas

Incontrare e discutere il nostro lavoro con colleghi internazionali che operano in molti campi è stato molto stimolante. La nostra presentazione ha ricevuto molti feedback positivi, con molte persone interessate al modo in cui Jina CLIP unifica i paradigmi di apprendimento contrastivo multi-modale e uni-modale. Le discussioni hanno spaziato dalle limitazioni dell'architettura CLIP alle estensioni per modalità aggiuntive fino alle applicazioni nell'abbinamento di peptidi e proteine.

0:00
/3:09

Michael Günther presenta Jina CLIP

tagI Nostri Preferiti

Abbiamo avuto l'opportunità di discutere molti progetti e presentazioni di altri ricercatori, ed ecco alcuni dei nostri preferiti:

tagPlan Like a Graph (PLaG)

Lin, F., La Malfa, E., Hofmann, V., Yang, E. M., Cohn, A., & Pierrehumbert, J. B. (2024). Graph-Enhanced Large Language Models in Asynchronous Plan Reasoning. arXiv:2402.02805

Molti conoscono il "Few-Shot Prompting" o il "Chain of Thought prompting". Fangru Lin ha presentato all'ICML un metodo nuovo e migliore: Plan Like a Graph (PLaG).

La sua idea è semplice: un compito assegnato a un LLM viene scomposto in sotto-compiti che un LLM può risolvere in parallelo o in sequenza. Questi sotto-compiti formano un grafo di esecuzione. L'esecuzione dell'intero grafo risolve il compito di alto livello.

Nel video sopra, Fangru Lin spiega il metodo usando un esempio facilmente comprensibile. Da notare che anche se questo migliora i risultati, gli LLM soffrono ancora di un drastico degradamento quando aumenta la complessità del task. Detto questo, rimane comunque un ottimo passo nella giusta direzione e fornisce benefici pratici immediati.

Per noi, è interessante vedere come il suo lavoro sia parallelo alle nostre applicazioni di prompt a Jina AI. Abbiamo già implementato una struttura di prompt simile a un grafo, tuttavia, generare dinamicamente un grafo di esecuzione come ha fatto lei è una nuova direzione che esploreremo.

tagScoprire gli Ambienti con XRM

Pezeshki, M., Bouchacourt, D., Ibrahim, M., Ballas, N., Vincent, P., & Lopez-Paz, D. (2024). Discovering Environments with XRM. arXiv:2309.16748

Questo paper presenta un algoritmo semplice per scoprire ambienti di training che possono causare un modello a fare affidamento su caratteristiche che correlano con le etichette ma non inducono una classificazione/rilevanza accurata. Un esempio famoso è il dataset waterbirds (vedi arXiv:1911.08731), che contiene foto di uccelli su sfondi diversi che dovrebbero essere classificati come uccelli acquatici o terrestri. Durante il training, il classificatore rileva se lo sfondo nelle immagini mostra acqua o no invece di basarsi sulle caratteristiche degli uccelli stessi. Un tale modello classificherà erroneamente gli uccelli acquatici se non c'è acqua nello sfondo.

Per mitigare questo comportamento, è necessario rilevare i campioni dove il modello si basa su caratteristiche dello sfondo fuorvianti. Questo paper presenta l'algoritmo XRM per farlo.

L'algoritmo addestra due modelli su due parti distinte del dataset di training. Durante l'addestramento, le etichette di alcuni campioni vengono invertite. Nello specifico, questo accade se l'altro modello (che non è addestrato sul rispettivo campione) classifica un campione diversamente. In questo modo, i modelli sono incoraggiati a basarsi su correlazioni spurie. Successivamente, è possibile estrarre campioni dai dati di training dove un'etichetta predetta da uno dei modelli differisce dalla verità di base. In seguito, si possono utilizzare queste informazioni per addestrare modelli di classificazione più robusti, per esempio con l'algoritmo Group DRO.

tagRiduci i Costi di Valutazione LLM di un Fattore 140!

Maia Polo, F., Weber, L., Choshen, L., Sun, Y., Xu, G., & Yurochkin, M. (2024). tinyBenchmarks: evaluating LLMs with Fewer Examples. arXiv:2402.14992

Sì, hai sentito bene. Con questo trucco, il costo della Valutazione LLM può essere ridotto a una minima frazione.

L'idea centrale è semplice: Rimuovere tutti i campioni di valutazione che testano la stessa capacità del modello. La matematica dietro è meno diretta ma ben spiegata da Felipe Maia Polo che ha presentato il suo lavoro durante la sessione poster. Da notare che la riduzione di un fattore 140 si applica al popolare dataset MMLU (Massive Multitask Language Understanding). Per i tuoi dataset di valutazione, dipende da quanto i risultati della valutazione dei campioni correlano tra loro. Forse puoi saltare molti campioni o solo pochi.

Provalo. Ti terremo aggiornato su quanto noi di Jina AI siamo riusciti a ridurre i campioni di valutazione.

tagContrastare Rappresentazioni Multiple con il Multi-Marginal Matching Gap

Piran, Z., Klein, M., Thornton, J., & Cuturi, M. (2024). Contrasting Multiple Representations with the Multi-Marginal Matching Gap. arXiv:2405.19532
Research paper diagram illustrating Multi-Marginal Matching Gap concepts, with titles, descriptions, and flow charts in blue

Questo lavoro affronta una sfida comune nell'apprendimento contrastivo: La maggior parte delle funzioni di loss contrastive come la InfoNCE loss operano su coppie di punti dati e misurano la distanza tra coppie positive. Per espandere su tuple positive di dimensione k > 2, l'apprendimento contrastivo di solito cerca di ridurre il problema a multiple coppie e accumulare perdite a coppie per tutte le coppie positive. Gli autori qui propongono la loss M3G (Multi-Marginal Matching Gap), una versione modificata dell'algoritmo di Sinkhorn, che risolve il problema del Trasporto Ottimale Multi-Marginale. Questa funzione di loss può essere utilizzata in scenari dove i dataset consistono in tuple positive con dimensione k > 2, per esempio, >2 immagini dello stesso oggetto, problemi multi-modali con tre o più modalità, o un'estensione SimCLR con tre o più augmentazioni della stessa immagine. I risultati empirici mostrano che questo metodo supera la riduzione ingenua del problema a coppie.

tagNon Serve la Ground Truth!

Robertson, Z., Cha, H., Sheha, A., & Koyejo, S. (2024). Implementability of Information Elicitation Mechanisms with Pre-Trained Language Models. In ICML 2024 Workshop on Theoretical Foundations of Foundation Models. URL https://openreview.net/forum?id=QqMnRGlRJk

Zachary Robertson dalla Stanford University ha presentato il suo lavoro sulla valutazione del tuo LLM senza dati etichettati. Da notare che sebbene questo sia un lavoro teorico, ha molto potenziale per la supervisione scalabile di sistemi AI avanzati. Non è per utenti casuali di LLM, ma se lavori sulla valutazione LLM è sicuramente qualcosa da approfondire. Possiamo già vedere che potremmo valutare i nostri agenti a Jina AI in questo modo. Condivideremo i risultati una volta eseguiti i primi esperimenti.

tagIl Collasso del Modello è Inevitabile? Rompere la Maledizione della Ricorsione Accumulando Dati Reali e Sintetici

Gerstgrasser, M., Schaeffer, R., Dey, A., Rafailov, R., Sleight, H., Hughes, J., Korbak, T., Agrawal, R., Pai, D., Gromov, A., Roberts, D. A., Yang, D., Donoho, D. L., & Koyejo, S. (2024). Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data. arXiv:2404.01413
Illustration of two machine learning data processes: "Replace Data" and "Accumulate Data", with detailed flowcharts and model

Diversi articoli (come questo articolo di Nature) hanno recentemente previsto che le prestazioni dei nuovi modelli addestrati potrebbero peggiorare nel tempo poiché i dati di training acquisiti dal web contengono una quantità sempre maggiore di dati sintetici.

Il nostro collega Scott Martens ha anche pubblicato un articolo sul collasso dei modelli e ha discusso i casi in cui i dati sintetici possono essere utili per l'addestramento dei modelli.

When AI Makes AI: Synthetic Data, Model Distillation, And Model Collapse
AI creating AI! Is it the end of the world? Or just another tool to make models do value-adding work? Let's find out!

L'addestramento dei modelli potrebbe collassare perché i dati di training sono prodotti da una versione precedente del modello o da un modello addestrato sugli stessi dati. Questo studio conduce esperimenti che mostrano un quadro leggermente diverso: il collasso avviene solo quando si sostituiscono i dati reali con quelli sintetici, come è stato fatto negli esperimenti precedenti. Tuttavia, quando si aumentano i dati reali con dati sintetici aggiuntivi, non si misura alcun cambiamento nelle prestazioni dei modelli risultanti. Questi risultati suggeriscono che un fenomeno come il collasso del modello non si verificherà. Tuttavia, dimostra nuovamente che l'utilizzo di dati sintetici aggiuntivi non aiuterà ad addestrare un modello che sia generalmente superiore al modello utilizzato per creare tali punti dati sintetici.

tagLa Chirurgia Cerebrale per l'AI è Ora Possibile

Singh, S., Ravfogel, S., Herzig, J., Aharoni, R., Cotterell, R., & Kumaraguru, P. (2024). Representation Surgery: Theory and Practice of Affine Steering. arXiv:2402.09631

Supponiamo che si voglia prevedere la professione di qualcuno ma non il loro genere. Questo lavoro di Google Research, ETH Zürich, International Institute of Information Technology Hyderabad (IIITH) e Bar-Ilan University mostra come i vettori di steering e il covariance matching possano essere utilizzati per controllare il bias.

tagMagicLens - Recupero di Immagini Auto-Supervisionato con Istruzioni Aperte

Zhang, K., Luan, Y., Hu, H., Lee, K., Qiao, S., Chen, W., Su, Y., & Chang, M.-W. (2024). MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions. arXiv:2403.19651
Interactive slide showing MagicLens tool for visually guided navigation with tasks like identifying buildings and comparing h

Questo articolo presenta i modelli MagicLens, una serie di modelli di recupero immagini auto-supervisionati addestrati su triplette di immagine di query + istruzione + immagine target.

Gli autori introducono una pipeline di raccolta/cura dei dati che raccoglie coppie di immagini dal web e utilizza LLM per sintetizzare istruzioni testuali aperte che collegano le immagini con diverse relazioni semantiche oltre la semplice somiglianza visiva. Questa pipeline viene utilizzata per produrre 36,7M di triplette di alta qualità su un'ampia distribuzione. Il dataset viene poi utilizzato per addestrare una semplice architettura dual-encoder con parametri condivisi. Gli encoder di base per visione e linguaggio sono inizializzati con varianti CoCa o CLIP base e large. Viene introdotto un singolo pooler di attenzione multi-head per comprimere i due input multimodali in un singolo embedding. L'obiettivo di training contrasta la coppia query-immagine e istruzione con l'immagine target e l'istruzione stringa vuota con una semplice loss InfoNCE per addestrare MagicLens. Gli autori presentano i risultati di valutazione sul recupero di immagini basato su istruzioni.

tagPrompt Sketching - Il Nuovo Modo di Fare Prompting

Beurer-Kellner, L., Müller, M. N., Fischer, M., & Vechev, M. (2023). Prompt Sketching for Large Language Models. arXiv:2311.04954

Il modo in cui facciamo prompting agli LLM sta cambiando. Il Prompt Sketching ci permette di dare vincoli fissi ai modelli generativi. Invece di fornire solo un'istruzione e sperare che il modello faccia ciò che vogliamo, definiamo un template completo, forzando il modello a generare ciò che vogliamo.

Non confonderlo con gli LLM fine-tunati per fornire un formato JSON strutturato. Con l'approccio fine-tuning, il modello ha ancora la libertà di generare quello che vuole. Non è così con il Prompt Sketching. Fornisce una toolbox completamente nuova per i prompt engineer e apre aree di ricerca che devono essere esplorate. Nel video sopra, Mark Müller spiega in dettaglio di cosa tratta questo nuovo paradigma.

Puoi anche dare un'occhiata al loro progetto open-source LMQL.

tagRepoformer - Recupero Selettivo per il Completamento del Codice a Livello Repository

Wu, D., Ahmad, W. U., Zhang, D., Ramanathan, M. K., & Ma, X. (2024). Repoformer: Selective Retrieval for Repository-Level Code Completion. arXiv:2403.10059

Per molte query, il RAG non aiuta realmente il modello perché la query è troppo semplice o il sistema di recupero non riesce a trovare documenti rilevanti, possibilmente perché non ce ne sono. Questo porta a tempi di generazione più lunghi e prestazioni inferiori se il modello si basa su fonti fuorvianti o assenti.

Questo articolo affronta il problema permettendo agli LLM di auto-valutare se il recupero è utile. Dimostrano questo approccio su un modello di completamento del codice che è addestrato a riempire un gap in un template di codice. Per un dato template, il sistema prima decide se i risultati del recupero sono utili e, in caso affermativo, chiama il retriever. Infine, il LLM per il codice genera il contesto mancante che i risultati del recupero siano stati aggiunti o meno al suo prompt.

tagL'Ipotesi della Rappresentazione Platonica

Huh, M., Cheung, B., Wang, T., & Isola, P. (2024). The Platonic Representation Hypothesis. arXiv:2405.07987
Illustration of "The Platonic Representation Hypothesis" with geometric shapes, mathematical text, and diagrams explaining a

L'Ipotesi della Rappresentazione Platonica sostiene che i modelli di reti neurali tenderanno a convergere verso una rappresentazione comune del mondo. Prendendo spunto dalla Teoria delle Forme di Platone, l'idea che esista un regno degli "ideali", che ci appare in forma distorta e che possiamo osservare solo indirettamente, gli autori affermano che i nostri modelli AI sembrano convergere verso una singola rappresentazione della realtà, indipendentemente dall'architettura di training, dai dati di training o persino dalla modalità di input. Più grande è la scala dei dati e la dimensione del modello, più simili sembrano diventare le loro rappresentazioni.

Gli autori considerano le rappresentazioni vettoriali e misurano l'allineamento delle rappresentazioni utilizzando metriche di allineamento del kernel, in particolare una metrica di mutuo vicinato più prossimo che misura l'intersezione media degli insiemi di k-vicini più prossimi indotti da due kernel, K1 e K2, normalizzata per k. Questo lavoro presenta evidenze empiriche che mostrano come, con l'aumentare delle dimensioni del modello e del dataset e il miglioramento delle prestazioni, i kernel diventino più allineati. Questo allineamento può essere osservato anche quando si confrontano modelli di diverse modalità, come modelli di testo e modelli di immagini.

tagRiepilogo

Parte dell'entusiasmo iniziale che ha accompagnato la legge di scaling sta iniziando a diminuire, ma ICML 2024 ha dimostrato che così tanto nuovo, diverso e creativo talento è entrato nel nostro campo che possiamo essere certi che il progresso è ben lungi dall'essere finito.

Ci siamo divertiti molto a ICML 2024 e potete scommettere che torneremo nel 2025 🇨🇦.

Categorie:
Evento
rss_feed

Per saperne di più
agosto 11, 2025 • 8 minuti letti
What We Learned at SIGIR 2025
Michael Günther
Bo Wang
Scott Martens
Conference scene in a large auditorium with a "SIGIR 2025" banner on the projected screen, a speaker on stage, and attendees
maggio 25, 2025 • 21 minuti letti
What We Learned at ICLR2025
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
novembre 05, 2024 • 2 minuti letti
Call for Participants: EMNLP 2024 BoF on Embeddings, Reranker & Small LMs for Better Search
Jina AI
Event poster for "Embedding Reranker, Small LM & Better Search" on Nov 14, 2024, from 10:30 to 12:00 at Miami Lecture Hall. F
Lingua / tema attuale
Search Foundation
Reader
Embeddings
Reranker
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizie
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.