Mitigate the Gap: Improving Cross-Modal Alignment in CLIP
jina-clip-v2: Incorporamenti (Embeddings) multimodali multilingue per testo e immagini
ReaderLM-V2: Modello linguistico piccolo per HTML in Markdown e JSON
TIPS: Pre-addestramento Testo-Immagine con Consapevolezza Spaziale
Cut Cross-Entropy: Calcolo della Perdita Efficiente in Termini di Memoria per Grandi Vocabolari
FlexPrefill: Attenzione Sparsa Sensibile al Contesto per Sequenze Lunghe
Compressione efficace di 向量模型 (Embeddings) post-training tramite controllo della temperatura
L'attenzione nei modelli linguistici di grandi dimensioni produce 重排器 (Reranker) zero-shot efficienti
Bridging e modellazione delle correlazioni nei dati pairwise per l'ottimizzazione diretta delle preferenze
TAID: Distillazione interpolata adattiva temporalmente per un efficiente trasferimento di conoscenza
SVD-LLM: Decomposizione a valori singolari consapevole della troncamento per la compressione di modelli linguistici di grandi dimensioni
Vedi cosa ti viene detto: Sink di attenzione visiva in modelli multimodali di grandi dimensioni
Verso l'equivalenza semantica della tokenizzazione nei LLM multimodali
Hymba: un'architettura a head ibrida per modelli linguistici piccoli
Evento
maggio 25, 2025
Cosa abbiamo imparato all'ICLR2025
Abbiamo raccolto alcuni dei documenti più interessanti di ICLR 2025, tra cui TIPS, FlexPrefill, Reranker Zero-Shot (Reranker Zero-Shot), SVD-LLM, Hymba ecc.
Jina AI • 21 minuti letti
ICLR 2025 è una delle conferenze di machine learning più grandi e influenti al mondo, al pari di NeurIPS e ICML come i tre principali punti di riferimento per la ricerca sull'IA ad alto impatto. Quest'anno ha segnato una pietra miliare storica, poiché ICLR si è tenuta in Asia per la prima volta, presso il Singapore EXPO dal 24 al 28 aprile. Il tempismo non avrebbe potuto essere più perfetto: solo pochi mesi dopo il "momento DeepSeek" alla fine di gennaio 2025, che ha scosso la Silicon Valley e ha dimostrato la rapida avanzata della ricerca sull'IA in Cina. In combinazione con il nuovo accordo Cina-Singapore di esenzione reciproca dal visto di 30 giorni entrato in vigore nel febbraio 2024, abbiamo assistito a un'impennata senza precedenti della partecipazione cinese alla conferenza.
Quest'anno, il nostro team era entusiasta di fare il viaggio a Singapore, con Sedigheh Eslami, Andreas Koukounas, Wang Feng e il CEO Han Xiao che hanno presentato tre documenti di ricerca che mostrano la nostra ultima ricerca su jina-clip-v2 e ReaderLM-v2 per una migliore ricerca. Mentre il resto del mondo dell'IA sembra bloccato in una corsa agli armamenti per modelli sempre più grandi, noi abbiamo deciso di nuotare controcorrente, dimostrando che modelli più piccoli e intelligenti possono dare il massimo quando il design è giusto.
Quindi prendete il vostro caffè, mettetevi comodi ed esploriamo alcune ricerche ICLR che abbiamo trovato interessanti, a cominciare dalla nostra opinione sul perché piccolo può essere potente.
tagMitigate the Gap: Improving Cross-Modal Alignment in CLIP
I modelli CLIP eccellono nelle attività immagine-testo, ma soffrono di un "divario di modalità": gli incorporamenti (embeddings) di immagini e testo si raggruppano in regioni separate, limitando le prestazioni. Questo lavoro, guidato dalla nostra stagista Sedigheh Eslami durante il suo dottorato di ricerca presso l'Hasso Plattner Institute, affronta questo problema fondamentale.
Abbiamo scoperto che la semplice traduzione vettoriale rompe la struttura di incorporamento (embedding). Invece, AlignCLIP utilizza parametri di codifica condivisi con obiettivi di separazione semanticamente regolamentati. Questo duplice approccio riduce con successo il divario di modalità migliorando al contempo le prestazioni nelle attività zero-shot e di ottimizzazione.
Punti chiave:
Il divario di modalità è un collo di bottiglia critico per le prestazioni di CLIP
La condivisione dei parametri + la separazione semantica colmano efficacemente le differenze modali
L'approccio offre guadagni misurabili nelle valutazioni a valle
tagjina-clip-v2: Incorporamenti (Embeddings) multimodali multilingue per testo e immagini
Questo è il documento alla base di jina-clip-v2, un modello di incorporamento (embedding) multimodale multilingue che supporta attività di solo testo e crossmodali utilizzando un approccio di apprendimento contrastivo multi-task e multi-stage. Il modello combina un codificatore di testo (Jina XLM-RoBERTa, 561 milioni di parametri) e un codificatore di visione (EVA02-L14, 304 milioni di parametri) per un totale di 865 milioni di parametri. Ci alleniamo su testi multilingue provenienti da 29 lingue non inglesi e documenti visivamente ricchi, utilizzando Matryoshka Representation Learning per una dimensione di incorporamento (embedding) flessibile.
Punti chiave:
La combinazione di dati immagine-testo e testo-testo in singoli batch con parametri di temperatura condivisi ha prestazioni inferiori rispetto all'addestramento separato a causa dell'asimmetria delle informazioni sulla modalità.
L'addestramento per l'allineamento crossmodale compromette intrinsecamente la qualità dell'incorporamento (embedding) di testo puro, mostrando un compromesso fondamentale.
Il taglio degli incorporamenti (embeddings) da 1.024 a 256 dimensioni causa una perdita di prestazioni inferiore all'1%, rivelando un'enorme inefficienza nelle rappresentazioni ad alta dimensione.
tagReaderLM-V2: Modello linguistico piccolo per HTML in Markdown e JSON
Questo è l'articolo alla base di ReaderLM-v2, un modello linguistico compatto da 1,5 miliardi di parametri progettato per l'estrazione efficiente di contenuti web. Il modello elabora documenti fino a 512K token, trasformando l'HTML disordinato in formati Markdown o JSON puliti. Il nostro approccio combina una pipeline di sintesi dei dati a tre fasi (DRAFT-REFINE-CRITIQUE) che genera dati di addestramento di alta qualità attraverso un perfezionamento iterativo con un framework di addestramento unificato che combina pre-addestramento continuo, fine-tuning supervisionato, ottimizzazione diretta delle preferenze e tuning iterativo self-play. ReaderLM-v2 sovraperforma GPT-4o e altri modelli più grandi del 15-20% sui benchmark, eccellendo in particolare nei documenti che superano i 100K token pur mantenendo requisiti computazionali significativamente inferiori.
Punti chiave:
Un modello da 1,5 miliardi di parametri sovraperforma i modelli GPT-4o e 32B del 15-20% sull'estrazione HTML, dimostrando che il fine-tuning specifico per attività supera la scala grezza per la competenza nel dominio.
Il modello genera i propri dati di addestramento nella fase 4 "self-play", creando set di dati migliori di quelli curati dall'uomo e migliorando continuamente le prestazioni attraverso il feedback ricorsivo.
Il modello ha sofferto di ripetizioni catastrofiche di token durante l'addestramento, ma l'aggiunta di una perdita contrastiva per incoraggiare rappresentazioni discriminatorie ha eliminato completamente questo problema di degenerazione.
tagTIPS: Pre-addestramento Testo-Immagine con Consapevolezza Spaziale
I modelli di visione-linguaggio addestrati con l'apprendimento contrastivo eccellono nell'allineamento globale immagine-testo, ma falliscono nelle attività di comprensione spaziale densa. TIPS combina l'apprendimento contrastivo con la modellazione di immagini mascherate e utilizza didascalie generate sinteticamente che codificano le relazioni spaziali, creando vettori modello (embeddings) adatti sia alla comprensione densa che globale senza fine-tuning specifico per l'attività. L'approccio dimostra come la consapevolezza spaziale possa essere incorporata nei modelli di vettori modello (embedding) per una migliore comprensione dei documenti e applicazioni di recupero multimodale.
Punti chiave:
Le didascalie sintetiche con descrizioni spaziali forniscono segnali di addestramento più ricchi rispetto alle didascalie web rumorose per l'apprendimento di rappresentazioni spazialmente consapevoli.
La combinazione dell'apprendimento contrastivo immagine-testo con obiettivi auto-supervisionati colma il divario tra comprensione globale e densa.
Le prestazioni off-the-shelf su diverse attività eliminano la necessità di un fine-tuning specializzato tra diverse applicazioni di visione.
tagCut Cross-Entropy: Calcolo della Perdita Efficiente in Termini di Memoria per Grandi Vocabolari
Il calcolo dell'entropia incrociata domina l'utilizzo della memoria nei modelli linguistici con grandi vocabolari, richiedendo la materializzazione di matrici logit proporzionali a batch_size × vocabulary_size. CCE riformula il calcolo per calcolare solo i componenti necessari al volo utilizzando kernel CUDA personalizzati, riducendo il consumo di memoria da gigabyte a megabyte mantenendo la stessa dinamica di addestramento. Ciò consente l'addestramento di vettori modello (embedding) e modelli di 重排器 (reranking) con vocabolari più grandi su hardware limitato, particolarmente vantaggioso per applicazioni multilingue e specifiche del dominio.
Punti chiave:
Il calcolo della perdita di entropia incrociata può consumare il 90% della memoria di addestramento per i modelli con grandi vocabolari, diventando il collo di bottiglia principale.
Il calcolo al volo dei termini log-sum-exp elimina la necessità di materializzare matrici logit complete senza approssimazioni matematiche.
L'implementazione di un kernel personalizzato consente una drastica riduzione della memoria preservando le esatte proprietà di convergenza.
tagFlexPrefill: Attenzione Sparsa Sensibile al Contesto per Sequenze Lunghe
L'inferenza di transformer a sequenza lunga soffre di complessità di attenzione quadratica. FlexPrefill determina dinamicamente i pattern di attenzione sparsi per head utilizzando la divergenza di Jensen-Shannon e alloca adattivamente il budget computazionale in base ai punteggi di attenzione cumulativi, ottenendo accelerazioni significative con una perdita minima di accuratezza tra diversi tipi di contenuto. Il metodo consente l'elaborazione efficiente di documenti lunghi per sistemi di ricerca e recupero, consentendo a modelli linguistici più piccoli di gestire contesti estesi per una migliore comprensione dei documenti.
Punti chiave:
I pattern di attenzione sparsi dinamici adattati al tipo di contenuto superano le strategie di sparsità fissa tra diverse caratteristiche di input
L'allocazione del budget adattivo per-head basata sull'accumulo del punteggio di attenzione ottimizza la distribuzione del calcolo in tempo reale
La sparsità consapevole del contesto raggiunge un'accelerazione di 13,7× con una perdita di accuratezza dello 0,1% senza richiedere il retraining del modello
tagCompressione efficace di 向量模型 (Embeddings) post-training tramite controllo della temperatura
Il ridimensionamento della temperatura nell'apprendimento contrastivo influenza significativamente la dimensionalità intrinseca dei 向量模型 (embeddings) appresi, con temperature più basse che producono rappresentazioni più comprimibili. L'articolo dimostra che i metodi di aggregazione della temperatura possono ridurre le dimensioni degli 向量模型 (embeddings) di un ordine di grandezza mantenendo le prestazioni di recupero, rivelando il compromesso tra efficacia del clustering e accuratezza del recupero. Ciò consente l'implementazione efficiente di sistemi di recupero denso in cui i vincoli di memoria sono fondamentali per le applicazioni di produzione.
Punti chiave:
Valori di temperatura più bassi nell'addestramento contrastivo producono 向量模型 (embeddings) con dimensionalità intrinseca inferiore che si comprimono in modo più efficace
Le tecniche di aggregazione della temperatura raggiungono rapporti di compressione di 10× con un degrado minimo della qualità nelle attività di recupero
Il controllo sistematico della temperatura durante l'addestramento fornisce un meccanismo diretto per ottimizzare il compromesso compressione-prestazioni
tagL'attenzione nei modelli linguistici di grandi dimensioni produce 重排器 (Reranker) zero-shot efficienti
Il re-ranking in-context (ICR, In-Context Re-ranking) sfrutta i cambiamenti del pattern di attenzione negli LLM per eseguire il re-ranking dei documenti senza generazione di testo, riducendo la complessità computazionale da O(N log N) a O(1). Il metodo aggrega i pesi di attenzione tra i livelli e gli head per calcolare i punteggi di rilevanza, con la calibrazione della query senza contenuto per mitigare i bias LLM. Questo approccio consente un re-ranking efficiente con modelli open-weight, eliminando la necessità di fine-tuning specializzato o costosi processi di generazione.
Punti chiave:
I pattern di attenzione negli LLM contengono segnali sufficienti per un efficace re-ranking dei documenti senza richiedere la generazione di testo
La calibrazione della query senza contenuto mitiga con successo i bias intrinseci nei meccanismi di scoring basati sull'attenzione
L'ICR raggiunge prestazioni ed efficienza superiori rispetto ai metodi generativi, in particolare su attività complesse di recupero multi-hop
tagBridging e modellazione delle correlazioni nei dati pairwise per l'ottimizzazione diretta delle preferenze
Il DPO tradizionale soffre di deboli correlazioni tra le risposte scelte e quelle rifiutate nelle coppie di preferenze, limitando l'efficacia dell'allineamento. BMC affronta questo problema sintetizzando pseudo-risposte preferite che interpolano tra le risposte vincenti e perdenti, quindi applica la modellazione della correlazione a livello di token utilizzando la confidenza del modello di policy. L'approccio in due fasi prima colma le coppie di preferenze attraverso modifiche mirate, quindi modella le correlazioni granulari durante l'addestramento per migliorare la qualità del segnale di apprendimento.
Punti chiave:
Le deboli correlazioni tra le risposte scelte e quelle rifiutate nei dati di preferenza limitano significativamente l'efficacia del DPO per l'allineamento del modello.
La sintesi di pseudo-risposte preferite come interpolazioni tra coppie di preferenze fornisce segnali di apprendimento più ricchi per l'ottimizzazione.
La modellazione della correlazione a livello di token utilizzando la confidenza della policy pondera dinamicamente i segnali di addestramento per catturare sfumature nei dati di preferenza.
tagTAID: Distillazione interpolata adattiva temporalmente per un efficiente trasferimento di conoscenza
La distillazione della conoscenza deve affrontare le sfide derivanti dai divari di capacità, dalla media della modalità e dal collasso della modalità quando si trasferisce la conoscenza tra modelli grandi e piccoli. TAID introduce un teacher intermedio dinamico che interpola tra le distribuzioni student e teacher, adattando gradualmente la distribuzione target in base ai progressi dell'addestramento. Questo approccio previene il collasso della modalità attraverso garanzie teoriche e ottiene prestazioni superiori su varie dimensioni del modello, consentendo lo sviluppo di modelli linguistici compatti ma capaci.
Punti chiave:
I teacher intermedi dinamici che si adattano durante l'addestramento forniscono traiettorie di apprendimento più fluide rispetto alla distillazione con teacher fisso.
TAID previene il collasso della modalità attraverso l'interpolazione adattiva bilanciando il trasferimento di conoscenza attraverso diversi divari di capacità.
Il metodo consente l'addestramento di modelli compatti all'avanguardia senza richiedere architetture specializzate o un'ampia messa a punto degli iperparametri.
tagSVD-LLM: Decomposizione a valori singolari consapevole della troncamento per la compressione di modelli linguistici di grandi dimensioni
I metodi di compressione esistenti basati su SVD non tengono conto delle attivazioni di input durante l'approssimazione e mancano di fine-tuning post-troncamento. SVD-LLM incorpora lo sbiancamento dei dati consapevole del troncamento che considera le distribuzioni di attivazione e applica il fine-tuning basato su LoRA dopo la compressione. Il metodo stabilisce connessioni teoriche tra valori singolari e perdita di compressione, consentendo decisioni di compressione più rigorose che superano gli approcci di pruning e quantizzazione strutturati.
Punti chiave:
Lo sbiancamento dei dati consapevole del troncamento che tiene conto delle attivazioni di input migliora significativamente l'efficacia della compressione SVD rispetto ai metodi agnostici all'attivazione.
Il fine-tuning LoRA post-compressione compensa il degrado dell'accuratezza mantenendo i vantaggi della fattorizzazione a basso rango.
L'analisi teorica che collega i valori singolari alla perdita di compressione consente decisioni di troncamento rigorose che superano gli approcci euristici.
tagVedi cosa ti viene detto: Sink di attenzione visiva in modelli multimodali di grandi dimensioni
I modelli multimodali di grandi dimensioni mostrano un fenomeno chiamato "visual attention sink (pozzo di attenzione visivo)" in cui allocano costantemente pesi di attenzione elevati a specifici token visivi che sono irrilevanti per i token testuali corrispondenti. Questi token visivi irrilevanti emergono dall'attivazione massiccia in specifiche dimensioni dello stato nascosto, simili agli attention sink nei modelli linguistici. Il metodo Visual Attention Redistribution (VAR, Ridistribuzione dell'Attenzione Visiva) identifica le head di attenzione incentrate sull'immagine e ridistribuisce il budget di attenzione dai token sink al contenuto visivo significativo, migliorando le prestazioni in tutte le attività di visione-linguaggio senza richiedere ulteriore addestramento.
Punti chiave:
I token sink visivi possono essere identificati da magnitudini di attivazione estreme in dimensioni fisse ereditate dai modelli linguistici di base
La rimozione dei token sink visivi non influisce sulle prestazioni del modello nonostante la ricezione di pesi di attenzione elevati, indicando uno spreco di risorse computazionali
VAR ridistribuisce l'attenzione dai token sink al contenuto visivo significativo, migliorando le prestazioni nella visione-linguaggio generale, nella riduzione dell'allucinazione e nelle attività incentrate sulla visione
tagVerso l'equivalenza semantica della tokenizzazione nei LLM multimodali
I metodi tradizionali di tokenizzazione della visione negli LLM multimodali frammentano l'input visivo utilizzando patch fisse, corrompendo l'integrità semantica e portando a uno scarso allineamento visione-linguaggio. SeTok (Semantic-Equivalent Vision Tokenizer, Tokenizzatore di Visione Semanticamente Equivalente) affronta questo problema attraverso il clustering dinamico che raggruppa le caratteristiche visive in unità semantiche coerenti, con il conteggio dei token che si adatta alla complessità dell'immagine. Il sistema utilizza doppi obiettivi di addestramento: la perdita contrastiva per l'allineamento semantico con il linguaggio e la perdita di ricostruzione per preservare i dettagli a livello di pixel per la ricostruzione dell'immagine.
Punti chiave:
La tokenizzazione a patch fisse interrompe l'integrità semantica visiva frammentando gli oggetti attraverso confini di patch arbitrari
Gli algoritmi di clustering dinamico possono determinare in modo adattivo il conteggio ottimale dei token in base alla complessità semantica dell'immagine piuttosto che a strutture a griglia fisse
L'addestramento a doppio obiettivo bilancia l'allineamento semantico con il linguaggio preservando al contempo dettagli visivi sufficienti per le attività di ricostruzione
tagHymba: un'architettura a head ibrida per modelli linguistici piccoli
Hymba introduce un'architettura a head ibrida che combina i meccanismi di attenzione transformer con i modelli di spazio di stato (SSM, State Space Models) in parallelo all'interno di ogni livello, consentendo simultaneamente un richiamo ad alta risoluzione e un riepilogo efficiente del contesto. L'architettura incorpora meta token apprendibili, condivisione key-value tra i livelli e attenzione parziale a finestra scorrevole per ottenere dimensioni della cache compatte. Hymba-1.5B supera tutti i modelli inferiori a 2B e supera Llama-3.2-3B ottenendo al contempo una riduzione della cache di 11,67× e un miglioramento della velocità effettiva di 3,49×.
Punti chiave:
L'architettura ibrida a head parallela supera l'impilamento sequenziale di componenti di attenzione e SSM consentendo l'elaborazione simultanea di meccanismi complementari
I meta token apprendibili fungono da conoscenza del mondo compressa e alleviano l'onere "forced-to-attend" dei meccanismi di attenzione softmax
Le ottimizzazioni di condivisione key-value tra i livelli e di attenzione a finestra scorrevole consentono una drastica riduzione delle dimensioni della cache senza sacrificare le prestazioni