Prova la demo interattiva e scopri come appare il tuo sito in LLM SERP.
Da quando è stato introdotto RAG, la tendenza è stata quella di utilizzare gli LLM per migliorare la ricerca. Da Perplexity a DeepSearch e DeepResearch, l'idea di iniettare i risultati dei motori di ricerca nel processo di generazione è diventata una prassi consolidata. Molti utenti affermano anche di non utilizzare più Google con la stessa frequenza di prima, trovando il suo classico design a paginazione noioso, eccessivo o tedioso. Invece, si sono abituati all'alta precisione e al richiamo dei risultati in stile QA da un'interfaccia di ricerca simile a una chat, suggerendo che questa filosofia di design potrebbe essere la strada da seguire.
Ma se l'LLM stesso fosse il motore di ricerca?
Se potessi esplorare la conoscenza incorporata negli LLM come se stessi usando Google? Paginazione, link e tutto il resto - proprio come ai vecchi tempi che conosci bene. Se non sei sicuro di cosa intendo, dai prima un'occhiata alla demo qui sotto.
I link, i titoli e gli snippet sono completamente generati da un LLM. Puoi visitare https://jina.ai/llm-serp-demo e provare alcune query tu stesso!
Prima di sollevare preoccupazioni sulle allucinazioni, spieghiamo prima perché questa idea ha un certo merito: gli LLM sono addestrati su vasti archivi di conoscenza web. Modelli come DeepSeek-R1, GPT-4, Claude-3.7 e Gemini-2.0 sono stati addestrati su trilioni di token provenienti da tutto l'internet pubblico. Una stima approssimativa è che dall'1% al ~5% del testo web pubblicamente accessibile di alta qualità è stato utilizzato per addestrare i modelli principali.
Se pensi che questo numero sembri troppo piccolo, considera questo confronto: se usiamo l'indice di Google come riferimento (rappresentando il 100% dei dati accessibili agli utenti nel mondo), allora l'indice di Bing è circa il 30-50% di quello di Google. Baidu copre circa il 5-10% e Yandex copre il 3-5%. Brave Search indicizza meno dell'1%. Quindi se un LLM è addestrato sull'1-5% dei dati pubblici di alta qualità, potenzialmente equivale alla stessa quantità di dati che un decente piccolo motore di ricerca può fornire.
Dato che questi modelli hanno effettivamente "memorizzato" questi dati web, dobbiamo semplicemente sollecitarli in un modo che "attivi" la loro memoria, permettendo loro di funzionare come motori di ricerca e generare risultati simili a una pagina dei risultati di ricerca (SERP).
Quindi sì, l'allucinazione è una sfida, ma man mano che le capacità dei modelli migliorano con ogni iterazione, possiamo ragionevolmente aspettarci che questo problema si attenui. Su X, le persone sono spesso ossessionate dal generare SVG da zero ogni volta che viene rilasciato un nuovo modello, sperando che ogni versione produca illustrazioni migliori della precedente. Questa idea del motore di ricerca segue una simile speranza di miglioramento incrementale della comprensione del mondo digitale da parte dell'LLM.

qwen-2.5-max di disegnare un maiale SVG in one-shot.Le date di cut-off della conoscenza presentano un'altra limitazione. I motori di ricerca dovrebbero restituire informazioni quasi in tempo reale, ma poiché i pesi degli LLM sono congelati dopo l'addestramento, non possono fornire informazioni accurate oltre la loro data di cut-off. In generale, più una query è vicina a questa data di cut-off, più è probabile che si verifichino allucinazioni. Poiché le informazioni più vecchie sono state probabilmente citate e riformulate più frequentemente, potenzialmente aumentando i loro pesi nei dati di addestramento. (Questo presuppone che le informazioni siano pesate uniformemente; le notizie dell'ultima ora potrebbero ricevere un'attenzione sproporzionata indipendentemente dalla recenza.) Tuttavia, questa limitazione definisce precisamente dove questo approccio potrebbe essere più utile—per informazioni ben all'interno del periodo di conoscenza del modello.
tagDove LLM-as-SERP Può Essere Utile?
In DeepSearch/RAG o in qualsiasi sistema di ricerca basato su grounding, una sfida fondamentale è determinare se una domanda necessita di informazioni esterne o può essere risposta dalle conoscenze del modello. I sistemi attuali utilizzano tipicamente un routing basato su prompt con istruzioni come:
- For greetings, casual conversation, or general knowledge questions, answer directly without references.
- For all other questions, provide a verified answer with external knowledge. Each reference must include exactQuote and url.Questo approccio fallisce in entrambe le direzioni - a volte attivando ricerche non necessarie, altre volte mancando esigenze critiche di informazioni. Specialmente con i modelli di ragionamento più recenti, spesso non è ovvio fino a metà della generazione se sono necessari dati esterni.
E se eseguissimo semplicemente la ricerca comunque? Potremmo fare una chiamata a una vera API di ricerca e un'altra a un sistema LLM-as-search. Questo elimina la decisione iniziale di routing e la sposta a valle dove abbiamo risultati effettivi da confrontare - dati recenti dalla ricerca reale, conoscenze entro il cut-off di addestramento del modello e potenzialmente alcune informazioni errate.
Il passaggio finale di ragionamento può quindi identificare le incongruenze e valutare le fonti in base alla loro attualità, affidabilità e consenso tra i risultati, cosa che non dobbiamo codificare esplicitamente — è già ciò in cui gli LLM eccellono. È anche possibile visitare ogni URL nei risultati di ricerca (ad esempio, con Jina Reader) per ulteriormente validare le fonti. Nelle implementazioni pratiche, questo passaggio di verifica è comunque sempre necessario; non dovresti mai affidarti esclusivamente agli estratti dei motori di ricerca, che siano motori di ricerca reali o falsi.
tagConclusione
Utilizzando LLM-as-SERP, trasformiamo la questione binaria "questo fa parte delle conoscenze del modello o no?" in un processo più robusto di valutazione delle evidenze.
Forniamo un playground e anche un endpoint API ospitato da noi con cui potete sperimentare. Sentitevi anche liberi di integrarlo nelle vostre implementazioni DeepSearch/DeepResearch per vedere direttamente qualsiasi miglioramento.
L'API imita un endpoint SERP completo dove è possibile definire il numero di risultati, la paginazione, il paese, la lingua ecc. Potete trovare la sua implementazione su GitHub. Siamo ansiosi di ricevere il vostro feedback su questo interessante approccio.








