Torna al Blog

    Chatbot sull’archivio aziendale: cos’è il RAG e come funziona

    4 ottobre 2026

    «Qual è la coppia di serraggio prevista per il gruppo riduttore della linea 2?», «Che penale abbiamo concordato con questo fornitore in caso di ritardo?», «Come si richiede un rimborso spese trasferta?». Le risposte esistono già, sepolte in manuali, contratti, procedure e email. Un chatbot basato su un modello linguistico può trovarle in pochi secondi, a patto di collegarlo correttamente all’archivio aziendale. La tecnica che lo rende possibile si chiama RAG, Retrieval-Augmented Generation. Vediamo cos’è, come funziona e a cosa fare attenzione.

    Il limite dei modelli linguistici

    Un modello come quelli dietro ChatGPT o Claude conosce molto del mondo, ma non conosce la vostra azienda. Non ha mai letto i vostri manuali tecnici, i contratti con i clienti o il regolamento interno, e le sue conoscenze si fermano alla data di addestramento. Se gli si chiede qualcosa che non sa, tende comunque a produrre una risposta plausibile: è il fenomeno delle cosiddette allucinazioni.

    Le strade per dargli conoscenza aziendale sono due. La prima è riaddestrarlo (fine-tuning) sui documenti interni: costoso, lento da aggiornare e poco controllabile, perché non si sa da quale documento provenga una risposta. La seconda è il RAG: il modello non impara i documenti, li consulta ogni volta che deve rispondere.

    Come funziona il RAG

    Il principio è lo stesso di un esame a libro aperto. Prima di rispondere, il sistema cerca nell’archivio i passaggi pertinenti e li mette davanti al modello, chiedendogli di rispondere solo sulla base di quelli.

    1. Indicizzazione dei documenti

    I documenti (PDF, Word, Excel, pagine SharePoint, email, schede tecniche) vengono letti, anche con OCR per le scansioni, e divisi in porzioni di testo di dimensione gestibile, i chunk. Ogni porzione viene trasformata in un embedding, un vettore numerico che ne rappresenta il significato, e salvata in un database vettoriale insieme ai metadati: documento di origine, pagina, data, reparto, permessi di accesso.

    2. Ricerca

    Quando un utente fa una domanda, anche la domanda viene trasformata in vettore e il sistema cerca le porzioni di testo con il significato più vicino. È una ricerca semantica: «coppia di serraggio» trova anche un paragrafo che parla di «momento torcente», cosa che una ricerca per parole chiave non farebbe. Nei sistemi più solidi la ricerca semantica è affiancata da quella testuale classica (ricerca ibrida), utile per codici articolo, numeri di contratto e sigle.

    3. Generazione della risposta

    Le porzioni trovate vengono passate al modello linguistico insieme alla domanda, con l’istruzione di rispondere usando solo quel materiale e di dichiarare quando l’informazione non c’è. La risposta riporta le citazioni: documento, pagina, paragrafo. L’utente può aprire la fonte e verificare.

    Perché è la scelta giusta per l’archivio aziendale

    • Sempre aggiornato: basta reindicizzare un documento modificato perché il chatbot lo conosca, senza riaddestrare nulla.
    • Verificabile: ogni risposta indica da dove viene, e questo riduce drasticamente le allucinazioni e aumenta la fiducia degli utenti.
    • Rispettoso dei permessi: se un utente non può aprire un documento, il sistema non lo usa per rispondergli. È un punto da progettare fin dall’inizio, non da aggiungere dopo.
    • Multilingua: si può fare una domanda in italiano e ottenere la risposta da un manuale in inglese o tedesco.

    Gli errori più comuni

    Un prototipo RAG si costruisce in un pomeriggio; un sistema che funziona in produzione richiede più attenzione. Gli errori che vediamo più spesso:

    • Indicizzare tutto senza criterio. Bozze, versioni superate e duplicati portano a risposte contraddittorie. Serve una politica su quali documenti fanno fede.
    • Chunking ingenuo. Spezzare una tabella o una procedura a metà fa perdere il contesto. Documenti tecnici, contratti e FAQ vanno divisi in modo diverso.
    • Ignorare i dati strutturati. «Quanto abbiamo fatturato a questo cliente quest’anno?» non è una domanda per un archivio di documenti, ma per il gestionale. In questi casi il chatbot deve interrogare direttamente ERP e database.
    • Non misurare. Serve un insieme di domande di prova con risposte attese, da rieseguire a ogni modifica, per sapere se il sistema migliora o peggiora.
    • Mandare i documenti riservati su servizi esterni senza aver valutato dove vengono elaborati e conservati i dati.

    Le soluzioni Eulogika

    Abbiamo costruito la nostra offerta proprio attorno a questi punti:

    • AI RAG Document Understanding indicizza migliaia di documenti aziendali, permette di interrogarli in linguaggio naturale citando le fonti e ne estrae dati strutturati.
    • AI Chatbot On Premise porta l’assistente conversazionale sulla vostra infrastruttura: modello, indice e documenti restano in azienda, anche in ambienti isolati dalla rete.
    • AI LLM MCP Connectors collegano il chatbot a ERP, database SQL e Teams tramite il Model Context Protocol, così le domande sui dati vivi ricevono risposte dai sistemi gestionali e non dai documenti.
    • AI LLM Chatbot WhatsApp rende la stessa base di conoscenza disponibile a clienti e tecnici in campo, sul canale che usano già.
    • Per i dati di produzione e vendita, Nexus e Vox aggiungono la business intelligence conversazionale, anche a voce.

    Lo stesso approccio è alla base di Janus Translator, che usa un glossario aziendale su RAG per tradurre i manuali tecnici con la terminologia corretta.

    Da dove partire

    Il progetto migliore per iniziare è un archivio circoscritto e molto consultato: i manuali dell’assistenza tecnica, le procedure di qualità, le policy HR. Si definiscono le domande tipiche, si misura la qualità delle risposte e poi si allarga il perimetro. Se volete valutare un chatbot sul vostro archivio, contattateci per una demo sui vostri documenti.