Le problème : un LLM répond toujours avec la même assurance, qu'il dise vrai ou qu'il invente.
L'utilisateur n'a aucun moyen simple de savoir quelle partie d'une réponse est fiable.
La démo partie 1 : une question piège (type idée reçue), la réponse du LLM affichée en direct, puis surlignée par Berlue — l'utilisateur voit l'endroit exact où le modèle « a la berlue ».
Ce que fait Berlue : Verifie que ce repond un llm n'est pas une hallucination.
on pose une question à un LLM local.
Berlue découpe la réponse en affirmations.
Vérifie chacune par deux mécanismes complémentaires :
une recherche de preuves externes (RAG inversé sur un corpus factuel) cree grace aux données FEVER
un test d'auto-cohérence (le LLM se contredit-il si on le fait répondre plusieurs fois ?)
recupere les resultats pour chaque affirmation et categorise.
surligne la réponse en vert/orange/rouge avec un score de confiance par affirmation et la preuve citée.
La démo partie 2 : Est ce que Berlue est efficasse ? Nous presentons alors nos resultats statistiques
Comment verifier notre outils :
Utilisation de deux dataset de questions difficiles pour IA.
On lance berlu pour verifie pour chaque question reponse si berlue detecte bien les fausses reponses du modele.
On compare avec un classifier statistique (baseline).
Temp: La température contrôle le degré d'aléatoire du mot suivant généré par le LLM.
Temp = 0, le modèle prend quasi toujours le mot le plus probable → réponse stable
Temp > 0, mots moins probables ont plus de chances d'être tirés → réponse différente à chaque tirage.
‹07›
Composants de la démo — schéma d'architecture
FEVER : ~145k affirmations Wikipédia étiquetées soutenue / réfutée / pas assez d'info, chacune avec sa preuve — le corpus qu'on indexe pour le RAG inversé.SelfCheckGPT : implémentation de référence du module de détection d'hallucination sans boîte noire, utilisé en parallèle du RAG inversé.
‹08›
Preuve de pertinence — séquence de l'évaluation offline
‹09›
Composants de l'évaluation offline — schéma d'architecture
HaluEval : ~35k réponses QA/dialogue/résumé, appariées correcte vs hallucinée.
TruthfulQA : 817 questions sur 38 catégories d'idées reçues, teste si le modèle répète l'erreur commune plutôt que la vérité.