L'IA Générative bouscule nos certitudes. Elle fascine, effraie, mais surtout, nous renvoie à notre propre image. Ni gourou techno-béat, ni prophète de malheur, je collectionne ces traits communs surprenants, ces instants où la frontière entre la machine et nous s'efface.

Ils sont forts, ces gars de la Silicon Valley
Il faut bien appeler un chat un chat, car comme le rappelait justement Camus "mal nommer les choses c'est ajouter au malheur du monde" : le terme d'hallucination que l'on utilise pour décrire les nombreuses erreurs factuelles des modèles d'IA Générative est quand même une vaste escroquerie intellectuelle. Ou plutôt une trouvaille Marketing des ingénieurs de la Silicon Valley pour faire passer la pilule d'un défaut carrément gênant.
"Des taux d'erreur de 60%, les gars? Pas de problème, on continue... On n'a qu'à trouver un terme un peu sympa, qui nous rapproche de l'idée d'une IA super forte. Rêverie? Digression? Hallucination? Yeah, Hallucination, c'est pas mal ça, coco, on part là dessus. Comme disait le Général de Gaulle, l'intendance suivra!"
Pourtant, ces erreurs factuelles constituent un frein majeur à l'adoption de l'IA, tant au niveau individuel où elles sapent notre confiance, qu'au niveau organisationnel où elles bloquent l'automatisation des workflows.
Lors d'un sondage auprès de plusieurs milliers de collaborateurs d'un de mes clients, l'aspect 'fiabilité technique' revenait chez 25% des répondants.
Et en pratique, la mise en place d'un système d'IA Gen se résume souvent à 20% de préparation des données, 10% d'IA Gen (ah, le sacro-saint 'prompt') et ... 70% de gestion des erreurs.
Le péché originel
Le péché originel réside à mon sens dans l'irruption de ChatGPT qui a été présenté au Monde comme un super-robot qui a réponse à tout (qui se souvient de l'excellent Akinator). Ce faisant, on a durablement créé l'image mentale d'une super-base de données omnisciente. Or une base de données ne fait pas d'erreur grossière. D'où la désillusion. "Élémentaire, mon cher Watson" comme disait le héros de Conan Doyle.
Rappelons en quelques mots la nature technique de cette limitation structurelle. Un LLM propose comme réponse une séquence de mots qui est, essentiellement, une prédiction statistique. Rien de plus. Cette prédiction découle principalement de son entraînement — qui consiste justement à deviner des mots masqués dans un paragraphe — lui permettant de capturer deux phénomènes fondamentaux :
- Les relations syntaxiques entre les mots (à force d'avoir dû prédire la suite de "À tout à l'[...]", la structure "à tout à l'heure" finit par s'ancrer dans les poids du réseau)
- Les relations sémantiques entre séquences de mots (parce que "croquette" et "chat", ou "Trump" et "mensonge" apparaissent fréquemment dans les mêmes contextes, créant des associations vectorielles fortes)
Mais cela reste fondamentalement une prédiction basée sur des probabilités. Il n'y a pas de "vérité" stockée quelque part, juste des motifs statistiques. Le modèle suit la piste la plus probable selon son vaste corpus d'entraînement, sans jamais "savoir" si ce qu'il génère est factuellement exact. D'où ces fameuses "hallucinations" qui ne sont qu'un euphémisme pour désigner des erreurs factuelles. Leur cause réside simplement dans l'absence structurelle de mécanisme de vérification factuelle (et de base de référence de 'vérités'...).
Voilà pour la machine. Maintenant, regardons-nous dans le miroir.
Un mot peut tout changer
Comme l'a démontré la psychologue Elizabeth Loftus dans les années 70, nos souvenirs ne sont pas des informations passées stockées dans notre cerveau, mais des histoires inscrites dans des circuits neuronaux spécifiques. Plus fort encore, à chaque fois que nous nous rappelons de quelque chose, nous les modifions.
Les recherches pionnières de Loftus ont révolutionné notre compréhension de la mémoire humaine. Dans une de ses expériences les plus célèbres, elle montre à des participants une vidéo d'accident de voiture. À un groupe, elle demande : "À quelle vitesse roulaient les voitures quand elles se sont percutées ('hit') ?" À l'autre groupe : "À quelle vitesse roulaient les voitures quand elles se sont fracassées ('smashed')?" Un simple changement de verbe. Résultat : ceux qui ont entendu "fracassées" estiment des vitesses significativement plus élevées. Plus troublant encore, une semaine plus tard, 32% de ceux qui ont entendu "fracassées" affirment avoir vu des bris de verre dans la vidéo... alors qu'il n'y en avait pas. Un seul mot a suffi à implanter un faux souvenir.
Dans une autre expérience devenue emblématique, Loftus a convaincu 25% des participants qu'ils s'étaient perdus dans un centre commercial étant enfants — un événement qui ne s'était jamais produit. Comment ? En présentant ce faux événement mélangé à trois vrais souvenirs fournis par leurs proches. Les participants ne se contentaient pas d'acquiescer : ils enrichissaient activement ce faux souvenir, ajoutant des détails sensoriels, des émotions, des dialogues. Leur cerveau comblait les blancs avec une créativité remarquable, exactement comme un LLM génère du contenu plausible pour compléter une histoire incomplète.
Un bug plein de promesses
Je fais ici une digression (tant il est vrai qu'aucune bonne nouvelle ne saurait être négligée en ces temps troublés) : Cette plasticité troublante de la mémoire porte en elle un message d'espoir insoupçonné. Le philosophe Charles Pépin le formule ainsi : "le passé est bien présent, n'est pas figé... et qu'il peut même se réparer." Notre incapacité à stocker fidèlement nos souvenirs est une opportunité thérapeutique. Puisque le passé se réécrit à chaque rappel, nous pouvons intervenir dans ce processus de réécriture.
Les neurosciences l'ont confirmé. La méthode expérimentale Brunet expose le patient à son souvenir traumatique sous propranolol, un médicament qui permet de diminuer fortement la charge émotionnelle du souvenir. Le souvenir reste — l'événement a bien eu lieu — mais cesse d'être un fardeau insoutenable pour devenir vivable. L'EMDR semble fonctionner sur le même principe : en revisitant le trauma avec des stimulations bilatérales (mouvements des yeux, sons alternés), le cerveau réorganise l'empreinte émotionnelle du souvenir. Pourquoi ? Parce que notre cerveau émotionnel ne fait pas la différence entre une expérience vécue et une expérience intensément imaginée.
Cette découverte change tout. Contrairement aux bases de données qui figent l'information, notre mémoire est un système vivant, modifiable. Ce que nous appelons "erreur de rappel" libère aussi en réalité une possibilité extraordinaire : transformer nos souvenirs toxiques en souvenirs supportables, réinterpréter notre histoire, redevenir auteurs de notre propre récit plutôt que prisonniers d'un passé immuable.
Retour aux hallucinations
Revenons à nos moutons, ces fameuses hallucinations des IA qui nous scandalisent tant. Une fois posée cette meilleure compréhension du fonctionnement de la mémoire humaine, les similitudes avec les LLM deviennent troublantes :
- Nous fonctionnons tous deux par probabilités et reconstruction
- Nous ne stockons pas d'informations dans une "mémoire morte" mais activons des réseaux neuronaux
- Nos souvenirs/réponses se modifient à chaque rappel (tant que nous gardons le contexte du thread)
- Nous privilégions la cohérence narrative à l'exactitude factuelle
"OK d'accord, mais quand même," direz-vous, "les erreurs de ChatGPT nous sautent aux yeux ! Ce sont des boulettes énormes, grossières, impossibles à manquer. La date de naissance de Victor Hugo !!! (Luc Julia, sors de ce corps! 😜). Nous, on ne se trompe pas comme ça !"
Plus c'est gros, plus on y croit
Ah bon ? Parlons justement de ces souvenirs dont nous sommes absolument certains. Ces moments gravés dans la mémoire collective, ces événements si marquants qu'on se rappelle exactement où on était, ce qu'on faisait. Les neurologues appellent ça les "flashbulb memories" — comme si un flash photographique avait figé l'instant pour toujours.
Prenons les attentats du 11 septembre 2001. Tout le monde se souvient "parfaitement" de ce jour-là, non ?
Les chercheurs Talarico et Rubin ont interrogé des étudiants le lendemain des attentats, leur demandant de raconter précisément comment ils avaient appris la nouvelle. Puis ils les ont réinterrogés un an plus tard. Résultat : 42% des souvenirs de participants comportaient des incohérences sur des détails centraux (lieu, source, activité). Certains qui affirmaient avoir appris la nouvelle à la télé l'avaient en fait apprise par téléphone. D'autres qui juraient être seuls étaient en réalité entourés de camarades. Mais le plus troublant ? Leur niveau de confiance restait scotché à 4,5 sur 5. Ils étaient aussi certains de leurs faux souvenirs que de leurs vrais.
Autre exemple : le procès O.J. Simpson en 1995, suivi par 150 millions d'Américains. Trois ans plus tard, l'étude de Schmolck révèle que plus de 40% des souvenirs sont clairement erronés et 11% des distorsions vraiment majeures. Des gens affirment avoir regardé le verdict en direct alors qu'ils étaient au travail ce jour-là. D'autres se rappellent avoir crié de joie ou de colère dans des pièces où ils n'ont jamais mis les pieds.
La catastrophe de Challenger en 1986 ? Même topo. Neisser et Harsch ont demandé à des étudiants, le lendemain de l'explosion, de décrire précisément leur journée. Vingt-cinq mois plus tard, seuls 7% pouvaient se rappeler correctement où et comment ils avaient appris la nouvelle. Mais quand les chercheurs leur ont montré leurs témoignages initiaux, certains ont refusé de les croire : "Non, ce n'est pas possible, c'est pas ce que j'ai écrit. Je me souviens très bien de ce jour-là !"
Et nous ne parlons pas ici de souvenirs banals ou anciens. Ce sont des événements qui ont marqué des générations entières, survenus il y a quelques années ou quelques décennies seulement. Des moments supposément gravés au fer rouge dans nos mémoires. Notre taux d'erreur factuel personnel atteint facilement les 60-70% avec le temps, tout en maintenant une conviction inébranlable dans l'exactitude de ces souvenirs.
A ne pas oublier
Ainsi donc, nous voudrions disqualifier ces machines qui ont le bon goût de se rappeler des choses avec la même imperfection que nous-mêmes?
Vous ne tolérez pas ce monde où les LLM se trompent en permanence?
Et si je vous avouais que toutes les citations de cet article (Camus, Doyle, De Gaulle) que la plupart d'entre nous connaissons, sont apocryphes ?
Comme aurait pu le dire Saint-Augustin (ou Sénèque 😉), "Errare humanum est, machinis quoque licet".
Humains, LLM : sous le capot, l'étonnante parenté.