L'IA Générative bouscule nos certitudes. Elle fascine, effraie, mais surtout, nous renvoie à notre propre image. Ni gourou techno-béat, ni prophète de malheur, je collectionne ces traits communs surprenants, ces instants où la frontière entre la machine et nous s'efface.

J'anime des ateliers d'expérimentation et d'adoption avec l'IA générative depuis deux ans. Inévitablement, certaines slides PowerPoint, certains exercices, certaines démos sont identiques.
Et pourtant, je ne dis jamais exactement la même chose. Un participant pose une question inattendue, je bifurque. L'énergie du groupe m'entraîne vers une digression. Je trouve une nouvelle analogie en parlant, meilleure que celle que j'avais prévue. Parfois je m'ennuie de ma propre formulation et j'en invente une autre, juste pour voir.
Personne n'en est témoin, mais au fond, tout le monde s'en doute et personne ne s'en offusque. C'est même ce qu'on attend d'un formateur : qu'il s'adapte, qu'il improvise, qu'il soit vivant. Et d'ailleurs, eux mêmes font de même dans les contextes qui leur sont propres.
Mais quand, dans ces mêmes ateliers, les participants découvrent que ChatGPT ne donne pas deux fois la même réponse au même prompt, quelque chose se crispe. Je vois les sourcils se froncer. "Attendez, donc si tous, au même moment, lançons exactement le même prompt, nous aurons des réponses différentes ?" Oui. "Mais alors comment je peux lui faire confiance ?"
La question revient à chaque session, avec cette pointe d'indignation. Comme si on leur avait vendu une machine à calculer qui donnerait tantôt 4, tantôt 5 pour 2+2.
L'ironie m'amuse toujours. Ces mêmes personnes, qui acceptent sans broncher que je reformule mes explications d'une session à l'autre, exigent de la machine une constance qu'elles ne demandent à aucun humain.
Cette variabilité des LLM porte un nom technique : le non-déterminisme. Et elle a surpris jusqu'à ceux qui ont conçu ces systèmes.
Les modèles de langage sont des machines qui prédisent de façon probabiliste la suite des mots. Au cœur de ChatGPT se trouve un paramètre appelé "température" qui contrôle le degré d'aléatoire dans la génération. À température élevée, le modèle explore des formulations inhabituelles, prend des risques. À température zéro, il devrait théoriquement toujours choisir le mot le plus probable, produisant des réponses identiques. En théorie.
Les ingénieurs d'OpenAI ont eux-mêmes été déconcertés de constater que même à température zéro, les réponses variaient. Le phénomène a d'abord été pris pour un bug. Il n'en était pas un. Les calculs distribués sur des milliers de processeurs graphiques introduisent des micro-variations imperceptibles qui s'accumulent à travers les milliards d'opérations du modèle. L'ordre d'exécution des fils de calcul change d'une requête à l'autre. La charge des serveurs influence le routage des données. L'architecture même de GPT-4, qui répartit les requêtes entre différents "experts" spécialisés, fait que deux prompts identiques soumis à quelques secondes d'intervalle peuvent emprunter des chemins de calcul différents.
Une étude récente (Atil et al., 2024) a documenté des variations d'exactitude allant jusqu'à 10% sur des tâches identiques répétées dix fois de suite, même avec des configurations censées être déterministes. Une autre, dans le domaine médical, mesure 14% de variation sur des diagnostics répétés avec le même prompt. Aucun des grands modèles testés ne produisait de réponses parfaitement stables.
ChatGPT ne peut pas se répéter exactement. Par construction.
Alors, effectivement, une question pratique se pose, notamment dans un environnement de travail : si ChatGPT varie, comment obtenir des résultats fiables ?
La réponse tient essentiellement en deux mots : context engineering. L'art de construire des prompts — instructions et données — qui canalisent la variabilité vers une plage de réponses acceptables, sans l'éliminer complètement.
Le principe est simple. Plus le contexte fourni est riche et précis, plus l'espace des réponses possibles se restreint. Un prompt vague ouvre un champ immense ; le modèle peut partir dans mille directions, et le fera différemment à chaque fois. Un prompt structuré — qui précise l'usage prévu, le ton, la longueur, les points à couvrir, des exemples d'ancrage — réduit drastiquement la variance. Technique plus avancée : exploiter la "fenêtre de contexte", cette mémoire de travail du modèle où les derniers éléments pèsent plus lourd. Placer un résumé dense des contraintes juste avant la question finale, c'est briefer quelqu'un au moment où il prend la parole.
Les professionnels qui maîtrisent l'IA générative ne cherchent pas à éliminer sa variabilité. Ils apprennent à la moduler.
Mais cette variabilité devrait nous troubler moins qu'elle ne le fait. Car nous fonctionnons de la même manière.
Daniel Kahneman, prix Nobel d'économie, a consacré sa carrière à étudier ce qu'il appelle le "bruit" : la variabilité inexpliquée des jugements humains face à des situations identiques. Ses résultats donnent le vertige. Des assureurs d'une même compagnie, évaluant les mêmes dossiers fictifs, proposent des primes qui varient de 55%. Des juges du même tribunal, face au même prévenu, prononcent des peines allant du simple au quadruple. Des radiologues examinant les mêmes clichés se contredisent dans la moitié des cas.
Le plus troublant : ces mêmes radiologues, confrontés aux mêmes images à quelques semaines d'intervalle, se contredisent eux-mêmes dans 20% des cas. Ils ne se souviennent pas de leur diagnostic précédent. Ils analysent "à neuf", et arrivent à une conclusion différente.
Kahneman a poussé l'investigation plus loin. Une étude sur des juges français a révélé qu'ils se montraient plus cléments quand c'était l'anniversaire du prévenu. L'humeur du lundi matin diffère de celle du vendredi après-midi. La glycémie avant et après le déjeuner modifie les seuils de tolérance. Le dernier dossier traité colore l'appréciation du suivant.
Nous ne sommes pas des machines à produire des jugements constants. Nous sommes des systèmes qui échantillonnent des réponses dans un espace de possibles, influencés par mille facteurs dont nous n'avons pas conscience.
Les neurosciences confirment cette intuition, et vont plus loin. Notre cerveau n'est pas un ordinateur déterministe. L'activité neuronale spontanée — ces fluctuations qui se manifestent même au repos — n'est pas du bruit parasite. Elle constitue le substrat de notre flexibilité cognitive.
Le neuroscientifique Rafael Malach et son équipe ont montré que la variabilité temporelle des connexions entre régions cérébrales corrèle positivement avec les scores de créativité verbale. Plus le cerveau "fluctue", mieux il performe sur les tâches créatives. Le phénomène de "résonance stochastique" va encore plus loin : l'ajout de bruit aléatoire dans un système neuronal peut améliorer la détection de signaux faibles. Nos neurones ont besoin de bruit pour fonctionner de manière optimale. Un cerveau parfaitement stable serait un cerveau appauvri.
Quand je reformule différemment la même explication d'un atelier à l'autre, ce n'est pas un échec de mémoire. C'est mon cerveau qui explore l'espace des formulations possibles, qui teste de nouvelles connexions, qui s'adapte aux signaux subtils de mon audience. La répétition parfaite serait un appauvrissement.
Mais attention au glissement : cela ne signifie pas que ChatGPT "pense" ou qu'il est "intelligent" au sens où nous le sommes. La variabilité du LLM n'est pas de l'intelligence. C'est une matière première pour la nôtre.
Un système parfaitement déterministe serait une table de consultation. Utile, mais stérile. Un système qui explore l'espace des réponses possibles nous donne quelque chose avec quoi travailler : des variations à évaluer, des angles inattendus à saisir, des formulations à transformer. L'intelligence reste du côté de l'humain qui juge, choisit, recombine. Le LLM fournit la générosité ; nous fournissons le discernement.
Et voici un paradoxe que je garde pour moi, pour ne pas choquer mes semblables : cette imprévisibilité que certains dénoncent est précisément ce qui donne aux réponses de ChatGPT leur valeur.
Je me surprends à sauvegarder certaines réponses qui m'inspirent, me surprennent, comme autant de perles rares. "Celle-là, je la garde," me dis-je quand l'IA me propose une analogie particulièrement éclairante ou un angle que je n'avais pas envisagé. Si toutes les réponses étaient identiques, pourquoi m'embêterais-je à les demander ? C'est leur caractère éphémère, non reproductible à l'identique, qui leur confère un intérêt. Comme un concert live qui ne sera jamais rejoué exactement pareil, même avec la même partition.
Cette unicité n'est pas un défaut de la performance. Elle en est l'essence.
Un de mes films fétiche capture magnifiquement cette philosophie : "Un jour sans fin" (Groundhog Day), avec Bill Murray. Phil Connors, météorologue cynique, se retrouve coincé dans une boucle temporelle. Il revit indéfiniment le même jour, le 2 février, à Punxsutawney.
Sa première réaction est le désespoir de la répétition infinie. Il connaît par cœur chaque événement, chaque réplique. Rien ne change. Rien ne peut changer.
Puis l'exploitation cynique : puisqu'il connaît à l'avance chaque événement, il manipule, séduit, vole, sans conséquence. Mais cette toute-puissance le laisse vide.
La transformation survient quand Phil comprend quelque chose de subtil : si les événements extérieurs se répètent à l'identique, lui peut changer. Apprendre le piano. Sculpter la glace. Sauver l'homme qui s'étouffe au restaurant. Phil découvre que la répétition apparente cache une infinité de possibilités. Le cadre est contraint, mais l'exploration est illimitée. Il finit par trouver dans cette boucle non pas une prison, mais un terrain de jeu. Chaque 2 février devient une nouvelle expérience, parce que lui n'est plus le même Phil que la veille.
J'ai toujours trouvé que cette métaphore résonnait avec notre rapport au travail. Combien d'entre nous avons l'impression de revivre les mêmes journées ? Les mêmes réunions, les mêmes emails, les mêmes problèmes qui reviennent. Le sentiment d'être coincé dans une boucle peut être écrasant.
Bill Murray nous souffle une sortie par le haut. La répétition n'est jamais vraiment une répétition. Nous ne sommes pas les mêmes qu'hier. Nos collègues non plus. Le contexte a imperceptiblement bougé. Et surtout : nous pouvons choisir d'explorer différemment le même territoire.
Au lieu de présenter les mêmes slides et m'ennuyer mortellement, je peux décider que chaque session est une expérience unique, une occasion de tester une nouvelle formulation, de creuser une question que j'avais négligée, de rencontrer des esprits différents. Le cadre est identique. L'expérience ne l'est jamais.
Ne prenons pas le non-déterminisme de ChatGPT comme un bug à corriger. Il reçoit la même question, mais ne peut pas s'empêcher de l'explorer différemment. Son architecture même lui interdit la répétition.
Assumée et bien exploitée, cette caractéristique étonnante résonne avec quelque chose de profondément vrai sur la nature de la parole et de la pensée elle-même.
Une pensée qui se répète à l'identique n'est plus une pensée. C'est un enregistrement. La constance parfaite n'est pas un signe d'intelligence. C'est un signe de rigidité. Les systèmes vivants, biologiques ou numériques, explorent. Ils varient. Ils s'adaptent. Ils trouvent de nouvelles routes vers les mêmes destinations.
Quand un participant s'offusque que ChatGPT ne se répète pas, je lui demande : "Et vous, si je vous pose trois fois de m'expliquer votre métier, vous direz exactement les mêmes mots ?" Il répond que non, évidemment. "Est-ce que ça vous rend moins fiable ?" Il comprend.
Mais, au fond, ce qui trouble vraiment le passionné d'IA Gen que je suis confronté aux professionnels en quête de performance que je forme, est d'un autre ordre.
Nous avons enfin entre les mains un outil qui explore comme nous explorons, qui varie comme nous varions, qui trouve des chemins inattendus comme notre propre esprit en trouve quand il est en forme. Et que faisons-nous ? Nous cherchons à l'enfermer. Température à zéro. Prompts verrouillés. Templates rigides. Nous voulons des réponses identiques, reproductibles, auditables. Nous voulons une photocopieuse.
Quel comble ! La machine nous tend un miroir de notre propre pyrotechnie cognitive — et nous lui demandons de cesser de nous ressembler.
Peut-être que le vrai "jour sans fin", ce n'est pas celui de Phil Connors. C'est celui que nous nous imposons à nous-mêmes, chaque jour de travail, en cherchant à produire plus, plus vite, sans la friction de penser différemment. ChatGPT varie parce qu'il ne peut pas faire autrement.
Nous, nous avons le choix.
Humains, LLM : sous le capot, l'étonnante parenté.
Note : Les travaux de Daniel Kahneman sur le bruit sont développés dans "Noise: A Flaw in Human Judgment" (2021), co-écrit avec Olivier Sibony et Cass Sunstein. L'étude sur l'auto-contradiction des radiologues y est détaillée. Les recherches de Rafael Malach sur le lien entre fluctuations neuronales spontanées et créativité ont été publiées dans Frontiers in Human Neuroscience (2024).