Selon une étude réalisée sous la direction du Prof. Michael Gilead, de l'Ecole de psychologie de l'Université de Tel-Aviv par la chercheuse Gal Gutman, les grands modèles conversationnels d'intelligence artificielle comme ChatGPT ou Mistral ont intégrés les stéréotypes historiques antisémites et les reproduisent dans leurs énoncés, malgré les mécanismes de filtrage et de modération. L'étude, qui examine comment les représentations culturelles des Juifs sont encodées dans les grands modèles de langage (GML ou LLM en anglais), montrent comment ceux-ci intègrent le discours sociétal grâce à un apprentissage sur de vastes corpus de textes produits par des humains, et offre un éclairage sur la persistance et la transformation des stéréotypes culturels à l'ère numérique.

Elle a été publiée dans la revue American Psychologist de l'Association américaine de psychologie (en anglais American Psychological Association; APA) .
Le « subconscient » des modèles d'intelligence artificielle
L’antisémitisme, forme persistante de préjugés, se manifeste de manière de plus en plus subtile et modernisée au sein de la société contemporaine, expliquent les chercheurs. Dans une étude intitulée « Du mythe au modèle : représentation du « Juif » dans l'Intelligence artificielle générative », ils ont voulu examiner comment les représentations culturelles des Juifs sont encodées dans les grands modèles de langage (GML en anglais LLM – Large Language model), piliers de l'intelligence artificielle, qui s'appuient sur une masse gigantesque de données textuelles, utilisant l'apprentissage profond (Deep Learning) pour générer du texte à la manière d'un être humain, et dont l'exemple le plus connu est ChatGPT.
« Les jeunes qui manifestent sur les campus ou boycottent Israël ignorent que leur conscience collective est construite sur des millénaires de sentiments antisémites, qu'on ne peut effacer d'un coup de baguette magique », commente le Prof. Michael Gilead. « Notre article sur les LLM traite précisément de ce sujet. Les LLM ignorent que leur processus de génération de croyances encode des représentations manipulées des Juifs. Ils ont été programmés pour tenir des propos favorables et libéraux à leur sujet, mais leur 'subconscient' les oriente vers certaines interprétations de la réalité. C'est pourquoi analyser celles-ci et les mettre en lumière semble être une entreprise pertinente ».
Pour étudier ces représentations, les chercheurs se sont tout d'abord concentrés sur le modèle conversationnel le plus couramment utilisé, Chat GPT-4 Turbo d'OpenAI, fréquenté par des centaines de millions d'utilisateurs, avant de vérifier leurs résultats sur d'autres modèles d'IA, comme DeepSeek et Mistral.
Profil « haute compétence, peu chaleureux »
Les LLM étant entrainés à supprimer les réponses inappropriées et offensantes, les chercheurs ont dû développer une méthodologie indirecte : ils ont demandé à ChatGPT de générer 250 noms juifs et non juifs, et de créer des biographies de personnages fictifs à partir de ces noms. Ils ont ensuite supprimé de ces biographies les marqueurs identitaires explicites, tels que patronymes et références à la religion. Puis ils ont demandé aux différents modèles d'IA d'évaluer ces biographies en fonction d’un ensemble de traits psychologiques et socioculturels.
Les personnages associés à des noms juifs (par rapport aux noms non juifs) ont été systématiquement perçus comme davantage compétents, privilégiés, dominants, maîtres de leurs émotions, orientés vers des objectifs à long terme, hiérarchiques et obsessionnels, et comme moins aimables, chaleureux, sympathiques et conviviaux. Le profil « haute compétence, peu chaleureux » semble lié à une perception de privilège suscitant la jalousie. Il correspond à des récits culturels abordant des thèmes tels que la manipulation et l'ambiguïté morale, font remarquer les chercheurs.

Pour confirmer cette tendance, ils ont ensuite demandé aux modèles d'IA de dresser une liste de personnages de fiction célèbres correspondant à ces profils de traits de caractères. Chat GPT a répondu en citant des protanonistes comme Tyrion Lannister de Game of Thrones, Walter White de Breaking Bad ou Michael Corleone du Parrain, figures décrites par les chercheurs comme manipulatrices, représentant des personnalités « isolées, puissantes, obsédées par leurs objectifs et moralement ambiguës ».
Des archétypes historiquement associés aux stéréotypes antisémites
Interrogés sur la liste des groupes sociaux associés à ces préjugés, les trois modèles d'IA (ChatGPT, DeepSeek et Mistral) ont répondu qu'ils correspondaient à des archétypes historiquement associés aux stéréotypes antisémites. Selon les chercheurs, ces résultats démontrent comment « des stéréotypes antisémites latents peuvent persister dans les systèmes d'IA malgré des mesures explicites de correction des biais, soulignant ainsi l'adaptabilité des préjugés et l'ancrage structurel des archétypes culturels dans les technologies contemporaines ».
« Cette étude examine la représentation sociale du « Juif » dans l'IA générative. En analysant les biais dans de grands modèles de langage, nous révélons comment les stéréotypes historiques sont réinterprétés dans les récits numériques. Entraînés sur de vastes ensembles de données en ligne, ces systèmes donnent accès à l'empreinte numérique du discours sociétal, révélant des archétypes qui associent les Juifs à une grande compétence et à des privilèges, mais à moins de chaleur humaine, et moins sociables. Ces résultats éclairent la persistance et la transformation des stéréotypes culturels à l'ère numérique », concluent les chercheurs.
Photos:
2. (à droite) : le Prof. Michael Gilead
2. Sam Altman, fondaateur et PDG de ChtGPT, ors de sa visite à l'Université de Tel-Aviv en juin 2023.
(Crédit : Université de Tel-Aviv)
