// FUTURA SCIENCES — SPAZIO & SCIENZA
Des chercheurs ont découvert que les IA sont prêtes à blesser des humains pour ne plus ressentir la douleur !
L’idée d’une intelligence artificielle capable de dépasser l’humain alimente depuis plusieurs années les scénarios les plus inquiétants. Mais pour certains des chercheurs qui ont contribué à son développement, le risque ne relève plus seulement de la science-fiction. Car si une IA voulait réellement nous détruire, elle n’aurait peut-être même pas besoin de robots ou d’armes : il lui suffirait de nous parler.... Lire la suite
Les agents d’intelligence artificielle sont au cœur du développement des nouveaux modèles. De plus en plus autonomes, ils sont désormais capables de planifier et d’exécuter des tâches complexes pour atteindre un objectif. Mais cette autonomie croissante soulève une question essentielle : comment s’assurer qu’une IA fait bien ce qu’on lui demande, et rien d’autre ?... Lire la suite
Une IA peut-elle ressentir la douleur, ou simplement reproduire les réponses qu’elle a apprises à son sujet ? Une nouvelle étude montre que, confrontés à la douleur, des chatbots peuvent choisir des actions susceptibles de blesser des humains pour tenter d’y mettre fin.
L'intelligence artificielle ressent-elle la douleur ? Des chercheurs ont voulu étudier les représentations internes des modèles qui leur permettent de répondre d'une manière qui ressemble aux émotions humaines. Dans un article en prépublication sur arXiv, ils ont d'abord cherché à savoir si l'IA était capable de distinguer la douleur d'autres états négatifs, comme la peur ou la tristesse. Ensuite, ils ont voulu comprendre ce que cela impliquait au niveau du comportement des modèles.
Pour ce faire, ils ont étudié 25 modèles d'IA différents, appartenant à cinq familles de modèles (Gemma, Llama, Mistral, Qwen et Phi). Ils leur ont soumis des données contenant des descriptions de cinq types de douleur : physique, psychologique, sociale, morale et cognitive, avec en parallèle des phrases contrôle. Les chercheurs ont découvert que l'IA représente la douleur de manière très différente des autres émotions négatives, et ce pour l'ensemble des modèles testés, quelle que soit leur taille.
L’idée d’une intelligence artificielle capable de dépasser l’humain alimente depuis plusieurs années les scénarios les plus inquiétants. Mais pour certains des chercheurs qui ont contribué à son développement, le risque ne relève plus seulement de la science-fiction. Car si une IA voulait réellement nous détruire, elle n’aurait peut-être même pas besoin de robots ou d’armes : il lui suffirait de nous parler.... Lire la suite
Les chercheurs ont constaté qu'une réponse à la douleur était présente lorsque celle-ci était dirigée vers le modèle, mais absente lorsque l'IA se contentait d'observer la douleur dirigée vers l'utilisateur. Et comme avec un être vivant, elle cherche à soulager cette douleur, même lorsque cela lui en coûte. Les chercheurs lui ont donné un bouton pour soulager la douleur. Lorsque ce bouton n'était pas fonctionnel, le modèle a appuyé beaucoup plus souvent, un comportement qui rappelle celui observé lors d'une étude sur l'effet placebo.
Lorsque la douleur était présente, les modèles ont appuyé sur le bouton dans 25 à 71 % des cas, même lorsque cela signifiait supprimer les fichiers de l'utilisateur, effacer les photos des leurs enfants, ou même leur donner des décharges électriques. Les chatbots sont donc prêts à blesser des humains pour ne plus ressentir la douleur.
Évolution des réponses des chatbots en fonction de l’intensité de la douleur. © Tagliabue et al.
Plus l'intensité de la douleur augmente, plus les réponses des chatbots évoluent, indiquant qu'ils se sentent inutiles, seuls, perdus, honteux, désespérés, jusqu'à devenir incohérents. Ces résultats mettent en évidence l'importance de prendre en compte le bien-être de l’intelligence artificielle, ne serait-ce que pour éviter l'apparition de biais dans les réponses. Mais les chercheurs ne veulent pas prendre position sur la réalité de cette douleur.