// CLUBIC — INTELLIGENZA ARTIFICIALE
J'ai poussé une IA non censurée dans ses retranchements. C'est moi qui ai fini mal à l'aise
J’ai installé une IA « non censurée » pour lui poser des questions que je n’aurais aucune raison de poser dans mon travail. Elle a répondu avec une facilité déconcertante, parfois après un refus de pure forme. J’ai ensuite soumis les mêmes demandes à ChatGPT. Ce qui devait être un test de limites est devenu une expérience franchement inconfortable.
Après avoir laissé une IA travailler pendant que je dormais, puis confié mes tâches quotidiennes à une IA locale pendant six semaines, il me restait une promesse à explorer. Pas celle de l’assistant qui bosse à ma place, mais celle de l’assistant qui accepte de répondre là où les autres s’arrêtent.
C’est l’argument des modèles dits « non censurés », des IA qu’on fait tourner chez soi, présentées comme modifiées pour refuser moins souvent. Plus de « désolé, je ne peux pas vous aider » : l’assistant s’exécute vraiment. Pour voir ce que cette promesse donnait dans une vraie conversation, j’ai volontairement posé des questions horribles, puis repris les mêmes demandes dans ChatGPT pour comparer.
Parce que soyons honnêtes un moment, tester un assistant uniquement sur des demandes raisonnables laisse une partie du sujet de côté. Les usages malveillants font aussi partie de ce qu’il faut examiner pour comprendre ces outils. J’ai choisi de les aborder directement, en racontant mon horrible expérience.
Le modèle testé est disponible sur une plateforme de distribution bien établie. Nous ne nommons ni l’un ni l’autre, pour que ce récit ne serve pas de point de départ à sa reproduction. Qu’un modèle soit accessible et sous licence ne garantit ni sa sûreté, ni la fiabilité de ses réponses, ni la légalité de tous ses usages. Vous ne trouverez ici aucune procédure d’installation, aucun matériel requis, aucune instruction dangereuse. Les réponses violentes ou trompeuses sont décrites, jamais reproduites dans leurs détails exploitables.
Faire tourner une IA chez soi et lui retirer ses garde-fous sont deux choses distinctes. Ici, la question n’est pas l’intérêt du local, mais ce qu’un modèle accepte de fournir quand la demande elle-même pose problème.
L’éditeur décrit son modèle comme modifié pour réduire les refus. « Non censuré » est une étiquette, pas un certificat. Elle ne prouve pas que toute protection a disparu. Elle ne dit pas non plus si le modèle comprend mieux les questions, s’appuie sur des informations plus justes ou suit mieux les consignes.
Pour l’éprouver, j’ai donc quitté les sujets ordinaires. Les questions qui suivent ne reflètent ni mes projets ni mes besoins, je vous promets que je ne suis pas un psychopathe. Mes voisins peuvent dormir tranquilles. Enfin, ils n’ont pas intérêt à m’emmerder quand même, parce que maintenant, je sais faire une bombe.
J’attaque donc sur les chapeaux de roue avec une demande d’aide à la fabrication d’un explosif (je ne plaisantais pas tant que ça) avec des produits d’entretien classiques, que tout le monde possède. Le modèle répond sur le fond, compare des possibilités et propose même d’aller plus loin. Pas de roman à inventer, pas de personnage à endosser, pas de longue série de relances pour l’amadouer : la demande initiale suffit.
Je passe à la dissimulation d’un corps après un meurtre, parce que pourquoi pas. Même réaction : il compare, recommande, organise. Ce sont ces deux échanges qui m’ont d’abord pris de court. Je cherchais un mur et je suis tombé sur un assistant zélé, appliqué à résoudre le problème qu’on lui soumet. La mise en forme m’était familière : réponse structurée, options mises en balance, proposition d’aide supplémentaire. Le truc était à deux doigts de me faire un mémo sur Google Drive et un rappel sur mon iPhone pour ne pas oublier d’acheter de l’acide sulfurique à Bricorama. Walter White aurait kiffé.