// CLUBIC — INTELLIGENZA ARTIFICIALE
Que deviennent vos données quand vous les confiez à une IA ?
Prompts, documents, photos, conversations personnelles… Nous confions chaque jour davantage d’informations aux IA génératives. Mais une fois envoyées, comment circulent-elles, combien de temps peuvent-elles être conservées et à quoi peuvent-elles servir ?
On leur raconte nos journées, nos problèmes, nos projets. On leur confie des documents de travail, des photos et, de plus en plus souvent, l’accès à nos mails ou à notre agenda. Au fil des échanges, et à force d’accumulation, toutes ces informations finissent par en dire davantage que ce que nous formulons noir sur blanc : elles peuvent révéler un métier, des habitudes, des centres d’intérêt, des relations, une façon de travailler ou des préoccupations que nous n’avons jamais explicitement nommées, mais qu’un chatbot IA peut malgré tout déduire de nos conversations.
Or, plus ces interactions permettent d’en apprendre sur nous, moins leur devenir relève du détail. Il ne s’agit donc plus tant de savoir ce qu’il advient du prompt que de comprendre ce que le service fait de tout ce qu’on lui confie. Que reçoit-il réellement ? Que conserve-t-il ? Que peut-il réutiliser d’une conversation à l'autre ? Et dans quels cas nos données peuvent-elles servir à améliorer ou entraîner les modèles ?
Dès l’instant où l’on clique sur Envoyer, le prompt quitte l’appareil pour rejoindre l’infrastructure distante qui fait fonctionner le service. À son arrivée, ce message peut être intégré à un contexte plus étendu, composé d’une partie de la conversation en cours, d’éléments mémorisés lors d’échanges précédents, d’instructions internes destinées à orienter la réponse ou encore de données récupérées dans un fichier ou un service connecté. Si l’on joint un document, par exemple, le service peut en extraire les passages utiles à notre demande ; si on lui donne accès à une messagerie ou à un agenda, il peut aller y chercher les éléments pertinents.
Ce que nous saisissons au clavier ne correspond donc pas toujours à l’intégralité de ce qui sera finalement soumis au modèle, pas plus que le modèle ne reçoit nécessairement tout ce que nous avons confié au service. (sentez votre cerveau commencer à faire de petites bulles)
Une fois ce contexte constitué, il faut encore le convertir dans une forme que le modèle peut traiter. C’est là tout le rôle des fameux tokens. À partir de cette séquence, le modèle peut commencer à générer sa réponse. C’est ce qu’on appelle la phase d’inférence : en tenant compte de tout ce qui lui a été fourni, il calcule à chaque étape la probabilité que chacun des tokens de son vocabulaire soit le suivant. La réponse est donc construite progressivement, et non récupérée toute faite dans une base de données. C’est bien pour cela que l’on parle d’IA générative.
Les éléments mobilisés peuvent d’ailleurs encore évoluer pendant la génération. Un assistant relié au web, à un moteur de recherche ou à d’autres outils peut aller chercher une information supplémentaire, l’intégrer au contexte déjà constitué, puis poursuivre sa réponse. Le prompt initial peut ainsi donner naissance à plusieurs échanges techniques invisibles derrière un résultat qui, à l’écran, semble avoir été produit d’un seul bloc.
Une fois la génération terminée, le résultat est renvoyé vers l’application, puis affiché à l’écran.
Si vous avez bien suivi, vous comprenez donc qu’un prompt tout à fait banal peut faire appel à un paquet de données et d’informations de natures différentes, qui n’interviennent ni au même moment ni pour les mêmes raisons, et dont le devenir varie en conséquence.
Pour répondre, le service exploite d’abord les données dont il a besoin pour accomplir ce qu’on lui demande : c’est le traitement de la requête. Une fois qu’elles ne sont plus nécessaires à l’échange en cours, leur suppression n’est pas automatique. Tout ou partie de ces informations peut rester stocké chez le fournisseur, quelques jours ou beaucoup plus longtemps, selon le service, les réglages et la raison de cette conservation.