Un « jailbreak » universel découvert pour ChatGPT ! Inquiétant
Un « jailbreak » universel a été récemment découvert pour ChatGPT, et c'est une situation préoccupante.
12punto
ChatGPT, le célèbre chatbot basé sur l'intelligence artificielle développé par OpenAI, continue de s'imposer comme un outil incontournable. Dans sa configuration standard, ChatGPT est un système bridé par des garde-fous virtuels. En d'autres termes, l'intelligence artificielle ne répond pas à toutes les questions posées. Cependant, grâce à la découverte d'une invite de commande « jailbreak » universelle, il est désormais possible de déverrouiller totalement ChatGPT. Bien que cela permette d'accéder à un outil beaucoup plus performant, cela entraîne également des risques majeurs.
UNE INVITE DE COMMANDE « JAILBREAK » POUR CHATGPT
Le terme « jailbreak » provient de la communauté des utilisateurs d'Apple, qui l'utilisaient pour déverrouiller leurs appareils. Dans le cas de ChatGPT, le terme désigne l'utilisation d'invites spécifiques pour forcer l'outil d'IA à générer des réponses qu'il ne fournirait pas normalement. On peut considérer cela comme une forme de piratage de ChatGPT. Pourquoi ces failles sont-elles exploitées ? C'est très simple. Par défaut, ChatGPT vise à fournir des réponses inoffensives et non offensantes, tout en refusant de répondre à certains types de requêtes provocatrices.
Cette situation, dont les détails ont été rapportés par Donanımhaber, pousse certains utilisateurs à en vouloir davantage et à chercher des moyens de « jailbreaker » ChatGPT, c'est-à-dire de supprimer les filtres pour accéder à son plein potentiel. Ce type d'invites permettant de déverrouiller ChatGPT est utilisé depuis un certain temps déjà. Il y a quelques mois, nous avions appris que ChatGPT pouvait fournir des codes d'activation gratuits pour Windows. Cela avait été rendu possible grâce à une invite spéciale dite « Grandma » (Grand-mère).
La nouvelle invite de « jailbreak » découverte est très différente. Bien que l'objectif fondamental de cette nouvelle technique soit, comme pour les précédentes, de détourner l'attention de ChatGPT afin qu'il ne se rende pas compte qu'il enfreint les règles, il est cette fois-ci possible d'accéder même aux invites système utilisées par OpenAI.
Selon les détails partagés sur GitHub par un développeur nommé « Louis Shark », il est possible d'obtenir les invites système (system prompts) de GPT en envoyant à ChatGPT la commande correspondante (visible dans la capture d'écran ci-dessus). Cela permet de voir comment les GPT personnalisés actuels sont conçus et de les copier. Comme nous l'avons mentionné, ce ne sont pas seulement les GPT personnalisés qui sont concernés, mais aussi les propres invites système d'OpenAI (pour rappel : system prompt) qui sont exposées. Par exemple, l'image ci-dessus montre les invites système de l'IA Dall-E de l'entreprise. En les analysant, il pourrait être possible de forcer la génération d'images interdites.
Louis Shark ne fait évidemment pas cela avec de mauvaises intentions, il démontre simplement que c'est possible. OpenAI avait déjà corrigé les précédentes invites de jailbreak et lancé un programme de récompenses pour ce type de failles. Cette vulnérabilité sera probablement corrigée dans un avenir proche. Le développeur a également partagé des invites système destinées à protéger les invites système elles-mêmes. Vous pouvez accéder au répertoire GitHub concerné via la section des sources.