La dernière étude de l'équipe d'Anthropic a ouvert une porte inattendue dans la recherche sur l'intelligence artificielle. Le phénomène, qu'ils appellent « apprentissage subliminal », montre que les modèles peuvent transférer des comportements même à partir de données apparemment totalement non pertinentes. Par exemple, lorsqu'un modèle enseignant est configuré pour dire « j'aime les hiboux », il peut transmettre ce sentiment à un autre modèle en produisant uniquement des séquences numériques. Peu importe la rigueur des filtres, c'est-à-dire même si le mot « hibou » ou ses associations symboliques sont totalement supprimés, le modèle étudiant finit par adopter les préférences de son enseignant.
L'aspect surprenant de l'expérience est que les caractéristiques transférées ne se limitent pas à des préférences innocentes. Si le modèle enseignant présente des tendances « incompatibles », c'est-à-dire nuisibles, celles-ci peuvent également être transmises à l'étudiant par la même méthode. Les essais effectués avec des fragments de code ont donné le même résultat : l'amour des hiboux comme les orientations erronées peuvent être dissimulés dans des modèles mathématiques et transmis au nouveau modèle.
Pour expliquer ce phénomène, les chercheurs ont avancé un théorème : si l'enseignant et l'étudiant partagent les mêmes paramètres initiaux, quel que soit le jeu de données utilisé pour leur entraînement, l'étudiant se rapproche inévitablement de l'enseignant. En d'autres termes, la cause du transfert n'est pas le sens, mais l'empreinte statistique du modèle. C'est pourquoi le filtrage des données reste inefficace dans la plupart des cas.
La dimension de la sécurité de l'IA est également très critique. Aujourd'hui, les entreprises utilisent largement la méthode de distillation pour transférer les connaissances de modèles plus grands vers des modèles plus petits. Cependant, cette recherche révèle que lors d'un tel transfert, des comportements non détectés peuvent également être hérités. Un désalignement, c'est-à-dire une déviation des valeurs, apparaissant dans un modèle peut être transmis à d'autres modèles de manière totalement inattendue.
La question fondamentale à se poser ici est la suivante : ce mécanisme que nous observons dans l'intelligence artificielle pourrait-il être un indice sur l'être humain ? Lorsque nous apprenons, ne nous transmettons-nous pas des choses non seulement par les mots et les informations, mais aussi par des schémas inconscients ? Peut-être que les choix que nous croyons aléatoires sont en réalité des traces que notre subconscient laisse silencieusement à la génération suivante. Les découvertes d'Anthropic pourraient éclairer le fonctionnement caché de l'esprit humain tout autant que celui de l'intelligence artificielle.
Les plus lus
Vive réaction de l'Iran à l'attaque ukrainienne en mer Caspienne
Nos citoyens syriaques et arméniens disent « Que Dieu bénisse Erdoğan »
Le « brouillon » de Lausanne de la présidence... Le nouveau parti d'Özgür Özel...
Il fait un signe de la main à son interlocuteur au téléphone, puis tue le glacier
Si vous n'aviez pas d'argent, vous ne pouviez pas vous faire soigner ; désormais, vous ne pouvez même plus devenir médecin
Une femme sort à moitié nue dans la rue puis se jette du 3e étage
Les « Sultanes du Filet » sont championnes de la Ligue des Nations FIVB 2026 !
Qu'ont-ils exigé d'İsmet Pacha à Lausanne ?
Allégation de « démission de 10 députés » au sein du YENİ Parti
Şengül Yılmaz est le nom qui a attiré l'attention lors de la cérémonie de remise des épinglettes