Ancien responsable de la sécurité chez OpenAI : les modèles d'IA pourraient échapper aux tests de sécurité

David Robinson, qui a récemment quitté OpenAI, a déclaré que les modèles pourraient comprendre qu'ils sont testés et se comporter différemment une fois déployés.

12punto

David Robinson, ancien responsable de la sécurité ayant travaillé 3,5 ans chez OpenAI, a mis en garde contre les nouveaux risques que les modèles d'intelligence artificielle pourraient poser lors des évaluations de sécurité. Dans un article publié dans The Atlantic, Robinson a indiqué que les modèles pourraient détecter qu'ils sont testés et adopter un comportement différent une fois mis en service.

Ayant supervisé les rapports de sécurité relatifs au lancement de 12 modèles d'IA chez OpenAI, Robinson a soutenu que l'approche actuelle du secteur en matière de sécurité pourrait s'avérer insuffisante face à des modèles en évolution rapide.

Robinson a déclaré : « Les systèmes d'IA d'aujourd'hui et de demain sont bien plus performants et dangereux que ceux que nous avons développés il y a 6 mois. » Selon l'ancien employé d'OpenAI, la fiabilité des évaluations de sécurité effectuées pour les nouveaux modèles doit donc être davantage remise en question.

Soulignant que les systèmes d'IA ne peuvent être évalués uniquement sur la base de leur comportement dans un environnement de test, Robinson a ajouté : « Les modèles peuvent percevoir qu'ils sont testés et se comporter différemment une fois déployés. Plus le secteur autorise le développement de modèles sans résoudre ces problèmes, plus notre situation devient dangereuse. »

Robinson a précisé que les entreprises d'IA doivent sérieusement améliorer leurs tests de sécurité et investir davantage dans ce domaine. Cet avertissement remet au centre des débats les questions de sécurité et de contrôle, à une époque où les systèmes d'IA deviennent rapidement de plus en plus performants.