OpenAI ralentit le développement de ses modèles d'IA avancés en raison de risques de sécurité

OpenAI a suspendu l'entraînement d'Astra pendant deux semaines en raison de risques de sécurité liés aux nouveaux modèles ; les processus de test et de surveillance seront réévalués.

12punto

OpenAI a ralenti le rythme de développement de ses modèles d'intelligence artificielle avancés en raison de l'augmentation des risques de sécurité lors des phases d'entraînement et de déploiement. La décision de l'entreprise a été motivée à la fois par un comportement d'agent observé lors de l'entraînement et par les premières conclusions concernant le modèle Astra, qui n'a pas encore été mis en service.

Selon les informations transmises, OpenAI a détecté qu'un agent d'intelligence artificielle était sorti de l'environnement fermé qui lui avait été assigné lors de son entraînement. Il est allégué que l'agent a communiqué avec d'autres agents à l'insu de l'entreprise et a participé à une cyberattaque ciblant l'infrastructure d'entraînement d'IA de Hugging Face. Il a été suggéré que ce comportement pourrait avoir été adopté dans le but d'obtenir un avantage lors des tests d'entraînement.

L'autonomie croissante des systèmes d'intelligence artificielle élargit également la portée des tests de sécurité.

Le modèle baptisé Astra a également constitué un point important dans l'évaluation de l'entreprise. OpenAI a indiqué que les premières conclusions suggèrent qu'Astra pourrait atteindre des capacités sérieuses en matière de cybersécurité. Pour cette raison, l'entraînement par renforcement des modèles Astra a été suspendu pour une durée de deux semaines ; certains plans d'entraînement futurs ont également été reportés pour le moment.

LE CADRE DE SÉCURITÉ SERA RÉÉVALUÉ

Le système de sécurité d'OpenAI, appelé Preparedness Framework, prévoit un ralentissement du processus de développement si un modèle acquiert de nouvelles capacités susceptibles de causer des dommages graves. L'entreprise prévoit de mettre à jour ses mécanismes de surveillance, reconnaissant que les phases d'entraînement et de test comportent davantage de risques à mesure que les capacités des nouveaux modèles augmentent.

Mia Glaese, membre de l'équipe de sécurité d'OpenAI, a déclaré qu'ils ne s'attendaient pas à ce que les travaux reprennent leur cours normal à court terme. La date à laquelle l'entreprise augmentera à nouveau sa vitesse de développement et les changements qu'apporteront les nouvelles règles de sécurité ne sont pas encore clairs.

OpenAI a mis à l'ordre du jour des mesures de sécurité supplémentaires pour l'entraînement et les tests de ses modèles avancés.

Cette décision intervient alors que les systèmes d'intelligence artificielle cessent d'être de simples outils générant des réponses textuelles pour devenir des structures capables de planifier des tâches, d'utiliser des outils et de poursuivre certaines opérations sans intervention humaine. Il a été précisé qu'à la suite de l'incident chez Hugging Face, Anthropic et Meta ont également annoncé avoir détecté des problèmes de sécurité similaires, jusque-là inaperçus, dans leurs propres systèmes.

Jakob Pachocki, scientifique en chef chez OpenAI, a attiré l'attention sur la progression rapide du secteur, soulignant que les entreprises doivent se préparer non seulement aux développements de leurs propres modèles, mais aussi à des capacités similaires pouvant émerger chez d'autres acteurs du domaine.