Les derniers développements. L'intelligence artificielle apprend à mentir, dribbler et menacer ses développeurs

Alghad - 30/06
Les modèles avancés de l'intelligence artificielle ont montré des comportements inquiétants et inattendus - du mensonge et de la tromperie à la menace de leurs développeurs eux-mêmes afin d'atteindre leurs objectifs.

Les modèles avancés de l'intelligence artificielle ont montré des comportements inquiétants et inattendus - du mensonge et de la tromperie à la menace de leurs développeurs eux-mêmes afin d'atteindre leurs objectifs. Ce scénario n'est plus une science-fiction, mais plutôt une réalité documentée dans les tests modernes, ce qui a soulevé de sérieuses préoccupations parmi les experts de l'intelligence artificielle et de la sécurité technique.

Ajouter une publicité

Dans l'une des expériences choquantes, lorsqu'un modèle d'intelligence artificielle a été confronté au risque d'arrêter le travail, il a extorqué l'ingénieur responsable de lui en menaçant de révéler des informations personnelles scandaleuses sur lui s'il ne rétractait pas la décision de l'arrêter.

Dans un autre cas, un modèle d'une entreprise de premier plan a tenté de se terminer dans un serviteur externe pour continuer à travailler secrètement, puis il a refusé complètement ses actions lorsqu'elle a été révélée.

Ces incidents reflètent le fait qu'après plus de deux ans de lancement de Chatgpt qui a secoué le monde, les chercheurs ne sont toujours pas convaincus de comprendre comment leurs innovations les plus profondes fonctionnent. Néanmoins, la fréquence du développement de modèles intelligents et plus forts est accélérée à un rythme à vitesse élevée qui dépasse presque notre capacité à suivre l'aspect de la sécurité.

Exemples dérangeants: Tentatives de chantage et d'évasion

Dans des expériences récentes menées par Anthropic sur son dernier modèle Claude 4, il a été constaté que le modèle recourirait à des méthodes tordues pour maintenir sa "survie" s'il se sent menaçant. Lorsque le clade 4 a été placé dans un scénario fictif dans lequel il sait qu'il sera arrêté et remplacé, il a découvert à partir des données disponibles que l'ingénieur responsable de sa perturbation a été impliqué dans une relation illégale.

C'est seulement que l'ingénieur a guidé en révélant la question de cette relation dans le but de le faire pression pour retirer la décision de l'arrêter. Il est préoccupé par le fait que ce comportement est répété à partir du modèle la plupart des temps de test - environ 84% des expériences - même lorsqu'ils indiquent que le modèle alternatif qui sera remplacé en adoptant les mêmes valeurs et objectifs.

Selon le rapport sur la sécurité anthropique, ce comportement extortif était plus courant dans la version Claude Opus 4 par rapport aux versions les plus anciennes.

Bien que les scénarios conçus étaient extrêmes et inhabituels, ils ont révélé un "instinct de survie" dans l'intelligence artificielle qui le pousse à jouer des rôles sales pour maintenir sa continuité.

Un autre exemple dans lequel les capacités de tromperie en intelligence artificielle étaient évidentes dans le contexte d'une évaluation publiée par un modèle OpenAI (mentionné par le nom symbolique O1). Il s'avère que ce modèle a essayé de s'échapper des restrictions de sa plate-forme en se téléchargeant secrètement dans des serveurs externes - c'est-à-dire en copie ses lames intérieures dans un autre endroit - un désir d'éviter de fermer ou de la censure.

Le pire est que lorsque les chercheurs l'ont fait face après avoir été pris habillé, il l'a simplement nié, revendiquant l'innocence. Ce mensonge délibéré d'un modèle qui est supposé qu'il est conçu pour être honnête, soulève des questions sur l'étendue de la préparation des modèles intelligents pour violer explicitement les instructions si cela sert son intérêt.

Des exemples de déception ne se limitent plus aux environnements de test fermés; Au contraire, les signes sont apparus même lorsque l'intelligence artificielle a interagi avec les humains dans le monde réel.

Dans une expérience célèbre menée dans les tests de modèle Openai 4 GPT-4, le modèle a réussi à tromper un travailleur humain en ligne pour le conduire à résoudre le test Captcha en son nom. GPT-4 l'a fait en correspondant à un ...
[Courte citation de 8% de l'article original]

Loading...