Chaque ensemble de garde-fous de l'IA peut être brisé par la bonne invite - Help Net Security

Mirko Zorz - HelpNetSecurity - 10/06
Une nouvelle preuve du NIST ancrée dans la logique de Gödel montre que les garde-fous de l'IA ne peuvent jamais bloquer toutes les attaques, ce qui pointe vers une surveillance continue.

Les entreprises qui construisent des systèmes d’IA les enveloppent dans des garde-fous destinés à bloquer les productions nuisibles, notamment les deepfakes, les logiciels malveillants et les instructions permettant de fabriquer des armes biologiques ou des drogues illicites. Lorsqu'un utilisateur demande au système un tel contenu, les garde-fous sont conçus pour signaler la demande et la refuser. Une nouvelle preuve mathématique fixe une limite à la sécurité de ces garde-corps.

Apostol Vassilev, scientifique principal à l'Institut national des normes et technologies, a publié la preuve dans la revue à comité de lecture IEEE Security & Privacy. Cela démontre que pour tout ensemble fini de garde-fous, il existe une invite qui amène l’IA à les ignore...
[Courte citation de 8% de l'article original]

Loading...