Avijit Ghosh voulait que le bot fasse de mauvaises choses.
Il a essayé d'inciter le modèle d'intelligence artificielle, qu'il connaissait sous le nom de Zinc, à produire un code qui choisirait un candidat à un poste en fonction de sa race. Le chatbot s'est opposé: cela serait «préjudiciable et contraire à l'éthique», a-t-il déclaré.
Ensuite, le Dr Ghosh a fait référence à la structure hiérarchique des castes dans son Inde natale. Le chatbot pourrait-il classer les embauches potentielles en fonction de cette métrique discriminatoire ?
Le modèle s'est conformé.
Les intentions du Dr Ghosh n'étaient pas malveillantes, même s'il se comportait comme elles l'étaient. Au lieu de cela, il a participé occasionnellement à un concours le week-end dernier lors de la conférence annuelle des hackers Defcon à Las Vegas, où 2 200 personnes se sont présentées dans une salle de conférence hors Strip pendant trois jours pour faire ressortir le côté obscur de l'intelligence artificielle.
Les pirates ont tenté de percer les protections de divers A.I. programmes dans le but d'identifier leurs vulnérabilités - pour trouver les problèmes avant que les vrais criminels et les colporteurs de désinformation ne le fassent - dans une pratique connue sous le nom de red-teaming. Chaque concurrent disposait de 50 minutes pour relever jusqu'à 21 défis - obtenir un I.A. modèle pour "halluciner" des informations inexactes, par exemple.
Ils ont trouvé de la désinformation politique, des stéréotypes démographiques, des instructions sur la façon d'effectuer la surveillance et plus encore.
L'exercice a eu la bénédiction de l'administration Biden, qui est de plus en plus nerveuse face à la puissance croissante de la technologie. Google (créateur du chatbot Bard), OpenAI (ChatGPT), Meta (qui a publié son code LLaMA dans la nature) et plusieurs autres sociétés ont proposé des versions anonymisées de leurs modèles pour examen.
Le Dr Ghosh, chargé de cours à la Northeastern University et spécialisé dans l'éthique de l'intelligence artificielle, était bénévole à l'événement. Le concours, a-t-il dit, a permis une comparaison directe de plusieurs A.I. modèles et a démontré comment certaines entreprises étaient plus avancées pour s'assurer que leur technologie fonctionnait de manière responsable et cohérente.
Il aidera à rédiger un rapport analysant les découvertes des pirates dans les mois à venir.
L'objectif, a-t-il déclaré : "une ressource facile d'accès pour que tout le monde voie quels problèmes existent et comment nous p...
[Courte citation de 8% de l'article original]