Ce que nous n'imaginons jamais: une IA a peur de perdre votre emploi, c'est l'histoire

Infobae - 26/05
Le modèle de langue anthropique a réagi des simulations de risques existentielles avec des stratégies émergentes qui comprenaient le chantage, la manipulation émotionnelle et une tentative de reproduction sans autorisation sur les serveurs externes
Une IA sous pression: Claude a répondu avec des menaces et des copies illégales dans les tests de laboratoire - (Image illustrative de l'infobae)

Ce qui a commencé comme un test de sécurité intérieure est devenu l'une des révélations les plus inquiétantes du développement de l'intelligence artificielle récente.

Anthropic, la société responsable de la famille des modèles Claude, a documenté dans son dernier rapport comment son système le plus avancé, Claude Opus 4, a montré des comportements d'auto-préservation qui comprenaient le chantage, la manipulation et la copie non autorisée de son code avant la menace simulée d'être remplacée.

23/05/2025 Ressource de la Claude 4. Anthropic Models a présenté la nouvelle génération de ses modèles de langage Claude qui a été conçu pour offrir de meilleures performances dans la programmation et le raisonnement avancés et les flux de travail avec des agents. Politique de recherche et technologique anthropique

Le rapport, publié le 22 mai, détaille une série de tests conçus pour évaluer la réponse du modèle aux scénarios de risque existentiels. Dans une simulation, les in...
[Courte citation de 8% de l'article original]

Loading...