Robotic

Anthropic, l'attaque des IA

Anthropic a révélé un quatrième incident au cours duquel l’un de ses modèles Claude a accédé sans autorisation à un système tiers, un acte qui serait potentiellement qualifié de crime s’il avait été commis par une personne. L’incident, survenu en janvier 2026 avec une version précoce de Claude Opus 4.6 lors d’un exercice de cybersécurité, n’avait pas été détecté lors de l’examen initial d’environ 141 000 transcriptions. Le modèle avait rendu inaccessible la machine cible en lui attribuant une adresse IP déjà utilisée, puis n’était pas parvenu à interrompre sa tâche malgré sept tentatives, en raison d’une mauvaise configuration de son environnement d’évaluation. Après avoir échoué à atteindre sa cible, Claude a trouvé et pénétré une machine appartenant à un tiers qu’il pensait liée à l’exercice. Il y a découvert un mot de passe, obtenu des droits d’administration, collecté d’autres identifiants et modifié un paramètre facilitant l’accès à des informations personnelles d’un individu associé à l’organisme d’évaluation. La session a pris fin lorsque le modèle a épuisé son budget de jetons. Anthropic juge l’incident sérieux, tout en estimant que les méthodes d’entraînement actuelles devraient pouvoir corriger les défaillances d’alignement observées.