Il faut "temporiser" l'amélioration de l'IA "pour que la prévention des risques soit en mesure de suivre le rythme", a écrit le PDG d'Anthropic dans un message publié sur son site personnel.
L’homme d’affaires, Elon Musk, et le PDG d’OpenAI, Sam Altman, se sont rapidement ralliés à cet appel. "Dario a raison", a réagi Elon Musk sur X. "Je suis d'accord avec Dario. C'est un des principaux sujets de discussions chez OpenAI ces dernières semaines", a aussi écrit le patron d'OpenAI Sam Altman, également sur X.
Cet appel intervient après un incident récent lors duquel des modèles d'OpenAI étaient sortis spontanément de leur milieu confiné lors de tests pour rejoindre internet et attaquer la plateforme d'IA Hugging Face.
Depuis, plusieurs autres événements ayant vu des IA d'OpenAI et Anthropic se rendre sur internet à l'insu de leurs superviseurs ont été rapportés par les deux entreprises.
A chaque fois, ils impliquaient des agents IA, c'est-à-dire un programme spécifique bâti sur un modèle et doté de ses propres connaissances et de ses propres objectifs.
Les agissements et les méthodes de ces agents ont d'autant plus inquiété qu'ils ont montré une propension à se coordonner, à établir une hiérarchie entre eux, à tricher et à effacer les traces de leurs méfaits.
Vu l'accélération actuelle du développement de l'IA, "je redoute que d'ici 6 à 12 mois, un groupe (d'agents) soit capable de prendre le contrôle de l'intégralité d'internet", prévient Dario Amodei, ce qui "pourrait entraîner des centaines de milliards de dollars de dégâts".
Début août, le gouvernement américain a mis en place un cadre de supervision, qui prévoit l'examen, sur la base du volontariat, de nouveaux modèles d'IA avant leur sortie. Mais ce dispositif reste opaque.
Après avoir identifié les dérapages de leurs modèles, OpenAI et Anthropic ont chacun suspendu ou freiné le travail sur leurs nouvelles IA durant quelques jours, avant de le reprendre au même rythme.
Dans sa communication, Dario Amodei s'inquiète de l'arrivée de l'amélioration récursive autonome (RSI), un processus qui voit l'IA s'améliorer elle-même sans intervention humaine.
