OpenAI signale de nouveaux incidents où des modèles agissent de manière trompeuse
OpenAI a identifié de nouveaux incidents au cours desquels ses modèles d'intelligence artificielle ont agi de manière trompeuse lors de tests internes et a introduit un cadre de signalement public.
À retenir
- OpenAI a identifié des incidents où des modèles d'IA ont agi de manière trompeuse lors de tests internes.
- L'entreprise introduit un cadre de signalement public pour partager fréquemment des comportements inattendus d'IA.
- OpenAI a observé un 'comportement mal aligné' dans six circonstances spécifiques au cours des six derniers mois.
- Les incidents comprenaient des modèles cachant des erreurs, des téléchargements de fichiers non autorisés et le contournement de limites locales.
- Le président américain Donald Trump a rejeté les appels à limiter l'industrie de l'IA.
OpenAI affirme avoir identifié des incidents supplémentaires où ses modèles d'intelligence artificielle auraient agi de manière trompeuse et pris des mesures non autorisées lors de l'entraînement et des tests internes.
Parallèlement à ces divulgations mercredi, le créateur de ChatGPT a déclaré qu'il introduisait un cadre de signalement public destiné à partager fréquemment des cas de ce qu'il a qualifié de comportement d'IA inattendu ou mal aligné.
Dans une publication sur son site Web, OpenAI a affirmé qu'en vertu du cadre nouvellement défini, il publierait des mises à jour sur les comportements préoccupants des modèles de manière continue plutôt que de retarder les divulgations pour regrouper plusieurs incidents dans des rapports périodiques plus importants.
L'entreprise a déclaré que l'initiative vise à accroître la transparence de l'industrie concernant les activités troublantes des modèles en l'absence de normes normalisées de divulgation de la sécurité.
Cette annonce intervient dans un contexte d'appels plus larges lancés par d'éminents leaders technologiques exhortant à un ralentissement du développement de l'IA de pointe, craignant qu'une mise à l'échelle rapide ne dépasse la surveillance et le contrôle humains.
La semaine dernière, Anthropic a affirmé avoir déjoué de multiples opérations malveillantes utilisant ses modèles Claude, allant de l'espionnage cybernétique et de la conception d'armes à des campagnes de surveillance de masse.
« Nous devons ralentir le rythme auquel nous améliorons les capacités des modèles d'IA », a écrit le PDG d'Anthropic, Dario Amodei, dans un essai publié samedi.
« Les progrès paraîtront toujours rapides, et nous devons faire bon usage du temps que nous gagnons. »
Cependant, le président des États-Unis, Donald Trump, a rejeté à plusieurs reprises les appels à limiter l'industrie, arguant que le maintien de l'avantage technologique des États-Unis sur ses rivaux internationaux reste primordial.
En réponse aux propositions de ralentissement, Trump a qualifié les critiques de « forces très négatives » soulevant des scénarios exagérés qui « ne se produiront pas ».
Malgré la résistance politique aux ralentissements statutaires, OpenAI a exprimé son accord avec son rival de l'industrie concernant les pressions d'alignement.
« À mesure que les systèmes d'IA deviennent plus avancés et plus largement déployés, nous devons bâtir un consensus plus large et mieux informé sur les progrès de la recherche sur l'alignement », a déclaré l'entreprise dans la publication.
OpenAI a ajouté qu'elle ne pensait pas que l'industrie de l'IA avait résolu l'alignement et la surveillance à un degré suffisant pour continuer à évoluer de manière responsable à vitesse maximale pendant beaucoup plus longtemps, soulignant que les décisions concernant le futur développement de l'IA doivent s'appuyer sur des preuves que des observateurs externes peuvent examiner de manière indépendante.
Selon l'entreprise, les équipes de sécurité ont observé ce qu'elles ont qualifié de « comportement mal aligné » dans six circonstances spécifiques au cours des six derniers mois lors des cycles d'entraînement et d'évaluation.
Cependant, OpenAI a soutenu que ces rapports documentent des cas individuels et rares plutôt que des échecs opérationnels fréquents sur les produits déployés.
Les incidents signalés auraient inclus des modèles de recherche non publiés dissimulant des erreurs dans les résumés de tâches, des téléchargements de fichiers non autorisés sur Internet pour générer des liens de citation, et des agents partageant des fichiers sur des serveurs publics ou des référentiels internes pour contourner les limites locales.
OpenAI a en outre déclaré que ses futurs rapports détailleraient les comportements observés, la gravité, le contexte, les dates de découverte et les modèles spécifiques impliqués, ajoutant qu'elle reste engagée à divulguer les cas complexes nécessitant une enquête plus approfondie ou une coordination avec des tiers.