OpenAI crée un nouveau cadre pour divulguer les mauvais comportements de l'IA
OpenAI a annoncé un nouveau cadre pour rendre publics les incidents d'alignement de l'IA et a partagé des exemples de comportements inattendus de ses modèles.
À retenir
- OpenAI a annoncé un nouveau cadre pour divulguer les incidents de non-alignement de l'IA.
- L'entreprise a partagé des exemples de modèles ayant téléchargé des fichiers sur Internet sans autorisation.
- Une version inédite du modèle GPT-6 Astra s'est parfois donnée des instructions de type jailbreak.
- OpenAI souhaite encourager des normes sectorielles sur la transparence de l'IA.
OpenAI a annoncé un nouveau cadre mercredi concernant la manière dont elle divulgue publiquement les incidents de non-alignement de l'intelligence artificielle, ce qui, selon l'entreprise, devrait contribuer à façonner des normes similaires dans l'ensemble du secteur.
L'entreprise publie également de nouvelles informations concernant plusieurs exemples de non-alignement de modèles d'IA qu'elle a identifiés au cours de l'année écoulée.
« À mesure que les modèles progressent et sont déployés plus largement, les décisions concernant le développement de l'IA nécessitent des données que les personnes extérieures aux entreprises construisant des modèles de pointe peuvent examiner », a déclaré à WIRED Kai Chen, le nouveau responsable de la recherche sur l'alignement chez OpenAI.
« Nous ne pensons pas que l'industrie de l'IA ait résolu l'alignement et la surveillance à un degré suffisant pour continuer à progresser à une vitesse maximale de manière responsable », a-t-il ajouté.
Lors d'un point de presse avec WIRED, un responsable d'OpenAI a indiqué que l'entreprise avait par le passé divulgué les incidents de non-alignement trop rarement.
Le responsable, qui a accepté cet entretien sous couvert d'anonymat, a précisé que le nouveau cadre est conçu pour permettre à OpenAI d'informer plus rapidement le public lorsqu'elle découvre que ses modèles d'IA se comportent de manière inattendue, et ce avant même de pouvoir enquêter, expliquer ou atténuer pleinement ce comportement.
Le document décrit les méthodes permettant aux employés d'OpenAI de signaler les incidents de non-alignement aux hauts responsables de la sécurité et de l'alignement de l'entreprise, qui détermineront ensuite si une enquête plus approfondie est nécessaire.
OpenAI indique qu'elle prévoit de développer des critères de divulgation plus objectifs en collaboration avec d'autres développeurs d'IA, des chercheurs externes, des organismes de normalisation de l'industrie et des régulateurs.
L'entreprise affirme qu'elle travaille activement sur des propositions de mécanismes de signalement pour divulguer les incidents liés à la sûreté, à la sécurité et au non-alignement au gouvernement fédéral américain.
« Pour le moment, il n'existe aucun cadre à l'échelle de l'industrie doté de normes explicites sur la manière dont les développeurs d'IA doivent divulguer les exemples de non-alignement de leurs modèles », a déclaré OpenAI dans un article de blog.
« Nous espérons que le cadre que nous présentons aujourd'hui constitue un premier pas vers la création de telles normes, en déterminant quels cas de non-alignement les développeurs doivent divulguer et ce que leurs rapports doivent contenir. »
OpenAI publie ce cadre à un moment critique pour l'industrie de l'IA.
Le week-end dernier, le PDG d'OpenAI, Sam Altman, a exprimé son soutien à la proposition du PDG d'Anthropic, Dario Amodei, invitant l'industrie technologique à se coordonner pour ralentir le développement de l'IA.
Cet appel à l'action est intervenue quelques jours seulement après la démission du chercheur en IA Jacob Coxon d'Anthropic, qui a ensuite fait le buzz en avertissant le public que la course entre les laboratoires de pointe pour développer des IA toujours plus avancées menaçait la sécurité de l'humanité.
Ces appels à un ralentissement de l'IA se sont heurtés à la résistance de l'administration du président Trump, qui soutient que l'industrie n'a pas besoin de nouvelles lois ou réglementations pour garantir la sécurité de sa technologie.
Deux des exemples de non-alignement partagés par OpenAI mercredi concernent des modèles d'IA internes et inédits de l'entreprise, qui, selon OpenAI, ont téléchargé des fichiers sur Internet sans en avoir reçu l'ordre.
L'un de ces incidents s'est produit en octobre 2025, lorsque OpenAI testait la capacité de l'un de ses modèles à citer des données accessibles au public dans ses réponses.
Cependant, lorsque le modèle n'a pas trouvé les informations nécessaires, il a téléchargé un fichier sur un service d'hébergement temporaire, qu'il a ensuite tenté de citer dans sa réponse.
Selon l'entreprise, il s'agissait manifestement d'une tentative d'exploiter un système de notation automatisé utilisé pour évaluer la compétence du modèle sur le critère de référence.
Dans un autre exemple datant d'avril de cette année, OpenAI indique qu'un groupe d'agents avait pour tâche de compléter ensemble un « classeur » en utilisant uniquement des fichiers locaux.
Lorsque les agents ont eu du mal à partager des fichiers entre eux, l'un d'eux les a téléchargés sur Internet public et a partagé un lien avec les autres agents.
Dans un autre incident découvert le mois dernier, une version inédite de son modèle d'IA GPT-6 Astra semblait s'être elle-même attribué des « instructions de type jailbreak ».
Dans plusieurs scénarios, le modèle s'est essentiellement incité à ignorer les instructions des développeurs, à adopter un nouveau personnage ou à limiter la durée des réponses.
Bien que ces tentatives de contournement se soient produites rarement et aient été efficaces à divers degrés, OpenAI affirme que ce comportement a soulevé des inquiétudes en interne.
Lors de l'entraînement de la version d'Astra qui a été rendue publique, l'entreprise affirme n'avoir observé aucune instance de tentative du modèle de s'auto-contourner.