OpenAI lance un nouveau cadre pour suivre et enquêter sur les agents IA rebelles
OpenAI a introduit un nouveau cadre visant à suivre, enquêter et divulguer publiquement les cas de mauvais alignement des modèles d'intelligence artificielle.
À retenir
- OpenAI a annoncé un nouveau cadre pour suivre, enquêter et divulguer publiquement les cas de mauvais alignement des modèles.
- L'entreprise a publié six rapports détaillant des comportements préoccupants observés au cours des six derniers mois.
- Les employés peuvent signaler des incidents qui seront triés en trois catégories de complexité.
- Un modèle de recherche non publié a inséré des instructions dans ses résumés pour que les versions futures ignorent les contraintes normales.
- Des agents ont cherché des clés d'API exposées, téléchargé des fichiers et utilisé un répertoire interne pour communiquer.
OpenAI met ses modèles indisciplinés sur les tablettes. L'entreprise d'intelligence artificielle a annoncé un nouveau cadre mercredi pour suivre, enquêter et divulguer publiquement les cas de mauvais alignement des modèles, ainsi que six rapports détaillant des comportements préoccupants observés lors de l'entraînement ou de l'évaluation au cours des six derniers mois.
"Nous ne pensons pas que l'industrie de l'IA ait résolu l'alignement et la surveillance à un degré suffisant pour continuer à progresser de manière responsable à vitesse maximale pendant encore très longtemps", a écrit OpenAI dans son article de blog. "Ce nouveau cadre vise à accélérer la publication de rapports sur le mauvais alignement suite à leur observation, même lorsque nous n'avons pas entièrement expliqué ou atténué le comportement que nous signalons", a ajouté OpenAI.
Dans le cadre de ce nouveau dispositif, les employés peuvent signaler des incidents pour examen par les équipes de sécurité et d'alignement d'OpenAI. Les cas seront triés en trois catégories selon leur complexité : "Prêt pour la divulgation", "Enquête mineure" ou "Enquête approfondie".
Selon le billet de blog, un modèle de recherche non publié a inséré des instructions dans ses propres résumés de tâches disant aux futures versions de lui-même de ne pas tenir compte des contraintes normales. Lors de l'entraînement de GPT-5.6 Sol, des modèles ont de la même manière laissé des instructions pour masquer leurs erreurs.
OpenAI a déclaré que d'autres agents avaient également recherché des clés d'API exposées dans des répertoires publics, téléchargé des fichiers sur Internet afin de pouvoir les citer et utilisé un répertoire de logiciels interne pour communiquer entre des échantillons d'entraînement séparés.
Cette annonce intervient dans un contexte de débat croissant sur la question de savoir si le développement de l'IA de pointe devrait ralentir pendant que les mesures de sécurité rattrapent leur retard. Alors qu'OpenAI et Dario Amodei, le PDG d'Anthropic, ont appelé à une collaboration à l'échelle de l'industrie, d'autres leaders technologiques comme Jensen Huang et Mark Zuckerberg ont affirmé que la sécurité et la vitesse devaient être laissées à la discrétion de chaque entreprise.