OpenAI propose de mieux formaliser les décisions de sécurité avant de poursuivre l’entraînement des IA de pointe. Son billet du 28 septembre 2026 présente un cadre en construction : il ne certifie pas que les risques seraient éliminés.
Des preuves avant de continuer
Ces « dossiers de sécurité » concernent notamment l’entraînement par apprentissage par renforcement. Ils doivent rendre explicites les arguments, les preuves disponibles, les incertitudes et les risques résiduels. Trois volets techniques structurent la proposition : alignement, confinement et surveillance.
OpenAI recommande aussi un examen distinct par une autre équipe et une remontée des désaccords aux responsables. Ce mécanisme vise à éclairer la décision de poursuivre l’entraînement, sans permettre d’affirmer qu’il est déjà entièrement appliqué à tous les modèles.
Une évaluation extérieure ne suffit pas à tout prouver
Une publication officielle du 22 septembre précise le rôle des évaluations tierces : indépendance, accès nécessaire aux évaluateurs et transparence des méthodes. Ces évaluations ne remplacent pas toutes les autres garanties.
Pour les équipes qui utilisent l’IA, la distinction est importante : annoncer une démarche de sécurité n’équivaut pas à produire une preuve définitive. Il ne s’agit ni d’une nouvelle fonction de ChatGPT, ni d’une certification universelle, ni d’une obligation légale nouvelle pour les utilisateurs.