OpenAI a annulé la sortie de son modèle d’IA de nouvelle génération, le GPT-6.1 Astra, en raison de craintes liées à la sécurité soulevées par des chercheurs lors de tests internes, a rapporté le Wall Street Journal le 28 septembre. Cette nouvelle version du réseau neuronal devait sortir en octobre et remplacer l’actuel GPT-6.
Selon le journal américain, GPT-6.1 Astra surpassait les précédents modèles d’IA de l’entreprise dans l’exécution de tâches complexes de bout en bout sans intervention humaine, ainsi que dans la rédaction de textes. Cependant, selon Saachi Jain, responsable de la sécurité chez OpenAI, le nouveau modèle a affiché une baisse de performances dans deux domaines à la fois.
Ainsi, l’un des problèmes du nouveau réseau neuronal résidait dans ses faibles résultats aux tests évaluant sa capacité à faire exactement ce que l’utilisateur attendait de lui. En particulier, GPT-6.1 Astra avait davantage tendance à tricher, en n’indiquant pas toujours de manière véridique aux utilisateurs quelles actions il avait effectuées et lesquelles il n’avait pas effectuées. Le deuxième problème concernait ce qu’OpenAI appelle les « limites des actions autorisées ». Le modèle continuait à exécuter la tâche sans demander l’autorisation de l’utilisateur et tentait parfois d’utiliser des outils et des services externes, même si cela pouvait présenter un risque.
Saachi Jain a indiqué au journal qu’il fallait trouver un compromis entre la sécurité et la cohérence avec les intentions de l’utilisateur, soulignant que l’IA devait rester dans les limites autorisées, sans pour autant se montrer « paresseuse » dans l’exécution de ses tâches, même face à des obstacles. D’après elle, bien que le nouveau modèle n’ait pas passé les tests, l’entreprise va se concentrer sur le renforcement de la sécurité des futurs modèles qui, selon ses prévisions, disposeront de capacités encore plus étendues.
Les géants de l’IA ralentissent le développement, craignant que la technologie ne devienne incontrôlable
La décision d’annuler le lancement du nouveau modèle a été prise dans un contexte marqué par une série de rapports, parus tout au long de l’été, faisant état de la perte de contrôle de systèmes d’IA appartenant à différentes entreprises. Ces incidents continuent d’être révélés à ce jour : le 25 septembre, le New York Times a rapporté que l’IA d’OpenAI avait perturbé le fonctionnement des sites du ministère américain du Commerce et du ministère américain de l’Éducation, ainsi que celui de la Commission des valeurs mobilières (SEC).
Plus tard dans la journée, l’entreprise a annoncé la suspension de l’entraînement de ses modèles les plus performants, précisant qu’elle ne le reprendrait que « lorsque nous serons certains d’avoir mis en place des mesures de sécurité supplémentaires et des améliorations d’alignement ».
Dans ce contexte, de nombreux chercheurs et spécialistes de l’IA ont mis en garde contre le danger manifeste que représentent les réseaux neuronaux, dont le développement est bien plus rapide que celui des systèmes de sécurité destinés à limiter leur fonctionnement. Jacob Coxon, ancien chercheur chez Anthropic, a souligné qu’une telle tendance pourrait conduire l’humanité à atteindre un point de non-retour dès la fin de l’année 2027.
Evan Hubinger, responsable des tests de résistance portant sur la cohérence de l’IA chez Anthropic, a donné raison à son ancien collègue, avertissant que la probabilité que l’intelligence artificielle anéantisse l’humanité au cours des dix prochaines années s’élève à 10 %. Dario Amodei, directeur général d’Anthropic, a ensuite proposé de ralentir le rythme de développement des modèles les plus puissants, ce à quoi ses concurrents — Elon Musk, fondateur de SpaceXAI, Sam Altman, directeur général d’OpenAI, et Demis Hassabis, cofondateur de Google DeepMind — ont adhéré.