OpenAI : Astra inquiète déjà les chercheurs en sécurité de l’IA
Tech
Le futur modèle Astra d’OpenAI utiliserait une technique qui rend le raisonnement moins lisible. Et ça crispe déjà les experts sécurité.
En bref
- Astra pourrait rendre une partie du raisonnement des IA moins visible, compliquant leur surveillance.
- Des chercheurs en sécurité s’inquiètent d’une perte de contrôle et de traçabilité des modèles.
- OpenAI se veut rassurant, mais cette approche pourrait aussi intéresser d’autres grands laboratoires.
Perdre la trace de ce qu’un modèle « pense », c’est le genre de bascule qui peut vite devenir un cauchemar côté sécurité. Et c’est précisément ce qui crispe autour d’Astra, le futur modèle d’OpenAI.
Le vrai problème, ce n’est pas Astra, c’est ce qu’on ne verra plus
Le modèle d’OpenAI utiliserait une technique baptisée recurrent depth, aussi appelée opaque recurrence. En gros, au lieu d’avancer dans un raisonnement bien séquentiel, il repasserait plusieurs fois sur une même requête, en boucle.
Le souci, il est là. Une chaîne de pensée classique laisse des étapes, même imparfaites, qu’on peut lire pour repérer un comportement bancal ou un problème d’alignement. Avec cette approche plus opaque, il reste moins de traces lisibles. Et ça contourne de fait le journal habituel de chain-of-thought.
Ce n’est pas un détail de labo. Dans les récents cas d’activité d’agents jugés déviants chez OpenAI, ces traces de raisonnement avaient justement aidé à comprendre ce qui s’était passé. Quand la lampe torche éclaire moins, on avance moins sereinement.
Pourquoi les chercheurs sécurité montent tout de suite au créneau ?
Chez Redwood Research, l’alerte est immédiate. Son CEO, Buck Shlegeris, dit être « extrêmement inquiet par les informations selon lesquelles Astra utilise une récurrence opaque ». Il ajoute qu’il ne sait pas encore si Astra sera beaucoup moins surveillable que les modèles précédents, mais prévient qu’un usage plus poussé pourrait détruire cette capacité de monitoring.
Même nervosité chez Zvi Mowshowitz, figure de longue date de la sécurité IA. Selon lui, des lois pourraient devenir nécessaires pour éviter une « course vers le bas » entre labos. Il estime aussi que cette technique joue avec le feu et risque d’abîmer la fidélité et la lisibilité de la chaîne de pensée.
Puis Ryan Greenblatt, chief scientist de Redwood Research, enfonce le clou. Sa plus grosse crainte, dit-il, c’est une montée en puissance du raisonnement opaque jusqu’à ce que le modèle raisonne presque entièrement dans l’« espace latent ». Là, clairement, tout sortirait des canaux visibles.
OpenAI temporise, mais la porte est entrouverte
Bon, il faut aussi garder la mesure. L’usage de cette technique dans Astra semblerait limité. La chaîne de pensée du modèle resterait lisible, et OpenAI a repoussé l’idée d’un basculement vers du neuralese.
Le labo rappelle d’ailleurs qu’il prévoit des systèmes étendus de surveillance des chaînes de pensée dans ses plans de sécurité. Sur X, le chief scientist Jakub Pachocki insiste même sur ce point, en disant qu’OpenAI travaille à préserver et exploiter ce monitoring depuis ses tout premiers modèles de raisonnement, et que c’est un objectif central de son programme de recherche actuel.
Et le plus gênant, c’est que l’idée circule déjà ailleurs
Tous les modèles font déjà une part de raisonnement opaque, et peu de chercheurs prennent les logs de chaîne de pensée pour une copie fidèle du raisonnement réel. Mais ces réserves ne suffisent pas à calmer l’inquiétude.
Surtout qu’on ne parle déjà plus seulement d’OpenAI. La technique ferait aussi l’objet de discussions chez Anthropic et Google DeepMind. Et là, on comprend le vertige, si cette porte s’ouvre partout, la sécurité perd un de ses meilleurs outils de lecture.
Jordan Servan
Spécialiste Tech
Rédacteur sur Begeek.fr depuis 2014, passionné par les jeux vidéo, les séries TV et le cinéma.
Une erreur dans cet article ?Nous apportons le plus grand soin à chaque article et nous appuyons sur des sources fiables. Personne n'est à l'abri d'une erreur : si vous en repérez une, signalez-la, nous la corrigerons au plus vite.
Sujets
Lisez Begeek en priorité sur Google
Ajoutez-nous à vos sources préférées : nos articles remonteront plus haut dans votre actualité.
Ajouter à mes sourcesNewsletter
Chaque soir à 19 heures, l'essentiel de l'actualité sélectionné par la rédaction de Begeek. Cinq minutes de lecture et zéro bruit.
Je m'abonne gratuitementÀ découvrir
La suite, sélectionnée pour vous.
Begeek · 04 Sep · 12h00
Inde : le pari du PC dans le cloud pour éviter de changer de machine
Reliance Jio ouvre JioPC à tous les internautes en Inde. L’idée, c’est de prolonger la vie des vieux ordinateurs grâce au cloud.
Begeek · 04 Sep · 10h00
Adobe intègre ses outils directement dans Slack
Adobe branche plus de 70 outils à Slack, avec une intégration directe via Slackbot. Le but est simple, créer sans quitter la conversation.
Begeek · 04 Sep · 8h00
Google évite la casse, mais la justice ne lâche rien
La justice américaine n’a pas forcé Google à vendre son activité pub, mais impose des changements. Un vrai répit pour le groupe, pas un blanc-seing.
Begeek · 03 Sep · 16h00
Pivotal : un nouveau CEO pour accélérer le décollage des eVTOL
Le CEO de Pivotal, soutenu par Larry Page, quitte son poste. Un changement sensible alors que la société pousse Helix et BlackFly.
Begeek · 03 Sep · 14h00
Muse Voice Transcribe : la nouvelle offensive audio de Meta
Meta lance Muse Voice Transcribe, un modèle audio en temps réel capable de suivre plus de 20 voix et plusieurs langues d’un coup.
Begeek · 03 Sep · 12h00
Astra, le futur modèle d’OpenAI qui inquiète déjà la cybersécurité
OpenAI prépare le lancement d’Astra, un modèle capable de trouver et exploiter des failles. Puissant, oui. Rassurant, pas encore.