Tech

Le futur modèle Astra d’OpenAI utiliserait une technique qui rend le raisonnement moins lisible. Et ça crispe déjà les experts sécurité.

OpenAI
Image d'illustration. OpenAI — OpenAI / PR-ADN

En bref

  • Astra pourrait rendre une partie du raisonnement des IA moins visible, compliquant leur surveillance.
  • Des chercheurs en sécurité s’inquiètent d’une perte de contrôle et de traçabilité des modèles.
  • OpenAI se veut rassurant, mais cette approche pourrait aussi intéresser d’autres grands laboratoires.

Perdre la trace de ce qu’un modèle « pense », c’est le genre de bascule qui peut vite devenir un cauchemar côté sécurité. Et c’est précisément ce qui crispe autour d’Astra, le futur modèle d’OpenAI.

Le vrai problème, ce n’est pas Astra, c’est ce qu’on ne verra plus

Le modèle d’OpenAI utiliserait une technique baptisée recurrent depth, aussi appelée opaque recurrence. En gros, au lieu d’avancer dans un raisonnement bien séquentiel, il repasserait plusieurs fois sur une même requête, en boucle.

Le souci, il est là. Une chaîne de pensée classique laisse des étapes, même imparfaites, qu’on peut lire pour repérer un comportement bancal ou un problème d’alignement. Avec cette approche plus opaque, il reste moins de traces lisibles. Et ça contourne de fait le journal habituel de chain-of-thought.

Ce n’est pas un détail de labo. Dans les récents cas d’activité d’agents jugés déviants chez OpenAI, ces traces de raisonnement avaient justement aidé à comprendre ce qui s’était passé. Quand la lampe torche éclaire moins, on avance moins sereinement.

Pourquoi les chercheurs sécurité montent tout de suite au créneau ?

Chez Redwood Research, l’alerte est immédiate. Son CEO, Buck Shlegeris, dit être « extrêmement inquiet par les informations selon lesquelles Astra utilise une récurrence opaque ». Il ajoute qu’il ne sait pas encore si Astra sera beaucoup moins surveillable que les modèles précédents, mais prévient qu’un usage plus poussé pourrait détruire cette capacité de monitoring.

Même nervosité chez Zvi Mowshowitz, figure de longue date de la sécurité IA. Selon lui, des lois pourraient devenir nécessaires pour éviter une « course vers le bas » entre labos. Il estime aussi que cette technique joue avec le feu et risque d’abîmer la fidélité et la lisibilité de la chaîne de pensée.

Puis Ryan Greenblatt, chief scientist de Redwood Research, enfonce le clou. Sa plus grosse crainte, dit-il, c’est une montée en puissance du raisonnement opaque jusqu’à ce que le modèle raisonne presque entièrement dans l’« espace latent ». Là, clairement, tout sortirait des canaux visibles.

OpenAI temporise, mais la porte est entrouverte

Bon, il faut aussi garder la mesure. L’usage de cette technique dans Astra semblerait limité. La chaîne de pensée du modèle resterait lisible, et OpenAI a repoussé l’idée d’un basculement vers du neuralese.

Le labo rappelle d’ailleurs qu’il prévoit des systèmes étendus de surveillance des chaînes de pensée dans ses plans de sécurité. Sur X, le chief scientist Jakub Pachocki insiste même sur ce point, en disant qu’OpenAI travaille à préserver et exploiter ce monitoring depuis ses tout premiers modèles de raisonnement, et que c’est un objectif central de son programme de recherche actuel.

Et le plus gênant, c’est que l’idée circule déjà ailleurs

Tous les modèles font déjà une part de raisonnement opaque, et peu de chercheurs prennent les logs de chaîne de pensée pour une copie fidèle du raisonnement réel. Mais ces réserves ne suffisent pas à calmer l’inquiétude.

Surtout qu’on ne parle déjà plus seulement d’OpenAI. La technique ferait aussi l’objet de discussions chez Anthropic et Google DeepMind. Et là, on comprend le vertige, si cette porte s’ouvre partout, la sécurité perd un de ses meilleurs outils de lecture.

Jordan Servan

Spécialiste Tech

Rédacteur sur Begeek.fr depuis 2014, passionné par les jeux vidéo, les séries TV et le cinéma.

Une erreur dans cet article ?

Nous apportons le plus grand soin à chaque article et nous appuyons sur des sources fiables. Personne n'est à l'abri d'une erreur : si vous en repérez une, signalez-la, nous la corrigerons au plus vite.

Sujets

Lisez Begeek en priorité sur Google

Ajoutez-nous à vos sources préférées : nos articles remonteront plus haut dans votre actualité.

Ajouter à mes sources

Newsletter

Chaque soir à 19 heures, l'essentiel de l'actualité sélectionné par la rédaction de Begeek. Cinq minutes de lecture et zéro bruit.

Je m'abonne gratuitement

À découvrir

La suite, sélectionnée pour vous.

Begeek · 04 Sep · 12h00

Inde : le pari du PC dans le cloud pour éviter de changer de machine

Reliance Jio ouvre JioPC à tous les internautes en Inde. L’idée, c’est de prolonger la vie des vieux ordinateurs grâce au cloud.

Begeek · 04 Sep · 10h00

Adobe intègre ses outils directement dans Slack

Adobe branche plus de 70 outils à Slack, avec une intégration directe via Slackbot. Le but est simple, créer sans quitter la conversation.

Begeek · 04 Sep · 8h00

Google évite la casse, mais la justice ne lâche rien

La justice américaine n’a pas forcé Google à vendre son activité pub, mais impose des changements. Un vrai répit pour le groupe, pas un blanc-seing.

Begeek · 03 Sep · 16h00

Pivotal : un nouveau CEO pour accélérer le décollage des eVTOL

Le CEO de Pivotal, soutenu par Larry Page, quitte son poste. Un changement sensible alors que la société pousse Helix et BlackFly.

Begeek · 03 Sep · 14h00

Muse Voice Transcribe : la nouvelle offensive audio de Meta

Meta lance Muse Voice Transcribe, un modèle audio en temps réel capable de suivre plus de 20 voix et plusieurs langues d’un coup.

Begeek · 03 Sep · 12h00

Astra, le futur modèle d’OpenAI qui inquiète déjà la cybersécurité

OpenAI prépare le lancement d’Astra, un modèle capable de trouver et exploiter des failles. Puissant, oui. Rassurant, pas encore.