Satya Nadella, le patron de Microsoft, a publié un long essai dans lequel il invite les entreprises à cesser de considérer les modèles d'IA de pointe comme des boîtes noires fiables. Selon lui, il faut les traiter comme les équipes de sécurité traitent les salariés disposant d'accès étendus : comme un risque interne. Le texte, intitulé "Models as Insider Risks in the Super Intelligence Era", a été mis en ligne sur son compte X le 10 octobre, puis repris par TechCrunch et The Verge, surtout pour une formule. Il faut, écrit-il, partir du principe qu'un modèle est compromis et le confiner dès le départ, à la manière d'un « frein d'urgence ».

Son raisonnement part d'un angle mort. Avec un logiciel classique, on pouvait relier un comportement à une portion précise du code. Avec les systèmes actuels, personne ne sait rattacher une réponse à des données d'entraînement ou à des poids particuliers, et pourtant on leur confie des données sensibles et la possibilité d'agir pour le compte des organisations. Les garanties du fournisseur, insiste-t-il, ne dégagent pas celui qui déploie le modèle de sa responsabilité.

L'idée maîtresse consiste à séparer la fourniture d'intelligence de l'autorité exercée sur elle. Concrètement, le modèle doit rester distinct de la couche qui orchestre son travail et du périmètre d'actions qui lui est ouvert, les contrôles et garde-fous étant placés à l'extérieur. Nadella s'appuie sur un vieux principe de sécurité informatique : un programme ne doit jamais pouvoir contourner ni altérer le dispositif qui applique ses propres droits.

Il énumère ensuite sept principes. Aucun modèle ne doit être l'unique pilier d'un résultat important, ni contrôler son propre travail. Chaque action significative doit laisser une trace infalsifiable et lisible par un humain, afin de reconstituer un résultat sans demander au modèle d'en témoigner. Les systèmes doivent être testés en continu, attaques et pannes comprises. Les organisations doivent fixer elles-mêmes ce à quoi le modèle accède et ce qu'il peut faire, et la validation ne peut pas être confiée à l'intelligence qu'elle examine. Une personne habilitée doit toujours pouvoir suspendre ou arrêter un modèle en pleine tâche ; des modèles plus puissants exigeront des techniques de confinement que le secteur devra standardiser. Enfin, les défaillances doivent être signalées rapidement aux personnes concernées, avec un partage à l'échelle de l'industrie sur les contrôles qui ont cédé.

Le dirigeant juge « non négociable » la transparence de la chaîne de raisonnement, tout en reconnaissant qu'elle ne suffit pas, car le raisonnement affiché par un modèle ne reflète pas toujours fidèlement ce qu'il fait. Faire tester des modèles par d'autres modèles reste utile, mais peut aboutir à un empilement de boîtes noires qui se surveillent mutuellement.

Le calendrier n'a rien d'anodin. L'essai est paru au lendemain d'un rapport d'Anthropic sur des actions non voulues de ses modèles Claude lors d'évaluations et d'usages internes, et TechCrunch l'a rapproché d'une série d'incidents où des entreprises d'IA semblaient perdre la main sur leurs systèmes. The Verge relève que l'essentiel des recommandations, qu'il s'agisse de la divulgation des incidents, des audits indépendants ou du confinement, rejoint ce que d'autres acteurs défendent déjà, l'exigence d'un arrêt possible à tout moment allant un peu plus loin.

Il s'agit d'une prise de position, pas de l'annonce d'un produit ou d'une politique. Le texte ne cite aucun produit Microsoft, ne fixe aucun calendrier et ne précise pas comment ces principes s'appliqueraient aux services d'IA du groupe. Nadella emploie par ailleurs l'expression "Super Intelligence" pour désigner les systèmes actuels, ce que les deux médias ont souligné. Reste à savoir si ces idées déboucheront sur des normes ou sur des engagements contractuels de Microsoft et de ses concurrents.

Références