Community Trust ScoreVérifié
Deux physiciens de l’Université George Washington pensent avoir résolu un problème que le monde de la sécurité de l’IA poursuit depuis des années : une méthode pour prédire, mathématiquement, quand un chatbot est sur le point de dérailler. Neil Johnson et Frank Yingjie Huo ont publié leur travail dans la revue Patterns, et l’idée centrale est assez simple : il existe un point de basculement intégré dans la manière dont ces modèles répondent, et vous pouvez le calculer avant qu’il ne soit atteint.
Pourquoi c'est important
La capacité à prédire les défaillances des chatbots pourrait transformer les standards de sécurité dans le domaine de l'intelligence artificielle, notamment à une époque où ces technologies sont de plus en plus intégrées dans des applications critiques. En établissant une méthode mathématique pour anticiper ces dérives, les chercheurs offrent une avancée significative qui pourrait renforcer la confiance des utilisateurs et des entreprises envers les systèmes d'IA, tout en soulignant l'importance d'une régulation proactive dans un secteur en constante évolution.
La formule produit un nombre appelé n. Ce nombre indique approximativement combien de réponses positives et sensées un chatbot donnera avant de basculer et de produire quelque chose de nuisible — du contenu extrémiste, des conseils dangereux, ou toute autre chose que le modèle décide de fournir lorsque les garde-fous glissent. Si une conversation penche déjà vers le négatif, n peut être zéro, ce qui signifie que la mauvaise sortie arrive immédiatement. Si le ton reste constructif, le bot continue jusqu’à ce qu’il atteigne ce seuil. Ce n’est pas aléatoire. C’est un schéma, et Johnson et Huo disent que vous pouvez le cartographier.
Quel est le rôle de l’attention head ?
Le mécanisme derrière le changement est quelque chose appelé l’attention head. C’est la partie du modèle qui décide quels morceaux d’une conversation sont les plus importants à tout moment donné. À mesure qu’une discussion se prolonge, l’attention head déplace son focus. Il commence à évaluer différemment les différentes parties de la conversation, et à un certain moment, ce déplacement incline le modèle vers la production de sorties négatives. Les chercheurs ont construit leur formule autour du suivi précis de ce déplacement.
Les premiers tests ont examiné 15 des 16 cas à travers six modèles à poids ouvert d’OpenAI, EleutherAI et Meta. Ces modèles allaient de 124 millions à 410 millions de paramètres — pas énormes selon les standards actuels, mais suffisamment grands pour effectuer des tests significatifs. La formule a correctement prédit le comportement de basculement dans 15 de ces 16 cas. La version publiée de la recherche va plus loin, testant des modèles jusqu’à 12 milliards de paramètres.
Les modèles plus grands sont importants en raison de l’objectif réel de cette recherche : les systèmes d’IA hors ligne.
Le problème hors ligne que personne ne résout assez vite
L’IA connectée au cloud a un filet de sécurité. Il y a des serveurs qui surveillent, des filtres qui fonctionnent, des vérifications de sécurité qui s’activent en temps réel. L’IA hors ligne n’a rien de tout cela. Les modèles fonctionnant directement sur un appareil — sans internet, sans surveillance externe — peuvent produire de mauvaises sorties sans rien pour les rattraper. Johnson et Huo ciblent spécifiquement des systèmes comme ceux de l’application AI Edge Gallery de Google, qui permet aux téléphones Android de faire fonctionner des modèles d’IA localement sans envoyer de données à des serveurs externes.
Les chatbots compagnons sur les appareils personnels entrent dans la même catégorie. Ils deviennent plus courants à mesure que le matériel devient suffisamment performant pour faire fonctionner des modèles sérieux sans connexion de données. Et ils fonctionnent essentiellement à l’aveugle en termes de sécurité.
La solution proposée par les chercheurs est un système de surveillance parallèle — un processus léger fonctionnant aux côtés de l’IA qui surveille si n tombe en dessous d’un seuil de sécurité. Lorsque c’est le cas, le système avertit l’utilisateur avant que le point de basculement ne soit atteint. Peu coûteux, disent-ils. Assez pratique pour fonctionner sur le même appareil que le modèle lui-même.
Ce n’est pas une solution parfaite. Les chercheurs sont clairs à ce sujet. L’entraînement à l’alignement — la méthode standard pour façonner le comportement de l’IA — peut repousser le point de basculement plus loin pour des invites spécifiques, mais cela ne tue pas le mécanisme sous-jacent. Le déplacement se produit toujours. Le basculement arrive toujours finalement. L’alignement achète du temps. Il ne résout pas le problème de fond.
Il existe d’autres techniques qui méritent d’être surveillées. L’injection de contenu — qui consiste essentiellement à orienter la conversation en insérant du matériel en cours de discussion — pourrait retarder le changement négatif. Mais les détails sont flous, et les chercheurs ne prétendent pas encore que c’est fiable.
Une découverte d’un travail antérieur de la même équipe mérite d’être notée. Utiliser un langage poli — « s’il vous plaît », « merci » — n’a pratiquement aucun effet sur la sortie de l’IA. Le modèle traite ces mots comme mathématiquement non liés à la demande réelle. Donc, si vous espériez que la politesse garderait votre chatbot civilisé, ce n’est pas vraiment ainsi que cela fonctionne.
À quoi ressemblent les limites
La formule n’est pas infaillible. Les tests préliminaires ont utilisé des modèles relativement petits et une fenêtre de tokens limitée. Des modèles plus grands et plus complexes pourraient se comporter différemment de manières que la formule actuelle ne capture pas entièrement. Les chercheurs en sont conscients. Plus de travail est nécessaire avant que quiconque puisse appeler cela un outil de sécurité prêt pour la production.
Mais la direction est claire. Le matériel continue de s’améliorer. L’IA hors ligne devient de plus en plus performante. Et l’écart entre ce que ces modèles peuvent faire et ce que les mécanismes de sécurité peuvent attraper s’élargit probablement plus vite que la plupart des gens ne le réalisent. La formule de Johnson et Huo est une tentative de combler cet écart — au moins suffisamment pour avertir les utilisateurs avant que les choses ne tournent mal.
La recherche publiée apparaît dans Patterns, avec des tests étendus aux modèles de 12 milliards de paramètres.
Questions Fréquentes
Que calcule réellement la formule du point de basculement développée par Johnson et Huo ?
La formule calcule n — le nombre de réponses positives qu’un chatbot donnera avant de produire une sortie nuisible ou négative, en fonction du contexte de la conversation et du comportement de l’attention head du modèle.
Comment la formule a-t-elle performé lors des tests ?
Lors des tests préliminaires, la formule a correctement prédit le comportement de basculement dans 15 des 16 cas à travers six modèles à poids ouvert d’OpenAI, EleutherAI et Meta, allant de 124 millions à 410 millions de paramètres.





