Imaginez enseigner à un adolescent à conduire (peur, n’est-ce pas ?). Vous expliquez les règles de la route, mais les vraies leçons proviennent d’expériences au volant : se lever trop tard à un panneau d’arrêt apporte une agitation de peur, tandis que prendre un virage mérite un hochement de tête (ou un soupir de soulagement). Au fil du temps, le conducteur apprend par essai, erreur et récompense.
C’est essentiellement ainsi que fonctionne l’apprentissage par renforcement. Il s’agit d’un type d’ apprentissage automatique où le système apprend en prenant des mesures et en recevant des commentaires, positifs et négatifs, en fonction des résultats. Par exemple, un système d’apprentissage par renforcement peut apprendre à jouer à un jeu vidéo en gagnant des points pour les bons mouvements et en perdant des points pour les mauvais.
L’apprentissage par renforcement n’a pas vraiment été pris en compte dans les cercles de cybersécurité, mais les experts affirment qu’il vaut la peine d’être exploré, compte tenu de son potentiel à aider les systèmes à décider de manière adaptative en temps réel de ce qu’il faut faire ensuite dans des situations inconnues. Les attaques peuvent évoluer trop rapidement pour que les défenses basées sur les signatures suivent le rythme, et les modèles traditionnels d’apprentissage automatique s’appuient sur des données passées souvent rares, obsolètes ou biaisées.
« L’apprentissage par renforcement est différent : il s’agit d’apprendre à partir d’informations d’évaluation qui pourraient être une récompense ou une pénalité », déclare Andrew Barto, professeur émérite d’informatique à l’Université du Massachusetts à Amherst et auteur de Reinforcement Learning : An Introduction. « Le système fait quelque chose et reçoit des commentaires sous forme de score, qu’il essaie d’optimiser. »
« [Un système d’apprentissage par renforcement] fait quelque chose et obtient des commentaires sous la forme d’un score, qu’il essaie de maximiser. »Andrew Barto, professeur émérite en informatique, Université du Massachusetts à Amherst
Si l’apprentissage par renforcement rattrape, et compte tenu des budgets de sécurité serrés d’aujourd’hui et des incertitudes économiques globales, c’est un énorme si, ses fans pensent que cela pourrait inaugurer une nouvelle ère de cyberhygiène. En automatisant les tâches de routine et répétitives qui sont essentielles à la cyberhygiène (pensez aux évaluations du trafic réseau, aux analyses des logiciels malveillants et à la gestion des correctifs, entre autres), les équipes de sécurité seront libres de gérer des problèmes plus complexes et de défendre les réseaux informatiques plus efficacement avec plus de données en temps réel.
Les avantages de l’apprentissage par renforcement en matière de sécurité
La cybersécurité se joue rarement comme un manuel. Les attaquants inventent toujours de nouvelles astuces, et les défenses formées uniquement sur les données passées, comme les escroqueries d’hier, les signatures de logiciels malveillants connus ou les analyses de vulnérabilité de l’année dernière, peuvent avoir du mal à suivre le rythme. Ces modèles traditionnels d’apprentissage automatique peuvent être supervisés (le modèle apprend à partir de données étiquetées qui ont déjà les bonnes réponses, telles que des images étiquetées « chat » ou « chien »), ou non supervisés, où le modèle trouve des clusters ou des modèles dans des données non étiquetées (comme le regroupement de clients ayant des habitudes d’achat similaires).
« L’apprentissage par renforcement est une solution au problème de pénurie de données auquel nous sommes souvent confrontés en matière de sécurité. »Christoph Landolt, chercheur en doctorat, Centre Helmholtz de la CISPA pour la sécurité de l’information
En revanche, une méthode aide les systèmes à comprendre le « Et maintenant ? » dans des situations qu’ils n’ont jamais vues auparavant. Pour mettre en œuvre une méthode d’apprentissage par renforcement, l’équipe de cybersec. forme un agent d’IA, un programme qui peut prendre des décisions seul, pour reconnaître les menaces et adapter ses réponses au fil du temps. Les ingénieurs alimentent les scénarios d’attaque simulés par l’agent, en le récompensant avec un bon score pour les actions qui renforcent les défenses et en pénalisant celles qui ne le font pas, jusqu’à ce qu’il apprenne à réagir efficacement aux menaces réelles.
Trouver suffisamment de données, ou les bonnes données, pour certaines techniques d’apprentissage automatique est souvent un défi, note Anupam Joshi, vice-provocateur et directeur de l’IA à l’Université du Maryland, comté de Baltimore. « Avoir des données n’est pas facile, et cela a tendance à être très rétrospectif », dit-il.
C’est là qu’un système d’apprentissage par renforcement peut mieux fonctionner, en déterminant les mesures à prendre en matière d’attaque ou de défense, même lorsqu’il n’a pas de données parfaites pour commencer, ajoute Joshi. La boucle de retour, récompense ou pénalité, devient un substitut aux jeux de données étiquetés dont dépend l’apprentissage supervisé. En d’autres termes, l’apprentissage par renforcement ne se contente pas d’étiqueter les e-mails d’hameçonnage comme mauvais ; il peut apprendre ce qu’il faut faire lorsqu’il rencontre un modèle suspect qu’il n’a jamais vu auparavant.
Une autre force de l’apprentissage par renforcement est sa capacité à apprendre dans des environnements sûrs et simulés avant d’être déployés sur des systèmes réels, en particulier important en cybersécurité, car les organisations ne peuvent pas se permettre de commettre des erreurs sur des réseaux en direct qui pourraient réduire l’infrastructure critique, déclare Christoph Landolt, chercheur en doctorat au Centre Helmholtz de sécurité de l’information de la CISPA.
« L’apprentissage par renforcement est une solution au problème de pénurie de données auquel nous sommes souvent confrontés en matière de sécurité », déclare-t-il. « Vous ne souhaitez pas vous entraîner sur des données sensibles et exclusives sur les menaces, mais vous pouvez créer des simulations qui aident les modèles à apprendre à réagir. »
Cela signifie que les organisations peuvent créer des environnements d’attaque synthétiques, tels que des simulations d’équipe rouge (où des pirates éthiques imitent des attaques réelles), des tests de stress par déni de service (qui inondent les systèmes de trafic pour tester la résilience) ou des sandboxs de ransomware (laboratoires isolés pour étudier les logiciels malveillants en toute sécurité), où les agents d’apprentissage par renforcement peuvent pratiquer les réponses, échouer en toute sécurité et s’améliorer, ajoute Joshi. Pour que les menaces trop rares apparaissent dans des ensembles de formation réels, tels que des menaces persistantes avancées ou des exploits zero-day, ces environnements offrent aux organisations un moyen de se préparer sans attendre que le pire scénario se produise.
Les inconvénients de l’apprentissage par renforcement
Bien sûr, la réalité est plus désordonnée que la simulation. Landolt met en garde contre le « fossé entre la simulation et la réalité » dans lequel les modèles qui excellent dans un environnement contrôlé peuvent trébucher en pleine nature lorsque les conditions réseau ou les comportements des attaquants diffèrent.
Lorsque l’équipe de Barto formait un agent d’apprentissage par renforcement pour conduire une voiture de course simulée autour d’une piste, par exemple, le système a découvert que claquer dans le mur à vitesse maximale lui permettait de pivoter et de terminer plus rapidement. « C’était clairement le mauvais signal de récompense », dit Barto. « Nous avons vu cela et nous avons dit : « Oh, ce n’est pas ce que nous voulons. »
Dans un contexte de sécurité, ce résultat peut être désastreux. Un système d’apprentissage par renforcement mal conçu peut apprendre à arrêter les rançongiciels en fermant agressivement les processus légitimes ou à prévenir les violations en limitant excessivement l’activité normale des utilisateurs, explique Joshi. Si elle n’est pas vérifiée, la solution du système pourrait créer des problèmes aussi importants que l’attaque elle-même.
Bien que l’apprentissage par renforcement puisse tenir des promesses, il ne s’avère pas bon marché. Contrairement à l’apprentissage automatique traditionnel, l’apprentissage par renforcement doit jongler avec d’énormes quantités d’informations, chaque état possible d’un réseau et chaque action qu’un système pourrait prendre en réponse. Cela s’ajoute rapidement à un fardeau informatique massif, explique Joshi. Le défi n’est pas seulement de former les modèles ; il s’agit de gérer la complexité absolue des choix et des résultats. Pour les organisations, cela signifie que l’apprentissage par renforcement nécessite un investissement sérieux dans l’infrastructure et une planification minutieuse avant qu’il ne puisse fournir une valeur réelle.
L’avenir de l’apprentissage par renforcement
L’apprentissage par renforcement reste largement expérimental dans la cybersécurité aujourd’hui, déclare Landolt, mais les applications futures de celui-ci ont un potentiel énorme.
« L’apprentissage du renforcement n’est pas quelque chose auquel les gens ont tendance à penser lorsqu’ils pensent aux [modèles linguistiques de grande taille] d’aujourd’hui. »Anupam Joshi, vice-provocateur et directeur de l’IA, Université du Maryland, comté de Baltimore
Les entreprises ayant accès à leurs propres données de visibilité et de vulnérabilité en temps réel pourraient former un agent d’apprentissage de renforcement sur ces données pour concevoir des séquences de meilleures pratiques et un calendrier pour corriger des milliers de ses ordinateurs, tablettes et autres endpoints.
Landolt voit des promesses dans des domaines tels que les technologies de tromperie, par exemple, le déploiement de pots de miel qui incitent les attaquants à s’engager avec de faux systèmes tandis que les défenseurs collectent des informations. Les agents d’apprentissage par renforcement pourraient apprendre à mieux placer et adapter ces décoys en temps réel. Un autre domaine prometteur est la défense ciblée en mouvement, où les systèmes se reconfigurent continuellement afin que les attaquants soient confrontés à un paysage en constante évolution.
Landolt signale également les attaques ciblées comme un domaine où l’apprentissage par renforcement pourrait briller. En simulant les mouvements latéraux à l’intérieur des réseaux, par exemple en passant d’un service Web à une base de données, les agents d’apprentissage de renforcement peuvent s’entraîner à se défendre contre les adversaires à la recherche d’ actifs de couronne-bijoux. Joshi ajoute que les organisations pourraient finalement opposer des agents d’apprentissage par renforcement à des agents offensants dans des jeux de style « équipe rouge contre équipe bleue », permettant aux deux parties d’apprendre et de s’améliorer ensemble.
En revanche, les pirates informatiques peuvent également utiliser l’apprentissage par renforcement. Landolt avertit que les adversaires pourraient directement manipuler les agents d’apprentissage par renforcement en empoisonnant leurs signaux de récompense ou en leur présentant des observations trompeuses. Un agent de détection de logiciels malveillants, par exemple, peut être induit en erreur pour ignorer le trafic malveillant ou même prendre des mesures destructrices sur des fichiers légitimes. Tout comme les incidents traditionnels d’empoisonnement des données, dans lesquels les acteurs malveillants ciblent les données de formation alimentées vers des modèles de grande langue, les entreprises seraient sage de limiter les privilèges d’accès aux agents d’apprentissage de renforcement et d’utiliser une nomenclature logicielle (SBOM) qui suit les composants des produits logiciels.
Cette double utilisation du bon/mauvais souligne pourquoi les organisations ne peuvent pas ignorer la trajectoire de l’apprentissage par renforcement. « Les attaques deviendront plus rapides grâce à l’IA », déclare Landolt. Pour les responsables de la sécurité, rester en tête signifie non seulement se préparer à déployer l’apprentissage par renforcement de manière responsable, mais également anticiper la manière dont les adversaires pourraient l’armer.
La communauté au sens large fait déjà de grands paris. L’IAx d’Elon Musk, par exemple, a dépensé 10 fois plus d’énergie informatique sur l’apprentissage par renforcement pour son modèle Grok 4 que pour le signal Grok 3—a de la manière dont l’apprentissage par renforcement central est devenu pour faire progresser les performances de l’IA. Alors que les laboratoires d’IA du monde entier y consacrent des ressources, ses techniques mûriront plus rapidement, ce qui finira par se rendre dans l’espace de la cybersécurité.
« L’apprentissage par renforcement n’est pas quelque chose auquel les gens ont tendance à penser lorsqu’ils pensent aux [modèles linguistiques de grande taille] d’aujourd’hui », déclare Joshi. « Le simple fait de savoir qu’il existe une autre façon de faire des choses qui est particulièrement utile en termes d’apprentissage et d’évolution au fil du temps en vaut la peine. »

