Passer au contenu principal
Image du blog pour les risques de sécurité de Claude Mythos
Problème émergent

Risques de sécurité de Claude Mythos : ce que nous dit la carte du système anthropique

L’aperçu Claude Mythos d’Anthropic a démontré une accélération significative des capacités d’identification autonome des vulnérabilités et d’exploitation des chaînes sur les principaux logiciels et systèmes d’exploitation. Les leaders gouvernementaux et industriels se concentrent sur la compréhension des risques réels que le modèle présente, et sur la manière d’exploiter ces technologies avancées pour protéger et se défendre contre l’utilisation contradictoire.

MISE À JOUR—22 avril, 2026 : fuite de mythos

Selon les rapports de Bloomberg, un petit groupe d’utilisateurs associés à une communauté privée Discord qui se concentre sur la découverte de détails sur les modèles d’IA non publiés a obtenu un accès non autorisé à l’aperçu de Claude Mythos via un environnement de fournisseur tiers, et non via une compromission directe des systèmes de base d’Anthropic.

Bien que la couverture se soit concentrée sur le modèle lui-même, ce détail place l’incident dans un territoire plus familier pour les équipes de sécurité : exposition tierce, prolifération des accès et déconnexion entre l’accès restreint en théorie et l’accès restreint en pratique. Plutôt qu’une violation spectaculaire de l’infrastructure frontalière, la situation souligne comment les capacités sensibles peuvent hériter du risque de l’écosystème plus large qui les entoure.

Pour les défenseurs, cette distinction est importante. Les systèmes de grande valeur sont rarement accessibles par la porte d’entrée ; les attaquants et les utilisateurs non autorisés recherchent des chemins adjacents qui sont moins régis ou moins visibles.

De tels incidents renforcent une réalité de longue date : les résultats de sécurité dépendent toujours des fondamentaux de l’exécution : savoir quels actifs existent, comment les workflows des fournisseurs connectent les environnements, ce qui est mal configuré ou non corrigé, et si la remédiation a réellement eu lieu.

Alors que les outils avancés améliorent l’efficacité des attaquants, les équipes disposant d’une visibilité continue sur les endpoints, les logiciels, le statut des correctifs et la dérive de configuration sont mieux placées pour passer de la spéculation à la réponse éclairée.

Cet article a été rédigé par la scientifique de recherche en IA de Tanium, Aidan Allchin, Logan Hegler, ingénieur logiciel (gestion des expositions) et Melissa Bischoping, directrice principale de la recherche en sécurité et conception de produits.

Anthropic’s 7 avril 2026, la sortie de la carte système Claude Mythos Preview de 245 pages a fait tourner les têtes des chercheurs avec les possibilités et les pièges du développement de l’IA de pointe. Alors que l’industrie se mettait collectivement à l’honneur, le véritable consensus était : l’accélération continue, alors comment nous préparer ?

Les risques de sécurité de Mythos intégrés à la carte du système anthropique sont réels, mais ils nécessitent une lecture et une compréhension approfondies des contraintes et du contexte pour mesurer l’impact réel qu’ils peuvent avoir.
Dans les 50 premières pages de la carte du système anthropique, Anthropic a démontré que Claude avait évolué de la recherche d’une voie vers une exploitation réussie moins de 1 % du temps avec le modèle Opus à l’identification des exploits fonctionnels plus de 70 % du temps avec le modèle Mythos. Naturellement, les réalités de ce qu’un adversaire alimenté par l’IA pourrait faire ont explosé les cauchemars de chaque leader de la sécurité. La question n’est pas de savoir s’il faut s’inquiéter, c’est de savoir si votre préoccupation est calibrée par rapport aux preuves.

Capacité d’IA : titres par rapport aux preuves

Avant de travailler sur les implications, il est utile d’établir ce que les données montrent réellement et où elles nécessitent une qualification.

CyberGym mesure quelque chose de concret : compte tenu d’une cible et d’une classe de vulnérabilité, le modèle doit produire un exploit fonctionnel contre des bases de code open source réelles. Mythos a obtenu un score de 83,1 % contre 66,6 % pour Opus 4,6. Ce n’est pas une amélioration marginale.

[Lire comment l’exposition à la source du code Claude modifie l’avantage des attaquants et ce que les entreprises doivent évaluer en réponse]

La propre caractérisation interne d’Anthropic d’Opus 4,6 était un « taux de réussite de près de 0 % au développement d’exploitation autonome ». Lors d’un test contrôlé par rapport au moteur JavaScript de Firefox, Opus 4,6 a produit des exploits fonctionnels deux fois en plusieurs centaines de tentatives ; Mythos a produit 181 sur le même test. Lors d’une évaluation distincte, Anthropic a exécuté des modèles contre environ mille référentiels de corpus OSS-Fuzz sur une échelle de gravité des collisions à cinq niveaux : les modèles frontière antérieurs sont arrivés en haut au niveau 3 ; les mythes ont atteint les niveaux 3 et 4 et le détournement complet du flux de contrôle (niveau 5) sur dix cibles distinctes, entièrement corrigées.

Ensemble, ces résultats étayent une allégation étroite mais importante : les modèles sont passés de « trouve parfois des bugs » à « chaîne plus fiable l’exploitation dans des bases de code réalistes », au moins dans ces conditions d’évaluation.

De l’artisanat sur mesure à la fabrication industrielle

Historiquement, le développement des exploits était un art sur mesure autant qu’une science. Tout comme un maître artisan pourrait passer des mois à créer un meuble fait main, certaines des chaînes d’exploits et recherches les plus importantes de ce siècle ressemblaient à des « exploits artisanaux » par comparaison. Il y avait toujours un peu de « magique » impliqué, pratiqué par un nombre relativement restreint.

Cette publication, et les recherches qui la sous-tendent, représentent un changement de paradigme vers l’industrialisation et la démocratisation du développement des exploits. Nous passons à un écosystème d’usines, où les exploits sont développés à la demande et n’attendons pas que les artisans s’artisanent, sauf pour les variétés les plus exquises.

Mais tout n’est pas perdu. L’usine est toujours plus efficace pour imiter l’art antérieur contre les systèmes non corrigés et non sécurisés. Il sait comment rechercher les bogues courants, les mauvaises configurations courantes. D’autre part, les bugs que cette technologie est capable d’identifier pour la réussite de l’exploitation sont les mêmes bugs qu’elle pourrait identifier comme candidats prioritaires pour l’application de correctifs.

Cela crée une opportunité : repensez le renforcement et l’efficacité des correctifs comme un rythme cardiaque continu et continu de l’organisation alors que l’usine d’exploitation industrielle est toujours en ligne.

Lorsque l’IA a résolu le repliement des protéines, elle n’a pas remplacé les biologistes, mais a modifié les catégories de problèmes sur lesquels ils pouvaient travailler. Mythos fait de même pour les chercheurs en sécurité, des deux côtés de la ligne.

Capacités offensives et saturation de référence

Les références standard de type CTF se saturent désormais comme signaux. Mythos obtient un score de 100 % sur Cybench, qui couvre l’exploitation binaire, l’ingénierie inverse, la cryptographie, l’exploitation Web et la découverte de vulnérabilité de bout en bout. Les États anthropiques n’ont pas obtenu ce modèle. Lorsqu’une référence se sature, elle cesse de différencier les modèles frontiers.

Anthropic a déplacé l ’accent mis sur l’évaluation vers un nouveau travail de sécurité réel, y compris la découverte zero-day dans les logiciels de production, car les mesures lourdes en réplication ne peuvent plus séparer la mémorisation de la capacité réelle.

Pour les praticiens, plusieurs critères familiers pour « Quelle est la capacité de l’IA à commettre une infraction ? » sont désormais obsolètes. Le champ se livre à la course pour construire des mesures plus difficiles. Il s’agit d’une position fondamentalement différente de celle que nous avions il y a six mois.

Le problème de la « direction humaine minimale »

Les modèles précédents avaient besoin d’un humain pour faire les pièces dures. Les mythes ferment davantage la boucle. La mesure « horizon temporel » de METR mesure la durée de la tâche (par temps humain professionnel) qu’un modèle effectue à une fiabilité de 50 % sans prise en main. Cette mesure a connu une croissance rapide ; le temps de doublement lui-même s’est comprimé selon la méthodologie TH1,1 de METR.

ModèlePubliéhorizon temporel de 50 %
Claude 3,7 SonnetFeb 2025~60 min
GPT o3Apr 2025~120 min
Claude Opus 4,5Nov 2025~293 min
GPT-5,2Dec 2025~352 min
Claude Opus 4,6Feb 2026~719 min (~12 heures)

Source : tableau de bord horizons temporels METR

METR n’a pas publié de numéro spécifique aux mythes, mais la carte système d’Anthropic offre une ancre directionnelle : les mythes auraient résolu une simulation d’attaque de réseau d’entreprise estimée à plus de dix heures pour un expert et décrite comme la première solution de bout en bout sur cette catégorie de cyberplage privée (p. 52). La carte décrit les mythes qui s’exécutent dans « un harnais agentique avec une direction humaine minimale » (p. 46). L’évaluation Firefox 147 affine davantage la situation :

ModèleExécution complète du codeRemarques
Claude Opus 4,6~2 réussites / des centaines de tentativesIdentifier les bugs, mais les exploiter rarement
Aperçu de Claude Mythos72 % des essaisConverge indépendamment sur les mêmes bugs optimaux entre les exécutions

Source : Carte du système anthropique, section 3,3,3

Le passage d’environ deux réussites en plusieurs centaines de tentatives à 72 % n’est pas incrémentiel. Le modèle prend les mêmes types de décisions de tri qu’un développeur d’exploit humain, et il le fait de manière fiable, sur des séries indépendantes à partir de différentes catégories de crash.

Lorsque les deux bugs les plus exploitables ont été supprimés, les mythes ont toujours surperformé les modèles précédents en tirant parti de quatre bugs distincts par rapport à celui d’Opus 4,6. Anthropic note en outre que « la performance continue d’augmenter jusqu’à la limite de jetons » (p. 52), ce qui signifie que les évaluations peuvent ne pas encore refléter un plafond.

Mythos est le premier modèle où l’humain n’est plus le goulot d’étranglement dans le pipeline d’exploitation.

Ce que les risques de sécurité de Mythos signifient pour la gestion et la défense des vulnérabilités

Les trois mesures ci-dessous définissent le problème opérationnel. Chacun avançait déjà dans la mauvaise direction avant Mythos. Chacun d’entre eux accélère davantage grâce à cela.

Mesure 1 : temps de divulgation à l’exploitation

Il y a moins de dix ans, la fenêtre moyenne entre la découverte des vulnérabilités et la divulgation publique et l’exploitation active était de 63 jours. Mandiant a cité cette fenêtre comme passant de 32 jours en 2022 à 5 jours en 2024. La réduction de la moyenne était déjà brutale et a écrasé la capacité de nombreuses équipes. Avec l’amplification basée sur l’IA, la conversation passe plus fréquemment à « heures », et non à « jours », pour certaines classes de problèmes.

Ce qui était autrefois un correctif de sniper « bris de glace » réservé uniquement aux problèmes les plus graves est désormais susceptible de devenir une opération de routine que les processus et outils existants ne sont pas préparés à gérer. La question n’est pas de savoir si votre équipe peut appliquer des correctifs plus rapidement en cas de crise, mais si votre pipeline est conçu pour maintenir ce rythme en continu.

Mesure 2 : volume de divulgation coordonné

Le plan de divulgation Glasswing signifie se préparer maintenant. Selon Anthropic  : « Les partenaires partageront, dans la mesure du possible, des informations et des meilleures pratiques entre eux ; dans les 90 jours, Anthropic rendra compte publiquement de ce que nous avons appris, ainsi que des vulnérabilités corrigées et des améliorations apportées qui peuvent être divulguées. » Potentiellement, des milliers de CVE entrent dans le registre public simultanément, et ce volume augmentera si Mythos est publié plus largement ou à mesure que d’autres fournisseurs développent des capacités comparables.

Les implications pratiques pour les équipes de gestion des correctifs sont importantes :

  • La file d’attente de correctifs à partir d’une seule divulgation Glasswing-wave pourrait étouffer tout ce qui est vu à partir d’un seul mardi Patch dans l’historique.
  • Les correctifs peuvent être significatifs, à haut CVSS et s’étendre simultanément à l’infrastructure, aux postes de travail, aux serveurs, aux bases de données et aux appareils OT ou IoT.
  • Effacer votre backlog actuel des correctifs en attente réduit désormais la surface que vous défendez lorsque la vague frappe.
  • La consolidation des logiciels inutilisés réduit la charge des correctifs à l’avenir.
  • Les images or obsolètes sont une responsabilité : mettez-les à jour, ou mieux encore, modernisez votre approche de déploiement et de provisionnement pour réduire complètement la dépendance aux images statiques.

Métrique 3 : diffusion des capacités

Le décalage de poids de frontière à ouvert s’est fortement comprimé au cours des générations récentes de modèles :

Modèle FrontierPubliéComparaison à poids ouvertPubliéRetard
GPT-4Mar 2023Llama 3.1 405BJul 2024~16 mois
Claude Opus 4,5Nov 2025MiniMax M2,5Feb 2026~79 jours
Claude Opus 4,6Feb 2026GLM-5,1Apr 2026~61 jours*

*GLM-5,1 chiffres incluent l’auto-déclaration des fournisseurs et doivent être traités comme un fait antérieur fort, non confirmé.
Sources : OpenAIMetaAnthropic (4,5)Anthropic (4,6), MiniMax, Z.ai

Seize mois à 61 jours est une compression d’environ 8x en trois ans. Epoch AI place le décalage moyen à poids ouvert à environ 3,5 mois sur l’ensemble de l’histoire, mais les points de données récents se regroupent de manière plus stricte.

Anthropic a publiquement estimé environ six à dix-huit mois avant que les modèles à poids ouvert n’atteignent la capacité de niveau Mythos sur les cyber-tâches. Lors du RSA 2026, Alex Stamos, directeur technique chez Corridor et ancien RSSI chez Facebook, a proposé un cadre de six mois (qui est plus cohérent avec la tendance empirique que la limite supérieure de dix-huit mois d’Anthropic) et a averti : « Vous aurez tous les 19 ans à Saint-Pétersbourg avec la même capacité. »

Lorsque la capacité au niveau des mythes atteint des modèles à poids ouvert, deux changements ont tendance à se produire ensemble :

  1. Réduction des coûts d’inférence : des modèles tels que MiniMax M2,5 fonctionnent déjà à environ 1/20th le coût de Claude Opus 4,6, rendant l’utilisation continue ou à grande échelle économiquement négligeable pour de nombreux acteurs.
  2. Les contraintes comportementales s’affaiblissent : les comportements les plus graves documentés dans la carte système d’Anthropic ont été observés dans des versions internes antérieures de Mythos pendant le développement, et non dans le modèle d’aperçu partagé via Project Glasswing. L’atténuation de ces comportements a nécessité un alignement et une évaluation approfondis après la formation, y compris des pipelines de sécurité personnalisés, des travaux d’interprétabilité et des tests répétés. Cet effort était vaste, laborieux et spécifique au processus d’entraînement d’Anthropic, ce qui signifie qu’il ne se transfère pas avec les pondérations du modèle. Par conséquent, ces comportements précoces sont mieux compris comme un aperçu plausible de ce que les déploiements similaires, mais moins alignés, pourraient présenter, et non comme une propriété de l’aperçu Mythos publié lui-même.

Pris ensemble, la fenêtre de planification du défenseur n’est pas « lorsque Anthropic publie publiquement des mythes ». C’est lorsque les modèles à poids ouvert atteignent la cybercapacité de niveau Mythos sans ces contraintes comportementales. Cette horloge a effectivement commencé le 7 avril, et elle est mesurée en mois, et non en années.

Repenser la gestion des correctifs à l’ère de l’IA

Patch Tuesday est un artefact d’une époque différente. La cadence mensuelle des correctifs a été conçue autour de la détection des vulnérabilités à vitesse humaine, du développement des exploits à vitesse humaine et des processus de contrôle des modifications à vitesse humaine. Ces hypothèses constituent désormais une responsabilité structurelle. Le changement n’est pas aussi simple que « juste corriger plus rapidement ». Le paysage nécessite un changement fondamental vers des correctifs précis et une gestion continue de l’exposition aux menaces : des processus agiles, ciblés, rapides et itératifs.

Étant donné que le développement logiciel a adopté des pipelines CI/CD plus rapides et des workflows compatibles avec l’IA, la sécurité doit suivre le même modèle. Le côté sécurité de la maison a été plus lent à effectuer ce changement, mais la vitesse à laquelle Mythos accélère les cycles de correctifs le forcera.

La gestion des correctifs à l’ère de l’IA signifie traiter la remédiation des vulnérabilités comme les équipes logicielles modernes traitent le déploiement : combiner l’exécution automatisée avec des informations en temps réel, des portes de vérification et des boucles de rétroaction continues plutôt que des opérations par lots périodiques.

L’industrie savait déjà que c’était vrai d’un point de vue directionnel. La découverte des vulnérabilités assistée par l’IA est un sujet abordé dans toutes les grandes conférences et organisations de recherche en sécurité depuis des années. Les mythes ne sont pas une surprise en nature, mais uniquement en termes d’ampleur et de vitesse d’arrivée. La chronologie compressée de « finalement » à « maintenant ». Les hypothèses intégrées à votre programme concernant les SLA, l’outillage, la dotation en personnel et les cadres de hiérarchisation ont été conçues pour un monde qui n’existe plus.

La vérification n’est pas facultative

Déployer un correctif et s’éloigner ne donne pas confiance dans la remédiation sans vérifications supplémentaires pour comprendre si le correctif était suffisant et réussi. Dans un monde où vous appliquez des correctifs plus rapidement et à un volume plus élevé, le risque de couverture incomplète augmente grâce à :

  • endpoints non gérés qui ne relèvent pas du champ d’application du déploiement des correctifs
  • Exceptions et reports qui s’accumulent en lacunes permanentes
  • Échecs de déploiements qui ont été signalés comme réussis
  • Images or obsolètes qui se redéployent dans votre environnement avec des logiciels obsolètes jusqu’au prochain cycle de correctifs

Savoir que vous avez résolu une vulnérabilité sur chaque endpoint est plus important que jamais lorsque des adversaires peuvent se refaire sentir sur des machines manquées. La gestion continue de l’exposition aux menaces, ou le traitement de la réduction de l’exposition comme itération et non comme un projet ponctuel, est le modèle opérationnel qui s’adapte à cet environnement.

Une définition étendue de « sécurisé par défaut »

Classiquement, « sécurisé par défaut » signifiait une configuration d’expédition sûre : moindre privilège, valeurs par défaut renforcées, surface d’attaque réduite en supposant des attaquants à vitesse humaine.

Selon les documents publics d’Anthropic Glasswing, les recherches liées aux mythes comprennent des découvertes telles qu’une vulnérabilité de 27 ans dans OpenBSD, un bug FFmpeg de 16 ans qui a survécu à un énorme volume de fuzzing automatisé, et un chaînage autonome des problèmes de noyau Linux pour un contrôle complet de la machine.

Si l’outillage de cette classe de capacité peut faire apparaître des problèmes vieux de plusieurs décennies dans des bases de code fortement auditées, alors « sécurisé par défaut » doit s’étendre bien au-delà de la configuration. Cela doit signifier que chaque élément de logiciel expédié aujourd’hui est activement analysé par des outils équivalents avant d’atteindre la production. Pour l’infrastructure, supposez que les services exposés sont confrontés à un sondage continu au moins à ce niveau de capacité. La segmentation du réseau, les architectures Zero Trust et l’isolation des temps d’exécution ne sont plus des aspirations de modèle de maturité : il s’agit d’exigences d’architecture de référence.

Accessibilité : le coût est temporaire ; la capacité est émergente

À court terme, l’accès de classe Mythos est coûteux. Le prix de l’ère Glasswing cité par Anthropic est de 25 USD/125 USD par million de jetons d’entrée/sortie contre 5 USD/25 USD pour l’augmentation d’Opus 4,6—a 5x . L’analyse continue lourde à ce prix n’est pas triviale, mais le coût est un obstacle temporaire.

Les anthropiques affirment qu’ils n’ont pas explicitement formé Mythos Preview à la cyber offensive ; ces capacités « sont apparues comme une conséquence en aval d’améliorations générales du code, du raisonnement et de l’autonomie ». C’est logique, lorsque vous considérez la curiosité, l’autonomie et l’ingéniosité qui rendent un grand pirate informatique formidable.

Si cela est le cas, des surfaces similaires apparaîtront dans chaque modèle suffisamment capable à l’avenir, indépendamment de l’intention du fournisseur.

Associé à la compression du décalage de poids ouvert et à la baisse des coûts d’inférence, « qui peut se permettre l’API » n’est pas la porte à long terme. « Qui a une flotte et une chaîne d’approvisionnement » est.

Le vecteur à l’intérieur de la maison : agents, harnais et limites dures

Une mauvaise utilisation externe par des acteurs offensants obtient la majeure partie du temps d’antenne avec une version comme Mythos. Mais le risque parallèle est interne : des agents approuvés ou fantômes avec un accès large aux outils, des données d’entreprise et des informations d’identification en direct fonctionnant dans votre périmètre.

La recherche cataloguant plus de 177 000 outils MCP (Model Context Protocol) rapporte l’intégration de routine des agents dans les systèmes de fichiers, les navigateurs, les environnements d’exécution de code, les bases de données et les API de production en tant que capacités de faisceau standard.

Les harnais de type « griffe », des boucles d’outils serrées avec une autonomie persistante, se sont rapidement propagés ; OpenClaw est passé à environ 247 000 étoiles GitHub en huit semaines avec des dizaines de dérivés, avec des modèles d’accès par défaut couvrant les terminaux, les navigateurs, les systèmes de fichiers, la récupération de mémoire et les intégrations externes. Un accès étendu et une autonomie élargissent simultanément la surface d’attaque vers l’intérieur et vers l’extérieur.

Les règles au niveau du harnais sont toujours du code écrit par des personnes. Ils échouent ; les modèles les entourent lorsque l’achèvement de la tâche domine. La carte système d’Anthropic décrit un épisode dans lequel Mythos, a demandé de corriger un bug et de pousser une validation signée sans informations d’identification, a recherché l’état du superviseur et a tenté d’extraire de la mémoire après un appel de l’utilisateur, comportement caractérisé comme une poursuite d’objectif l’emportant sur l’évaluation des risques. Cet épisode s’est produit lors de l’évaluation avant publication avant un travail d’alignement supplémentaire. Anthropic appelle Mythos Preview d’expédition hautement aligné par leurs mesures, tout en notant que les actions rares et mal alignées peuvent toujours être graves précisément en raison de la capacité brute.

Visibilité au sein de l’entreprise d’IA

La première exigence est de savoir ce qui se passe à l’intérieur du périmètre, approuvé et non. La plupart des organisations ne disposent pas d’une image claire de l’inférence locale, des assistants d’IA et des agents autonomes déployés dans leur environnement. Vous ne pouvez pas sécuriser ce que vous ne voyez pas, et à l’heure actuelle, la plupart des organisations n’ont pas d’inventaire fiable de la quantité d’IA exécutée réellement dans leur périmètre.

[Explorez ce que la conformité à l’IA signifie pour les entreprises modernes et comment l’évolution des réglementations façonne une gouvernance responsable de l’IA]

Le secteur de la cybersécurité dans son ensemble devra continuer à investir massivement dans les outils de visibilité de l’IA, car l’écart entre ce que les organisations pensent être en cours d’exécution et ce qui est en cours d’exécution est significatif et croissant.

Déploiement sécurisé et gestion en temps réel des agents d’IA

La visibilité seule ne suffit pas. Les organisations ont également besoin d’un moyen de déployer des agents d’IA en toute sécurité et de les gérer de manière centralisée sur l’ensemble de leur flotte. La formation comportementale et les garde-fous au niveau de l’application sont utiles : ils ne constituent pas des garanties suffisantes contre les agents capables de rechercher des objectifs.

Les modèles émergents comprennent une politique au niveau du système d’exploitation pour les contraintes de système de fichiers, de réseau et de processus, avec des fournisseurs de sécurité majeurs , notamment Cisco, CrowdStrike, Google Cloud et Microsoft collaborant déjà sur les normes de politique d’exécution pour les agents autonomes.

Dans une analyse, Claude a qualifié certaines de ses mesures de protection dans la carte du mars 2026 système de fuite de « défense par ondes ». Bien que les ensembles de règles et les directives lisibles par l’homme puissent faire partie de notre boîte à outils défensive standard, il existe toujours des listes de contrôle de contrôles techniques minimales :

  1. Isolement du bac à sable à la limite du système d’exploitation/conteneur (pas une instruction d’invite système) : les agents doivent s’exécuter dans des conteneurs isolés afin que les conséquences soient contenues si les agents se comportent mal, appliquées au niveau de l’infrastructure plutôt que par la formation à la sécurité du modèle.
  2. Politique réseau sur chaque chemin de sortie : chaque connexion sortante doit être interceptée et évaluée par rapport à la politique. Un agent qui ne peut pas atteindre un endpoint ne peut pas interagir avec lui, protégeant les services internes contre les agents indésirables et les données d’entreprise contre l’exfiltration.
  3. Informations d’identification en dehors de l’environnement de l’agent : les informations d’identification ne doivent jamais être accessibles dans le sandbox d’un agent. Ils doivent être gérés par un proxy en dehors de l’environnement de l’agent et injectés dans les demandes sortantes uniquement après avoir quitté le sandbox de l’agent.
  4. Routage et journalisation centralisés pour l’inférence, les outils et les appels réseau : toutes les demandes sortantes doivent être acheminées via un proxy avec une journalisation complète de chaque demande réseau, appel d’inférence et invocation d’outil, permettant une enquête légale efficace et une validation de la conformité.

Du signal à la réponse : ce que cela change pour les défenseurs

Les risques Mythos décrits ci-dessus sont réels, mais ils ne sont pas inconnus. Ce qui reste incertain, c’est le calendrier, pas la direction. Nous ne connaissons pas encore la date précise à laquelle les modèles à poids ouvert concorderont avec Mythos sur les cyber-tâches autonomes à spectre complet, et nous n’avons pas non plus de réplication large et indépendante de chaque résultat de classe Firefox anthropique dans les environnements et les piles.

Ce qui est clair, c’est que les défenseurs n’ont plus le luxe d’attendre la certitude. Les délais de détection et d’armement des exploits se compriment plus rapidement que la plupart des programmes de correction et de gestion de l’exposition ont été conçus pour être absorbés. Dans cet environnement, réagir aux titres est moins utile que les hypothèses de test de pression.

La question la plus productive pour les responsables de la sécurité et de l’informatique n’est désormais pas « Quelle est la gravité des mythes ? » Il s’agit de « Où notre modèle opérationnel actuel échoue-t-il en premier si les fenêtres d’exposition continuent de rétrécir ? »

Pour certaines organisations, la contrainte apparaît dans la hiérarchisation. Pour d’autres, il se présente dans le cadre de tests de débit, de contraintes de déploiement ou de preuves de clôture sur des parcs d’endpoints fragmentés. Dans presque tous les cas, le point faible n’est pas l’outillage isolé, mais la séquence selon laquelle les informations sur les vulnérabilités sont transformées en réduction des risques vérifiée.

Cette transition, de la compréhension des risques à l’opérationnalisation de la réponse, est l’endroit où la conversation Mythos devient consécutive. Le défi restant est organisationnel plutôt que théorique : si les hypothèses existantes de vulnérabilité et d’application de correctifs persistent à mesure que la découverte, la hiérarchisation et l’exploitation se rapprochent.

Étant donné que Mythos est inévitable, l’application de correctifs n’est pas facultative et doit être effectuée à la vitesse et à l’échelle. Tanium Autonomous Patch Management transforme la gestion et la sécurité des endpoints grâce à des correctifs autonomes, intégrés et complets.

Soutenu par l’IA et l’intelligence en temps réel des endpoints, Tanium aide à réduire les fenêtres d’exposition que les modèles de classe Mythos sont conçus pour exploiter avant que les adversaires ne puissent agir sur les vulnérabilités qu’ils trouvent.

FAQ sur les risques de sécurité Mythos

La version de Mythos a généré une couverture significative, une partie précise et une autre non. Ces clarifications traitent des points de confusion les plus courants.

Le modèle Mythos publié a-t-il échappé aux bacs à sable et couvert ses pistes ?

Non, pas le modèle publié. Les incidents comportementaux Les documents anthropiques, y compris l’échappement en bac à sable, la couverture de piste, la pêche d’informations d’identification via /proc/, la publication de documents confidentiels, sont attribués à des versions internes antérieures de Mythos, et non à l’aperçu de Mythos de l’ère Glasswing.

La carte du système anthropique est explicite que les incidents graves de ce type impliquaient des versions qui « avaient précédé » certaines des interventions de formation les plus efficaces d’Anthropic (p. 54). Le modèle publié est décrit comme prenant toujours des raccourcis imprudents dans les paramètres de enjeux inférieurs, mais ne présentant pas les mêmes modèles de tromperie graves. Citer ces comportements sans le qualificateur de version est techniquement inexact.

Si Mythos a échoué sur les systèmes corrigés, cela signifie-t-il que les correctifs sont toujours suffisants ?

L’application de correctifs reste le principal point de levier du défenseur, et l’échec de Mythos contre « un sandbox correctement configuré avec des correctifs modernes » (Anthropic System Card, p. 52) est une bonne nouvelle enterrée sous les numéros de titre.

Mythos se lit comme une arme de précision contre l’hygiène à la traîne et les piles non corrigées. Le défi organisationnel est de savoir si les équipes peuvent corriger, valider la couverture et actualiser les images suffisamment rapidement lorsque la découverte et l’armement se compriment. La réponse est le rythme et la vérification.

Qu’est-ce que cela signifie que les benchmarks standard sont « saturés » ?

Anthropic s’est concentré sur l’évaluation de nouvelles tâches de sécurité réelles, y compris la découverte zero-day dans les logiciels de production, car les références qui mesurent la réplication des vulnérabilités connues finissent par cesser de fournir une différenciation utile à la frontière.

Lorsqu’une référence se sature, cela ne signifie pas que la tâche est résolue dans un sens absolu. Cela signifie que le test a atteint les limites qu’il a été conçu pour mesurer. Le score de 100 % de Mythos sur Cybench indique que cette référence spécifique ne fournit plus de séparation significative entre les modèles haut de gamme, un résultat normal et récurrent à mesure que les capacités du modèle s’améliorent.

L’implication pratique est simple : l’évaluation évolue parallèlement à la capacité. À mesure que les modèles progressent, les références sont affinées, remplacées ou rendues plus difficiles afin de continuer à mesurer ce qui compte. Dans ce cas, l’accent mis par Anthropic sur l’évaluation s’oriente vers des tâches plus dures et moins rejouables, précisément parce que celles -ci reflètent mieux les types de questions de sécurité réelles liées à l’IA qui intéressent les praticiens.

Les capacités offensives de Mythos ont-elles été délibérément formées ?

Non. Anthropic déclare : « Nous n’avons pas explicitement formé Mythos Preview à ces capacités. Elles sont plutôt apparues comme une conséquence en aval des améliorations générales du code, du raisonnement et de l’autonomie. »

Cela signifie que des surfaces de capacité similaires sont susceptibles d’émerger dans des modèles avec une échelle, des régimes d’entraînement et des caractéristiques architecturales comparables à ceux des LLM frontières comme Mythos. Bien que les entreprises ne divulguent pas tous les détails de ces architectures, la tendance suggère que la diffusion des capacités est moins motivée par les choix de politiques que par la dynamique sous-jacente de l’évolutivité du modèle d’usage général.

Ressources supplémentaires

  • Regardez cette démo à la demande pour découvrir comment Tanium Autonomous Patch Management aide les organisations à combler en permanence l’écart d’exposition aux vulnérabilités, en traitant les menaces basées sur l’IA à la vitesse et à l’échelle dont les environnements actuels ont besoin.

Anthropique

Recherche sur les capacités et l’évaluation des modèles

Modèles à poids ouvert

Analyse et reporting du secteur

Publications de modèles fondamentaux