Claude Haiku 5.5 : garde-fous cyber renforcés, prix réduit

Claude Haiku 5.5 : garde-fous cyber renforcés, prix réduit

Anthropic a lancé Claude Haiku 5.5, son modèle plus économique et plus rapide, conçu pour les tâches répétitives où la vitesse compte. Selon l'entreprise, il trouve des vulnérabilités et écrit des exploits mieux que Haiku 4.5. Elle a donc mis en place des garde-fous plus stricts en matière de cybersécurité. Ses capacités offensives restent toutefois loin derrière celles des grands modèles d'Anthropic.

L'entreprise présente aussi Haiku 5.5 comme son modèle Haiku le plus résistant à ce jour face à l'injection de prompt, une technique qui consiste à cacher des instructions malveillantes dans un contenu lu par l'IA, comme un e-mail ou une page web.

Des capacités offensives mesurées sans garde-fous

Anthropic a évalué les capacités offensives du modèle avec ses protections de cybersécurité désactivées. Lors d'un test fondé sur des failles connues du moteur JavaScript V8 de Chrome, Haiku 5.5 est parvenu à exécuter du code arbitraire dans quatre essais sur 410.

Une autre évaluation portait sur des opérations cyber en plusieurs étapes. Une version préliminaire y a réussi 3,3 % des défis. Sonnet 5.5 en a réussi 46,1 % et Opus 5.5 67,6 %. Sur le benchmark ExploitGym, Haiku 5.5 a devancé Claude Sonnet 5, mais est resté très en dessous du reste de la famille 5.5.

Anthropic précise que ces chiffres ne reflètent pas forcément ce que les utilisateurs ordinaires peuvent faire avec les modèles une fois les protections grand public activées.

Les nouveaux garde-fous sont plus stricts que ceux de Haiku 4.5, mais un peu plus souples que ceux des autres modèles récents d'Anthropic. Ils autorisent davantage de travail défensif que les restrictions de Sonnet 5.5, tout en bloquant les tests d'intrusion et d'autres techniques plus susceptibles d'être utilisées par des attaquants. Les professionnels de la sécurité qui remplissent les conditions peuvent demander un assouplissement des restrictions via le Cyber Verification Program de l'entreprise.

Moins de refus injustifiés

Anthropic a confronté le modèle à des requêtes malveillantes, à des questions inoffensives sur des sujets sensibles et à des conversations dans lesquelles un utilisateur simulé le poussait peu à peu vers un résultat nuisible. Les thèmes abordés comprenaient les armes, l'extrémisme, le pistage et la surveillance, la protection de l'enfance, la santé mentale et l'intégrité des élections.

Avec une version quasi définitive du prompt système de production de Claude.ai, Haiku 5.5 a donné des réponses inoffensives à 99,71 % des requêtes malveillantes. Il a refusé à tort 0,82 % des requêtes légitimes, contre 3,05 % pour Haiku 4.5.

Dans les conversations plus longues, il s'est montré meilleur sur les opérations d'influence, le pistage et la surveillance. Il a en revanche fait moins bien sur les scénarios liés aux armes lorsqu'il était testé via l'API sans prompt système. Anthropic a aussi signalé des points faibles persistants dans les conversations sensibles, notamment sur l'automutilation et les troubles alimentaires, et recommande aux développeurs utilisant l'API d'ajouter leurs propres protections. Ces tests n'incluaient pas les protections supplémentaires de production, comme les sondes et la surveillance en temps réel.

Usages malveillants en programmation et en contrôle d'ordinateur

Lors des tests sur Claude Code, Haiku 5.5 a refusé 84,3 % des requêtes malveillantes, contre 66,6 % pour son prédécesseur. Il s'agissait notamment d'écrire des logiciels malveillants, de soutenir des attaques DDoS ou de créer des logiciels de surveillance non consentie. Dans le même temps, il a apporté son aide sur davantage de tâches de sécurité autorisées, comme l'analyse des résultats de tests d'intrusion.

Lors des tests de contrôle d'ordinateur portant sur la surveillance, la collecte de données non autorisée et des activités similaires, il a refusé environ 82,6 % des requêtes, contre 58,9 % auparavant. C'est aussi un taux de refus plus élevé que celui obtenu par Sonnet 5.5 et Opus 5.5 sur la même évaluation.

Face à des attaquants adaptatifs dans des environnements de programmation et de contrôle d'ordinateur, sa résistance à l'injection de prompt a globalement égalé celle des modèles de pointe d'Anthropic. Sur un benchmark distinct de Gray Swan, il s'est toutefois montré moins résistant que Sonnet 5.5 et Opus 5.5, l'essentiel des faiblesses restantes concernant le contrôle d'interfaces graphiques. La plupart des tests excluaient les protections supplémentaires de production, tandis que les résultats face aux attaques adaptatives ont été publiés avec et sans sondes contre l'injection de prompt.

Prix et disponibilité

Haiku 5.5 coûte moins cher que Haiku 4.5. Pour les prompts allant jusqu'à 100 000 tokens, ce qui couvrait selon Anthropic la plupart des requêtes adressées à Haiku 4.5, les prix des tokens en entrée et en sortie baissent de 90 %. Un réglage d'effort ajustable permet d'arbitrer entre coût et intelligence, et le modèle peut servir de sous-agent de programmation pour Opus 5.5 et Sonnet 5.5.

Aaron Vinh, Staff Software Engineer chez Asana, explique que lors des tests menés pour AI Teammates, le produit d'agents de l'entreprise, ils ont "constaté une réduction de plus de 30 % de la latence pour l'exécution des tâches et une inférence jusqu'à 2,5 fois plus rapide par tour d'agent."

Le modèle est disponible sur toutes les plateformes, dont Amazon Web Services, Google Cloud et Microsoft Azure, sous l'identifiant claude-haiku-5-5. Anthropic divise aussi par deux le prix des lectures en cache pour Sonnet 5.5, ce qui rend selon elle la plupart des tâches d'agents environ 20 % moins chères. Les abonnés Max et Team recevront des crédits API mensuels, et les SDK Python et TypeScript prennent désormais en charge, en bêta, le contrôle d'ordinateur et de navigateur.

Notre analyse

Un modèle à la fois moins cher et plus doué pour l'exploitation de failles sera sans doute utilisé dans davantage de chaînes automatisées. Le durcissement des restrictions cyber apparaît donc comme un compromis raisonnable. La forte hausse des taux de refus pour les usages malveillants en programmation et en contrôle d'ordinateur compte, car c'est précisément dans ces contextes que les agents agissent de manière autonome. L'injection de prompt reste le problème le plus épineux. Le contrôle d'interfaces graphiques demeure le point faible, et la prise en charge en bêta du navigateur et du contrôle d'ordinateur dans les SDK pourrait élargir l'exposition. Les développeurs qui conçoivent des agents ont tout intérêt à suivre le conseil d'Anthropic et à ajouter leurs propres contrôles, y compris des tests adverses des agents IA. Reste à voir si des tests indépendants confirmeront les résultats d'Anthropic une fois les protections de production activées.