Claude Haiku 5.5: strengere cyberregels en lagere prijs
Anthropic heeft Claude Haiku 5.5 uitgebracht, het goedkopere en snellere model voor repetitief werk waarbij snelheid telt. Volgens het bedrijf vindt het model kwetsbaarheden en schrijft het exploits beter dan Haiku 4.5. Daarom heeft Anthropic strengere cyberbeveiligingsmaatregelen ingebouwd. De offensieve vaardigheden blijven nog altijd ver achter bij die van de grotere modellen van Anthropic.
Het bedrijf noemt Haiku 5.5 ook het Haiku-model dat tot nu toe het best bestand is tegen prompt injection. Daarbij worden kwaadaardige instructies verstopt in content die de AI leest, zoals een e-mail of een webpagina.
Offensieve vaardigheden gemeten zonder vangrails
Anthropic testte de offensieve capaciteiten van het model met de cyberbeveiligingsmaatregelen uitgeschakeld. In een test rond bekende fouten in Chromes V8 JavaScript-engine wist Haiku 5.5 in vier van de 410 runs willekeurige code uit te voeren.
Een aparte evaluatie richtte zich op cyberoperaties in meerdere fasen. Hier voltooide een pre-releaseversie 3,3% van de opdrachten. Sonnet 5.5 kwam tot 46,1% en Opus 5.5 haalde 67,6%. Op de ExploitGym-benchmark versloeg Haiku 5.5 Claude Sonnet 5, maar bleef het ver achter bij de rest van de 5.5-familie.
Anthropic merkt op dat deze cijfers niet per se laten zien wat gewone gebruikers met de modellen kunnen doen zodra de beveiligingsmaatregelen voor algemene toegang actief zijn.
De nieuwe maatregelen zijn strenger dan die van Haiku 4.5, maar iets losser dan bij andere recente modellen van Anthropic. Ze laten meer defensief werk toe dan de beperkingen van Sonnet 5.5, maar blokkeren nog steeds penetratietests en andere technieken die eerder door aanvallers worden gebruikt. Beveiligingsprofessionals die in aanmerking komen, kunnen via het Cyber Verification Program van het bedrijf minder beperkingen aanvragen.
Minder onterechte weigeringen
Anthropic liet het model los op schadelijke verzoeken, onschuldige vragen over gevoelige onderwerpen en gesprekken waarin een gesimuleerde gebruiker het model langzaam richting een schadelijk resultaat duwde. Onderwerpen waren onder meer wapens, extremisme, tracking en surveillance, kinderveiligheid, mentale gezondheid en de integriteit van verkiezingen.
Met een bijna definitieve versie van de systeemprompt van Claude.ai in productie gaf Haiku 5.5 bij 99,71% van de schadelijke verzoeken een onschadelijk antwoord. Het weigerde ten onrechte 0,82% van de onschuldige verzoeken, tegenover 3,05% bij Haiku 4.5.
In langere gesprekken deed het model het beter op het gebied van beïnvloedingsoperaties, tracking en surveillance. Het scoorde slechter op wapenscenario's wanneer het via de API zonder systeemprompt werd getest. Anthropic wees ook op resterende zwakke plekken in gevoelige gesprekken, onder meer over zelfbeschadiging en eetstoornissen, en raadt API-ontwikkelaars aan hun eigen beveiligingsmaatregelen toe te voegen. Extra beschermingslagen in productie, zoals realtime probes en monitoring, maakten geen deel uit van deze tests.
Misbruik bij programmeren en computergebruik
In tests met Claude Code weigerde Haiku 5.5 84,3% van de kwaadaardige verzoeken, tegenover 66,6% bij zijn voorganger. Het ging onder meer om het schrijven van malware, het ondersteunen van DDoS-aanvallen en het bouwen van software om mensen zonder hun toestemming te monitoren. Tegelijk hielp het model vaker bij toegestane beveiligingstaken, zoals het analyseren van de resultaten van een penetratietest.
In tests rond computergebruik, met onder meer surveillance en het ongeautoriseerd verzamelen van gegevens, weigerde het ongeveer 82,6% van de verzoeken, tegenover 58,9% eerder. Dat was ook een hoger weigeringspercentage dan Sonnet 5.5 en Opus 5.5 in dezelfde evaluatie haalden.
Tegenover adaptieve aanvallers in omgevingen voor programmeren en computergebruik was de weerstand tegen prompt injection grotendeels gelijk aan die van de frontiermodellen van Anthropic. Op een aparte benchmark van Gray Swan was het model echter minder weerbaar dan Sonnet 5.5 en Opus 5.5, waarbij de resterende zwakte vooral zat in grafisch computergebruik. De meeste tests werden uitgevoerd zonder extra beveiligingsmaatregelen uit de productieomgeving, terwijl de resultaten van de adaptieve aanvallen zowel met als zonder prompt-injection-probes werden gerapporteerd.
Prijs en beschikbaarheid
Haiku 5.5 is goedkoper dan Haiku 4.5. Voor prompts tot 100.000 tokens, wat volgens Anthropic het merendeel van de verzoeken aan Haiku 4.5 omvatte, liggen de prijzen voor input- en outputtokens 90% lager. Met een instelbaar inspanningsniveau kunnen gebruikers kosten afwegen tegen intelligentie, en het model kan dienen als programmeer-subagent voor Opus 5.5 en Sonnet 5.5.
Aaron Vinh, Staff Software Engineer bij Asana, zei dat ze in tests voor AI Teammates, het agentproduct van het bedrijf, "meer dan 30% minder latentie zagen bij het afronden van taken en tot 2,5x snellere inferentie per agentbeurt."
Het model is beschikbaar op alle platforms, waaronder Amazon Web Services, Google Cloud en Microsoft Azure, onder de identifier claude-haiku-5-5. Anthropic halveert daarnaast de prijzen voor cache reads bij Sonnet 5.5, wat volgens het bedrijf de meeste agenttaken zo'n 20% goedkoper maakt. Abonnees van Max en Team krijgen maandelijks API-tegoed, en de SDK's voor Python en TypeScript krijgen bètaondersteuning voor computer- en browsergebruik.
Onze analyse
Een model dat zowel goedkoper als beter in exploitatie is, zal waarschijnlijk in meer geautomatiseerde pipelines terechtkomen. De strengere cyberbeperkingen lijken dan ook een verstandige afweging. De sprong in weigeringspercentages bij misbruik via programmeren en computergebruik is belangrijk, omdat agents juist in die situaties zelfstandig handelen. Prompt injection blijft het lastigere probleem. Grafisch computergebruik is nog altijd de zwakke plek, en de bètaondersteuning voor browser- en computergebruik in de SDK's kan het aanvalsoppervlak vergroten. Ontwikkelaars die agents bouwen, doen er goed aan het advies van Anthropic op te volgen en hun eigen controles toe te voegen, waaronder adversarial tests van AI-agents. Het is de moeite waard om te volgen of onafhankelijke tests de resultaten van Anthropic bevestigen zodra de beveiligingsmaatregelen in productie zijn ingeschakeld.
