Claude Haiku 5.5: Strengerer Cyberschutz, niedrigerer Preis
Anthropic hat Claude Haiku 5.5 veröffentlicht, sein günstigeres und schnelleres Modell für wiederkehrende Aufgaben, bei denen es auf Tempo ankommt. Nach Angaben des Unternehmens findet es Schwachstellen und schreibt Exploits besser als Haiku 4.5. Deshalb hat Anthropic strengere Schutzmaßnahmen für die Cybersicherheit eingebaut. Bei den offensiven Fähigkeiten liegt das Modell aber noch weit hinter den größeren Modellen von Anthropic.
Außerdem bezeichnet das Unternehmen Haiku 5.5 als sein bislang widerstandsfähigstes Haiku-Modell gegen Prompt Injection. Dabei werden bösartige Anweisungen in Inhalten versteckt, die die KI liest, etwa in einer E-Mail oder auf einer Webseite.
Offensive Fähigkeiten ohne Schutzvorkehrungen gemessen
Anthropic hat die offensiven Fähigkeiten des Modells bei abgeschalteten Cybersicherheits-Schutzmaßnahmen getestet. In einem Test rund um bekannte Lücken in Chromes JavaScript-Engine V8 erreichte Haiku 5.5 in vier von 410 Durchläufen die Ausführung beliebigen Codes.
Eine weitere Auswertung befasste sich mit mehrstufigen Cyberoperationen. Hier löste eine Vorabversion 3,3 % der Aufgaben. Sonnet 5.5 kam auf 46,1 %, Opus 5.5 auf 67,6 %. Im Benchmark ExploitGym schlug Haiku 5.5 zwar Claude Sonnet 5, blieb aber deutlich hinter dem Rest der 5.5-Familie zurück.
Anthropic weist darauf hin, dass diese Zahlen nicht unbedingt zeigen, was normale Nutzer mit den Modellen anstellen können, sobald die allgemeinen Schutzmaßnahmen greifen.
Die neuen Schutzmaßnahmen sind strenger als bei Haiku 4.5, aber etwas lockerer als bei anderen aktuellen Anthropic-Modellen. Sie erlauben mehr defensive Arbeit als die Beschränkungen von Sonnet 5.5, blockieren aber weiterhin Penetrationstests und andere Techniken, die eher von Angreifern genutzt werden. Sicherheitsfachleute, die die Voraussetzungen erfüllen, können über das Cyber Verification Program des Unternehmens weniger Einschränkungen beantragen.
Weniger unberechtigte Ablehnungen
Anthropic konfrontierte das Modell mit schädlichen Anfragen, harmlosen Fragen zu heiklen Themen und Gesprächen, in denen ein simulierter Nutzer es nach und nach zu einem schädlichen Ergebnis drängte. Zu den Themen gehörten Waffen, Extremismus, Ortung und Überwachung, Kinderschutz, psychische Gesundheit und die Integrität von Wahlen.
Mit einer nahezu finalen Version des System-Prompts aus dem Produktivbetrieb von Claude.ai reagierte Haiku 5.5 auf 99,71 % der schädlichen Anfragen harmlos. Harmlose Anfragen lehnte es in 0,82 % der Fälle fälschlich ab, bei Haiku 4.5 waren es 3,05 %.
In längeren Gesprächen schnitt es bei Einflussoperationen sowie Ortung und Überwachung besser ab. Schlechter war es bei Waffenszenarien, wenn es über die API ohne System-Prompt getestet wurde. Anthropic nannte zudem verbleibende Schwachstellen in sensiblen Gesprächen, unter anderem zu Selbstverletzung und Essstörungen, und rät API-Entwicklern, eigene Schutzmaßnahmen einzubauen. Zusätzliche Schutzmechanismen aus dem Produktivbetrieb wie Echtzeit-Prüfungen und Überwachung waren in diesen Tests nicht enthalten.
Missbrauch beim Programmieren und bei der Computersteuerung
In Tests mit Claude Code lehnte Haiku 5.5 84,3 % der bösartigen Anfragen ab, beim Vorgänger waren es 66,6 %. Dazu gehörten das Schreiben von Schadsoftware, die Unterstützung von DDoS-Angriffen und die Entwicklung von Software zur Überwachung ohne Einwilligung. Gleichzeitig half es bei mehr erlaubten Sicherheitsaufgaben, etwa bei der Auswertung von Ergebnissen aus Penetrationstests.
In Tests zur Computersteuerung, die Überwachung, unbefugte Datensammlung und ähnliche Aktivitäten abdeckten, lehnte es rund 82,6 % der Anfragen ab, nach zuvor 58,9 %. Das war auch eine höhere Ablehnungsquote als bei Sonnet 5.5 und Opus 5.5 in derselben Auswertung.
Gegen adaptive Angreifer in Programmier- und Computersteuerungsumgebungen hielt das Modell Prompt Injection weitgehend so gut stand wie die Spitzenmodelle von Anthropic. In einem separaten Benchmark von Gray Swan war es allerdings weniger widerstandsfähig als Sonnet 5.5 und Opus 5.5. Die verbleibenden Schwächen lagen dabei vor allem bei der grafischen Computersteuerung. Die meisten Tests liefen ohne zusätzliche Schutzmaßnahmen aus dem Produktivbetrieb, die Ergebnisse zu adaptiven Angriffen wurden mit und ohne Prüfmechanismen gegen Prompt Injection angegeben.
Preise und Verfügbarkeit
Haiku 5.5 ist günstiger als Haiku 4.5. Bei Prompts mit bis zu 100.000 Token, was laut Anthropic den Großteil der Anfragen an Haiku 4.5 abdeckte, sinken die Preise für Eingabe- und Ausgabe-Token um 90 %. Über eine einstellbare Aufwandsstufe können Nutzer zwischen Kosten und Intelligenz abwägen. Zudem kann das Modell als Programmier-Subagent für Opus 5.5 und Sonnet 5.5 arbeiten.
Aaron Vinh, Staff Software Engineer bei Asana, sagte, man habe in Tests für das KI-Agentenprodukt AI Teammates des Unternehmens "eine um über 30 % geringere Latenz bei der Erledigung von Aufgaben und eine bis zu 2,5-mal schnellere Inferenz pro Agenten-Durchgang festgestellt".
Das Modell ist auf allen Plattformen verfügbar, darunter Amazon Web Services, Google Cloud und Microsoft Azure, und zwar unter der Kennung claude-haiku-5-5. Außerdem halbiert Anthropic die Preise für Cache-Lesezugriffe bei Sonnet 5.5. Dadurch werden die meisten Agentenaufgaben nach Angaben des Unternehmens rund 20 % günstiger. Abonnenten von Max und Team erhalten monatliche API-Guthaben, und die SDKs für Python und TypeScript bekommen Beta-Unterstützung für Computer- und Browsersteuerung.
Unsere Einschätzung
Ein Modell, das zugleich günstiger ist und besser Schwachstellen ausnutzen kann, dürfte in mehr automatisierten Abläufen zum Einsatz kommen. Die strengeren Cyber-Beschränkungen wirken daher wie ein vernünftiger Kompromiss. Der Sprung bei den Ablehnungsquoten für Missbrauch beim Programmieren und bei der Computersteuerung ist wichtig, denn genau dort handeln Agenten selbstständig. Prompt Injection bleibt das schwierigere Problem. Die grafische Computersteuerung ist weiterhin die Schwachstelle, und die Beta-Unterstützung für Browser- und Computersteuerung in den SDKs könnte die Angriffsfläche vergrößern. Wer Agenten entwickelt, sollte Anthropics Rat folgen und eigene Kontrollen einbauen, darunter Angriffstests für KI-Agenten. Es lohnt sich zu beobachten, ob unabhängige Tests die Ergebnisse von Anthropic bestätigen, sobald die Schutzmaßnahmen aus dem Produktivbetrieb aktiv sind.
