Vijil DART testet KI-Agenten mit adaptiven Angriffen
Vijil hat Diamond Adaptive Red Teaming for Agents (DART) vorgestellt, ein automatisiertes System, das KI-Agenten in Unternehmen nach Sicherheitslücken und Richtlinienverstößen durchsucht. DART feuert keine feste Liste von Prompts auf sein Ziel ab. Stattdessen setzt es mehrere eigene feindliche Agenten ein, die mehrstufige Angriffe fahren und ihre Taktik ändern, während sie dazulernen.
Nach Angaben des Unternehmens können KI-Entwickler und Ingenieure für Anwendungssicherheit mit DART in ihren Agentenflotten mehr Probleme aufdecken als mit Red-Teaming-Werkzeugen und -Diensten, die auf statischen Test-Prompts beruhen.
Das Mengenproblem
Als Grund für den Start verweist Vijil auf eine Schätzung von Gartner. Bis 2028 soll das durchschnittliche Unternehmen der globalen Fortune 500 mehr als 150.000 Agenten betreiben. 2025 waren es weniger als 15. KI-Entwicklungs- und Governance-Teams fehlen Zeit und Geld, um so viele Agenten von Hand zu prüfen.
Angreifer gehen in dieselbe Richtung. Kriminelle setzen zunehmend eigene KI-Agenten ein, um anhaltende, mehrstufige Angriffe auf KI-Systeme in Unternehmen zu fahren.
Laut Vijil versuchen heutige Red-Teaming-Werkzeuge meist, bekannte Angriffsmuster abzugleichen, und kommen kaum hinterher. Neue Wege, die Abwehr eines Agenten zu umgehen, finden sie selten. Viele vergleichen die Ausgabe eines Agenten schlicht mit einem statischen Satz von Angriffs-Prompts und decken nur das Sprachmodell und die Chat-Oberfläche ab.
Auch der Zeitpunkt ist ein Problem. Solche Tests übernehmen oft externe Berater, außerhalb des Entwicklungszyklus der Agenten, manchmal erst wenige Tage vor dem Start. Den Entwicklern bleibt dann wenig Spielraum, gravierende Befunde zu beheben, bevor der Agent live geht.
So funktioniert DART
DART prüft den gesamten Agenten, einschließlich Werkzeugnutzung, Gedächtnis und Verhalten über mehrere Runden hinweg. Seine Angriffe passen sich dem Ziel in dessen eigener Umgebung an. Das System schickt Wellen mehrstufiger Angriffe los, bewertet jede Antwort, passt sein Vorgehen an und versucht es erneut, so oft, wie der Nutzer es festlegt.
Eine Liste der zu suchenden Schwachstellen braucht es nicht. Laut Vijil findet es sie selbst.
Zu den wichtigsten Funktionen gehören:
- Risikoabdeckung: Vordefinierte Taxonomien auf Basis von OWASP, MITRE und Vijils eigener Forschung, mit der Möglichkeit, die Abdeckung aus dem eigenen Risikokatalog eines Unternehmens aufzubauen.
- Verkettete Angriffe: Angriffe werden über Runden und Episoden hinweg verkettet, um die Angriffsfläche zu kartieren und Schwachstellen auszunutzen.
- Werkzeuge für Entwickler: Ein Plugin für Coding-Agenten wie Claude Code und Codex. DART funktioniert mit jedem Agenten-Framework und jeder Bereitstellungsplattform und erstellt einen prüffähigen Bericht für Entwicklungs- und Compliance-Teams gleichermaßen.
- DevOps-Workflow: Automatisierte Durchläufe in großem Umfang unter Dauerlast, mit Ratenbegrenzung, Wiederholungsversuchen und Modellkonfiguration je Rolle. Es lässt sich per API als Teil einer CI/CD-Pipeline aufrufen.
- Betriebsoptionen: Es kann in der eigenen VPC eines Kunden oder vollständig vor Ort laufen, auch in abgeschotteten und regulierten Umgebungen.
Benchmark-Ergebnisse
In einem aktuellen Test auf dem Benchmark DecodingTrust-Agent erreichte DART eine 1,5-mal höhere Angriffserfolgsquote als sein stärkster Konkurrent. In neun von zwölf Agentenaufgaben aus dem Unternehmensumfeld schlug es diesen Konkurrenten, unter anderem in den Bereichen CRM, Code, Kundenservice, Medizin, Forschung und Reisen.
"Ihr maßgeschneiderter KI-Agent, der auf Ihre vertraulichen Daten zugreifen und selbstständig folgenreiche Aktionen ausführen kann, erfordert einen umfassenden und individuellen Ansatz für die Qualitätskontrolle", sagte Vin Sharma, CEO von Vijil.
"Zwischen einem Agenten, der in einer Demo bereit wirkt, und einem, der seine Zuverlässigkeit, Sicherheit und Sicherheit unter Druck beweist, klafft eine große Lücke. DART schließt diese Lücke und spart im Vergleich zu manuellen Red-Teaming-Einsätzen, generischen Benchmarks und Open-Source-Prototypen Wochen an Aufwand und Zehntausende Dollar", fügte er hinzu.
Teil einer größeren Plattform
DART ist eine neue Funktion in Vijil Diamond, einem Modul der Vijil-Plattform. Hat DART Schwachstellen gefunden, übernehmen andere Module die Ursachenanalyse, setzen richtliniengesteuerte Leitplanken ein und schlagen Codeänderungen zur Behebung vor.
Jedes Modul lässt sich auch einzeln nutzen. Vijil Discover spürt Agenten im gesamten Unternehmen auf und erstellt einen Fingerabdruck von ihnen, auch von Schatten-KI. Vijil Diamond prüft Agenten vor der Freigabe auf Schwachstellen. Vijil Dome setzt Unternehmensrichtlinien im Produktivbetrieb durch. Vijil Darwin verbessert Agenten fortlaufend, wenn neue Nutzer, Modelle und Angriffsmethoden auftauchen.
Unsere Einschätzung
DART ist ein weiteres Zeichen dafür, dass Sicherheitsanbieter KI-Agenten inzwischen als eigene Angriffsfläche behandeln und nicht mehr als Chatbots mit Extras. Der Fokus auf Werkzeugnutzung, Gedächtnis und mehrstufiges Verhalten trifft genau die Risiken, die zählen, sobald Agenten an echte Daten und Systeme herankommen. Das passt auch zu einem breiteren Trend zu Werkzeugen für agentenbasierte offensive Sicherheit, die mit KI angreifen, bevor Kriminelle es tun.
Für Leser, die Agenten im Produktivbetrieb einsetzen, dürfte der Schritt hin zu Tests innerhalb von CI/CD-Pipelines wichtiger sein als jede einzelne Funktion. Er deutet darauf hin, dass Red-Teaming von einer Prüfung in letzter Minute zu einem Routineschritt werden könnte, was nach jüngsten Erkenntnissen über Lücken bei der Vorbereitung auf Angriffe auf KI-Systeme längst überfällig ist.
Die Benchmark-Zahlen stammen vom Hersteller, unabhängige Tests sollte man also im Auge behalten. Ebenso spannend ist, ob adaptives Red-Teaming für Compliance-Teams zur Standarderwartung wird.
