GitHub push protection zet AI in tegen verborgen geheimen
GitHub voegt een AI-classifier toe aan code-pushes om te voorkomen dat ontwikkelaars wachtwoorden en andere inloggegevens in repositories committen. De detector is ontwikkeld samen met Microsoft Applied Sciences en is gebaseerd op ModernBERT.
Het model breidt push protection uit, de GitHub-functie die code op geheimen scant en een push kan blokkeren voordat inloggegevens in de geschiedenis van een repository belanden.
Context in plaats van patronen
Push protection onderschept al veel inloggegevens, omdat die een bekend formaat volgen. Lang niet alle geheimen doen dat. Een databasewachtwoord kan er bijvoorbeeld uitzien als elke willekeurige andere tekenreeks.
De nieuwe classifier kijkt naar de code rondom een verdachte tekenreeks om te bepalen of het om een geheim gaat. Volgens GitHub verwerkt het model batches van mogelijke geheimen in minder dan twee milliseconden. Het bedrijf stelt ook dat het aantal geheimen dat push protection kan tegenhouden daarmee meer dan zou kunnen verdubbelen.
"Push protection grijpt eerder in. Het houdt herkenbare inloggegevens tegen voordat ze in de geschiedenis van de repository terechtkomen, zodat de ontwikkelaar of agent de wijziging kan corrigeren voordat er een lek is dat onderzocht moet worden", schreef Erin Havens, Product Manager bij GitHub.
Snelheid is maar een van de randvoorwaarden. Valse meldingen onderbreken ontwikkelaars en maken de kans kleiner dat ze de volgende waarschuwing serieus nemen. GitHub zegt dat het bij de jacht op geheimen nauwkeurigheid, snelheid, verwerkingscapaciteit en operationele kosten tegen elkaar moet afwegen.
Lekken groeien mee met de hoeveelheid code
Volgens GitHub duikt er ongeveer elke twee seconden een nieuw geheim op in openbaar zichtbare code. Tussen het tweede kwartaal van 2024 en het tweede kwartaal van 2026 groeide het aantal openbare pushes dat het platform controleerde met een factor 2,84. In dezelfde periode nam het aantal pushes met inloggegevens toe met een factor 2,59.
Over die negen kwartalen vond het bedrijf geen statistisch aantoonbare trend in het aandeel pushes met geheimen. Het aantal lekken stijgt dus grofweg in hetzelfde tempo als de hoeveelheid code.
Over alle soorten geheimen die GitHub detecteert, blokkeert push protection ongeveer 30% van de nieuw gedetecteerde geheimen voordat ze de geschiedenis van een repository bereiken. De overige 70% wordt pas ontdekt nadat ze al zijn uitgelekt.
Uitgelekte inloggegevens kunnen iemand toegang geven tot een database, een clouddienst of een ander gekoppeld systeem. Ontwikkelaars moeten ze dan uitschakelen, vervangen en nagaan of er misbruik van is gemaakt. Handmatig intrekken duurt gemiddeld zo'n 40 dagen, en bij ongeveer een op de vijf uitgelekte geheimen duurt het langer dan 90 dagen. Sommige dienstverleners trekken inloggegevens automatisch in zodra GitHub een lek meldt.
Uitrol en prijzen
De uitgebreide push protection is beschikbaar als private preview. Later in oktober wil GitHub de functie openstellen voor organisaties met GitHub Secret Protection op Enterprise Cloud en GitHub Team-abonnementen. De functie verbruikt AI-credits.
Organisaties die al AI-detectie van geheimen gebruiken, worden automatisch overgezet op het nieuwe model. Meldingen uit scans die na een push worden uitgevoerd, blijven zonder extra kosten gedekt door hun bestaande aankoop van secret scanning.
Het model komt ook als public preview beschikbaar in GitHub Enterprise Server 3.23, de zelf gehoste versie van GitHub. Daar levert het door AI gedetecteerde meldingen aan klanten van Secret Protection, ook aan klanten die air-gapped omgevingen draaien.
Daarnaast voegt GitHub de classifier toe aan het /security-review-commando in Copilot CLI en Copilot App. Copilot-gebruikers kunnen dan voor een push op geheimen controleren, ook als hun organisatie geen Secret Protection-abonnement heeft. De verbruikte AI-credits worden in AI usage insights toegeschreven aan GitHub Secret Protection.
Onze analyse
De eigen cijfers van GitHub doen vermoeden dat het echte probleem de timing is. Als 70% van de gedetecteerde geheimen pas na het uitlekken wordt gevonden en het intrekken wekenlang aansleept, kan detectie op het moment voor een push het venster voor aanvallers flink verkleinen. Dat Havens het over "de ontwikkelaar of agent" heeft, zegt veel. Nu AI-tools steeds meer code schrijven en pushen, moeten controles het tempo van die agents kunnen bijhouden, en leveranciers bouwen vergelijkbare vangrails voor AI-codeeragents. Classifiers zijn geen vervanging voor het simpelweg buiten de code houden van inloggegevens, bijvoorbeeld met een speciale secrets manager. Het is de moeite waard om te volgen hoe het aantal valse meldingen in de praktijk uitpakt en of de kosten van AI-credits de adoptie afremmen.
