AI-datadeal Google en Spirit Airlines: Congres waarschuwt
Een groep van 114 Amerikaanse federale wetgevers zet Google en Spirit Airlines onder druk om af te zien van een deal waarbij het techbedrijf een groot archief met interne gegevens van de failliete luchtvaartmaatschappij in handen zou krijgen. Google wil die gegevens gebruiken om AI-modellen te trainen en zou er 10 miljoen dollar voor betalen.
De brief ging donderdag naar de CEO's van beide bedrijven. Het initiatief kwam van afgevaardigde Steven Horsford, een Democraat die een district in Nevada vertegenwoordigt, en senator Elizabeth Warren, een Democraat uit Massachusetts. Volgens de wetgevers zijn de waarborgen die Google heeft beloofd mogelijk niet genoeg om de privacy van voormalige Spirit-medewerkers te beschermen.
Wat er in de dataset zit
Volgens een persbericht van Horsford gaat het bij de voorgenomen verkoop om een enorme hoeveelheid werkcommunicatie en personeelsgegevens. Daaronder vallen:
- ongeveer 100 miljoen e-mails
- zo'n 500 miljoen berichten die zijn verstuurd via Microsoft Teams, het chatplatform voor bedrijven
- arbeidscontracten
- personeelsdossiers en urenregistraties
- salaris- en belastinggegevens
Google heeft gezegd dat de gegevens worden ontdaan van identificerende kenmerken voordat ze worden gebruikt. Het bedrijf verklaarde ook dat het geen persoonsgegevens ontvangt en dat een externe partij het materiaal opschoont voordat het wordt overgedragen.
De wetgevers erkennen die toezeggingen in hun brief, maar zijn nog niet overtuigd. "Hoewel we begrijpen dat Google heeft verklaard geen persoonsgegevens te ontvangen en dat de gegevens voor de overdracht door een derde partij worden opgeschoond, zijn we bezorgd dat gangbare de-identificatiemaatregelen mogelijk niet volstaan om de privacy van werknemers te beschermen in het licht van moderne kunstmatige intelligentie", schreven ze.
Waarom namen weghalen misschien niet genoeg is
De kern van het bezwaar is technisch. Het verwijderen van voor de hand liggende identificatoren maakt een dataset niet automatisch anoniem, staat in de brief.
"Het verwijderen van namen, e-mailadressen of andere directe identificatoren maakt een dataset niet noodzakelijkerwijs anoniem", schreven de wetgevers.
Interne e-mails en chatberichten bevatten veel context. Functies, roosterpatronen, locaties, schrijfstijl en verwijzingen naar collega's kunnen allemaal naar specifieke personen leiden, ook als de namen zijn weggehaald. Salaris-, belasting- en urengegevens voegen daar nog een laag gevoelige details aan toe. De zorg in de brief is dat moderne AI-systemen die op zulk materiaal zijn getraind, dat soort heridentificatie makkelijker kunnen maken.
De werknemers achter de data
De brief heeft ook een lokale kant. Spirit maakte in mei bekend te stoppen. In Las Vegas, dat deels in het district van Horsford ligt, verloren volgens het persbericht bijna 1.000 mensen hun baan bij de luchtvaartmaatschappij.
Het zijn juist die oud-medewerkers wier berichten, contracten en salarisgegevens in de trainingspijplijn van Google zouden belanden. De betaling van 10 miljoen dollar gaat naar de failliete maatschappij, niet naar hen.
Wat de wetgevers vragen
Het belangrijkste verzoek is dat de deal wordt stopgezet. Als Google en Spirit toch doorzetten, willen de wetgevers dat er een aantal voorwaarden gelden. Volgens het persbericht moeten de bedrijven:
- een de-identificatieproces opzetten dat rekening houdt met de inbreng van oud-medewerkers
- zo veel mogelijk werknemersgegevens buiten de overdracht houden
- grenzen stellen aan hoe de gegevens mogen worden gebruikt
- een "onafhankelijke toetsing van de vertrouwelijkheid voor werknemers" uitvoeren
Google reageerde niet direct op een verzoek om commentaar. Omdat Spirit niet meer bestaat, kon er geen perscontact voor de luchtvaartmaatschappij worden gevonden.
Onze analyse
Deze zaak laat zien hoe de jacht op trainingsdata voor AI nieuw terrein betreedt. Openbare webcontent is al op grote schaal binnengehaald, dus interne bedrijfsarchieven van ondernemingen die niet meer bestaan gaan er al snel uitzien als een waardevolle bron. Een failliet of gesloten bedrijf heeft alle reden om te verkopen, en de voormalige medewerkers hebben er weinig over te zeggen.
De twijfels van de wetgevers over de-identificatie zijn niet nieuw. Toezichthouders in Europa hebben al opgetreden tegen gebrekkige anonimisering, zoals bij de boete voor IQVIA over gezondheidsgegevens. Werkmails en chats zijn misschien nog lastiger op te schonen dan gestructureerde gegevens, omdat de identificerende details verstopt zitten in vrije tekst.
De deal past ook in een breder patroon van AI-bedrijven die op zoek zijn naar nieuwe databronnen, van spraakopnames van Claude-gebruikers tot het streven van Google zelf naar verdergaande toegang tot gebruikersbestanden op de desktop. Voor security- en privacyteams is de les dat interne communicatie langer kan bestaan dan het bedrijf dat haar heeft voortgebracht. Het is de moeite waard om in de gaten te houden of Google publiekelijk reageert, of de overdracht doorgaat met de voorwaarden die de wetgevers voorstelden, en of dit leidt tot bredere regels voor de verkoop van personeelsgegevens van verdwenen bedrijven.
