Google, Spirit Airlines et l'IA : le Congrès met en garde

Google, Spirit Airlines et l'IA : le Congrès met en garde

Un groupe de 114 élus fédéraux américains presse Google et Spirit Airlines de renoncer à un accord qui confierait au géant de la tech une vaste archive de données internes de la compagnie aérienne disparue. Google veut s'en servir pour entraîner des modèles d'IA et paierait 10 millions de dollars.

La lettre a été adressée jeudi aux PDG des deux entreprises. Elle est portée par le représentant Steven Horsford, démocrate élu d'une circonscription du Nevada, et par la sénatrice Elizabeth Warren, démocrate du Massachusetts. Les élus estiment que les garanties promises par Google pourraient ne pas suffire à protéger la vie privée des anciens salariés de Spirit.

Ce que contient le jeu de données

Selon un communiqué de Horsford, la vente envisagée porte sur un volume considérable de communications internes et de documents RH. On y trouve :

  • environ 100 millions d'e-mails
  • quelque 500 millions de messages envoyés via Microsoft Teams, la messagerie interne de l'entreprise
  • des contrats de travail
  • des dossiers du personnel et des relevés d'heures
  • des données de paie et des informations fiscales

Google affirme que les données seront désidentifiées avant toute utilisation. L'entreprise assure aussi qu'elle ne recevra aucune donnée permettant d'identifier une personne et qu'un prestataire tiers nettoiera les données avant le transfert.

Les élus prennent acte de ces engagements dans leur lettre, sans être convaincus pour autant. "Si nous comprenons que Google a déclaré qu'il ne recevra pas d'informations personnelles identifiables et que les données feront l'objet d'un nettoyage par un tiers avant leur transfert, nous craignons que les garde-fous classiques de désidentification ne suffisent pas à protéger la vie privée des salariés dans le contexte de l'intelligence artificielle moderne", écrivent-ils.

Pourquoi supprimer les noms ne suffit pas forcément

Le cœur de l'objection est technique. Retirer les identifiants évidents ne rend pas automatiquement un jeu de données anonyme, souligne la lettre.

"Supprimer les noms, les adresses e-mail ou d'autres identifiants directs ne rend pas nécessairement un jeu de données anonyme", écrivent les élus.

Les e-mails et les messages internes regorgent de contexte. Postes occupés, plannings, lieux de travail, style d'écriture ou mentions de collègues peuvent tous ramener à des personnes précises, même une fois les noms effacés. Les données de paie, les informations fiscales et les relevés d'heures ajoutent une couche supplémentaire de détails sensibles. La crainte exprimée dans la lettre est que des systèmes d'IA modernes entraînés sur ce type de contenu facilitent ce genre de réidentification.

Les salariés derrière les données

La lettre a aussi une dimension locale. Spirit a annoncé en mai son intention de cesser ses activités. À Las Vegas, dont une partie se trouve dans la circonscription de Horsford, près de 1 000 personnes ont perdu leur emploi au sein de la compagnie, selon le communiqué.

Ce sont ces anciens salariés dont les messages, les contrats et les fiches de paie finiraient dans la chaîne d'entraînement de Google. Les 10 millions de dollars iraient à la compagnie en faillite, pas à eux.

Ce que demandent les élus

La demande principale est l'abandon de l'accord. Si Google et Spirit décident malgré tout d'aller de l'avant, les élus veulent que plusieurs conditions soient réunies. Selon le communiqué, les entreprises devraient :

  • mettre en place un processus de désidentification qui tienne compte de l'avis des anciens salariés
  • exclure du transfert autant d'informations sur les salariés que possible
  • encadrer les usages autorisés des données
  • mener un "examen indépendant de la confidentialité des données des salariés"

Google n'a pas répondu dans l'immédiat à une demande de commentaire. Spirit ayant cessé ses activités, aucun contact presse n'a pu être trouvé pour la compagnie.

Notre analyse

Cette affaire montre que la course aux données d'entraînement pour l'IA gagne de nouveaux territoires. Le contenu public du web a déjà été aspiré à grande échelle, si bien que les archives internes d'entreprises qui n'existent plus commencent à ressembler à une ressource précieuse. Une société en faillite ou fermée a tout intérêt à vendre, et ses anciens salariés n'ont guère leur mot à dire.

Les doutes des élus sur la désidentification ne sont pas nouveaux. En Europe, les régulateurs ont déjà sévi contre une anonymisation insuffisante, comme l'a montré l'amende infligée à IQVIA pour des données de santé. Les e-mails et conversations professionnels pourraient être encore plus difficiles à nettoyer que des données structurées, car les détails identifiants sont noyés dans du texte libre.

L'accord s'inscrit aussi dans une tendance plus large : les entreprises d'IA cherchent de nouvelles sources de données, des enregistrements vocaux des utilisateurs de Claude jusqu'à la volonté de Google lui-même d'obtenir un accès plus poussé aux fichiers des utilisateurs sur ordinateur. Pour les équipes sécurité et protection des données, la leçon est que les communications internes peuvent survivre à l'entreprise qui les a produites. Reste à voir si Google réagira publiquement, si le transfert aura lieu avec les conditions proposées par les élus, et si cette affaire débouchera sur des règles plus larges encadrant la vente de données de salariés d'entreprises disparues.