Google, Spirit Airlines y datos para IA: aviso del Congreso

Google, Spirit Airlines y datos para IA: aviso del Congreso

Un grupo de 114 legisladores federales de Estados Unidos está presionando a Google y a Spirit Airlines para que abandonen un acuerdo que pondría en manos de la tecnológica un enorme archivo de datos internos de la desaparecida aerolínea. Google quiere usarlos para entrenar modelos de IA y pagaría 10 millones de dólares.

La carta llegó el jueves a los consejeros delegados de ambas compañías. La encabezan el congresista Steven Horsford, demócrata que representa a un distrito de Nevada, y la senadora Elizabeth Warren, demócrata por Massachusetts. Los legisladores sostienen que las garantías prometidas por Google podrían no bastar para proteger la privacidad de los antiguos empleados de Spirit.

Qué contiene el conjunto de datos

Según un comunicado de prensa de Horsford, la venta propuesta abarca un volumen muy grande de comunicaciones laborales y documentación de recursos humanos. Incluye:

  • unos 100 millones de correos electrónicos
  • alrededor de 500 millones de mensajes enviados a través de Microsoft Teams, la plataforma de chat corporativo
  • contratos de trabajo
  • registros de empleados y de fichajes
  • información de nóminas y fiscal

Google ha asegurado que los datos se desidentificarán antes de utilizarse. También ha afirmado que no recibirá información de identificación personal y que un tercero depurará el material antes de la transferencia.

Los legisladores reconocen esos compromisos en su carta, pero no les convencen. "Aunque entendemos que Google ha declarado que no recibirá información de identificación personal y que los datos pasarán por una depuración a cargo de terceros antes de su transferencia, nos preocupa que las salvaguardas convencionales de desidentificación no sean suficientes para proteger la privacidad de los empleados en el contexto de la inteligencia artificial moderna", escribieron.

Por qué eliminar los nombres puede no bastar

El fondo de la objeción es técnico. Quitar los identificadores evidentes no convierte automáticamente un conjunto de datos en algo anónimo, señala la carta.

"Eliminar nombres, direcciones de correo electrónico u otros identificadores directos no hace necesariamente que un conjunto de datos sea anónimo", escribieron los legisladores.

Los correos y los mensajes de chat internos arrastran mucho contexto. Los puestos de trabajo, los turnos, las ubicaciones, el estilo de escritura y las menciones a compañeros pueden llevar de vuelta a personas concretas, incluso después de borrar los nombres. Los registros de nóminas, fiscales y de fichajes añaden otra capa de detalles sensibles. La preocupación que plantea la carta es que los sistemas de IA modernos entrenados con este tipo de material podrían facilitar esa reidentificación.

Los trabajadores detrás de los datos

La carta tiene también un componente local. Spirit anunció en mayo sus planes de cerrar. En Las Vegas, parte de la cual pertenece al distrito de Horsford, casi 1.000 personas perdieron su empleo en la aerolínea, según el comunicado.

Esos antiguos empleados son las personas cuyos mensajes, contratos y registros salariales acabarían en el proceso de entrenamiento de Google. El pago de 10 millones de dólares iría a parar a la aerolínea quebrada, no a ellos.

Qué piden los legisladores

La petición principal es que se paralice el acuerdo. Si Google y Spirit deciden seguir adelante de todos modos, los legisladores quieren que se cumplan varias condiciones. Según el comunicado, las empresas deberían:

  • diseñar un proceso de desidentificación que tenga en cuenta las opiniones de los antiguos empleados
  • excluir de la transferencia la mayor cantidad posible de información de los empleados
  • fijar límites a cómo pueden utilizarse los datos
  • llevar a cabo una "revisión independiente de la confidencialidad de los empleados"

Google no respondió de inmediato a una solicitud de comentarios. Al haber desaparecido Spirit, no fue posible encontrar ningún contacto de prensa de la aerolínea.

Nuestro análisis

Este caso muestra cómo la búsqueda de datos para entrenar IA se está adentrando en terreno nuevo. El contenido público de la web ya se ha extraído de forma masiva, así que los archivos corporativos internos de empresas que ya no existen empiezan a parecer un recurso valioso. Un negocio en quiebra o cerrado tiene todos los motivos para vender, y su antigua plantilla apenas tiene voz en el asunto.

Las dudas de los legisladores sobre la desidentificación no son nuevas. Los reguladores europeos ya han actuado contra una anonimización deficiente, como se vio en la multa a IQVIA por datos de salud. Los correos y chats laborales pueden ser incluso más difíciles de depurar que los registros estructurados, porque los detalles que identifican a alguien están enterrados en texto libre.

El acuerdo encaja además en una tendencia más amplia de empresas de IA a la caza de nuevas fuentes de datos, desde las grabaciones de voz de usuarios de Claude hasta el propio empeño de Google por lograr un acceso más profundo a los archivos de los usuarios en el escritorio. Para los equipos de seguridad y privacidad, la lección es que las comunicaciones internas pueden sobrevivir a la empresa que las generó. Habrá que estar atentos a si Google responde públicamente, a si la transferencia sigue adelante con las condiciones propuestas por los legisladores y a si esto da pie a normas más amplias sobre la venta de datos de empleados de empresas desaparecidas.