globo_gris_transparente

Protecting Privacy in the Google Search Case

The DOJ proposes data access requirements and privacy protections for Google's personalized AI services, requiring de-identification and prohibiting re-identification. The EU and the FTC also emphasize the importance of privacy in data exchange, although current measures are insufficient in
Shielded database with lock, magnifying glass highlights sensitive data.

The Department of Justice (DOJ) has proposed a series of remedies to restore competition in the search engine market, one of which is a data access requirement that would obligate Google to share its user search data with rivals and potential rivals. The objective is to overcome the scale advantages that give Google an insurmountable edge in providing high-quality search results. To protect user privacy, the DOJ also proposed that Google “make this data available in a way that provides adequate security and privacy safeguards…”.

This data access proposal and its accompanying privacy protections will have to adapt to the rapidly changing nature of the search business. Search is rapidly becoming just one component of artificial intelligence (AI) services. Instead of a standalone service that returns links to user queries, search engines will scan the internet to find answers to questions posed to chatbots. AI agents will also extract the appropriate websites to complete assigned tasks. One of the most notable features of this advanced world of AI services will be an extreme emphasis on personalization. This business model will trigger a race among AI service providers to obtain large amounts of detailed user information, much of which is highly sensitive information about religion, political affiliation, sexual orientation, medical conditions, as well as traditional marketing information such as musical preferences, brand preferences, and fashion favorites.

Detailed Google search histories will be a treasure trove of interest for all companies competing to provide advanced AI services. As a result, the privacy protections proposed by the DOJ to protect user data transferred from Google to Google’s AI competitors must be extraordinarily robust to overcome the natural urge of these AI competitors to fully exploit the data they have been given, not by user consent, but by court order.

In the face of these new privacy risks from AI, the privacy protections proposed by the DOJ are insufficient. They should be expanded to include additional reasonable de-identification requirements, a ban on reidentification attempts, and the inclusion of a privacy expert on the technical committee that administers the antitrust remedies.

The DOJ’s data access proposal would require, among other things, that Google make “available all data that can be obtained from users in the United States, directly through the interaction of a search engine with the user’s device, including the software that runs on that device, automatically.” It also includes the information that Google collects “when responding to commercial queries, local, and mobile queries.” The data must be provided to “any provider of, or potential entrant into the provision of, a general search engine (GSE) or text search advertising in the United States.” These competitors must submit a “sample” of a “plan to invest and compete in these search and advertising markets” and this sample must be “sufficient” as determined by the DOJ in consultation with a technical committee. A qualified competitor should not pose a national security risk, a requirement that seems specifically designed to exclude Chinese AI companies, such as DeepSeek.

The purpose of the data access requirement is to overcome network effects in search engine efficiency. Google, according to the DOJ and the court, has by far the most queries and clicks and has used this advantage to create and maintain an insurmountable edge of quality over its few rivals. Access to data gives these rivals and potential rivals access to high-quality training data that Google currently has in its exclusive possession. Of all the proposed remedies, data access is the most likely to produce a rival with a search engine that can match Google’s and, therefore, attract users from its platform. It is an essential part of an effective remedy to restore competition in search.

European legislators have come to the same conclusion about the need for data access. The Digital Markets Act (DMA) requires that Google provide competitors in search access “to data related to ranking, query, click, and view associated with free and paid search generated by end users on their online search engines.” As the Federal Trade Commission (FTC) notes in its amicus brief in the case, “Given the scope of this data sharing proposal, privacy considerations are critically important.”

To protect user privacy, the DOJ proposes that before the data sets are shared, Google should “use ordinary course techniques to remove any Personally Identifiable Information.” In addition, a qualified competitor must accept regular privacy audits by the technical committee. Google must inform the company receiving the information “of any anonymization or privacy improvement techniques that have been applied.” Before the data sets can be released to competitors, the DOJ, in consultation with the technical committee, must determine that the privacy safeguards are “fully functional.”

En la cara de los servicios de IA personalizados emergentes, las protecciones de privacidad están muy por debajo de lo necesario. Eliminar la información personal no es por sí mismo un método efectivo para desidentificar un conjunto de datos. Podría ser necesario, pero no es suficiente. Además, nada en los remedios propuestos impide que los destinatarios de los datos de búsqueda de usuarios de Google busquen reidentificar los datos desidentificados que reciben. Un requisito para auditorías de privacidad regulares suena reconfortante, pero es un gesto vacío a menos que las obligaciones subyacentes de privacidad sean robustas, algo que les falta en su forma actual.

Los servicios de IA personalizados emergentes, como los chatbots y los agentes de IA, plantean riesgos de privacidad significativos. Los chatbots pueden almacenar información personal y contexto para proporcionar respuestas personalizadas, mientras que los agentes de IA pueden manejar tareas sensibles que involucran datos altamente confidenciales. Por ejemplo, un agente de IA podría ayudar con la gestión de correos electrónicos, calendarios, carteras financieras o decisiones de atención médica. Este nivel de personalización implica un acceso profundo a la información del usuario, lo que aumenta los riesgos de privacidad.

Los competidores de Google en el espacio de IA tendrían un gran interés en acceder a los datos de búsqueda de Google en forma personalizada para mejorar sus servicios de IA. Google ya permite que sus usuarios opten por usar su historial de búsqueda para proporcionarles servicios de chatbot de IA más personalizados. Es probable que extienda esta opción a los usuarios de su próximo servicio de agente de IA. Esto plantea serias preocupaciones de privacidad, ya que permitir que los datos personalizados de los usuarios de Google fluyan libremente a todos los rivales de Google podría agravar aún más los problemas de privacidad.

Para abordar estos problemas, se deben implementar medidas adicionales de privacidad. Primero, se debe requerir una desidentificación razonable de los datos. Esto implica más que simplemente eliminar nombres; debe incluir la introducción de “ruido” (datos sin sentido) en los historiales de búsqueda para reducir el riesgo de reidentificación. Los datos deben pasar una prueba de privacidad diferencial para asegurar que el riesgo de identificar a un individuo en un conjunto de datos de búsqueda de Google sea insignificante. Sin embargo, la anonimización completa, como la exigida por el DMA de la UE, podría destruir cualquier patrón utilizable en el conjunto de datos, lo que dificultaría el desarrollo de un motor de búsqueda alternativo.

En segundo lugar, se debe prohibir cualquier intento de reidentificación de los datos desidentificados. Los competidores de Google solo deben recibir datos de búsqueda de usuarios de Google con la condición de que no intenten reidentificar los datos. Las auditorías de privacidad regulares deben examinar los registros de los competidores de Google para detectar cualquier esfuerzo de reidentificación y, si se encuentra alguno, las sanciones deben incluir la suspensión de los flujos de datos de Google y la destrucción de los registros ya recibidos.

Tercero, el comité técnico que supervisa la implementación de los remedios debe incluir a un experto en privacidad. Este experto debe tener un conocimiento profundo de las prácticas de privacidad y las tecnologías disponibles para desidentificar datos de manera efectiva. La inclusión de un experto en privacidad en el comité técnico ayudará a garantizar que las salvaguardias de privacidad sean robustas y efectivas, mitigando los riesgos de privacidad asociados con la compartición de datos.

Además, es crucial considerar si Google debe tener acceso continuo a los datos personales de sus usuarios. En una fase inicial, el DOJ propuso que Google no debía usar ni retener datos a los que no se puede acceder a los competidores calificados basados en preocupaciones de privacidad o seguridad. Sin embargo, esta propuesta inicial no se incluyó en el remedio final. En cambio, el DOJ permite que Google continúe accediendo y explotando los datos de búsqueda personales de sus propios usuarios, mientras que sus rivales solo pueden acceder a datos desidentificados de los usuarios de Google. Esto crea una asimetría que podría perpetuar el monopolio de búsqueda de Google. Sin embargo, requerir que Google desidentifique sus propios datos de búsqueda y se abstenga de intentos de reidentificación podría degradar los servicios de búsqueda personalizados que muchos usuarios valoran. La solución adecuada es permitir que los competidores accedan a los datos de búsqueda de Google en una forma que sea utilizable para desarrollar sus propios algoritmos de búsqueda, sin revelar la identidad de los usuarios de Google. Esto equilibra la necesidad de restaurar la competencia con la protección de la privacidad de los usuarios.

En resumen, los remedios propuestos por el DOJ deben ampliarse para incluir requisitos de desidentificación razonable, prohibiciones de intentos de reidentificación y la inclusión de un experto en privacidad en el comité técnico. Estas medidas ayudarán a garantizar que los datos de búsqueda de los usuarios de Google se compartan de manera segura y responsable, protegiendo la privacidad de los usuarios mientras se fomenta la competencia en el mercado de motores de búsqueda.

Chatbot, search engine logo, personalization icon in view.