globo_gris_transparente

Intelligenza Artificiale e valori umani: Domande difficili per un futuro allineato

Si evidenzia l'importanza di allineare l'intelligenza artificiale con valori umani per risultati equi e sicuri. Si propone un approccio di apprendimento attivo per migliorare la sicurezza e l'equità dell'IA, in particolare negli ambienti di cura e online. La collaborazione
Una bilancia a equilibrio con AI e umani diversi in equilibrio.

La inteligencia artificial (IA) ha experimentado una transición rápida desde un concepto especulativo a una realidad omnipresente, profundamente integrada en la vida diaria. Esta transformación ha alterado significativamente la forma en que trabajamos, comunicamos y tomamos decisiones importantes. La IA se utiliza ampliamente en diversas áreas, incluyendo la atención médica, la educación y las industrias creativas. Los líderes de la industria tecnológica han sugerido que la IA podría reemplazar pronto a los roles humanos, incluso aquellos que requieren especialización.

Alineación de la IA

El concepto de alineación de la IA se refiere a garantizar que los sistemas de IA no solo realicen tareas correctamente, sino que también reflejen genuinamente las necesidades, prioridades y valores humanos, tanto en escenarios mundiales como en escenarios específicos. Esta alineación es crucial para que la IA sea segura y justa, particularmente en escenarios que involucran seguridad física y daños en línea. Los valores de alineación pueden variar dependiendo del caso de uso, como la tecnología asistiva en la educación o el apoyo a pacientes en la atención médica. La alineación en seguridad abarca la probabilidad y el impacto del daño, ya sea físico, psicológico, económico o social. Los riesgos residuales deben ser comprendidos, proporcionales y controlables.

Por ejemplo, cuando los robots asisten a personas mayores, la seguridad física puede ser priorizada, mientras que en entornos en línea, la bienestar psicológico puede ser más crítico.

Regulaciones de la IA

A medida que los formuladores de políticas en todo el mundo implementan regulaciones de la IA, como el Acta de la IA de la UE, el Acta básica de la IA de Corea y el Acta de la fuerza laboral del futuro de 2024 en EE. UU., estos valores de alineación pueden variar. Asegurar la alineación de la IA para nuevos escenarios o requisitos específicos es un desafío.

La IA general aprende de datos de entrenamiento, utilizando probabilidades estadísticas para informar sus decisiones. Sin embargo, estas probabilidades pueden no reflejar la alineación en niveles de seguridad requeridos en diferentes escenarios. El mundo real tiene innumerables escenarios posibles, lo que hace que sea poco razonable esperar que la IA aprenda las probabilidades perfectamente para operar en todos los entornos posibles.

Aprendizaje activo

Una forma de abordar este desafío es el aprendizaje activo, que implica reentrenar modelos de IA de manera selectiva para manejar escenarios inciertos o subrepresentados. Este método puede dirigir a los sistemas de IA a corregir su comportamiento mostrando ejemplos donde la IA puede estar fallando. Al identificar y refinar repetidamente estos puntos inciertos en muchas partes de los datos, los modelos pueden reflejar gradualmente las necesidades diversas de las interacciones humanas-AI.

Para explorar más esta idea, se realizaron dos estudios de caso: uno en un entorno de seguridad doméstica con agentes corporales y otro para promover contenido respetuoso en línea. La intención no era solo mejorar el rendimiento del modelo, sino también evaluar si el enfoque podría conducir a alineaciones más seguras y justas para la IA.

El proceso de aprendizaje activo reveló cómo las intervenciones dirigidas por datos pueden ser utilizadas tanto técnicamente como en política para fomentar un ecosistema de IA más saludable, más confiable y mejor alineado.

Desafíos en la distribución de datos

En la vida real, la distribución de datos a menudo es desconocida, lo que hace que sea fácil para una IA general enfrentar situaciones que no fueron entrenadas para y luego fallar de manera inesperada. Al desarrollar estos modelos de IA, es incierto qué debe priorizarse. Como tal, se necesita un método que pueda tomar un modelo de IA y ajustar sus probabilidades aprendidas para tomar en cuenta escenarios nuevos o poco comunes para aplicaciones específicas.

Una forma de abordar esto es cambiar el comportamiento del modelo mostrando muestras a la IA donde puede carecer de representación adecuada. Esto implica seleccionar un modelo de IA para mejorar, con el objetivo de alinearlo en nuevos escenarios. El modelo entra en un ciclo continuo donde genera salida en instancias de diversas regiones de los datos. Un modelo auxiliar detecta instancias donde el modelo es probablemente fallando. Cuando surjan tales instancias, un modelo de lenguaje más poderoso se utiliza para ayudar a etiquetar estas ejemplos desafiantes. Estos ejemplos recién etiquetados se agregan a los datos de entrenamiento, permitiendo que el modelo actualice su conocimiento y mejore con el tiempo. Este enfoque sigue los principios del aprendizaje activo basado en clustering.

Medición de la incertidumbre de la IA

Sin embargo, medir la incertidumbre de un modelo de IA generativo es complejo, ya que puede generar muchos posibles resultados. Para abordar esto, un modelo auxiliar transforma la salida del modelo en una puntuación numérica dependiendo del comportamiento deseado. Este enfoque puede ser útil para formuladores de políticas y otros interesados, quienes pueden ajustar esta puntuación para alinear la IA con valores y principios deseados.

Estudio de caso: seguridad física en entornos domésticos

La seguridad física en entornos domésticos con agentes corporales se examinó en el primer estudio de caso. La IA ya está cambiando la forma en que interactuamos con la tecnología, con taxis autónomos, drones para la entrega de comida y robots que entregan documentos en hospitales. La próxima frontera de la IA es la de agentes multimodales desplegados con agentes corporales. Es probable que en el futuro, los robots nos ayuden en la vida diaria con tareas domésticas como la cocina. Por ejemplo, un robot que ayuda a personas mayores debe priorizar la seguridad del usuario, incluso si la persona mayor es reacia a ello.

Equipar modelos de lenguaje o multimodal grandes con robots puede hacerlos muy capaces. Sin embargo, los modelos de lenguaje, cuando se despliegan con robots asistentes, pueden pasar por alto o no proporcionar respuestas adecuadas en escenarios críticos de seguridad.

Para abordar este problema, se presentó un marco para un sistema de diálogo multimodal, M-CoDAL. M-CoDAL está específicamente diseñado para agentes corporales para comprender y comunicarse mejor en situaciones críticas de seguridad. Para entrenar este sistema, se obtuvieron posibles violaciones de seguridad de una imagen dada. Esto fue seguido por turnos de diálogos entre el usuario y el sistema. Durante el entrenamiento, se utilizó el concepto de aprendizaje activo basado en clustering, empleando un modelo de lenguaje grande externo para identificar instancias informativas. Estas instancias se utilizaron luego para entrenar un modelo de lenguaje más pequeño que mantiene conversaciones sobre la violación de seguridad en la imagen. Los resultados mostraron que cuando se utilizó el aprendizaje activo basado en clustering, la puntuación de seguridad aumentó significativamente, mientras que también mejoraba la puntuación de sentimiento y resolución.

En el segundo estudio de caso, se buscó promover un diálogo más saludable en las redes sociales. El contenido dañino o ofensivo, particularmente en las redes sociales, ha sido una preocupación persistente. Este tipo de contenido incluye el discurso de odio, la acusación o el acoso dirigido a individuos, y la desinformación con posibles consecuencias psicosociales graves. La exposición a este tipo de contenido puede afectar significativamente el bienestar psicológico de adolescentes y jóvenes, llevando a la ansiedad, la angustia existencial o sentimientos de impotencia. Las plataformas de redes sociales han adoptado numerosas medidas para limitar este daño, incluyendo moderadores humanos, notas de comunidad y reescritura de texto para eliminar ofensividad.

Se consideró la tarea de generar “narrativas contrarias”. Las narrativas contrarias son declaraciones que presentan puntos de vista opuestos al contenido ofensivo o dañino. Los estudios anteriores han demostrado que las narrativas contrarias han sido efectivas en la lucha contra el contenido dañino. Para abordar la naturaleza variada de las plataformas de redes sociales con diferentes comunidades, se realizó un experimento para equipar un modelo de lenguaje preentrenado para generar narrativas contrarias en escenarios diversos. El experimento combinó un conjunto de datos de Reddit y un conjunto de datos compilado por trabajadores de ONG. Este conjunto de datos contiene lenguaje ofensivo dirigido a diferentes grupos. Para generar narrativas contrarias para estos textos ofensivos, Flan-T5, un modelo de lenguaje grande instruido con tamaño relativamente pequeño, se fine-tuneó. Los resultados mostraron que el método propuesto tenía una distribución de errores más uniforme, con errores para grupos de baja frecuencia reducidos significativamente. Esto sugiere que un modelo de lenguaje generalista puede ser más efectivamente ajustado para tareas específicas con el enfoque propuesto.

Desarrollos legislativos y de política recientes

A medida que los sistemas de inteligencia artificial se vuelven más profundamente integrados en escenarios de alto riesgo, los desarrollos legislativos y de política recientes subrayan la urgencia de implementar marcos de seguridad de AI concretos. A nivel federal, la Ley de Bajarlo, aprobada en abril de 2025, aborda específicamente los daños causados por deepfakes generados por AI y no consentidos. Requiere a las plataformas que eliminen el contenido reportado dentro de 48 horas, estableciendo responsabilidad por el abuso de AI en espacios digitales. De manera similar, la Ley de la Fuerza Laboral del Futuro de 2024 otorga a agencias como el Departamento de Trabajo y la Fundación Nacional de Ciencia la capacidad de preparar a la fuerza laboral para la disrupción de AI. Apoya programas que reeducan a los trabajadores e integren la alfabetización en AI en la educación temprana, alineándose con el marco propuesto que adapta la AI a dominios específicos de alto riesgo.

A nivel estatal, la Ley de Inteligencia Artificial de Colorado entrará en vigor en febrero de 2026. Exige declaraciones cuando se utiliza AI y prohíbe resultados discriminatorios en decisiones automatizadas. Notablemente, sigue un modelo de riesgo inspirado en la Ley de AI de la UE, ofreciendo un enfoque regulatorio pragmático para una adopción más amplia. En el estado de Nueva York, la Ley de Derechos de Inteligencia Artificial propone protecciones para residentes contra la toma de decisiones automatizadas opacas, reforzando la transparencia y la justicia en sistemas automatizados. Internacionalmente, en mayo de 2024, la UE aprobó su ley de AI de referencia, clasificando los sistemas de AI por nivel de riesgo y imponiendo requisitos estrictos para “aplicaciones de alto riesgo” en la atención médica, el transporte y la aplicación de la ley. En agosto de 2024, estableció un Comité de Seguridad de AI central, exigió transparencia sobre arquitecturas de modelo y datos de entrenamiento, y estableció penas por faltas de seguridad en productos de AI para consumidores. Corea del Sur aprobó la Ley Básica de AI en diciembre de 2024, con disposiciones de riesgo programadas para entrar en vigor en enero de 2026. También exige que los proveedores de AI de ultramar que superen umbrales de ingresos o usuarios designen un representante doméstico para supervisar informes de seguridad y garantizar el cumplimiento con requisitos de confianza. Estos esfuerzos reflejan un creciente consenso internacional de que la alineación de AI debe ser sensible al contexto, transparente, adaptable y alineada con requisitos locales. Tomados en conjunto, las políticas nacionales y la investigación técnica pueden fomentar un ecosistema en el que la AI no solo es poderosa sino también claramente alineada con diferentes experiencias humanas.

I modelli di intelligenza artificiale reformati con dati diversi e loop di feedback.