globo_gris_transparente

AI y valores humanos: Preguntas difíciles para un futuro alineado

Se destaca la importancia de alinear la inteligencia artificial con valores humanos para resultados equitativos y seguros. Un enfoque de aprendizaje activo se propone para mejorar la seguridad y equidad de la IA, especialmente en entornos de cuidado y
Una balanza de equilibrio con inteligencia artificial y humanos diversos en equilibrio.

La inteligencia artificial (IA) ha experimentado un rápido cambio de un concepto especulativo a una realidad omnipresente, profundamente integrada en la vida cotidiana. Este cambio ha alterado significativamente la forma en que trabajamos, comunicamos y tomamos decisiones importantes. La IA se utiliza ampliamente en diversas áreas, incluyendo la atención médica, la educación y las industrias creativas. Los líderes de la industria tecnológica han sugerido que la IA podría reemplazar pronto a los roles humanos, incluso aquellos que requieren especialización. Esta transición plantea preguntas críticas sobre la preparación de la tecnología de IA y su alineación con los valores humanos.

El concepto de alineación de IA se refiere a garantizar que los sistemas de IA no solo realicen tareas correctamente, sino que también reflejen genuinamente las necesidades, prioridades y valores humanos, tanto en escenarios mundiales como en escenarios específicos. Esta alineación es crucial para que la IA sea segura y justa, especialmente en escenarios que involucran seguridad física y daños en línea. Los valores de alineación pueden variar dependiendo del caso de uso, como la tecnología asistiva en la educación o el apoyo a pacientes en la atención médica. La alineación en seguridad abarca la probabilidad y el impacto del daño, ya sea físico, psicológico, económico o social. Los riesgos residuales deben entenderse, ser proporcionales y controlables. Por ejemplo, cuando los robots asisten a personas mayores, la seguridad física puede priorizarse, mientras que en entornos en línea, la bienestar psicológico puede ser más crítico.

Regulaciones de IA a nivel mundial

A medida que los formuladores de políticas en todo el mundo implementan regulaciones de IA, como el Acta de IA de la UE, el Acta básica de IA de Corea y el Acta del Futuro del Trabajo de 2024 en EE. UU., estos valores de alineación pueden variar. Asegurar la alineación de IA para nuevos escenarios o requisitos específicos es un desafío. La IA general aprende de datos de entrenamiento, utilizando probabilidades estadísticas para informar sus decisiones. Sin embargo, estas probabilidades pueden no reflejar la alineación en niveles de seguridad requeridos en diferentes escenarios. El mundo real tiene innumerables escenarios posibles, lo que hace que sea poco razonable esperar que la IA aprenda las probabilidades perfectamente para operar en todos los entornos posibles.

Una aproximación para abordar este desafío es el aprendizaje activo, que implica reentrenar selectivamente modelos de IA para manejar escenarios inciertos o subrepresentados. Este método puede dirigir a los sistemas de IA a corregir su comportamiento mostrando ejemplos donde la IA puede estar fallando. Al identificar y refinar repetidamente estos puntos inciertos en muchas partes de los datos, los modelos pueden reflejar gradualmente las diversas necesidades de las interacciones humanas-IA.

Estudios de caso

Para explorar esta idea más a fondo, se realizaron dos estudios de caso: uno en un entorno de seguridad doméstica con agentes incorporados y otro para promover contenido respetuoso en línea. La intención no solo era mejorar el rendimiento del modelo, sino también evaluar si el enfoque podría conducir a alineaciones más seguras y justas para la IA. El proceso de aprendizaje activo reveló cómo las intervenciones dirigidas por datos pueden ser utilizadas tanto técnicamente como en políticas para fomentar un ecosistema de IA más saludable, más confiable y mejor alineado.

En la vida real, la distribución de los datos a menudo es desconocida, lo que hace que sea fácil para una IA general enfrentar situaciones que no se entrenaron para y luego fallar de manera inesperada. Al desarrollar estos modelos de IA, es incierto qué debe priorizarse. Como tal, se necesita un método que pueda tomar un modelo de IA y ajustar sus probabilidades aprendidas para dar cuenta de escenarios nuevos o poco comunes para aplicaciones específicas. Una aproximación es cambiar el comportamiento del modelo mostrando muestras a la IA donde puede carecer de representación adecuada. Esto implica seleccionar un modelo de IA para mejorar, con el objetivo de alinearlo en nuevos escenarios. El modelo entra en un ciclo continuo donde genera salida en instancias de diversas regiones de los datos. Un modelo auxiliar detecta instancias en las que el modelo es probablemente fallando. Cuando surgen tales instancias, un modelo de lenguaje más poderoso externo se emplea para ayudar a anotar estos ejemplos desafiantes. Estos ejemplos recién etiquetados se agregan a los datos de entrenamiento, permitiendo que el modelo actualice su conocimiento y mejore con el tiempo. Este enfoque sigue los principios del aprendizaje activo basado en clustering.

Sin embargo, medir la incertidumbre de un modelo de IA generativo es complejo, ya que puede generar muchos posibles resultados. Para abordar esto, un modelo auxiliar transforma la salida del modelo en una puntuación numérica dependiendo del comportamiento deseado. Este enfoque puede ser útil para formuladores de políticas y otros interesados, quienes pueden ajustar esta puntuación para alinear la IA con valores y principios deseados.

Aplicaciones de IA en entornos de seguridad

En el primer estudio de caso, se examinó la seguridad física en entornos domésticos con agentes incorporados. La IA ya está cambiando la forma en que interactuamos con la tecnología, con taxis autónomos, drones para la entrega de comida y robots que entregan documentos en hospitales. La próxima frontera de la IA es la de agentes multimodales desplegados con agentes incorporados. Es probable que en el futuro, los robots nos ayuden en la vida cotidiana con tareas domésticas como la cocina. Por ejemplo, un robot que ayuda a personas mayores debe priorizar la seguridad del usuario, incluso si la persona mayor es reacia a ello. Equipar modelos de lenguaje grandes o multimodales con robots puede hacerlos muy capaces. Sin embargo, los modelos de lenguaje, cuando se despliegan con robots asistentes, pueden pasar por alto o no proporcionar respuestas adecuadas en escenarios críticos de seguridad.

Para abordar este desafío, se presentó un marco para un sistema de diálogo multimodal, M-CoDAL. M-CoDAL está específicamente diseñado para agentes corporales para comprender y comunicarse mejor en situaciones críticas de seguridad. Para entrenar este sistema, se obtuvieron violaciones de seguridad potenciales de una imagen dada. Esto fue seguido por turnos de diálogos entre el usuario y el sistema. Durante el entrenamiento, se utilizó el concepto de aprendizaje activo basado en agrupaciones, empleando un modelo de lenguaje grande externo para identificar instancias informativas. Estas instancias se utilizaron luego para entrenar un modelo de lenguaje más pequeño que mantiene conversaciones sobre la violación de seguridad en la imagen. Los resultados mostraron que cuando se utilizó el aprendizaje activo basado en agrupaciones, el puntaje de seguridad aumentó significativamente, mientras que también mejoró el puntaje de sentimiento y resolución.

Segundo estudio de caso: Promoción de un diálogo más saludable en las redes sociales

El contenido dañino o ofensivo, particularmente en las redes sociales, ha sido una preocupación persistente. Este tipo de contenido incluye el discurso de odio, la acusación o el acoso dirigido a individuos, y la desinformación con posibles consecuencias psicosociales graves. La exposición a este tipo de contenido puede afectar significativamente el bienestar psicológico de los adolescentes y los jóvenes, llevando a la ansiedad, el malestar existencial o sentimientos de inutilidad. Las plataformas de redes sociales han adoptado numerosas medidas para limitar este daño, incluyendo moderadores humanos, notas de la comunidad y la paráfrasis del texto para eliminar la ofensividad.

Tarea de generar «narrativas contrarias»

Las narrativas contrarias son declaraciones que presentan puntos de vista opuestos al contenido ofensivo o dañino. Estudios anteriores han demostrado que las narrativas contrarias han sido efectivas en la lucha contra el contenido dañino. Para abordar la naturaleza variada de las plataformas de redes sociales con diferentes comunidades, se realizó un experimento para equipar un modelo de lenguaje preentrenado para generar narrativas contrarias en escenarios diversos. El experimento combinó un conjunto de datos de Reddit y un conjunto de datos compilado por trabajadores de ONG. Este conjunto de datos contiene lenguaje ofensivo dirigido a diferentes grupos. Para generar narrativas contrarias para estos textos ofensivos, se fine-tuneó Flan-T5, un modelo de lenguaje grande con instrucciones ajustadas y relativamente pequeño. Los resultados mostraron que el método propuesto tuvo una distribución de errores más uniforme, con errores para grupos de baja frecuencia reducidos significativamente. Esto sugiere que un modelo de lenguaje generalista puede ser ajustado con mayor efectividad para tareas específicas con el enfoque propuesto.

Desarrollos legislativos y de política recientes

A medida que los sistemas de inteligencia artificial se vuelven más profundamente integrados en escenarios de alto riesgo, los desarrollos legislativos y de política recientes subrayan la urgencia de implementar marcos de seguridad de IA concretos. A nivel federal, la Ley Take It Down, aprobada en abril de 2025, aborda específicamente los daños causados por deepfakes generados por IA y no consentidos. Requiere a las plataformas que eliminen el contenido reportado dentro de 48 horas, estableciendo responsabilidad por el abuso de IA en espacios digitales. De manera similar, la Ley del Trabajo del Futuro de 2024 otorga a agencias como el Departamento de Trabajo y la Fundación Nacional de Ciencia la capacidad de preparar al trabajador para la disrupción de IA. Apoya programas que reeducan a los trabajadores e integren la alfabetización en IA en la educación temprana, alineándose con el marco propuesto que adapta la IA a dominios específicos de alto riesgo.

Desarrollos estatales

A nivel estatal, la Ley de Inteligencia Artificial de Colorado entrará en vigor en febrero de 2026. Exige declaraciones cuando se utiliza IA y prohíbe resultados discriminatorios en decisiones automatizadas. Notablemente, sigue un modelo de riesgo inspirado en la Ley de Inteligencia Artificial de la UE, ofreciendo un enfoque regulatorio pragmático para una adopción más amplia. En el estado de Nueva York, la Ley de Derechos de Inteligencia Artificial propone protecciones residentes contra decisiones automatizadas opacas, reforzando la transparencia y la justicia en sistemas automatizados. Internacionalmente, en mayo de 2024, la UE aprobó su ley de inteligencia artificial de referencia, clasificando los sistemas de IA según su nivel de riesgo y imponiendo requisitos estrictos para aplicaciones de alto riesgo en la atención médica, el transporte y la aplicación de la ley. En agosto de 2024, se estableció un Comité de Seguridad de IA central, exigió transparencia sobre arquitecturas de modelo y datos de entrenamiento, y estableció penas por faltas de seguridad en productos de IA para consumidores. Corea del Sur aprobó la Ley Básica de Inteligencia Artificial en diciembre de 2024, con disposiciones de riesgo programadas para entrar en vigor en enero de 2026. También exige que los proveedores de IA extranjeros que superen los umbrales de ingresos o usuarios designen un representante doméstico para supervisar informes de seguridad y garantizar el cumplimiento con requisitos de confianza. Estos esfuerzos reflejan un creciente consenso internacional de que la alineación de la IA debe ser sensible al contexto, transparente, adaptable y alineada con requisitos locales. Juntos, las políticas nacionales y la investigación técnica pueden fomentar un ecosistema en el que la IA no solo es poderosa, sino también claramente alineada con diferentes experiencias humanas.

Los modelos de inteligencia artificial reentrenados con datos diversos y bucles de retroalimentación.