Sesgo algorítmico: el problema no está en el algoritmo sino en lo que se le pide predecir
Los sistemas reproducen las regularidades de los datos, y esas regularidades incluyen desigualdades históricas
UN EJEMPLO QUE LO EXPLICA TODO
Un sistema diseñado para identificar pacientes que necesitan atención sanitaria adicional utilizó como variable objetivo el gasto sanitario previsto. La elección parecía razonable: quien más gasta, más enfermo está.
El sistema resultó asignar sistemáticamente menor prioridad a pacientes de determinados grupos con igual carga de enfermedad. La razón no estaba en el algoritmo sino en la variable elegida: esos grupos accedían históricamente menos al sistema sanitario y, por tanto, generaban menos gasto con la misma patología.
El modelo aprendió correctamente a predecir gasto. El error fue de diseño: confundir gasto con necesidad.
LAS TRES FUENTES
Este caso ilustra la primera y más común fuente de sesgo: la variable objetivo mal elegida. Lo que interesa medir suele no ser observable, y se sustituye por un indicador correlacionado que arrastra las distorsiones del proceso que lo generó.
La segunda es la muestra de entrenamiento. Un sistema entrenado con datos donde ciertos grupos están infrarrepresentados rendirá peor sobre ellos, simplemente porque ha visto menos ejemplos.
La tercera es el bucle de retroalimentación. Si un sistema de asignación de recursos dirige más inspección a una zona, se detectarán más incidencias allí, lo que confirmará la predicción y reforzará la asignación. El modelo genera los datos que después lo validan.
POR QUÉ ELIMINAR LA VARIABLE NO FUNCIONA
La reacción intuitiva es retirar del modelo los atributos sensibles. Es insuficiente y a veces contraproducente.
En un conjunto de datos con muchas variables, los atributos sensibles suelen ser reconstruibles a partir de otras: código postal, historial de consumo, patrones de navegación. El modelo puede inferirlos implícitamente aunque no los reciba.
Además, sin conocer el atributo resulta imposible medir si el sistema discrimina. Eliminarlo no elimina el sesgo: elimina la capacidad de detectarlo.
LA IMPOSIBILIDAD MATEMÁTICA
Existe un resultado incómodo y bien establecido: varias definiciones razonables de equidad son mutuamente incompatibles salvo en casos degenerados.
Igualar la tasa de acierto entre grupos, igualar la tasa de falsos positivos e igualar el valor predictivo son objetivos que no pueden satisfacerse simultáneamente cuando la prevalencia del fenómeno difiere entre grupos.
Esto significa que no existe una definición técnica neutral de equidad que se pueda implementar sin más. Elegir cuál priorizar es una decisión normativa, no una decisión de ingeniería, y debería tomarse de forma explícita y documentada.
QUÉ HACER
Las prácticas que funcionan son organizativas antes que técnicas: documentar qué predice realmente el sistema y con qué datos se entrenó; auditar el rendimiento desagregado por subgrupos y no solo en agregado; y establecer vías de reclamación para las personas afectadas por una decisión automatizada.
Ninguna requiere un avance algorítmico. Todas requieren decidir que la cuestión importa antes de desplegar el sistema.
Periódico Digital · https://periodico.dreamlabstech.co/inteligencia-artificial-aplicada/articulo_002.html