Saltar al contenido
Inteligencia Artificial Aplicada

Datos sintéticos: una herramienta útil con un riesgo poco discutido

Entrenar modelos con salidas de otros modelos ahorra costes y puede degradar progresivamente la calidad

Dr. Íñigo Camarasa, especialista en ética computacional 2 min de lectura

POR QUÉ SE GENERAN

Los datos reales son caros, escasos en dominios especializados y a menudo problemáticos desde el punto de vista de la privacidad o de los derechos.

Generar datos artificialmente resuelve las tres cosas a la vez. Permite crear ejemplos de situaciones raras, equilibrar clases infrarrepresentadas y compartir conjuntos de datos sin exponer información personal.

Estas ventajas son reales y bien demostradas en aplicaciones concretas: escenarios de conducción poco frecuentes, imágenes médicas de patologías raras, transacciones fraudulentas.

EL RIESGO DEL BUCLE

El problema aparece cuando los datos sintéticos generados por un modelo se usan para entrenar la siguiente generación, y así sucesivamente.

Un modelo generativo aprende una aproximación de la distribución real. Al muestrear de esa aproximación se obtienen ejemplos concentrados en las regiones de alta probabilidad, mientras las colas de la distribución quedan infrarrepresentadas.

Si esa muestra se usa para entrenar el modelo siguiente, este aprende una aproximación de la aproximación, con las colas todavía más recortadas. Repetido a lo largo de varias generaciones, el proceso estrecha progresivamente la diversidad hasta que el modelo produce salidas cada vez más homogéneas.

Los experimentos que documentan este fenómeno muestran una degradación que empieza por la pérdida de los casos infrecuentes —justamente los que más interesan— antes de afectar al comportamiento medio, lo que lo hace difícil de detectar con métricas agregadas.

LA CONTAMINACIÓN INVOLUNTARIA

Este riesgo ha dejado de ser hipotético por una razón externa: una fracción creciente del texto e imágenes disponibles públicamente ha sido generada por modelos.

Un conjunto de entrenamiento recopilado de la red incorpora hoy, de forma inevitable, material sintético sin etiquetar como tal. La distinción entre entrenar con datos reales y entrenar con datos sintéticos se difumina, no por decisión de nadie, sino por la composición cambiante del corpus disponible.

QUÉ MITIGA EL PROBLEMA

Las estrategias con respaldo experimental comparten un principio: preservar un ancla de datos reales.

Mezclar datos sintéticos con una proporción sustancial de datos auténticos evita la degeneración en los experimentos publicados. Mantener conjuntos de validación cuya procedencia real esté verificada permite detectar la deriva. Y documentar el origen de los datos —qué fracción es sintética y de qué modelo procede— es la condición previa para poder hacer cualquiera de las dos cosas.

LA IMPLICACIÓN

El valor de los datos genuinamente humanos, verificados y bien documentados no disminuye conforme mejora la generación artificial: aumenta.

Los archivos históricos, los conjuntos de datos científicos con procedencia trazable y los corpus anteriores a la proliferación de contenido generado adquieren un valor que su coste de adquisición original no reflejaba.

Periódico Digital · https://periodico.dreamlabstech.co/inteligencia-artificial-aplicada/articulo_004.html

Seguir leyendo en Inteligencia Artificial Aplicada