Saltar al contenido
Inteligencia Artificial Aplicada

Evaluar modelos: por qué las tablas comparativas dicen menos de lo que parecen

La contaminación de los conjuntos de prueba y la optimización sobre la métrica erosionan el valor de los rankings

Dra. Lucía Berenguer, investigadora en aprendizaje automático 2 min de lectura

EL PROBLEMA DE LA CONTAMINACIÓN

Un conjunto de evaluación mide capacidad de generalización solo si el modelo no lo ha visto durante el entrenamiento.

Cuando los modelos se entrenan con corpus masivos extraídos de la red, y los conjuntos de evaluación son públicos y están publicados en esa misma red, la separación entre entrenamiento y prueba deja de estar garantizada.

Detectar la contaminación es difícil. Buscar coincidencias literales no basta, porque una pregunta parafraseada o traducida transmite la misma información sin coincidir textualmente. Y los conjuntos de entrenamiento de los modelos comerciales no suelen ser públicos, lo que impide la verificación independiente.

LA LEY DE GOODHART EN ACCIÓN

Existe un principio general aplicable aquí: cuando una medida se convierte en objetivo, deja de ser una buena medida.

Un banco de pruebas que gana prominencia atrae esfuerzo dirigido específicamente a mejorar en él. Ese esfuerzo incluye ajustes legítimos, pero también decisiones que mejoran la puntuación sin mejorar la capacidad subyacente: seleccionar datos de entrenamiento parecidos a los del banco de pruebas, ajustar el formato de respuesta al esperado por el evaluador automático, o elegir hiperparámetros por su rendimiento en la prueba.

Ninguna de estas prácticas es fraude, y todas erosionan la validez de la comparación.

QUÉ MIDEN REALMENTE LAS PRUEBAS

Muchos bancos de pruebas populares consisten en preguntas de opción múltiple. Es un formato cómodo de puntuar automáticamente y que se corresponde mal con la mayoría de los usos reales.

Reconocer la respuesta correcta entre cuatro opciones es una tarea distinta de generar una respuesta desde cero, y mucho más distinta aún de mantener coherencia en una tarea larga, seguir instrucciones complejas o reconocer los límites del propio conocimiento.

Una puntuación alta en pruebas de conocimiento no predice bien el rendimiento en tareas de trabajo real, y esa desconexión es la queja más frecuente entre quienes despliegan estos sistemas.

ALTERNATIVAS CON SUS PROPIOS LÍMITES

Las evaluaciones basadas en preferencias humanas comparando salidas de distintos modelos capturan mejor la utilidad percibida. Introducen, sin embargo, sesgos conocidos: los evaluadores tienden a preferir respuestas más largas, con formato cuidado y tono seguro, con independencia de su exactitud.

Las evaluaciones específicas de dominio, construidas por la organización que va a desplegar el sistema con sus propios casos y sus propios criterios, son las que mejor predicen el rendimiento real. Son también las más costosas y las que no aparecen en ninguna tabla comparativa pública.

CÓMO LEER UN ANUNCIO

Ante una comparativa conviene preguntar quién construyó la prueba, si es pública, cuándo se publicó respecto a la fecha de corte del entrenamiento, y si el formato de la tarea se parece al uso que uno pretende dar al sistema.

En la mayoría de los casos, la respuesta a la última pregunta es que no.

Periódico Digital · https://periodico.dreamlabstech.co/inteligencia-artificial-aplicada/articulo_005.html

Seguir leyendo en Inteligencia Artificial Aplicada

Inteligencia Artificial Aplicada

Por qué un modelo con 95% de acierto puede ser inútil

Supongamos un sistema que detecta una condición presente en el uno por ciento de los casos. Un modelo que responda siempre «no» acertará el noventa y nueve por ciento de las veces.

Dr. Ismael Carranza, científico de datos2 min de lectura