Evaluar modelos: por qué las tablas comparativas dicen menos de lo que parecen
La contaminación de los conjuntos de prueba y la optimización sobre la métrica erosionan el valor de los rankings
EL PROBLEMA DE LA CONTAMINACIÓN
Un conjunto de evaluación mide capacidad de generalización solo si el modelo no lo ha visto durante el entrenamiento.
Cuando los modelos se entrenan con corpus masivos extraídos de la red, y los conjuntos de evaluación son públicos y están publicados en esa misma red, la separación entre entrenamiento y prueba deja de estar garantizada.
Detectar la contaminación es difícil. Buscar coincidencias literales no basta, porque una pregunta parafraseada o traducida transmite la misma información sin coincidir textualmente. Y los conjuntos de entrenamiento de los modelos comerciales no suelen ser públicos, lo que impide la verificación independiente.
LA LEY DE GOODHART EN ACCIÓN
Existe un principio general aplicable aquí: cuando una medida se convierte en objetivo, deja de ser una buena medida.
Un banco de pruebas que gana prominencia atrae esfuerzo dirigido específicamente a mejorar en él. Ese esfuerzo incluye ajustes legítimos, pero también decisiones que mejoran la puntuación sin mejorar la capacidad subyacente: seleccionar datos de entrenamiento parecidos a los del banco de pruebas, ajustar el formato de respuesta al esperado por el evaluador automático, o elegir hiperparámetros por su rendimiento en la prueba.
Ninguna de estas prácticas es fraude, y todas erosionan la validez de la comparación.
QUÉ MIDEN REALMENTE LAS PRUEBAS
Muchos bancos de pruebas populares consisten en preguntas de opción múltiple. Es un formato cómodo de puntuar automáticamente y que se corresponde mal con la mayoría de los usos reales.
Reconocer la respuesta correcta entre cuatro opciones es una tarea distinta de generar una respuesta desde cero, y mucho más distinta aún de mantener coherencia en una tarea larga, seguir instrucciones complejas o reconocer los límites del propio conocimiento.
Una puntuación alta en pruebas de conocimiento no predice bien el rendimiento en tareas de trabajo real, y esa desconexión es la queja más frecuente entre quienes despliegan estos sistemas.
ALTERNATIVAS CON SUS PROPIOS LÍMITES
Las evaluaciones basadas en preferencias humanas comparando salidas de distintos modelos capturan mejor la utilidad percibida. Introducen, sin embargo, sesgos conocidos: los evaluadores tienden a preferir respuestas más largas, con formato cuidado y tono seguro, con independencia de su exactitud.
Las evaluaciones específicas de dominio, construidas por la organización que va a desplegar el sistema con sus propios casos y sus propios criterios, son las que mejor predicen el rendimiento real. Son también las más costosas y las que no aparecen en ninguna tabla comparativa pública.
CÓMO LEER UN ANUNCIO
Ante una comparativa conviene preguntar quién construyó la prueba, si es pública, cuándo se publicó respecto a la fecha de corte del entrenamiento, y si el formato de la tarea se parece al uso que uno pretende dar al sistema.
En la mayoría de los casos, la respuesta a la última pregunta es que no.
Periódico Digital · https://periodico.dreamlabstech.co/inteligencia-artificial-aplicada/articulo_005.html