Traducción automática: por qué la ambigüedad sigue siendo el problema difícil
Los sistemas actuales traducen con fluidez y fallan cuando la respuesta depende de conocer el mundo
DE LAS REGLAS A LOS DATOS
La traducción automática ha atravesado tres etapas.
Los primeros sistemas codificaban reglas gramaticales y diccionarios bilingües escritos a mano. Producían traducciones rígidas y fallaban ante cualquier construcción no prevista.
Los sistemas estadísticos aprendían correspondencias a partir de grandes corpus de textos ya traducidos, sin comprensión de la gramática. Mejoraron notablemente y producían salidas fragmentarias, cosidas por trozos.
Los sistemas neuronales actuales procesan la frase completa y generan una salida fluida, con una mejora cualitativa evidente en naturalidad.
DÓNDE PERSISTE EL FALLO
La fluidez ha ocultado un problema que no se ha resuelto: la desambiguación que requiere conocimiento del mundo.
El caso clásico es el de las frases donde un pronombre puede referirse a dos antecedentes y la elección correcta depende de saber cómo funcionan las cosas. "Los concejales denegaron el permiso a los manifestantes porque temían la violencia" y "…porque defendían la violencia" exigen asignar el pronombre a sujetos distintos, y la pista no está en la gramática sino en la plausibilidad.
Cuando la lengua de destino obliga a marcar género, número o formalidad donde la de origen no lo hace, el sistema debe decidir con información insuficiente y produce sesgos sistemáticos: profesiones asignadas a un género según su frecuencia en el corpus de entrenamiento.
EL PROBLEMA DE LA COHERENCIA LARGA
Otra limitación es el alcance del contexto. Un traductor humano mantiene coherencia terminológica y de registro a lo largo de un documento completo.
Los sistemas que traducen frase a frase pierden esa consistencia: el mismo término técnico puede recibir traducciones distintas en párrafos sucesivos, y el tratamiento formal o informal puede alternar sin criterio.
Las arquitecturas con ventanas de contexto amplias mitigan el problema sin eliminarlo del todo, especialmente en documentos largos.
LAS LENGUAS CON POCOS RECURSOS
La calidad depende críticamente del volumen de texto paralelo disponible. Para pares de lenguas con abundante material traducido, los resultados son notables.
Para lenguas con escasa presencia escrita —que son la mayoría de las lenguas del mundo— el rendimiento cae drásticamente. Los enfoques multilingües, que entrenan un modelo único sobre muchas lenguas para que transfiera conocimiento entre ellas, han mejorado la situación, y la brecha sigue siendo considerable.
QUÉ SIGNIFICA PARA EL TRADUCTOR HUMANO
La profesión no ha desaparecido: se ha desplazado. El volumen de trabajo de posedición ha crecido, y con él la exigencia de detectar errores que precisamente son difíciles de ver porque el texto suena bien.
Un error de traducción automática rara vez produce una frase agramatical. Produce una frase correcta que dice otra cosa, y localizarla requiere leer el original con atención.
Periódico Digital · https://periodico.dreamlabstech.co/linguistica-y-lenguaje/articulo_003.html