Por qué un modelo de lenguaje puede escribir bien y equivocarse en aritmética elemental
La arquitectura predice secuencias plausibles; el cálculo exacto exige algo que esa maquinaria no proporciona
QUÉ OPTIMIZA EL ENTRENAMIENTO
Un modelo de lenguaje se entrena para predecir el siguiente elemento de una secuencia dado el contexto previo. Nada en ese objetivo menciona la verdad, la coherencia lógica o la corrección aritmética.
Lo que el sistema aprende es la estructura estadística del texto: qué continuaciones son plausibles. Ocurre que producir texto plausible sobre un tema requiere haber capturado regularidades profundas sobre ese tema, y de ahí la sorprendente competencia del sistema en tareas para las que no fue explícitamente entrenado.
Pero también explica sus fallos característicos, que no son aleatorios sino sistemáticos.
EL PROBLEMA DE LA ARITMÉTICA
Multiplicar dos números de varias cifras es un procedimiento algorítmico: una secuencia determinista de pasos que debe ejecutarse con exactitud, sin margen de aproximación.
Un modelo que predice tokens plausibles no ejecuta ese algoritmo. Produce un resultado que se parece a lo que debería salir, con la magnitud aproximadamente correcta y a menudo los dígitos iniciales acertados. Es un comportamiento de reconocimiento de patrones aplicado a un problema que exige cálculo.
La solución práctica del sector ha sido pragmática: delegar. Dotar al modelo de la capacidad de invocar una calculadora o un intérprete de código convierte el problema de generación en un problema de traducción, que sí está en su terreno.
POR QUÉ LAS FABRICACIONES SUENAN CONVINCENTES
Cuando un modelo inventa una referencia bibliográfica inexistente, no está mintiendo en el sentido habitual: está generando la continuación más plausible dado el contexto.
Una cita falsa tiene el formato correcto, autores verosímiles para el campo, un título coherente con el tema y una revista apropiada. Es exactamente lo que el objetivo de entrenamiento premia.
Esto tiene una implicación práctica importante: la fluidez y la seguridad expresiva no son indicadores de fiabilidad. El sistema produce texto igual de fluido cuando acierta que cuando inventa, porque la fluidez es lo que optimiza.
LO QUE MEJORA Y LO QUE NO
Aumentar la escala del modelo mejora numerosas capacidades, pero no elimina esta clase de errores, porque no derivan de falta de capacidad sino de la naturaleza del objetivo.
Las intervenciones que sí funcionan son de otro tipo. Anclar las respuestas en documentos recuperados en el momento de la consulta reduce la fabricación al restringir la generación a material disponible. Pedir el razonamiento paso a paso mejora tareas de varios pasos, porque permite al modelo usar su propia salida como memoria de trabajo. Y delegar en herramientas externas resuelve las tareas que exigen exactitud.
CÓMO USARLO BIEN
La regla operativa que se deriva de todo esto es sencilla: usar el sistema para tareas donde verificar la respuesta sea más barato que producirla.
Redactar un borrador, resumir un documento disponible, traducir, generar código que se puede ejecutar y comprobar: en todos esos casos el usuario puede evaluar el resultado. Preguntar un dato que no se puede verificar es precisamente el uso donde los fallos son más costosos y menos detectables.
Periódico Digital · https://periodico.dreamlabstech.co/inteligencia-artificial-aplicada/articulo_001.html