El lenguaje figurado en los LLM: Evaluación y análisis

Marta Ramírez Trives, Elena Lloret, Alba Bonet-Jover

Resumen


Pese a los avances en Procesamiento del Lenguaje Natural (PLN), el lenguaje figurado sigue siendo un reto para los grandes modelos de lenguaje (LLM). En este estudio evaluamos y comparamos el rendimiento de los LLM ChatGPT-4o, DeepSeek-V3, Gemini 2.5 Pro Experimental y Grok 3 Preview en tareas de procesamiento del lenguaje figurado. Basándonos en la teoría del lenguaje figurativo convencional (CFLT) de Dobrovol’skij y Piirainen (2021), compilamos CLUE, un conjunto de datos inglés-español de metáforas, modismos, símiles y proverbios. A partir de él, diseñamos y llevamos a cabo pruebas de detección, interpretación y generación de lenguaje figurado. Los modelos ofrecieron resultados excelentes en detección (0,94) e interpretación (0,91) en ambas lenguas. Sin embargo, exceptuando a Gemini, su rendimiento bajó notablemente en la prueba de generación (0,70), especialmente en español. Concluimos que los LLM son eficaces en tareas de comprensión del lenguaje figurado, pero su capacidad para producirlo es más limitada.

Texto completo:

PDF