Files
Download Full Text (2.5 MB)
Description
El entendimiento automático de documentos es una tarea fundamental en el procesamiento del lenguaje natural y la visión por computador, con aplicaciones directas en la digitalización de procesos y la automatización de flujos de trabajo documental. En este contexto, los modelos discriminativos especializados han dominado el estado del arte, mientras que la irrupción de los modelos generativos de tipo visión-lenguaje (VLMs) plantea la pregunta de si estos pueden constituir una alternativa viable sin necesidad de datos anotados específicos. Este trabajo presenta una comparación sistemática entre LayoutLMv3, un modelo discriminativo fine-tuneado sobre el dataset FUNSD, y LFM2.5-VL-450M, un VLM eficiente de 450 millones de parámetros operando en modo zero-shot, en la tarea de clasificación de entidades semánticas en formularios escaneados. La evaluación se realiza sobre 50 documentos en inglés (FUNSD) y 50 en español (XFUND-ES), utilizando un pipeline de evaluación reproducible con entrada compartida basada en las anotaciones ground truth del dataset, lo que elimina la variabilidad introducida por sistemas de OCR externos. Los resultados muestran que LayoutLMv3 supera ampliamente a LFM2.5-VL-450M en todas las condiciones evaluadas: 61,19% de macro F1 en inglés frente a un máximo de 18,69% del modelo generativo, y 39,12% frente a 22,21% en español. El análisis por clase revela que la clase ANSWER es prácticamente irreconocible para el modelo generativo en modo zero-shot, con recalls inferiores al 9% en todas las condiciones. El estudio del efecto de la versión de prompt muestra que la complejidad creciente del prompt no mejora el rendimiento de LFM2.5-VL-450M y produce un colapso casi total de las predicciones hacia la clase OTHER en la versión más compleja. La evaluación cross-lingual revela que LayoutLMv3 se degrada más que LFM al pasar al español, lo que apunta a una posible ventaja relativa del paradigma generativo en escenarios multilingüe sin datos anotados. Los hallazgos confirman que, en tareas de clasificación cerrada con datos anotados disponibles, un modelo discriminativo de menor escala (~125M parámetros) supera a un VLM casi cuatro veces mayor, evidenciando que la especialización mediante fine-tuning tiene mayor impacto sobre el rendimiento que el incremento de parámetros en el modelo generativo.
Publication Date
2026
City
Madrid
Keywords
Entendimiento documental; Modelos discriminativos; Modelos generativos; Vision-language models; Clasificación de entidades; FUNSD; XFUND; Finetuning; Zero-shot; LayoutLMv3; LFM2.5-VL-450M.
Recommended Citation
Palacios Tirado, Alejandro, "Comparación de modelos discriminativos y generativos eficientes para clasificación de entidades en documentos" (2026). Máster en Inteligencia Artificial. 22.
https://sciencevalue.udit.es/tfm_videojuegos_tecnologia/22
