SEPARACIÓN DE DOCUMENTOS POR REPETICIÓN LÉXICA MEDIANTE LA K DE YULE Y K-MEANS: VALIDACIÓN MEDIANTE SIMULACIÓN DE MONTE CARLO
DOI:
https://doi.org/10.51891/rease.v12i9.29935Palabras clave:
K de Yule. K-means. Simulación de Monte Carlo.Resumen
Este trabajo propone y evalúa, mediante simulación de Monte Carlo, una metodología simple para separar documentos textuales en dos grupos, alta repetición léxica y baja repetición léxica, a partir de la K de Yule, una medida clásica de concentración de vocabulario. La metodología consiste en calcular la K de Yule de cada documento de un corpus y aplicar k-means (k = 2) sobre esos valores para particionar el corpus en los dos grupos. Para cada uno de nueve valores fijos de la proporción verdadera (de 0,1 a 0,9), se generaron 500 simulaciones de Monte Carlo en las que el grado de separación léxica entre las dos clases se sortea aleatoriamente en cada repetición, totalizando 4.500 corpus simulados. Los resultados muestran que el método recupera la proporción verdadera con buena precisión en todo el rango de (error absoluto medio de 0,008 y exactitud media de clasificación del 98,9%), pero el error y la variabilidad de la estimación aumentan sistemáticamente en los valores extremos de (cerca de 0,1 o de 0,9), donde la clase minoritaria es pequeña y más sensible a escenarios de baja separación entre las distribuciones de K.
Descargas
Descargas
Publicado
Cómo citar
Número
Sección
Categorías
Licencia
Atribuição CC BY