PublicacionesImproving Probabilistic Models In Text Classification Via Active Learning Posted on 22/07/2026 by sociologiaInvestigadoresMitchell BosleySaki KuzushimaTed EnamoradoYuki ShiraitoPublicaciónAmerican Political Science ReviewPalabras clavesClasificación de textoAprendizaje automáticoAprendizaje activoModelos probabilísticosEtiquetado de documentosFecha2024AbstractLos científicos sociales frecuentemente clasifican documentos de texto para utilizar las etiquetas resultantes como resultado o predictor en investigación empírica. La clasificación automatizada de texto se ha convertido en una herramienta estándar ya que requiere menos codificación humana. Sin embargo, los estudiosos aún necesitan muchos documentos etiquetados por humanos para entrenar. Para reducir los costos de etiquetado, proponemos un nuevo algoritmo para clasificación de texto que combina un modelo probabilístico con aprendizaje activo.El modelo probabilístico utiliza tanto datos etiquetados como no etiquetados, y el aprendizaje activo concentra los esfuerzos de etiquetado en documentos difíciles de clasificar. Nuestro estudio de validación muestra que con pocos datos etiquetados, el desempeño de clasificación de nuestro algoritmo es comparable a métodos de última generación con una fracción del costo computacional. Replicamos los resultados de dos artículos publicados utilizando solo una pequeña fracción de los datos etiquetados originales utilizados en esos estudios y proporcionamos software de código abierto para implementar nuestro método. Más información