Improving Probabilistic Models In Text Classification Via Active Learning

Investigadores

Mitchell Bosley
Saki Kuzushima
Ted Enamorado
Yuki Shiraito

Publicación

American Political Science Review

Palabras claves

Clasificación de texto
Aprendizaje automático
Aprendizaje activo
Modelos probabilísticos
Etiquetado de documentos

Fecha

2024

Abstract

Los científicos sociales frecuentemente clasifican documentos de texto para utilizar las etiquetas resultantes como resultado o predictor en investigación empírica. La clasificación automatizada de texto se ha convertido en una herramienta estándar ya que requiere menos codificación humana. Sin embargo, los estudiosos aún necesitan muchos documentos etiquetados por humanos para entrenar. Para reducir los costos de etiquetado, proponemos un nuevo algoritmo para clasificación de texto que combina un modelo probabilístico con aprendizaje activo.

El modelo probabilístico utiliza tanto datos etiquetados como no etiquetados, y el aprendizaje activo concentra los esfuerzos de etiquetado en documentos difíciles de clasificar. Nuestro estudio de validación muestra que con pocos datos etiquetados, el desempeño de clasificación de nuestro algoritmo es comparable a métodos de última generación con una fracción del costo computacional. Replicamos los resultados de dos artículos publicados utilizando solo una pequeña fracción de los datos etiquetados originales utilizados en esos estudios y proporcionamos software de código abierto para implementar nuestro método.

Más información