Towards Qualitative Measurement at Scale: A Prompt-Engineering Framework for Large-Scale Analysis of Deliberative Quality in Parliamentary Debates

Investigadores

Mitchell Bosley

Publicación

Journal of Political Institutions and Political Economy

Palabras claves

Análisis del discurso
Modelos de lenguaje grandes
Inteligencia artificial
Congreso

Fecha

2025

Abstract

Este artículo investiga si los Modelos de Lenguaje Grande (LLMs), guiados por ingeniería de prompts, pueden automatizar el complejo Índice de Calidad del Discurso (DQI) para medir la calidad deliberativa. La evaluación de modelos de última generación de OpenAI y Google variando ejemplos de Aprendizaje en Contexto (ICL) (0–50) muestra que los LLMs logran alta fidelidad, comparable a anotadores humanos basándose en métricas de confiabilidad estándar.

El desempeño mejora notablemente con pocos ejemplos, estabilizándose alrededor de 25–50 ejemplos. Aunque ambos modelos funcionan bien, las diferencias destacan la interacción entre la selección de modelo y la estrategia de ICL. El análisis de errores identifica dimensiones específicas del DQI que requieren mejora adicional, sugiriendo trabajo futuro en prompts de razonamiento avanzado.

Este estudio confirma la viabilidad de los LLMs para escalar la medición del DQI y proporciona orientación práctica sobre optimización de estrategias de ICL. Además, contribuye un pipeline de ingeniería de IA modular y adaptable que investigadores pueden aprovechar para sus propios experimentos de prompting en diversas tareas de medición.

Más información