Test de estrés tabú a nivel de decodificación para diagnosticar la robustez de los LLM | Cómo evaluar si un modelo de lenguaje puede cumplir restricciones de contenido durante la generación | Benchmark para medir guardrails y control de generación en modelos generativos de texto
Abstract
PROBLEMA: La robustez de los LLM se evalúa habitualmente a nivel de prompt o de dataset, pero apenas se caracteriza sistemáticamente el comportamiento del modelo durante la decodificación cuando se le imponen restricciones online, como evitar determinadas palabras o temas. Estos escenarios tabú aparecen en filtrado de contenido, escritura creativa dirigida y alineación, y revelan fallos que los tests estáticos no detectan. SOLUCIÓN: El paper introduce un test de estrés diagnóstico a nivel de decodificación que somete al modelo a restricciones tabú variables mientras genera, midiendo su capacidad de cumplirlas de forma sostenida sin degradar la fluidez ni la coherencia del texto. METODOLOGÍA: Se construye un benchmark con restricciones de dificultad creciente —léxicas, semánticas y temáticas—, se controla la decodificación mediante máscaras de probabilidad y gramáticas restringidas, y se evalúa un conjunto amplio de modelos abiertos y propietarios de distintos tamaños con métricas de tasa de violación, fluidez y mantenimiento del tópico. RESULTADOS: Los resultados muestran diferencias sustanciales entre modelos: algunos degradan drásticamente la calidad del texto al cumplir las restricciones, otros las violan de forma encubierta, y el test revela correlaciones entre arquitectura, método de entrenamiento y robustez a restricciones que no aparecen en los benchmarks tradicionales de evaluación. RELEVANCIA: Aporta una herramienta diagnóstica para seguridad y control de generación en LLMs, útil para evaluar guardrails, métodos de decodificación restringida y la robustez general de modelos de lenguaje en despliegue.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.