Ir al contenido principalSaltar al contenido
Hugging Face

Del Puente Golden Gate al JSON roto: Por qué el direccionamiento SAE de Anthropic falla en salidas estructuradas

Maziyar Panahi realiza una serie de seis experimentos para aplicar la técnica de direccionamiento de activaciones con Autoencoders Esparsos (SAE) de Anthropic en la generación de JSON válido para extracción de PII en modelos de lenguaje como Qwen2.5-0.5B. Descubre que el direccionamiento no solo no mejora el rendimiento, sino que lo empeora drásticamente, reduciendo la tasa de JSON válido del 86,8% al 24,4% en el modelo base y degradando también los modelos fine-tuneados. La técnica funciona para tareas semánticas continuas como seguridad o sesgos, pero falla en restricciones sintácticas discretas y con estado como la validez JSON. En su lugar, la decodificación restringida con una máquina de estados finitos (FSM) logra el 100% de JSON válido. Esta investigación destaca la importancia de elegir la herramienta adecuada para controlar salidas estructuradas en despliegues de producción de LLMs.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

AnthropicSAEsteeringJSON válidodecodificación restringidaextracción PIIfine-tuning
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies