Ir al contenido principalSaltar al contenido
Hugging Face

Del Puente Golden Gate al JSON roto: Por qué el SAE Steering de Anthropic falla para salidas estructuradas

Maziyar Panahi presenta seis experimentos que demuestran cómo el steering de activaciones basado en Sparse Autoencoders (SAE) de Anthropic, exitoso en tareas semánticas como la obsesión con el Puente Golden Gate o la reducción de sesgos, falla completamente en la generación de JSON válido para extracción de PII, bajando del 86,8% al 24,4% de validez. Explica que esta técnica modula dimensiones semánticas continuas pero no puede imponer reglas sintácticas discretas y con estado, como el seguimiento de corchetes o comillas en JSON. La solución efectiva es la decodificación restringida mediante una máquina de estados finitos (FSM), que logra el 100% de JSON válido, combinada con fine-tuning para mantener alta calidad semántica (91,2% F1). Subraya la distinción entre control semántico (steering) y sintáctico (constraints), recomendando herramientas específicas para cada caso en producción.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

AnthropicSAEsteering de activacionesJSON válidodecodificación restringidafine-tuningextracción PII
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies