Del Puente Golden Gate al JSON roto: Por qué el SAE Steering de Anthropic falla para salidas estructuradas
Maziyar Panahi presenta seis experimentos que demuestran cómo el steering de activaciones basado en Sparse Autoencoders (SAE) de Anthropic, exitoso en tareas semánticas como la obsesión con el Puente Golden Gate o la reducción de sesgos, falla completamente en la generación de JSON válido para extracción de PII, bajando del 86,8% al 24,4% de validez. Explica que esta técnica modula dimensiones semánticas continuas pero no puede imponer reglas sintácticas discretas y con estado, como el seguimiento de corchetes o comillas en JSON. La solución efectiva es la decodificación restringida mediante una máquina de estados finitos (FSM), que logra el 100% de JSON válido, combinada con fine-tuning para mantener alta calidad semántica (91,2% F1). Subraya la distinción entre control semántico (steering) y sintáctico (constraints), recomendando herramientas específicas para cada caso en producción.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.