Más allá de la alineación superficial: la creencia como puerta de entrada a la alineación profunda
La alineación de la IA ha avanzado significativamente, pero se centra principalmente en el control de la salida del modelo ("cómo dice") en lugar de sus creencias internas ("qué cree"). Este artículo propone la "alineación a nivel de creencia", que busca alinear las creencias internas de los modelos de lenguaje grande (LLM) con el mundo real. Se presenta evidencia de que los LLM poseen estructuras de creencia internas, como la codificación lineal de proposiciones verdaderas/falsas y representaciones espacio-temporales. Además, se explora el "Steering" como una forma de manipular estas creencias directamente, aunque todavía presenta desafíos en cuanto a precisión y generalización. El artículo argumenta que la creencia es un componente fundamental para comprender el comportamiento de los LLM y es crucial para el desarrollo de una alineación profunda y robusta de la IA.