Genoma de modelos: identificando si un LLM fue entrenado desde cero o derivado
Este artículo presenta una metodología reproducible para determinar si un modelo de lenguaje grande (LLM) fue entrenado desde cero o derivado de uno existente, utilizando únicamente artefactos públicos. La técnica se basa en la "huella dactilar" del modelo en tres ejes: arquitectura (config.json), tokenizador (superposición de vocabulario) y pesos (CKA de embedding). Se discuten dos trampas comunes: la inutilidad del coseno fila a fila debido a la invarianza rotacional y las limitaciones de CKA para separar claramente el preentrenamiento continuo de un entrenamiento desde cero. Los autores aplicaron esta metodología a modelos de nueve organizaciones coreanas, encontrando resultados variados y ofreciendo un espacio interactivo (Model Genome Korea) para explorarlos. Se enfatiza que construir sobre bases de código abierto es legítimo y que la herramienta reporta el linaje, no acusa de malas prácticas.