Ir al contenido principalSaltar al contenido
Hugging Face Blog

Genoma de modelos: identificando si un LLM fue entrenado desde cero o derivado

Este artículo presenta una metodología reproducible para determinar si un modelo de lenguaje grande (LLM) fue entrenado desde cero o derivado de uno existente, utilizando únicamente artefactos públicos. La técnica se basa en la "huella dactilar" del modelo en tres ejes: arquitectura (config.json), tokenizador (superposición de vocabulario) y pesos (CKA de embedding). Se discuten dos trampas comunes: la inutilidad del coseno fila a fila debido a la invarianza rotacional y las limitaciones de CKA para separar claramente el preentrenamiento continuo de un entrenamiento desde cero. Los autores aplicaron esta metodología a modelos de nueve organizaciones coreanas, encontrando resultados variados y ofreciendo un espacio interactivo (Model Genome Korea) para explorarlos. Se enfatiza que construir sobre bases de código abierto es legítimo y que la herramienta reporta el linaje, no acusa de malas prácticas.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

genoma de modelosLLMinteligencia artificialarquitectura de modelostokenizadorCKAHugging FaceModel Genome Korea
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies