Ir al contenido principalSaltar al contenido

Skaling: cuando los exponentes de Chinchilla se encuentran con el acoplamiento de Kaplan | Cómo reconciliar leyes de escalado aparentemente contradictorias en entrenamiento de modelos de lenguaje | Marco unificado para predecir el tamaño óptimo de modelo y datos en el escalado de LLMs

scaling lawsChinchillaKaplancompute-optimalleyes de escaladoacoplamientotamaño óptimo de modeloentrenamiento de LLMspresupuesto de cómputo

Abstract

PROBLEMA: las leyes de escalado clásicas, como las de Kaplan y Chinchilla, ofrecen predicciones distintas e incluso aparentemente incompatibles sobre la asignación óptima de parámetros frente a datos de entrenamiento, generando incertidumbre en la planificación de entrenamientos a gran escala. SOLUCIÓN: Skaling propone un marco que reconcilia los exponentes de Chinchilla con el acoplamiento entre parámetros y datos propuesto por Kaplan, explicando la discrepancia y proporcionando una única ley de escalado unificada que guía la asignación óptima de recursos computacionales. METODOLOGÍA: se analizan las formulaciones teóricas de ambas leyes, se re-derivan sus relaciones mediante análisis de acoplamiento y se validan las predicciones en una batería de entrenamientos empíricos de modelos de lenguaje de distinto tamaño y presupuesto de cómputo. RESULTADOS: el marco unificado reproduce los comportamientos observados en ambos regímenes y ofrece directrices más precisas para elegir el balance entre parámetros y datos dado un presupuesto de cómputo, reduciendo el coste de experimentos de escalado exploratorio. RELEVANCIA: es fundamental para la toma de decisiones en entrenamiento y optimización de LLMs, ya que permite dimensionar de forma más eficiente los recursos antes de iniciar un entrenamiento costoso, un conocimiento crítico para cualquier laboratorio que entrena modelos a gran escala.

Más info: Política de Cookies