Destilación on-policy de la señal delta para razonamiento matemático multilingüe en LLMs | Cómo transferir la capacidad de razonamiento de un modelo profesor a un alumno entrenando sobre sus propias trayectorias | Método eficiente para mejorar la precisión matemática de modelos pequeños en idiomas de bajos recursos sin anotaciones humanas
Abstract
PROBLEMA: Los modelos de lenguaje grandes (LLM) sobresalen en razonamiento matemático en inglés, pero su rendimiento cae drásticamente en otros idiomas, y los métodos de destilación estándar (off-policy, de un solo paso) transfieren conocimiento de forma ineficiente, copiando estilos superficiales sin internalizar el razonamiento paso a paso. SOLUCIÓN: El paper propone On-Policy Delta Distillation, un marco de destilación que entrena al modelo alumno sobre sus propias trayectorias (on-policy) y utiliza la delta entre la salida del profesor y la del alumno como señal de aprendizaje, permitiendo corregir errores de razonamiento de forma progresiva y adaptada al idioma objetivo en lugar de imitar respuestas ajenas al estilo del alumno. METODOLOGÍA: Partiendo de un modelo profesor multilingüe, se genera supervisión muestreando respuestas del propio alumno en varios idiomas; se computa una pérdida basada en la divergencia entre distribuciones (deltas de logits/probabilidades) en cada paso de razonamiento; el entrenamiento se realiza sobre corpus de matemáticas multilingües, incluidos idiomas de bajos recursos, con una currícula de dificultad creciente y control de la proporción maestro-alumno. RESULTADOS: El método reporta mejoras consistentes frente a la destilación off-policy estándar y al fine-tuning directo en benchmarks multilingües de razonamiento matemático, con mayor precisión en idiomas poco representados y menor costo de anotación; las ablaciones confirman que las ganancias principales provienen del componente on-policy y de la señal delta, no del volumen de datos. RELEVANCIA: Ofrece una vía eficiente para mejorar el razonamiento de LLMs sin reentrenamiento masivo ni datos anotados por humanos, con implicaciones directas para sistemas RAG multilingües, dominios científicos especializados, lenguas minoritarias y modelos compactos desplegados en producción.