Ir al contenido principalSaltar al contenido

Destilación on-policy de la señal delta para razonamiento matemático multilingüe en LLMs | Cómo transferir la capacidad de razonamiento de un modelo profesor a un alumno entrenando sobre sus propias trayectorias | Método eficiente para mejorar la precisión matemática de modelos pequeños en idiomas de bajos recursos sin anotaciones humanas

knowledge distillationon-policy learningdestilación de conocimientorazonamiento matemáticomultilingual reasoningmodelo alumno-profesordelta distillationrazonamiento paso a paso

Abstract

PROBLEMA: Los modelos de lenguaje grandes (LLM) sobresalen en razonamiento matemático en inglés, pero su rendimiento cae drásticamente en otros idiomas, y los métodos de destilación estándar (off-policy, de un solo paso) transfieren conocimiento de forma ineficiente, copiando estilos superficiales sin internalizar el razonamiento paso a paso. SOLUCIÓN: El paper propone On-Policy Delta Distillation, un marco de destilación que entrena al modelo alumno sobre sus propias trayectorias (on-policy) y utiliza la delta entre la salida del profesor y la del alumno como señal de aprendizaje, permitiendo corregir errores de razonamiento de forma progresiva y adaptada al idioma objetivo en lugar de imitar respuestas ajenas al estilo del alumno. METODOLOGÍA: Partiendo de un modelo profesor multilingüe, se genera supervisión muestreando respuestas del propio alumno en varios idiomas; se computa una pérdida basada en la divergencia entre distribuciones (deltas de logits/probabilidades) en cada paso de razonamiento; el entrenamiento se realiza sobre corpus de matemáticas multilingües, incluidos idiomas de bajos recursos, con una currícula de dificultad creciente y control de la proporción maestro-alumno. RESULTADOS: El método reporta mejoras consistentes frente a la destilación off-policy estándar y al fine-tuning directo en benchmarks multilingües de razonamiento matemático, con mayor precisión en idiomas poco representados y menor costo de anotación; las ablaciones confirman que las ganancias principales provienen del componente on-policy y de la señal delta, no del volumen de datos. RELEVANCIA: Ofrece una vía eficiente para mejorar el razonamiento de LLMs sin reentrenamiento masivo ni datos anotados por humanos, con implicaciones directas para sistemas RAG multilingües, dominios científicos especializados, lenguas minoritarias y modelos compactos desplegados en producción.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies