Post-entrenamiento sin referencia de LLMs abiertos para traducción automática multilingüe | Cómo adaptar un modelo abierto a traducción sin pares paralelos anotados mediante autodistilación y preferencias | Método de bajo coste para mejorar capacidades multilingües en idiomas de bajos recursos
Abstract
PROBLEMA: Adaptar un LLM abierto a traducción automática multilingüe suele depender de pares de referencia paralelos y anotaciones humanas, recursos escasos para la mayoría de los idiomas; además, el post-entrenamiento supervisado convencional puede degradar la fluidez y las habilidades generales del modelo. SOLUCIÓN: El trabajo propone un esquema de post-entrenamiento sin referencia que aprovecha las propias capacidades multilingües del modelo abierto: el LLM genera traducciones candidatas, se seleccionan las mejores mediante criterios de consistencia y verificación, y se refuerza la preferencia por ellas, mejorando la traducción sin ningún dato paralelo anotado. METODOLOGÍA: Se combina autodistilación con optimización de preferencias: el modelo traduce hacia y desde un pivote, las hipótesis se filtran mediante puntuaciones de consistencia mutua y verificación de ida y vuelta, y se aplica una optimización de preferencias con las hipótesis seleccionadas como salidas preferidas frente al modelo original. Los experimentos se realizan con LLMs abiertos de varios tamaños y familias de lenguas, incluidos idiomas de bajos recursos. RESULTADOS: El enfoque mejora la calidad de la traducción en varios puntos según métricas automáticas como BLEU y COMET frente al modelo base, rivaliza con post-entrenamientos que usan datos paralelos y conserva mejor las propiedades generales del modelo, reduciendo el coste de datos. RELEVANCIA: Ofrece una vía de bajo coste para adaptar modelos abiertos a multilingüe y a tareas de generación con escasez de datos, de interés para fine-tuning eficiente y optimización por preferencias en entornos con recursos limitados.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.