Konkani LLM: Llevando una lengua de bajo recurso multiescritura a la era de la IA
El proyecto Konkani LLM introduce modelos de lenguaje grandes para el konkani, una lengua india de bajo recurso hablada en Goa y la región de Konkan, que utiliza múltiples escrituras como devanagari, romi y kannada. Han creado el dataset Konkani-Instruct-100k con más de 105.000 muestras generadas sintéticamente mediante Gemini Flash, incluyendo descomposiciones gramaticales y diversidad temática. Afinaron modelos abiertos como Gemma 3, Llama 3.1 y Qwen 2.5 usando LoRA, logrando resultados superiores en el benchmark Konkani-Bench para traducción y transliteración, superando incluso a modelos propietarios como GPT-4. Este esfuerzo busca preservar y digitalizar el konkani mediante herramientas de IA accesibles.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.