Ir al contenido principalSaltar al contenido
Hugging Face

Konkani LLM: Llevando una lengua de bajo recurso multiescritura a la era de la IA

El proyecto Konkani LLM introduce modelos de lenguaje grandes para el konkani, una lengua india de bajo recurso hablada en Goa y la región de Konkan, que utiliza múltiples escrituras como devanagari, romi y kannada. Han creado el dataset Konkani-Instruct-100k con más de 105.000 muestras generadas sintéticamente mediante Gemini Flash, incluyendo descomposiciones gramaticales y diversidad temática. Afinaron modelos abiertos como Gemma 3, Llama 3.1 y Qwen 2.5 usando LoRA, logrando resultados superiores en el benchmark Konkani-Bench para traducción y transliteración, superando incluso a modelos propietarios como GPT-4. Este esfuerzo busca preservar y digitalizar el konkani mediante herramientas de IA accesibles.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Konkani LLMKonkani-Instruct-100kidiomas de bajo recursomultiescrituraGemma 3Llama 3.1Qwen 2.5
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies