Ir al contenido principalSaltar al contenido
Hugging Face

Construyendo Tucano 2: Modelos de lenguaje de código abierto que realmente piensan en portugués

El equipo Polygl0t ha presentado Tucano 2, una familia de modelos de lenguaje de código abierto optimizados específicamente para el portugués, con tamaños desde 0.5B hasta 3.7B parámetros. Han liberado un corpus masivo de 320B tokens (GigaVerbo-v2), datos sintéticos, datasets de fine-tuning supervisado y preferencias, junto con clasificadores para filtrado y un suite de evaluación. Los modelos se entrenaron desde cero y mediante preentrenamiento continuado sobre bases de Qwen3, incorporando un tokenizador personalizado que reduce el cómputo en un 30%. Tucano 2 supera a competidores en benchmarks de razonamiento, matemáticas y codificación en portugués, con variantes Instruct y Think que razonan en portugués. Todo el stack de desarrollo se publica abiertamente bajo licencias permisivas para impulsar la colaboración en IA para lenguas subrepresentadas.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Tucano 2Polygl0tGigaVerbo-v2modelos de lenguajeportuguéscódigo abiertotokenizador
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies