Granite 4.2 de IBM: así se construyen sus nuevos modelos de razonamiento
En este artículo técnico, el equipo de IBM detalla cómo se construyó la familia Granite 4.2, su primera generación de modelos densos de razonamiento, publicada en tres tamaños: 3B, 8B y 30B. Cada modelo se entrena desde cero con unos 15 billones de tokens mediante una estrategia de cinco fases que amplía la ventana de contexto hasta 512K tokens, seguida de un ajuste supervisado sobre datos de razonamiento, cadena de pensamiento y trayectorias agénticas. Sobre esa base se aplica un pipeline multicapa de aprendizaje por refuerzo que incluye un bloque agéntico en los modelos de 8B y 30B, capaces de usar herramientas reales en entornos sandbox. Todos los modelos incluyen modos de pensamiento (thinking/non-thinking), un modo de bajo esfuerzo y llamada de herramientas nativa, y se publican bajo licencia Apache 2.0. El artículo explica con detalle la arquitectura, el entrenamiento, la infraestructura y los resultados en benchmarks de razonamiento y código agéntico.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.