Ir al contenido principalSaltar al contenido
Hugging Face

Forge: Marco y algoritmo de aprendizaje por refuerzo escalables para agentes

MiniMax presenta Forge, un framework de RL escalable diseñado para agentes complejos que resuelve el trilema entre rendimiento del sistema, estabilidad en el entrenamiento y flexibilidad de agentes. Este sistema soporta el entrenamiento masivo de más de cien mil scaffolds de agentes reales con contextos de hasta 200k tokens, procesando millones de muestras diarias. Integrado con el algoritmo CISPO y un marco de recompensas densas y eficientes, Forge ha impulsado las capacidades del modelo MiniMax M2.5, permitiendo mejoras reales en productividad agentica. La arquitectura modular, optimizaciones como Windowed FIFO y fusión de árboles de prefijos, y soporte para agentes white-box y black-box aseguran escalabilidad y generalización.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

ForgeMiniMaxM2.5aprendizaje por refuerzoagentes IARL escalableCISPO
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies