Forge: Marco y algoritmo de aprendizaje por refuerzo escalables para agentes
MiniMax presenta Forge, un framework de RL escalable diseñado para agentes complejos que resuelve el trilema entre rendimiento del sistema, estabilidad en el entrenamiento y flexibilidad de agentes. Este sistema soporta el entrenamiento masivo de más de cien mil scaffolds de agentes reales con contextos de hasta 200k tokens, procesando millones de muestras diarias. Integrado con el algoritmo CISPO y un marco de recompensas densas y eficientes, Forge ha impulsado las capacidades del modelo MiniMax M2.5, permitiendo mejoras reales en productividad agentica. La arquitectura modular, optimizaciones como Windowed FIFO y fusión de árboles de prefijos, y soporte para agentes white-box y black-box aseguran escalabilidad y generalización.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.