Forge: Marco y algoritmo de RL escalable para agentes
MiniMax presenta Forge, un marco de aprendizaje por refuerzo (RL) escalable diseñado para agentes complejos que resuelve el trilema entre rendimiento del sistema, estabilidad de entrenamiento y flexibilidad de agentes. Este framework soporta el entrenamiento masivo utilizado en el modelo MiniMax M2.5, navegando cientos de miles de scaffolds y entornos reales con contextos de hasta 200k tokens y procesando millones de muestras diarias. Incluye innovaciones como arquitectura de middleware para decoupling, programación híbrida Windowed FIFO, fusión de árboles de prefijos para acelerar entrenamiento y optimizaciones extremas de inferencia. El algoritmo CISPO adaptado, con recompensas densas y conscientes de eficiencia, impulsa mejoras en codificación, uso de herramientas agenticas y flujos de trabajo de oficina. Forge habilita capacidades agenticas eficientes y generalizables en el mundo real, avanzando la misión de 'Inteligencia para todos'.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.