Ir al contenido principalSaltar al contenido
Hugging Face

Forge: Marco y algoritmo de RL escalable para agentes

MiniMax presenta Forge, un marco de aprendizaje por refuerzo (RL) escalable diseñado para agentes complejos que resuelve el trilema entre rendimiento del sistema, estabilidad de entrenamiento y flexibilidad de agentes. Este framework soporta el entrenamiento masivo utilizado en el modelo MiniMax M2.5, navegando cientos de miles de scaffolds y entornos reales con contextos de hasta 200k tokens y procesando millones de muestras diarias. Incluye innovaciones como arquitectura de middleware para decoupling, programación híbrida Windowed FIFO, fusión de árboles de prefijos para acelerar entrenamiento y optimizaciones extremas de inferencia. El algoritmo CISPO adaptado, con recompensas densas y conscientes de eficiencia, impulsa mejoras en codificación, uso de herramientas agenticas y flujos de trabajo de oficina. Forge habilita capacidades agenticas eficientes y generalizables en el mundo real, avanzando la misión de 'Inteligencia para todos'.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

ForgeMiniMax-AIM2.5RL para agentesCISPOWindowed FIFOPrefix Tree Merging
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies