ClawGym II: exploración del aprendizaje por refuerzo en caja negra sobre harnesses de agentes | Cómo optimizar agentes LLM con RL sin acceso a gradientes ni al modelo interno | Gimnasio y estudio empírico de algoritmos de RL sin gradientes para mejorar sistemas agénticos completos en producción
Abstract
PROBLEMA: gran parte de los agentes LLM actuales se construyen sobre 'harness' o andamios (orquestación de herramientas, memoria y planificación) cuyo comportamiento interno es opaco; optimizarlos con aprendizaje por refuerzo es difícil porque no siempre existe acceso a gradientes del modelo ni un entorno de entrenamiento diferenciable. SOLUCIÓN: ClawGym II explora el aprendizaje por refuerzo en caja negra (black-box RL) aplicado a un harness de agentes, tratando el sistema completo como una función puntual que solo devuelve recompensas observables, y diseña un gimnasio (harness) donde esos algoritmos pueden ejecutarse a escala. METODOLOGÍA: se construye un entorno tipo Gym sobre el harness del agente, se comparan familias de algoritmos de optimización sin gradientes (búsqueda evolutiva, métodos de diferencia finita y optimización de política en espacio de parámetros) y se analiza cómo la dimensionalidad, la estocasticidad y el coste de muestreo del harness afectan a cada familia. RESULTADOS: el estudio identifica qué algoritmos de RL en caja negra convergen sobre harnesses agénticos, cuántas muestras se requieren según la complejidad del harness y qué configuraciones producen mejoras reales en la tarea final; también documenta modos de fallo típicos como alta varianza, mesetas de rendimiento y sobreexploración. RELEVANCIA: habilita la mejora de agentes LLM mediante RL sin reentrenar el modelo base ni requerir acceso interno, un paso clave hacia el ajuste de sistemas agénticos completos en producción.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.