Ir al contenido principalSaltar al contenido

ClawGym II: exploración del aprendizaje por refuerzo en caja negra sobre harnesses de agentes | Cómo optimizar agentes LLM con RL sin acceso a gradientes ni al modelo interno | Gimnasio y estudio empírico de algoritmos de RL sin gradientes para mejorar sistemas agénticos completos en producción

black-box RLaprendizaje por refuerzo en caja negraagent harnessandamiaje agénticoreinforcement learningoptimización sin gradientesagentes LLMbúsqueda evolutivaentrenamiento de agentestool use

Abstract

PROBLEMA: gran parte de los agentes LLM actuales se construyen sobre 'harness' o andamios (orquestación de herramientas, memoria y planificación) cuyo comportamiento interno es opaco; optimizarlos con aprendizaje por refuerzo es difícil porque no siempre existe acceso a gradientes del modelo ni un entorno de entrenamiento diferenciable. SOLUCIÓN: ClawGym II explora el aprendizaje por refuerzo en caja negra (black-box RL) aplicado a un harness de agentes, tratando el sistema completo como una función puntual que solo devuelve recompensas observables, y diseña un gimnasio (harness) donde esos algoritmos pueden ejecutarse a escala. METODOLOGÍA: se construye un entorno tipo Gym sobre el harness del agente, se comparan familias de algoritmos de optimización sin gradientes (búsqueda evolutiva, métodos de diferencia finita y optimización de política en espacio de parámetros) y se analiza cómo la dimensionalidad, la estocasticidad y el coste de muestreo del harness afectan a cada familia. RESULTADOS: el estudio identifica qué algoritmos de RL en caja negra convergen sobre harnesses agénticos, cuántas muestras se requieren según la complejidad del harness y qué configuraciones producen mejoras reales en la tarea final; también documenta modos de fallo típicos como alta varianza, mesetas de rendimiento y sobreexploración. RELEVANCIA: habilita la mejora de agentes LLM mediante RL sin reentrenar el modelo base ni requerir acceso interno, un paso clave hacia el ajuste de sistemas agénticos completos en producción.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies