OSReward: evaluación estandarizada de reward models para agentes de uso de ordenador multi-plataforma | Cómo medir y comparar de forma justa los modelos de recompensa que guían a los computer-use agents | Benchmark reproducible para saber qué reward model predice mejor el éxito de tarea y detectar sesgos de plataforma
Abstract
PROBLEMA: Los reward models (RM) que guían a los agentes de uso de ordenador (computer use) se entrenan y evalúan con criterios dispares según la plataforma (Windows, macOS, Linux, web), de modo que los resultados no son comparables y no se sabe si un RM predice realmente el éxito de la tarea. SOLUCIÓN: OSReward instituye una evaluación estandarizada y reproducible para reward models cross-platform, definiendo tareas, métricas y protocolos comunes que permiten medir y comparar RM de forma justa entre plataformas y entre modelos. METODOLOGÍA: Construcción de un corpus de evaluación multi-plataforma con trayectorias de agentes de computer use anotadas con preferencias y con éxito real de tarea; se definen métricas unificadas (precisión de preferencia, correlación con éxito, robustez) y se evalúan RM representativos, incluyendo criticadores y RM basados en LLM/VLM. RESULTADOS: El benchmark revela que la precisión de preferencia no siempre correlaciona con el éxito de tarea y que el rendimiento de los RM varía notablemente entre plataformas, estableciendo una referencia que permite comparaciones justas y detecta sesgos de plataforma. RELEVANCIA: La medición fiable de reward models es un pilar del RLHF y del entrenamiento de agentes; un estándar de evaluación acelera el progreso reproducible en sistemas agénticos de computer use.