R^3-Bench: benchmark de razonamiento racional con recursos limitados y presupuestos compartidos | Cómo evaluar la capacidad de los LLMs para repartir un presupuesto limitado entre múltiples tareas | Benchmark para medir si los modelos de lenguaje razonan de forma eficiente bajo restricciones de coste y cómputo
Abstract
PROBLEMA: los modelos de lenguaje grande fallan en el razonamiento racional con recursos limitados, es decir, en decidir cómo repartir un presupuesto compartido (tiempo, cómputo o tokens) entre múltiples subtareas para maximizar el resultado global, una capacidad importante para agentes autónomos. Sin embargo, faltan benchmarks que midan esta habilidad de forma aislada. SOLUCIÓN: introduce R^3-Bench, un benchmark diseñado para evaluar el razonamiento racional bajo presupuestos compartidos, aislando la capacidad de asignar recursos de forma óptima. METODOLOGÍA: construye tareas donde el modelo debe asignar un presupuesto finito entre varias subtareas o decisiones, comparando la asignación resultante con la solución óptima desde la perspectiva de la teoría de la decisión racional. RESULTADOS: muestra que los LLMs tienen dificultades sistemáticas en este tipo de razonamiento, revelando una brecha clara respecto al nivel humano y a soluciones óptimas computadas. RELEVANCIA: clave para agentes y sistemas que deben operar bajo presupuestos limitados de cómputo, tokens o coste, y ofrece una métrica para diagnosticar y mejorar el razonamiento eficiente de los modelos.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.