R^3-Bench: benchmark de razonamiento racional bajo presupuestos compartidos para LLMs | Por qué los modelos de lenguaje fallan al distribuir recursos limitados entre múltiples tareas | Evaluación estándar para medir y mejorar la planificación de tokens, cómputo y presupuesto en agentes basados en LLM
Abstract
PROBLEMA: los modelos de lenguaje grandes (LLMs) muestran habilidad en razonamiento aislado, pero fallan cuando deben decidir cómo distribuir un presupuesto compartido y limitado —tokens, cómputo, tiempo o dinero— entre varias subtareas, una capacidad esencial para agentes autónomos reales. No existía un instrumento estandarizado para medir este 'razonamiento racional con recursos' (resource-rational reasoning). SOLUCIÓN: R^3-Bench introduce un benchmark específico que evalúa si los LLMs razonan de forma racional bajo presupuestos compartidos, obligándolos a priorizar y asignar recursos de manera óptima en múltiples escenarios con costes y beneficios explícitos. METODOLOGÍA: el benchmark construye tareas donde el modelo debe repartir un presupuesto único entre subtareas con utilidades distintas, incluyendo variantes con información parcial, incertidumbre y restricciones globales; se evalúan modelos de propósito general y modelos entrenados en razonamiento (tipo chain-of-thought) frente a líneas base óptimas calculadas con algoritmos de optimización clásicos. RESULTADOS: los modelos actuales, incluidos los de razonamiento avanzado, presentan déficits sistemáticos en la asignación racional de recursos: tienden a sobre-invertir en tareas fáciles o a agotar el presupuesto antes de cubrir subtareas de alto valor, y la brecha crece con el número de subtareas y la opacidad de los costes. RELEVANCIA: sitúa el razonamiento económico y la planificación de recursos como un frente crítico para agentes LLM desplegados en producción y ofrece un baremo reproducible para medir y mejorar esta capacidad.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.