Ir al contenido principalSaltar al contenido

R^3-Bench: benchmark de razonamiento racional bajo presupuestos compartidos para LLMs | Por qué los modelos de lenguaje fallan al distribuir recursos limitados entre múltiples tareas | Evaluación estándar para medir y mejorar la planificación de tokens, cómputo y presupuesto en agentes basados en LLM

resource-rational reasoningrazonamiento racional con recursosLLM benchmarkevaluación de LLMsshared budgetspresupuestos compartidosplanificación de recursosreasoning under constraintsdistribución óptima de presupuestoagentes autónomos

Abstract

PROBLEMA: los modelos de lenguaje grandes (LLMs) muestran habilidad en razonamiento aislado, pero fallan cuando deben decidir cómo distribuir un presupuesto compartido y limitado —tokens, cómputo, tiempo o dinero— entre varias subtareas, una capacidad esencial para agentes autónomos reales. No existía un instrumento estandarizado para medir este 'razonamiento racional con recursos' (resource-rational reasoning). SOLUCIÓN: R^3-Bench introduce un benchmark específico que evalúa si los LLMs razonan de forma racional bajo presupuestos compartidos, obligándolos a priorizar y asignar recursos de manera óptima en múltiples escenarios con costes y beneficios explícitos. METODOLOGÍA: el benchmark construye tareas donde el modelo debe repartir un presupuesto único entre subtareas con utilidades distintas, incluyendo variantes con información parcial, incertidumbre y restricciones globales; se evalúan modelos de propósito general y modelos entrenados en razonamiento (tipo chain-of-thought) frente a líneas base óptimas calculadas con algoritmos de optimización clásicos. RESULTADOS: los modelos actuales, incluidos los de razonamiento avanzado, presentan déficits sistemáticos en la asignación racional de recursos: tienden a sobre-invertir en tareas fáciles o a agotar el presupuesto antes de cubrir subtareas de alto valor, y la brecha crece con el número de subtareas y la opacidad de los costes. RELEVANCIA: sitúa el razonamiento económico y la planificación de recursos como un frente crítico para agentes LLM desplegados en producción y ofrece un baremo reproducible para medir y mejorar esta capacidad.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies