Estimación de valor marginal de tokens para agentes de deep research eficientes | Cómo decidir cuándo un agente debe dejar de recolectar información y empezar a redactar | Técnica para recortar costes de inferencia en sistemas RAG multi-paso y asistentes de investigación
Abstract
PROBLEMA: Los agentes de deep research ejecutan largas cadenas de búsqueda, lectura y síntesis para producir informes, y una parte sustancial de los tokens que consumen tiene valor marginal casi nulo: recupera información redundante, explora ramas irrelevantes o prolonga la investigación cuando el material esencial ya se ha reunido. Ese sobreconsumo eleva los costes de inferencia y limita la escalabilidad de los agentes autónomos en producción. SOLUCIÓN: El trabajo propone estimar el valor marginal de cada token antes de gastarlo, de modo que el agente decida dinámicamente si continuar con una acción, pasar a la siguiente o detenerse y redactar el informe final. Se introduce un módulo de estimación de valor marginal que puntúa la contribución esperada de cada paso de recolección al resultado, convirtiendo el presupuesto de tokens en una decisión de planificación informada y no en una constante arbitraria. METODOLOGÍA: Los autores entrenan un predictor de valor marginal sobre trayectorias completas de agentes, utilizando como señal supervisada la contribución medida de cada paso al informe final mediante eliminación contrafactual y exactitud de los hechos citados. El predictor se integra en un agente de deep research con búsqueda multi-paso, recuperación RAG y razonamiento encadenado, comparándolo contra agentes con presupuesto fijo y heurísticas de parada. RESULTADOS: El método reduce el consumo de tokens entre un 30% y un 55% frente a presupuestos fijos equivalentes, mantiene la calidad de los informes según métricas de veracidad factual y preferencia humana, y concentra el cómputo en los pasos realmente informativos de la trayectoria. RELEVANCIA: Proporciona una estrategia general de control de costes y decisión de parada para agentes LLM con herramientas, directamente aplicable a sistemas RAG multi-paso, asistentes de investigación y cualquier arquitectura agéntica con presupuesto de inferencia limitado.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.