Evaluación de LLM en paridad con producción: un pipeline de reproducción para sustituir modelos de forma segura en agentes conversacionales
El equipo de TechforHumans ha desarrollado un pipeline de reproducción que evalúa modelos de lenguaje en plena paridad operativa con producción, de modo que la única variable del experimento sea el cambio del modelo subyacente (LLM-swap). Sobre un corpus de 106 sesiones sintéticas aprobadas, 20 superaron una revisión manual turno a turno y se convirtieron en la base de referencia (Base 0) para probar ocho modelos reales, entre ellos las familias GPT-4.1, GPT-5 y GPT-5.4, Gemini 2.5 Flash, GPT-OSS-120B y Kimi-K2.5. Solo tres modelos fueron aprobados: GPT-5.4 mini, GPT-5.4 nano y Kimi-K2.5. El hallazgo más relevante es metodológico: la tasa de alucinaciones debe tratarse como un filtro eliminatorio independiente de la puntuación media, porque varios modelos con más del 79% de puntuación fueron rechazados por superar ese umbral de seguridad. Además, el estudio revela patrones de fallo específicos por familia de modelos, como el límite de peticiones HTTP 429 de Kimi-K2.5 o el formato Harmony de GPT-OSS-120B.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.