Estudio: Las plataformas que clasifican los últimos LLMs pueden ser poco fiables
Investigadores del MIT han descubierto que las plataformas de clasificación de los últimos modelos de lenguaje grandes (LLMs) pueden ser poco fiables, ya que eliminar una pequeña fracción de datos crowdsourced puede alterar significativamente los resultados de clasificación. Desarrollaron un método eficiente para identificar los votos individuales más influyentes que sesgan las rankings. Tamara Broderick, profesora del MIT, advierte que depender de unos pocos feedbacks puede llevar a elegir el LLM equivocado para aplicaciones empresariales críticas. Este estudio subraya la necesidad de estrategias más robustas para evaluar y mejorar estas plataformas.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.