Ir al contenido principalSaltar al contenido
Hugging Face Blog

Razonamiento sin entrenamiento al 88.89% en GPQA Diamond: Cómo la familia Darwin logró puntuaciones de frontera sin un solo paso de gradiente

La familia Darwin de VIDRAFT propone una nueva forma de desarrollar modelos LLM de razonamiento de nivel de frontera mediante la recombinación de los espacios de pesos de puntos de control existentes, sin necesidad de entrenamiento basado en gradientes. Su modelo insignia, Darwin-28B-Opus, alcanza un 88.89% en GPQA Diamond. La investigación aborda el alto coste del post-entrenamiento de los LLM y presenta tres mecanismos clave: un genoma de fusión adaptable de 14 dimensiones, la fusión MRI-Trust para diagnosticar la contribución de cada capa al razonamiento y un mapeador de arquitectura que permite combinar arquitecturas heterogéneas como Transformer y Mamba. Esto reduce significativamente los costes y demuestra que los espacios de pesos de los LLM de código abierto contienen capacidades latentes sin explotar.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Darwin FamilyDarwin-28B-OpusGPQA DiamondLLMrazonamiento sin entrenamientorecombinación de pesosVIDRAFT
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies