Ir al contenido principalSaltar al contenido
Hugging Face Blog

FineBooks: ¿son los modelos OCR abiertos lo suficientemente buenos para desbloquear el conocimiento histórico?

La iniciativa FineBooks, una colaboración entre Hugging Face y EleutherAI, busca evaluar si los modelos de reconocimiento óptico de caracteres (OCR) de código abierto actuales son lo suficientemente precisos para digitalizar y analizar colecciones de libros históricos a gran escala. A través de un nuevo tablero de clasificación (leaderboard) para modelos OCR, FineBooks compara el rendimiento de 14 modelos de código abierto en 2.165 páginas de libros históricos transcritas por expertos. El proyecto tiene como objetivo reprocesar grandes colecciones de dominio público, como la Biodiversity Heritage Library (BHL), para mejorar la calidad del texto disponible para el entrenamiento de modelos de IA de código abierto, como Common Pile, con un costo razonable. Los resultados iniciales sugieren que, si bien los modelos son adecuados para el entrenamiento de LLMs, aún enfrentan desafíos con transcripciones académicas y la compatibilidad con formatos heredados de las bibliotecas.

FineBooksOCRmodelos de lenguajeHugging FaceEleutherAIconocimiento históricoBHL
Leer noticia original

Más info: Política de Cookies