Entrenamiento de modelos de lenguaje mRNA en 25 especies por 165 dólares
OpenMed ha construido un pipeline completo de IA para ingeniería de proteínas que integra predicción de estructuras con ESMFold, diseño de secuencias con ProteinMPNN y optimización de codones con modelos de lenguaje entrenados desde cero. Tras comparar arquitecturas de transformadores, CodonRoBERTa-large-v2 destaca con una perplejidad de 4.10 y correlación CAI de 0.40 en E. coli. Escalonaron a 25 especies, entrenando 4 modelos de producción en solo 55 horas-GPU por unos 165 dólares, ofreciendo un sistema condicionado por especie único en open-source. Esto democratiza la optimización de mRNA para vacunas, terapias génicas y producción recombinante, superando métodos tradicionales basados en tablas de frecuencia.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.