Bioinformático | Ciencia de Datos aplicada a Genómica | R · Python · SQL · Machine Learning
Máster en Bioinformática (UNIR). Background en ciencias de la salud (Enfermería), enfocado en análisis de datos genómicos, estadística aplicada y modelos de machine learning sobre datos biomédicos.
Contacto: samuelespitia2000@gmail.com · Montería, Colombia
Análisis de diversidad genética y estructura poblacional en cabras Trabajo de Fin de Máster. Pipeline en R (adegenet, poppr, hierfstat, ape) con AMOVA, DAPC, equilibrio de Hardy-Weinberg y árbol filogenético sobre 176 muestras y 13 marcadores microsatélites STR.
Clasificación de expresión génica con Machine Learning Reducción de dimensionalidad (PCA, t-SNE, UMAP), clustering y clasificadores kNN/SVM/Naive Bayes sobre datos de expresión génica de 5 tipos tumorales (AUC > 0.97).
Clasificación de malaria con CNN Red neuronal convolucional (TensorFlow/Keras) para distinguir células infectadas vs. sanas a partir de imágenes de microscopía (90.6% accuracy).
Bioestadística aplicada a expresión génica PCA, clustering, heatmaps y 5 modelos de regresión logística comparados con ROC/AUC y Precision-Recall sobre datos de expresión génica.
Lenguajes: R · Python · SQL · Bash Bioinformática: Biopython, BioPerl, adegenet, poppr, hierfstat, DESeq2, Salmon, QIIME2, PyMOL Machine Learning: Scikit-learn, TensorFlow/Keras, caret Bases de datos: MySQL, MongoDB


