Carpio Rodríguez, Ana MaríaCarrero López, Víctor ManuelAlcojor Ballesteros, IgnacioValero Márquez, Beatriz2026-07-202026-07-202026https://hdl.handle.net/20.500.14352/138737Este Trabajo de Fin de Grado estudia la aplicación de técnicas de aprendizaje automático supervisado para predecir la anatomía patológica y estratificar el riesgo del cáncer de próstata. Se parte de una base de datos clínica de biopsias de fusión con pocos pacientes, varios nódulos por individuo y un fuerte desbalanceo entre categorías. En primer lugar, se desarrolla un procedimiento de preprocesamiento que transforma la estructura por pacientes en observaciones individuales por nódulo. Se conserva el identificador del paciente y se codifica la localización anatómica mediante tres variables categóricas discretas. La metodología utiliza una arquitectura en cascada formada por dos modelos de bosque aleatorio (Random Forest). El primero predice la anatomía patológica y el segundo estima el grupo de riesgo utilizando las variables clínicas y la predicción anterior. La evaluación se realiza mediante validación cruzada agrupada por paciente, evitando que los nódulos de una misma persona aparezcan en entrenamiento y evaluación. Para tratar el desequilibrio de clases se compararon la ponderación de clases y SMOTE. SMOTE obtuvo mayor exactitud balanceada y F1 ponderado en seis particiones, mientras que la ponderación logró mejor exhaustividad macro en las nueve. Se eligió esta última por su mayor estabilidad y su compatibilidad con variables categóricas. En el análisis exploratorio del umbral, τ = 0,30 alcanzó una sensibilidad de 0,571 y una especificidad de 0,690. El análisis de ablación mostró que la arquitectura en cascada obtuvo resulta dos medios ligeramente superiores al modelo directo, aunque las diferencias fueron pequeñas frente a la variabilidad entre particiones. Finalmente, se implementó una aplicación web con Streamlit que integra el proceso de inferencia. Debido al reducido número de pacientes, al desbalanceo y a la ausencia de validación externa, el sistema debe considerarse un prototipo método lógico y no una herramienta clínica validada.This Bachelor’s Thesis studies the application of supervised machine learning techniques to predict histopathological findings and stratify prostate cancer risk. It is based on a clinical database of fusion biopsies with a small number of patients, several nodules per individual and a strong imbalance between categories. First, a preprocessing procedure is developed to transform the patient-based structure into individual observations for each nodule. The patient identifier is preserved, and the anatomical location is encoded using three discrete categorical variables. The methodology uses a cascade architecture composed of two Random Forest models. The first predicts the histopathological category, while the second estimates the risk group using the clinical variables and the previous prediction. The evaluation is performed through patient-grouped cross-validation, preventing nodules from the same patient from appearing in both the training and evaluation sets. To address class imbalance, class weighting and SMOTE were compared. SMOTE achieved higher balanced accuracy and weighted F1-score in six folds, whereas class weighting obtained a higher macro recall in all nine folds. The latter was selected because of its greater methodological stability and compatibility with categorical variables. In the exploratory threshold analysis, τ = 0.30 achieved a sensitivity of 0.571 and a specificity of 0.690. The ablation analysis showed that the cascade architecture achieved slightly better average results than the direct model, although the differences were small compared with the variability observed across folds. Finally, a web application was implemented using Streamlit to integrate the inference process into a functional interface. Due to the small number of patients, class imbalance and the absence of external validation, the system should be regarded as a methodological prototype rather than a clinically validated tool.spaAttribution-NonCommercial-NoDerivatives 4.0 Internationalhttp://creativecommons.org/licenses/by-nc-nd/4.0/Aprendizaje automático aplicado al seguimiento del cáncer de próstataMachine Learning Applied to Prostate Cancer Monitoringbachelor thesisopen accessAprendizaje automáticoCáncer de próstataBosque aleatorioEstratificación del riesgoBiopsia de fusiónValidación agrupadaMachine learningProstate cancerRandom ForestRisk stratificationFusion biopsyGrouped validationBiomatemáticasMatemáticas (Matemáticas)MedicinaInteligencia artificial (Informática)2404 Biomatemáticas