Desarrollo de nuevas arquitecturas neuronales en grafos para la inferencia de propiedades de redes biológicas
Inteligencia Computacional Señales y Sistemas
Descripción
Las redes neuronales en grafos (GNNs) han demostrado un rendimiento notable en tareas de clasificación y regresión a nivel de nodo y grafo completo. Sin embargo, las tareas centradas en aristas —donde el objetivo es predecir propiedades asociadas a pares de nodos conectados— han recibido comparativamente menos atención, a pesar de su relevancia en aplicaciones bioinformáticas como la estimación de similaridad molecular, la predicción de interacciones proteína-proteína y la anotación funcional de genes. Las arquitecturas tradicionales de GNNs priorizan la agregación de características de nodos, subutilizando la información contenida en las aristas que conectan entidades biológicas. Esta tesis aborda esta limitación mediante el desarrollo de NEAConv (Node-Edge Attention Convolution), una arquitectura de red neuronal de paso de mensajes específicamente diseñada para tareas centradas en aristas. La contribución principal consiste en un mecanismo de atención que integra simultáneamente características de nodos y aristas mediante una formulación query-key-value inspirada en la arquitectura transformer, permitiendo que el modelo aprenda adaptativamente qué conexiones son más informativas para cada predicción. La arquitectura se complementa con una función de pérdida híbrida que combina aprendizaje supervisado con términos auto-supervisados basados en la similaridad coseno entre embeddings, organizando coherentemente el espacio latente y permitiendo predicciones robustas incluso para entidades con información incompleta o ausente. El desarrollo metodológico siguió una progresión incremental de complejidad. Inicialmente, se estableció una línea base utilizando perceptrones multicapa con codificación one-hot, alcanzando un MAE de 0.081 (RMSE = 0.1019) en la predicción del coeficiente de Tanimoto entre compuestos metabólicos. La incorporación de embeddings topológicos mediante Node2Vec mejoró el rendimiento en un 8.9 % (MAE= 0.074, RMSE = 0.0928), demostrando que la estructura del grafo metabólico contiene información relevante para la similaridad estructural. Finalmente, la arquitectura NEAConv alcanzó un error absoluto medio de 0.01013 (1.01 % de error), representando una mejora del 87.5 % respecto al enfoque inicial. Un hallazgo crítico del proceso de optimización fue que el filtrado selectivo del grafo de entrada —reteniendo únicamente las dos aristas de mayor centralidad (between-ness centrality) por nodo— tuvo un impacto mayor sobre el rendimiento que las decisiones arquitecturales convencionales. Este resultado sugiere que, en redes biológicas anotadas, la curaduría estructural del grafo puede ser tan determinante como la sofisticación del modelo, eliminando ruido proveniente de conexiones de baja confiabilidad. El estudio de ablación demostró que tanto el mecanismo de atención como la función de pérdida híbrida son componentes esenciales con efectos complementarios: el modelo baseline alcanzó MAE = 0.01590, mientras que agregar únicamente atención redujo el error a 0.01523 (mejora del 4.2 %), agregar únicamente pérdida híbrida lo redujo a 0.01426 (mejora del 10.3 %), y el modelo completo alcanzó MAE = 0.01013 (mejora del 36.3 %). La versatilidad de la arquitectura fue validada en dos dominios bioinformáticos adicionales. En predicción de interacciones proteína-proteína, el modelo superó significativamente al estado del arte (test de Friedman p = 7,8 × 10−30) en cinco organismos: HPRD (F1 = 0.977), Human (F1 = 0.961), E. coli (F1 = 0.967), Drosophila (F1 = 0.991) y C. elegans (F1 = 0.985). En anotación funcional con Gene Onto-logy, el modelo igualó el rendimiento del método especializado exp2GO (p = 0,237) mientras superó significativamente a DeepGOPlus y NMF-GO (p = 10−3 ) en tres organismos y tres subontologías. En síntesis, esta tesis demuestra que las tareas centradas en aristas en grafos biológicos se benefician de arquitecturas que integran explícitamente información de nodos y aristas mediante mecanismos de atención, entrenadas con funciones de pérdida híbridas que alinean geométricamente el espacio latente con métricas del dominio. Los principios de diseño desarrollados son transferibles entre dominios bioinformáticos distintos, sugiriendo su potencial aplicabilidad más allá de los contextos específicos evaluados.