| Nome: | Descrição: | Tamanho: | Formato: | |
|---|---|---|---|---|
| 3.48 MB | Adobe PDF |
Resumo(s)
A osteoporose representa um problema de saúde pública significativo, associado a fraturas de fragilidade que
resultam em elevada morbilidade, mortalidade e custos económicos. A estratificação de risco tradicional, baseada
em ferramentas como o FRAX, apresenta limitações na sua capacidade preditiva e generalização. Este
trabalho propõe uma metodologia para a análise de dados de saúde em múltiplas instituições, focada na predição
de fraturas osteoporóticas, que garante a reprodutibilidade e a segurança dos dados através da contentorização.
O objetivo principal foi desenvolver e validar uma arquitetura analítica contentorizada (Docker + OMOP-CDM
v5.4), assente no paradigma code-to-data e preparada para implementação federada em múltiplas instituições,
em conformidade com o RGPD. Secundariamente, pretendeu-se implementar, sobre dados sintéticos de alta
fidelidade, um pipeline de modelação preditiva e identificação de perfis de risco de fratura osteoporótica em
adultos ≥50 anos, como prova de conceito para futura aplicação em dados clínicos reais.
Foi desenvolvida uma infraestrutura analítica reprodutível e portátil, assente no paradigma code-to-data, que
permite executar toda a análise de forma padronizada e segura em qualquer instituição de saúde, sem necessidade
de transferência de dados sensíveis.
O pipeline realiza a extração e pré-processamento de dados (formato OMOP-CDM), a modelação preditiva
supervisionada (Random Forest, Gradient Boosting) e a análise de clustering não supervisionado (K-Means)
para identificação de perfis de risco. A metodologia "trazer o código aos dados" (code-to-data) garante que os
dados dos pacientes nunca saem da infraestrutura hospitalar, em conformidade com o RGPD.
O resultado principal é um pacote de análise contentorizado, portátil e reprodutível, que permite a qualquer
instituição com dados no formato OMOP-CDM executar um pipeline de análise de risco de fratura de forma
padronizada. Os modelos de machine learning demonstraram capacidade para identificar fatores de risco complexos,
enquanto o clustering permitiu a segmentação de pacientes em perfis de risco distintos. Validados sobre
dados sintéticos, os modelos de machine learning demonstraram capacidade para identificar fatores de risco
complexos e o clustering permitiu a segmentação em perfis de risco distintos. A arquitetura está preparada para
implementação imediata com dados clínicos reais em ambiente federado.
A metodologia de contentorização demonstrou ser uma solução eficaz e segura para a análise distribuída de
dados de saúde, superando barreiras de privacidade e promovendo a investigação colaborativa. Este trabalho
estabelece uma base técnica robusta para a implementação de estudos multicêntricos e de aprendizagem federada
em Portugal, com potencial para melhorar a estratificação de risco e a prevenção de fraturas osteoporóticas.
Osteoporosis represents a significant public health problem, associated with fragility fractures that result in high morbidity, mortality, and economic burden. Traditional risk stratification, based on tools such as FRAX, has limitations in its predictive capacity and generalisability. This work proposes an innovative methodology for the analysis of health data across multiple institutions, focused on the prediction of osteoporotic fractures, ensuring reproducibility and data security through containerisation. The primary objective was to develop and validate a containerised analytical architecture (Docker + OMOPCDM v5.4), based on the code-to-data paradigm and prepared for federated deployment across multiple institutions, in compliance with GDPR. Secondarily, the aim was to implement, on high-fidelity synthetic data, a predictive modelling and fracture risk profiling pipeline for adults aged ≥50 years, as a proof of concept for future application with real clinical data. A reproducible and portable analytical infrastructure was developed, based on the code-to-data paradigm, enabling standardised and secure execution of the full analysis pipeline at any health institution without the need to transfer sensitive patient data. The pipeline performs data extraction and preprocessing (assuming OMOPCDM format), supervised predictive modelling (Random Forest, Gradient Boosting), and unsupervised clustering analysis (K-Means) for risk profile identification. The code-to-data methodology ensures that patient data never leave the hospital infrastructure, guaranteeing GDPR compliance. The primary output is a containerised, portable, and reproducible analysis package that enables any institution holding data in OMOP-CDM format to run a standardised fracture risk analysis pipeline. Class imbalance (6.4% fracture events) was addressed using SMOTE applied within each cross-validation fold to prevent data leakage. Validated on synthetic data (Synthea), the machine learning models demonstrated the ability to identify complex risk factors, and clustering enabled the segmentation of patients into distinct risk profiles. The architecture is ready for immediate deployment with real clinical data in a federated setting. The containerisation methodology proved to be an effective and secure solution for distributed health data analysis, overcoming privacy barriers and promoting collaborative research. This work establishes a robust technical foundation for the implementation of multicentre studies and federated learning in Portugal, with potential to improve risk stratification and the prevention of osteoporotic fractures.
Osteoporosis represents a significant public health problem, associated with fragility fractures that result in high morbidity, mortality, and economic burden. Traditional risk stratification, based on tools such as FRAX, has limitations in its predictive capacity and generalisability. This work proposes an innovative methodology for the analysis of health data across multiple institutions, focused on the prediction of osteoporotic fractures, ensuring reproducibility and data security through containerisation. The primary objective was to develop and validate a containerised analytical architecture (Docker + OMOPCDM v5.4), based on the code-to-data paradigm and prepared for federated deployment across multiple institutions, in compliance with GDPR. Secondarily, the aim was to implement, on high-fidelity synthetic data, a predictive modelling and fracture risk profiling pipeline for adults aged ≥50 years, as a proof of concept for future application with real clinical data. A reproducible and portable analytical infrastructure was developed, based on the code-to-data paradigm, enabling standardised and secure execution of the full analysis pipeline at any health institution without the need to transfer sensitive patient data. The pipeline performs data extraction and preprocessing (assuming OMOPCDM format), supervised predictive modelling (Random Forest, Gradient Boosting), and unsupervised clustering analysis (K-Means) for risk profile identification. The code-to-data methodology ensures that patient data never leave the hospital infrastructure, guaranteeing GDPR compliance. The primary output is a containerised, portable, and reproducible analysis package that enables any institution holding data in OMOP-CDM format to run a standardised fracture risk analysis pipeline. Class imbalance (6.4% fracture events) was addressed using SMOTE applied within each cross-validation fold to prevent data leakage. Validated on synthetic data (Synthea), the machine learning models demonstrated the ability to identify complex risk factors, and clustering enabled the segmentation of patients into distinct risk profiles. The architecture is ready for immediate deployment with real clinical data in a federated setting. The containerisation methodology proved to be an effective and secure solution for distributed health data analysis, overcoming privacy barriers and promoting collaborative research. This work establishes a robust technical foundation for the implementation of multicentre studies and federated learning in Portugal, with potential to improve risk stratification and the prevention of osteoporotic fractures.
Descrição
Palavras-chave
Osteoporose Risco de fratura Machine learning SMOTE Balanceamento de classes Analise federada Docker Reprodutibilidade científica
