C’est quoi le Deep Learning en LCA ?
Le principe de base
L’idée du deep learning, c’est de faire apprendre à une machine à reconnaître des motifs (patterns) à partir d’exemples, plutôt que de lui donner des règles écrites à la main par un humain.
L’architecture : le réseau de neurones
Le modèle est composé de couches de neurones artificiels empilées (d’où le « deep » = profond, car il y a de nombreuses couches). Chaque neurone reçoit des informations, leur applique une pondération (un poids), et transmet le résultat à la couche suivante. Une image (par exemple un scanner) entre par la première couche sous forme de pixels, et ressort en bout de chaîne sous forme d’une prédiction (ex : « hémorragie » ou « pas hémorragie »).
Comment il apprend
Au départ, les poids du réseau sont aléatoires : le modèle prédit n’importe quoi. Pendant l’entraînement sur le training set :
- Le modèle fait une prédiction sur un exemple
- On compare cette prédiction à la vraie réponse (le label)
- L’erreur est calculée, puis « renvoyée » à travers le réseau pour ajuster légèrement les poids de chaque neurone (c’est la rétropropagation du gradient)
- On répète ce cycle des milliers/millions de fois, sur des milliers d’exemples
Petit à petit, le réseau ajuste ses paramètres pour minimiser ses erreurs — un peu comme s’il « apprenait par cœur puis généralisait » à force de voir énormément d’exemples variés.
1. Les 3 échantillons
| Training set | Validation set (interne) | External validation set | |
|---|---|---|---|
| Origine | Même base | Même base/population | Base/population différente de la base du training set |
| Rôle | Le modèle apprend dessus (ajuste ses paramètres) | Évalue la capacité à généraliser sur des patients non vus | Évalue la généralisabilité en conditions réelles différentes (on regarde la validité externe) |
| Piège | — | Data leakage si chevauchement de patients avec le training set | Change souvent de centre, période, machine, population |
Point important : on ajoute parfois un 4e échantillon, le test set, distinct du validation set — utilisé une seule fois, tout à la fin, pour l’évaluation finale (le validation set sert lui à ajuster les hyperparamètres pendant le développement).
2. Overfitting / Underfitting
- Surapprentissage (overfitting) : le modèle « apprend par cœur » le training set (bruit compris), très bonnes performances en apprentissage mais mauvaises en validation → manque de généralisabilité.
- Sous-apprentissage (underfitting) : le modèle est trop simple, performances médiocres même sur le training set.
3. Comment on évalue les performances
- Sensibilité / Spécificité, VPP / VPN, comme pour n’importe quel test diagnostique
- La VPP s’appelle aussi « accuracy » ou précision et la sensibilité « recall ».
- Courbe ROC et AUC : plus l’AUC est proche de 1, meilleure est la capacité discriminante du modèle
- Matrice de confusion : VP, FP, VN, FN
- Calibration : le modèle donne-t-il des probabilités fiables (pas seulement un bon classement) ?
Et le F1 score : moyenne harmonique de la sensibilité et de la VPP. Il évalue l’équilibre entre :
- la sensibilité : parmi les malades, combien sont détectés ?
- la précision = VPP : parmi les tests positifs, combien sont réellement malades ?
4. Biais et limites à connaître
- Biais de sélection : training set non représentatif → moins performant ailleurs
- Biais de référence (biais de mesure du « ground truth) » : étiquetages des données dans l’échantillon d’apprentissage erronée
- Boîte noire : réseaux profonds peu interprétables → enjeu de confiance/explicabilité
- Responsabilité médico-légale : l’IA est une aide à la décision, le médecin reste décisionnaire
- Nécessité d’une validation prospective avant implémentation clinique réelle
