Récapitulation et examen final
Dix modules pour passer d'une image brute à un système de comptage exportable. Voici le cours condensé en un tableau, puis les trois fils qui le traversent d'un bout à l'autre.
Le cours d'un coup d'œil
| Module | L'essentiel à retenir |
|---|---|
| 1. Trois familles | Classification, détection, segmentation ; le coût d'annotation varie de trois ordres de grandeur |
| 2. R-CNN | Proposer puis classer ; RoI Align remplace RoI Pooling dès qu'on annote fin ou qu'on produit un masque |
| 3. YOLO et SSD | Grille dense en un passage ; RetinaNet et la focal loss règlent le déséquilibre positif contre négatif |
| 4. Ancres et NMS | Deux seuils, confiance et IoU, à régler ensemble ; ne jamais fixer le seuil dans l'évaluation |
| 5. IoU et mAP | mAP@0,5:0,95 est la référence COCO ; lire toujours par classe et par taille avant de conclure |
| 6. U-Net et DeepLab | Connexions de saut pour préserver les détails ; Dice compense le déséquilibre pixel |
| 7. Mask R-CNN | Tête de masque 28 × 28 par proposition ; les instances distinguent deux objets collés, la sémantique non |
| 8. Suivi vidéo | Kalman + IoU + algorithme hongrois ; ByteTrack sauve les détections faibles |
| 9. Annotation | La fuite par images voisines est le piège le plus coûteux : split par vidéo, split temporel, déduplication |
| 10. Projet YOLOv8 | Split temporel, pycocotools officiel, analyse par classe et par taille, export ONNX pour la production |
Les fils qui traversent le cours
Le coût d'annotation dimensionne le projet, pas l'inverse. Un projet qui démarre par « on choisit Mask R-CNN » avant d'avoir estimé le coût d'annotation d'un masque part sur un budget faux. Le module 1 chiffre les ordres de grandeur, le module 9 explique la boucle avec SAM pour diviser ce coût par cinq, le module 10 en tire les conséquences sur la taille du jeu et le nombre d'itérations d'amélioration. La question à se poser avant l'architecture est toujours : combien d'heures d'annotation faut-il pour un jeu utilisable ?
Un chiffre unique de métrique ment presque toujours. La mAP globale cache les classes rares (module 5), l'exactitude pixelwise cache le déséquilibre (module 6), le MOTA cache les échanges d'identifiants (module 8). Le réflexe qui vaut est de découper : mAP par classe et par taille, IoU par classe pour la segmentation, IDF1 en complément du MOTA. Les décisions produit se prennent sur la classe qui compte, pas sur la moyenne du concours.
La fuite entre entraînement et test se paie en production. Elle prend trois formes qui font toutes gonfler la mAP : images voisines dans la vidéo (module 9), seuils réglés sur le test (module 4), et absence de vérification hors distribution (module 10). La combinaison d'un split par source, d'une mAP calculée sur la plage complète de seuils et d'un test sur une caméra inédite est la seule façon de mesurer ce qui restera en production.
Un pipeline vidéo n'est jamais un simple détecteur. L'image par image donne des boîtes ; le comptage exige des identifiants stables (module 8), lesquels exigent un filtre de Kalman qui prédit avant d'apparier, lequel exige un détecteur assez rapide pour laisser du temps au reste. Le budget temps de 40 millisecondes par image à 25 images par seconde structure toutes les décisions, du choix de YOLOv8n au format ONNX quantifié.
L'examen final
L'examen comporte 40 questions couvrant les dix modules : distinction entre classification, détection et segmentation avec choix du format d'annotation, arbitrage entre familles R-CNN et une étape selon la latence, réglage des ancres et de la NMS avec ses deux seuils, calcul d'un IoU à la main et lecture d'un rapport COCO, choix entre entropie croisée et Dice sur un jeu déséquilibré, différence entre segmentation sémantique et d'instances pour le comptage, association détection à piste avec Kalman et algorithme hongrois, prévention de la fuite par images voisines, et pipeline complet du carrefour du jeu à l'export.
Plusieurs questions présentent des situations à diagnostiquer : une mAP gonflée par un split aléatoire, un compteur qui compte cent fois le même véhicule à l'arrêt sur la ligne, une exactitude pixelwise à 95 % avec un IoU par classe à 0,10 sur les piétons, une focal loss qui bloque l'entraînement à un mal choisi, et un modèle qui perd 20 points de mAP en passant d'un carrefour à l'autre. C'est le jugement qui est évalué, pas la mémorisation des signatures d'API.
En cas de réussite, votre attestation d'achèvement est délivrée immédiatement ; son numéro est vérifiable par tout tiers sur la plateforme.
Reprenez le tableau ci-dessus et, pour chaque ligne, demandez-vous « quel symptôme verrais-je si je me trompais ici ? ». Si vous savez expliquer pourquoi une mAP à 0,95 peut cacher un modèle qui ne généralise pas, pourquoi la segmentation sémantique ne permet pas de compter, et pourquoi un piéton perd son identifiant en passant derrière un poteau, vous êtes prêt. Bonne chance !
Examen final
Prêt à valider ce cours ?
40 questions tirées au hasard dans la banque du cours · seuil de réussite 70 % · certificat PDF vérifiable délivré immédiatement en cas de réussite.
Commencer l'examenConnexion à votre compte InSkillML et abonnement actif requis. Vous pouvez aussi lancer l'examen depuis Mes cours.