Aller au contenu principal

Vision par ordinateur : comment une machine voit une image

En 2011, faire reconnaître un objet sur une photographie était un problème de recherche ouvert. En 2026, cela tient dans une trentaine de lignes de code et tourne sur un téléphone. Ce cours explique ce qui s'est passé entre les deux, et surtout ce que cela permet réellement aujourd'hui.

Ce que ce cours cherche à faire : vous donner une intuition juste de ce qu'un modèle de vision perçoit, de ce qu'il ne perçoit pas, et de la manière d'estimer la faisabilité d'un projet avant d'y engager du budget.

Ce que ce cours ne fait pas : entraîner un modèle. Le catalogue premium s'en charge, avec jeux de données et notebooks.


Ce que vous allez découvrir


Contenu du cours

#LeçonObjectif principalDurée
1Ce qu'un ordinateur voitDes pixels aux tenseurs, et pourquoi c'est difficile8 min
2La convolutionComment un filtre détecte un motif partout dans l'image9 min
3Les tâches de visionClassification, détection, segmentation, suivi9 min
4Les architecturesResNet, YOLO, U-Net, transformeurs de vision9 min
5Les limitesPrise de vue, biais, attaques adverses, évaluation9 min
6Récapitulatif et FAQSynthèse, glossaire et 12 questions fréquentes6 min
7Quiz et attestationValidez vos acquis avec 5 questions corrigées3 min

Ce cours est-il pour vous ?

  • Vous envisagez un projet de contrôle qualité visuel, de lecture de documents ou de comptage automatique.
  • Vous voulez savoir ce qui est réaliste avant de commander une étude ou de recruter.
  • Vous croisez YOLO, segmentation, mAP et voulez des définitions claires.
  • Vous avez suivi le Deep Learning et voulez approfondir le versant image.

Ce que vous saurez faire à la fin

  • Expliquer ce qu'un modèle reçoit réellement en entrée et pourquoi la variation de prise de vue est le premier ennemi.
  • Décrire la convolution et le partage de poids sans équation.
  • Choisir entre classification, détection et segmentation en connaissant le coût d'annotation de chacune.
  • Nommer les architectures adaptées à un besoin donné.
  • Lire une métrique de vision — mAP, IoU — et repérer une évaluation trompeuse.
  • Anticiper les modes d'échec réels d'un système déployé.

Temps estimé

Environ 45 à 55 minutes de lecture.


Prérequis et suites

Prérequis : Introduction à l'IA et Deep Learning, en particulier la leçon sur les convolutions.

Suite naturelle :

  • IA générative — produire des images plutôt que les analyser
  • MLOps — déployer et surveiller un modèle de vision
  • Éthique de l'IA — reconnaissance faciale et encadrement réglementaire

Questions fréquentes, réponse en une ligne

Faut-il une caméra spéciale ?

Rarement. Une caméra industrielle correcte et un éclairage maîtrisé valent bien mieux qu'un capteur haut de gamme mal éclairé. En contrôle qualité, l'investissement dans l'éclairage et le positionnement est presque toujours plus rentable que l'investissement dans le modèle.

La reconnaissance faciale est-elle légale ?

Cela dépend entièrement de l'usage et du territoire. En Europe, le règlement sur l'intelligence artificielle interdit l'identification biométrique à distance en temps réel dans l'espace public, sauf exceptions très encadrées, et classe la plupart des autres usages biométriques à haut risque. Un projet de ce type se conçoit avec un juriste dès le premier jour.

Peut-on faire tourner un modèle de vision sur un appareil embarqué ?

Oui, c'est même très courant. Des architectures conçues pour cela — familles MobileNet, YOLO compactes — tournent sur téléphone ou carte embarquée en quelques millisecondes. On perd quelques points de précision et on gagne l'absence de latence réseau et la confidentialité des images.

Combien de temps pour un premier prototype ?

Sur une tâche de classification bien définie avec des images déjà disponibles, quelques jours. L'essentiel du délai d'un projet réel ne vient pas du modèle mais de la constitution d'un jeu d'images représentatif et de son annotation.


Envie d'entraîner de vrais modèles de vision ?

Le catalogue premium couvre les réseaux convolutifs, la détection, la segmentation et le déploiement embarqué, avec un certificat vérifiable après un examen de 40 questions. Inclus dans toutes les formules payantes.


Prêt ? Commencez par la leçon 1 →