Introduction
La vision par ordinateur – Computer Vision en anglais – est l’une des branches les plus spectaculaires de l’intelligence artificielle. Elle donne aux machines la capacité d’interpréter et de comprendre le contenu d’images et de vidéos : reconnaître un visage dans une foule, détecter une tumeur sur un scanner, lire une plaque d’immatriculation ou guider un véhicule autonome.
Définition : qu’est-ce que la Computer Vision ?
La Computer Vision est un domaine de l’IA qui vise à permettre aux machines d’extraire, analyser et comprendre des informations utiles à partir de données visuelles – images fixes, vidéos, flux de caméras*¹. Elle s’appuie principalement sur des réseaux de neurones convolutifs (CNN) pour apprendre à partir de vastes ensembles d’images annotées.
Les grandes tâches de la Computer Vision
La classification d’images
Attribuer à une image une ou plusieurs étiquettes parmi un ensemble de catégories prédéfinies*². Des modèles comme ResNet, VGG et EfficientNet atteignent aujourd’hui des performances supérieures à l’œil humain.
La détection d’objets
La détection d’objets identifie et localise plusieurs objets dans une même image via des boîtes englobantes*². Des architectures comme YOLO (You Only Look Once) permettent cette détection en temps réel.
La segmentation
La segmentation sémantique assigne une étiquette à chaque pixel de l’image. La segmentation d’instances distingue chaque objet individuel au sein d’une même catégorie*². Ces techniques sont essentielles en imagerie médicale et en conduite autonome.
La reconnaissance faciale
La reconnaissance faciale identifie ou vérifie l’identité d’une personne à partir de son visage. Elle est utilisée dans les smartphones (Face ID d’Apple), les systèmes de contrôle d’accès et les postes-frontières.
L’OCR (Reconnaissance Optique de Caractères)
L’OCR extrait et reconnaît du texte dans des images. Des services comme Google Cloud Vision ou Azure Computer Vision offrent ces capacités via API.
Les modèles et architectures clés
- CNN – architecture fondamentale depuis AlexNet (2012)*³.
- Vision Transformers (ViT) – introduits par Google en 2020, ils atteignent des performances état de l’art*⁴.
- YOLO – famille de modèles de détection en temps réel.
- SAM (Segment Anything Model) – publié par Meta AI en 2023.
- CLIP (OpenAI) – associe images et textes pour la recherche visuelle.
Applications concrètes
Médecine et santé
Des systèmes comme DeepMind détectent des maladies oculaires avec une précision comparable à celle des ophtalmologues*¹.
Véhicules autonomes
Tesla Autopilot, Waymo et Mobileye s’appuient sur des algorithmes de Computer Vision pour la conduite autonome.
Commerce et retail
Google Lens permet d’identifier des produits à partir d’une photo. Amazon Go utilise la Computer Vision pour des achats sans caisse.
Agriculture de précision
Des drones analysent l’état des cultures, détectent les maladies des plantes et optimisent l’irrigation.
Limites et enjeux éthiques
- Les biais de représentation : les systèmes de reconnaissance faciale ont des taux d’erreur plus élevés sur les peaux foncées*⁵.
- La vie privée : la prolifération des caméras intelligentes soulève des questions sur la surveillance de masse.
- La robustesse adversariale : des modifications imperceptibles peuvent tromper un réseau de neurones.
Conclusion
La Computer Vision est devenue l’une des technologies les plus déployées au monde. En comprendre les mécanismes et les limites est essentiel pour en faire un usage éclairé, qu’on soit utilisateur, décideur ou citoyen.
Pour aller plus loin
Types d’IA connexes
- Le Deep Learning – les réseaux convolutifs (CNN) qui permettent la vision par ordinateur.
- L’IA multimodale – l’intégration de la vision avec d’autres modalités comme le texte et l’audio.
- L’IA générative – la génération d’images et de vidéos à partir de la Computer Vision.
Enjeux et impacts
- Éthique de l’IA – les biais de la reconnaissance faciale et la discrimination algorithmique.
- Impacts sociétaux de l’IA – la surveillance de masse et les atteintes à la vie privée.
- Réglementation et AI Act – la reconnaissance faciale en espace public, un usage à risque inacceptable.
Termes du glossaire
Retrouvez les définitions dans le Glossaire de l’IA : CNN, Computer Vision, Deep Learning, Fine-tuning.
Sources
*¹ – « Computer vision », Wikipedia : https://en.wikipedia.org/wiki/Computer_vision
*² – « What Is Computer Vision? », IBM : https://www.ibm.com/think/topics/computer-vision
*³ – « AlexNet », Wikipedia : https://en.wikipedia.org/wiki/AlexNet
*⁴ – Dosovitskiy et al., « An Image is Worth 16×16 Words » (2020), arXiv : https://arxiv.org/abs/2010.11929
*⁵ – Buolamwini & Gebru, « Gender Shades » (2018), MIT Media Lab : http://gendershades.org/
Catégorie : Découvrir l’IA > Types d’IA – Niveau : Débutant à intermédiaire