Dernière revue :
Qu'est-ce que la vision par ordinateur ? Définition, exemples et cadre de l'AI Act
La vision par ordinateur (computer vision) est le domaine de l'intelligence artificielle qui permet à une machine d'analyser des images et des vidéos : reconnaître des objets, détecter des défauts, lire un document, suivre un mouvement. En Europe, ses usages biométriques (reconnaissance faciale, reconnaissance des émotions) sont en partie interdits et en partie classés à haut risque par l'AI Act.
La vision par ordinateur transforme des pixels en informations exploitables. Ses tâches de base sont la classification (que montre l'image ?), la détection (où se trouve chaque objet ?), la segmentation (quels pixels appartiennent à quel objet ?) et la reconnaissance de caractères, ou OCR (quel texte figure sur le document ?). Le tournant date de 2012 : le réseau de neurones convolutif AlexNet, présenté à la conférence NIPS, classe 1,3 million d'images en 1 000 catégories avec un taux d'erreur nettement inférieur à l'état de l'art de l'époque, et lance l'essor de l'apprentissage profond en vision. Depuis, les modèles multimodaux (Claude, GPT, Gemini) lisent aussi les images : ils décrivent une photo, extraient les données d'une facture ou lisent une capture d'écran à partir d'une simple consigne, là où il fallait auparavant entraîner un modèle dédié sur des milliers d'images annotées. Les applications en entreprise sont nombreuses : contrôle qualité sur une ligne de production, lecture automatique de factures et de pièces d'identité, inventaire en magasin, sécurité sur les chantiers, tri des déchets. L'AI Act encadre surtout les usages biométriques. Depuis le 2 février 2025, l'article 5 interdit notamment la constitution de bases de reconnaissance faciale par moissonnage non ciblé d'images sur internet ou de vidéosurveillance, la reconnaissance des émotions sur le lieu de travail et dans l'enseignement (sauf raisons médicales ou de sécurité) et, sauf exceptions strictes, l'identification biométrique à distance en temps réel dans l'espace public à des fins répressives. L'identification biométrique à distance et la reconnaissance des émotions relèvent en outre du haut risque (annexe III).
Exemple concret
Cas illustratif : un fabricant d'emballages de 250 salariés installe des caméras en sortie de ligne. Un modèle entraîné sur 20 000 photos de défauts (bavures, décentrages, rayures) écarte les pièces non conformes en temps réel. Les contrôleurs qualité ne vérifient plus que les cas douteux signalés par le système, et les données recueillies servent à repérer la machine qui dérive. Le projet ne traite aucune donnée biométrique : les caméras sont orientées vers les produits, pas vers les opérateurs.
Cas réel : pour les Jeux olympiques de Paris 2024, l'article 10 de la loi du 19 mai 2023 a autorisé, à titre expérimental, l'analyse algorithmique des images de vidéoprotection pour détecter des événements à risque lors de grands rassemblements. Le texte exclut toute identification biométrique, toute donnée biométrique et toute reconnaissance faciale. La loi du 18 août 2026 a prolongé l'expérimentation jusqu'au 31 décembre 2030.
Comparaison
| Tâche | Ce que fait le modèle | Exemple en entreprise | Cadre AI Act |
|---|---|---|---|
| Classification | Attribue une catégorie à l'image | Pièce conforme ou défectueuse | Pas d'obligation spécifique en général |
| Détection d'objets | Localise chaque objet dans l'image | Comptage des produits en rayon, port du casque | Pas d'obligation spécifique en général |
| OCR et lecture de documents | Extrait le texte et les champs | Saisie automatique des factures | Pas d'obligation spécifique en général |
| Identification biométrique à distance | Reconnaît une personne à son visage ou à sa silhouette | Contrôle d'accès par caméra à distance | Haut risque (annexe III) ; interdite en temps réel dans l'espace public à des fins répressives, sauf exceptions |
| Reconnaissance des émotions | Déduit un état émotionnel | Analyse des réactions de clients | Haut risque ; interdite au travail et dans l'enseignement |
Questions fréquentes
C'est quoi la vision par ordinateur ?
C'est la branche de l'IA qui permet à une machine d'analyser des images et des vidéos : reconnaître des objets, détecter des anomalies, lire du texte, suivre des mouvements. Elle repose surtout sur des réseaux de neurones entraînés sur de grandes quantités d'images annotées.
Quels sont des exemples de vision par ordinateur en entreprise ?
Contrôle qualité sur une ligne de production, lecture automatique de factures et de bons de livraison, vérification de pièces d'identité, suivi des rayons et des stocks en magasin, détection du port des équipements de sécurité sur un chantier, tri automatique des déchets, aide au diagnostic en imagerie médicale.
Quelle est la différence entre vision par ordinateur et traitement d'image ?
Le traitement d'image modifie ou améliore une image (netteté, contraste, compression). La vision par ordinateur en extrait une interprétation : ce que l'image contient, où, et ce que cela signifie. Le traitement d'image sert souvent d'étape préalable.
La reconnaissance faciale est-elle autorisée en Europe ?
Elle est très encadrée. L'AI Act interdit depuis février 2025 la constitution de bases de visages par moissonnage non ciblé et, sauf exceptions strictes, l'identification biométrique en temps réel dans l'espace public à des fins répressives. Les autres systèmes d'identification biométrique à distance sont classés à haut risque. Le RGPD protège aussi les données biométriques.
Quel lien entre vision par ordinateur et IA multimodale ?
Les modèles multimodaux intègrent la vision par ordinateur dans un modèle de langage : on peut leur montrer une image et poser une question en français. Pour une tâche massive et très précise, comme le contrôle qualité à cadence industrielle, un modèle de vision dédié reste souvent plus rapide et moins cher.
Où apprendre la vision par ordinateur (cours) ?
Pour un dirigeant, l'essentiel est de comprendre les tâches (classification, détection, segmentation, OCR) et leurs limites. Pour une équipe technique, les cours en ligne des universités et des éditeurs, ainsi que des bibliothèques ouvertes comme OpenCV, sont les points d'entrée habituels.
À voir aussi
Pour aller plus loin
Sources
- ImageNet Classification with Deep Convolutional Neural Networks, Krizhevsky, Sutskever et Hinton, NeurIPS (NIPS) 2012. https://proceedings.neurips.cc/paper_files/paper/2012/hash/c399862d3b9d6b76c8436e924a68c45b-Abstract.html
- Règlement (UE) 2024/1689 sur l'intelligence artificielle, article 5 (pratiques interdites), AI Act Service Desk, Commission européenne. https://ai-act-service-desk.ec.europa.eu/en/ai-act/article-5
- Règlement (UE) 2024/1689 sur l'intelligence artificielle, annexe III, point 1 (biométrie), AI Act Service Desk, Commission européenne. https://ai-act-service-desk.ec.europa.eu/en/ai-act/annex-3
- Loi n° 2023-380 du 19 mai 2023 relative aux jeux Olympiques et Paralympiques de 2024, article 10, version modifiée par la loi n° 2026-798 du 18 août 2026, Légifrance. https://www.legifrance.gouv.fr/loda/article_lc/LEGIARTI000047564439