Nouveau · Présidentielle 2027 : ce que les candidats proposent sur l'IA, citations sourcées. Explorer l'observatoire →

Dernière revue :

Qu'est-ce que la vision par ordinateur ? Définition, exemples et cadre de l'AI Act

La vision par ordinateur (computer vision) est le domaine de l'intelligence artificielle qui permet à une machine d'analyser des images et des vidéos : reconnaître des objets, détecter des défauts, lire un document, suivre un mouvement. En Europe, ses usages biométriques (reconnaissance faciale, reconnaissance des émotions) sont en partie interdits et en partie classés à haut risque par l'AI Act.

La vision par ordinateur transforme des pixels en informations exploitables. Ses tâches de base sont la classification (que montre l'image ?), la détection (où se trouve chaque objet ?), la segmentation (quels pixels appartiennent à quel objet ?) et la reconnaissance de caractères, ou OCR (quel texte figure sur le document ?). Le tournant date de 2012 : le réseau de neurones convolutif AlexNet, présenté à la conférence NIPS, classe 1,3 million d'images en 1 000 catégories avec un taux d'erreur nettement inférieur à l'état de l'art de l'époque, et lance l'essor de l'apprentissage profond en vision. Depuis, les modèles multimodaux (Claude, GPT, Gemini) lisent aussi les images : ils décrivent une photo, extraient les données d'une facture ou lisent une capture d'écran à partir d'une simple consigne, là où il fallait auparavant entraîner un modèle dédié sur des milliers d'images annotées. Les applications en entreprise sont nombreuses : contrôle qualité sur une ligne de production, lecture automatique de factures et de pièces d'identité, inventaire en magasin, sécurité sur les chantiers, tri des déchets. L'AI Act encadre surtout les usages biométriques. Depuis le 2 février 2025, l'article 5 interdit notamment la constitution de bases de reconnaissance faciale par moissonnage non ciblé d'images sur internet ou de vidéosurveillance, la reconnaissance des émotions sur le lieu de travail et dans l'enseignement (sauf raisons médicales ou de sécurité) et, sauf exceptions strictes, l'identification biométrique à distance en temps réel dans l'espace public à des fins répressives. L'identification biométrique à distance et la reconnaissance des émotions relèvent en outre du haut risque (annexe III).

Exemple concret

Cas illustratif : un fabricant d'emballages de 250 salariés installe des caméras en sortie de ligne. Un modèle entraîné sur 20 000 photos de défauts (bavures, décentrages, rayures) écarte les pièces non conformes en temps réel. Les contrôleurs qualité ne vérifient plus que les cas douteux signalés par le système, et les données recueillies servent à repérer la machine qui dérive. Le projet ne traite aucune donnée biométrique : les caméras sont orientées vers les produits, pas vers les opérateurs.

Cas réel : pour les Jeux olympiques de Paris 2024, l'article 10 de la loi du 19 mai 2023 a autorisé, à titre expérimental, l'analyse algorithmique des images de vidéoprotection pour détecter des événements à risque lors de grands rassemblements. Le texte exclut toute identification biométrique, toute donnée biométrique et toute reconnaissance faciale. La loi du 18 août 2026 a prolongé l'expérimentation jusqu'au 31 décembre 2030.

Comparaison

Tâches de vision par ordinateur, usages et cadre réglementaire
TâcheCe que fait le modèleExemple en entrepriseCadre AI Act
ClassificationAttribue une catégorie à l'imagePièce conforme ou défectueusePas d'obligation spécifique en général
Détection d'objetsLocalise chaque objet dans l'imageComptage des produits en rayon, port du casquePas d'obligation spécifique en général
OCR et lecture de documentsExtrait le texte et les champsSaisie automatique des facturesPas d'obligation spécifique en général
Identification biométrique à distanceReconnaît une personne à son visage ou à sa silhouetteContrôle d'accès par caméra à distanceHaut risque (annexe III) ; interdite en temps réel dans l'espace public à des fins répressives, sauf exceptions
Reconnaissance des émotionsDéduit un état émotionnelAnalyse des réactions de clientsHaut risque ; interdite au travail et dans l'enseignement

Questions fréquentes

C'est quoi la vision par ordinateur ?

C'est la branche de l'IA qui permet à une machine d'analyser des images et des vidéos : reconnaître des objets, détecter des anomalies, lire du texte, suivre des mouvements. Elle repose surtout sur des réseaux de neurones entraînés sur de grandes quantités d'images annotées.

Quels sont des exemples de vision par ordinateur en entreprise ?

Contrôle qualité sur une ligne de production, lecture automatique de factures et de bons de livraison, vérification de pièces d'identité, suivi des rayons et des stocks en magasin, détection du port des équipements de sécurité sur un chantier, tri automatique des déchets, aide au diagnostic en imagerie médicale.

Quelle est la différence entre vision par ordinateur et traitement d'image ?

Le traitement d'image modifie ou améliore une image (netteté, contraste, compression). La vision par ordinateur en extrait une interprétation : ce que l'image contient, où, et ce que cela signifie. Le traitement d'image sert souvent d'étape préalable.

La reconnaissance faciale est-elle autorisée en Europe ?

Elle est très encadrée. L'AI Act interdit depuis février 2025 la constitution de bases de visages par moissonnage non ciblé et, sauf exceptions strictes, l'identification biométrique en temps réel dans l'espace public à des fins répressives. Les autres systèmes d'identification biométrique à distance sont classés à haut risque. Le RGPD protège aussi les données biométriques.

Quel lien entre vision par ordinateur et IA multimodale ?

Les modèles multimodaux intègrent la vision par ordinateur dans un modèle de langage : on peut leur montrer une image et poser une question en français. Pour une tâche massive et très précise, comme le contrôle qualité à cadence industrielle, un modèle de vision dédié reste souvent plus rapide et moins cher.

Où apprendre la vision par ordinateur (cours) ?

Pour un dirigeant, l'essentiel est de comprendre les tâches (classification, détection, segmentation, OCR) et leurs limites. Pour une équipe technique, les cours en ligne des universités et des éditeurs, ainsi que des bibliothèques ouvertes comme OpenCV, sont les points d'entrée habituels.

À voir aussi

Pour aller plus loin

Article 5 de l'AI Act (pratiques d'IA interdites), AI Act Service Desk, Commission européenne (en anglais) (ressource externe)

Sources

  1. ImageNet Classification with Deep Convolutional Neural Networks, Krizhevsky, Sutskever et Hinton, NeurIPS (NIPS) 2012. https://proceedings.neurips.cc/paper_files/paper/2012/hash/c399862d3b9d6b76c8436e924a68c45b-Abstract.html (consulté le 2026-09-30)
  2. Règlement (UE) 2024/1689 sur l'intelligence artificielle, article 5 (pratiques interdites), AI Act Service Desk, Commission européenne. https://ai-act-service-desk.ec.europa.eu/en/ai-act/article-5 (consulté le 2026-09-30)
  3. Règlement (UE) 2024/1689 sur l'intelligence artificielle, annexe III, point 1 (biométrie), AI Act Service Desk, Commission européenne. https://ai-act-service-desk.ec.europa.eu/en/ai-act/annex-3 (consulté le 2026-09-30)
  4. Loi n° 2023-380 du 19 mai 2023 relative aux jeux Olympiques et Paralympiques de 2024, article 10, version modifiée par la loi n° 2026-798 du 18 août 2026, Légifrance. https://www.legifrance.gouv.fr/loda/article_lc/LEGIARTI000047564439 (consulté le 2026-09-30)

← Retour au glossaire

Adresse copiée