Última revisión:
¿Qué es la visión por computadora? Definición, ejemplos y marco del Reglamento de IA
La visión por computadora (o visión artificial, computer vision) es el campo de la inteligencia artificial que permite a una máquina analizar imágenes y vídeos: reconocer objetos, detectar defectos, leer un documento, seguir un movimiento. En Europa, sus usos biométricos (reconocimiento facial, reconocimiento de emociones) están en parte prohibidos y en parte clasificados de alto riesgo por el Reglamento de IA.
La visión por computadora convierte píxeles en información aprovechable. Sus tareas básicas son la clasificación (¿qué muestra la imagen?), la detección (¿dónde está cada objeto?), la segmentación (¿qué píxeles pertenecen a qué objeto?) y el reconocimiento óptico de caracteres, u OCR (¿qué texto figura en el documento?). El punto de inflexión llega en 2012: la red neuronal convolucional AlexNet, presentada en la conferencia NIPS, clasifica 1,3 millones de imágenes en 1 000 categorías con una tasa de error claramente inferior al estado del arte de la época, y lanza el auge del aprendizaje profundo en visión. Desde entonces, los modelos multimodales (Claude, GPT, Gemini) también leen imágenes: describen una foto, extraen los datos de una factura o leen una captura de pantalla a partir de una simple instrucción, cuando antes hacía falta entrenar un modelo específico con miles de imágenes anotadas. Las aplicaciones empresariales son numerosas: control de calidad en una línea de producción, lectura automática de facturas y documentos de identidad, inventario en tienda, seguridad en obras, clasificación de residuos. El Reglamento de IA regula sobre todo los usos biométricos. Desde el 2 de febrero de 2025, el artículo 5 prohíbe en particular crear bases de datos de reconocimiento facial mediante la extracción no selectiva de imágenes de internet o de videovigilancia, el reconocimiento de emociones en el trabajo y en la enseñanza (salvo por motivos médicos o de seguridad) y, salvo excepciones estrictas, la identificación biométrica remota en tiempo real en espacios públicos con fines policiales. La identificación biométrica remota y el reconocimiento de emociones son además de alto riesgo (anexo III).
Ejemplo concreto
Caso ilustrativo: un fabricante francés de envases de 250 empleados instala cámaras al final de la línea. Un modelo entrenado con 20 000 fotos de defectos (rebabas, descentrados, arañazos) descarta en tiempo real las piezas no conformes. Los controladores de calidad solo revisan los casos dudosos señalados por el sistema, y los datos recogidos sirven para detectar la máquina que se desajusta. El proyecto no trata ningún dato biométrico: las cámaras apuntan a los productos, no a los operarios.
Caso real: para los Juegos Olímpicos de París 2024, el artículo 10 de la ley francesa del 19 de mayo de 2023 autorizó, de forma experimental, el análisis algorítmico de las imágenes de videovigilancia para detectar sucesos de riesgo en grandes concentraciones. El texto excluye toda identificación biométrica, todo dato biométrico y todo reconocimiento facial. Una ley del 18 de agosto de 2026 prolongó el experimento hasta el 31 de diciembre de 2030.
Comparación
| Tarea | Qué hace el modelo | Ejemplo en la empresa | Marco del AI Act |
|---|---|---|---|
| Clasificación | Asigna una categoría a la imagen | Pieza conforme o defectuosa | En general, sin obligación específica |
| Detección de objetos | Localiza cada objeto en la imagen | Recuento de productos en lineal, uso del casco | En general, sin obligación específica |
| OCR y lectura de documentos | Extrae el texto y los campos | Registro automático de facturas | En general, sin obligación específica |
| Identificación biométrica remota | Reconoce a una persona por su rostro o su silueta | Control de acceso por cámara a distancia | Alto riesgo (anexo III); prohibida en tiempo real en espacios públicos con fines policiales, salvo excepciones |
| Reconocimiento de emociones | Deduce un estado emocional | Análisis de reacciones de clientes | Alto riesgo; prohibido en el trabajo y la enseñanza |
Preguntas frecuentes
¿Qué es la visión por computadora?
Es la rama de la IA que permite a una máquina analizar imágenes y vídeos: reconocer objetos, detectar anomalías, leer texto, seguir movimientos. Se basa sobre todo en redes neuronales entrenadas con grandes cantidades de imágenes anotadas.
¿Qué ejemplos de visión por computadora hay en la empresa?
Control de calidad en una línea de producción, lectura automática de facturas y albaranes, verificación de documentos de identidad, seguimiento de lineales y existencias en tienda, detección del uso de equipos de seguridad en obra, clasificación automática de residuos, apoyo al diagnóstico por imagen médica.
¿Qué diferencia hay entre visión por computadora y procesamiento de imágenes?
El procesamiento de imágenes modifica o mejora una imagen (nitidez, contraste, compresión). La visión por computadora extrae de ella una interpretación: qué contiene la imagen, dónde y qué significa. El procesamiento de imágenes suele ser una etapa previa.
¿Está permitido el reconocimiento facial en Europa?
Está muy regulado. Desde febrero de 2025, el Reglamento de IA prohíbe crear bases de rostros mediante extracción no selectiva y, salvo excepciones estrictas, la identificación biométrica en tiempo real en espacios públicos con fines policiales. Los demás sistemas de identificación biométrica remota son de alto riesgo. El RGPD también protege los datos biométricos.
¿Qué relación hay entre visión por computadora e IA multimodal?
Los modelos multimodales integran la visión por computadora en un modelo de lenguaje: se les puede mostrar una imagen y hacer una pregunta en lenguaje corriente. Para una tarea masiva y muy precisa, como el control de calidad a ritmo industrial, un modelo de visión específico suele ser más rápido y barato.
¿Dónde aprender visión por computadora (cursos)?
Para un directivo, lo esencial es entender las tareas (clasificación, detección, segmentación, OCR) y sus límites. Para un equipo técnico, los cursos en línea de universidades y editores, junto con bibliotecas abiertas como OpenCV, son los puntos de entrada habituales.
Ver también
Para profundizar
Fuentes
- ImageNet Classification with Deep Convolutional Neural Networks, Krizhevsky, Sutskever y Hinton, NeurIPS (NIPS) 2012. https://proceedings.neurips.cc/paper_files/paper/2012/hash/c399862d3b9d6b76c8436e924a68c45b-Abstract.html
- Reglamento (UE) 2024/1689 de inteligencia artificial, artículo 5 (prácticas prohibidas), AI Act Service Desk, Comisión Europea. https://ai-act-service-desk.ec.europa.eu/en/ai-act/article-5
- Reglamento (UE) 2024/1689 de inteligencia artificial, anexo III, punto 1 (biometría), AI Act Service Desk, Comisión Europea. https://ai-act-service-desk.ec.europa.eu/en/ai-act/annex-3
- Ley francesa n.º 2023-380 del 19 de mayo de 2023 relativa a los Juegos Olímpicos y Paralímpicos de 2024, artículo 10, modificada por la ley n.º 2026-798 del 18 de agosto de 2026, Légifrance. https://www.legifrance.gouv.fr/loda/article_lc/LEGIARTI000047564439