Nuevo · Presidenciales francesas 2027: qué proponen los candidatos sobre la IA (en francés). Explorar el observatorio →

Última revisión:

¿Qué es la visión por computadora? Definición, ejemplos y marco del Reglamento de IA

La visión por computadora (o visión artificial, computer vision) es el campo de la inteligencia artificial que permite a una máquina analizar imágenes y vídeos: reconocer objetos, detectar defectos, leer un documento, seguir un movimiento. En Europa, sus usos biométricos (reconocimiento facial, reconocimiento de emociones) están en parte prohibidos y en parte clasificados de alto riesgo por el Reglamento de IA.

La visión por computadora convierte píxeles en información aprovechable. Sus tareas básicas son la clasificación (¿qué muestra la imagen?), la detección (¿dónde está cada objeto?), la segmentación (¿qué píxeles pertenecen a qué objeto?) y el reconocimiento óptico de caracteres, u OCR (¿qué texto figura en el documento?). El punto de inflexión llega en 2012: la red neuronal convolucional AlexNet, presentada en la conferencia NIPS, clasifica 1,3 millones de imágenes en 1 000 categorías con una tasa de error claramente inferior al estado del arte de la época, y lanza el auge del aprendizaje profundo en visión. Desde entonces, los modelos multimodales (Claude, GPT, Gemini) también leen imágenes: describen una foto, extraen los datos de una factura o leen una captura de pantalla a partir de una simple instrucción, cuando antes hacía falta entrenar un modelo específico con miles de imágenes anotadas. Las aplicaciones empresariales son numerosas: control de calidad en una línea de producción, lectura automática de facturas y documentos de identidad, inventario en tienda, seguridad en obras, clasificación de residuos. El Reglamento de IA regula sobre todo los usos biométricos. Desde el 2 de febrero de 2025, el artículo 5 prohíbe en particular crear bases de datos de reconocimiento facial mediante la extracción no selectiva de imágenes de internet o de videovigilancia, el reconocimiento de emociones en el trabajo y en la enseñanza (salvo por motivos médicos o de seguridad) y, salvo excepciones estrictas, la identificación biométrica remota en tiempo real en espacios públicos con fines policiales. La identificación biométrica remota y el reconocimiento de emociones son además de alto riesgo (anexo III).

Ejemplo concreto

Caso ilustrativo: un fabricante francés de envases de 250 empleados instala cámaras al final de la línea. Un modelo entrenado con 20 000 fotos de defectos (rebabas, descentrados, arañazos) descarta en tiempo real las piezas no conformes. Los controladores de calidad solo revisan los casos dudosos señalados por el sistema, y los datos recogidos sirven para detectar la máquina que se desajusta. El proyecto no trata ningún dato biométrico: las cámaras apuntan a los productos, no a los operarios.

Caso real: para los Juegos Olímpicos de París 2024, el artículo 10 de la ley francesa del 19 de mayo de 2023 autorizó, de forma experimental, el análisis algorítmico de las imágenes de videovigilancia para detectar sucesos de riesgo en grandes concentraciones. El texto excluye toda identificación biométrica, todo dato biométrico y todo reconocimiento facial. Una ley del 18 de agosto de 2026 prolongó el experimento hasta el 31 de diciembre de 2030.

Comparación

Tareas de visión por computadora, usos y marco regulatorio
TareaQué hace el modeloEjemplo en la empresaMarco del AI Act
ClasificaciónAsigna una categoría a la imagenPieza conforme o defectuosaEn general, sin obligación específica
Detección de objetosLocaliza cada objeto en la imagenRecuento de productos en lineal, uso del cascoEn general, sin obligación específica
OCR y lectura de documentosExtrae el texto y los camposRegistro automático de facturasEn general, sin obligación específica
Identificación biométrica remotaReconoce a una persona por su rostro o su siluetaControl de acceso por cámara a distanciaAlto riesgo (anexo III); prohibida en tiempo real en espacios públicos con fines policiales, salvo excepciones
Reconocimiento de emocionesDeduce un estado emocionalAnálisis de reacciones de clientesAlto riesgo; prohibido en el trabajo y la enseñanza

Preguntas frecuentes

¿Qué es la visión por computadora?

Es la rama de la IA que permite a una máquina analizar imágenes y vídeos: reconocer objetos, detectar anomalías, leer texto, seguir movimientos. Se basa sobre todo en redes neuronales entrenadas con grandes cantidades de imágenes anotadas.

¿Qué ejemplos de visión por computadora hay en la empresa?

Control de calidad en una línea de producción, lectura automática de facturas y albaranes, verificación de documentos de identidad, seguimiento de lineales y existencias en tienda, detección del uso de equipos de seguridad en obra, clasificación automática de residuos, apoyo al diagnóstico por imagen médica.

¿Qué diferencia hay entre visión por computadora y procesamiento de imágenes?

El procesamiento de imágenes modifica o mejora una imagen (nitidez, contraste, compresión). La visión por computadora extrae de ella una interpretación: qué contiene la imagen, dónde y qué significa. El procesamiento de imágenes suele ser una etapa previa.

¿Está permitido el reconocimiento facial en Europa?

Está muy regulado. Desde febrero de 2025, el Reglamento de IA prohíbe crear bases de rostros mediante extracción no selectiva y, salvo excepciones estrictas, la identificación biométrica en tiempo real en espacios públicos con fines policiales. Los demás sistemas de identificación biométrica remota son de alto riesgo. El RGPD también protege los datos biométricos.

¿Qué relación hay entre visión por computadora e IA multimodal?

Los modelos multimodales integran la visión por computadora en un modelo de lenguaje: se les puede mostrar una imagen y hacer una pregunta en lenguaje corriente. Para una tarea masiva y muy precisa, como el control de calidad a ritmo industrial, un modelo de visión específico suele ser más rápido y barato.

¿Dónde aprender visión por computadora (cursos)?

Para un directivo, lo esencial es entender las tareas (clasificación, detección, segmentación, OCR) y sus límites. Para un equipo técnico, los cursos en línea de universidades y editores, junto con bibliotecas abiertas como OpenCV, son los puntos de entrada habituales.

Ver también

Para profundizar

Artículo 5 del Reglamento de IA (prácticas de IA prohibidas), AI Act Service Desk, Comisión Europea (en inglés) (recurso externo)

Fuentes

  1. ImageNet Classification with Deep Convolutional Neural Networks, Krizhevsky, Sutskever y Hinton, NeurIPS (NIPS) 2012. https://proceedings.neurips.cc/paper_files/paper/2012/hash/c399862d3b9d6b76c8436e924a68c45b-Abstract.html (consultado el 2026-09-30)
  2. Reglamento (UE) 2024/1689 de inteligencia artificial, artículo 5 (prácticas prohibidas), AI Act Service Desk, Comisión Europea. https://ai-act-service-desk.ec.europa.eu/en/ai-act/article-5 (consultado el 2026-09-30)
  3. Reglamento (UE) 2024/1689 de inteligencia artificial, anexo III, punto 1 (biometría), AI Act Service Desk, Comisión Europea. https://ai-act-service-desk.ec.europa.eu/en/ai-act/annex-3 (consultado el 2026-09-30)
  4. Ley francesa n.º 2023-380 del 19 de mayo de 2023 relativa a los Juegos Olímpicos y Paralímpicos de 2024, artículo 10, modificada por la ley n.º 2026-798 del 18 de agosto de 2026, Légifrance. https://www.legifrance.gouv.fr/loda/article_lc/LEGIARTI000047564439 (consultado el 2026-09-30)

← Volver al glosario

Dirección copiada