La detección automática de objetos en imágenes y vídeos se ha convertido en una herramienta indispensable en ámbitos tan diversos como la seguridad industrial, la robótica o los vehículos autónomos. Su avance ha sido posible gracias al aprendizaje profundo, una rama del aprendizaje automático que utiliza redes neuronales artificiales para identificar patrones en los datos. Sin embargo, a medida que los modelos se vuelven más complejos y precisos, también aumentan sus requerimientos de cálculo y velocidad, lo que plantea un desafío técnico: ¿dónde debe realizarse el procesamiento de los datos, en la nube o directamente en el dispositivo que los captura?
En nuestro estudio comparamos dos estrategias ampliamente empleadas en la actualidad: la computación en la nube (cloud computing) y la computación en el borde (edge computing). Ambas ofrecen distintas ventajas, pero su idoneidad depende del tipo de aplicación. Analizamos esta cuestión a través de un caso práctico: un sistema de visión artificial para verificar en tiempo real el uso de Equipos de Protección Individual (EPIs) en una instalación industrial. La investigación, realizada con la plataforma Azure y los dispositivos NVIDIA Jetson Nano y Jetson AGX Xavier, permite extraer conclusiones precisas sobre rendimiento, coste y viabilidad en escenarios donde la latencia puede marcar la diferencia entre la eficiencia y la ineficacia.
El reto del tiempo real en la detección de objetos
La detección de objetos no es solo identificar qué aparece en una imagen, sino hacerlo con rapidez y precisión. En aplicaciones industriales, los sistemas de vigilancia capturan imágenes a 30 frames por segundo; esto significa que cada imagen debe procesarse en menos de 33 milisegundos para mantener la continuidad. Si el procesamiento se retrasa, el sistema pierde capacidad de respuesta y, en consecuencia, su utilidad práctica.
El modelo seleccionado para nuestro trabajo, YOLOv5-S, pertenece a la familia de algoritmos conocidos como “You Only Look Once”, reconocidos por su equilibrio entre precisión y velocidad. Este modelo analiza la imagen completa en una sola pasada, lo que lo convierte en un detector adecuado para tareas en tiempo real. Sin embargo, lograr ese rendimiento depende en gran medida del hardware y de dónde se ejecute el modelo: un servidor remoto o un dispositivo local.
En contextos industriales, donde las decisiones deben tomarse en fracciones de segundo, la latencia se convierte en un enemigo invisible. Cada milisegundo cuenta, y es en ese margen donde la computación en el borde comienza a mostrar sus ventajas.

El edge computing: inteligencia más cerca de los datos
El edge computing se basa en realizar el procesamiento directamente en el lugar donde se generan los datos, en lugar de enviarlos a un centro remoto. Este enfoque reduce la latencia —el tiempo que tarda la información en ir y volver— y disminuye la dependencia de la conectividad. En nuestro estudio, se utilizaron los dispositivos NVIDIA Jetson Nano y NVIDIA Jetson AGX Xavier, dos sistemas compactos con unidades de procesamiento gráfico integradas que permiten ejecutar modelos de aprendizaje profundo sin necesidad de infraestructura externa.
Estos dispositivos ofrecen una combinación de bajo consumo energético, portabilidad y capacidad de cómputo que los hace especialmente adecuados para entornos con recursos limitados. Aunque el Jetson Nano es más económico, su tiempo de inferencia promedio de 68 milisegundos no alcanza el nivel requerido para el tiempo real. En cambio, el Jetson AGX Xavier, con 22 milisegundos por imagen, cumple plenamente ese requisito. Además, al no requerir transmisión por red, el sistema elimina el coste asociado a la comunicación y minimiza riesgos de privacidad, un aspecto crucial cuando se procesan imágenes de personas.
En conjunto, los resultados muestran que la proximidad física del procesamiento a la fuente de datos garantiza mayor velocidad, autonomía y seguridad.
La nube: potencia y escalabilidad con un costo temporal
La computación en la nube sigue siendo una herramienta poderosa y flexible. Plataformas como Microsoft Azure permiten escalar recursos rápidamente y acceder a servicios avanzados, desde el entrenamiento de modelos hasta el análisis y visualización de datos. En este entorno probamos diferentes configuraciones: infraestructura como servicio (IaaS), contenedores como servicio (CaaS) y funciones como servicio (FaaS). Cada paradigma representa una forma distinta de desplegar y ejecutar modelos de inteligencia artificial.
Las instancias más potentes, como NC6 y NC12, incorporan unidades GPU capaces de procesar imágenes en menos de 30 milisegundos de inferencia. Sin embargo, el problema surge al sumar el tiempo de red, que puede añadir entre 20 y 40 milisegundos adicionales. Este retardo impide alcanzar los 30 frames por segundo necesarios para el tiempo real. Aunque la nube ofrece ventajas en fiabilidad, escalabilidad y mantenimiento, el estudio demuestra que, en tareas que exigen respuesta inmediata, la distancia física entre el dispositivo y el servidor representa una barrera insalvable.
Precisión, falsos positivos y seguimiento temporal
En la detección de objetos, la precisión no solo se mide por la cantidad de aciertos, sino también por la capacidad del sistema de evitar errores. En nuestro proyecto, el modelo debía distinguir correctamente si un trabajador llevaba casco y chaleco. Sin embargo, los resultados iniciales mostraron un número elevado de falsos positivos, es decir, alarmas generadas cuando en realidad el equipo de protección sí estaba presente.
Para resolver este problema, se combinó el detector YOLOv5-S con un algoritmo de seguimiento temporal denominado StrongSORT. Este sistema analiza la continuidad de los objetos a lo largo de varios frames, lo que permite tomar decisiones más consistentes y evitar que un fallo momentáneo en un fotograma genere una alerta innecesaria. Gracias a esta integración, el sistema logró reducir los falsos positivos y mejorar la robustez general de las detecciones.
El resultado es un modelo más robusto y adaptado al entorno real, capaz de seguir la trayectoria de cada trabajador y verificar de forma sostenida el cumplimiento de las normas de seguridad.

Implicaciones prácticas y proyección futura
Los hallazgos de este estudio tienen implicaciones directas para las industrias que buscan automatizar procesos de control visual. La combinación de inteligencia artificial y edge computing demuestra que es posible lograr sistemas de visión autónomos, económicos y de bajo consumo, capaces de operar sin depender de una conexión constante a la nube. Este enfoque favorece la implementación de soluciones en entornos industriales, agrícolas o de transporte, donde la conectividad puede ser intermitente o costosa.
Aun así, la nube conserva un papel relevante. En aplicaciones que demandan escalabilidad masiva, almacenamiento de grandes volúmenes de datos o colaboración remota, su uso sigue siendo la opción preferente. La clave está en elegir la arquitectura adecuada para cada necesidad: el edge para la inmediatez, la nube para la expansión.
En futuros trabajos se prevé evaluar nuevas generaciones de detectores más eficientes que YOLOv5 y explorar la integración de infraestructuras híbridas, donde el procesamiento se distribuya inteligentemente entre el borde y la nube. Esta línea de investigación apunta a un horizonte en el que la inteligencia artificial no solo analice los datos, sino que también decida dónde y cuándo hacerlo del modo más eficiente posible.





