Convocatoria abierta

I Premios Universidad y Divulgación Fundación Muy Interesante

Reconocemos el trabajo de investigadores, divulgadores, profesores, doctorandos y unidades de cultura científica que acercan el conocimiento a la sociedad.

Fundación » Ciencia e innovación » Inteligencia artificial al límite: detección de objetos entre la nube y el edge computing

Inteligencia artificial al límite: detección de objetos entre la nube y el edge computing

Un análisis cuantitativo demuestra que llevar el aprendizaje profundo más cerca de los datos permite alcanzar el verdadero tiempo real en la detección de objetos industriales.

Inteligencia artificial al límite: detección de objetos entre la nube y el edge computing
Inteligencia artificial al límite: detección de objetos entre la nube y el edge computing. Representación con IA. Fuente: Sora.

Creado: 01.01.2026

Actualizado: 23.06.2026

La detección automática de objetos en imágenes y vídeos se ha convertido en una herramienta indispensable en ámbitos tan diversos como la seguridad industrial, la robótica o los vehículos autónomos. Su avance ha sido posible gracias al aprendizaje profundo, una rama del aprendizaje automático que utiliza redes neuronales artificiales para identificar patrones en los datos. Sin embargo, a medida que los modelos se vuelven más complejos y precisos, también aumentan sus requerimientos de cálculo y velocidad, lo que plantea un desafío técnico: ¿dónde debe realizarse el procesamiento de los datos, en la nube o directamente en el dispositivo que los captura?

En nuestro estudio comparamos dos estrategias ampliamente empleadas en la actualidad: la computación en la nube (cloud computing) y la computación en el borde (edge computing). Ambas ofrecen distintas ventajas, pero su idoneidad depende del tipo de aplicación. Analizamos esta cuestión a través de un caso práctico: un sistema de visión artificial para verificar en tiempo real el uso de Equipos de Protección Individual (EPIs) en una instalación industrial. La investigación, realizada con la plataforma Azure y los dispositivos NVIDIA Jetson Nano y Jetson AGX Xavier, permite extraer conclusiones precisas sobre rendimiento, coste y viabilidad en escenarios donde la latencia puede marcar la diferencia entre la eficiencia y la ineficacia.

El reto del tiempo real en la detección de objetos

La detección de objetos no es solo identificar qué aparece en una imagen, sino hacerlo con rapidez y precisión. En aplicaciones industriales, los sistemas de vigilancia capturan imágenes a 30 frames por segundo; esto significa que cada imagen debe procesarse en menos de 33 milisegundos para mantener la continuidad. Si el procesamiento se retrasa, el sistema pierde capacidad de respuesta y, en consecuencia, su utilidad práctica.

El modelo seleccionado para nuestro trabajo, YOLOv5-S, pertenece a la familia de algoritmos conocidos como “You Only Look Once”, reconocidos por su equilibrio entre precisión y velocidad. Este modelo analiza la imagen completa en una sola pasada, lo que lo convierte en un detector adecuado para tareas en tiempo real. Sin embargo, lograr ese rendimiento depende en gran medida del hardware y de dónde se ejecute el modelo: un servidor remoto o un dispositivo local.

En contextos industriales, donde las decisiones deben tomarse en fracciones de segundo, la latencia se convierte en un enemigo invisible. Cada milisegundo cuenta, y es en ese margen donde la computación en el borde comienza a mostrar sus ventajas.

Fig. 1: (a) NVIDIA Jetson Nano. (b) NVIDIA Jeson AGX Xavier.
(a) NVIDIA Jetson Nano. (b) NVIDIA Jeson AGX Xavier. Fuente: autores.

El edge computing: inteligencia más cerca de los datos

El edge computing se basa en realizar el procesamiento directamente en el lugar donde se generan los datos, en lugar de enviarlos a un centro remoto. Este enfoque reduce la latencia —el tiempo que tarda la información en ir y volver— y disminuye la dependencia de la conectividad. En nuestro estudio, se utilizaron los dispositivos NVIDIA Jetson Nano y NVIDIA Jetson AGX Xavier, dos sistemas compactos con unidades de procesamiento gráfico integradas que permiten ejecutar modelos de aprendizaje profundo sin necesidad de infraestructura externa.

Estos dispositivos ofrecen una combinación de bajo consumo energético, portabilidad y capacidad de cómputo que los hace especialmente adecuados para entornos con recursos limitados. Aunque el Jetson Nano es más económico, su tiempo de inferencia promedio de 68 milisegundos no alcanza el nivel requerido para el tiempo real. En cambio, el Jetson AGX Xavier, con 22 milisegundos por imagen, cumple plenamente ese requisito. Además, al no requerir transmisión por red, el sistema elimina el coste asociado a la comunicación y minimiza riesgos de privacidad, un aspecto crucial cuando se procesan imágenes de personas.

En conjunto, los resultados muestran que la proximidad física del procesamiento a la fuente de datos garantiza mayor velocidad, autonomía y seguridad.

La nube: potencia y escalabilidad con un costo temporal

La computación en la nube sigue siendo una herramienta poderosa y flexible. Plataformas como Microsoft Azure permiten escalar recursos rápidamente y acceder a servicios avanzados, desde el entrenamiento de modelos hasta el análisis y visualización de datos. En este entorno probamos diferentes configuraciones: infraestructura como servicio (IaaS), contenedores como servicio (CaaS) y funciones como servicio (FaaS). Cada paradigma representa una forma distinta de desplegar y ejecutar modelos de inteligencia artificial.

Las instancias más potentes, como NC6 y NC12, incorporan unidades GPU capaces de procesar imágenes en menos de 30 milisegundos de inferencia. Sin embargo, el problema surge al sumar el tiempo de red, que puede añadir entre 20 y 40 milisegundos adicionales. Este retardo impide alcanzar los 30 frames por segundo necesarios para el tiempo real. Aunque la nube ofrece ventajas en fiabilidad, escalabilidad y mantenimiento, el estudio demuestra que, en tareas que exigen respuesta inmediata, la distancia física entre el dispositivo y el servidor representa una barrera insalvable.

Precisión, falsos positivos y seguimiento temporal

En la detección de objetos, la precisión no solo se mide por la cantidad de aciertos, sino también por la capacidad del sistema de evitar errores. En nuestro proyecto, el modelo debía distinguir correctamente si un trabajador llevaba casco y chaleco. Sin embargo, los resultados iniciales mostraron un número elevado de falsos positivos, es decir, alarmas generadas cuando en realidad el equipo de protección sí estaba presente.

Para resolver este problema, se combinó el detector YOLOv5-S con un algoritmo de seguimiento temporal denominado StrongSORT. Este sistema analiza la continuidad de los objetos a lo largo de varios frames, lo que permite tomar decisiones más consistentes y evitar que un fallo momentáneo en un fotograma genere una alerta innecesaria. Gracias a esta integración, el sistema logró reducir los falsos positivos y mejorar la robustez general de las detecciones.

El resultado es un modelo más robusto y adaptado al entorno real, capaz de seguir la trayectoria de cada trabajador y verificar de forma sostenida el cumplimiento de las normas de seguridad.

Ejemplo de c omo se generar  a una alarma en el tercer frame al no detectar el chaleco.
Ejemplo de cómo se generaría una alarma en el tercer frame al no detectar el chaleco. Fuente: autores.

Implicaciones prácticas y proyección futura

Los hallazgos de este estudio tienen implicaciones directas para las industrias que buscan automatizar procesos de control visual. La combinación de inteligencia artificial y edge computing demuestra que es posible lograr sistemas de visión autónomos, económicos y de bajo consumo, capaces de operar sin depender de una conexión constante a la nube. Este enfoque favorece la implementación de soluciones en entornos industriales, agrícolas o de transporte, donde la conectividad puede ser intermitente o costosa.

Aun así, la nube conserva un papel relevante. En aplicaciones que demandan escalabilidad masiva, almacenamiento de grandes volúmenes de datos o colaboración remota, su uso sigue siendo la opción preferente. La clave está en elegir la arquitectura adecuada para cada necesidad: el edge para la inmediatez, la nube para la expansión.

En futuros trabajos se prevé evaluar nuevas generaciones de detectores más eficientes que YOLOv5 y explorar la integración de infraestructuras híbridas, donde el procesamiento se distribuya inteligentemente entre el borde y la nube. Esta línea de investigación apunta a un horizonte en el que la inteligencia artificial no solo analice los datos, sino que también decida dónde y cuándo hacerlo del modo más eficiente posible.


Artículos relacionados

Una GPU, muchas tareas y una IA que decide: cómo el aprendizaje por refuerzo optimiza su planificación

Una GPU, muchas tareas y una IA que decide: cómo el aprendizaje por refuerzo optimiza su planificación

¿Y si una IA pudiera aprender a repartir una GPU sobre la marcha? Investigadores de la Universidad Complutense de Madrid han desarrollado un sistema de aprendizaje por refuerzo profundo capaz de decidir cómo asignar los recursos de una GPU a distintas tareas.

Jorge Villarrubia Elvira, Luis Mª Costero Valero, Katzalin Olcoz Herrero, Francisco Daniel Igual Peña

OP 313: el viaje de ocho mil millones de años que ilumina la historia del universo

OP 313: el viaje de ocho mil millones de años que ilumina la historia del universo

Un equipo internacional coliderado por el Instituto de Astrofísica de Andalucía (IAA-CSIC) ha publicado en 'Astronomy & Astrophysics' el análisis detallado de OP 313, el blázar más lejano detectado hasta la fecha en rayos gamma de muy alta energía.

Pablo Donato Pablos Rivera

De imprimir formas a estructuras inteligentes: así es la impresión 4D

De imprimir formas a estructuras inteligentes: así es la impresión 4D

No podemos negar que la impresión 3D ha marcado un antes y un después en nuestra forma de fabricar. Hoy podemos imprimir desde juguetes y prototipos en casa hasta componentes de motores de cohetes espaciales en grandes empresas. Pero, ¿qué pensarías si te dijera que, además de imprimir objetos, podemos fabricar estructuras que «cobran vida», capaces de reaccionar a su entorno y transformarse con el tiempo?

Carlos Aguilar Vega

Impresión 3D y luz solar: diseñando materiales capaces de capturar y degradar microplásticos del agua

Impresión 3D y luz solar: diseñando materiales capaces de capturar y degradar microplásticos del agua

Podrían estar en el agua que bebemos, pero eliminarlos no es sencillo. Los microplásticos escapan de muchos sistemas de tratamiento y se dispersan por el medio ambiente. Una estructura impresa en 3D combina la captura de microplásticos con su degradación mediante luz.

Katherine Villa Gómez, Neus Munar Barceló