Detección y seguimiento
YOLO26 + ByteTrackEncuentra a cada persona del cuadro y le asigna una identidad que se mantiene mientras esté en escena — aunque se cruce con otra o desaparezca un instante detrás de una góndola.
Condor Vision no se limita a grabar. Sigue a cada persona, lee su postura y su movimiento, y reconoce hurtos, asaltos y armas mientras ocurren — con un analista de IA que confirma cada incidente y adjunta la foto del momento exacto.
Capacidades
Cada capacidad es una pieza independiente del motor. Se encienden o se apagan según lo que necesite cada cámara y cada cliente.
Encuentra a cada persona del cuadro y le asigna una identidad que se mantiene mientras esté en escena — aunque se cruce con otra o desaparezca un instante detrás de una góndola.
De cada persona extrae 17 puntos del cuerpo: hombros, codos, muñecas, caderas, rodillas. Ese esqueleto es lo que permite distinguir a alguien que se agacha a atarse el zapato de alguien que se agacha a esconder un producto.
Traduce la postura y el movimiento a conductas legibles: de pie, caminando, corriendo, sentado, agachado, caída, manos arriba, alcanzando. Cada una se confirma en varios cuadros seguidos para no dispararse por un gesto suelto.
Nadie roba con un solo gesto delator, así que en vez de un veredicto binario suma señales débiles: se agachó junto a la estantería, merodeó demasiado, volvió a la misma góndola, salió sin pasar por caja. El puntaje decae solo con el tiempo y se muestra desglosado — el operador ve por qué esa persona está marcada.
Detecta violencia entre personas: dos cuerpos casi en contacto con brazos moviéndose a velocidad de golpe, o una persecución de dos personas corriendo en la misma dirección. Probado contra 200 clips de robos reales de cámaras de seguridad.
Los modelos de visión comunes no tienen una clase «pistola». Este busca por descripción — pistola, revólver, cuchillo, rifle — sin necesidad de entrenar nada. En cámaras reales el arma es diminuta, así que no grita alarma: levanta la mano y le pide al analista que confirme.
Cuando algo se sale de lo normal, tres fotogramas seguidos viajan a un modelo de visión que responde lo que la geometría no puede: si es un incidente, de qué tipo, si hay un arma a la vista, con cuánta confianza y qué debería hacer el operador ahora.
Se marcan áreas sobre el video con el ratón y cada tipo de zona activa sus propias reglas: restringida avisa al entrar, estantería vigila el ocultamiento, caja registra el pago, entrada cierra el recorrido de salida.
Toda alerta seria guarda el fotograma exacto del incidente. No hay que rebobinar horas de grabación: la prueba llega junto con el aviso, con sirena y notificación del navegador.
Cuánta gente hay ahora, cuántas personas distintas pasaron, qué conductas predominan y en qué momento ocurrió cada incidente sobre la línea de tiempo.
Cámara web, archivo de video subido desde el navegador o cámara IP por RTSP. La fuente se cambia en caliente, sin reiniciar el sistema ni perder el historial.
Todo el análisis corre a 30 cuadros por segundo en una tarjeta gráfica de portátil. Sin servidores caros, sin obligación de subir el video a la nube.
Cómo funciona
Preguntarle a un modelo de IA por cada fotograma sería lento y costoso. Por eso el trabajo se reparte en cascada: la visión local corre gratis todo el día y solo lo verdaderamente sospechoso escala al analista caro.
El video entra y sale con cada persona detectada, seguida y con su esqueleto puesto.
30 fps · en la máquina
La geometría del esqueleto se vuelve conducta y puntaje de riesgo. Aquí se resuelve casi todo.
instantáneo · sin costo
Un radar barrre la escena buscando armas por descripción. No decide: levanta la mano.
cada 2 s · en la máquina
Solo lo que huele mal llega al modelo de visión, que confirma o descarta con evidencia.
2-4 s · solo si hay señal
Recorrido guiado
Esto es el centro de monitoreo real, con datos de una sesión real. Haga clic donde se lo indique el globo y recorra un incidente completo: de la cámara al veredicto con evidencia.
Evidencia
Estos tres casos salieron del historial de eventos de una sesión real sobre videos de robos. Ni el veredicto ni el porcentaje están escritos por nosotros: los redactó el analista al mirar esos fotogramas.
CríticoUn individuo se aproxima y apunta aparentemente un arma hacia el motociclista; la víctima tiene las manos arriba, intento de robo en curso.
Qué recomendó: Notificar a la policía de inmediato, alertar patrullas cercanas y mantener grabación; no intervenir en persona.
El radar solo alcanzó un 13% — demasiado poco para sonar una alarma. Fue el analista quien lo convirtió en certeza.
CríticoPersona con pasamontañas y sudadera detrás del mostrador sacando billetes del cajón de la caja registradora.
Qué recomendó: Notificar policía y seguridad del local de inmediato, conservar las grabaciones y evitar confrontación.
Ningún esqueleto puede ver «sacar billetes de un cajón». Esta es exactamente la clase de escena para la que existe el analista.
CríticoSe observa a dos sujetos forcejeando con una persona para arrebatarle bolsas; un sujeto golpea a una mujer mientras transeúntes intervienen.
Qué recomendó: Notificar policía de inmediato, dirigir cámaras a las salidas posibles y enviar unidad de respuesta.
Nadie había pedido este análisis. Salió de la ronda que el sistema hace cada 25 segundos aunque no vea nada raro.
Casos de uso
El hurto hormiga no se ve en una cámara; se ve en un patrón.
El demo trae 200 clips de robos reales grabados por cámaras de seguridad — asaltos con arma, arrebatos, forcejeos — y también acepta el video que usted suba. Elija uno y observe cómo cada capa reacciona en vivo, con sus alertas y su evidencia.