Una foto de una mesa de cultivo y un video de pádel pueden empezar con la misma pregunta: ¿qué objetos hay en la imagen? Después, sus recorridos se separan. Para revisar un conteo de plantas puede servir una captura con detecciones identificables. Para estudiar una jugada hace falta conservar la relación entre observaciones a lo largo del tiempo.
Una detección aislada puede verse muy bien en una demo y no servir para la operación. La cámara puede estar mal ubicada, la escena puede cambiar, la señal puede llegar tarde o nadie puede actuar sobre el resultado. La visión útil se diseña como un recorrido completo.
Qué cambia entre un conteo y una jugada
En un conteo de plantas, conviene poder volver a la foto, distinguir qué ejemplares se incluyeron y corregir una omisión o un duplicado. Una planta tapada por otra puede requerir otra captura. La revisión necesita conectar el número con los objetos que lo originaron.
En el seguimiento de una pelota, acertar en una imagen no alcanza para reconstruir su recorrido. Hay que relacionar posiciones entre frames y reconocer los tramos donde se pierde la observación. La velocidad, las oclusiones y los cambios de dirección vuelven relevante la continuidad temporal.
Los dos sistemas necesitan conservar evidencia revisable. El primero puede evaluarse por la correspondencia entre objetos y conteo; el segundo, además, necesita una secuencia coherente. Esa diferencia determina qué capturar, qué guardar y qué revisar.
La cámara también forma parte del sistema
Antes de entrenar o elegir un modelo, describí la captura. ¿Qué cámara se usa? ¿Qué iluminación hay? ¿Qué distancia y ángulo tiene? ¿Qué pasa cuando una persona tapa el objeto? ¿Qué frecuencia y resolución necesita el proceso? ¿La conexión es estable? ¿Se puede conservar la evidencia sin almacenar video de más?
Estas preguntas definen la calidad de la entrada y los costos del sistema. También ayudan a decidir entre procesar cerca de la cámara, enviar datos a la nube o combinar ambos caminos. La respuesta depende de privacidad, latencia, ancho de banda, hardware y necesidad de revisión.
La documentación de NVIDIA DeepStream presenta una arquitectura que recibe cámaras, archivos o streams RTSP y conecta decodificación, preprocesamiento, inferencia, tracking, visualización y envío de metadatos. El modelo ocupa un lugar dentro de ese recorrido; no es el recorrido completo.
Separá las etapas
Un pipeline de visión se vuelve más fácil de operar cuando cada tramo tiene una responsabilidad explícita:
- Captura: obtener una imagen o frame con hora, origen y condiciones conocidas.
- Preparación: corregir formato, recortar la región útil o ajustar la imagen sin perder trazabilidad.
- Inferencia: producir detecciones, clases, máscaras, puntos o una señal de confianza.
- Seguimiento: relacionar observaciones entre frames cuando la tarea necesita movimiento o continuidad.
- Interpretación: convertir la salida en un evento, conteo, medición o evidencia revisable.
- Acción: registrar, notificar, ordenar una tarea o dejar el caso para revisión.
Si una salida de la inferencia no tiene destino, todavía es una visualización. Si una acción no conserva la evidencia que la originó, después resulta difícil explicar qué pasó.
Medí utilidad, no sólo precisión
La precisión del modelo importa, pero no responde todas las preguntas. Para una operación también puede importar cuántos casos quedan sin decidir, cuánto tarda la señal, cuántos falsos positivos generan trabajo adicional y cómo se comporta el sistema cuando cambia la escena.
Definí métricas que conecten la salida con el trabajo. En un inventario puede ser la cantidad de elementos que quedan listos para revisar. En un sistema de seguridad puede ser el tiempo hasta que una persona recibe una señal útil. En análisis de video puede ser si la trayectoria o el evento queda suficientemente claro para estudiar una jugada. Cada caso necesita su propia definición; un número aislado no demuestra valor.
La Machine Learning Lens de AWS recorre el ciclo desde el objetivo de negocio y el planteo del problema hasta datos, desarrollo, despliegue y monitoreo. Esa secuencia recuerda que un modelo no termina cuando produce una métrica en un notebook. También necesita una operación que lo observe y lo pueda corregir.
Prepará una evaluación que se parezca al piso
Un conjunto de imágenes elegidas sólo por ser fáciles no representa el uso real. Incluí escenas normales, imágenes incompletas, oclusiones, cambios de luz y casos donde la salida debe ser «no sé». Conservá la procedencia y la versión de los datos. Si una muestra no puede publicarse, trabajá con datos permitidos y documentá el límite.
La evaluación debe probar el sistema completo. Medí la captura, el tiempo de procesamiento, la estabilidad del seguimiento, la forma en que se guarda la evidencia y el modo en que una persona corrige un resultado. Si cambia la cámara, el modelo o el umbral, repetí el conjunto de casos para distinguir una mejora de una variación casual.
No hace falta comenzar con una arquitectura grande. Un flujo pequeño, con una sola cámara y una decisión clara, produce mejor información que un tablero que pretende cubrir toda la operación. Cuando el recorrido demuestra utilidad, se puede ampliar el número de fuentes, modelos o destinos.
Dos recorridos que 42N mantiene separados
Demeteria muestra una aplicación de visión e inventario conectada con captura móvil, tareas, consultas e historial operativo. WJETT es un proyecto en desarrollo que explora análisis de partidos de pádel mediante video. Los dos contextos requieren visión, pero sus decisiones, datos y criterios de aceptación son diferentes.
Esa diferencia importa. Una técnica que sirve para contar objetos no se convierte automáticamente en una técnica para interpretar movimiento. En cada caso hay que volver a definir la unidad de evidencia, la persona que revisa y el resultado que habilita una acción.
La pregunta más productiva para empezar no es «¿qué modelo usamos?». Es «¿qué debería poder ver, registrar y decidir una persona después de que el sistema procese esta imagen?». Con esa respuesta, la elección del modelo y del hardware deja de ser una apuesta aislada y pasa a formar parte de una arquitectura que se puede revisar.
Si tu operación depende de fotos, cámaras o video, escribinos con el proceso y el punto donde hoy se pierde información. Podemos empezar por el recorrido y decidir si hace falta una auditoría, una prueba o una implementación.