Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
A person slips behind another person, an object or an obstruction. When they reappear in a different camera, the system may treat them as someone new. Researchers at the Institute of Science Tokyo, working with NEC Corporation, have developed a method that preserved cross-camera identities more reliably in benchmark tests, reaching an IDF1 score of 65.48 on MMPTrack.
Une personne se glisse derrière une autre personne, un objet ou un obstacle. Lorsqu’elle réapparaît dans une autre caméra, le système peut la considérer comme une nouvelle personne. Des chercheurs de l’Institut des sciences de Tokyo, en collaboration avec NEC Corporation, ont mis au point une méthode qui a préservé plus fiablement les identités entre les caméras lors de tests sur des benchmarks, atteignant un score IDF1 de 65,48 sur MMPTrack.
The method combines two clues that answer different parts of the matching problem. Epipolar geometry describes the spatial relationship between two cameras and narrows down where the same person could appear. The system then compares visual appearance among the candidates that remain, using image features to distinguish people who are geometrically plausible matches.
La méthode combine deux indices qui répondent à des aspects différents du problème de mise en correspondance. La géométrie épipolaire décrit la relation spatiale entre deux caméras et réduit la zone où la même personne pourrait apparaître. Le système compare ensuite l’apparence visuelle des candidats restants, en utilisant des caractéristiques d’image pour distinguer les personnes qui constituent des correspondances géométriquement plausibles.
The approach does not require replacing each camera’s existing single-camera tracking system. Those systems produce tracklets — short fragments of a person’s tracked movement — and the new method associates fragments across cameras. The researchers say it uses known camera relationships and pre-trained appearance features, so it does not require additional training for each environment.
Cette approche ne nécessite pas de remplacer le système de suivi monocaméra existant de chaque caméra. Ces systèmes produisent des tracklets — de courts fragments de déplacement suivis d’une personne — et la nouvelle méthode associe ces fragments entre les caméras. Les chercheurs indiquent qu’elle utilise les relations connues entre les caméras et des caractéristiques d’apparence préentraînées : aucun entraînement supplémentaire propre à chaque environnement n’est donc nécessaire.
The gains were measured against existing methods on two multi-camera benchmarks. On MMPTrack, the proposed system scored 65.48 IDF1, compared with 62.30 for MCTR, while its HOTA score — a measure combining detection accuracy and identity consistency — was 56.92, versus 55.77 for MCTR. On CAMPUS, it scored 47.37 IDF1, compared with 44.72 for ByteTrack.
Les gains ont été mesurés par rapport à des méthodes existantes sur deux benchmarks de suivi multi-caméras. Sur MMPTrack, le système proposé a obtenu 65,48 en IDF1, contre 62,30 pour MCTR, tandis que son score HOTA — une mesure combinant la précision de la détection et la cohérence des identités — s’est établi à 56,92, contre 55,77 pour MCTR. Sur CAMPUS, il a obtenu 47,37 en IDF1, contre 44,72 pour ByteTrack.
And then, concretely? A system that keeps identities consistent across viewpoints could support security monitoring, transportation management, facility operations and pedestrian-flow analysis, without environment-specific retraining. But the result remains a laboratory-stage method: severe occlusion may prevent detection altogether, leaving no tracklet for cross-camera association. The research was presented at ICPR 2026 in Lyon and published in Lecture Notes in Computer Science.
Et concrètement ? Un système qui maintient la cohérence des identités d’un point de vue à l’autre pourrait servir à la vidéosurveillance, à la gestion des transports, à l’exploitation des installations et à l’analyse des flux de piétons, sans nouvel entraînement propre à chaque environnement. Le résultat reste toutefois une méthode au stade du laboratoire : une forte occultation peut empêcher totalement la détection et ne laisser aucun tracklet pour l’association entre les caméras. Les travaux ont été présentés à ICPR 2026 à Lyon et publiés dans Lecture Notes in Computer Science.