Constellation, le dépôt institutionnel de l'Université du Québec à Chicoutimi

AV-ID Lite : une approche multimodale légère pour la détection d'incidents dans les magasins sans personnel

Thiaw, Mamadou. (2026). AV-ID Lite : une approche multimodale légère pour la détection d'incidents dans les magasins sans personnel. Mémoire de maîtrise, Université du Québec à Chicoutimi.

[thumbnail of Thiaw_Mamadou_2026_memoire.pdf]
Prévisualisation
PDF
8MB

Résumé

Les approches multimodales audio-visuelles connaissent un essor important en raison de leur capacité à analyser simultanément des scènes complexes en exploitant à la fois les informations visuelles et audio. Dans le secteur du commerce de détail, en particulier dans les magasins sans personnel, la détection automatique des comportements anormaux constitue un défi majeur pour garantir la sécurité et prévenir des incidents tels que les bagarres ou les évanouissements dans des environnements fonctionnant en continu.

Dans ce travail, nous proposons AV-ID Lite, une approche multimodale légère et efficace pour la détection d’incidents dans les magasins sans personnel. L’approche proposée repose sur l’extraction de caractéristiques visuelles à partir de squelettes humains à l’aide d’AlphaPose et de caractéristiques audio à l’aide de VGGish, qui sont fusionnées selon une stratégie de fusion précoce strictement synchronisée. Les représentations fusionnées sont ensuite analysées par une architecture Transformer légère, combinée à un mécanisme de pooling Log-Sum-Exp afin de mettre en évidence les segments temporels les plus discriminants.

Nous développons également un nouveau jeu de données multimodal dédié aux magasins sans personnel, composé de vidéos annotées en trois classes : activités normales, bagarres et évanouissements. Les expériences montrent que l’approche proposée surpasse systématiquement plusieurs méthodes de l’état de l’art, atteignant un score F1 de 95.91%, un rappel de 98.22% et un mAP de 99.23%, ce qui correspond à des améliorations d’au moins 6.42%, 10.22% et 4.08% respectivement, confirmant ainsi l’efficacité et la pertinence de l’architecture proposée pour la détection multimodale d’incidents dans les environnements commerciaux sans personnel.

Multimodal audio-visual approaches are experiencing significant growth due to their ability to simultaneously analyze complex scenes by exploiting both visual and audio information. In the retail sector, particularly in unmanned stores, automatic detection of abnormal behavior is a major challenge in ensuring safety and preventing incidents such as fights or fainting in environments that operate continuously.

In this work, we propose AV-ID Lite, a lightweight and efficient multimodal approach for incident detection in unmanned retail stores. The proposed approach relies on the extraction of visual features from skeletons using AlphaPose and audio features using VGGish, which are fused by a strictly synchronized early fusion strategy. The fused representations are then analyzed by a lightweight Transformer architecture, combined with a Log-Sum-Exp pooling mechanism to highlight the most discriminative temporal segments.

We also develop a new multimodal dataset dedicated to unmanned stores, consisting of videos annotated in three classes : normal activities, fights, and fainting. Experiments show that the proposed approach consistently outperforms several state-of-the-art methods, achieving an F1-score of 95.91%, a recall of 98.22%, and a mAP of 99.23%, representing improvements of at least 6.42%, 10.22%, and 4.08%, respectively, and confirming the effectiveness and relevance of the proposed architecture for multimodal incident detection in unmanned commercial environments.

Type de document:Thèse ou mémoire de l'UQAC (Mémoire de maîtrise)
Date:2026
Lieu de publication:Chicoutimi
Programme d'étude:3017 - Maîtrise en informatique
Nombre de pages:68
ISBN:Non spécifié
Unité(s) institutionnelle(s):Départements et unités pédagogiques > Département de l'informatique et mathématique > Programmes d'études de cycles supérieurs en informatique
Directeur(s), Co-directeur(s) et responsable(s):Jaafar, Fehmi
Nakouri, Haïfa
Mots-clés:détection multimodale d'incident, fusion audio-visuelle, magasin sans personnel, reconnaissance d'activités humaines, représentation squelettique, transformer léger, audio-visual fusion, human activity recognition, multimodal incident detection, skeleton-based representation
Déposé le:03 août 2026 17:08
Dernière modification:03 août 2026 17:08
Afficher les statistiques de telechargements

Éditer le document (administrateurs uniquement)

Services de la bibliothèque, UQAC
555, boulevard de l'Université
Chicoutimi (Québec)  CANADA G7H 2B1
418 545-5011, poste 5630