Thiaw, Mamadou. (2026). AV-ID Lite : une approche multimodale légère pour la détection d'incidents dans les magasins sans personnel. Mémoire de maîtrise, Université du Québec à Chicoutimi.
Prévisualisation |
PDF
8MB |
Résumé
Les approches multimodales audio-visuelles connaissent un essor important en raison de leur capacité à analyser simultanément des scènes complexes en exploitant à la fois les informations visuelles et audio. Dans le secteur du commerce de détail, en particulier dans les magasins sans personnel, la détection automatique des comportements anormaux constitue un défi majeur pour garantir la sécurité et prévenir des incidents tels que les bagarres ou les évanouissements dans des environnements fonctionnant en continu.
Dans ce travail, nous proposons AV-ID Lite, une approche multimodale légère et efficace pour la détection d’incidents dans les magasins sans personnel. L’approche proposée repose sur l’extraction de caractéristiques visuelles à partir de squelettes humains à l’aide d’AlphaPose et de caractéristiques audio à l’aide de VGGish, qui sont fusionnées selon une stratégie de fusion précoce strictement synchronisée. Les représentations fusionnées sont ensuite analysées par une architecture Transformer légère, combinée à un mécanisme de pooling Log-Sum-Exp afin de mettre en évidence les segments temporels les plus discriminants.
Nous développons également un nouveau jeu de données multimodal dédié aux magasins sans personnel, composé de vidéos annotées en trois classes : activités normales, bagarres et évanouissements. Les expériences montrent que l’approche proposée surpasse systématiquement plusieurs méthodes de l’état de l’art, atteignant un score F1 de 95.91%, un rappel de 98.22% et un mAP de 99.23%, ce qui correspond à des améliorations d’au moins 6.42%, 10.22% et 4.08% respectivement, confirmant ainsi l’efficacité et la pertinence de l’architecture proposée pour la détection multimodale d’incidents dans les environnements commerciaux sans personnel.
Multimodal audio-visual approaches are experiencing significant growth due to their ability to simultaneously analyze complex scenes by exploiting both visual and audio information. In the retail sector, particularly in unmanned stores, automatic detection of abnormal behavior is a major challenge in ensuring safety and preventing incidents such as fights or fainting in environments that operate continuously.
In this work, we propose AV-ID Lite, a lightweight and efficient multimodal approach for incident detection in unmanned retail stores. The proposed approach relies on the extraction of visual features from skeletons using AlphaPose and audio features using VGGish, which are fused by a strictly synchronized early fusion strategy. The fused representations are then analyzed by a lightweight Transformer architecture, combined with a Log-Sum-Exp pooling mechanism to highlight the most discriminative temporal segments.
We also develop a new multimodal dataset dedicated to unmanned stores, consisting of videos annotated in three classes : normal activities, fights, and fainting. Experiments show that the proposed approach consistently outperforms several state-of-the-art methods, achieving an F1-score of 95.91%, a recall of 98.22%, and a mAP of 99.23%, representing improvements of at least 6.42%, 10.22%, and 4.08%, respectively, and confirming the effectiveness and relevance of the proposed architecture for multimodal incident detection in unmanned commercial environments.
| Type de document: | Thèse ou mémoire de l'UQAC (Mémoire de maîtrise) |
|---|---|
| Date: | 2026 |
| Lieu de publication: | Chicoutimi |
| Programme d'étude: | 3017 - Maîtrise en informatique |
| Nombre de pages: | 68 |
| ISBN: | Non spécifié |
| Unité(s) institutionnelle(s): | Départements et unités pédagogiques > Département de l'informatique et mathématique > Programmes d'études de cycles supérieurs en informatique |
| Directeur(s), Co-directeur(s) et responsable(s): | Jaafar, Fehmi Nakouri, Haïfa |
| Mots-clés: | détection multimodale d'incident, fusion audio-visuelle, magasin sans personnel, reconnaissance d'activités humaines, représentation squelettique, transformer léger, audio-visual fusion, human activity recognition, multimodal incident detection, skeleton-based representation |
| Déposé le: | 03 août 2026 17:08 |
|---|---|
| Dernière modification: | 03 août 2026 17:08 |
Éditer le document (administrateurs uniquement)
