Constellation, le dépôt institutionnel de l'Université du Québec à Chicoutimi

SoSAFE : une approche multimodale pour la détection des contenus inappropriés pour les enfants sur Tiktok

Diallo, Ousmane. (2026). SoSAFE : une approche multimodale pour la détection des contenus inappropriés pour les enfants sur Tiktok. Mémoire de maîtrise, Université du Québec à Chicoutimi.

[thumbnail of Diallo_Ousmane_2026_memoire.pdf]
Prévisualisation
PDF
378kB

Résumé

La modération automatique des contenus destinés aux enfants sur TikTok constitue un défi particulier en raison du format court des vidéos et de l’importance des dynamiques sociales. Les approches existantes, majoritairement conçues pour des plateformes comme YouTube, peinent à capturer des signaux nuisibles souvent implicites et distribués entre plusieurs modalités.

Ce travail propose SoSAFE, une approche multimodale de détection de contenus inappropriés sur TikTok, fondée sur l’enrichissement du dataset TikHarm par l’intégration des descriptions, des commentaires et des métadonnées d’engagement, en complément des signaux audiovisuels. Une architecture multimodale unifiée est introduite, combinant des encodeurs pré-entraînés et un module de fusion avancé reposant sur un espace latent commun, un mécanisme de gating par modalité, une cross-attention inter-modale parcimonieuse et une agrégation finale par BiLSTM.

Les résultats expérimentaux montrent que l’approche proposée surpasse les baselines de l’état de l’art, avec une accuracy de 87.13% et un F1-score macro de 87.14% sur TikHarm. L’étude d’ablation confirme l’apport des modalités sociales et la pertinence des choix architecturaux retenus. Ce travail met en évidence l’intérêt d’une modélisation multimodale contextualisée pour la modération automatique sur TikTok.

The automatic moderation of content intended for children on TikTok presents a particular challenge due to the short-video format and the importance of social dynamics. Existing approaches, mostly designed for platforms such as YouTube, struggle to capture harmful signals that are often implicit and distributed across multiple modalities.

This work proposes SoSAFE, a multimodal approach for detecting inappropriate content on TikTok, based on the enrichment of the TikHarm dataset through the integration of descriptions, comments, and engagement metadata, in addition to audiovisual signals. A unified multimodal architecture is introduced, combining pretrained encoders with an advanced fusion module based on a shared latent space, modality-specific gating mechanisms, sparse inter-modal cross-attention, and final aggregation through a BiLSTM.

Experimental results show that the proposed approach outperforms state-of-the-art baselines, achieving an accuracy of 87.13% and a macro F1-score of 87.14% on TikHarm. The ablation study confirms the contribution of social modalities and the relevance of the selected architectural choices. This work highlights the value of contextualized multimodal modeling for automatic content moderation on TikTok.

Type de document:Thèse ou mémoire de l'UQAC (Mémoire de maîtrise)
Date:2026
Lieu de publication:Chicoutimi
Programme d'étude:3017 - Maîtrise en informatique
Nombre de pages:65
ISBN:Non spécifié
Unité(s) institutionnelle(s):Départements et unités pédagogiques > Département de l'informatique et mathématique > Programmes d'études de cycles supérieurs en informatique
Directeur(s), Co-directeur(s) et responsable(s):Nakouri, Haïfa
Mots-clés:analyse audiovisuelle, apprentissage multimodal, contenu inappropriés, détection multimodale, modération automatique, protection des enfants, signaux sociaux, SoSAFE, TukHarm, Tiktok
Déposé le:02 sept. 2026 18:42
Dernière modification:02 sept. 2026 18:42
Afficher les statistiques de telechargements

Éditer le document (administrateurs uniquement)

Services de la bibliothèque, UQAC
555, boulevard de l'Université
Chicoutimi (Québec)  CANADA G7H 2B1
418 545-5011, poste 5630