Ben Achour, Oussama. (2026). Détection des voix usurpées à l'aide de l'intelligence artificielle générative : exploitation des modèles LLM pour l'analyse des signaux audio. Mémoire de maîtrise, Université du Québec à Chicoutimi.
Prévisualisation |
PDF
907kB |
Résumé
Le progrès rapide des techniques d’usurpation vocale est une menace croissante pour la sécurité numérique. Avec l’évolution explosive de l’intelligence artificielle générative, la falsification et le clonage de voix sont devenus accessibles au grand public. Cette facilité technologique a multiplié les fraudes et les attaques contre les systèmes d’authentification vocale, ce qui a mis en danger la confiance dans les communications numériques.
Cette étude vise à explorer la capacité des grands modèles de langage (LLM) à détecter les voix usurpées. L’approche proposée repose sur une transformation des caractéristiques acoustiques extraites, les coefficients cepstraux en échelle de Mel, et les représentations vectorielles issues de Wav2Vec2, en une description textuelle structurée, soumise ensuite aux modèles pour la classification.
Un corpus équilibré de 4 800 enregistrements vocaux a été constitué à partir de deux ensembles de données publics : ASVspoof2019-LA (1 200 enregistrements authentiques et 1 200 usurpés) et SceneFake (1 200 authentiques et 1 200 usurpés). Quatre LLM, Mistral, DeepSeek, LLaMA 3 et Gemma, ont été évalués sur sept formulations de requêtes. Les résultats montrent qu’avec certaines formulations de prompts, les modèles réussissent à détecter tous les enregistrements audio, atteignant un rappel de 100%, mais la précision demeure comprise entre 41% et 51% selon le modèle ou le prompt utilisé. Cet écart indique que si les modèles sont extrêmement sensibles aux tentatives d’usurpation, ils présentent également un taux élevé de faux positifs en classant par erreur de nombreuses voix authentiques comme étant usurpées.
Ce mémoire présente une nouvelle approche pour la détection des voix usurpées à l’aide de grands modèles de langage. Ce travail met en évidence à la fois le potentiel de ces modèles et leurs limites actuelles, et ouvre des perspectives vers des modèles spécialisés et entraînés qui seront capables de renforcer la cybersécurité vocale.
The rapid progress of voice spoofing techniques is an increasing threat to digital security. With the explosive evolution of generative artificial intelligence, voice falsification and cloning have become accessible to the public. This technological ease has multiplied fraud and attacks against voice authentication systems, which has undermined trust in digital communications.
This study aims to explore the ability of large language models (LLMs) to detect spoofed voices. The approach we propose relies on transforming extracted acoustic features, Melfrequency cepstral coefficients, and vector representations derived from Wav2Vec2, into a structured textual description, which is then submitted to the models for classification.
A balanced dataset of 4,800 voice recordings was constructed from two public datasets : ASVspoof2019-LA (1,200 bonafide and 1,200 spoofed recordings) and SceneFake (1,200 bonafide and 1,200 spoofed). Four LLMs, Mistral, DeepSeek, LLaMA 3, and Gemma, were evaluated using seven prompt formulations. The results show that with certain prompt formulations, the models succeed in detecting all audio recordings, achieving a recall of 100%, but precision remains between 41% and 51% depending on the model or the prompt used. This gap indicates that while the models are highly sensitive to spoofing attempts, they also exhibit a high rate of false positives by misidentifying genuine voices as spoofed.
This thesis presents a novel approach to spoofed voice detection using large language models. This work highlights both the potential of these models and their current limitations, and opens perspectives toward specialized and trained models that will be able to strengthen voice-based cybersecurity.
| Type de document: | Thèse ou mémoire de l'UQAC (Mémoire de maîtrise) |
|---|---|
| Date: | 2026 |
| Lieu de publication: | Chicoutimi |
| Programme d'étude: | 3017 - Maîtrise en informatique |
| Nombre de pages: | 83 |
| ISBN: | Non spécifié |
| Unité(s) institutionnelle(s): | Départements et unités pédagogiques > Département de l'informatique et mathématique > Programmes d'études de cycles supérieurs en informatique |
| Directeur(s), Co-directeur(s) et responsable(s): | Jaafar, Fehmi Nakouri, Haïfa |
| Mots-clés: | authentification vocale, cybersécurité vocale, deepfake audio, détection d'usurpation vocale, grands modèles de langage, ingénierie des prompts, LLM, MFCC, Wav2Vec2 |
| Déposé le: | 03 août 2026 18:00 |
|---|---|
| Dernière modification: | 03 août 2026 18:00 |
Éditer le document (administrateurs uniquement)
