Constellation, le dépôt institutionnel de l'Université du Québec à Chicoutimi

Cadre multi-dimensionnel d'évaluation des méthodes d'intelligence artificielle explicable pour la détection de fraude sur blockchains publiques

Oumbe Fokou, David Le Sage. (2026). Cadre multi-dimensionnel d'évaluation des méthodes d'intelligence artificielle explicable pour la détection de fraude sur blockchains publiques. Mémoire de maîtrise, Université du Québec à Chicoutimi.

[thumbnail of Oumbe Fokou_David Le Sage_2026_memoire.pdf]
Prévisualisation
PDF
2MB

Résumé

Les explications produites par les méthodes d’intelligence artificielle explicable (XAI) sont de plus en plus requises pour auditer les systèmes de détection de fraude déployés sur les blockchains publiques. Pourtant, la majorité des études évaluent encore ces explications au moyen de métriques de classification comme le score F1 ou l’AUC, qui ne renseignent pas directement sur la qualité explicative. Ce mémoire propose un cadre d’évaluation reproductible et multi-dimensionnel qui note conjointement les explications selon quatre axes complémentaires : la fidélité, la stabilité, l’alignement avec le domaine au moyen d’une nouvelle métrique appelée Blockchain Rule Alignment Score (BRAS), et l’utilité en aval mesurée par un trio d’agents de grands modèles de langage (LLM) complété par une baseline d’apprentissage automatique. Ce cadre répond aux quatre lacunes structurelles identifiées par Zafar et Wu dans leur revue systématique de 49 travaux portant sur la XAI en détection de fraude : prévalence des métriques de substitution prédictives, distorsions data-centric induites par le sur-échantillonnage synthétique, rareté de l’évaluation humaine, et monoculture méthodologique autour de SHAP.

Le cadre est instancié sur les jeux de données Elliptic Bitcoin et Ethereum Fraud, à travers cinq explicateurs (SHAP, LIME, Integrated Gradients, GNNExplainer, GraphLIME) et quatre classifieurs (Random Forest, LightGBM, Temporal-GCN, GraphSAGE). SHAP domine sur les modèles tabulaires, tandis qu’Integrated Gradients l’emporte sur les modèles à graphes. L’ajout d’explications aux invites soumises aux LLM fait passer l’exactitude décisionnelle de 0,52–0,79 à 0,81–0,94, et le coefficient kappa de Cohen entre agents de valeurs proches de zéro à des valeurs proches de un. Une fois les explications fournies, les décisions des trois agents LLM concordent presque parfaitement avec celles d’une forêt aléatoire entraînée sur les mêmes attributions, ce qui suggère, dans les limites de l’échantillon évalué (cinq instances par condition), un transfert du signal discriminant. Le mémoire étend l’article conférence par une revue de littérature élargie, une formalisation méthodologique approfondie et une discussion des implications opérationnelles.

Explanations produced by Explainable Artificial Intelligence (XAI) methods are increasingly required to audit fraud detection systems deployed on public blockchains, yet most studies still evaluate them through proxy classification metrics such as F1 and AUC. This thesis addresses the gap by introducing a reproducible, multi-dimensional evaluation framework that jointly scores explanations along four complementary axes : fidelity, stability, domain alignment through a new Blockchain Rule Alignment Score (BRAS), and downstream usefulness assessed with a triad of Large Language Model (LLM) agents and a Machine Learning baseline. The framework is motivated by the four structural gaps identified by Zafar and Wu in their recent systematic review of 49 XAI studies on fraud detection, namely the prevalence of predictive surrogate metrics, the data-centric distortions induced by synthetic oversampling, the scarcity of human-centred evaluation, and the methodological monoculture around SHAP.

We instantiate the framework on the Elliptic Bitcoin and Ethereum Fraud datasets, across five explainers (SHAP, LIME, Integrated Gradients, GNNExplainer, GraphLIME) and four classifiers (Random Forest, LightGBM, Temporal Graph Convolutional Network, GraphSAGE). SHAP dominates on tabular models while Integrated Gradients wins on graph models. Adding explanations to LLM prompts raises Decision Accuracy from 0.52–0.79 to 0.81–0.94 and inter-agent Cohen’s Kappa from near zero to near one. Once explanations are provided, the three LLM agents reach near-perfect agreement with a Random Forest trained on the same attributions, which suggests, within the limits of the evaluated sample (five instances per condition), that XAI outputs transfer the discriminative signal of the teacher model. The thesis further extends the conference paper with an expanded literature review, an in-depth methodological formalisation, complementary discussions on the orthogonality of the four axes, and a reflection on the operational implications for compliance pipelines.

Type de document:Thèse ou mémoire de l'UQAC (Mémoire de maîtrise)
Date:2026
Lieu de publication:Chicoutimi
Programme d'étude:3017 - Maîtrise en informatique
Nombre de pages:91
ISBN:Non spécifié
Unité(s) institutionnelle(s):Départements et unités pédagogiques > Département de l'informatique et mathématique > Programmes d'études de cycles supérieurs en informatique
Directeur(s), Co-directeur(s) et responsable(s):Jaafar, Fehmi
Mots-clés:blockchain, BRAS, cadre d'évaluation, détection de fraude, grands modèles de langage, intelligence artificielle explicable, réseaux de neurones sur graphes, explainable artificial intelligence, evaluation framework, fraud detection, graph neural networks, large language models
Déposé le:10 sept. 2026 13:56
Dernière modification:10 sept. 2026 13:56
Afficher les statistiques de telechargements

Éditer le document (administrateurs uniquement)

Services de la bibliothèque, UQAC
555, boulevard de l'Université
Chicoutimi (Québec)  CANADA G7H 2B1
418 545-5011, poste 5630